Offre

Après les limites d’export NVIDIA, comment la Chine obtient-elle du calcul IA avancé ?

Ingénierie IA Contrôle d’export · calcul
2026-09-08 ~14 min

En bref : Pas de H100 ne veut pas dire pas de calcul IA avancé. Séparez train, inférence, exécution. Un datacenter tiers n’est pas un contournement légal pour un HQ Chine.

La ligne de partage est la voie conforme : tokens API, GPU cloud licencié, puces IA nationales ou exécution Cloud Mac.

En bref

  1. Pas de H100 / B200 ne veut pas dire pas de puissance de calcul IA avancée. Séparez : entraînement, inférence, exécution d’agent — ne les boulonnez pas à une SKU contrôlée.
  2. Le guide BIS du 31/05/2026 dit qu’une entité dont le siège ou la société mère ultime est en D:5 (Chine comprise) ou à Macao a encore besoin d’une licence pour recevoir des articles de calcul avancé partout. Un datacenter tiers n’est pas un contournement légal.
  3. La plupart des équipes produit et agent doivent acheter des tokens (API), pas des cartes. Le GPU cloud n’existe que pour une entité contractable qui doit héberger ses poids.
  4. Les puces IA nationales (Ascend, Cambricon) conviennent à qui porte les graphes et paie la migration CUDA — pas à « CUDA stock demain ».
  5. Le Cloud Mac héberge MCP, signature et agents 24/7. Il ne remplace pas un GPU de datacenter. Les retries couvercle fermé rachètent la même inférence.
Pouvoir acheter une puce n’est pas la ligne de partage. Sur quelle voie conforme chaque charge repose, l’est.
Baies de datacenter et allée froide illustrant le choix de calcul IA sous contrôle d’export
Le goulot n’est plus « avons-nous une carte NVIDIA », mais quelle voie contrôlable porte l’entraînement, l’inférence et l’exécution.

0. En bref

Au 2026-09-08, les restrictions d’export de puces IA NVIDIA US vont de H100 / H200 / Blackwell au H20 sous licence et à un B30A débiné bloqué. La Chine pousse les datacenters financés par l’État vers des accélérateurs nationaux et peut exiger le retrait de pièces étrangères sur des sites inachevés. L’ancienne réponse « juste une carte phare dans la salle » est morte.

Contrastes pour qui doit décider cette semaine :

  • Inférence produit / boucles d’agent : tokens par défaut. DeepSeek, Qwen, Gemini, Claude vendent la capacité avancée en API sans déplacer du silicium contrôlé. Coûts : coût tokens DeepSeek V4-Flash.
  • Faut entraîner ou fine-tuner : portez vers un cluster national si vous changez le graphe. GPU cloud licencié seulement si la mère ultime n’est clairement pas D:5. « Filiale Singapour + HQ Chine » n’est pas une exception de licence.
  • Datacenters tiers : pour un acheteur à HQ Chine après mi-2026, c’est licence et enforcement, pas un raccourci gris. Lisez le guide BIS 31/05/2026 et la conformité export NVIDIA.
  • Exécution : MCP, Keychain, xcodebuild, agents 24/7 sur Cloud Mac — pas sur la même liste d’emballage contrôlée que les GPU d’entraînement.

GPU versus Mac pour le débit d’inférence est une autre coupe ; voir NVIDIA GTC Berlin 2026 : louer un GPU ou un Mac.

1. Pourquoi l’ancien plan est mort après les limites d’export

Les équipes égalaient « calcul IA avancé » et « un phare NVIDIA dans la cage ». Après 2022 les US ont tiré A100, H100 puis Blackwell dans les contrôles de calcul avancé par densité et interconnect. Des bins Chine (A800 / H800 / H20) sont apparus ; chaque fois qu’ils approchaient l’entraînement frontier en cluster, la règle s’est resserrée. En 2025–2026 le H20 est passé sous licence et le B30A a été traité comme une restriction pleine parce que les clusters pouvaient encore entraîner de grands modèles.

Pékin a aussi demandé aux builds financés par l’État d’utiliser des puces nationales ; les sites précoces peuvent devoir retirer des accélérateurs étrangers déjà installés. D’où l’intuition chère : il ne resterait que le marché gris ou un rack dans un pays tiers. Cela lie risque de conformité, comms de livraison et lock-in CUDA sans livrer l’agent de la semaine prochaine.

  • Les contrôles s’attachent à l’article plus l’entité utilisatrice finale, pas au drapeau sur la cage. Voir 15 CFR 742 et le mémo BIS.
  • Après un KYC cloud plus dur sur les clients à HQ D:5, un contrat tiers ne livre pas automatiquement des H100.
  • Les cartes marché gris n’ont ni drivers, ni garantie d’interconnect, ni chemin licite pour mettre des poids en production.

La vraie question n’est pas « la Chine peut-elle encore acheter NVIDIA ». C’est quelle part de la charge doit héberger des poids, quelle part peut être des tokens, et quelle part n’est qu’un hôte d’exécution qui joue les FLOPS.

2. Cinq voies de calcul

2.1 Voie A : API modèles / acheter des tokens

Entrée : clé API ou contrat entreprise. Exécution : inférence, outils, long contexte. Contexte : prompts et fichiers autorisés. Coût au million de tokens ; frontière : clauses de résidence et d’entraînement. C’est le calcul avancé par défaut de la plupart des produits Chine et agents sortants en 2026. Ne collez pas un bon de commande « entraîner 70B » sur un bot support.

2.2 Voie B : GPU cloud licencié

Entrée : AWS / Azure / GCP / un cloud GPU licencié. Exécution : entraînement CUDA et inférence auto-hébergée. Coût : heures GPU + egress + idle. Frontière : qui signe, où siège la mère ultime, si le cloud voit une réexportation sous licence. La voie n’existe que si l’entité survit à cet examen.

2.3 Voie C : datacenter tiers

Sur la brochure : une cage en Malaisie, Thaïlande, Singapour ou aux Émirats et une « société locale ». Après le 31/05/2026, le BIS a réaffirmé que les articles de calcul avancé destinés à des entités à HQ D:5 / Macao — ou dont la mère ultime y est — exigent une licence quel que soit le lieu d’immatriculation du destinataire. Les opérateurs de bonne foi alignés sur l’EAR n’ont pas, pour l’instant, à cesser l’usage existant à cause de ce mémo. Ce n’est pas une nouvelle porte d’achat pour un HQ Chine. Écrire « DC tiers contourne les limites d’export NVIDIA » dans un plan de lancement, c’est parier le jalon sur une pause d’enforcement.

2.4 Voie D : puces IA nationales

Huawei Ascend, Cambricon, Biren, Moore Threads tournent CANN ou leur runtime — pas un swap CUDA transparent. Départ : communauté Ascend. L’exécution couvre entraînement et inférence si vous réécrivez graphes, comms et télémétrie. Contexte : cluster national et résidence nationale. Coût : mois d’ingénieurs + électricité, pas un sticker USD. Les projets d’État vivent presque uniquement ici.

2.5 Voie E : exécution hétérogène (Cloud Mac / Apple silicon)

Entrée : SSH / VNC vers un Mac cloud ou local. Exécution : MCP, signature, worktrees, Core ML on-device — pas un entraînement H100. Les prototypes à faible concurrence peuvent tester de petits modèles en mémoire unifiée ; le débit prod revient aux API ou GPU. Mémoire comme vrai goulot : Mac mini serveur d’agent IA. Facturation de location : plateforme FOSSBilling.

3. Comparaison à en-têtes uniques

Mettez cages tierces, GPU cloud, puces nationales, API et hôte d’exécution dans une table pour ne pas seulement demander « est-ce CUDA ».

Couche / optionEntréeExécutionContexteCoûtFrontière de droits
API / tokensClé / contrat entrepriseInférence, outils, long contextePrompts et fichiers autorisésPar million de tokens ; retries doublentRésidence et usage d’entraînement
GPU cloud licenciéConsole / engagementTrain CUDA + inférence self-hostPoids dans un VPCHeures GPU + idle + egressSignataire et mère ultime
DC tiersContrat de cage outre-merRessemble à un GPU cloud sur papierPays de cage ≠ exception de licenceLoyer + diligence + enforcementLe BIS regarde le HQ, pas l’autocollant
Puces IA nationalesCloud national / salle propreTrain/infer sur stack nativeDonnées et outillage nationauxMois de migration + électricitéPresque obligatoire pour les builds fiscaux
Exécution Cloud MacSSH / Mac cloudMCP, signature, agents 24/7Dépôts, certs, KeychainHôte en jour, pas des FLOPSUtilisateur processus et egress

Phrase asymétrique : changer le pays de la cage n’efface pas « mère ultime en Chine ». Une puce nationale moins chère n’arrête pas non plus le rachat de tokens après un couvercle. La SKU est une graduation sur la voie.

4. Matrice de scénarios

Couche / optionEntréeExécutionContexteCoûtFrontière de droits
Agent support / code, faible QPSAPI par défautFlash ou API nationale, plafond de pasCourt contexte + system en cacheBudget sortie 3–8× entréeClés seulement backend
Fine-tune 7B–70B, portableCluster nationalStack train Ascend / CambriconDonnées restent au paysMois-hommes > prix carteConformité fiscale ou nationale d’abord
Mère ultime indépendante hors D:5GPU cloud licenciéCourte location CUDA pour prouverVPC + rotation de clésJournalier puis engagementLe juridique passe BIS / KYC cloud
HQ Chine + cage outre-mer souhaitéeNe pas en faire le défautSupposer la licence refuséeLe papier tiers ne suffit pasLa diligence dépasse souvent l’APILire le BIS ; hors plan de lancement
iOS / MCP / orchestration 24/7Cloud Mac + APILe Mac exécute, n’entraîne pasCerts et DerivedData restent sur le MacMachine jour + tokensLe Keychain ne quitte pas la boîte
Datacenter financé par l’ÉtatPuces nationalesLivrer le stack d’appel d’offresRésidence nationaleÉcrire la migration au calendrierLes accélérateurs étrangers peuvent devoir sortir

5. Stacks recommandés

A | Produit par défaut (la plupart des équipes)
  Inférence API nationale ou mondiale
  → plafond de pas + budget jour
  → MCP / signature sur Cloud Mac
  → pas d’achat de phare NVIDIA contrôlé

B | Doit auto-entraîner
  Cluster Ascend / Cambricon
  → porter d’abord un vrai graphe d’entraînement
  → réécrire comms et moniteurs avec
  → garder l’inférence live sur une API

C | Entité outre-mer conforme
  Le juridique confirme la mère ultime
  → cycle court GPU cloud licencié
  → egress et rotation de clés dans le runbook
  → pas de coquille tierce comme licence

D | Projet fiscal / localisation
  Accélérateurs 100 % nationaux
  → verrouiller CANN (ou stack d’AO) dans le SOW
  → jamais « attendre un assouplissement B30A » sur le chemin critique

6. Pièges

  • Piège 1 : cage Singapour / Malaisie = H100 licite. Le BIS regarde le HQ de la mère ultime, pas l’autocollant.
  • Piège 2 : l’IA avancée exige un NVIDIA en propre. La plupart des requêtes live sont de l’inférence ; les tokens sont déjà du calcul avancé.
  • Piège 3 : les puces nationales sont un « CUDA plus faible ». Autre stack. Pas de port d’opérateurs, pas de calcul.
  • Piège 4 : cartes marché gris en prod. Pas de drivers, pas de garantie, pas de chemin de conformité.
  • Piège 5 : devis GPU cloud sans entité. Un KYC raté transforme le contrat en papier.
  • Piège 6 : faire tourner l’agent sur un laptop puis blâmer le manque de GPU. Les retries couvercle achètent des tokens, pas des cartes.
  • Piège 7 : lire les règles d’export comme « la Chine n’aura plus jamais de NVIDIA ». Licences et bins bougent. Écrivez le plan sur des voies.

7. Sept étapes

  1. Séparer la charge de la semaine prochaine en train / infer / execute. Interdire « tout a besoin d’un H100 ».
  2. Choisir une API pour la colonne infer (docs API DeepSeek ou hôte national) et mesurer les tokens sur le vrai prompt.
  3. Dessiner l’entité contre le BIS 31/05/2026 : HQ, mère ultime, compte cloud. HQ Chine → pas de cage tierce dans le design.
  4. S’il faut entraîner : choisir un stack national et porter un graphe qui reproduit le loss avant de remplir une salle.
  5. Ouvrir un court PoC GPU cloud licencié seulement après que l’entité a survécu aux revues cloud et export.
  6. Déplacer MCP, signature et orchestration 24/7 sur Cloud Mac pour tuer les retries couvercle. Frontières : MCP sur Cloud Mac vs VPS vs local.
  7. Publier une page : API par défaut, train national, pas de marché gris, pas de bypass tiers. Réconcilier facture et entité chaque mois.

8. FAQ

Un datacenter tiers contourne-t-il les limites d’export NVIDIA ?

Non pour une entité dont le siège ou la mère ultime est en Chine ou à Macao. Le BIS (31/05/2026) exige une licence mondiale. Un rack en Malaisie n’est pas un contournement légal.

Sans H100, plus d’IA avancée ?

La plupart des produits et agents n’ont pas besoin d’H100 en propre. Achetez l’inférence en API ; entraînez sur des stacks nationaux portables ou un GPU cloud licencié d’une entité conforme. L’écart est la voie, pas une SKU.

Les puces nationales remplacent-elles CUDA ?

En partie pour l’entraînement et l’inférence, pas par défaut pour chaque kernel. Le coût est opérateurs, interconnect et outillage.

GPU cloud ou tokens ?

Faible concurrence et boucles d’agent : les tokens et le time-to-prod gagnent. Louez des GPU pour fine-tune, résidence ou limites d’API.

Le Cloud Mac est-il un GPU de datacenter ?

Non. MCP, signature, agents 24/7, contrôles on-device. L’inférence reste API ou GPU. Les retries couvercle rachètent des tokens.

9. Synthèse

Après les restrictions d’export de puces IA NVIDIA en 2026, les équipes chinoises obtiennent du calcul IA avancé en séparant les voies — pas en chassant une carte phare pour la cage. Un datacenter tiers n’est pas un bypass pour une HQ D:5. Le GPU cloud ne sert que les contrats qui survivent à l’examen d’entité. Les puces IA nationales servent l’entraînement portable et les builds fiscaux. Les tokens API servent la plupart de l’inférence live.

Ordre : séparer la charge → inférer sur API → dessiner la mère ultime → entraîner sur national ou cloud licencié → exécuter sur Cloud Mac → supprimer « cage tierce comme bypass » de la liste des jalons. Les règles bougeront ; les voies ne doivent pas être réécrites chaque semaine.

Achetez le calcul sur une voie ; n’enchaînez pas l’exécution à un laptop fermé

Les règles d’export décident quelle carte vous ne pouvez pas acheter. Elles ne décident pas si un agent rachète la même inférence après le couvercle. Gardez MCP, le dépôt et la signature sur un Cloud Mac M-series toujours allumé. Inférez sur une API ou un GPU que vous pouvez détenir licitement ; entraînez sur un stack portable. Acceptation à la journée, puis engagement mensuel, pour que chaque million de tokens frappe une vraie étape, pas un retry.

Comparer · Offres · Démarrer l’onboarding