En bref
- Pas de H100 / B200 ne veut pas dire pas de puissance de calcul IA avancée. Séparez : entraînement, inférence, exécution d’agent — ne les boulonnez pas à une SKU contrôlée.
- Le guide BIS du 31/05/2026 dit qu’une entité dont le siège ou la société mère ultime est en D:5 (Chine comprise) ou à Macao a encore besoin d’une licence pour recevoir des articles de calcul avancé partout. Un datacenter tiers n’est pas un contournement légal.
- La plupart des équipes produit et agent doivent acheter des tokens (API), pas des cartes. Le GPU cloud n’existe que pour une entité contractable qui doit héberger ses poids.
- Les puces IA nationales (Ascend, Cambricon) conviennent à qui porte les graphes et paie la migration CUDA — pas à « CUDA stock demain ».
- Le Cloud Mac héberge MCP, signature et agents 24/7. Il ne remplace pas un GPU de datacenter. Les retries couvercle fermé rachètent la même inférence.
Pouvoir acheter une puce n’est pas la ligne de partage. Sur quelle voie conforme chaque charge repose, l’est.
0. En bref
Au 2026-09-08, les restrictions d’export de puces IA NVIDIA US vont de H100 / H200 / Blackwell au H20 sous licence et à un B30A débiné bloqué. La Chine pousse les datacenters financés par l’État vers des accélérateurs nationaux et peut exiger le retrait de pièces étrangères sur des sites inachevés. L’ancienne réponse « juste une carte phare dans la salle » est morte.
Contrastes pour qui doit décider cette semaine :
- Inférence produit / boucles d’agent : tokens par défaut. DeepSeek, Qwen, Gemini, Claude vendent la capacité avancée en API sans déplacer du silicium contrôlé. Coûts : coût tokens DeepSeek V4-Flash.
- Faut entraîner ou fine-tuner : portez vers un cluster national si vous changez le graphe. GPU cloud licencié seulement si la mère ultime n’est clairement pas D:5. « Filiale Singapour + HQ Chine » n’est pas une exception de licence.
- Datacenters tiers : pour un acheteur à HQ Chine après mi-2026, c’est licence et enforcement, pas un raccourci gris. Lisez le guide BIS 31/05/2026 et la conformité export NVIDIA.
- Exécution : MCP, Keychain, xcodebuild, agents 24/7 sur Cloud Mac — pas sur la même liste d’emballage contrôlée que les GPU d’entraînement.
GPU versus Mac pour le débit d’inférence est une autre coupe ; voir NVIDIA GTC Berlin 2026 : louer un GPU ou un Mac.
1. Pourquoi l’ancien plan est mort après les limites d’export
Les équipes égalaient « calcul IA avancé » et « un phare NVIDIA dans la cage ». Après 2022 les US ont tiré A100, H100 puis Blackwell dans les contrôles de calcul avancé par densité et interconnect. Des bins Chine (A800 / H800 / H20) sont apparus ; chaque fois qu’ils approchaient l’entraînement frontier en cluster, la règle s’est resserrée. En 2025–2026 le H20 est passé sous licence et le B30A a été traité comme une restriction pleine parce que les clusters pouvaient encore entraîner de grands modèles.
Pékin a aussi demandé aux builds financés par l’État d’utiliser des puces nationales ; les sites précoces peuvent devoir retirer des accélérateurs étrangers déjà installés. D’où l’intuition chère : il ne resterait que le marché gris ou un rack dans un pays tiers. Cela lie risque de conformité, comms de livraison et lock-in CUDA sans livrer l’agent de la semaine prochaine.
- Les contrôles s’attachent à l’article plus l’entité utilisatrice finale, pas au drapeau sur la cage. Voir 15 CFR 742 et le mémo BIS.
- Après un KYC cloud plus dur sur les clients à HQ D:5, un contrat tiers ne livre pas automatiquement des H100.
- Les cartes marché gris n’ont ni drivers, ni garantie d’interconnect, ni chemin licite pour mettre des poids en production.
La vraie question n’est pas « la Chine peut-elle encore acheter NVIDIA ». C’est quelle part de la charge doit héberger des poids, quelle part peut être des tokens, et quelle part n’est qu’un hôte d’exécution qui joue les FLOPS.
2. Cinq voies de calcul
2.1 Voie A : API modèles / acheter des tokens
Entrée : clé API ou contrat entreprise. Exécution : inférence, outils, long contexte. Contexte : prompts et fichiers autorisés. Coût au million de tokens ; frontière : clauses de résidence et d’entraînement. C’est le calcul avancé par défaut de la plupart des produits Chine et agents sortants en 2026. Ne collez pas un bon de commande « entraîner 70B » sur un bot support.
2.2 Voie B : GPU cloud licencié
Entrée : AWS / Azure / GCP / un cloud GPU licencié. Exécution : entraînement CUDA et inférence auto-hébergée. Coût : heures GPU + egress + idle. Frontière : qui signe, où siège la mère ultime, si le cloud voit une réexportation sous licence. La voie n’existe que si l’entité survit à cet examen.
2.3 Voie C : datacenter tiers
Sur la brochure : une cage en Malaisie, Thaïlande, Singapour ou aux Émirats et une « société locale ». Après le 31/05/2026, le BIS a réaffirmé que les articles de calcul avancé destinés à des entités à HQ D:5 / Macao — ou dont la mère ultime y est — exigent une licence quel que soit le lieu d’immatriculation du destinataire. Les opérateurs de bonne foi alignés sur l’EAR n’ont pas, pour l’instant, à cesser l’usage existant à cause de ce mémo. Ce n’est pas une nouvelle porte d’achat pour un HQ Chine. Écrire « DC tiers contourne les limites d’export NVIDIA » dans un plan de lancement, c’est parier le jalon sur une pause d’enforcement.
2.4 Voie D : puces IA nationales
Huawei Ascend, Cambricon, Biren, Moore Threads tournent CANN ou leur runtime — pas un swap CUDA transparent. Départ : communauté Ascend. L’exécution couvre entraînement et inférence si vous réécrivez graphes, comms et télémétrie. Contexte : cluster national et résidence nationale. Coût : mois d’ingénieurs + électricité, pas un sticker USD. Les projets d’État vivent presque uniquement ici.
2.5 Voie E : exécution hétérogène (Cloud Mac / Apple silicon)
Entrée : SSH / VNC vers un Mac cloud ou local. Exécution : MCP, signature, worktrees, Core ML on-device — pas un entraînement H100. Les prototypes à faible concurrence peuvent tester de petits modèles en mémoire unifiée ; le débit prod revient aux API ou GPU. Mémoire comme vrai goulot : Mac mini serveur d’agent IA. Facturation de location : plateforme FOSSBilling.
3. Comparaison à en-têtes uniques
Mettez cages tierces, GPU cloud, puces nationales, API et hôte d’exécution dans une table pour ne pas seulement demander « est-ce CUDA ».
| Couche / option | Entrée | Exécution | Contexte | Coût | Frontière de droits |
|---|---|---|---|---|---|
| API / tokens | Clé / contrat entreprise | Inférence, outils, long contexte | Prompts et fichiers autorisés | Par million de tokens ; retries doublent | Résidence et usage d’entraînement |
| GPU cloud licencié | Console / engagement | Train CUDA + inférence self-host | Poids dans un VPC | Heures GPU + idle + egress | Signataire et mère ultime |
| DC tiers | Contrat de cage outre-mer | Ressemble à un GPU cloud sur papier | Pays de cage ≠ exception de licence | Loyer + diligence + enforcement | Le BIS regarde le HQ, pas l’autocollant |
| Puces IA nationales | Cloud national / salle propre | Train/infer sur stack native | Données et outillage nationaux | Mois de migration + électricité | Presque obligatoire pour les builds fiscaux |
| Exécution Cloud Mac | SSH / Mac cloud | MCP, signature, agents 24/7 | Dépôts, certs, Keychain | Hôte en jour, pas des FLOPS | Utilisateur processus et egress |
Phrase asymétrique : changer le pays de la cage n’efface pas « mère ultime en Chine ». Une puce nationale moins chère n’arrête pas non plus le rachat de tokens après un couvercle. La SKU est une graduation sur la voie.
4. Matrice de scénarios
| Couche / option | Entrée | Exécution | Contexte | Coût | Frontière de droits |
|---|---|---|---|---|---|
| Agent support / code, faible QPS | API par défaut | Flash ou API nationale, plafond de pas | Court contexte + system en cache | Budget sortie 3–8× entrée | Clés seulement backend |
| Fine-tune 7B–70B, portable | Cluster national | Stack train Ascend / Cambricon | Données restent au pays | Mois-hommes > prix carte | Conformité fiscale ou nationale d’abord |
| Mère ultime indépendante hors D:5 | GPU cloud licencié | Courte location CUDA pour prouver | VPC + rotation de clés | Journalier puis engagement | Le juridique passe BIS / KYC cloud |
| HQ Chine + cage outre-mer souhaitée | Ne pas en faire le défaut | Supposer la licence refusée | Le papier tiers ne suffit pas | La diligence dépasse souvent l’API | Lire le BIS ; hors plan de lancement |
| iOS / MCP / orchestration 24/7 | Cloud Mac + API | Le Mac exécute, n’entraîne pas | Certs et DerivedData restent sur le Mac | Machine jour + tokens | Le Keychain ne quitte pas la boîte |
| Datacenter financé par l’État | Puces nationales | Livrer le stack d’appel d’offres | Résidence nationale | Écrire la migration au calendrier | Les accélérateurs étrangers peuvent devoir sortir |
5. Stacks recommandés
A | Produit par défaut (la plupart des équipes) Inférence API nationale ou mondiale → plafond de pas + budget jour → MCP / signature sur Cloud Mac → pas d’achat de phare NVIDIA contrôlé B | Doit auto-entraîner Cluster Ascend / Cambricon → porter d’abord un vrai graphe d’entraînement → réécrire comms et moniteurs avec → garder l’inférence live sur une API C | Entité outre-mer conforme Le juridique confirme la mère ultime → cycle court GPU cloud licencié → egress et rotation de clés dans le runbook → pas de coquille tierce comme licence D | Projet fiscal / localisation Accélérateurs 100 % nationaux → verrouiller CANN (ou stack d’AO) dans le SOW → jamais « attendre un assouplissement B30A » sur le chemin critique
6. Pièges
- Piège 1 : cage Singapour / Malaisie = H100 licite. Le BIS regarde le HQ de la mère ultime, pas l’autocollant.
- Piège 2 : l’IA avancée exige un NVIDIA en propre. La plupart des requêtes live sont de l’inférence ; les tokens sont déjà du calcul avancé.
- Piège 3 : les puces nationales sont un « CUDA plus faible ». Autre stack. Pas de port d’opérateurs, pas de calcul.
- Piège 4 : cartes marché gris en prod. Pas de drivers, pas de garantie, pas de chemin de conformité.
- Piège 5 : devis GPU cloud sans entité. Un KYC raté transforme le contrat en papier.
- Piège 6 : faire tourner l’agent sur un laptop puis blâmer le manque de GPU. Les retries couvercle achètent des tokens, pas des cartes.
- Piège 7 : lire les règles d’export comme « la Chine n’aura plus jamais de NVIDIA ». Licences et bins bougent. Écrivez le plan sur des voies.
7. Sept étapes
- Séparer la charge de la semaine prochaine en train / infer / execute. Interdire « tout a besoin d’un H100 ».
- Choisir une API pour la colonne infer (docs API DeepSeek ou hôte national) et mesurer les tokens sur le vrai prompt.
- Dessiner l’entité contre le BIS 31/05/2026 : HQ, mère ultime, compte cloud. HQ Chine → pas de cage tierce dans le design.
- S’il faut entraîner : choisir un stack national et porter un graphe qui reproduit le loss avant de remplir une salle.
- Ouvrir un court PoC GPU cloud licencié seulement après que l’entité a survécu aux revues cloud et export.
- Déplacer MCP, signature et orchestration 24/7 sur Cloud Mac pour tuer les retries couvercle. Frontières : MCP sur Cloud Mac vs VPS vs local.
- Publier une page : API par défaut, train national, pas de marché gris, pas de bypass tiers. Réconcilier facture et entité chaque mois.
8. FAQ
Un datacenter tiers contourne-t-il les limites d’export NVIDIA ?
Non pour une entité dont le siège ou la mère ultime est en Chine ou à Macao. Le BIS (31/05/2026) exige une licence mondiale. Un rack en Malaisie n’est pas un contournement légal.
Sans H100, plus d’IA avancée ?
La plupart des produits et agents n’ont pas besoin d’H100 en propre. Achetez l’inférence en API ; entraînez sur des stacks nationaux portables ou un GPU cloud licencié d’une entité conforme. L’écart est la voie, pas une SKU.
Les puces nationales remplacent-elles CUDA ?
En partie pour l’entraînement et l’inférence, pas par défaut pour chaque kernel. Le coût est opérateurs, interconnect et outillage.
GPU cloud ou tokens ?
Faible concurrence et boucles d’agent : les tokens et le time-to-prod gagnent. Louez des GPU pour fine-tune, résidence ou limites d’API.
Le Cloud Mac est-il un GPU de datacenter ?
Non. MCP, signature, agents 24/7, contrôles on-device. L’inférence reste API ou GPU. Les retries couvercle rachètent des tokens.
9. Synthèse
Après les restrictions d’export de puces IA NVIDIA en 2026, les équipes chinoises obtiennent du calcul IA avancé en séparant les voies — pas en chassant une carte phare pour la cage. Un datacenter tiers n’est pas un bypass pour une HQ D:5. Le GPU cloud ne sert que les contrats qui survivent à l’examen d’entité. Les puces IA nationales servent l’entraînement portable et les builds fiscaux. Les tokens API servent la plupart de l’inférence live.
Ordre : séparer la charge → inférer sur API → dessiner la mère ultime → entraîner sur national ou cloud licencié → exécuter sur Cloud Mac → supprimer « cage tierce comme bypass » de la liste des jalons. Les règles bougeront ; les voies ne doivent pas être réécrites chaque semaine.
Achetez le calcul sur une voie ; n’enchaînez pas l’exécution à un laptop fermé
Les règles d’export décident quelle carte vous ne pouvez pas acheter. Elles ne décident pas si un agent rachète la même inférence après le couvercle. Gardez MCP, le dépôt et la signature sur un Cloud Mac M-series toujours allumé. Inférez sur une API ou un GPU que vous pouvez détenir licitement ; entraînez sur un stack portable. Acceptation à la journée, puis engagement mensuel, pour que chaque million de tokens frappe une vraie étape, pas un retry.