先行结论
- 买不到 H100 / B200 不等于没有先进 AI 算力。先拆工作负载:训练、推理、Agent 执行是三条轨道,不要绑在一张受限卡上。
- 2026-05-31 BIS 指南写明:总部位于 D:5(含中国)或澳门、或其最终母公司在这些地区的实体,在全球任何地点接收先进计算物项仍需许可。第三国数据中心不是合法绕过。
- 多数产品和 Agent 团队应先买 Token(API),而不是买卡。云 GPU 只服务「能签合规合同的主体 + 必须自持权重」的场景。
- 国产 AI 芯片(昇腾、寒武纪等)适合能改框架、能消化 CUDA 迁移成本的训练/推理;不适合「明天就要跑通原版 CUDA 算子」。
- Cloud Mac 解决 MCP、签名、常驻 Agent,不替代数据中心 GPU。合盖重试会把同一轮推理再买一遍。
芯片能不能买到不是分水岭,工作负载该落在哪条合规轨道才是分水岭。
0. 先行结论
截至 2026-09-08,美国对 NVIDIA 高端加速器的 AI 芯片出口限制已经从 H100 / H200 / Blackwell,延伸到需要许可的 H20,以及被挡下的降规 B30A。与此同时,中国对财政资金支持的数据中心提出国产芯片要求,未完工项目还可能被要求拆除已装的外国加速器。两边同时收紧,旧答案「想办法买一张旗舰卡」失效了。
给需要立刻拍板的人一组对照:
- 产品推理 / Agent 循环:默认买 Token。DeepSeek、通义、Gemini、Claude 都能把「先进能力」卖成 API,而不把受限硅片搬进机房。价格拆解见 DeepSeek V4-Flash Token 成本。
- 必须自训或精调:能改框架就走国产集群;有独立、可证明的非 D:5 最终母公司,才谈持牌云 GPU。不要用「新加坡子公司 + 中国总部」当免许可证明。
- 第三国数据中心:对总部在中国的买家,2026 年中以后这不再是灰色捷径,而是许可与执法问题。先读 BIS 2026-05-31 指南 与 NVIDIA 出口合规页。
- 执行层:MCP、钥匙串、xcodebuild、常驻 Agent 放 Cloud Mac,不要和训练卡抢同一张受限清单。
租 GPU 还是上 Mac 做推理,场景不同;GTC 后的吞吐对比见 NVIDIA GTC Berlin 2026:租 GPU 还是 Mac。
1. 问题为什么存在:出口限制之后,旧方案为何失效
旧方案失败得很具体:团队把「先进 AI 算力」等同于「机房里有 NVIDIA 旗舰」。2022 年以后,美国按性能密度和互联把 A100、H100、后继 Blackwell 纳入先进计算物项;中国市场一度出现 A800 / H800 / H20 等降规型号,每次接近可组集群训练前沿模型的阈值,规则就再收一档。2025–2026 年 H20 改为许可制,B30A 即使按早期门槛降规,也被按「集群仍能训练大模型」挡住。
另一边,中国要求财政资金支持的新建数据中心使用国产芯片,未达进度的项目可能拆除已装的外国加速器。于是出现一种错觉:好像只剩地下渠道或第三国机柜。对工程团队,这是最贵的错觉——它把合规风险、交付 comms 和 CUDA 锁定绑在一起,却解决不了「下周要上线的 Agent」。
- 出口管制看的是物项 + 最终用户主体,不是机柜贴纸上的国家名。见 15 CFR 742 与 BIS 指南。
- 云厂商对 D:5 总部客户收紧 KYC 后,第三国合同并不自动等于可交付 H100。
- 灰市卡没有驱动支持、没有互联质保,也没有把权重合法放进生产的路径。
真正要回答的不是「中国还能不能买到 NVIDIA」,而是:你的负载有多少必须自持权重,有多少可以买 Token,有多少其实是执行环境而不是 FLOPS。
2. 五条算力轨道:先分类,再谈国产芯片与云 GPU
2.1 轨道 A:模型 API / 买 Token
入口是 API Key 或企业合同,执行能力是推理、工具调用、长上下文,上下文是你愿意上传的提示与文件。成本按百万 Token,权限边界是供应商的驻留与培训条款。这是 2026 年大多数中国产品和出海 Agent 的默认先进算力。不要把「自训 70B」的采购单套到「客服 Agent」上。
2.2 轨道 B:持牌云 GPU
入口是 AWS / Azure / GCP / 持牌 GPU 云的控制台。执行能力是 CUDA 训练与自托管推理。成本是卡时 + 出口流量 + 闲置。权限边界是:你的签约主体是谁、最终母公司在哪、云厂商是否把这笔单视为需许可的再出口。只有主体经得起审查时,这条轨道才存在。
2.3 轨道 C:第三国数据中心
表面上是马来西亚、泰国、新加坡、阿联酋的机柜和「本地公司」。2026-05-31 之后,BIS 再次确认:先进计算物项交给 D:5 / 澳门总部或其最终母公司在这些地区的实体,不论实体注册在哪,许可要求仍在。善意运营、且活动符合 EAR 的机房运营商,指南说暂不必因该文件停止已有使用——但这不是给中国总部买家新开一扇买卡的门。把第三国机房写成「绕过 NVIDIA AI 芯片出口限制」的方案,是把工程计划建立在执法豁免上。
2.4 轨道 D:国产 AI 芯片
华为昇腾、寒武纪、壁仞、沐曦等走 CANN / 自有运行时,不是 CUDA 的透明替换。官方入口见 昇腾社区。执行能力覆盖训练与推理,前提是你改图、改通信、改监控。上下文是国产集群与国内数据驻留。成本是迁移人月 + 集群电费,不是「一张卡的美元标价」。财政项目几乎只能走这条轨道。
2.5 轨道 E:异构执行层(Cloud Mac / Apple silicon)
入口是 SSH / VNC 上的云 Mac 或本机 Mac。执行能力是 MCP、签名、worktree、端侧 Core ML,不是替代 H100 训练。低并发原型可以把小模型放在统一内存上试,但生产吞吐仍应回 API 或 GPU。配置与内存瓶颈见 Mac mini 当 AI Agent 服务器。算力租赁计费怎么自动化,见 FOSSBilling 算力租赁平台。
3. 核心对比:同一套五维表头
把第三国机房、云 GPU、国产芯片、API 和执行层放进同一张表,避免只比「有没有 CUDA」。
| 层/方案 | 入口 | 执行能力 | 上下文 | 成本 | 权限边界 |
|---|---|---|---|---|---|
| API / Token | Key / 企业合同 | 推理、工具、长上下文 | 提示与允许上传的文件 | 按百万 Token;重试会翻倍 | 供应商驻留与培训条款 |
| 持牌云 GPU | 云控制台 / 承诺用量 | CUDA 训练与自托管推理 | 你放进 VPC 的权重 | 卡时 + 闲置 + 出网 | 签约主体与最终母公司 |
| 第三国数据中心 | 海外机柜合同 | 表面上等同云 GPU | 机柜所在国 ≠ 许可豁免 | 租金 + 合规尽调 + 执法风险 | BIS:看总部不看贴纸 |
| 国产 AI 芯片 | 国产云 / 自建机房 | 自有栈上的训练推理 | 国内数据与国产工具链 | 迁移人月 + 电费 | 财政项目几乎必选 |
| Cloud Mac 执行层 | SSH / 云 Mac | MCP、签名、常驻 Agent | 仓库、证书、钥匙串 | 日租机器,不买 FLOPS | 进程用户与网络出口 |
读表时记住非对称结论:换一个第三国机柜解决不了「最终母公司在中国」这条许可规则;换一张更便宜的国产卡也解决不了「Agent 合盖断线后把 Token 再买一遍」。型号只是轨道上的刻度。
4. 场景怎么选
| 层/方案 | 入口 | 执行能力 | 上下文 | 成本 | 权限边界 |
|---|---|---|---|---|---|
| 客服 / 编程 Agent,低并发 | API 默认 | Flash / 国产 API,限制步数 | 短上下文 + 缓存系统提示 | 预算输出 3–8× 输入 | 密钥只放后端 |
| 要精调 7B–70B,能改框架 | 国产集群 | 昇腾 / 寒武纪训练栈 | 自有数据不出境 | 人月 > 卡价 | 财政或国内合规优先 |
| 有独立非 D:5 最终母公司 | 持牌云 GPU | CUDA 短周期租卡验证 | VPC + 密钥轮换 | 先日租再承诺 | 法务先过 BIS / 云厂商 KYC |
| 中国总部 + 想用海外机柜 | 不要当默认方案 | 先假设许可被拒 | 第三国注册不够 | 尽调成本常高于 API | 读 BIS 指南,勿写进上线计划 |
| iOS / MCP / 常驻编排 | Cloud Mac + API | Mac 只执行,不训练 | 证书与 DerivedData 留在 Mac | 日租机器 + Token | 钥匙串不离开盒子 |
| 国家资金数据中心 | 国产芯片 | 按招标栈交付 | 国内驻留 | 迁移写入工期 | 外国加速器可能被要求拆除 |
5. 推荐组合
A | 产品默认(大多数团队) 国产或国际 API 推理 → 步数上限 + 日预算 → MCP / 签名跑在 Cloud Mac → 不采购受限 NVIDIA 旗舰 B | 必须自训 昇腾 / 寒武纪集群 → 先迁一条真实训练图 → 通信与监控同步改 → API 仍承担线上推理 C | 合规海外主体 法务确认最终母公司 → 持牌云 GPU 短周期 → 权重出网与密钥轮换写进 runbook → 不用第三国壳公司当许可 D | 财政 / 国产替代项目 100% 国产加速器 → 招标栈锁定 CANN 等 → 禁止把「等 B30A 松绑」写进里程碑
6. 常见误区
- 误区 1:新加坡 / 马来西亚机柜 = 合法 H100。BIS 看最终母公司总部,不看机柜贴纸。
- 误区 2:先进 AI 必须自持 NVIDIA。多数线上请求是推理,Token 已经是先进算力。
- 误区 3:国产芯片是「弱一点的 CUDA」。它是另一条栈;不迁算子就没有算力。
- 误区 4:灰市卡能上生产。没有驱动支持、没有互联质保、没有合规路径。
- 误区 5:云 GPU 报价单可以不写主体。云厂商 KYC 失败,卡时合同等于废纸。
- 误区 6:用笔记本跑 Agent 再抱怨 GPU 不够。合盖重试买的是 Token,不是卡。
- 误区 7:把出口管制解读成「永远买不到任何 NVIDIA」。许可、降规型号与政策窗口会变;工程计划应按轨道写,不按传闻 SKU 写。
7. 7 步落地
- 把下周要上线的负载拆成训练 / 推理 / 执行三列,禁止「全部要 H100」。
- 推理列先选一家 API(见 DeepSeek API 文档 或你已有的国内模型服务),用真实 Prompt 量 Token。
- 对照 BIS 2026-05-31 画主体图:总部、最终母公司、签约云账号。D:5 总部就不要把第三国机房写进方案。
- 必须自训则选国产栈,先迁一条能复现 loss 的训练图,而不是先买满机柜。
- 仅当主体经得起云厂商与出口合规审查时,才开持牌云 GPU 的短周期 PoC。
- 把 MCP、签名、常驻编排迁到 Cloud Mac,切断合盖重试。部署边界见 MCP 部署:Cloud Mac vs VPS vs 本地。
- 内部发布一页「算力轨道卡」:默认 API、自训国产、禁止灰市、禁止把第三国机房当绕过;每月对一次发票与主体。
8. FAQ
第三国数据中心还能绕过 NVIDIA AI 芯片出口限制吗?
对总部位于中国或澳门、或其最终母公司在这些地区的实体,不能。2026-05-31 BIS 指南确认:先进计算物项在全球任何地点交付给这类实体仍需许可。马来西亚或新加坡的机柜不是合法绕过。
买不到 H100 就做不了先进 AI 吗?
多数产品和 Agent 并不需要自持 H100。先用 API 买推理,把训练放到能改框架的国产集群,或放到有独立合规主体的持牌云 GPU。缺的是轨道,不是某一型号。
国产 AI 芯片能替代 CUDA 吗?
能替代一部分训练和推理,不能默认替代所有 CUDA 算子。昇腾、寒武纪走自己的栈;迁移成本在算子、通信和工具链,不在海报算力。
云 GPU 和买 Token 哪个更划算?
低并发产品和 Agent 循环通常 Token 更便宜、上线更快。只有当要自训/精调、长上下文必须自持、或 API 的延迟与数据驻留不满足时,才值得租卡。
Cloud Mac 能当数据中心 GPU 用吗?
不能。Cloud Mac 解决 MCP、签名、常驻 Agent 和端侧验证;推理用 API 或 GPU。合盖笔记本导致的重试会把 Token 再买一遍。
9. 总结
2026 年在 NVIDIA AI 芯片出口限制之后,中国团队获得先进 AI 算力的合法路径是拆轨道,而不是找一张能走私进机房的旗舰卡。第三国数据中心对 D:5 总部实体不再是绕过;云 GPU 只服务经得起主体审查的合同;国产 AI 芯片服务能迁栈的训练与财政项目;API Token 服务大多数线上推理。
工作顺序应当是:拆负载 → 推理走 API → 画清最终母公司 → 自训走国产或持牌云 → 执行层走 Cloud Mac → 把「第三国机柜当绕过」从里程碑里删掉。规则会改,轨道不该每周重写。