결론
- H100 / B200를 못 산다고 선진 AI 연산이 없는 것은 아니다. 학습·추론·Agent 실행을 세 궤도로 나누고, 규제 대상 한 장에 묶지 마라.
- 2026-05-31 BIS 지침은 D:5(중국 포함) 또는 마카오에 본사가 있거나 최종 모회사가 그곳에 있는 법인은 세계 어디서 받든 선진 컴퓨팅 품목에 허가가 필요하다고 명시한다. 제3국 데이터센터는 합법 우회가 아니다.
- 대부분의 제품·Agent 팀은 카드가 아니라 토큰(API)을 먼저 사야 한다. 클라우드 GPU는 심사 가능한 계약 주체와 자체 가중치 호스팅이 필요할 때만.
- 국산 AI 칩(Ascend, Cambricon 등)은 그래프를 이식하고 CUDA 이전 비용을 감당할 학습/추론용이다. 내일 재고 CUDA가 필요하면 맞지 않는다.
- Cloud Mac은 MCP, 서명, 상시 Agent를 담당하며 데이터센터 GPU를 대체하지 않는다. 덮개 닫힘 재시도는 같은 추론을 다시 산다.
칩을 살 수 있는지가 분수령이 아니다. 각 워크로드가 어느 컴플라이언스 궤도에 앉느냐가 분수령이다.
0. 결론
2026-09-08 기준 미국의 NVIDIA AI 칩 수출 제한은 H100 / H200 / Blackwell에서 허가제 H20, 차단된 다운빈 B30A까지 확장됐다. 중국은 재정 지원 데이터센터에 국산 가속기를 요구하고, 미완 현장에서 외국 부품 철거를 요구할 수 있다. 옛 답 “플래그십 카드를 방에 넣자”는 죽었다.
이번 주 결정해야 하는 사람을 위한 대조:
- 제품 추론 / Agent 루프: 기본은 토큰. DeepSeek, Qwen, Gemini, Claude는 규제 실리콘을 옮기지 않고 선진 능력을 API로 판다. 비용은 DeepSeek V4-Flash 토큰 비용.
- 자체 학습·파인튜닝 필수: 그래프를 바꿀 수 있으면 국산 클러스터. 최종 모회사가 명백히 비 D:5일 때만 라이선스 클라우드 GPU. “싱가포르 자회사 + 중국 본사”는 예외가 아니다.
- 제3국 데이터센터: 중국 본사 구매자에게 2026년 중반 이후는 회색 지름길이 아니라 허가와 집행 문제다. BIS 2026-05-31과 NVIDIA 수출 컴플라이언스를 먼저 읽어라.
- 실행 층: MCP, Keychain, xcodebuild, 상시 Agent는 Cloud Mac. 학습 GPU와 같은 규제 패킹 리스트에 올리지 마라.
추론 처리량에서 GPU냐 Mac이냐는 다른 단면이다. NVIDIA GTC Berlin 2026: GPU인가 Mac인가.
1. 수출 제한 이후 옛 계획이 죽은 이유
팀은 “선진 AI 연산”을 “케이지 안의 NVIDIA 플래그십”과 동일시했다. 2022년 이후 미국은 성능 밀도와 인터커넥트로 A100, H100, 후속 Blackwell을 선진 컴퓨팅 통제에 넣었다. 중국 전용 빈(A800 / H800 / H20)이 나올 때마다 클러스터 규모 최전선 학습에 가까워지면 규칙이 조여졌다. 2025–2026년에 H20는 허가제로 바뀌고, B30A는 클러스터가 여전히 대형 모델을 학습할 수 있어 전면 제한처럼 취급됐다.
베이징은 재정 사업에 국산 칩을 요구하고, 초기 현장은 이미 설치한 외국 가속기를 빼야 할 수 있다. 남은 수는 회색 시장이나 제3국 랙뿐이라는 비싼 착각이 생겼다. 컴플라이언스, 납기, CUDA 락인을 묶고 다음 주 Agent는 출하하지 못한다.
- 통제는 품목 + 최종 사용자 법인에 붙지, 케이지의 국기에 붙지 않는다. 15 CFR 742와 BIS 메모.
- 클라우드가 D:5 본사 고객 KYC를 조인 뒤, 제3국 계약은 자동으로 H100을 배달하지 않는다.
- 회색 시장 카드에는 드라이버 지원, 인터커넥트 보증, 합법적 프로덕션 경로가 없다.
진짜 질문은 “중국이 아직 NVIDIA를 살 수 있나”가 아니다. 가중치를 직접 호스팅해야 하는 부하, 토큰으로 충분한 부하, FLOPS를 가장한 실행 호스트의 비율이다.
2. 다섯 연산 궤도
2.1 궤도 A: 모델 API / 토큰 구매
진입은 API 키 또는 기업 계약. 실행은 추론, 도구, 긴 컨텍스트. 맥락은 보낼 수 있는 프롬프트와 파일. 비용은 백만 토큰. 경계는 공급자의 상주와 학습 조항. 2026년 중국산 제품과 해외 Agent의 기본 선진 연산. 70B 학습 발주서를 지원 봇에 붙이지 마라.
2.2 궤도 B: 라이선스 클라우드 GPU
진입은 AWS / Azure / GCP / 인가 GPU 클라우드. 실행은 CUDA 학습과 자체 호스트 추론. 비용은 GPU 시간 + 이그레스 + 유휴. 경계는 서명자, 최종 모회사, 클라우드가 재수출 허가 건으로 보는지. 법인이 그 심사를 견뎌야 궤도가 존재한다.
2.3 궤도 C: 제3국 데이터센터
브로셔상 말레이시아, 태국, 싱가포르, UAE의 케이지와 “현지 회사”. 2026-05-31 이후 BIS는 D:5 / 마카오 본사 또는 최종 모회사가 그곳에 있는 법인에 가는 선진 컴퓨팅 품목은 수령 법인의 설립지와 무관하게 허가가 필요하다고 재확인했다. EAR에 맞는 선의의 운영자는 당분간 이 메모만으로 기존 사용을 멈출 필요는 없다. 그것은 중국 본사 구매자에게 새 구매 문을 열지 않는다. “제3국 DC로 NVIDIA 수출 제한 우회”를 출시 계획에 쓰는 것은 집행 휴일에 마일스톤을 거는 것이다.
2.4 궤도 D: 국산 AI 칩
Huawei Ascend, Cambricon, Biren, Moore Threads는 CANN 또는 자체 런타임이며 투명한 CUDA 교체가 아니다. Ascend 커뮤니티에서 시작하라. 그래프, 통신, 텔레메트리를 다시 쓰면 학습과 추론을 덮는다. 맥락은 국내 클러스터와 국내 상주. 비용은 인월과 전력이며 한 장의 달러 스티커가 아니다. 재정 사업은 거의 여기만 산다.
2.5 궤도 E: 이종 실행(Cloud Mac / Apple silicon)
진입은 클라우드 또는 로컬 Mac으로의 SSH / VNC. 실행은 MCP, 서명, worktree, 온디바이스 Core ML이며 H100 학습이 아니다. 낮은 동시성 프로토타입은 통합 메모리에서 작은 모델을 시험할 수 있지만 프로덕션 처리량은 API나 GPU로 돌아간다. 진짜 병목인 메모리: Mac mini를 AI Agent 서버로. 임대 과금 자동화: FOSSBilling 연산 임대 플랫폼.
3. 같은 헤더의 비교
제3국 케이지, 클라우드 GPU, 국산 칩, API, 실행 호스트를 한 표에 넣어 “CUDA인가”만 묻지 마라.
| 층/방안 | 진입 | 실행 | 맥락 | 비용 | 권한 경계 |
|---|---|---|---|---|---|
| API / 토큰 | 키 / 기업 계약 | 추론, 도구, 긴 컨텍스트 | 허용된 프롬프트와 파일 | 백만 토큰; 재시도는 두 배 | 공급자 상주와 학습 조항 |
| 인가 클라우드 GPU | 콘솔 / 약정 | CUDA 학습 + 자체 호스트 추론 | VPC에 넣은 가중치 | GPU 시간 + 유휴 + 이그레스 | 서명 주체와 최종 모회사 |
| 제3국 DC | 해외 케이지 계약 | 종이 위로는 클라우드 GPU | 케이지 국가 ≠ 허가 예외 | 임대 + 실사 + 집행 위험 | BIS는 본사를 본다 |
| 국산 AI 칩 | 국내 클라우드 / 자체 홀 | 네이티브 스택 학습·추론 | 국내 데이터와 툴링 | 이전 인월 + 전력 | 재정 사업은 거의 필수 |
| Cloud Mac 실행 | SSH / 클라우드 Mac | MCP, 서명, 상시 Agent | 저장소, 인증서, Keychain | 일 임대 호스트, FLOPS 아님 | 프로세스 사용자와 이그레스 |
비대칭 한 줄: 케이지를 다른 나라로 옮겨도 “최종 모회사가 중국”은 지워지지 않는다. 더 싼 국산 카드도 덮개 닫힘 후 토큰 재과금을 막지 못한다. SKU는 궤도 위의 눈금이다.
4. 시나리오 행렬
| 층/방안 | 진입 | 실행 | 맥락 | 비용 | 권한 경계 |
|---|---|---|---|---|---|
| 지원 / 코딩 Agent, 낮은 QPS | API 기본 | Flash 또는 국내 API, 스텝 제한 | 짧은 컨텍스트 + 캐시된 시스템 | 출력을 입력의 3–8×로 예산 | 키는 백엔드만 |
| 이식 가능한 7B–70B 파인튜닝 | 국산 클러스터 | Ascend / Cambricon 학습 스택 | 데이터는 국내 | 인월 > 카드 가격 | 재정·국내 컴플라이언스 우선 |
| 독립 비 D:5 최종 모회사 | 인가 클라우드 GPU | 짧은 CUDA 임대로 증명 | VPC + 키 로테이션 | 일 단위 후 약정 | 법무가 먼저 BIS / 클라우드 KYC |
| 중국 본사 + 해외 케이지 희망 | 기본으로 두지 마라 | 허가는 거절로 가정 | 제3국 서류로는 부족 | 실사가 API보다 비싼 경우가 많다 | BIS를 읽고 출시 계획에서 빼라 |
| iOS / MCP / 상시 오케스트레이션 | Cloud Mac + API | Mac은 실행하고 학습하지 않는다 | 인증서와 DerivedData는 Mac | 일 임대 머신 + 토큰 | Keychain은 상자 밖으로 |
| 재정 데이터센터 | 국산 칩 | 입찰 스택을 납품 | 국내 상주 | 이전을 일정에 쓴다 | 외국 가속기는 빠져야 할 수 있다 |
5. 추천 스택
A | 제품 기본(대부분의 팀) 국내 또는 국제 API 추론 → 스텝 상한 + 일일 예산 → MCP / 서명은 Cloud Mac → 규제 NVIDIA 플래그십 구매 금지 B | 자체 학습 필수 Ascend / Cambricon 클러스터 → 실제 학습 그래프 한 줄을 먼저 이식 → 통신과 모니터를 같이 다시 쓴다 → 라이브 추론은 API 유지 C | 적격 해외 주체 법무가 최종 모회사 확인 → 짧은 인가 클라우드 GPU → 이그레스와 키 로테이션을 runbook에 → 제3국 쉘을 허가로 쓰지 않는다 D | 재정 / 국산화 사업 가속기 100% 국산 → SOW에 CANN(또는 입찰 스택) 고정 → “B30A 완화 대기”를 임계 경로에 두지 마라
6. 함정
- 함정 1: 싱가포르 / 말레이시아 케이지 = 합법 H100. BIS는 최종 모회사 본사를 본다.
- 함정 2: 선진 AI에는 자체 NVIDIA가 필요하다. 대부분의 라이브 요청은 추론이며 토큰이 이미 선진 연산이다.
- 함정 3: 국산 칩은 “약한 CUDA”. 다른 스택이다. 연산자를 이식하지 않으면 연산이 없다.
- 함정 4: 회색 시장 카드를 프로덕션에. 드라이버, 보증, 컴플라이언스 경로가 없다.
- 함정 5: 주체 없는 클라우드 GPU 견적. KYC 실패는 계약을 종이로 만든다.
- 함정 6: 노트북에서 Agent를 돌리고 GPU 부족을 탓한다. 덮개 닫힘 재시도가 사는 것은 토큰이다.
- 함정 7: 수출 규칙을 “중국은 영원히 NVIDIA를 못 얻는다”로 읽는다. 허가와 빈은 움직인다. 계획은 궤도로 써라.
7. 7단계
- 다음 주 부하를 학습 / 추론 / 실행으로 나누고 “전부 H100”을 금지한다.
- 추론 열에 API를 고른다(DeepSeek API 문서 또는 국내 호스트). 실제 프롬프트로 토큰을 잰다.
- BIS 2026-05-31에 맞춰 주체도를 그린다: 본사, 최종 모회사, 클라우드 계정. 중국 본사면 제3국 케이지를 설계에 넣지 마라.
- 학습이 필요하면 국산 스택을 고르고 홀을 채우기 전에 loss를 재현하는 그래프 한 줄을 이식한다.
- 법인이 클라우드와 수출 심사를 견딘 뒤에만 짧은 인가 클라우드 GPU PoC를 연다.
- MCP, 서명, 상시 오케스트레이션을 Cloud Mac으로 옮겨 덮개 닫힘 재시도를 죽인다. 경계: MCP: Cloud Mac vs VPS vs 로컬.
- 한 장짜리: 기본 API, 학습은 국산, 회색 시장 금지, 제3국 우회 금지. 매달 청구서와 주체를 맞춘다.
8. FAQ
제3국 데이터센터로 NVIDIA 수출 제한을 우회할 수 있나?
중국·마카오 본사 또는 최종 모회사가 그곳에 있는 법인은 불가. BIS(2026-05-31)는 선진 컴퓨팅 품목을 세계 어디에 인도해도 허가가 필요하다고 말한다. 말레이시아나 싱가포르 랙은 합법 우회가 아니다.
H100이 없으면 선진 AI는 불가능한가?
대부분의 제품과 Agent는 자체 H100이 필요 없다. 추론은 API, 학습은 이식 가능한 국산 클러스터 또는 적격 주체의 라이선스 클라우드 GPU. 부족한 것은 궤도이지 한 SKU가 아니다.
국산 AI 칩이 CUDA를 대체하나?
학습·추론 일부는 가능. 모든 CUDA 커널의 기본 대체는 아니다. 비용은 연산자·인터커넥트·툴체인.
클라우드 GPU와 토큰 중 뭐가 나은가?
낮은 동시성과 Agent 루프는 토큰과 출시 속도에서 이긴다. 파인튜닝, 자체 보유 긴 컨텍스트, API의 지연·상주가 부족할 때만 GPU를 빌린다.
Cloud Mac이 데이터센터 GPU인가?
아니다. MCP, 서명, 상시 Agent, 온디바이스 검증용. 추론은 API 또는 GPU. 덮개 닫힘 재시도는 토큰을 다시 산다.
9. 요약
2026년 NVIDIA AI 칩 수출 제한 이후 중국 팀이 선진 AI 연산을 얻는 합법 경로는 궤도 분할이지, 케이지로 밀수할 플래그십 카드 탐색이 아니다. 제3국 데이터센터는 D:5 본사 법인의 우회가 아니다. 클라우드 GPU는 주체 심사를 견디는 계약만. 국산 AI 칩은 이식 가능한 학습과 재정 사업. API 토큰은 대부분의 라이브 추론.
순서: 부하를 나눈다 → 추론은 API → 최종 모회사를 그린다 → 학습은 국산 또는 인가 클라우드 → 실행은 Cloud Mac → “제3국 케이지로 우회”를 마일스톤에서 지운다. 규칙은 움직인다. 궤도를 매주 다시 쓰지 마라.