글 핵심 요약
- 공식 확인: 2026년 5월 19일 I/O에서 Gemini 3.5 패밀리 발표; Gemini 3.5 Flash 당일 GA; Pro는 내부 사용 중, 「다음 달」 공개 예정——해당 일정은 연기됨.
- 7월 13일 기준: Pro는 Vertex AI 엔터프라이즈 프리뷰; 공개 API에
gemini-3.5-proGA 항목 없음; 다수 언론이 7월 17일을 목표일로 보도하나 Google은 미공식 발표. - 미공식 확인·광범위 보도: 2M token 컨텍스트, Deep Think 추론 레이어, API 약 $15/$60 백만 token, Ultra $250/월 구독 문턱.
- 지금 바로 사용 가능: Gemini 3.5 Flash(1M 컨텍스트, $1.50/$9 백만 token)가 대부분 Agent·코딩 시나리오를 커버.
- 선택 분기점은 「누가 더 똑똑한가」가 아니라 컨텍스트 길이 × 추론 비용 × 실행 환경——장시간 Agent는 클라우드 Mac에서 7×24 도구 체인 실행이 현실적.
선행 결론: Flash는 오늘부터, Pro는 기다릴 가치는 있지만 프로덕션에 걸지 말 것
Google이 공식 model card를 공개하기 전까지, Pro 관련 숫자는 모두 베팅이지 계약 조항이 아니다.
세 가지만 기억하세요: ① Gemini 3.5 Flash는 2026년 Google 개발자용 기본 주력; ② Gemini 3.5 Pro는 패밀리의 「중포」이나 7월 중순까지 공개 GA 아님; ③ 지금 「7월 17일 출시」 소문 날짜에 프로덕션을 묶는 것은 이득보다 리스크가 크다.
Google 공식 블로그는 절제되어 있다: 3.5 패밀리는 「frontier intelligence with action」——Agent와 코딩; Flash 당일 전면 공개; Pro는 「내부 사용 중, 다음 달 출시 기대」. Sundar Pichai도 I/O에서 동일한 톤.공식 본문에 2M 컨텍스트, Deep Think, API 단가 기재 없음——이는 후속 언론 보도와 엔터프라이즈 프리뷰 유출. 신뢰도는 층별로 봐야 한다.
엔지니어에게 현실적인 방법: Flash로 Antigravity / Gemini API / Vertex Agent 파이프라인을 통과시키고, 「저장소 전체 2M token 일괄 투입」이나 「다단계 하드 추론」이 필요한 작업은 backlog에 기록한 뒤 Gemini API changelog에 GA 항목이 나오면 기본 모델을 전환. GPT-5.6과 Gemini 선택 가이드와 같은 결론: 모델 발표는 점점 촘촘하지만, 먼저 고정할 것은 워크플로 진입점과 실행 노드.
1. Gemini 3.5 Pro가 Flash보다 「난산」인 이유
Flash가 I/O 당일 GA된 것은 우연이 아니다. Google은 3.5 Flash를 고처리량·Agent 우선 기본 모델로 위치: 1M 컨텍스트, 동적 thinking 기본 ON, Terminal-Bench 2.1 76.2% 등 벤치마크는 I/O 발표 목록에 공개됨. 「Flash도 플래그십급」——검색, Gemini App, Antigravity 기본 경험에 중요.
Pro의 역할은 다르다. Business Insider, Geeky Gadgets 등 다수 테크 미디어 보도에 따르면 Google은 엔터프라이즈 프리뷰에서 장시간 Agent 작업의 token 효율과 품질이 내부 기준에 미달해 아키텍처급 재구축을 진행. GA는 6월에서 7월로 미뤄지고, 보도상 목표일은 7월 17일. Google 대변인은 구체 날짜에 논평 거부——「7월 17일」은 업계 컨센서스급 목표 창이지 SLA에 쓸 약속이 아니다.
구 계획의 실패 지점? I/O 직후 많은 팀이 로드맵을 「6월 Pro 전면 전환」으로 썼다:
- 예산을 「소문의 $15/$60」에 고정했으나 6월에는 Flash만 과금 가능해 재무 모델 왜곡.
- Vertex 프리뷰에서 만든 prompt와 도구 체인을 모델 ID로 추상화하지 않아 GA 전환 시 재작업.
- 「2M으로 저장소 통째 읽기」를 전제로 Flash 1M + 검색/청크로 80% 달성 가능한 점 무시.
- 노트북에서 장시간 Agent 실행, 덮개 닫으면 끊김——「Pro 대기」와 무관한데 모델 미출시 탓으로 돌림.
Pro 지연의 교훈: Google은 기준 미달 「Ultra 후속」으로 브랜드를 훼손하기보다 한 달 늦춘다. 사용자에게는 오히려 신호——Flash는 이미 충분히 강하고, Pro는 분명히 위를 가야 독립 가격대에 값한다.
2. Gemini 3.5 Pro란? Flash와 역할 분담
2.1 패밀리 포지셔닝(공식 톤)
Google 공식에 따르면 Gemini 3.5는 2026년 차세대 모델 패밀리. 키워드는 Agent, 코딩, 장시간 작업. Flash는 「기본·고속·광범위」; Pro는 「최난도 추론·최장 컨텍스트·최고 품질」——과거 Gemini Ultra / 3.1 Pro 대를 이어받지만 I/O 원고에 「Ultra 개명」 문구 없음. 「3.5 Pro」만 사용.
2.2 Gemini 3.5 Flash(GA 완료·대조군)
Pro를 쓰려면 Flash 대조가 필수. 그렇지 않으면 「기다릴지」 판단 불가:
- API ID:
gemini-3.5-flash(GA, preview 접미사 없음) - 컨텍스트: 1,048,576 입력 token / 65,536 출력 token(공식 문서)
- 가격: $1.50 / $9.00 백만 input/output token; 캐시 입력 $0.15
- 배포: Gemini App, Search AI Mode, Gemini API, AI Studio, Android Studio, Google Antigravity, Vertex AI, Gemini Enterprise
- 능력: 멀티모달 입력, 함수 호출, 코드 실행, 검색 도구, 동적 thinking
2.3 Gemini 3.5 Pro(프리뷰 / GA 대기)
2026-07-13 기준 공개 채널에서 확인 가능한 상태:
- Google은 Pro 존재와 내부 사용을 인정, 공개 rollout은 「다음 달(6월)」에서 연기.
- Vertex AI 엔터프라이즈 고객은 제한 프리뷰에서 시험 가능(모든 개발자가 셀프 개통 가능한 것은 아님).
- 공개 Gemini API 모델 목록은
gemini-3.5-flash와gemini-3.1-pro-preview등이 중심, Pro GA model card 없음.
미디어 보도의 Pro 차별화 능력(GA 검증 대기):
- 2M token 컨텍스트——Flash 약 2배. 저장소 전체 코드, 장문 컴플라이언스 문서, 긴 Agent 궤적용.
- Deep Think 추론 레이어——다단 논리, 복잡 수학, 계획; 구독 대와 연동된다는 보도(가격 절 참조).
- 강화 멀티모달과 UI 생성——Gemini 3 시리즈 대화형 Web UI 계승, hardest reasoning용.
- 저지연은 강점 아님——Pro는 품질 우선, Flash와 보완 관계이지 대체가 아님.
3. 출시 타임라인: I/O에서 7월 중순까지
| 시기 | 이벤트 | 신뢰도 |
|---|---|---|
| 2026-05-19 | Google I/O: Gemini 3.5 발표; Flash GA; Pro 내부 사용, 다음 달 공개 예정 | 공식 |
| 2026-05 ~ 06 | Flash가 Gemini App / Search AI Mode 기본값; Antigravity, Enterprise 동기화 | 공식 |
| 2026-06 하순 | 미디어: Pro GA 6월→7월; Vertex 프리뷰 지속; API changelog에 Pro GA 없음 | 미디어 보도 + API 현황 |
| 2026-07-08 ~ 17 | 다수 outlet: Google 목표 7월 17일 GA; 아키 재구축과 프리뷰 피드백 관련 보도 | 미디어 보도(미공식) |
| 2026-07-13(작성일) | Pro 아직 공개 GA 아님; 개발자는 Flash로 프로덕션, changelog 모니터 | 사실 상태 |
공식 발표를 어떻게 추적? 두 소스 권장: Google DeepMind / Gemini 모델 블로그와 Gemini API Changelog. GA 당일 보통 동시에: model card, 가격 페이지 업데이트, AI Studio 기본 옵션. 헤드라인만 있고 이 셋이 없으면 여전히 프리뷰 취급.
4. 기능 목록: 공식 확인 vs 미발표
| 능력 | Flash(GA) | Pro(예상 / 보도) | 상태 |
|---|---|---|---|
| Agent 장시간 작업 | 공식 주력 | 더 강한 추론과 계획 | Flash 확인; Pro는 GA 후 평가 |
| 컨텍스트 윈도우 | 1M tokens | 2M tokens(보도) | Flash 공식; Pro 미공표 |
| Deep Think / 심층 추론 | 동적 thinking 기본 ON | 독립 Deep Think 레이어(보도) | Pro 미공표 |
| 코딩 / Terminal-Bench | 76.2%(I/O 발표) | Flash 초과 기대 | Flash 수치 있음; Pro 미발표 |
| 멀티모달 | 이미지·음성·영상 입력 | 더 강한 대화 UI(보도) | Flash 확인 |
| Antigravity / Vertex | 연결됨 | 프리뷰 중 | Flash GA; Pro 엔터프라이즈 프리뷰 |
개발자에게 기능의 「가치」는 작업 형태에 달림:
- 단발 800K token 이내 코드 리뷰 + 패치 생성: Flash로 보통 충분, 비용도 관리 가능.
- 저장소 의존 그래프 전체 + 크로스 서비스 추적 + 일괄 출력: 2M에 이론적 우위, 다만 Pro 실측 latency와 hallucination률 대기.
- 다단 수학 증명, 복잡 컴플라이언스 추론: Deep Think가 독립 대라면 OpenAI
reasoning.effort=max나 Claude extended thinking에 가까운 포지션 가능.
5. Gemini 3.5 Pro 가격: 공식 공백과 합리적 추정
Google은 Pro 공식 API 가격을 아직 발표하지 않음. 아래는 층별 설명. 소문을 청구서로 쓰지 말 것.
5.1 확인된 참고가: Gemini 3.5 Flash
| 항목 | 가격(USD) |
|---|---|
| 입력 token | $1.50 / 백만(비글로벌 리전 약 $1.65) |
| 출력 token | $9.00 / 백만(비글로벌 리전 약 $9.90) |
| 캐시 입력 | $0.15 / 백만 |
5.2 미디어 보도의 Pro 가격대(미확인)
다수 미디어의 동일 오더 추측. 예산 샌드박스용만:
- API: 약 $15 / 백만 입력, $60 / 백만 출력——Flash 약 10배 오더.
- 소비자 구독: Deep Think 또는 풀 Pro 능력은 Gemini Advanced / Ultra 대(약 $250/월) 필요할 수 있음(보도 톤, Google 가격 페이지 아님).
- 다른 outlet은 완만한 API 추측($1.25 / $10)도——10배 가설과 충돌. GA 당일 model card가 정답.
5.3 경쟁사와 거친 계산(의사결정 보조, 실시간 견적 아님)
Pro 소문 가격과 Flash, GPT-5.6 / Codex 쿼터 논리를 같은 틀에서:
- 고빈도 Agent, 일일 백만 token급: Flash 또는 GPT-5.6 Luna/Terra가 현실적.
- 저빈도·초장 컨텍스트·일발 승부: Pro 2M이 TCO 우위 가능(적은 호출로 품질), 공식 단가 검증 대기.
- 터미널 코딩 Agent 7×24: 모델 요금 외 실행 환경(클라우드 Mac 상시 가동)이 청구에 더 큰 영향을 주는 경우가 많음.
6. 5축 비교: Pro(예상) vs Flash vs GPT-5.6 vs Claude
| 축 | Gemini 3.5 Flash | Gemini 3.5 Pro(예상) | GPT-5.6 Sol | Claude Mythos 5 |
|---|---|---|---|---|
| 가용성 | GA, 전 채널 | 프리뷰 / GA 대기 | GA(2026-07) | GA |
| 컨텍스트 | 1M(공식) | 2M(보도) | 플랜 / API에 따름 | 약 200K+ |
| 코딩 Agent | Terminal-Bench 76.2% | 미발표 | Terminal-Bench 88.8% | SWE-bench Pro 선행 |
| API 가격(오더) | $1.5 / $9 | 소문 ~$15 / $60 | Sol/Terra/Luna 분리 | 중~고가 대 |
| 최적 진입점 | Antigravity / Gemini API | Vertex + AI Studio(대기) | Codex / Cursor | Claude Code CLI |
이 표의 의도는 「누가 이기나」가 아니라 단일 기본 승자는 없다는 것. Flash는 Google 생태계 내 「충분히 빠르고 충분히 저렴한」 Agent 기반; Pro가 2M + Deep Think를 실현하면 초장 문서와 하드 추론을 보완; OpenAI와 Anthropic은 터미널 코딩과 IDE 진입점에서 여전히 성숙. 자세히는 GPT-5.6 코딩 선택 가이드.
7. 시나리오 선택 매트릭스
| 시나리오 | 지금 권장 | Pro GA 후 재평가 | 비권장 |
|---|---|---|---|
| Antigravity 기본 Agent | 3.5 Flash | 작업별 Pro 전환 | Pro 대기로 중단 |
| 단발 <1M token 코드 리뷰 | 3.5 Flash | — | Pro 프리뷰에 억지 |
| monorepo 저장소 일괄 분석 | Flash + 청크 / 검색 | 3.5 Pro 2M | 노트북 로컬 하드런 |
| 복잡 재무 / 컴플라이언스 다단 추론 | Flash + 인간 검토 | Deep Think(공표 후) | 무료 티어 장 Agent |
| iOS / Xcode CI Agent | Flash API + 클라우드 Mac | Pro 장 컨텍스트 | Web UI만, 도구 체인 없음 |
| 프로덕션 SLA 시스템 | Flash GA + 버전 고정 | Pro GA + 카나리 | 소문 출시일에 묶기 |
8. 권장 스택
【Stack A — 개인 개발자 / 시험】
모델: Gemini 3.5 Flash(AI Studio 또는 API)
진입: Antigravity 또는 자체 스크립트 + function calling
실행: 로컬 단기 작업; 장기 작업은 클라우드 Mac으로
예산: Flash $1.5/$9로 token 추정; Pro 10×로 예약하지 말 것
【Stack B — 엔터프라이즈 Vertex】
모델: Flash 프로덕션 + Pro 프리뷰는 별도 project
거버넌스: 프리뷰와 프로덕션 service account 분리; 모델 ID 환경변수화
모니터: changelog RSS + 비용 알림(BigQuery billing export)
전환: Pro GA 후 10% 카나리 → 벤치마크 회귀 → 전량
【Stack C — 멀티모델 코딩 팀】
검색 / 대규모 저장소 스캔: Gemini 3.5 Flash
하드 추론 / 아키 리뷰: Pro 대기 또는 Claude extended thinking
터미널 수정: Claude Code 또는 Codex on 클라우드 Mac worktree
IDE 일상: Cursor + GPT-5.6 Terra
원칙: 동일 작업에 「주 모델」 하나만, 이중 token 방지
9. 흔한 오해
- 오해 1: 미디어 보도를 model card로 간주. 2M, Deep Think, $15/$60는 Google 공식 I/O 문에 없음; 아키 문서에 쓰기 전 「미확인」 표기.
- 오해 2: Flash는 과도기 제품. I/O 데이터는 Flash가 여러 Agent 벤치에서 전세대 3.1 Pro 초과; 주력이지 「lite」가 아님.
- 오해 3: Pro 나오면 전원 전환. 긴 컨텍스트 ≠ 낮은 총비용; 2M 단발 호출 실패 재시도가 더 비쌀 수 있음.
- 오해 4: Antigravity와 API 차이 무시. 동일 모델도 harness마다 도구 목록, 권한, 지연 다름——실제 진입점에서 측정.
- 오해 5: Pro 대기 중 아무것도 배포 안 함. 경쟁사는 기다려 주지 않음; Flash로 Agent 파이프라인 먼저 통과가 이주 공백보다 가치 있음.
10. 도입 단계(7단계)
- 작업 목록화: >1M 컨텍스트 또는 하드 추론 필요 작업 비율; <20%면 Flash를 주 모델로.
- Flash 프로덕션 경로 개통: AI Studio 또는 Vertex에서 프로젝트 생성, API key / workload identity 환경 분리.
- 모델 ID 추상화: 코드에
GEMINI_MODEL=gemini-3.5-flash, 산재 하드코딩 금지, Pro GA 전환 용이하게. - 장 Agent를 실행 노드로: 수시간 도구 체인은 클라우드 Mac, 로컬 슬립 끊김 방지(Flash/Pro 선택과 직교하지만 핵심).
- changelog 구독: Gemini API + Google AI 블로그; 7월 중하순 GA 확인 캘린더.
- Pro GA 당일 플로우: model card 읽기 → 내부 golden set → Flash와 비용·품질 비교 → 10% 카나리.
- 2주 회고: token량, 작업 성공률, 인간 개입 횟수 기록——데이터로 Pro 10× 단가 가치 판단.
11. FAQ
Gemini 3.5 Pro 출시됐나요?
2026년 7월 13일 기준 공개 GA 아님. Google은 5월 19일 I/O에서 Pro 내부 사용과 익월 공개 발표; 현재 연기 단계. 엔터프라이즈 고객은 Vertex AI 프리뷰에서 제한 시험 가능. 다수 미디어가 목표일 7월 17일 보도하나 Google 미확인.
Gemini 3.5 Pro와 Flash 차이는?
Flash는 전면 이용 가능, 고속 Agent와 코딩, 1M 컨텍스트, $1.50/$9 백만 token. Pro는 패밀리 플래그십 예상: 보도상 2M 컨텍스트, Deep Think 심층 추론, 더 높은 API 단가와 다단 작업 능력; 구체 스펙은 GA model card 기준.
Gemini 3.5 Pro 가격은?
Google은 Pro 공식 가격 미발표. 미디어 일반 추측은 API 약 $15/$60 백만 input/output token, Flash 약 10배; Deep Think는 약 $250/월 Ultra 대와 연동 가능(보도). 공식 가격 페이지 업데이트 전까지 Flash 가격만 계약·예산에 기재.
지금 어떤 Gemini 모델을 써야 하나요?
프로덕션은 Gemini 3.5 Flash(gemini-3.5-flash) 우선. Google 생태계 Agent, Antigravity, Enterprise 오케스트레이션에서 Flash가 2026년 기본값. Pro는 프리뷰 자격 내에서만 평가하고 프로덕션 트래픽과 분리.
2M 컨텍스트 때문에 Pro를 기다릴 가치가 있나요?
작업에 따라 다름: 1M + RAG/청크로 80% 충족되면 기다릴 필요 없음. 단발로 저장소 전체 투입이 루틴이고 재시도 비용이 극대면 Pro GA 후 A/B. GA 전에 소문 2M에 아키텍처 걸지 말 것.
12. 요약
Gemini 3.5 Pro란?——2026년 I/O에 발표된 3.5 패밀리 플래그십, 최난도 추론과 최장 컨텍스트용이나 7월 중순까지 공개 GA 아님. 기능과 가격에서 Flash는 완전한 model card 있음; Pro의 2M, Deep Think, $15/$60 등 핵심 숫자는 「신뢰할 만한 보도·미공식」. 출시 시기는 「6월」에서 「7월 중하순」으로 미뤄짐, API changelog를 정으로 하고 미디어 카운트다운에 의존하지 말 것.
현실적 경로는 하나: 오늘 Flash로 Agent를 돌리고, 내일 Pro로 증분 업그레이드. 모델 전쟁은 매주 뉴스가 나오지만, 엔지니어링 팀이 고정할 것은 실행 환경, 모델 ID 추상화, 비용 대시보드——나머지는 Sundar가 다음에 블로그에 서명하는 날 기본 설정을 바꾸면 된다.
Pro를 기다리는 동안 Flash + 클라우드 Mac으로 Agent 안정화
Gemini 3.5 Flash로 API 코딩 Agent를 구성하고 실행층은 클라우드 Mac mini M4——xcodebuild, Git worktree, SSH 장세션이 끊기지 않음. Pro GA 후에는 환경변수 model ID만 바꾸면 파이프라인 재구축 불필요; Apple Silicon 통합 메모리는 1M급 장 컨텍스트에 적합, macOS 격리로 Agent 오조작 위험 감소.
일일 요금으로 Antigravity / Gemini API 스모크를 통과한 뒤 월간으로 상시 운영. kvmboot 클라우드 Mac mini M4는 「Flash 오늘, Pro 내일」의 현실적 출발점—— 요금제 보기 , GA 대기 시간을 납품 가능한 Agent 파이프라인으로 바꾸세요.