本文要點
- 官方已確認:2026 年 5 月 19 日 I/O 發布 Gemini 3.5 家族;Gemini 3.5 Flash 當日 GA;Pro 內部使用中,計畫「下個月」公開——該時間表已推遲。
- 截至 7 月 13 日:Pro 仍在 Vertex AI 企業預覽;公開 API 尚無
gemini-3.5-proGA 條目;多家媒體指向 7 月 17 日 為目標日,但 Google 未官宣。 - 未官方確認、但廣泛報導:2M token 上下文、Deep Think 推理層、API 約 $15/$60 每百萬 token、Ultra $250/月 訂閱門檻。
- 現在就能用:Gemini 3.5 Flash(1M 上下文,$1.50/$9 每百萬 token)已覆蓋多數 Agent 與編碼場景。
- 選型分水嶺不是「誰智商更高」,而是上下文長度 × 推理成本 × 執行環境——長 Agent 建議配合 雲端 Mac 7×24 跑工具鏈。
先行結論:Flash 今天就能幹活,Pro 值得等但別押生產
在 Google 放出正式 model card 之前,所有關於 Pro 的數字都是賭注,不是合約條款。
如果你只記三句話:① Gemini 3.5 Flash 已是 2026 年 Google 面向開發者的預設主力;② Gemini 3.5 Pro 是家族裡的「重砲」,但截至 7 月中旬仍未公開 GA;③ 現在把生產系統綁在「據說 7 月 17 日上線」的日期上,風險大於收益。
Google 在 官方部落格 寫得很克制:3.5 家族強調「frontier intelligence with action」——面向 Agent 與編碼;Flash 當日全面可用;Pro「已在內部使用,期待下個月推出」。Sundar Pichai 在 I/O 舞台上也用了同樣口徑。但官方全文沒有寫 2M 上下文、沒有寫 Deep Think、沒有寫 API 單價——這些來自後續媒體報導與企業預覽洩露,可信度需要分層看待。
對工程師而言,更務實的做法是:用 Flash 跑通 Antigravity / Gemini API / Vertex 的 Agent 流水線,把「需要整倉 2M token 一次灌入」或「多步硬推理」的任務記在 backlog 裡,等 Gemini API changelog 出現 GA 條目再切換預設模型。這與我們寫 GPT-5.6 與 Gemini 選型指南 時的結論一致:模型發布會越來越密,工作流入口與執行節點才是你該先固定的。
1. 為什麼 Gemini 3.5 Pro 比 Flash「難產」?
Flash 能在 I/O 當天 GA,並不是偶然。Google 把 3.5 Flash 定位成高吞吐、Agent 優先的預設模型:1M 上下文、動態 thinking 預設開啟、Terminal-Bench 2.1 76.2% 等 benchmark 已在 I/O 公告清單 中公布。它要證明的是「Flash 系列也能打旗艦」——這對搜尋、Gemini App、Antigravity 的預設體驗至關重要。
Pro 的角色不同。多家科技媒體(含 Business Insider、Geeky Gadgets 等)報導,Google 在企業預覽中發現長時程 Agent 任務上的 token 效率與品質未達內部 bar,因而進行架構級重建,GA 從 6 月滑向 7 月,報導中的目標日為 7 月 17 日。Google 發言人拒絕對具體日期置評——這意味著「7 月 17 日」是產業共識級的目標窗口,不是開發者可以寫進 SLA 的承諾。
舊方案失敗在哪?很多團隊在 I/O 後立刻把路線圖寫成「6 月全量切 Pro」:
- 預算按「傳聞中的 $15/$60」鎖死,結果 6 月只有 Flash 可計費,財務模型失真。
- 在 Vertex 預覽環境做的 prompt 與工具鏈,未抽象模型 ID,GA 切換時要返工。
- 把「2M 一次讀完整倉」當成架構前提,忽視 Flash 1M + 檢索/分塊同樣能完成 80% 任務。
- 筆電本機跑長 Agent,合蓋即斷;與「等 Pro」無關,卻會被誤歸因到模型未發布。
Pro 延遲的核心教訓是:Google 寧願晚一個月,也不願用未達標的「Ultra 繼任者」砸招牌。對使用者來說,這反而是訊號——Flash 已經夠強,Pro 必須明顯更強才配得上獨立定價檔。
2. Gemini 3.5 Pro 是什麼?與 Flash 怎麼分
2.1 家族定位(官方口徑)
根據 Google 官方描述,Gemini 3.5 是 2026 年新一代模型家族,關鍵詞是 Agent、編碼、長時程任務。Flash 負責「預設、高速、廣覆蓋」;Pro 負責「最難推理、最長上下文、最高品質」——相當於承接過去 Gemini Ultra / 3.1 Pro 檔位的敘事,但 Google 在 I/O 稿中未使用「Ultra 更名」字樣,僅以「3.5 Pro」指稱。
2.2 Gemini 3.5 Flash(已 GA,對照組)
寫 Pro 必須對照 Flash,否則讀者無法判斷「要不要等」:
- API ID:
gemini-3.5-flash(GA,無 preview 後綴) - 上下文:1,048,576 輸入 token / 65,536 輸出 token(官方文件)
- 定價:$1.50 / $9.00 每百萬 input/output token;快取輸入 $0.15
- 分發:Gemini App、AI Mode in Search、Gemini API、AI Studio、Android Studio、Google Antigravity、Vertex AI、Gemini Enterprise
- 能力:多模態輸入、函式呼叫、程式碼執行、搜尋工具、動態 thinking
2.3 Gemini 3.5 Pro(預覽 / 待 GA)
截至 2026-07-13,公開渠道能確認的狀態是:
- Google 承認 Pro 存在且內部已用,公開 rollout 計畫從「下月(6 月)」推遲。
- Vertex AI 企業客戶可在限定預覽中試用(非所有開發者自助開通)。
- 公開 Gemini API 模型列表以
gemini-3.5-flash與gemini-3.1-pro-preview等為主,尚無 Pro GA 模型卡。
媒體報導中的 Pro 差異化能力(待 GA 驗證):
- 2M token 上下文——約為 Flash 兩倍,面向整倉程式碼、長篇合規文件、長 Agent 軌跡。
- Deep Think 推理層——多步邏輯、複雜數學與規劃;據稱與訂閱檔綁定(見下文價格節)。
- 更強多模態與 UI 生成——延續 Gemini 3 系列互動式 Web UI 能力,定位 hardest reasoning。
- 更低延遲不是賣點——Pro 走品質優先,與 Flash 形成互補而非替代。
3. 發布時間線:從 I/O 到 7 月中旬
| 時間 | 事件 | 可信度 |
|---|---|---|
| 2026-05-19 | Google I/O:發布 Gemini 3.5;Flash GA;Pro 內部使用,計畫下月公開 | 官方 |
| 2026-05 ~ 06 | Flash 成為 Gemini App / Search AI Mode 預設;Antigravity、Enterprise 同步 | 官方 |
| 2026-06 下旬 | 媒體稱 Pro GA 從 6 月滑至 7 月;Vertex 預覽繼續;API changelog 無 Pro GA | 媒體報導 + API 現狀 |
| 2026-07-08 ~ 17 | 多家 outlet 稱 Google 目標 7 月 17 日 GA;稱架構重建與預覽回饋有關 | 媒體報導(未官宣) |
| 2026-07-13(本文寫作日) | Pro 仍未公開 GA;開發者應以 Flash 生產、監控 changelog | 事實狀態 |
如何盯官宣? 建議訂閱兩個源:Google DeepMind / Gemini 模型部落格 與 Gemini API Changelog。GA 當天通常會同時出現:model card、定價頁更新、AI Studio 預設選項。只有新聞標題沒有這三樣,就仍按預覽處理。
4. 功能清單:官方已確認 vs 待官宣
| 能力 | Flash(GA) | Pro(預期 / 報導) | 狀態 |
|---|---|---|---|
| Agent 長時程任務 | 官方主推 | 更強推理與規劃 | Flash 已確認;Pro 待 GA 評測 |
| 上下文視窗 | 1M tokens | 2M tokens(報導) | Flash 官方;Pro 未官宣 |
| Deep Think / 深度推理 | 動態 thinking 預設開 | 獨立 Deep Think 層(報導) | Pro 未官宣 |
| 編碼 / Terminal-Bench | 76.2%(I/O 公布) | 預期高於 Flash | Flash 有數字;Pro 待公布 |
| 多模態 | 圖文音視訊輸入 | 更強互動 UI(報導) | Flash 已確認 |
| Antigravity / Vertex | 已接入 | 預覽中 | Flash GA;Pro 企業預覽 |
對開發者來說,功能是否「值」取決於任務形態:
- 單次 800K token 以內的程式碼審查 + 補丁生成:Flash 通常足夠,且成本可控。
- 整庫依賴圖 + 跨服務追蹤 + 一次輸出:2M 才有理論優勢,但要等 Pro 實測 latency 與 hallucination 率。
- 多步數學證明、複雜合規推理:Deep Think 若確為獨立檔位,可能接近 OpenAI
reasoning.effort=max或 Claude extended thinking 的定位。
5. Gemini 3.5 Pro 價格:官方空白與合理預估
Google 尚未公布 Pro 的正式 API 定價。 以下分層說明,避免把傳聞當發票。
5.1 已確認的參考價:Gemini 3.5 Flash
| 項目 | 價格(USD) |
|---|---|
| 輸入 token | $1.50 / 百萬(非全球區域約 $1.65) |
| 輸出 token | $9.00 / 百萬(非全球區域約 $9.90) |
| 快取輸入 | $0.15 / 百萬 |
5.2 媒體報導中的 Pro 價位(未確認)
多家媒體給出的同一量級猜測如下,僅供預算沙盤使用:
- API:約 $15 / 百萬輸入、$60 / 百萬輸出——約為 Flash 的 10× 量級。
- 消費者訂閱:Deep Think 或完整 Pro 能力可能要求 Gemini Advanced / Ultra 檔(約 $250/月) 才解鎖(報導口徑,非 Google 定價頁)。
- 另有 outlet 給出較溫和的 API 猜測(如 $1.25 / $10),與 10× 假說衝突——再次說明必須以 GA 當日 model card 為準。
5.3 與競品粗算(幫助決策,非即時報價)
把 Pro 傳聞價與 Flash、GPT-5.6 / Codex 配額邏輯 放在同一框架:
- 高頻 Agent、日呼叫百萬級 token:Flash 或 GPT-5.6 Luna/Terra 更現實。
- 低頻、超長上下文、一次成敗:Pro 2M 可能有 TCO 優勢(少次呼叫換品質),待官方單價驗證。
- 終端編碼 Agent 7×24:模型費之外,執行環境(雲端 Mac 常開)往往比多 5× token 單價更影響帳單。
6. 五維對比:Pro(預期)vs Flash vs GPT-5.6 vs Claude
| 維度 | Gemini 3.5 Flash | Gemini 3.5 Pro(預期) | GPT-5.6 Sol | Claude Mythos 5 |
|---|---|---|---|---|
| 可用性 | GA,全渠道 | 預覽 / 待 GA | GA(2026-07) | GA |
| 上下文 | 1M(官方) | 2M(報導) | 視套餐 / API | 約 200K+ |
| 編碼 Agent | Terminal-Bench 76.2% | 待公布 | Terminal-Bench 88.8% | SWE-bench Pro 領先 |
| API 價(量級) | $1.5 / $9 | 傳聞 ~$15 / $60 | 分 Sol/Terra/Luna | 中高檔 |
| 最佳入口 | Antigravity / Gemini API | Vertex + AI Studio(待) | Codex / Cursor | Claude Code CLI |
這張表想表達的不是「誰贏」,而是沒有單一預設贏家。Flash 在 Google 生態內已是「夠快夠便宜」的 Agent 底座;Pro 若兌現 2M + Deep Think,會在超長文件與硬推理上補位;OpenAI 與 Anthropic 仍在終端編碼與 IDE 入口上更成熟。詳見 GPT-5.6 寫程式選型指南。
7. 場景選擇矩陣
| 場景 | 現在推薦 | Pro GA 後再評估 | 不建議 |
|---|---|---|---|
| Antigravity 預設 Agent | 3.5 Flash | 按任務切 Pro | 死等 Pro 停工 |
| 單次 <1M token 程式碼審查 | 3.5 Flash | — | 強行上 Pro 預覽 |
| 整倉 monorepo 一次分析 | Flash + 分塊 / 檢索 | 3.5 Pro 2M | 筆電本機硬跑 |
| 複雜財務 / 合規多步推理 | Flash + 人工覆核 | Deep Think(若官宣) | Free 檔長 Agent |
| iOS / Xcode CI Agent | Flash API + 雲端 Mac | Pro 長上下文 | 僅 Web UI 無工具鏈 |
| 生產 SLA 系統 | Flash GA + 版本釘死 | Pro GA + 灰度 | 綁定傳聞發布日 |
8. 推薦組合(Stack)
【Stack A — 個人開發者 / 試水】
模型:Gemini 3.5 Flash(AI Studio 或 API)
入口:Antigravity 或自研腳本 + function calling
執行:本機短任務;長任務遷雲端 Mac
預算:按 Flash $1.5/$9 估 token;勿按 Pro 10× 預留
【Stack B — 企業 Vertex】
模型:Flash 生產 + Pro 預覽環境單獨 project
治理:預覽與生產不同 service account;模型 ID 環境變數化
監控:changelog RSS + 費用告警(BigQuery 匯出 billing)
切換:Pro GA 後 10% 流量灰度 → benchmark 回歸 → 全量
【Stack C — 多模型編碼團隊】
檢索 / 大倉掃:Gemini 3.5 Flash
硬推理 / 架構評審:等 Pro 或 Claude extended thinking
終端改碼:Claude Code 或 Codex on 雲端 Mac worktree
IDE 日常:Cursor + GPT-5.6 Terra
原則:同一任務只選一個「主模型」,避免雙份 token
9. 常見誤區
- 誤區 1:把媒體報導當 model card。2M、Deep Think、$15/$60 在 Google 官方 I/O 文中均未出現;寫進架構文件前請標註「未確認」。
- 誤區 2:Flash 只是過渡品。I/O 數據證明 Flash 已在多項 Agent benchmark 上超過上一代 3.1 Pro;它是主力不是「/lite」。
- 誤區 3:Pro 一出就要全員切換。更長上下文 ≠ 更低總成本;2M 單次呼叫的失敗重試可能更貴。
- 誤區 4:忽略 Antigravity 與 API 的差異。同一模型在不同 harness 下工具列表、權限、延遲不同——要在真實入口測。
- 誤區 5:等 Pro 期間什麼都不部署。競品不會等你;用 Flash 先把 Agent 流水線跑通,比空等兩週更值錢。
10. 落地步驟(7 步)
- 盤點任務:列出需要 >1M 上下文或硬推理的任務占比;若 <20%,Flash 即可作為主模型。
- 開通 Flash 生產路徑:AI Studio 或 Vertex 建立專案,API key / workload identity 分環境管理。
- 模型 ID 抽象:程式碼中
GEMINI_MODEL=gemini-3.5-flash,禁止硬編碼 scattered 字串,便於 Pro GA 切換。 - 長 Agent 遷執行節點:需要數小時工具鏈的任務放 雲端 Mac,避免本機休眠斷連(與選 Flash/Pro 正交但關鍵)。
- 訂閱 changelog:Gemini API + Google AI 部落格;設日曆提醒 7 月中下旬檢查是否 GA。
- Pro GA 當日流程:讀 model card → 跑內部 golden set → 對比 Flash 成本與品質 → 10% 灰度。
- 兩週複盤:記錄 token 量、任務成功率、人工介入次數——用數據決定 Pro 是否值得 10× 單價。
11. FAQ
Gemini 3.5 Pro 發布了嗎?
截至 2026 年 7 月 13 日,尚未公開 GA。Google 在 5 月 19 日 I/O 宣布 Pro 內部使用中並計畫次月推出;目前處於推遲階段,企業客戶可在 Vertex AI 預覽中有限試用。多家媒體報導目標日為 7 月 17 日,但 Google 未官方確認該日期。
Gemini 3.5 Pro 和 Flash 有什麼區別?
Flash 已全面可用,主打高速 Agent 與編碼,1M 上下文,定價 $1.50/$9 每百萬 token。Pro 預期定位為家族旗艦:媒體報導 2M 上下文、Deep Think 深度推理、更高 API 單價與更強多步任務能力;具體規格以 GA model card 為準。
Gemini 3.5 Pro 價格是多少?
Google 未公布 Pro 正式定價。 媒體常見猜測為 API 約 $15/$60 每百萬 input/output token,約為 Flash 的 10 倍;Deep Think 可能綁定約 $250/月的 Ultra 檔訂閱。在官方定價頁更新前,請只將 Flash 價格寫入合約與預算。
現在應該用哪個 Gemini 模型?
生產環境優先 Gemini 3.5 Flash(gemini-3.5-flash)。需要 Google 生態內 Agent、Antigravity、Enterprise 編排時,Flash 已是 2026 年預設。僅在預覽資格內評估 Pro,且與生產流量隔離。
2M 上下文值得等 Pro 嗎?
取決於任務:若 1M + RAG/分塊已滿足 80% 需求,不必等。若你 routinely 需要單次呼叫灌入整倉且重試成本極高,可在 Pro GA 後做 A/B。別在 GA 前把架構押在傳聞的 2M 上。
12. 總結
Gemini 3.5 Pro 是什麼?——Google 在 2026 年 I/O 公布的 3.5 家族旗艦,定位最難推理與最長上下文,但截至 7 月中旬仍未公開 GA。功能與價格方面,Flash 有完整 model card;Pro 的 2M、Deep Think、$15/$60 等關鍵數字仍屬「可信報導、未官宣」。發布時間從「6 月」滑向「7 月中下旬」,應以 API changelog 為準,而非媒體倒數計時。
務實路徑只有一條:今天用 Flash 把 Agent 跑起來,明天用 Pro 做增量升級。 模型戰爭每週都有新聞,工程團隊該固定的是執行環境、模型 ID 抽象與成本儀表板——其餘,等 Sundar 下次在部落格上簽字那天再改預設配置也不遲。
等 Pro 的日子裡,用 Flash + 雲端 Mac 先把 Agent 跑穩
Gemini 3.5 Flash 調 API 做編碼 Agent,執行層放在雲端 Mac mini M4 上——xcodebuild、Git worktree、SSH 長會話不斷連。Pro GA 後只需改環境變數裡的 model ID,流水線不用推倒重來;Apple Silicon 統一記憶體 適合 1M 級長上下文,macOS 隔離 降低 Agent 誤操作本機檔案的風險。
先用日租跑通 Antigravity / Gemini API 冒煙任務,再升月租常駐。 kvmboot 雲端 Mac mini M4 是「Flash 今天、Pro 明天」的務實起點—— 立即了解套餐方案 ,把等待 GA 的時間變成可交付的 Agent 流水線。