先行结论
- 2026 年不要问「Gemini API 价格是多少」的单一数字,要问你走哪条计费轨道:免费额度、按量 Standard、Batch/Flex,还是 Vertex / Enterprise。
- Token 成本的分水岭不是模型名字,而是输出 + thinking tokens占比;输入再便宜,Agent 循环一开就会把账单翻倍。
- 官方表上 Flash / Flash-Lite(以及 2.5 Pro)仍标 Free of charge,但 RPM/RPD 很低,且免费层数据可用于改进产品;Gemini 3.1 Pro Preview 免费层不可用。
- 2026 年底前
gemini-3.7-flash/gemini-3.6-flash有导入价(约 $0.75 / $3.75 / 百万 token),2027-01-01 起翻倍——把导入价当永久价会预算穿仓。 - 重试、合盖断线、MCP 空转会把同一轮对话再买一遍。Token 标价不是分水岭,计费轨道 × 输出占比 × 执行环境才是。
模型能力不是分水岭,计费轨道与 thinking token 占比才是分水岭。
0. 先行结论
截至 2026-08-19,Gemini Developer API 官方定价页给出的不是一张「套餐月费」,而是按模型、按 Standard / Batch / Flex / Priority、按百万 token 的矩阵。Google AI Studio 网页试玩在多数地区仍免费;真正要上线的 Gemini API 价格取决于:你有没有绑支付账号、模型是否还在免费层、输入输出比、thinking 开没开、有没有走 Batch,以及有没有把同一份 system prompt 做成上下文缓存。
给需要立刻拍板的人一组对照(美元 / 百万 token,Standard 付费层,不含税;以官方表为准):
- 最便宜文本线:Gemini 2.5 Flash-Lite 约 $0.10 输入 / $0.40 输出,免费层仍标 Free of charge(低速率)。
- 均衡生产:2.5 Flash 约 $0.30 / $2.50;3.5 Flash-Lite 约 $0.30 / $2.50。
- 新一代 Flash:3 Flash Preview 约 $0.50 / $3.00;3.5 Flash 约 $1.50 / $9.00。
- 导入价窗口(至 2026-12-31):3.7 Flash 与 3.6 Flash 约 $0.75 / $3.75,2027-01-01 起约 $1.50 / $7.50。
- 旗舰推理:3.1 Pro Preview 无免费层;≤200k 约 $2 / $12,>200k 约 $4 / $18。2.5 Pro ≤200k 约 $1.25 / $10。
同一页还写死:输出价格包含 thinking tokens。Agent 多跳、开思考预算,账单跟「聊天补全」完全不是一个量级。模型怎么接 Function Calling 与 MCP,见 2026 AI Agent 技术栈。
1. 问题为什么存在:为什么「Gemini API 价格」搜不到一个数字
旧方案失败得很具体:团队把 Google AI Studio 的「能聊」当成生产免费额度,把 Pro 的标价当成 Flash 的标价,把输入单价当成整段会话单价。结果 PoC 一周 $0,上线第一周因为工具循环把输出 token打满,再叠加合盖笔记本导致的超时重试,账单比报价单高一个数量级。
2026 年定价页把复杂度又加了三层:同一模型拆 Standard / Batch / Flex / Priority;Flash 线有导入价到期日;Pro 线按 prompt 是否超过 200k 分段。搜索引擎上的「一口价」文章往往停在 2025 或 2026 年 5 月,会漏掉 3.7 Flash 导入价和「思考 token 算输出」这两条会改预算的规则。
- 免费层不是 $0 无限:有 RPM/RPD,且 Used to improve our products = Yes。
- Batch / Flex 大约半价,但不保证秒级延迟;Priority 更贵,换高峰接入。
- Grounding with Google Search:Gemini 3.x 约每月 5,000 次共享免费,超出约 $14 / 千次;2.5 线仍常见 1,500 RPD 后 $35 / 千次。
- 音频、图像、视频输入往往另价;TTS / Imagen / Veo / Lyria 是另一张表,不要和文本 Agent 混算。
如果你同时在比 Claude 订阅与 API,计费哲学完全不同:Claude Code 常是席位月费,Gemini Developer API 默认是 Token 成本。对照见 Claude Code 2026 价格与套餐。
2. 五条计费轨道:先分类,再谈免费额度
2.1 轨道 A:Google AI Studio 网页
面向试 Prompt、看多模态。多数地区 Studio 界面使用仍标免费。它解决「模型能不能干活」,不解决生产 RPM、SLA、数据不用于训练。不要把 Studio 截图当财务模型。
2.2 轨道 B:Gemini API 免费层(API Key,未开计费或免费配额内)
从 AI Studio 拿 Key 即可打 API。官方表对大量 Flash 型号在 Standard 列出 Free of charge,但对 3.1 Pro Preview 写 Not available。免费层速率见 rate limits,会被项目、型号、地区改写。适合验证 JSON、试 Function Calling,不适合 7×24 Agent。
2.3 轨道 C:Gemini API 付费层(绑 Cloud Billing)
更高限额、上下文缓存、Batch/Flex/Priority、付费层通常 不用你的内容改进产品(官方表 Paid = No)。这是大多数独立产品和小团队的生产轨道。计费说明见 Billing。
2.4 轨道 D:Vertex AI / Gemini Enterprise
企业 IAM、VPC-SC、采购合同、区域与承诺用量。单价可能与 Developer API 不同,账单进 GCP 项目。Agent 平台另有导入价表,见 Vertex / Agent Platform pricing。选型看合规,不看「哪张海报更便宜 3 美分」。
2.5 轨道 E:隐性成本——执行环境
API 账单不含 Mac、不含常驻 MCP、不含你因为超时重试买下的第二轮 thinking。iOS 构建、钥匙串、worktree 若跑在合盖笔记本上,失败重试 = 再买一遍输出 token。这是标价表看不见的 Token 成本。MCP 应落在哪台机器,见 MCP 部署:Cloud Mac vs VPS vs 本地。
3. 核心对比:同一套五维表头
下面把「免费额度、按量、批处理、企业、执行环境」放进同一张表,避免只比输入单价。
| 层/方案 | 入口 | 执行能力 | 上下文 | 成本 | 权限边界 |
|---|---|---|---|---|---|
| API 免费层 | API Key / Studio | 能推理、能发 functionCall;限额内 | 对话 + 你塞进的文件;数据可能用于改进产品 | 标价 $0,真正上限是 RPM/RPD | Google 项目配额;勿放生产密钥到客户端 |
| 付费 Standard | 绑 Billing 的 Developer API | 生产 RPM;缓存、Grounding 付费项 | 付费层通常不用于训练 | 按百万 token;思考计入输出 | 密钥在后端;模型只见参数 |
| Batch / Flex | 异步/可延迟队列 | 同一模型,延迟换折扣(常见约 50%) | 适合离线评测、夜批 | 输入输出约半价;无免费 Batch 的型号居多 | 仍走你的 GCP 账单 |
| Priority | 高峰优先 | 同一模型,更贵换稳定性 | 线上尖峰 Agent | 例如 3.7 Flash 导入价约 $1.35 / $6.75 | 适合 SLO 比单价更重要的入口 |
| Vertex / 企业 | GCP 控制台 / 采购 | 区域、私网、合同支持 | 企业数据边界 | 合同价 + 承诺用量,可能≠ Developer 表 | IAM / VPC-SC |
| 执行环境(隐性) | 本机 / VPS / Cloud Mac | 跑 MCP、测试、签名,不推理 | 仓库、证书、常驻进程 | 日租机器 + 因重试浪费的 token | 进程用户与网络出口 |
读表时记住非对称结论:换一个更便宜的 Flash 解决不了「每次超时重试都把 thinking 再买一遍」;上 Vertex 也解决不了 Schema 分叉。单价只是轨道上的刻度。
3.1 2026-08 官方 Standard 标价速查(美元 / 百万 token)
整理自 ai.google.dev 定价页。Google 随时调价;导入价有截止日期。
| 型号 | 免费层输入/输出 | 付费输入 | 付费输出(含 thinking) | 备注 |
|---|---|---|---|---|
| 2.5 Flash-Lite | 有 | $0.10 | $0.40 | 高流量最便宜文本线 |
| 2.5 Flash | 有 | $0.30 | $2.50 | 音频输入 $1.00 |
| 2.5 Pro | 有 | $1.25 / $2.50(>200k) | $10 / $15 | 长上下文分段 |
| 3 Flash Preview | 有 | $0.50 | $3.00 | 音频输入 $1.00 |
| 3.1 Flash-Lite | 有 | $0.25 | $1.50 | 音频输入 $0.50 |
| 3.5 Flash-Lite | 有 | $0.30 | $2.50 | 高流量 agentic |
| 3.5 Flash | 有 | $1.50 | $9.00 | 缓存读 $0.15 |
| 3.6 / 3.7 Flash | 有 | $0.75→$1.50 | $3.75→$7.50 | 导入价至 2026-12-31 |
| 3.1 Pro Preview | 无 | $2 / $4(>200k) | $12 / $18 | 旗舰;不要拿免费 Key 硬打 |
4. 场景怎么选
| 层/方案 | 入口 | 执行能力 | 上下文 | 成本 | 权限边界 |
|---|---|---|---|---|---|
| 个人学 API / 写 demo | Studio + 免费 API Key | Flash-Lite / 3 Flash,关思考 | 单个 notebook | 目标 $0;超限就停 | 只用测试密钥 |
| 周更产品、日活低 | 付费 Standard + 2.5/3.5 Flash-Lite | 工具循环要设步数上限 | 短上下文 + 缓存 system | 先按输出 3~8× 输入做预算 | 后端代理,禁止浏览器直出 Key |
| 代码 Agent / MCP 多跳 | 付费 Standard;可混 3.7 Flash 导入价 | thinking 开小预算;失败熔断 | 仓库摘要,勿整仓塞进 prompt | 输出+思考才是大头 | MCP 常驻,避免重试买 token |
| 夜间评测、数据清洗 | Batch / Flex | 同一型号半价,可等小时级 | 大批次文件 | 用折扣换 SLA | 队列与重试策略写死 |
| 要合规、区域、私网 | Vertex / 企业合同 | 型号对齐但账单不同 | VPC 内数据 | 采购价,不是博客表 | IAM 最小权限 |
| iOS / Xcode 同机 Agent | Cloud Mac 上 Host + MCP | Gemini 只负责推理 | 证书与 DerivedData 在 Mac | 机器日租 + API 按量 | 钥匙串不出机器 |
5. 推荐组合
组合 A|个人 PoC Studio 免费试模型 → 免费层 2.5 Flash-Lite → 关掉 thinking / 低预算 → 不要绑生产数据 组合 B|独立产品(推荐) 付费 Developer API + 3.5 Flash-Lite 或 2.5 Flash 做默认 → system prompt 开上下文缓存 → Agent 循环:最大步数、按 tool 计费告警 → 夜间评测走 Batch(约 50% off) → 3.1 Pro 只给「难单」路由,禁止默认 Pro 组合 C|2026 Q4 导入价窗口 编码/Agent 主路径试 3.7 Flash Standard($0.75/$3.75) → 财务模型必须按 2027-01-01 翻倍做压力测试 → 能 Batch 的离线活不要占 Standard 组合 D|Apple 交付 Gemini 只做推理 API → MCP / xcodebuild / 签名在 Cloud Mac → 合盖重试会直接打在 Token 成本上
6. 常见误区
- 误区 1:把 Studio 免费当成 API 免费无限。免费层有速率,超了就是 429,不是「再便宜一点」。
- 误区 2:只用输入单价做报价。输出含 thinking,Agent 会话经常输出 ≥ 输入。
- 误区 3:3.1 Pro Preview 还能用免费 Key 硬打。官方 Standard 免费列是 Not available。
- 误区 4:把 3.7 Flash 导入价写进年度合同却不写到期日。
- 误区 5:浏览器暴露 API Key。被刷的是你的付费层,不是 Google 的免费额度。
- 误区 6:失败重试无上限。合盖、Wi‑Fi 切换、MCP 超时会把同一 thinking 再买一遍。
- 误区 7:Grounding、图像、TTS 和文本 token 混在一张预算表里不加行。
7. 落地步骤(7 步)
- 打开官方定价页,记下你要用的
model id、是否有免费层、是否有导入价到期日。 - 在 AI Studio 用同一条生产 Prompt 打一次,看 input / output / thinking token,不要用「你好」估算。
- 给 Agent 设最大 tool 步数与每日美元 cap;429 时降级到 Flash-Lite,而不是死磕 Pro。
- 重复前缀(系统提示、工具 JSON Schema)做成上下文缓存,核对缓存读单价。
- 能离线的评测、回填走 Batch/Flex;线上才用 Standard 或 Priority。
- 把 MCP 与构建迁到不会合盖的机器,消灭「超时重试税」。部署决策见 MCP 与 Cloud Mac。
- 做一张内部价目:默认型号、升级型号、2027-01-01 压力价;每月对照账单 diff,而不是对照博客。
8. FAQ
Gemini API 现在还有免费额度吗?
有,但是按型号。大量 Flash / Flash-Lite 以及 2.5 Pro 在官方表 Standard 仍标 Free of charge;3.1 Pro Preview 免费层不可用。免费等于低 RPM/RPD + 数据可能用于改进产品,不等于生产配额。
Token 怎么计费?thinking 算哪一边?
按百万 token 的输入、输出分别计价。官方写明输出价格包括 thinking tokens。上下文缓存是第三列:缓存写入/存储按小时,命中读取远低于普通输入。
Batch 一定比 Standard 便宜吗?
付费 Batch/Flex 常见约半价,但许多型号的 Batch 没有免费层。用延迟和不保证实时,换折扣。不适合用户盯着看的对话。
Developer API 和 Vertex 哪家便宜?
标价表不能直接横比。Vertex 卖的是区域、IAM、合同与发票路径。初创用 Developer API 更快;有合规清单时走 Vertex,别为了三美分拆两套工具定义。
为什么还要把 Agent 放到云 Mac?
Gemini 只卖推理。你的 MCP、Xcode、钥匙串若在合盖笔记本上失败,付费层会为每次重试再收思考 token。常驻 Cloud Mac 降的是无效 Token 成本,不是模型单价。
9. 总结
2026 年的 Gemini API 价格不是一个套餐数字,而是一张会过期的矩阵:免费额度管试跑,付费 Standard 管线上,Batch 管离线,Priority 管尖峰,Vertex 管合规。真正决定月账单的,是输出与 thinking 占比,以及你有没有为失败重试付第二遍钱。
落地顺序固定:官方表锁定型号 → 用生产 Prompt 量 token → 默认 Flash-Lite/Flash → Pro 只作路由 → 缓存与 Batch 降输入 → 执行环境常驻以免重试税。标价会变;计费轨道和熔断策略不该每周重写。