限时优惠

Gemini API 价格是多少?2026 Token 成本与免费额度完整解析

AI 工程 Gemini API · 价格 · Token
2026-08-19 约 14 分钟阅读

结论先行:不要找一个「Gemini API 价格」数字——要按计费轨道选:免费额度、付费 Standard、Batch/Flex,还是 Vertex。

分水岭不是模型昵称,而是输出 + thinking tokens占比。3.1 Pro Preview 无免费层;3.7 Flash 导入价到 2026-12-31。Gemini API 价格 · Token 成本 · 免费额度

先行结论

  1. 2026 年不要问「Gemini API 价格是多少」的单一数字,要问你走哪条计费轨道:免费额度、按量 Standard、Batch/Flex,还是 Vertex / Enterprise。
  2. Token 成本的分水岭不是模型名字,而是输出 + thinking tokens占比;输入再便宜,Agent 循环一开就会把账单翻倍。
  3. 官方表上 Flash / Flash-Lite(以及 2.5 Pro)仍标 Free of charge,但 RPM/RPD 很低,且免费层数据可用于改进产品;Gemini 3.1 Pro Preview 免费层不可用
  4. 2026 年底前 gemini-3.7-flash / gemini-3.6-flash导入价(约 $0.75 / $3.75 / 百万 token),2027-01-01 起翻倍——把导入价当永久价会预算穿仓。
  5. 重试、合盖断线、MCP 空转会把同一轮对话再买一遍。Token 标价不是分水岭,计费轨道 × 输出占比 × 执行环境才是。
模型能力不是分水岭,计费轨道与 thinking token 占比才是分水岭。
开发者对照 Gemini API 价格表与 Token 账单看板
先锁定计费轨道,再对照每百万 token 标价;免费额度只覆盖试跑,生产要按输出与思考 token 做预算。

0. 先行结论

截至 2026-08-19,Gemini Developer API 官方定价页给出的不是一张「套餐月费」,而是按模型、按 Standard / Batch / Flex / Priority、按百万 token 的矩阵。Google AI Studio 网页试玩在多数地区仍免费;真正要上线的 Gemini API 价格取决于:你有没有绑支付账号、模型是否还在免费层、输入输出比、thinking 开没开、有没有走 Batch,以及有没有把同一份 system prompt 做成上下文缓存。

给需要立刻拍板的人一组对照(美元 / 百万 token,Standard 付费层,不含税;以官方表为准):

  • 最便宜文本线:Gemini 2.5 Flash-Lite 约 $0.10 输入 / $0.40 输出,免费层仍标 Free of charge(低速率)。
  • 均衡生产:2.5 Flash 约 $0.30 / $2.50;3.5 Flash-Lite 约 $0.30 / $2.50
  • 新一代 Flash:3 Flash Preview 约 $0.50 / $3.00;3.5 Flash 约 $1.50 / $9.00
  • 导入价窗口(至 2026-12-31):3.7 Flash 与 3.6 Flash 约 $0.75 / $3.75,2027-01-01 起约 $1.50 / $7.50
  • 旗舰推理:3.1 Pro Preview 无免费层;≤200k 约 $2 / $12,>200k 约 $4 / $18。2.5 Pro ≤200k 约 $1.25 / $10

同一页还写死:输出价格包含 thinking tokens。Agent 多跳、开思考预算,账单跟「聊天补全」完全不是一个量级。模型怎么接 Function Calling 与 MCP,见 2026 AI Agent 技术栈

1. 问题为什么存在:为什么「Gemini API 价格」搜不到一个数字

旧方案失败得很具体:团队把 Google AI Studio 的「能聊」当成生产免费额度,把 Pro 的标价当成 Flash 的标价,把输入单价当成整段会话单价。结果 PoC 一周 $0,上线第一周因为工具循环把输出 token打满,再叠加合盖笔记本导致的超时重试,账单比报价单高一个数量级。

2026 年定价页把复杂度又加了三层:同一模型拆 Standard / Batch / Flex / Priority;Flash 线有导入价到期日;Pro 线按 prompt 是否超过 200k 分段。搜索引擎上的「一口价」文章往往停在 2025 或 2026 年 5 月,会漏掉 3.7 Flash 导入价和「思考 token 算输出」这两条会改预算的规则。

  • 免费层不是 $0 无限:有 RPM/RPD,且 Used to improve our products = Yes
  • Batch / Flex 大约半价,但不保证秒级延迟;Priority 更贵,换高峰接入。
  • Grounding with Google Search:Gemini 3.x 约每月 5,000 次共享免费,超出约 $14 / 千次;2.5 线仍常见 1,500 RPD 后 $35 / 千次。
  • 音频、图像、视频输入往往另价;TTS / Imagen / Veo / Lyria 是另一张表,不要和文本 Agent 混算。

如果你同时在比 Claude 订阅与 API,计费哲学完全不同:Claude Code 常是席位月费,Gemini Developer API 默认是 Token 成本。对照见 Claude Code 2026 价格与套餐

2. 五条计费轨道:先分类,再谈免费额度

2.1 轨道 A:Google AI Studio 网页

面向试 Prompt、看多模态。多数地区 Studio 界面使用仍标免费。它解决「模型能不能干活」,不解决生产 RPM、SLA、数据不用于训练。不要把 Studio 截图当财务模型。

2.2 轨道 B:Gemini API 免费层(API Key,未开计费或免费配额内)

AI Studio 拿 Key 即可打 API。官方表对大量 Flash 型号在 Standard 列出 Free of charge,但对 3.1 Pro Preview 写 Not available。免费层速率见 rate limits,会被项目、型号、地区改写。适合验证 JSON、试 Function Calling,不适合 7×24 Agent。

2.3 轨道 C:Gemini API 付费层(绑 Cloud Billing)

更高限额、上下文缓存、Batch/Flex/Priority、付费层通常 用你的内容改进产品(官方表 Paid = No)。这是大多数独立产品和小团队的生产轨道。计费说明见 Billing

2.4 轨道 D:Vertex AI / Gemini Enterprise

企业 IAM、VPC-SC、采购合同、区域与承诺用量。单价可能与 Developer API 不同,账单进 GCP 项目。Agent 平台另有导入价表,见 Vertex / Agent Platform pricing。选型看合规,不看「哪张海报更便宜 3 美分」。

2.5 轨道 E:隐性成本——执行环境

API 账单不含 Mac、不含常驻 MCP、不含你因为超时重试买下的第二轮 thinking。iOS 构建、钥匙串、worktree 若跑在合盖笔记本上,失败重试 = 再买一遍输出 token。这是标价表看不见的 Token 成本。MCP 应落在哪台机器,见 MCP 部署:Cloud Mac vs VPS vs 本地

3. 核心对比:同一套五维表头

下面把「免费额度、按量、批处理、企业、执行环境」放进同一张表,避免只比输入单价。

层/方案入口执行能力上下文成本权限边界
API 免费层API Key / Studio能推理、能发 functionCall;限额内对话 + 你塞进的文件;数据可能用于改进产品标价 $0,真正上限是 RPM/RPDGoogle 项目配额;勿放生产密钥到客户端
付费 Standard绑 Billing 的 Developer API生产 RPM;缓存、Grounding 付费项付费层通常不用于训练按百万 token;思考计入输出密钥在后端;模型只见参数
Batch / Flex异步/可延迟队列同一模型,延迟换折扣(常见约 50%)适合离线评测、夜批输入输出约半价;无免费 Batch 的型号居多仍走你的 GCP 账单
Priority高峰优先同一模型,更贵换稳定性线上尖峰 Agent例如 3.7 Flash 导入价约 $1.35 / $6.75适合 SLO 比单价更重要的入口
Vertex / 企业GCP 控制台 / 采购区域、私网、合同支持企业数据边界合同价 + 承诺用量,可能≠ Developer 表IAM / VPC-SC
执行环境(隐性)本机 / VPS / Cloud Mac跑 MCP、测试、签名,不推理仓库、证书、常驻进程日租机器 + 因重试浪费的 token进程用户与网络出口

读表时记住非对称结论:换一个更便宜的 Flash 解决不了「每次超时重试都把 thinking 再买一遍」;上 Vertex 也解决不了 Schema 分叉。单价只是轨道上的刻度。

3.1 2026-08 官方 Standard 标价速查(美元 / 百万 token)

整理自 ai.google.dev 定价页。Google 随时调价;导入价有截止日期。

型号免费层输入/输出付费输入付费输出(含 thinking)备注
2.5 Flash-Lite$0.10$0.40高流量最便宜文本线
2.5 Flash$0.30$2.50音频输入 $1.00
2.5 Pro$1.25 / $2.50(>200k)$10 / $15长上下文分段
3 Flash Preview$0.50$3.00音频输入 $1.00
3.1 Flash-Lite$0.25$1.50音频输入 $0.50
3.5 Flash-Lite$0.30$2.50高流量 agentic
3.5 Flash$1.50$9.00缓存读 $0.15
3.6 / 3.7 Flash$0.75→$1.50$3.75→$7.50导入价至 2026-12-31
3.1 Pro Preview$2 / $4(>200k)$12 / $18旗舰;不要拿免费 Key 硬打

4. 场景怎么选

层/方案入口执行能力上下文成本权限边界
个人学 API / 写 demoStudio + 免费 API KeyFlash-Lite / 3 Flash,关思考单个 notebook目标 $0;超限就停只用测试密钥
周更产品、日活低付费 Standard + 2.5/3.5 Flash-Lite工具循环要设步数上限短上下文 + 缓存 system先按输出 3~8× 输入做预算后端代理,禁止浏览器直出 Key
代码 Agent / MCP 多跳付费 Standard;可混 3.7 Flash 导入价thinking 开小预算;失败熔断仓库摘要,勿整仓塞进 prompt输出+思考才是大头MCP 常驻,避免重试买 token
夜间评测、数据清洗Batch / Flex同一型号半价,可等小时级大批次文件用折扣换 SLA队列与重试策略写死
要合规、区域、私网Vertex / 企业合同型号对齐但账单不同VPC 内数据采购价,不是博客表IAM 最小权限
iOS / Xcode 同机 AgentCloud Mac 上 Host + MCPGemini 只负责推理证书与 DerivedData 在 Mac机器日租 + API 按量钥匙串不出机器

5. 推荐组合

组合 A|个人 PoC
  Studio 免费试模型 → 免费层 2.5 Flash-Lite
  → 关掉 thinking / 低预算
  → 不要绑生产数据

组合 B|独立产品(推荐)
  付费 Developer API + 3.5 Flash-Lite 或 2.5 Flash 做默认
  → system prompt 开上下文缓存
  → Agent 循环:最大步数、按 tool 计费告警
  → 夜间评测走 Batch(约 50% off)
  → 3.1 Pro 只给「难单」路由,禁止默认 Pro

组合 C|2026 Q4 导入价窗口
  编码/Agent 主路径试 3.7 Flash Standard($0.75/$3.75)
  → 财务模型必须按 2027-01-01 翻倍做压力测试
  → 能 Batch 的离线活不要占 Standard

组合 D|Apple 交付
  Gemini 只做推理 API
  → MCP / xcodebuild / 签名在 Cloud Mac
  → 合盖重试会直接打在 Token 成本上

6. 常见误区

  • 误区 1:把 Studio 免费当成 API 免费无限。免费层有速率,超了就是 429,不是「再便宜一点」。
  • 误区 2:只用输入单价做报价。输出含 thinking,Agent 会话经常输出 ≥ 输入。
  • 误区 3:3.1 Pro Preview 还能用免费 Key 硬打。官方 Standard 免费列是 Not available。
  • 误区 4:把 3.7 Flash 导入价写进年度合同却不写到期日。
  • 误区 5:浏览器暴露 API Key。被刷的是你的付费层,不是 Google 的免费额度。
  • 误区 6:失败重试无上限。合盖、Wi‑Fi 切换、MCP 超时会把同一 thinking 再买一遍。
  • 误区 7:Grounding、图像、TTS 和文本 token 混在一张预算表里不加行。

7. 落地步骤(7 步)

  1. 打开官方定价页,记下你要用的 model id、是否有免费层、是否有导入价到期日。
  2. 在 AI Studio 用同一条生产 Prompt 打一次,看 input / output / thinking token,不要用「你好」估算。
  3. 给 Agent 设最大 tool 步数与每日美元 cap;429 时降级到 Flash-Lite,而不是死磕 Pro。
  4. 重复前缀(系统提示、工具 JSON Schema)做成上下文缓存,核对缓存读单价。
  5. 能离线的评测、回填走 Batch/Flex;线上才用 Standard 或 Priority。
  6. 把 MCP 与构建迁到不会合盖的机器,消灭「超时重试税」。部署决策见 MCP 与 Cloud Mac
  7. 做一张内部价目:默认型号、升级型号、2027-01-01 压力价;每月对照账单 diff,而不是对照博客。

8. FAQ

Gemini API 现在还有免费额度吗?

有,但是按型号。大量 Flash / Flash-Lite 以及 2.5 Pro 在官方表 Standard 仍标 Free of charge;3.1 Pro Preview 免费层不可用。免费等于低 RPM/RPD + 数据可能用于改进产品,不等于生产配额。

Token 怎么计费?thinking 算哪一边?

按百万 token 的输入、输出分别计价。官方写明输出价格包括 thinking tokens。上下文缓存是第三列:缓存写入/存储按小时,命中读取远低于普通输入。

Batch 一定比 Standard 便宜吗?

付费 Batch/Flex 常见约半价,但许多型号的 Batch 没有免费层。用延迟和不保证实时,换折扣。不适合用户盯着看的对话。

Developer API 和 Vertex 哪家便宜?

标价表不能直接横比。Vertex 卖的是区域、IAM、合同与发票路径。初创用 Developer API 更快;有合规清单时走 Vertex,别为了三美分拆两套工具定义。

为什么还要把 Agent 放到云 Mac?

Gemini 只卖推理。你的 MCP、Xcode、钥匙串若在合盖笔记本上失败,付费层会为每次重试再收思考 token。常驻 Cloud Mac 降的是无效 Token 成本,不是模型单价。

9. 总结

2026 年的 Gemini API 价格不是一个套餐数字,而是一张会过期的矩阵:免费额度管试跑,付费 Standard 管线上,Batch 管离线,Priority 管尖峰,Vertex 管合规。真正决定月账单的,是输出与 thinking 占比,以及你有没有为失败重试付第二遍钱。

落地顺序固定:官方表锁定型号 → 用生产 Prompt 量 token → 默认 Flash-Lite/Flash → Pro 只作路由 → 缓存与 Batch 降输入 → 执行环境常驻以免重试税。标价会变;计费轨道和熔断策略不该每周重写。

让 Token 花在推理上,而不是花在合盖重试上

Gemini 的 Token 成本已经按百万级透明标价;真正不可控的是 Agent 在笔记本上超时、MCP 掉线、Xcode 签失败后再走一轮 thinking。独占 M4 云 Mac 把 Host、仓库与 MCP 放在同一条常驻路径上,待机功耗低、SSH 固定,适合先日租验收再锁月租——让付费层的每一百万输出 token 都打在有效步骤上。

了解选型对比 · 查看套餐 · 立即了解开通