限时优惠

DeepSeek V4-Flash API 价格:2026 峰谷 Token 成本完整解析

AI 工程 DeepSeek API · 价格 · Token
2026-08-22 约 14 分钟阅读

结论先行:2026-08-16 起 DeepSeek 按 UTC 峰谷 × cache-hit/miss 计价,谷时恰好半价。

分水岭不是模型 ID,而是输出 token 占比 × 请求 UTC 窗口。谷时 out $0.66/M,峰时 $1.32/M;cache-hit 谷时 in 仅 $0.007/M。DeepSeek API 价格 · Token 成本 · 峰谷定价

先行结论

  1. 2026-08-16 16:00 UTC 起,DeepSeek 不再卖「一口价」:deepseek-v4-flash 按 UTC 峰谷分档,谷时单价恰好是峰时一半。
  2. 谷时(非 01:00–04:00、06:00–10:00 UTC)cache-miss 输入约 $0.22/M、输出 $0.66/M;峰时翻倍为 $0.44 / $1.32。cache-hit 输入谷时仅 $0.007/M
  3. 8 月 16 日前旧价是统一 $0.14 输入 / $0.28 输出 / $0.0028 cache-hit——把旧表写进 2026 Q4 预算会系统性低估谷时、高估峰时。
  4. Token 成本的分水岭不是「Flash 还是 Pro」,而是输出 token 占比 × 请求落在哪个 UTC 窗口;thinking 默认开启且与 non-thinking 同价,Agent 多跳在峰时会把账单放大 3 倍。
  5. 1M 上下文 + OpenAI 兼容端点 https://api.deepseek.com 让迁移容易,但峰谷调度与 cache 命中率才是可控杠杆;合盖重试、MCP 空转会把同一轮输出在峰时再买一遍。
模型 ID 不是分水岭,UTC 峰谷档位与输出 token 占比才是分水岭。
开发者对照 DeepSeek V4-Flash API 峰谷价目表与 Token 账单
先锁定 UTC 峰谷窗口与 cache 命中率,再对照每百万 token 标价;输出占比决定月账单的 60% 以上。

0. 先行结论

截至 2026-08-22,DeepSeek 官方定价页在 2026-08-16 16:00 UTC 生效的新价目把 deepseek-v4-flash(检查点 DeepSeek-V4-Flash-0731,7 月 31 日起可用)拆成峰时 / 谷时 × cache-hit / cache-miss × 输入 / 输出 六格矩阵。API 基址 https://api.deepseek.com,OpenAI 兼容;1M token 上下文;thinking 默认开启,thinking 与 non-thinking 同一价目表。

给需要立刻拍板的人一组对照(美元 / 百万 token,以官方表为准):

  • 谷时 deepseek-v4-flash:cache-hit 输入 $0.007,cache-miss 输入 $0.22,输出 $0.66
  • 峰时 deepseek-v4-flash:cache-hit $0.014,cache-miss 输入 $0.44,输出 $1.32(恰好 2× 谷时)。
  • 谷时 deepseek-v4-pro:cache-hit $0.022,cache-miss 输入 $0.66,输出 $1.98;峰时各档再 ×2。
  • 旧统一价(8 月 16 日前):输入 $0.14,输出 $0.28,cache-hit $0.0028——已无参考价值,除非你的账单周期横跨调价日。

UTC 峰时窗口固定为 01:00–04:0006:00–10:00;其余为谷时。同一模型在谷时跑批处理、在峰时跑在线 Agent,月账单可能差 2 倍——但若输出 token 占 70% 以上,调峰只能省 35% 左右,因为输出在谷时仍是输入 cache-miss 的 3 倍。横向对比 Gemini 按轨道计费,见 Gemini API 2026 价格与免费额度;Agent 栈与 MCP 见 2026 AI Agent 技术栈

1. 问题为什么存在:为什么「DeepSeek API 价格」搜不到一个数字

旧方案失败得很具体:团队把 8 月 15 日博客里的 $0.14 / $0.28 写进财务模型,8 月 17 日上线后同一流量在 UTC 07:00 触发峰时,输出 $1.32/M 直接把 PoC 预算打穿。另一批人只看谷时 $0.22 输入,忽略 Agent 循环里输出 token 常 ≥ 输入 3 倍,且 thinking 默认开、与正文同价,多跳工具调用在峰时窗口会把「便宜 Flash」变成「贵 Pro 体验、Flash 账单」。还有团队不做 cache,每次把 80k system prompt 当 cache-miss 输入,峰时 $0.44/M × 0.08M = 每轮 $0.035 仅输入——一天 1 万次就是 $350,而 cache-hit 谷时同样前缀只要 $0.00056/次。

2026 年 8 月的复杂度不在模型数量,而在时间维度:DeepSeek 把供需高峰映射到 UTC 固定窗口,谷时恰好半价。这与 Gemini 的 Batch/Flex 半价、Claude 的席位月费完全不同。搜索引擎上的「DeepSeek 多少钱」文章大多停在统一价时代,会漏掉峰谷分界、cache-hit 第三列、以及 V4-Flash-0731 检查点。若你同时在比 Claude 订阅,见 Claude Code 2026 价格与套餐

  • 峰时不是「稍贵一点」,而是整表 ×2;跨窗口的一条 Agent 会话可能前半段谷时、后半段峰时,账单按请求时间戳分段。
  • cache-hit 与 cache-miss 价差在谷时约 31 倍($0.007 vs $0.22),在峰时约 31 倍($0.014 vs $0.44)——不做前缀缓存等于自愿交「重复输入税」。
  • 1M 上下文是能力上限,不是免费额度;长上下文 + cache-miss 在峰时输入 $0.44/M,塞满 1M 单次理论输入成本 $440(实际还有输出)。
  • thinking 默认开启且同价,关闭 thinking 并不降价;预算应按「带 thinking 的输出量」估算。
  • MCP 重试、合盖断线、xcodebuild 失败会把同一轮对话在峰时再跑一遍——API 标价不含执行环境,见 MCP 部署:Cloud Mac vs VPS vs 本地

2. 四条计费维度:先分类,再谈单价

2.1 维度 A:峰时 vs 谷时(UTC)

官方写死峰时 01:00–04:00 UTC06:00–10:00 UTC。北京时间峰时约为 09:00–12:00 与 14:00–18:00(夏令时不变)。谷时费率 = 峰时 ÷ 2。批处理、评测、离线摘要应锚定谷时 cron;在线客服若覆盖欧美早高峰,不可避免撞 UTC 06:00–10:00 峰窗。

2.2 维度 B:cache-hit vs cache-miss 输入

重复前缀(system prompt、工具 JSON Schema、RAG 静态块)命中 cache 后,输入按 cache-hit 计价,Flash 谷时 $0.007/M。未命中或前缀变更则走 cache-miss 全价。DeepSeek 的 cache 是成本杠杆,不是可选优化。

2.3 维度 C:输入 vs 输出 token

输出在谷时已是 cache-miss 输入的 3 倍($0.66 vs $0.22);峰时输出 $1.32 是 cache-hit 输入 $0.014 的 94 倍。Agent 多跳、长 CoT、工具结果回灌都会膨胀输出——输出占比是月账单的主旋钮,峰谷只是乘数。

2.4 维度 D:Flash vs Pro 与执行环境

deepseek-v4-pro 谷时 cache-miss 输入 $0.66、输出 $1.98,约为 Flash 的 3 倍;仅当 Flash 搞不定质量时才值得升级。API 账单不含 Mac、MCP 常驻、签名失败重试;iOS 构建 Agent 若跑在合盖笔记本上,峰时重试 = 再付 $1.32/M 输出。

3. 核心对比:同一套五维表头

下面把峰时、谷时、旧统一价、Pro 档、执行环境放进同一张表,避免只比输入单价。

层/方案入口执行能力上下文成本权限边界
谷时 V4-Flashhttps://api.deepseek.com + API Key1M 上下文;thinking 默认同价cache-hit / miss 分档in $0.007–0.22, out $0.66 /MOpenAI 兼容;Key 在后端
峰时 V4-Flash同上,请求 UTC 戳在峰窗同上,延迟与队列可能升同上in $0.014–0.44, out $1.32 /M同一 Key;按时间分段计费
旧统一价(已废止)8/16 前账单无峰谷无分档 cachein $0.14, out $0.28, hit $0.0028勿写入新预算
谷时 V4-Promodel=deepseek-v4-pro更强推理,同 1M 窗cache 分档in $0.022–0.66, out $1.98 /M难单路由,勿默认
cache 策略重复前缀稳定降输入 misssystem + Schema 固定hit 可降输入 97%+前缀变更 = 重新 miss
执行环境(隐性)本机 / VPS / Cloud MacMCP、测试、签名仓库、证书峰时重试浪费 out token常驻 Host 降无效输出

读表时的非对称结论:把请求从峰时挪到谷时只能省 50%,把输出 token 占比从 70% 压到 40% 能省的可比或更多;两者要同时做。上 Pro 解决不了 Schema 分叉,调峰也解决不了无 cache 的 80k system prompt。

3.1 2026-08 官方价目速查(美元 / 百万 token)

整理自 api-docs.deepseek.com 定价页。2026-08-16 16:00 UTC 起生效;DeepSeek 保留调价权利。

模型时段cache-hit 输入cache-miss 输入输出备注
deepseek-v4-flash谷时$0.007$0.22$0.66检查点 0731;thinking 同价
deepseek-v4-flash峰时$0.014$0.44$1.32UTC 01–04、06–10 点
deepseek-v4-pro谷时$0.022$0.66$1.98峰时 ×2
deepseek-v4-pro峰时$0.044$1.32$3.96仅难单路由
(旧价至 8/16)统一$0.0028$0.14$0.28已废止,勿引用

4. 场景怎么选

层/方案入口执行能力上下文成本权限边界
个人试 API / demohttps://api.deepseek.com + Flash短对话,关多跳单轮 <8k锚定谷时;目标 <$5/月测试 Key,后端代理
日更产品、亚欧美混合Flash + cache system限制 tool 步数短上下文 + 命中 cache按 out 3× in 预算;峰谷各半监控 UTC 分布
代码 Agent / MCP 多跳Flash 默认;Pro 路由 5% 难单thinking 同价;失败熔断仓库摘要,勿整仓 prompt输出+重试是大头MCP 常驻 Cloud Mac
夜间批处理、评测Flash 谷时 cron1M 窗可分批大批 JSONL谷时 out $0.66 省 50%队列与重试写死
长文档 RAGFlash + 高 cache 命中静态块进 cache动态 query 短miss 输入可控前缀版本化
iOS / Xcode 同机 AgentCloud Mac Host + MCPDeepSeek 只推理证书在 Mac机器日租 + 避峰时重试钥匙串不出机器

5. 推荐组合

组合 A|个人 PoC
  deepseek-v4-flash + 谷时试跑
  → 短 prompt,关 Agent 多跳
  → 对照官方价目,勿用旧 $0.14/$0.28

组合 B|独立产品(推荐)
  Flash 默认 + system/Schema cache
  → 批处理与评测 cron 在 UTC 谷时
  → Agent:最大步数、峰时降级或排队
  → Pro 只接「Flash 连续失败」路由

组合 C|跨模型栈
  DeepSeek Flash 做高性价比推理
  → 与 Gemini / Claude 按场景分流(见 Agent 栈文)
  → 统一 JSON Schema,避免三套 tool 定义

组合 D|Apple 交付
  DeepSeek 只做推理 API
  → MCP / xcodebuild / 签名在 Cloud Mac
  → 合盖重试若在峰时,输出 $1.32/M 再买一遍

6. 常见误区

  • 误区 1:仍用 8 月 16 日前 $0.14/$0.28 报价。新价峰谷分档,旧表已废止。
  • 误区 2:只盯谷时输入 $0.22,忽略输出 $0.66(谷时)或峰时 $1.32。Agent 账单大头在输出。
  • 误区 3:以为关 thinking 能省钱。官方同价,thinking 默认开。
  • 误区 4:不做 cache,每轮 50k system 当 miss。hit 谷时 $0.007/M 差 31 倍。
  • 误区 5:把 UTC 峰窗当「可忽略」——北京下午 14:00–18:00 恰是 UTC 06:00–10:00 峰段。
  • 误区 6:失败重试无上限。MCP 超时在峰时再跑,输出 token 双倍。
  • 误区 7:默认 Pro。Flash 谷时 out $0.66 已是很多场景够用,Pro 谷时 out $1.98 是 3 倍。

7. 落地步骤(7 步)

  1. 打开 官方定价页,确认生效日 2026-08-16 16:00 UTC 与峰时窗口;记录 deepseek-v4-flash 六格价。
  2. 同一条生产 Prompt 在谷时、峰时各打一次,记录 input/output、cache hit/miss,勿用「你好」估算。
  3. 把 system prompt 与工具 JSON Schema 做成稳定前缀,开启 cache;监控 hit 率,目标 >80% 输入 token 走 hit。
  4. 给 Agent 设最大 tool 步数与每日美元 cap;峰时 429 或成本告警时排队到谷时或降级短答。
  5. 批处理、评测、embedding 回填 cron 在 UTC 谷时;在线入口接受峰时溢价或限流。
  6. 把 MCP 与构建迁到不会合盖的机器,消灭峰时重试税。见 MCP 与 Cloud Mac
  7. 做内部价目:谷时/峰时两列、默认 Flash、Pro 路由阈值;每月对照账单按 UTC 小时分布 diff,而不是对照旧博客。

8. FAQ

DeepSeek V4-Flash API 现在多少钱?

取决于 UTC 峰谷与 cache。谷时 cache-miss 输入 $0.22/M、输出 $0.66/M;峰时翻倍。cache-hit 输入谷时 $0.007/M。8 月 16 日前统一价已废止。

峰时和谷时怎么划分?

UTC 01:00–04:0006:00–10:00 为峰时,费率为谷时 2 倍;其余为谷时。按请求到达 API 的 UTC 时间戳计费,不是用户本地时区。

thinking 和 non-thinking 价格一样吗?

一样。V4-Flash 默认 thinking 开启,同一价目表;预算应按含 thinking 的输出 token 估算。

和 Gemini API 比哪个便宜?

不能横比单一数字。DeepSeek 卖峰谷 × cache 分档;Gemini 卖轨道 × 模型矩阵。高 cache 命中 + 谷时批处理 DeepSeek 输入可极低;高输出 Agent 在峰时要按 $1.32/M 算。见 Gemini API 2026 价格

model id 写什么?

deepseek-v4-flash(检查点 DeepSeek-V4-Flash-0731)。Pro 为 deepseek-v4-pro。基址 https://api.deepseek.com,OpenAI SDK 改 base_url 即可。

为什么还要 Cloud Mac?

DeepSeek 只卖推理。MCP、Xcode、钥匙串在笔记本上失败,峰时重试会再付 $1.32/M 输出。常驻 Cloud Mac 降的是无效输出 token,不是模型单价。

9. 总结

2026 年 8 月后的 DeepSeek V4-Flash API 价格不是一张静态表,而是UTC 峰谷 × cache 命中 × 输入输出比 的乘积。谷时半价能省一半,但若输出占 70%,调峰 alone 最多省 35%;压输出、提 cache、避峰时重试三者要一起做。

落地顺序固定:官方表锁定六格价 → 谷峰各测一次生产 Prompt → system/Schema cache → 批处理锚谷时 → Agent 步数上限与峰时熔断 → 执行环境常驻。旧 $0.14/$0.28 进垃圾箱;输出 token 占比与 UTC 窗口写进每一版财务模型。

让 Token 花在推理上,而不是花在峰时重试上

DeepSeek 的 Token 成本已经按峰谷与 cache 透明标价;真正不可控的是 Agent 在笔记本上超时、MCP 掉线、Xcode 签失败后再走一轮输出——若撞 UTC 峰窗,输出 $1.32/M 再买一遍。独占 M4 云 Mac 把 Host、仓库与 MCP 放在同一条常驻路径上,待机功耗低、SSH 固定,适合先日租验收再锁月租——让每一百万输出 token 都打在有效步骤上。

了解选型对比 · 查看套餐 · 立即了解开通