先行结论
- 2026-08-16 16:00 UTC 起,DeepSeek 不再卖「一口价」:deepseek-v4-flash 按 UTC 峰谷分档,谷时单价恰好是峰时一半。
- 谷时(非 01:00–04:00、06:00–10:00 UTC)cache-miss 输入约 $0.22/M、输出 $0.66/M;峰时翻倍为 $0.44 / $1.32。cache-hit 输入谷时仅 $0.007/M。
- 8 月 16 日前旧价是统一 $0.14 输入 / $0.28 输出 / $0.0028 cache-hit——把旧表写进 2026 Q4 预算会系统性低估谷时、高估峰时。
- Token 成本的分水岭不是「Flash 还是 Pro」,而是输出 token 占比 × 请求落在哪个 UTC 窗口;thinking 默认开启且与 non-thinking 同价,Agent 多跳在峰时会把账单放大 3 倍。
- 1M 上下文 + OpenAI 兼容端点
https://api.deepseek.com让迁移容易,但峰谷调度与 cache 命中率才是可控杠杆;合盖重试、MCP 空转会把同一轮输出在峰时再买一遍。
模型 ID 不是分水岭,UTC 峰谷档位与输出 token 占比才是分水岭。
0. 先行结论
截至 2026-08-22,DeepSeek 官方定价页在 2026-08-16 16:00 UTC 生效的新价目把 deepseek-v4-flash(检查点 DeepSeek-V4-Flash-0731,7 月 31 日起可用)拆成峰时 / 谷时 × cache-hit / cache-miss × 输入 / 输出 六格矩阵。API 基址 https://api.deepseek.com,OpenAI 兼容;1M token 上下文;thinking 默认开启,thinking 与 non-thinking 同一价目表。
给需要立刻拍板的人一组对照(美元 / 百万 token,以官方表为准):
- 谷时 deepseek-v4-flash:cache-hit 输入 $0.007,cache-miss 输入 $0.22,输出 $0.66。
- 峰时 deepseek-v4-flash:cache-hit $0.014,cache-miss 输入 $0.44,输出 $1.32(恰好 2× 谷时)。
- 谷时 deepseek-v4-pro:cache-hit $0.022,cache-miss 输入 $0.66,输出 $1.98;峰时各档再 ×2。
- 旧统一价(8 月 16 日前):输入 $0.14,输出 $0.28,cache-hit $0.0028——已无参考价值,除非你的账单周期横跨调价日。
UTC 峰时窗口固定为 01:00–04:00 与 06:00–10:00;其余为谷时。同一模型在谷时跑批处理、在峰时跑在线 Agent,月账单可能差 2 倍——但若输出 token 占 70% 以上,调峰只能省 35% 左右,因为输出在谷时仍是输入 cache-miss 的 3 倍。横向对比 Gemini 按轨道计费,见 Gemini API 2026 价格与免费额度;Agent 栈与 MCP 见 2026 AI Agent 技术栈。
1. 问题为什么存在:为什么「DeepSeek API 价格」搜不到一个数字
旧方案失败得很具体:团队把 8 月 15 日博客里的 $0.14 / $0.28 写进财务模型,8 月 17 日上线后同一流量在 UTC 07:00 触发峰时,输出 $1.32/M 直接把 PoC 预算打穿。另一批人只看谷时 $0.22 输入,忽略 Agent 循环里输出 token 常 ≥ 输入 3 倍,且 thinking 默认开、与正文同价,多跳工具调用在峰时窗口会把「便宜 Flash」变成「贵 Pro 体验、Flash 账单」。还有团队不做 cache,每次把 80k system prompt 当 cache-miss 输入,峰时 $0.44/M × 0.08M = 每轮 $0.035 仅输入——一天 1 万次就是 $350,而 cache-hit 谷时同样前缀只要 $0.00056/次。
2026 年 8 月的复杂度不在模型数量,而在时间维度:DeepSeek 把供需高峰映射到 UTC 固定窗口,谷时恰好半价。这与 Gemini 的 Batch/Flex 半价、Claude 的席位月费完全不同。搜索引擎上的「DeepSeek 多少钱」文章大多停在统一价时代,会漏掉峰谷分界、cache-hit 第三列、以及 V4-Flash-0731 检查点。若你同时在比 Claude 订阅,见 Claude Code 2026 价格与套餐。
- 峰时不是「稍贵一点」,而是整表 ×2;跨窗口的一条 Agent 会话可能前半段谷时、后半段峰时,账单按请求时间戳分段。
- cache-hit 与 cache-miss 价差在谷时约 31 倍($0.007 vs $0.22),在峰时约 31 倍($0.014 vs $0.44)——不做前缀缓存等于自愿交「重复输入税」。
- 1M 上下文是能力上限,不是免费额度;长上下文 + cache-miss 在峰时输入 $0.44/M,塞满 1M 单次理论输入成本 $440(实际还有输出)。
- thinking 默认开启且同价,关闭 thinking 并不降价;预算应按「带 thinking 的输出量」估算。
- MCP 重试、合盖断线、xcodebuild 失败会把同一轮对话在峰时再跑一遍——API 标价不含执行环境,见 MCP 部署:Cloud Mac vs VPS vs 本地。
2. 四条计费维度:先分类,再谈单价
2.1 维度 A:峰时 vs 谷时(UTC)
官方写死峰时 01:00–04:00 UTC 与 06:00–10:00 UTC。北京时间峰时约为 09:00–12:00 与 14:00–18:00(夏令时不变)。谷时费率 = 峰时 ÷ 2。批处理、评测、离线摘要应锚定谷时 cron;在线客服若覆盖欧美早高峰,不可避免撞 UTC 06:00–10:00 峰窗。
2.2 维度 B:cache-hit vs cache-miss 输入
重复前缀(system prompt、工具 JSON Schema、RAG 静态块)命中 cache 后,输入按 cache-hit 计价,Flash 谷时 $0.007/M。未命中或前缀变更则走 cache-miss 全价。DeepSeek 的 cache 是成本杠杆,不是可选优化。
2.3 维度 C:输入 vs 输出 token
输出在谷时已是 cache-miss 输入的 3 倍($0.66 vs $0.22);峰时输出 $1.32 是 cache-hit 输入 $0.014 的 94 倍。Agent 多跳、长 CoT、工具结果回灌都会膨胀输出——输出占比是月账单的主旋钮,峰谷只是乘数。
2.4 维度 D:Flash vs Pro 与执行环境
deepseek-v4-pro 谷时 cache-miss 输入 $0.66、输出 $1.98,约为 Flash 的 3 倍;仅当 Flash 搞不定质量时才值得升级。API 账单不含 Mac、MCP 常驻、签名失败重试;iOS 构建 Agent 若跑在合盖笔记本上,峰时重试 = 再付 $1.32/M 输出。
3. 核心对比:同一套五维表头
下面把峰时、谷时、旧统一价、Pro 档、执行环境放进同一张表,避免只比输入单价。
| 层/方案 | 入口 | 执行能力 | 上下文 | 成本 | 权限边界 |
|---|---|---|---|---|---|
| 谷时 V4-Flash | https://api.deepseek.com + API Key | 1M 上下文;thinking 默认同价 | cache-hit / miss 分档 | in $0.007–0.22, out $0.66 /M | OpenAI 兼容;Key 在后端 |
| 峰时 V4-Flash | 同上,请求 UTC 戳在峰窗 | 同上,延迟与队列可能升 | 同上 | in $0.014–0.44, out $1.32 /M | 同一 Key;按时间分段计费 |
| 旧统一价(已废止) | 8/16 前账单 | 无峰谷 | 无分档 cache | in $0.14, out $0.28, hit $0.0028 | 勿写入新预算 |
| 谷时 V4-Pro | model=deepseek-v4-pro | 更强推理,同 1M 窗 | cache 分档 | in $0.022–0.66, out $1.98 /M | 难单路由,勿默认 |
| cache 策略 | 重复前缀稳定 | 降输入 miss | system + Schema 固定 | hit 可降输入 97%+ | 前缀变更 = 重新 miss |
| 执行环境(隐性) | 本机 / VPS / Cloud Mac | MCP、测试、签名 | 仓库、证书 | 峰时重试浪费 out token | 常驻 Host 降无效输出 |
读表时的非对称结论:把请求从峰时挪到谷时只能省 50%,把输出 token 占比从 70% 压到 40% 能省的可比或更多;两者要同时做。上 Pro 解决不了 Schema 分叉,调峰也解决不了无 cache 的 80k system prompt。
3.1 2026-08 官方价目速查(美元 / 百万 token)
整理自 api-docs.deepseek.com 定价页。2026-08-16 16:00 UTC 起生效;DeepSeek 保留调价权利。
| 模型 | 时段 | cache-hit 输入 | cache-miss 输入 | 输出 | 备注 |
|---|---|---|---|---|---|
| deepseek-v4-flash | 谷时 | $0.007 | $0.22 | $0.66 | 检查点 0731;thinking 同价 |
| deepseek-v4-flash | 峰时 | $0.014 | $0.44 | $1.32 | UTC 01–04、06–10 点 |
| deepseek-v4-pro | 谷时 | $0.022 | $0.66 | $1.98 | 峰时 ×2 |
| deepseek-v4-pro | 峰时 | $0.044 | $1.32 | $3.96 | 仅难单路由 |
| (旧价至 8/16) | 统一 | $0.0028 | $0.14 | $0.28 | 已废止,勿引用 |
4. 场景怎么选
| 层/方案 | 入口 | 执行能力 | 上下文 | 成本 | 权限边界 |
|---|---|---|---|---|---|
| 个人试 API / demo | https://api.deepseek.com + Flash | 短对话,关多跳 | 单轮 <8k | 锚定谷时;目标 <$5/月 | 测试 Key,后端代理 |
| 日更产品、亚欧美混合 | Flash + cache system | 限制 tool 步数 | 短上下文 + 命中 cache | 按 out 3× in 预算;峰谷各半 | 监控 UTC 分布 |
| 代码 Agent / MCP 多跳 | Flash 默认;Pro 路由 5% 难单 | thinking 同价;失败熔断 | 仓库摘要,勿整仓 prompt | 输出+重试是大头 | MCP 常驻 Cloud Mac |
| 夜间批处理、评测 | Flash 谷时 cron | 1M 窗可分批 | 大批 JSONL | 谷时 out $0.66 省 50% | 队列与重试写死 |
| 长文档 RAG | Flash + 高 cache 命中 | 静态块进 cache | 动态 query 短 | miss 输入可控 | 前缀版本化 |
| iOS / Xcode 同机 Agent | Cloud Mac Host + MCP | DeepSeek 只推理 | 证书在 Mac | 机器日租 + 避峰时重试 | 钥匙串不出机器 |
5. 推荐组合
组合 A|个人 PoC deepseek-v4-flash + 谷时试跑 → 短 prompt,关 Agent 多跳 → 对照官方价目,勿用旧 $0.14/$0.28 组合 B|独立产品(推荐) Flash 默认 + system/Schema cache → 批处理与评测 cron 在 UTC 谷时 → Agent:最大步数、峰时降级或排队 → Pro 只接「Flash 连续失败」路由 组合 C|跨模型栈 DeepSeek Flash 做高性价比推理 → 与 Gemini / Claude 按场景分流(见 Agent 栈文) → 统一 JSON Schema,避免三套 tool 定义 组合 D|Apple 交付 DeepSeek 只做推理 API → MCP / xcodebuild / 签名在 Cloud Mac → 合盖重试若在峰时,输出 $1.32/M 再买一遍
6. 常见误区
- 误区 1:仍用 8 月 16 日前 $0.14/$0.28 报价。新价峰谷分档,旧表已废止。
- 误区 2:只盯谷时输入 $0.22,忽略输出 $0.66(谷时)或峰时 $1.32。Agent 账单大头在输出。
- 误区 3:以为关 thinking 能省钱。官方同价,thinking 默认开。
- 误区 4:不做 cache,每轮 50k system 当 miss。hit 谷时 $0.007/M 差 31 倍。
- 误区 5:把 UTC 峰窗当「可忽略」——北京下午 14:00–18:00 恰是 UTC 06:00–10:00 峰段。
- 误区 6:失败重试无上限。MCP 超时在峰时再跑,输出 token 双倍。
- 误区 7:默认 Pro。Flash 谷时 out $0.66 已是很多场景够用,Pro 谷时 out $1.98 是 3 倍。
7. 落地步骤(7 步)
- 打开 官方定价页,确认生效日 2026-08-16 16:00 UTC 与峰时窗口;记录
deepseek-v4-flash六格价。 - 用同一条生产 Prompt 在谷时、峰时各打一次,记录 input/output、cache hit/miss,勿用「你好」估算。
- 把 system prompt 与工具 JSON Schema 做成稳定前缀,开启 cache;监控 hit 率,目标 >80% 输入 token 走 hit。
- 给 Agent 设最大 tool 步数与每日美元 cap;峰时 429 或成本告警时排队到谷时或降级短答。
- 批处理、评测、embedding 回填 cron 在 UTC 谷时;在线入口接受峰时溢价或限流。
- 把 MCP 与构建迁到不会合盖的机器,消灭峰时重试税。见 MCP 与 Cloud Mac。
- 做内部价目:谷时/峰时两列、默认 Flash、Pro 路由阈值;每月对照账单按 UTC 小时分布 diff,而不是对照旧博客。
8. FAQ
DeepSeek V4-Flash API 现在多少钱?
取决于 UTC 峰谷与 cache。谷时 cache-miss 输入 $0.22/M、输出 $0.66/M;峰时翻倍。cache-hit 输入谷时 $0.007/M。8 月 16 日前统一价已废止。
峰时和谷时怎么划分?
UTC 01:00–04:00 与 06:00–10:00 为峰时,费率为谷时 2 倍;其余为谷时。按请求到达 API 的 UTC 时间戳计费,不是用户本地时区。
thinking 和 non-thinking 价格一样吗?
一样。V4-Flash 默认 thinking 开启,同一价目表;预算应按含 thinking 的输出 token 估算。
和 Gemini API 比哪个便宜?
不能横比单一数字。DeepSeek 卖峰谷 × cache 分档;Gemini 卖轨道 × 模型矩阵。高 cache 命中 + 谷时批处理 DeepSeek 输入可极低;高输出 Agent 在峰时要按 $1.32/M 算。见 Gemini API 2026 价格。
model id 写什么?
deepseek-v4-flash(检查点 DeepSeek-V4-Flash-0731)。Pro 为 deepseek-v4-pro。基址 https://api.deepseek.com,OpenAI SDK 改 base_url 即可。
为什么还要 Cloud Mac?
DeepSeek 只卖推理。MCP、Xcode、钥匙串在笔记本上失败,峰时重试会再付 $1.32/M 输出。常驻 Cloud Mac 降的是无效输出 token,不是模型单价。
9. 总结
2026 年 8 月后的 DeepSeek V4-Flash API 价格不是一张静态表,而是UTC 峰谷 × cache 命中 × 输入输出比 的乘积。谷时半价能省一半,但若输出占 70%,调峰 alone 最多省 35%;压输出、提 cache、避峰时重试三者要一起做。
落地顺序固定:官方表锁定六格价 → 谷峰各测一次生产 Prompt → system/Schema cache → 批处理锚谷时 → Agent 步数上限与峰时熔断 → 执行环境常驻。旧 $0.14/$0.28 进垃圾箱;输出 token 占比与 UTC 窗口写进每一版财务模型。