DeepSeek V4 Flash 涨价前:6 个真正省钱的杠杆(2026)

DeepSeek 官方已挂涨价预告。缓存命中比未命中便宜 50 倍,22 家托管商缓存读价差 28 倍,最顺手的 slug 买到的是旧版 0423。6 个可执行杠杆加盈亏平衡算法。

DeepSeek V4 Flash 涨价前:6 个真正省钱的杠杆(2026)

涨价通知说了什么,今天又花你多少钱

公告:             DeepSeek API「显著」涨价,2026-08-06 发布,无幅度,无日期
V4 Flash 现价:    $0.14/M 输入(缓存未命中)、$0.0028/M 输入(缓存命中)、$0.28/M 输出
缓存命中 vs 未命中:输入便宜 50 倍
托管商缓存价差:   22 家从 $0.0028 到 $0.078 每 1M(28 倍)
最低输入价:       DeepInfra $0.09/M,但是 fp4 量化
盈亏平衡:         约 77% 缓存命中率决定走官方还是走第三方
slug 陷阱:        deepseek/deepseek-v4-flash 是旧的 0423 版
思考模式:         默认开启,effort 为 high,按输出价计费

2026 年 8 月 6 日,DeepSeek 在定价页挂出通知:计划近期上调 DeepSeek API 服务的整体价格,预计涨幅显著,请据此规划用量。没有数字,没有日期。r/DeepSeek 上那条讨论帖一天内跑到 115 条评论,最高赞的回应只有两个词。

有用的反应不是连夜迁移。大多数在跑 V4 Flash 的人本来就在多付好几倍的钱,而原因跟价目表毫无关系。这里面有六个原因今天就能改,赶在新价格落地之前。

哪些杠杆真的能压账单?

缓存行为和托管商选择,按这个顺序。价目表反而最不重要。 下面按每个杠杆能撬动多少钱排序,依据是本文后面的价格数据。

杠杆影响量级改造成本
缓存命中 vs 未命中输入 token 50 倍
托管商缓存读价缓存输入最高 28 倍
思考模式开关砍掉按输出价计费的推理 token
选对模型版本同价换新模型
量化与上下文质量与截断风险
Harness 选择改变每个任务的 token 量

前两项互相纠缠,所以「谁最便宜」没有固定答案。按顺序过一遍。

值得为这件事花一下午吗?

如果你在 V4 Flash 上每月花超过约 $50,值得。低于这个数,做第 3 项和第 5 项就收工。 不是每种负载都撑得起这场审计。

整份清单都值得做的情况:

  • 你在跑 agent,也就是长的多轮会话,同一段上下文要重放几十次。50 倍的缓存差距正是在这里滚成真金白银。
  • 你的月度支出大到一旦涨 2 到 4 倍,就得找人谈预算。
  • 你在用第三方托管商,而且从没查过它的缓存读价、量化精度和上下文上限。

不值得做的情况:

  • 你发的是零散的一次性请求,没有共享前缀。没有缓存可命中,本文大部分内容对你不适用,挑输入价最低的然后继续干活。
  • 你还在做原型。模型选择会在账单变重要之前先变。
  • 你的流量已经走 DeepSeek 官方、前缀稳定、思考模式按任务调过。该做的你都做了。

停止规则: 如果你修好了 slug(第 3 节)、查过托管商的缓存读那一列(第 2 节),没发现异常,那么剩下几项的收益只有个位数百分比。回去发版吧。

1. 为什么缓存命中比未命中便宜 50 倍?

因为 DeepSeek 给缓存输入定价 $0.0028/M,而未命中是 $0.14/M。 这是整个页面上最大的一个倍数,把其他所有你能调的东西都盖过去了。

项目V4 FlashV4 Pro
输入,缓存命中$0.0028$0.003625
输入,缓存未命中$0.14$0.435
输出$0.28$0.87
上下文1M1M
最大输出384K384K

缓存默认开启,不需要改代码,但它的匹配规则比你在别家见过的前缀缓存更严,值得弄明白。

DeepSeek 存的是缓存前缀单元(cache prefix unit),一个请求只有在完整匹配其中某个单元时才算命中。单元会在请求边界(你的输入结尾和模型输出结尾)落盘,也会在长输入内部按固定 token 间隔落盘,还会在系统发现多个请求共享某段前缀时落盘。

实际后果常常让人踩空。追加是有效的:先发 A + B,再发 A + B + C,第二个请求命中第一个留下的单元。分叉则无效,至少不是立刻有效。先发 A + B,再发 A + C,第二个请求是完全未命中,哪怕两者都共享 A。真正发生的是系统注意到了共享的 A 并把它落成独立单元,于是第三个请求 A + D 才终于命中。

这意味着扇出模式,也就是一份长文档配许多个不同问题,前两次调用要付全价,从第三次才开始省。如果你用两个请求测缓存然后断定它不管用,原因就在这。

顺序仍然重要,因为一个永远不重复的单元永远不会被复用。

最常打断前缀的四件事,按出现频率粗排:

  • system prompt 里的时间戳或日期。 写「Today is 2026-08-06T14:22:11Z」会让每一次调用都缓存失效。模型如果确实需要日期,把它放进最后一条 user 消息。
  • 由 dict 或 set 生成的工具列表。 迭代顺序每次运行都不同,JSON 输出被打乱,前缀永远对不上。给列表排序。
  • 检索结果被放在指令前面。 RAG 输出按设计每次都不一样,它该放在稳定的 system prompt 之后,而不是之前。
  • 为了链路追踪注入的 session ID 或 request ID。 有用,而且挪到末尾不花一分钱。

修法在每种情况下都一样:稳定的内容在前,易变的内容在后。验证是否生效要读 usage 对象,别靠看排版猜。DeepSeek 会返回 prompt_cache_hit_tokensprompt_cache_miss_tokens,两者的比值就是本文每个决策都依赖的那个数,测它只需要一个请求。

r/DeepSeek 上有位用户贴了七天账单:约 24M 输入、6M 输出,总共 $1.87,他把账单降了约 70% 归功于上下文缓存。拿它当基准之前值得先算一遍:按官方价,24M 输入加 6M 输出在 70% 命中率下大约是 $2.74,要压到 $1.87 需要命中率接近 96%。要么缓存表现比他报的更好,要么有一部分流量跑在别处。那条帖子下面最高赞的回复也值得读,来自一个每天烧 200M 输入 token 的人,他说 24M「差得还远」。两个数字都是真的,只是在描述两种活。

2. DeepSeek V4 Flash 哪家托管商最便宜?

跟你的缓存命中率匹配的那家,而答案在 77% 附近翻转。 OpenRouter 为 0731 版列出 22 家托管商,输入价和输出价都聚在 2 倍上下的区间里,缓存读不是。

托管商输入输出缓存读vs 官方量化上下文
DeepInfra$0.09$0.18$0.0186.4xfp41M
GMICloud$0.126$0.252$0.02529.0xfp81M
BaseTen$0.13$0.26$0.02810xfp81M
DeepSeek 官方$0.14$0.28$0.00281xfp81M
Fireworks$0.14$0.28$0.02810x未知1M
Cloudflare$0.14$0.28$0.02810xfp8384K
AkashML$0.14$0.28$0.027.1xfp8131K
Parasail$0.14$0.28$0.0725xfp81M
Io Net$0.16$0.32$0.07828xfp8262K
Phala$0.20$0.40$0.0725x未知1M

把 Parasail 那一行再看一遍。输入价跟走官方一样,输出价一样,缓存读贵 25 倍。没有任何一种负载适合选它。Phala、Io Net、Morph 同理。Reddit 上有帖子把这个现象归到 OpenRouter 头上,说是零数据留存路由导致的;更完整的解释来自一条回复:这些不过是别的公司在托管同一份权重,既没有 DeepSeek 的缓存基础设施,也没有它的利润空间。

真正在输入价上压过官方的是 DeepInfra、GMICloud 和 BaseTen。它们能不能帮你省钱,取决于你的流量形状:

输出占输入的比例盈亏平衡缓存命中率(DeepInfra vs 官方)
0%77%
5%84%
10%92%
20%+永远不会;DeepInfra 一直更便宜

低于平衡点选便宜的托管商,高于平衡点走官方。拿那条 Reddit 帖子的 24M/6M 形状在 70% 命中率下算:DeepInfra $2.03,官方 $2.74,Parasail $3.86。零缓存时:DeepInfra $3.24,官方 $5.04。

3. 你买到的真是你以为的那个模型吗?

多半不是,如果你用了那个最顺眼的 slug。 在 OpenRouter 上,deepseek/deepseek-v4-flash 指向的是 DeepSeek V4 Flash 0423。当前版本挂在 deepseek/deepseek-v4-flash-0731,是另一条独立条目。

deepseek/deepseek-v4-flash          -> V4 Flash 0423   (older)
deepseek/deepseek-v4-flash-0731     -> V4 Flash 0731   (current)
~deepseek/deepseek-v4-flash-latest  -> tracks current

0731 这一版正是 r/LocalLLaMA 和 r/DeepSeek 讨论帖里一直在夸的那个,说它修好了长 agent 会话里的上下文腐化。因为一个默认 slug 就用差不多的价钱买到四月版本,是这份清单里最便宜的一处错误。

4. fp4 和 131K 上下文实际让你付出什么?

发票上看不见的质量,以及会话跑到一半才发现的截断。 那些输入便宜的托管商卖的并不是同一件东西。

DeepInfra 的 $0.09 输入价是全表最低,跑的是 fp4 量化。Sail Research、Ambient、Ionstream 也是。其余大多数跑 fp8,还有几家报「未知」。DeepSeek 自家端点报的是 fp8。没有任何一家公布过自己 fp4 与 fp8 服务这个模型的基准差值,所以把 fp4 端点上 36% 的输入折扣当成一笔代价未测量的交易,而不是白捡的便宜。

上下文窗口的差异比价格差异还大:

  • AkashML:131K
  • CoreWeave、AtlasCloud、Io Net:262K
  • Cloudflare:384K
  • DeepSeek 官方及其余大多数:1M

如果你按输入价挑了托管商,然后 agent 悄无声息地在 131K 处开始截断,来源就在这里。模型支持 1M,卡住你的是托管商。

5. 该关掉思考模式吗?

有时候该,而且它默认开着、effort 是 high,多数人没意识到这点。 DeepSeek 文档写得很直白:思考模式默认启用,默认 effort 为 high。那些推理 token 按输出价计费。

# OpenAI format: disable thinking
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[...],
    extra_body={"thinking": {"type": "disabled"}},
)

Anthropic 格式下的等价写法是 {"reasoning": {"effort": "none"}}。effort 档位在不同模型上的映射不同:在 V4 Flash 上,low 映射到 low,xhigh 向下映射到 high;而 V4 Pro 会把 low 向上映射到 high。

全局翻开关之前有两件事值得知道。思考模式会忽略 temperaturetop_ppresence_penaltyfrequency_penalty,而且设了也不报错,所以一份看起来调过参的配置可能什么都没做。另外关掉它会牺牲多步任务上的准确率,而多步任务恰恰是人们用 V4 Flash 干的事。抽取、分类、格式化时关掉;重构和调试时留着。

我们是通过网关而不是直连 DeepSeek 端点测的这项,数字被网关侧的参数处理搅浑了,所以这里不公布倍数。用你自己的 prompt、在你自己的流量上,读 usage 对象里的 completion_tokens_details.reasoning_tokens,前后各测一次。

在攒这份数据的期间有个好用的经验法则:如果一个人类审阅者不看推导过程就会接受这个答案,那么思考大概没挣回它的成本。从发票里抽字段、给工单打标签、重排 JSON、写 commit message,都落在这一档。而任何答错了代价高且错得不明显的活,涵盖了大部分重构和几乎所有调试,就是推理 token 值回票价的地方。按任务类型路由,别去翻一个全局开关,等新价格落地后再复查一遍,因为这些 token 计的正是输出价。

6. Harness 会改变账单吗?

比价目表改得更多,因为它决定每个任务花多少 token。 r/DeepSeek 上没人对选哪个达成一致,但所有人都同意这件事重要。

反复出现的名字是 OpenCode、Reasonix、Pi 和 Codex。一位用户说 Reasonix 靠更好的缓存命中把一个长任务「从 20 分钟压到 5 分钟」;另一位说它跟 Pi 或 OpenCode 比「还是有点毛病,也不好扩展」。第三位提到 DeepSeek 原生支持 Codex 之后就彻底不需要代理了。没有共识选项,诚实的结论是:harness 开销真实存在、量级不小,而且高度取决于你的负载。

真正值得内化的是机制:每一个 agent 回合都会重放整段对话。保持前缀稳定的 harness 命中缓存,重放部分按 $0.0028/M 计费;每回合重建上下文的 harness,同样这批 token 要按 $0.14/M 付。这就是第 1 节那个 50 倍,一次会话里被应用几十遍。

价格翻倍后这套算法会怎样?

走官方几乎在所有场景都不再占优,因为第三方托管商没有理由跟涨。 OpenRouter 上那些托管商是在自己的硬件上跑开源权重。DeepSeek 调价只动 DeepSeek 自己的端点,动不了它们,于是本文所有的盈亏平衡点会同时挪位。

倍数还没人知道,所以这里把同一份 24M 输入 / 6M 输出、70% 缓存命中率的负载放进三种情景,DeepInfra 保持不变作为第三方参照:

情景DeepSeek 官方DeepInfra更便宜的
今天$2.74$2.03DeepInfra
官方价 2x$5.47$2.03DeepInfra
官方价 4x$10.94$2.03DeepInfra

这份负载今天就已经偏向第三方了,因为 24M 输入配 6M 输出算是输出偏重,足以让更便宜的输出价占主导。只有当输出只占输入的一小部分时,缓存优势才救得了走官方这条路。就算在那里地面也在动:纯输入流量下,对 DeepInfra 的盈亏平衡命中率今天约是 77%,如果官方价翻倍会升到约 94%。在这条线以上,你仍然想要官方端点那个 $0.0028 的缓存读;在这条线以下,你是在补贴一个自己没命中的缓存。

实操结论:如果你的缓存命中率确实高于 90% 且输出量很小,涨价会疼但走官方可能仍然占优。其他人都该在数字落地之前准备好一条测试过的第二路径。

什么时候干脆换模型?

等新价格落地、算下来不划算的时候,不是现在。 讨论帖里全是提前站队 GPT-5.6 Luna 的人,它确实是被点名最多的替代选项,也确实带视觉支持。把它放进候选名单是合理的,今天就拍板则是糟糕的决定,因为 DeepSeek 一个数字都还没公布。

关于这事能挪多远,有个参照:一位评论者回忆 DeepSeek 在四五月间降价约 75%,后来把降价转成永久,据此推断「显著」可能意味着大致回到旧价位,也就是涨 4 倍。那是一个人根据公开历史做的推断,不是内部消息。按区间做准备,别按某个数字。

现在就值得做的:

  • 把你真实的缓存命中率打点出来。上面每个决策都依赖它,而几乎没人在测。
  • 让第二家供应商在开关后面跑通,这样切换是改配置而不是立项。
  • 新价格公布后重算盈亏平衡表。77% 这个数字只对今天的价格成立。

团队该怎么落这套东西?

托管商和思考策略集中决定,然后别再让个人各挑各的。 在团队里,故障模式不是一个错误选择,而是六个没人看得见的不同选择。

有三件事值得一次性达成一致:

  • 把模型字符串钉在共享配置里,而不是各个服务里。 当四个服务各自硬编码自己的 slug 时,0423 与 0731 的问题会被乘以四。一个常量、一个位置,版本升级就变成一次评审。
  • 按负载类别设思考策略,不是按开发者。 抽取和分类类服务关掉思考。agent 和重构类服务留着。把规则写下来,因为默认是开的,而没人会注意到一个默认值。
  • 按服务而不是按组织统计缓存命中率。 聚合数字会盖住那个在 system prompt 里塞了时间戳、每次调用都在付 50 倍的服务。把 prompt_cache_hit_tokensprompt_cache_miss_tokens 跟现有请求指标一起打点,异常值立刻现形。

这件事做错的账单后果分布不均。一个配错的高流量服务可能比团队其他所有服务加起来还贵,而且从外面看跟配对了的一模一样。

怎么把第二条路径养着?

走一个两种协议都说的入口,这样兜底就只是换个模型字符串。 DeepSeek 同时提供 OpenAI 格式端点和位于 https://api.deepseek.com/anthropic 的 Anthropic 格式端点,这也是 V4 Flash 能不加转接层就塞进 Claude 形态工具链的原因。

如果你不想在局势明朗之前给每家供应商各开一个账号,ofox 上 V4 Flash 的价格与走官方相同,同样是 $0.14 / $0.28 / $0.0028,两种协议共用一把 key。它不比 DeepSeek 官方便宜,任何告诉你网关能在源站自家模型上比源站更便宜的人都在卖东西。它买到的是一次集成,新价格来了之后可以在后面换模型。

那些悄悄花钱的常见错误

错误代价修法
system prompt 里有易变前缀每个请求都是缓存未命中,50 倍把时间戳和检索结果挪到末尾
只按输入价挑托管商缓存输入最高 28 倍查缓存读那一列
deepseek/deepseek-v4-flash拿到的是 0423 版改用 -0731 的 slug
默认哪里都是 1M 上下文在 131K 处静默截断查托管商的上下文那一列
抽取任务还开着思考推理 token 按输出价计费按任务类型关闭
在思考模式下调 temperature什么都不会发生,也不报错思考模式下这些参数被忽略
相信那份高峰时段表围着一份未公布的政策做规划截至 2026-08-06 官方页上没有

值得考虑的替代方案

  • DeepSeek 官方。 缓存读比次优托管商便宜 6.4 倍,fp8,完整 1M 上下文。最适合缓存密集的 agent 活。
  • DeepInfra、GMICloud、BaseTen。 输入是真便宜。最适合一次性、低缓存的流量。先查量化精度。
  • ofox。 与官方同价,两种协议一把 key,想要一条可切换路径时有用。不是折扣。
  • GPT-5.6 Luna。 r/DeepSeek 点名最多的替代选项,带视觉支持。等 DeepSeek 公布数字后再比。
  • 自托管。 权重是开放的。r/LocalLLaMA 上有人用 2 张 RTX 3090 加一台二手服务器跑 0731 版。只有在你已经拥有硬件时才划算。

至于完全不花钱的路径,我们单独写过 DeepSeek V4 Flash free: 4 zero-cost paths。完整价目表拆解(含 V4 Pro)见 DeepSeek V4 API pricing guide,Pro 上的钱到底花在哪见 cache miss and thinking costs。如果涨价后 Flash 不再是性价比之选,Flash 对决 Gemini 3.6 Flash 覆盖了最接近的预算型对手,如何降低 AI API 成本 则把上面这些缓存技巧做了推广。

来源

常见问题

DeepSeek API 要涨价了吗?
是。截至 2026 年 8 月 6 日,官方定价页挂着这条通知:「We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.」没给幅度,也没给生效日期。当前价格仍然有效:V4 Flash 缓存未命中 $0.14/M 输入,缓存命中 $0.0028/M,输出 $0.28/M。
DeepSeek 是不是要按高峰时段收 2 倍?
截至 2026-08-06,官方定价页上没有这条。Reddit 上一条高赞评论引用了一份高峰/低谷政策,称北京时间 9:00-12:00 和 14:00-18:00 按 2 倍计价,但这段文字并不在线上的定价页上,页面上只有那条整体涨价通知。在 DeepSeek 正式公布之前,把这份高峰时段表当成未经证实的信息。
跑 DeepSeek V4 Flash 哪家托管商最便宜?
完全取决于你的缓存命中率。DeepInfra 输入报 $0.09/M,低于 DeepSeek 自家的 $0.14/M,但它的缓存读要 $0.018/M,而 DeepSeek 只要 $0.0028/M。缓存命中率大约低于 77% 时第三方托管商更划算,高于这条线走官方更划算。如果你的输出量超过输入量的约 20%,那么无论命中率如何,便宜的托管商都更划算。
为什么别家的缓存读贵这么多?
第三方托管商是在自己的基础设施上跑开源权重,既没有 DeepSeek 那套缓存栈,也没有它的定价补贴。OpenRouter 上 0731 版列出的 22 家托管商里,缓存读从每 1M $0.0028 到 $0.078,相差 28 倍,而输入价和输出价彼此只在 2 倍上下的区间内。
用 deepseek/deepseek-v4-flash 拿到的是最新模型吗?
不是。在 OpenRouter 上这个 slug 指向的是 DeepSeek V4 Flash 0423。当前版本是另一条独立条目 deepseek/deepseek-v4-flash-0731。挑那个看起来最顺眼的 slug,等于在价格差不多的前提下悄悄买了一个旧模型。
关掉思考模式能省钱吗?
能省下按输出价计费的那部分推理 token。按 DeepSeek 文档,思考模式默认开启,effort 默认是 high。OpenAI 格式下用 thinking type disabled 关闭,Anthropic 格式下用 reasoning effort none。多步任务上质量会掉,所以这是按任务决定的开关,不是全局开关。
涨价之后 GPT-5.6 Luna 会比 DeepSeek 便宜吗?
在 DeepSeek 公布数字之前无法判断。Luna 是 r/DeepSeek 涨价帖里被点名最多的替代选项,部分原因是它支持视觉。任何在新价格落地之前写出来的对比都是猜测。