DeepSeek V4 Flash 对决 Gemini 3.6 Flash:分数打平,价格差 10 倍

两者在 Artificial Analysis 上都拿 50 分。DeepSeek 定价 $0.14/M,Gemini 为 $1.50/M,但前者花掉 210M token,后者仅 59M。10 倍差距藏在哪。

DeepSeek V4 Flash 对决 Gemini 3.6 Flash:分数打平,价格差 10 倍

太长不看: DeepSeek V4 Flash 0731 和 Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index v4.1 上都落在 50 分,GPT-5.6 Luna 以 51 分领先一分。它们的标价跨度超过一个数量级。有意思的地方在于:当你不再对比价签,而是开始对比同一套评测工作负载的实际账单时会发生什么。Artificial Analysis 公布了它跑每个模型所付的钱:DeepSeek $72.02,Luna $190.87,Gemini $726.70。输出价签上的差距是 27x,实际账单上的差距是 10.1x,因为 DeepSeek 那次跑烧掉了 210M 输出 token,而 Gemini 只用了 59M。两个数字都在说:如果你的工作负载是文本,就选 DeepSeek;但一旦流水线要发送图像,这两个数字都撑不住。

太长不看:你该选哪个?

你的情形选择原因
纯文本、高并发、成本是硬约束DeepSeek V4 Flash 0731每 token 最便宜,约 10x,还叠加 98% 的缓存折扣
涉及图像、音频、视频或 PDF 的任何场景Gemini 3.6 FlashDeepSeek 0731 只支持文本;没有更便宜的绕行方案
用户能感知到延迟的交互式 UXGemini 3.6 Flash约每秒 220 个输出 token,且在 AA 的测试中三者里 TTFT 最低
长的单次生成(完整文件、长报告)DeepSeek V4 Flash 0731最大输出 384K,Gemini 只有 64K
想在一个模型上同时拥有最高指数分和视觉能力GPT-5.6 Luna指数 51、支持视觉,且在 2026-07-30 降价 80%
可以激进缓存的有界智能体循环DeepSeek V4 Flash 0731缓存读取 $0.0028/M,是三者中最低的,且遥遥领先
你今天就需要可复现的第三方延迟数据Gemini 3.6 Flash 或 GPT-5.6 Luna快照时 AA 没有 0731 版本的速度或 TTFT 数据

有两种理由可以读到这里就停下。如果你的工作负载会发送任何非文本输入,第二行就已经拍板,本文其余部分只是背景。如果你的工作负载是文本,且每月运行量在约 2000 万 token 以下,那么上表中最便宜和最贵选项之间的年度差额,比一天的工程时间还小,所以按延迟来选然后往下走就行。下文所有内容,都是写给账单大到值得争论的场景。

计分板:DeepSeek V4 Flash 0731 与 Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index v4.1 上同为 50 分,GPT-5.6 Luna 为 51 分,而三者每 100 万 token 的标价分别是 $0.14/$0.28、$1.50/$7.50、$0.20/$1.20

7 月 31 日到底改了什么

DeepSeek 在 2026-07-31 发布了 V4 Flash 的新版本,但没有改动模型本身。同样的 284B 总参数、同样的 13B 激活、同样的 1M 上下文、同样的 $0.14 / $0.28 定价。API 模型名也没变,仍是 deepseek-v4-flash,该版本在 DeepSeek 文档中标识为模型版本 DeepSeek-V4-Flash-0731。变的是后训练。

实测效果比「仅后训练」通常给人的印象要大得多。在 Artificial Analysis Intelligence Index v4.1 上,分数从 40 涨到 50。AA 的智能体评测 GDPval-AA v2 从 1189 Elo 升到 1559。Terminal-Bench 2.1 提升 17 个点,达到 79%。AA 还把 0731 版本排在 DeepSeek 自家旗舰 DeepSeek V4 Pro 之上 6 个点,这对任何按「Pro 处理难题」的假设写过路由规则的人来说都是个尴尬的结果。

我们也是这类人之一。我们五月的 DeepSeek V4 Pro 与 Flash 路由指南 得出结论:多文件工作和长智能体循环应交给 Pro。对 0731 版本而言,这个结论不再成立,诚实的说法是:Flash 现在是默认,Pro 是你需要拿出理由才用的例外。

权重上线得比谁说的都快。AA 的发布报道称完整权重预计在「未来几周」推出,多数二手报道至今仍在重复这句话。在 2026-08-01 核实时,Hugging Face 上的 deepseek-ai/DeepSeek-V4-Flash-0731 已经以 48 个 safetensors 分片、MIT 许可、无门槛的形式提供了该模型。如果你在别处读到 0731 只有 API,那大概只在一天左右的时间里是对的。

在数字开始堆叠之前,有一点值得先说清楚。Intelligence Index 是一个滚动排行榜,下文的一切都是 2026-08-01 的快照。请把排序当作耐久的事实,把绝对分数当作某一天的读数。

参数速览对比

DeepSeek V4 Flash 0731Gemini 3.6 FlashGPT-5.6 Luna
ofox 模型 IDdeepseek/deepseek-v4-flashgoogle/gemini-3.6-flashopenai/gpt-5.6-luna
AA Intelligence Index v4.1505051 🏆
发布时间2026-07-31(0731 版本)2026-07-212026-07-09
输入价格(厂商标价)$0.14/M 🏆$1.50/M$0.20/M
输出价格(厂商标价)$0.28/M 🏆$7.50/M$1.20/M
缓存输入$0.0028/M 🏆$0.15/M$0.02/M
上下文窗口1M1M (1,048,576)1M
最大输出384K 🏆64K (65,536)128K
输入模态文本文本、图像、视频、音频、PDF 🏆文本、图像
输出速度(AA)快照时未公布219.6 tok/s 🏆172.1 tok/s
首 token 时间(AA)快照时未公布15.11s 🏆121.89s
开放权重是,Hugging Face 上 MIT 许可 🏆
协议格式OpenAI、Anthropic、ResponsesOpenAI、GeminiOpenAI、Anthropic、Responses

有两行值得再看一眼。最大输出是个真正的分水岭:384K 对 64K,是「一次调用生成长文件」和「构建续写循环」之间的区别。而空着的延迟单元格并不是排版失误。AA 关于 0731 版本的供应商页面在 2026-08-01 快照时没有列出任何速度或首 token 时间数据,所以任何给你报某个每秒 token 数的人,报的都是别的东西。

基准全景:三个模型仅差一分

以下是 0731 版本的 AA 子项分数明细,凡是 AA 公布了四月版本对应数据的,都附上了差值。

评测DeepSeek V4 Flash 0731相较四月版本的变化
Intelligence Index v4.150+10
GDPval-AA v2 (Elo)1559+370
Terminal-Bench 2.179%+17
GPQA Diamond91%+1
AA-LCR66%+3
SciCode50%+5
Humanity’s Last Exam37%+5
τ³-Bench Banking31%+8
CritPt17%+9
AA-Omniscience Index-16+7

Omniscience 这一行是大家会跳过的。AA 报告称,提升来自更少的幻觉,而非知道得更多,准确率持平。对于一个你即将接入生产流量的模型来说,「更少出错」比「知道更多」是更有用的升级,而这恰恰是单一综合分会掩盖的那类东西。

这里有两条来源说明,因为这次发布不止一套数字在流传。

DeepSeek 自己的发布材料报告 Terminal-Bench 2.1 为 82.7、DeepSWE 为 54.4、Cybergym 为 76.7。Artificial Analysis 报告的 Terminal-Bench 2.1 是 79%。两者都可能是对的;测试框架、脚手架和努力档位各不相同,而且快照时并没有第三方复现过 DeepSWE 和 Cybergym 的数字。我们全程采用 AA 的数字,因为在这里的三个模型上,只有它是用同一种方式测出来的。如果你在别处看到有人引用 82.7,那是厂商自己的测试框架,并非矛盾。

另一条:附在多数目录页(包括我们的)上的 DeepSeek V4 Flash 的 LMArena 分数显示为 Overall 1438、排名七十几,更新于 2026-07-12。它比 0731 版本早了十九天,测的是四月的模型。新版本的 Arena 分数需要新的投票,在那之前,任何对比页面上「DeepSeek V4 Flash」旁边的那个数字,描述的都是一个在 AA 上低 10 分的模型。

啰嗦税:为什么价签差距不等于账单差距

对这两个模型的每一篇对比都以 $0.14 对 $1.50 开头,然后就停在那里。这个比例是真实的,但它也是本文里最不可靠的数字,因为它给一个 token 定价,而不是给一件工作定价。

Artificial Analysis 公布了更好的东西:它用同一套 Intelligence Index 跑每个模型时实际付了多少钱,连账单一起。

Artificial Analysis 用 Intelligence Index 跑每个模型的花费柱状图:DeepSeek V4 Flash 0731 为 210M 输出 token、$72.02,GPT-5.6 Luna 为 130M、$190.87,Gemini 3.6 Flash 为 59M、$726.70

模型该次指数跑的输出 tokenAA 该次跑的总花费
DeepSeek V4 Flash 0731210M$72.02
GPT-5.6 Luna130M$190.87
Gemini 3.6 Flash59M$726.70

同一套评测,三张真实账单。Gemini 的花费是 DeepSeek 的 10.1x,Luna 是 2.7x。对照输出价格 27x 和 4.3x 的价签比例,这意味着 DeepSeek 纸面优势的大约 60% 在价格卡和账单之间的某处消失了。

消失去了 token 里。DeepSeek 在那套评测上花了 210M 输出 token,Gemini 只用了 59M,AA 将其标注为在同类中非常啰嗦。单把输出这一段按标价算,DeepSeek 是 $58.80,Luna 是 $156.00,Gemini 是 $442.50,这一段的差距是 7.5x。两张账单的构成也因此不同:输出约占 DeepSeek 那次花费的 82%,占 Gemini 的约 61%。这是一个为达到同样分数而写出三倍半文字的模型的特征。AA 不公布每个模型的输入 token 数,所以剩下的部分无法从公开数字进一步拆解。

你该按哪个数字来规划,取决于你的流量。以提示为主的工作负载会贴近输入比例 10.7x。以生成为主的工作负载会被啰嗦压向 7.5x。AA 的端到端数字 10.1x 落在两者之间,跑在一套本身就是混合的评测上,这也是为什么在预算评审里需要辩护的场景,用 10x 作默认比 27x 更靠谱。

关于这些 token 数有两点提醒。它们来自 AA 的最大努力和高努力配置,这是每个模型区间里最贵的那一端,而非典型的生产设定。而且啰嗦程度取决于工作负载;一套满是硬推理题的评测偏袒推理简短的模型,而你的抽取流水线不是那套评测。

关于 210M 的一条脚注,因为流传着两个 AA 数字。模型页面报告该次指数跑为 210M 输出 token;AA 的发布文章报告约 206M,同时还有个更有意思的事实:这比上一个 V4 Flash 版本花的(约 234M) 12%。所以 0731 既比同类更啰嗦,又比自己的前代更省。我们全程用 210M,因为模型页面的数字是这里三个模型都以同一种方式公布的那个。

不过这个杠杆是真实存在的,而且只是一个开关。DeepSeek 文档列出 deepseek-v4-flash 同时支持非思考和思考两种模式,默认是思考模式,而推理 token 按输出计费。对于有界任务,关掉思考就是啰嗦税消失的地方。

在你自己的流量上测量

AA 的比例是个起点估计,不是你的数字。要拿到你自己的数字,只需在你真实提示的一个样本上跑一次,因为每个 OpenAI 兼容的响应都会带上你需要的 token 计数:

import collections
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")

costs = {  # input, output, per 1M tokens
    "deepseek/deepseek-v4-flash": (0.14, 0.28),
    "google/gemini-3.6-flash": (1.50, 7.50),
    "openai/gpt-5.6-luna": (0.20, 1.20),
}
totals = collections.defaultdict(float)

for prompt in load_your_real_prompts():        # 50 is enough to see the shape
    for model, (pin, pout) in costs.items():
        u = client.chat.completions.create(
            model=model, messages=[{"role": "user", "content": prompt}]
        ).usage
        totals[model] += (u.prompt_tokens * pin + u.completion_tokens * pout) / 1e6

for model, spend in sorted(totals.items(), key=lambda kv: kv[1]):
    print(f"{model:32} ${spend:.4f} over the sample")

用五十条有代表性的提示,在三个模型上各跑一遍只花几分钱,能告诉你的东西比任何排行榜都多。有两点要注意。给 DeepSeek 分别在思考开启和关闭下各跑一次,因为这个开关对输出这一列的影响比模型选择还大。而且要从你实际的流量分布里取样,而不是取最难的用例,因为在硬推理题上测出的啰嗦比例,无法迁移到一队两行的分类任务上。

定价算账:两张真实的月度账单

以下所有价格均为厂商标价,快照日期 2026-08-01,按每 1M token 计。

场景 A,一个抽取流水线。 每月 200M 输入 token 和 10M 输出 token,无缓存,输出为短结构化。

模型输入成本输出成本月度合计
DeepSeek V4 Flash 0731$28.00$2.80$30.80
GPT-5.6 Luna$40.00$12.00$52.00
Gemini 3.6 Flash$300.00$75.00$375.00

输入占主导,所以这个场景紧贴输入价格比例:Gemini 的花费是 DeepSeek 的 12x,Luna 是 1.7x。注意 7 月 30 日的降价把 Luna 的位置改变了多少。按旧的 $1 / $6,同样的工作负载每月要 $260。

场景 B,一个编码智能体循环。 每月 100M 输入 token(缓存命中率 70%)和 40M 输出 token。

模型缓存输入新鲜输入输出月度合计
DeepSeek V4 Flash 0731$0.20$4.20$11.20$15.60
GPT-5.6 Luna$1.40$6.00$48.00$55.40
Gemini 3.6 Flash$10.50$45.00$300.00$355.50

那张表把 token 数固定住了,这暗地里假设三个模型为做同一件工作会写出同样多的字。它们不会。改为固定工作量,并按指数跑的啰嗦比例来缩放输出,能给出同一个智能体循环更公平的画面:

模型等量工作所需的输出 token月度合计
DeepSeek V4 Flash 0731142M$44.16
GPT-5.6 Luna88M$113.00
Gemini 3.6 Flash40M(基准)$355.50

DeepSeek 从便宜 23x 变成便宜 8x。决策不变,但你放进幻灯片的那个数字应该变。

关于 DeepSeek 这套算账更深入的版本,包括缓存未命中对真实账单的影响,见我们的 V4 Pro 成本拆解DeepSeek V4 API 定价指南

两个会左右你账单的定价细节

DeepSeek 即将引入高峰时段定价。 其定价文档里有一条脚注:API 将采用高峰/非高峰政策,高峰时段价格为常规价格的 2x,适用于所有计费项,生效日期待官方公告。高峰窗口为北京时间(UTC+8)09:00 到 12:00 和 14:00 到 18:00。

在假设它无害之前,先换算到你自己的时钟上。这些窗口落在美国东部时间 21:00 到 00:00 和 02:00 到 06:00,对于美国白天的工作负载正是半夜;落在中欧时间 03:00 到 06:00 和 08:00 到 12:00,会吃掉一个欧洲团队的整个上午。如果你在欧洲运行,而 DeepSeek 把它开起来,那么工作日的前半天你的 $0.14 会变成 $0.28。这仍然低于 Gemini,但已经不是你当初预算的那个数字。

你走哪条通道购买,可能和厂商标价不同。 OpenAI 在 2026-07-30 把 GPT-5.6 Luna 降价 80%,从 $1 / $6 降到 $0.20 / $1.20。通过 Azure 提供 Luna 的列表在 2026-08-01 快照时还没有变动,包括我们的,其中 openai/gpt-5.6-luna 是一条 Azure 通道,显示 $1 / $6 标价。同一个模型 ID,相差 5x,纯粹取决于你落到哪个上游。

模型快照时的通道输入输出缓存输入
DeepSeek V4 Flash 0731DeepSeek 第一方$0.14$0.28$0.0028
DeepSeek V4 Flash 0731阿里云 BaiLian$0.14$0.28$0.028
DeepSeek V4 Flash 0731Azure$0.19$0.51$0.19
Gemini 3.6 FlashGoogle / Vertex$1.50$7.50$0.15
Gemini 3.6 FlashGoogle batch 或 flex$0.75$3.75$0.075
GPT-5.6 LunaOpenAI 第一方$0.20$1.20$0.02
GPT-5.6 LunaAzure$1.00$6.00$0.10

那张表有两条脚注。我们的 Luna 列表在快照时正在跑一个 20% 的促销,把 Azure 通道拉到实际 $0.80 / $4.80,仍是 OpenAI 标价的四倍。而缓存读取那一列值得单独看一眼:在 Azure 的 DeepSeek 通道上,缓存读取和新鲜输入同价,这抹掉了这个模型最大的那项成本优势。

这张表教给你的通用规则是:查通道,而不是查模型名。某个实验室宣布的降价会立刻到达它自己的 API,其他人则各按各自的节奏。上面七行里有两行是同一个模型,价格却相差悬殊。

纯文本实际会让你付出什么

这次对比里最便宜的模型看不见东西。DeepSeek V4 Flash 0731 接受文本、调用函数、返回 JSON,同时讲 OpenAI 和 Anthropic 两种协议格式,就这些。Gemini 3.6 Flash 接受文本、图像、视频、音频和 PDF。GPT-5.6 Luna 接受文本和图像。

这不是靠提示工程或更大预算能弥补的质量差距。如果你的流水线要发送坏掉界面的截图、扫描的发票,或视频里的帧,DeepSeek 的调用不会以更高价格优雅降级,而是从结构上失败。对于这类工作,上面每一张成本表都变得无关紧要,这也是为什么模态那一行放在参数表靠上的位置,而不是埋在最底下。

一个常见的解法是把流量拆开:多模态请求发给 Gemini,其余全发给 DeepSeek,前面放一个路由器。这比只选一个模型要多干点活,但对于 90% 请求都是文本的流水线,通常在第一个月就能回本。

何时该选 DeepSeek V4 Flash 0731

有量的纯文本工作负载,账单是一项真实的支出。任何缓存命中率高的场景都受益尤其大,因为 $0.0028/M 的缓存读取相当于新鲜输入 98% 的折扣,是 50x 的降幅。长的单次生成也偏爱它:384K 最大输出是 Gemini 上限的六倍。它也是三者中唯一公布了权重的,在 Hugging Face 上以 MIT 许可发布,所以如果计划是先用 API 做原型、之后自托管,这一个是有路径的。

对有界任务关掉思考。它就是上面 $15.60 和 $44.16 两行之间的区别。

何时该选 Gemini 3.6 Flash

只要涉及非文本模态,价格还没进对话它就已经拍板了。还有当延迟对用户可见时:219.6 输出 token/秒让它在快照时的 AA 速度排名里位列 185 个模型中的第三,15.11 秒的首 token 时间对一个推理模型来说很快。以及当你希望你即将依赖的东西已经被第三方测过时,因为 AA 公布了 Gemini 的速度和延迟,却没有 0731 版本的。

批处理档被低估了。对于能容忍延迟的工作,$0.75 / $3.75 让 Gemini 与 DeepSeek 的有效距离减半。

何时该选 GPT-5.6 Luna

当你想在同一个模型上同时拥有三者中最高的指数分和视觉能力时,而这次降价 80% 让这个组合变得实惠,这在三周前还做不到。$0.20 / $1.20 的 Luna 在价格上现在更接近 DeepSeek 而非 Gemini,得分却比两者都高一分。

先查两件事。AA 测得的 121.89 秒首 token 时间是最大努力配置,而最大努力不是交互式设定;如果你在 UI 里用 Luna,就用更低的努力档。还要确认你的网关把你放到哪条通道上,因为降价前的 Azure 档是 OpenAI 标价的 5x。我们的 GPT-5.6 分档指南 讲了 Sol、Terra 和 Luna 如何分工。

何时三者都不是正确答案

如果你的工作负载很小,这一切都无所谓。在每月几百万 token 的量级上,这里最便宜和最贵选项之间的差别,相对于一小时工程时间只是舍入误差,你应该按能力来选然后往下走。

如果你在追求零成本,托管 API 就是错的工具。这个模型家族的免费和自托管路径是另一套单独的活,带着实打实的额度上限,见 DeepSeek V4 Flash 免费:四条零成本路径。那些路径是针对 0731 之前的版本核实过的,所以在依赖它们之前请重新核对额度。自托管路径此后有了变化:0731 权重现在已在 Hugging Face 上以 MIT 许可提供,所以免许可选项适用于当前版本,而非四月那个。

而如果这份活是深度多步的智能体工作、工具调用达到两位数,那么这三个 flash 档模型都不是明显合适的选择。那是前沿档的领地,诚实的答案是在你自己的轨迹上做基准测试,而不是在任何人的指数上。我们之前的 Gemini Flash Lite 对决 DeepSeek V4 Flash 智能体循环对比 讲解了工具调用可靠性在深度上如何改变这笔账。

通过 ofox 试用全部三个:在一个循环里做 A/B

三个都跑在一个 OpenAI 兼容的端点上,所以对比是换个字符串的事,而不是三套集成。模型 ID 分别是 deepseek/deepseek-v4-flashgoogle/gemini-3.6-flashopenai/gpt-5.6-luna

Python

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.io/v1", api_key="YOUR_OFOX_API_KEY")

MODELS = [
    "deepseek/deepseek-v4-flash",
    "google/gemini-3.6-flash",
    "openai/gpt-5.6-luna",
]

prompt = "Refactor this function to remove the nested loop. Return only code."

for model in MODELS:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    u = r.usage
    print(f"{model:32} in={u.prompt_tokens:6} out={u.completion_tokens:6}")

记录 completion_tokens,而不只是延迟。那一列就是啰嗦差异在你自己流量上显现的地方,也是价签不会告诉你的那个数字。

Node

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.ofox.io/v1",
  apiKey: process.env.OFOX_API_KEY,
});

const models = [
  "deepseek/deepseek-v4-flash",
  "google/gemini-3.6-flash",
  "openai/gpt-5.6-luna",
];

for (const model of models) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: "Summarize this changelog in 3 bullets." }],
  });
  console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens);
}

DeepSeek 跑不了的那次调用

同一个客户端、同一个端点,一个改变一切的内容块。把它发给 google/gemini-3.6-flashopenai/gpt-5.6-luna,你会得到答案。把它发给 deepseek/deepseek-v4-flash,则无论什么价格都不行。

import base64

img = base64.b64encode(open("screenshot.png", "rb").read()).decode()

r = client.chat.completions.create(
    model="google/gemini-3.6-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Which element is misaligned?"},
            {"type": "image_url",
             "image_url": {"url": f"data:image/png;base64,{img}"}},
        ],
    }],
)
print(r.choices[0].message.content)

备选方案

如果三个都不合适,值得看的邻居就在同一个端点上。DeepSeek V4 Pro 标价 $0.435 / $0.87(ofox 列表四舍五入为 $0.45 / $0.88),现在是 AA 指数上更贵且分数更低的那个兄弟,不过如果你有针对特定工作负载的证据表明它在你的轨迹上胜出,它仍是正确选择。GPT-5.6 Terra 在 flash 档确实不够用时排在 Luna 之上。在 ofox 目录之外,同样的模型可以从 DeepSeek、Google AI Studio 和 OpenAI API 第一方获得,如果你只需要一个厂商、并且想在降价当天就拿到而不是等通道跟上,那这是正确选择。

带实时定价的模型页面:DeepSeek V4 FlashGemini 3.6 FlashGPT-5.6 Luna

来源