Gemini 3.8 vs 3.7 Flash:同价,每任务贵 45%
Gemini 3.8 Flash 与 3.7 Flash 单价相同,但每任务输出多 30%,成本 $0.40→$0.58 换 3 分。什么时候该升、什么时候 Google 自己都说别动。
Gemini 3.8 Flash 的价格和 Gemini 3.7 Flash 一模一样。Google 定价页上两个模型的每一格都相同,连 2027 年 1 月 1 日翻倍的那条脚注都一样。账单却不一样。Artificial Analysis 测到 3.8 Flash 每任务多花 30% 的输出 token,每个智能指数任务的成本从 $0.40 涨到 $0.58。
先说结论
- 按 token 算:一样。 输入 $0.75,输出 $3.75,缓存输入 $0.075,Batch 和 Flex 减半,Priority 1.8 倍,2027 年 1 月 1 日全部翻倍。没什么可比的。
- 按任务算:high 档下 3.8 Flash 贵约 45%。 Artificial Analysis 上 $0.58 对 $0.40,换来 59 分对 56 分。AA 自己把这个差距写成「约 40%」。
- 接近免费的升级方式是 medium 档。 3.8 Flash 默认的 medium 档 57 分、每任务 $0.41,比 3.7 Flash 多 1 分,多 1 美分。
- Google 说不动也行。 3.7 Flash「对讲效率的场景仍然得到完整支持」。这是厂商的原话,不是我们的。
Google 改了什么,没改什么
Gemini 3.8 Flash 在 2026 年 9 月 2 日发布,距 8 月 13 日的 3.7 Flash 三周。Google 的发布文把差别说成行为而不是价格(以下引文为译文):「3.8 Flash 更肯下功夫。面对复杂任务,它表现出更强的钻研劲头——执行额外的推理步骤、反复调用工具。有时它会消耗更多 token 来把表现拉满,尤其在较高的 effort 档位。」
接着是多数文章跳过的那句建议:「开发者可以用较低的 effort 档位来减少 token 开销,或者继续用 Gemini 3.7 Flash,它对讲效率的场景仍然得到完整支持。」开发者文档又重复了一遍:「Gemini 3.8 Flash 在长时间运行的复杂任务上可能会用更多 token,这是有意为之。」
所以厂商的口径是:同价,每次调用干更多活,并且明确给了退回 3.7 Flash 的路。
Gemini 3.8 Flash vs 3.7 Flash:规格与价格
| 规格 | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| 发布 | 2026-08-13 | 2026-09-02 |
| 输入 / 输出,每百万 token | $0.75 / $3.75 | $0.75 / $3.75 |
| 2027-01-01 起 | $1.50 / $7.50 | $1.50 / $7.50 |
| 缓存输入 | $0.075 | $0.075 |
| 上下文 | 1M token | 1M token |
| 最大输出 | 64K token | 64K token |
| 思考档位 | low / medium(默认)/ high | low / medium(默认)/ high |
minimal | 报错 | 报错 |
| AA 智能指数(high) | 56 | 59 |
| AA 每任务成本(high) | $0.40 | $0.58 |
| AA 每任务输出 token(high) | — | 4.8 万,「增加 30%」 |
| 跑完 AA 指数的输出 token | 6400 万 | 1.2 亿 |
| 跑完 AA 指数的花费 | $484.73 | $825.83 |
| AA 输出速度 | 约 287 token/s | 约 302 token/s |
| AA 每任务时长(high) | 2.2 分钟 | 2.5 分钟 |
价格来自 Google 定价页;指数、token、花费和速度来自 Artificial Analysis,均为 2026 年 9 月 3 日读数。除发布日期外,有差别的是最后七行。AA 把成本和时长的变化归到两件事:每任务输出 token 多 30%,以及 agentic 评测里轮次更多。
Gemini 3.8 Flash 比 3.7 Flash 强多少?
Gemini 3.8 Flash 在 Artificial Analysis 智能指数 high 档拿 59 分,3.7 Flash 拿 56 分;这 3 分每任务贵约 45%,$0.58 对 $0.40。 Artificial Analysis 给每个模型的每个档位一个综合分:
| 模型,档位 | AA 智能指数 | AA 每任务成本 |
|---|---|---|
| Gemini 3.8 Flash,high | 59 | $0.58 |
| Gemini 3.8 Flash,medium(默认) | 57 | $0.41 |
| Gemini 3.7 Flash,high | 56 | $0.40 |
| Gemini 3.8 Flash,low | 52 | $0.24 |
| Gemini 3.6 Flash,high | 52 | — |
顺着成本那一列往下看,事情很清楚。3.8 Flash high 档(59 分)每任务比 3.7 Flash high 档(56 分)贵 45%;medium 档(57 分)贵 2.5%;low 档(52 分)便宜 40%,而 52 分是 3.6 Flash 早就有的分数。
AA 自己对这次发布的总结是「智能指数提升 3 分」,代价是「每任务平均输出 token 增加 30%,到 4.8 万」。两个数字都是 high 档的。用默认的 medium 档,你能拿到大部分提升,几乎不多花钱。换成我们上线,选的就是这个档位。
Gemini 3.8 Flash 的 token 用量:多出的 30% 去了哪
Gemini 3.8 Flash high 档每任务输出 token 比 3.7 Flash 多约 30%,按 Artificial Analysis 的数据平均 4.8 万,多出来的部分花在额外的推理步骤和反复的工具调用上。 单价只是账单里较小的那一半。另一半是模型停下来之前写了多少,这一代变的就是这个数。
整套指数跑完,AA 记到 3.7 Flash 输出 6400 万 token,评价是「相比 7100 万的中位数相当精炼」;3.8 Flash 输出 1.2 亿,「相比中位数非常啰嗦」。AA 给的每任务平均值是 3.8 Flash high 档 4.8 万,比 3.7 Flash 高 30%。
token 花在了 Google 说的地方:额外的推理步骤和反复的工具调用。在需要这些的任务上,这就是那 3 分。在不需要的任务上,这是同一个答案多出 30% 的输出、按每百万 $3.75 计费。你的流量属于哪一种,跑分说不了,你自己调用返回里的 completion_tokens 能说。
速度基本抹平
AA 测到 3.8 Flash 每秒输出约 302 个 token,3.7 Flash 约 287。5% 的速度提升盖不过 30% 的 token 增加,所以 AA 的每任务时长是涨的,high 档从 2.2 分钟到 2.5 分钟,而不是降。如果你优化的是端到端耗时,3.8 Flash 的 low 档每任务 0.8 分钟才是那个杠杆,代价是分数。
迁移只改一个字符串
请求里只有模型名要动:
- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"
两个模型都接受 low、medium、high,默认 medium,传 minimal 都报错;3.7 Flash API 接入指南里有那个 400 的原始返回,以及最便宜的合法档位要花多少。上下文和 64K 输出上限没变。OpenAI 兼容层的参数名是 reasoning_effort,Google 原生协议是 thinking_level。
切换后要复查两件事:
- 输出预算和告警。 单价不变,high 档每任务大约多 30% token。凡是按 3.7 Flash 输出量校准的阈值都会触发。
- effort 档位。 如果你在 3.7 Flash 上开
high是因为分数需要,先试 3.8 Flash 的medium。它比 3.7 Flash 的 high 档高 1 分,AA 每任务只差 1 美分。
Gemini 3.8 Flash 该不该升级?
- 任务确实需要 59 分,而且你验证过 3.7 Flash 的 56 分在这个任务上真的不够,不是想当然。
- 你能用 medium 档上线:57 分、每任务 $0.41,对比 3.7 Flash 的 56 分、$0.40,是严格的改进。
- 你的流量是重工具调用的 agent 类,Google 说多出来的步骤就落在这里。
什么时候留在 3.7 Flash
- 3.7 Flash 已经够用。Google 的用词是「完整支持」;价格上没有换的理由,high 档每任务贵 45% 倒是不换的理由。
- 你按输出量计费,30% 的增幅没有余量。
- 你的 prompt 是针对 3.7 Flash 的行为调的,重调的成本比那 1 分值钱。
两个模型共同面对的断崖
2027 年 1 月 1 日两个模型都翻倍,输入 $1.50、输出 $7.50。token 用量不变的话,3.8 Flash 的 $0.58 / $0.41 / $0.24 每任务梯子会变成约 $1.16 / $0.82 / $0.48,3.7 Flash 的 $0.40 变成约 $0.80。两者之间 45% 的差距原样保留,动的只是绝对值。预算跑过 12 月的,都得按第二行算。
通过 Ofox 调用
google/gemini-3.7-flash 在 Ofox 目录里,Google 线路输入 $0.75、输出 $3.75(同页 CloudVertex 线路为 $1.50 / $7.50,/v1/models 的 pricing 字段目前返回的是后者),可以走 https://api.ofox.ai/v1 的 OpenAI 兼容端点,也可以走 Google 原生 Gemini 协议。Gemini 3.8 Flash 截至 2026 年 9 月 3 日尚未进入目录。 上架后,通过 Ofox 迁移和上面一样只改一个字符串,加上 google/ 前缀。GET /v1/models 返回的目录才是能调什么的最终依据。
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
for model in ["google/gemini-3.7-flash"]: # 上架后加上 "google/gemini-3.8-flash"
for effort in ["low", "medium", "high"]:
r = client.chat.completions.create(
model=model,
reasoning_effort=effort,
messages=[{"role": "user", "content": "把这个 GROUP BY 改写成窗口函数。"}],
)
print(f"{model:28} {effort:7} out={r.usage.completion_tokens:6}")
拿你自己的 prompt 跑一遍,看 out 那一列。升不升的答案,就是你真正会上线的那个档位下 3.7 Flash 行和 3.8 Flash 行的差值,乘以每百万 $3.75。这篇给不了你这个数,这段循环能。
来源
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://ai.google.dev/gemini-api/docs/pricing
- https://ai.google.dev/gemini-api/docs/latest-model
- https://artificialanalysis.ai/articles/gemini-3-8-flash
- https://artificialanalysis.ai/models/gemini-3-8-flash
- https://artificialanalysis.ai/models/gemini-3-7-flash
- https://ofox.ai/zh/models/google/gemini-3.7-flash
价格、指数分数、token 数和速度均于 2026 年 9 月 3 日核对。Ofox 目录收录情况同日核对自线上 /v1/models 接口,Ofox 价格取自模型页。
常见问题
- Gemini 3.8 Flash 比 Gemini 3.7 Flash 贵吗?
- 按 token 算不贵。两者都是每百万 token 输入 $0.75、输出 $3.75,到 2026 年 12 月 31 日为止,2027 年 1 月 1 日起都变为 $1.50 和 $7.50,缓存、Batch、Flex、Priority 费率也完全相同。按任务算贵:Artificial Analysis 测到 high 档下 3.8 Flash 每个智能指数任务 $0.58,3.7 Flash 是 $0.40,因为 3.8 Flash 每任务多写约 30% 的输出 token。
- Gemini 3.8 Flash 比 3.7 Flash 强多少?
- Artificial Analysis 智能指数 high 档差 3 分:59 对 56。3.8 Flash 默认的 medium 档是 57 分,比 3.7 Flash 高 1 分,每任务成本几乎相同,$0.41。low 档 3.8 Flash 是 52 分,低于 3.7 Flash。
- 该从 Gemini 3.7 Flash 升到 3.8 Flash 吗?
- Google 自己的说法是 3.7 Flash「对讲效率的场景仍然得到完整支持」。需要 high 档那 59 分、而且 high 档每任务贵约 45% 你也能接受,就升。用 medium 档切过去,能以和 3.7 Flash 差不多的每任务成本拿到 57 分。如果 3.7 Flash 已经够用,价格上没有换的理由。
- Gemini 3.8 Flash 和 3.7 Flash 的 API 参数一样吗?
- 一样。两者都接受 low、medium、high 三个思考档位,默认 medium,传 minimal 都会报错。上下文都是 1M token,输出上限都是 64K token。请求里只有模型字符串从 gemini-3.7-flash 改成 gemini-3.8-flash,别的都不用动。
- Ofox 上能用 Gemini 3.8 Flash 吗?
- 截至 2026 年 9 月 3 日还不能。google/gemini-3.7-flash 在 Ofox 目录里,Google 线路输入 $0.75、输出 $3.75(同页 CloudVertex 线路为 $1.50 / $7.50),OpenAI 兼容协议和 Gemini 原生协议都能走。3.8 Flash 上架后,迁移和直连 Google 一样只改一个字符串。


