Gemini 3.7 Flash API 接入指南:$0.75 的价格,和 minimal 档被删掉的坑

Gemini 3.7 Flash 输入 $0.75 / 输出 $3.75,和 3.6 Flash 现在完全同价。thinking 只剩 low/medium/high 三档,3.6 上能用的 minimal 传过去会报错。定价口径、接入代码、官方评测强弱项与选型对照。

Gemini 3.7 Flash API 接入指南:$0.75 的价格,和 minimal 档被删掉的坑

Gemini 3.7 Flash 在 2026-08-13 上线,输入 $0.75、输出 $3.75(每百万 token)。 这个价有两个附加条件:它写死到 2026-12-31,之后翻倍;而且 Gemini 3.6 Flash 现在挂着一模一样的价。

真正会让迁移代码挂掉的是另一件事。thinking 档位从四个变成三个,minimal 被拿掉了,官方规格页在那一行下面加了一句 Note: minimal is not supported and returns an error.

最后更新 2026-08-21。$0.75 / $3.75 是限时价,2026-12-31 之后翻倍,跨年做预算前请重新核一遍。

Gemini 3.7 Flash 的 API 多少钱?

Google 定价页把两个日期塞进了同一个格子里,所以照抄单价很容易抄到错的那一行。

档位输入 / 百万 token输出 / 百万 token生效期
Standard$0.75$3.75至 2026-12-31
Standard$1.50$7.502027-01-01 起
Batch / Flex$0.375$1.875至 2026-12-31
Batch / Flex$0.75$3.752027-01-01 起

缓存读取 $0.075,缓存存储 $0.50 每百万 token 每小时(2027 年起翻倍为 $0.15 和 $1.00)。输出价里已经含了思考 token,官方原话是 response pricing is the sum of output tokens and thinking tokens——也就是说你为 thinking_level: high 多消耗的那部分推理,是按输出价结账的。

发布当天 Google for Developers 的说法是「3.6 Flash 每百万 token 原价的一半」。这句话本身没错,但那个「原价」是 3.6 Flash 在 2026-07-21 上线时的 $1.50 / $7.50,而在 3.7 发布的同一天,3.6 Flash 也降到了 $0.75 / $3.75。现在官方定价页上两个模型的每一格逐字相同。换代这件事本身既不加钱也不省钱,省的是限时。

Gemini 3.7 Flash 的 ofox 模型页上还有几项官方定价页不单列的费率:音频输入 $0.75、缓存写入 $0.0415、一小时期限的缓存写入 $0.50、联网搜索 $0.014 每次请求。

Gemini 3.7 Flash 怎么接入?

两条路,代码差别只在 base URL 和模型名。

ofox 的 OpenAI 兼容端点:

from openai import OpenAI

client = OpenAI(
    api_key="sk-...",
    base_url="https://api.ofox.ai/v1",
)

r = client.chat.completions.create(
    model="google/gemini-3.7-flash",
    reasoning_effort="low",
    messages=[{"role": "user", "content": "把这段 SQL 改写成窗口函数版本"}],
)
print(r.choices[0].message.content)

直连 Google 的 OpenAI 兼容层,模型名去掉 google/ 前缀:

client = OpenAI(
    api_key="AIza...",
    base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)

r = client.chat.completions.create(
    model="gemini-3.7-flash",
    reasoning_effort="low",
    messages=[...],
)

用 Gemini 原生协议的话,控制推理的参数名不是 reasoning_effort 而是 thinking_level,接受 low / medium / high,不传时默认 medium。ofox 侧两种协议都开着,模型页列的是 OpenAI(/v1/chat/completions)和 Gemini 两条,上游走 Google 与 Cloud Vertex 两个供应商。

能力清单直接抄官方规格页,省得试:函数调用、结构化输出、上下文缓存、代码执行、搜索接地、URL context、文件搜索、Google Maps 接地都支持,Computer use 标的是 Preview;Batch API、Flex inference、Priority inference 三种消费模式都开。不支持的是 Live API、图像生成和音频生成——输入吃文本、图像、视频、音频、PDF,输出只有文本。

从 3.6 Flash 迁过来要改什么?

改模型 ID 之外,有三处会真的咬人。

第一处是 minimal 档没了。 官方规格页 Thinking 那一行写的是 Supported (low, medium, high),紧跟着一句 Note: minimal is not supported and returns an error. 3.6 Flash 是接受 minimal 的,所以任何把这个值写死在配置里的调用,换成 3.7 之后会拿到报错而不是静默降级。

这里有个口径需要你自己确认一次:Google 的 OpenAI 兼容层文档里有一张 reasoning_effort 到 thinking level 的映射表,那张表列的是 Gemini 3.1 Pro、3.1 Flash-Lite、Gemini 3 Flash 和 2.5 几列,没有单独的 3.7 Flash 列。规格页说 3.7 不收 minimal,映射表又把 OpenAI 侧的 minimal 往下映射,两页对不齐。上线前拿一个最短的 prompt 探一次 reasoning_effort="minimal",看回的是 200 还是 400,比读文档快。这类「参数校验到底发生在模型侧还是路由侧」的坑不是 Gemini 独有,GLM 5.3 那边同一个参数在两条路由上给出过相反答案

第二处是默认档。 原生协议不传 thinking_level 的默认值是 medium。如果你原来的负载是靠 minimal 压成本的,删掉这个参数等于跳到 medium,账单会涨,而且涨的部分按输出价计。

第三处是输出上限。 输入 1,048,576 token,输出只有 65,536。1M 的窗口很容易让人以为可以一次性吐出等体量的内容,长文档重写、整仓代码生成这类任务还是要自己切片。

Gemini 3.7 Flash 强在哪、弱在哪?

Google 模型卡里给了一张同价位对照表,把 3.7 Flash 和 3.6 Flash、Claude Sonnet 5GPT-5.6 Terra、Muse Spark 1.2 摆在一起。挑其中差距明显的几项:

评测Gemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
AA Intelligence Index56525557
FrontierCode 1.143.6%34.4%42.7%41.3%
Code Arena Web1588153815411523
AutomationBench30.4%17.0%10.7%23.6%
GDM-MRCR v2(128k)97.0%91.8%81.5%93.5%
LVBench85.4%84.2%68.5%78.9%
Terminal-bench 2.185.8%78.0%80.4%87.4%
Terminal-bench 3.014.9%5.4%14.6%20.8%
DeepSWE v1.165.3%48.6%53.8%69.6%
GDPVal-AA v21525142215981578
Agent’s Last Exam26.3%24.2%33.3%28.0%
CharXiv(无工具)84.5%85.2%77.0%85.9%

强项集中在三块:长上下文检索(MRCR 128k 拿到 97.0%,是这张表里唯一上 95 的)、视频与前端代码(LVBench 85.4%、Code Arena Web 1588 都是第一)、以及 GUI/浏览器自动化(AutomationBench 30.4%,接近 Sonnet 5 的三倍)。

弱项也集中在要跑很久的活上:Terminal-bench 两个版本都落在 GPT-5.6 Terra 后面,2.1 是 85.8% 对 87.4%,3.0 是 14.9% 对 20.8%;DeepSWE v1.1 同样落后;GDPVal-AA v2 那类模拟真实经济产出的任务是全表最低的 1525。Agent’s Last Exam 26.3% 也明显不如 Sonnet 5。让它做流程里的一步没问题,交给它无人值守跑八小时就不合适。

有一项值得单独拎出来:CharXiv 是整张表里唯一比自家上一代退步的指标,无工具 84.5% 对 3.6 的 85.2%,带工具 88.7% 对 89.4%。图表密集的多模态负载,换代之前先用自己的样本比一遍。

还有一点得说破:Terminal-bench 这两行都是厂商自己跑的。模型卡给 2.1 报的是 85.8%,而公开的 Terminal-Bench 2.1 榜榜首只有 83.8% ± 1.2%——我们拉的时候榜上一共 17 条验证过的提交,没有一条是 3.7 Flash。自报分数越过了验证榜的第一名,这张表里最该当成「主张」而不是「结果」读的就是这个数。

另外一条不在模型卡里的数据:Artificial Analysis 在 high 档、直连 Google API 实测的首个 token 延迟是 14.52 秒,被它自己标注为高于同价位推理模型的平均(中位 2.80 秒);输出速度 389.5 token/秒,这一项是全站第一。一个叫 Flash 的模型首字要等十几秒,这个反差在交互式产品里是要命的,批处理里则完全无所谓。

什么场景该选 Gemini 3.7 Flash?

你的场景建议依据
128k 以上的文档检索、RAG 召回MRCR v2 97.0%,同表最高
视频理解、长视频问答LVBench 85.4%,领先 Sonnet 5 近 17 个点
前端 / Web 代码生成Code Arena Web 1588 第一
浏览器与 GUI 自动化AutomationBench 30.4%,Sonnet 5 只有 10.7%
多步终端任务、长跑 agent谨慎Terminal-bench 3.0 仅 14.9%
低延迟对话、语音前端换模型AA 实测 TTFT 14.52 秒(high 档),且不支持 Live API
图表密集的多模态分析先自测CharXiv 是唯一比 3.6 退步的项
一次要吐 10 万 token 以上要分片输出上限 65,536

如果你的场景不在这张表里,ofox 的模型选型工具按任务类型(编程、agent、RAG 长文档、视觉、抽取、翻译等)把 100+ 模型按质量、成本、速度排一遍,价格和上下文长度是实时拉的,不用注册也不用 API Key。

性能相当的是哪几个模型?

按 Google 模型卡引用的 AA Intelligence Index,56 分这一档挤着四个模型,分差在三分以内,价格却差了三倍多。

模型AA Index输入 / 百万输出 / 百万
GPT-5.6 Terra57$2.00$12.00
Muse Spark 1.257$1.25$4.25
Gemini 3.7 Flash56$0.75$3.75
Claude Sonnet 555$2.00$10.00
Gemini 3.6 Flash52$0.75$3.75

在这一档里 3.7 Flash 是最便宜的,输出价只有 GPT-5.6 Terra 的三分之一不到。代价是前面那些弱项——终端长跑和 GDPVal 类任务上它排在末位,所以「分数相当」只在综合指数这一个维度成立,落到具体任务上要看上一节那张表。

再往下一档,Gemini 3.6 Flash 现在和 3.7 同价却低 4 分,除非你有已经调好的 prompt 依赖它的行为,否则没有留下的理由。文本负载想再省一个数量级,DeepSeek V4 FlashGLM-5.3 是另一条路,但都不吃图像和视频。上一代 Gemini 3.5 Flash 的接入方式与 3.7 基本一致,老代码换个模型 ID 就能跑。

References

常见问题

Gemini 3.7 Flash 的 API 多少钱?
Google 定价页写的是输入 $0.75 / 输出 $3.75 每百万 token,缓存读取 $0.075。但这一格里还有第二行:这个价到 2026-12-31 为止,2027-01-01 起变成 $1.50 / $7.50。Batch 与 Flex 档是 $0.375 / $1.875,同样在 2027 年翻倍。输出价包含思考 token,官方原文是 response pricing is the sum of output tokens and thinking tokens。
Gemini 3.7 Flash 比 3.6 Flash 贵吗?
不贵,两个现在完全同价。Google 官方定价页上,3.6 Flash 和 3.7 Flash 的每一格逐字相同,包括那句 $0.75 through December 31, 2026 和 $1.50 starting January 1, 2027。发布当天的宣传语说 3.7 是 3.6 原价的一半,那个原价指的是 3.6 在 2026-07-21 上线时的 $1.50 / $7.50,同一天 3.6 也跟着降到了 $0.75。所以换代本身不加钱,也不省钱。
Gemini 3.7 Flash 的 thinking 档位有哪些?
原生参数是 thinking_level,接受 low、medium、high 三个值,默认 medium。官方模型规格页在 Thinking 那一行明确写了 Note: minimal is not supported and returns an error。3.6 Flash 上可以传 minimal,所以从 3.6 迁过来的代码如果硬编码了这个值,换模型 ID 之后会直接报错。
Gemini 3.7 Flash 的上下文和输出上限是多少?
输入上限 1,048,576 token,输出上限 65,536 token。1M 的上下文窗口不代表能一次吐出等量内容,输出侧只有 64K,长文档改写或者整仓代码生成要自己分片。输入支持文本、图像、视频、音频和 PDF,输出只有文本。
Gemini 3.7 Flash 适合做实时语音应用吗?
不适合,Live API 在官方能力表上是 Not supported,图像生成和音频生成同样不支持。它是纯文本输出的多模态输入模型。要做实时语音走 Gemini 3.1 Flash Live 或者 3.5 Live Translate 那条线。另外 Artificial Analysis 在 high 档、直连 Google API 的条件下实测首个 token 延迟 14.52 秒,在 Flash 这个命名下算慢的,交互式场景要先自己量一遍。
和 Gemini 3.7 Flash 分数相当的是哪几个模型?
按 Google 模型卡里引用的 Artificial Analysis Intelligence Index,3.7 Flash 是 56,同一张表里 Claude Sonnet 5 是 55、GPT-5.6 Terra 和 Muse Spark 1.2 都是 57。差距在三分以内,但价格不在同一档:3.7 Flash $0.75 / $3.75、Sonnet 5 $2 / $10、GPT-5.6 Terra $2 / $12、Muse Spark 1.2 $1.25 / $4.25。这一档里它是最便宜的那个。
Gemini 3.7 Flash 在网关上的模型 ID 是什么?
ofox 上是 google/gemini-3.7-flash,走 OpenAI 兼容协议或 Gemini 原生协议都行。直连 Google 时模型代号是 gemini-3.7-flash,OpenAI 兼容层的 base URL 为 https://generativelanguage.googleapis.com/v1beta/openai/。