Gemini 3.8 Flash API 定价:现在 $0.75,1 月起 $1.50
Gemini 3.8 Flash 每百万输入 token $0.75、输出 $3.75,2026 年底前有效。全部档位、限流规则,以及怎么拿 key、现在就能调。
Gemini 3.8 Flash 每百万输入 token $0.75、输出 $3.75(含思考 token),有效期到 2026 年 12 月 31 日。2027 年 1 月 1 日起两个数字都翻倍。 模型 ID 是 gemini-3.8-flash,在 Gemini API 和 Vertex AI 上都是 GA,支持三档思考等级。下面所有数据取自 Google 定价页和限流页,读取时间是发布次日的 2026 年 9 月 3 日。
模型 ID: gemini-3.8-flash
标准价: 每百万 输入 $0.75 / 输出 $3.75,2026-12-31 前
2027-01-01 起 $1.50 / $7.50
Batch、Flex: $0.375 / $1.875,之后 $0.75 / $3.75
Priority: $1.35 / $6.75,之后 $2.70 / $13.50
缓存: 读 $0.075(之后 $0.15);存储每百万 token 每小时 $0.50(之后 $1.00)
免费层: 有,定价页「免费」那一列
上下文: 输入 1,048,576 / 输出 65,536
思考档位: low | medium(默认)| high;传 minimal 会报错
Vertex AI: GA,2026-09-02,global 端点 + us / eu 多区域
网关: 截至 2026-09-03 Ofox 目录里还没有
最后更新 2026 年 9 月 3 日。首发价 2026 年 12 月 31 日到期,预算跨过这个日期要按第二档算。
Gemini 3.8 Flash API 到底多少钱?
输入 $0.75、输出 $3.75,2027 年的价格 Google 直接印在同一格里。 Google 定价表对 Gemini 3.8 Flash 的原文是「输入:$0.75,至 2026 年 12 月 31 日;$1.50,自 2027 年 1 月 1 日起」,输出那格是「$3.75,至 2026 年 12 月 31 日;$7.50,自 2027 年 1 月 1 日起」。
| 档位 | 输入/百万 | 输出/百万 | 2026-12-31 前 | 2027-01-01 起 |
|---|---|---|---|---|
| 标准 | $0.75 | $3.75 | 是 | $1.50 / $7.50 |
| Batch | $0.375 | $1.875 | 是 | $0.75 / $3.75 |
| Flex | $0.375 | $1.875 | 是 | $0.75 / $3.75 |
| Priority | $1.35 | $6.75 | 是 | $2.70 / $13.50 |
| 上下文缓存读取 | $0.075 | — | 是 | $0.15 |
| 缓存存储 | 每百万 token 每小时 $0.50 | — | 是 | $1.00 |
| Google Search 联网 | 每月 5,000 次免费,所有 Gemini 3.x 模型共享,之后每千次 $14 |
这张表里有三点比标价本身更影响账单:
- 输出价格含思考 token。 推理按输出价 $3.75 计费,思考档位本质上是价格倍数。
- Batch 和 Flex 正好打对折。 能等的任务用同一个模型只要 $0.375 / $1.875。
- Priority 是 1.8 倍。 $1.35 / $6.75 买的是独立的限流池,不是换了个模型。
Gemini 3.7 Flash 和 3.6 Flash 的每一格都和 3.8 Flash 相同。三者之间按 token 算没有省钱的空间,具体对比见 3.8 Flash vs 3.7 Flash。
Gemini 3.8 Flash 免费吗?
免费层可用,但限流数字 Google 不公开。 定价页给 Gemini 3.8 Flash 单独列了免费层那一列,输入、输出、上下文缓存都写着「免费」。联网搜索每月 5,000 次免费,所有档位通用。
免费层没有的是公开的每分钟请求数。限流页原话是限流「可以在 Google AI Studio 里查看」,并且「所列限流数字不保证,实际容量可能有出入」。网上有第三方文章给出免费层 10 RPM、每天 1,500 次请求这类数字,这些没有一手来源,按未核实处理;要看自己项目的真实限流,去 AI Studio 限流页。
Gemini 3.8 Flash 的限流规则是什么?
每模型的 RPM、TPM 只在 AI Studio 里显示。Google 公开的是分级表、花费上限和 Batch 上限。
| 使用层级 | 怎么达标 | 每 10 分钟花费上限 | 3.8 Flash 的 Batch 排队 token 上限 |
|---|---|---|---|
| 免费 | 有活跃项目或免费试用 | 不适用 | 未列出 |
| Tier 1 | 绑定有效的账单账号 | $10 | 3,000,000 |
| Tier 2 | 累计付费 $100,且首次付款满 3 天 | $50 | 400,000,000 |
| Tier 3 | 累计付费 $1,000,且首次付款满 30 天 | $200 | 1,000,000,000 |
以上数字全部来自 Google 限流页 2026 年 9 月 3 日的版本。有四条规则实际使用时要注意:
- 限流按项目算,不是按 API key。 在同一个项目里换 key 没有用。每日配额在太平洋时间午夜重置。
- 花费上限触发的也是
429 RESOURCE_EXHAUSTED,和 RPM 超限报的是同一个错误码。Tier 1 的话,$10 花在标准价上大概是 270 万输出 token,一段高强度、high 档的连续调用可能在触发请求数限流之前就先撞上花费上限。 - Priority 通道有独立配额池,是同模型同 Tier 标准限流的 0.3 倍。
- 升级 Tier 是自动的,满足花费和账号年限条件就会升:从免费层升 Tier 1 是即时的,之后每次升级 10 分钟内生效。
如果已经在 Gemini 调用上遇到 429,Google 自己的错误码文档区分了 rate_limit_exceeded 和 quota_exceeded 两种不同的 429 成因;站内的 Claude Code 429 排查文也讲了同一套读响应头、做退避重试的方法,原理对任何走令牌桶限流的 API 都适用,Gemini 也不例外。
实际每任务花多少钱
按 token 单价和 3.7 Flash 一样,但 high 档下每任务大概贵 45%,原因是模型写得更多。 Google 的发布文章说得很直白:「有时模型会用更多 token 来最大化表现,尤其是在更高的 effort 档位下。」开发者文档补了一句:「Gemini 3.8 Flash 在处理耗时更长、更复杂的任务时可能用更多 token,这是设计使然。」
Artificial Analysis 给出了具体数字:
| 模型、档位 | AA 智能指数 | 每 AA 任务成本 | 每任务输出 token |
|---|---|---|---|
| Gemini 3.8 Flash, high | 59 | $0.58 | 4.8 万,「增幅约 30%」 |
| Gemini 3.8 Flash, medium(默认) | 57 | $0.41 | — |
| Gemini 3.8 Flash, low | 52 | $0.24 | — |
| Gemini 3.7 Flash, high | 56 | $0.40 | — |
跑完整个指数,AA 在 3.8 Flash 上花了 $825.83,3.7 Flash 是 $484.73。默认的 medium 档才是这份定价表真正的重点:57 分,$0.41 一个任务,比 3.7 Flash 在 high 档多 1 分,只多花约一分钱。同一篇发布文章里给出的 HLE-Verified 分数是 54.9%。
按 3.7 Flash 的输出量做的预算,套到 3.8 Flash 的 high 档上会算错。上线前先看自己流量里的 completion_tokens(OpenAI 兼容)或 usageMetadata.candidatesTokenCount(原生协议),别直接照搬基准测试的数字。
怎么申请 Gemini 3.8 Flash 的 API key
打开 Google AI Studio,点 Create API key,不用单独注册。 Google 的 API key 指南写道:「如果你是新用户,接受服务条款后 Google AI Studio 会自动创建一个默认的 Google Cloud 项目和 API key。」已有 Google Cloud 账号的用户从后台选一个项目就行。这个 key 免费层立即可用,不需要绑卡。
上线前有两件事要做:
- 不要把 key 写进客户端代码。 官方指南原话:「编译进客户端代码的 key 会被用户提取出来。」浏览器或移动端的请求要走自己的后端代理,或者走一个自己签发受限 key 的网关。
- 在截止日期前迁移出 Standard key。 Google 官方原话:「2026 年 9 月:Gemini API 将拒绝 Standard key 的请求。你必须在此日期之前迁移到 auth key,以避免服务中断。」Standard key 只关联项目账单,不识别调用方;auth key 绑定到 service account,被盗后能更快封禁。官方文档没写具体是 9 月哪一天——今天申请的 key,这次迁移不是可选项,是这个月内必须完成的事。
怎么调用 Gemini 3.8 Flash
三条路:用 AI Studio 的 key 走 Gemini API、走 Vertex AI,或者等 OpenAI 兼容网关上架这个模型。
Gemini API,原生协议
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{"parts": [{"text": "把这个 GROUP BY 改写成窗口函数。"}]}],
"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}
}'
thinkingLevel 接受 low、medium、high。传 minimal 会报校验错误;3.7 Flash 指南里有那个 400 报错的原始内容,3.8 Flash 有同样的限制。
Gemini API,OpenAI 兼容
from openai import OpenAI
client = OpenAI(
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
api_key="YOUR_GEMINI_API_KEY",
)
r = client.chat.completions.create(
model="gemini-3.8-flash",
reasoning_effort="medium",
messages=[{"role": "user", "content": "把这个 GROUP BY 改写成窗口函数。"}],
)
print(r.usage.completion_tokens)
这条路径的参数叫 reasoning_effort,对应同样的三档。
Vertex AI
Google 的 Vertex 模型页标注 gemini-3.8-flash 「发布阶段:GA,发布日期:2026 年 9 月 2 日」,可用范围是 global 端点以及 us、eu 两个多区域,计费方式有 Standard、Flex、Priority 三种按量付费,也支持 Provisioned Throughput。Vertex 走 Google Cloud 账单,配额体系独立;如果 Gemini API 因为地区限制报错,Google 官方建议的替代路径也是 Vertex。
通过 Ofox
截至 2026 年 9 月 3 日,Ofox 目录里还没有 Gemini 3.8 Flash。 google/gemini-3.7-flash 已经在目录里,Google 供应商线路输入 $0.75、输出 $3.75(同一模型页上的 CloudVertex 线路是 $1.50 / $7.50,/v1/models 接口的 pricing 字段目前报的就是这个更高的数字),OpenAI 兼容端点 https://api.ofox.ai/v1 和 Google 原生 Gemini 协议 https://api.ofox.ai/gemini 都能走。3.8 Flash 上架后,模型字符串加上 google/ 前缀就是同样的调用方式。真正的目录以 GET https://api.ofox.ai/v1/models 的实时返回为准,不要照这篇文章的说法直接假设。
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
r = client.chat.completions.create(
model="google/gemini-3.7-flash", # 上架后换成 google/gemini-3.8-flash
reasoning_effort="medium",
messages=[{"role": "user", "content": "ping"}],
)
Gemini 3.8 Flash 和其他选项比价格
| 模型 | 输入/百万 | 输出/百万 | AA 指数 | 备注 |
|---|---|---|---|---|
| Gemini 3.8 Flash | $0.75 | $3.75 | 59(high) | 2027-01-01 翻倍 |
| Gemini 3.7 Flash | $0.75 | $3.75 | 56(high) | 2027-01-01 翻倍 |
| Gemini 3.5 Flash | $1.50 | $9.00 | — | 没有已公布的调价计划 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | — | |
| DeepSeek V4 Flash 0731 | $0.44 | $1.32 | 52 | 高峰时段价,非高峰对半;详见 3.8 Flash vs DeepSeek V4 Flash |
Gemini 价格来自 Google 定价页,DeepSeek 来自其 API 定价页,两者都是 2026 年 9 月 3 日读取;指数分数同日取自 Artificial Analysis。按 token 单价算,3.8 Flash 和 3.7、3.6 Flash 一样便宜,是当代 Flash 里最低的一档。按任务算,AA 的测量里 3.8 Flash 在 low 档最便宜($0.24),但只有 52 分;在 56 到 57 分这个区间,3.7 Flash 的 high 档和 3.8 Flash 的 medium 档只差一分钱。
记在日历上的那个日期
2027 年 1 月 1 日,Gemini 3.8 Flash 的每一格价格都会翻倍:标准价 $1.50 / $7.50,Batch 和 Flex $0.75 / $3.75,Priority $2.70 / $13.50,缓存读取 $0.15,存储每百万 token 每小时 $1.00。如果 token 用量不变,AA 测出的 $0.58 / $0.41 / $0.24 每任务成本会变成大约 $1.16 / $0.82 / $0.48。这条信息从发布起就印在定价页上,不是需要观望的传闻,而是可以直接排进预算表的一行。
信息来源
- https://ai.google.dev/gemini-api/docs/pricing
- https://ai.google.dev/gemini-api/docs/rate-limits
- https://ai.google.dev/gemini-api/docs/latest-model
- https://ai.google.dev/gemini-api/docs/api-key
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-8-flash
- https://artificialanalysis.ai/articles/gemini-3-8-flash
- https://ofox.ai/models/google/gemini-3.7-flash
价格、限流规则和 Batch 上限取自 Google 官方页面 2026 年 9 月 3 日的版本。Ofox 目录信息同日与 /v1/models 实时接口核对。
常见问题
- Gemini 3.8 Flash API 每百万 token 多少钱?
- 输入 $0.75、输出 $3.75,2026 年 12 月 31 日前有效,2027 年 1 月 1 日起同一格变成 $1.50 和 $7.50。输出价格含思考 token。缓存输入现在是 $0.075,1 月起 $0.15;缓存存储按每小时每百万 token $0.50 计,同日翻倍。
- Gemini 3.8 Flash 免费吗?
- Gemini API 免费层可用。Google 定价页在免费层那一列写着 Gemini 3.8 Flash 的输入、输出和上下文缓存都是「免费」。免费层的限流比付费层低,具体每模型的 RPM 和 TPM 数值 Google 只在 AI Studio 里展示,官方文档不公开。
- Gemini 3.8 Flash 的限流是多少?
- Google 不公开每个模型的 RPM 或 TPM,限流页原话是「可以在 Google AI Studio 里查看」。官方公开的是:Tier 1/2/3 分别每 10 分钟 $10/$50/$200 的花费上限,3.8 Flash 在这三个 Tier 的 Batch 排队 token 上限分别是 300 万、4 亿、10 亿,Priority 通道的限流是标准限流的 0.3 倍。限流按项目算,不是按 API key。
- Gemini 3.8 Flash 比 Gemini 3.7 Flash 便宜吗?
- 按 token 完全一样:输入 $0.75、输出 $3.75,Batch、Flex、Priority、缓存费率都相同,2027 年 1 月 1 日翻倍的时间点也一样。按任务算,3.8 Flash 更贵:Artificial Analysis 测到 high 档下每个智能指数任务 $0.58,3.7 Flash 是 $0.40,因为 3.8 Flash 每任务多写约 30% 的输出 token。
- Gemini 3.8 Flash 的模型 ID 是什么?
- gemini-3.8-flash,Gemini API 和 Vertex AI 上都是这个 ID。Vertex 上该模型于 2026 年 9 月 2 日 GA,覆盖 global 端点以及 us、eu 两个多区域。OpenAI 兼容协议下模型字符串不变。通过 Ofox 调用会是 google/gemini-3.8-flash,但截至 2026 年 9 月 3 日 Ofox 目录里只有 google/gemini-3.7-flash,还没有 3.8。
- Gemini 3.8 Flash 支持 minimal 思考档位吗?
- 不支持。Google 模型文档写明 minimal「Gemini 3.8 Flash 不支持,会返回错误」。支持的思考档位是 low、medium(默认)、high。如果配置里从旧版 Flash 模型继承了硬编码的 minimal,换模型 ID 后就会直接报错。
- 怎么申请 Gemini 3.8 Flash 的 API key?
- 去 Google AI Studio(aistudio.google.com/apikey)点 Create API key。新用户接受条款后会自动生成一个默认的 Google Cloud 项目和 key;已有 Cloud 账号的用户从后台选项目就行。免费层不需要绑卡就能拿到 key。Google 官方指南提醒不要把 key 硬编码进客户端代码,而且现在申请到的 Standard key 会在 2026 年 9 月被停用:官方原话是「Gemini API 将拒绝 Standard key 的请求」。要在那之前迁移到绑定 service account 的 auth key。


