大模型 API 折扣价:13 个模型,哪些是真降、哪些是原价
五个系列 13 个模型在折。逐个对厂商官网价核过之后,折扣分成三类:真比厂商便宜、和厂商官网一分不差、厂商自己的限时价原样透传。只有第一类是网关让出的毛利。
现在 ofox 上有 13 个模型、横跨五个系列,实际扣费低于划线价。best-value 页按折扣力度排好了序,值得花两分钟看一眼,但真正要看的不是百分比。
要看的是这个百分比是拿什么当基准算出来的。这里三种降价意味着三件完全不同的事,其中只有一种是网关把自己的毛利让出来。
哪些模型在打折
五个系列:GPT、Gemini、GLM、Doubao、Seedance。 文本模型按百万 token 计费,Seedance 按输出秒数计费。
| 模型 | 输入 / 1M | 输出 / 1M | 缓存输入 |
|---|---|---|---|
openai/gpt-5.6-luna | $0.20 | $1.20 | $0.02 |
openai/gpt-5.6-terra | $2.00 | $12.00 | $0.20 |
openai/gpt-5.6-sol | $2.50 | $15.00 | $0.25 |
google/gemini-3.7-flash | $0.75 | $3.75 | $0.075 |
google/gemini-3.6-flash | $0.75 | $3.75 | $0.075 |
z-ai/glm-5.2 | $0.98 | $3.08 | $0.182 |
z-ai/glm-5.3 | $1.26 | $3.96 | $0.234 |
volcengine/doubao-seed-2.1-pro | $0.7072 | $3.536 | $0.1416 |
volcengine/doubao-seed-2.1-turbo | $0.3536 | $1.7696 | $0.068 |
四个 Seedance 走的是另一套计价表:seedance-2.0-mini 每秒 $0.02 起、seedance-2.0-fast $0.042、seedance-2.0 $0.063、seedance-2.5 在 480p $0.11 起、1080p 文生视频 $0.48、1080p 视频生视频 $0.568。最后这个模型是按分辨率和模式分档定价的,不是一个数,所以折扣页只显示它的 1080p 那一档,完整表格在模型页上。决定账单的是时长和分辨率,不是提示词长度,所以同分辨率下 30 秒的片子大约是 6 秒的五倍钱。
折后价真的比直连厂商便宜吗
有时候是,老实说得分三类讲。 上面每一个文本模型的价格,我们在 2026-08-21 都拿厂商自己的定价页对过一遍。它们分成三组,知道某个模型属于哪一组,就是「真省钱」和「看起来像省钱」的区别。
第一类:低于厂商官网价。 GLM-5.2 这里是 $0.98 / $3.08,Z.ai 自己是 $1.40 / $4.40,直连 Z.ai 的价打七折。GLM-5.3 是 $1.26 / $3.96,对同样的 $1.40 / $4.40,九折。两个 Doubao 也属于这一类:Seed 2.1 Pro 扣 $0.7072 / $3.536、Turbo 扣 $0.3536 / $1.7696,而 ByteDance 发布时公布的是每百万 ¥6 / ¥30,按我们在 Seed 2.1 接入指南里记下的汇率约合 $0.88 / $4.41。火山引擎用人民币定价,所以这个换算只能当近似值,不是分毫不差的对照。这一类里降幅最大的是 GPT-5.6 Sol:$2.50 / $15,对 OpenAI 标准档的 $5 / $30,正好一半——而且是在你真正同步调用的那一档上。
第二类:和厂商一分不差。 GPT-5.6 Luna 扣 $0.20 / $1.20,这就是 OpenAI 官方标准价,精确到分。GPT-5.6 Terra 扣 $2 / $12,同样一致。每 token 你省不到钱——这恰恰是重点:不加价、一把 key、故障转移路由白送,而不是当作增值服务收你钱。
第三类:厂商自己的推广价,原样透传。 Gemini 3.7 Flash 和 3.6 Flash 都是 $0.75 / $3.75。Google 自己也是这个价。那是 Google 的推广价,印在定价页上,到期日 2026-12-31,2027-01-01 起两个模型都回到 $1.50 / $7.50。没有人在给 Gemini 打折。网关只是把 Google 自己的限时价原封不动传下来——这是正确的做法,但它意味着这笔便宜消失在 Google 说了算的日子,而不是网关说了算的日子。
如果你的预算要跨过年,第三类就是需要多算一遍的那类。我们写过Gemini 3.7 Flash 那个价究竟是拿什么比出来的,包括存档的定价页——它显示对照基准在发布后 48 小时内就动过。
GPT-5.6 在这儿和在 OpenAI 差多少
三档里只有一档是真的半价,另外两档与源站相同。
| 模型 | 这里的价 | OpenAI 标准档 | 差别 |
|---|---|---|---|
| GPT-5.6 Sol | $2.50 / $15 | $5.00 / $30.00 | 一半 |
| GPT-5.6 Terra | $2.00 / $12.00 | $2.00 / $12.00 | 相同 |
| GPT-5.6 Luna | $0.20 / $1.20 | $0.20 / $1.20 | 相同 |
Sol 这一行还有个值得知道的点:$2.50 / $15 同时也是 OpenAI 给 Sol 的 Batch 和 Flex 档价。那两档是拿延迟换价格的,Batch 会在一个时间窗内异步返回结果,而不是在调用里返回。这里你是在普通同步请求上拿到这个数——这才是这个折扣的全部实质。
缓存输入是同样的结构:Sol 每百万 $0.25、Terra $0.20、Luna $0.02。跑一个每轮都重放同一段系统提示词的长期 agent,决定月账单的通常是缓存输入这一行,不是标价的输入价。
哪些折扣是跟着厂商活动走的
Gemini 和 Seedance,两个都是。 Google 的 Flash 价印着到期日。Seedance 的折扣跟着 BytePlus 的活动窗口,那些窗口有明确的起止日期而不是无限期,2.5 的窗口只覆盖 1080p 输出。
这件事只影响一个具体决定:要不要把某个价格写死进成本模型。第一类的价是商务安排,动起来慢。第三类的价跟着厂商的市场日历动。两类今天都是真金白银,但只有一类是你能填进「下季度」那个单元格的数。
best-value 页自己也写了这句话,是那一页上值得读两遍的一句:促销跟随厂商变化,可能随时结束。
折后价怎么用
你什么都不用做。 没有优惠码输入框、没有要切换的套餐、没有最低充值。模型页上的价就是这次请求扣费的价。
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="z-ai/glm-5.2", # 每 1M:输入 $0.98 / 输出 $3.08
messages=[{"role": "user", "content": "Summarise this changelog"}],
)
print(r.usage)
换模型是改一个字符串的事——这才是折扣清单值得关心的现实理由:如果一个分类任务现在跑在 $5 的第一梯队模型上,而 $0.98 的 GLM-5.2 能过你的质量线,迁移是一行代码,省下的是 5 倍。模型选型器可以按任务类型和预算帮你排好序,我们的 API 价格横评覆盖更大的范围,包括那些没在打折的模型。
如果你正好盯着某个系列,还有两篇值得读:GLM 5.3 的定价和 reasoning_effort 陷阱——默认 effort 档的账单是最便宜那档的 35 倍;以及Doubao Seed 2.1 接入指南,如果你想用火山引擎的模型但不想注册火山引擎。
这份清单里该挑哪个
| 你的需求 | 选 | 价格 |
|---|---|---|
| 大批量、够用就行的文本 | GPT-5.6 Luna | $0.20 / $1.20 |
| 能吃视频输入里最便宜的 | Doubao Seed 2.1 Turbo | $0.3536 / $1.7696 |
| 第一梯队推理,半价 | GPT-5.6 Sol | $2.50 / $15 |
| 长上下文检索加视频输入 | Gemini 3.7 Flash | $0.75 / $3.75 |
| 开源权重家族的编程与 agent | GLM-5.2 | $0.98 / $3.08 |
| 视频生成,每秒最便宜 | Seedance 2.0 Mini | 每秒 $0.02 起 |
上面这些价是控制台今天实际扣的钱。页面上它们旁边的百分比,是这个数字怎么来的背景信息——而这篇文章想说的是,背景比百分比值钱。
References
常见问题
- ofox 上哪些大模型 API 在打折?
- 五个系列共 13 个模型:GPT(5.6 Luna、Sol、Terra)、Gemini(3.7 Flash、3.6 Flash)、GLM(5.2、5.3)、Doubao(Seed 2.1 Pro、Seed 2.1 Turbo)和 Seedance(2.0、2.0 Fast、2.0 Mini、2.5)。实时清单在 best-value 页上,按折扣力度排序,厂商改价它就跟着变。
- 网关的折后价真的比直连厂商便宜吗?
- 看模型,答案分三类。GLM-5.2 的 $0.98 / $3.08 确实低于 Z.ai 自家的 $1.40 / $4.40。GPT-5.6 Luna 的 $0.20 / $1.20 与 OpenAI 官方价一分不差,每 token 省不到钱,但也不加价。Gemini 3.7 Flash 的 $0.75 / $3.75 是 Google 自己的推广价,2026-12-31 到期,根本不是网关给的折扣。
- GPT-5.6 走网关是什么价?
- Sol 每百万 token 输入 $2.50、输出 $15,Terra 是 $2 和 $12,Luna 是 $0.20 和 $1.20。OpenAI 官方标准档同款模型分别是 $5 / $30、$2 / $12、$0.20 / $1.20。只有 Sol 这一行是官方标准档的一半,另外两个完全相同。
- 用折后价需要填优惠码吗?
- 不用。模型页上写的价就是实际扣费的价,没有优惠码输入框、没有最低充值门槛、也没有单独要开通的折扣套餐。划线的那个数字是参照,不是需要解锁的条件。
- 这些折扣能持续多久?
- 没有统一的截止日,因为价格跟着各家厂商自己走。Google 在定价页上给 Gemini 3.7 和 3.6 Flash 标了 2026-12-31。Seedance 跟 BytePlus 的活动窗口。GLM 没有公布结束时间。把它们都当作「今天有效」,做季度预算前重新核一遍。
- 大批量跑文本,哪个折扣模型最便宜?
- GPT-5.6 Luna,每百万 token 输入 $0.20、输出 $1.20,缓存输入 $0.02。其次是 Doubao Seed 2.1 Turbo 的 $0.3536 和 $1.7696。两个都比第一梯队便宜一个数量级,而且都保留了工具调用和视觉输入。
- 视频模型也在折扣里吗?
- 四个 Seedance 在,而且它们按输出秒数计费而不是按 token:Seedance 2.0 Mini 每秒 $0.02 起、2.0 Fast $0.042、2.0 $0.063、2.5 在 480p 每秒 $0.11 起、1080p 文生视频 $0.48、1080p 视频生视频 $0.568。按秒计费意味着账单由分辨率和时长决定,跟提示词长度没关系。


