Grok 4.6 API 定价:过 200K 全请求翻倍,575 token 是分水岭

Grok 4.6 是 $2 输入 / $6 输出,但 prompt 一到 200K,整个请求的每个 token 都按双倍计。以及实测出来的、4.5 反而更便宜的那条界线。

Grok 4.6 API 定价:过 200K 全请求翻倍,575 token 是分水岭

Grok 4.6 是输入 $2.00 / 输出 $6.00(每 100 万 token),和 Grok 4.5 一模一样。 两张 model card 剩下的部分连速率限制都对得上。只有一个数字不同——缓存输入——而且贵的那个是新模型。

更大的那个数字根本不是两个模型之间的差异:prompt 到 20 万 token 时所有单价翻倍,而且是整个请求一起翻。

模型 ID:      grok-4.6 / grok-4.5(网关上是 x-ai/grok-4.6)
上下文:       两者都是 500K
200K 以下:    $2.00 输入 / $6.00 输出   两者相同
               缓存 4.6 是 $0.50,4.5 是 $0.30
200K 及以上:  $4.00 输入 / $12.00 输出  两者相同
               缓存 4.6 是 $1.00,4.5 是 $0.60
阈值行为:     适用于请求里的所有 token,不是只算超出部分
实测:         每请求固定输入开销 4.6 是 206 个 token,4.5 是 494 个
分水岭:       约 575 个缓存 token,低于它 4.6 每次更便宜
快照日期:     2026-08-19

Grok 4.6 API 多少钱?

输入 $2.00、缓存输入 $0.50、输出 $6.00,每 100 万 token,直到 prompt 达到 20 万。 数据来自 xAI 的模型列表,顺带一提,这个文档站现在自称 SpaceXAI:

模型上下文输入缓存输入输出
grok-4.6,prompt < 200K500K$2.00$0.50$6.00
grok-4.6,prompt ≥ 200K500K$4.00$1.00$12.00
grok-4.5,prompt < 200K500K$2.00$0.30$6.00
grok-4.5,prompt ≥ 200K500K$4.00$0.60$12.00
grok-4.31M$1.25$0.20$2.50

grok-4.3 放进这张表是有原因的。它比两个 4.x 旗舰输入便宜 38%、输出便宜 58%,上下文还是 1M 而不是 500K。如果你的负载不需要最新模型,下一档不是小钱。

网关这边单价原样透传。OpenRouter 和 ofox 挂的 x-ai/grok-4.6 都是 $2.00 / $6.00、上下文 500,000。两家目录都没暴露的是第二行——网关的模型列表一般每个模型只带一对价格,所以 200K 以上翻倍这件事在账单出来之前是看不见的。这一条要去 xAI 的表上读,别信目录字段。

prompt 越过 20 万 token 会发生什么?

整个请求重新定价,不是只算溢出部分。 xAI 的表述没有歧义:prompt 达到阈值的请求,其中所有 token 都按高档价计费。

两个相差 2,000 token 的请求,输出都是 2,000 token:

prompt 大小输入费用输出费用合计
199,000 token$0.398$0.012$0.410
201,000 token$0.804$0.024$0.828

prompt 多 1%,账单多 102%。这里没有渐变的斜坡,线以下的 token 也不打折。

实际后果是:即使上下文窗口有 500K,20 万对成本敏感的活来说是硬顶不是软顶。用掉窗口 40% 以上就已经在贵的那一档了。

有两件事让这条线比看起来更容易越过。第一,阈值算的是 prompt,所以一段长对话是一轮一轮走过去的,可能任何单条消息都不大却已经越线。第二,prompt 里装的不只有你的 prompt——这是下一节的主题。

如果你在做批量,办法是在线之前就切开而不是切在之后。两个 15 万 token 的请求,输入部分花 $0.60;一个 30 万 token 的请求,同样的 token 要 $1.20。

Grok 4.6 和 4.5 到底差在哪?

公开 card 上只差一个数字。 我们把两张 model card 拉下来逐字段并排:

字段Grok 4.6Grok 4.5
上下文窗口500,000500,000
模态文本、图像 → 文本文本、图像 → 文本
Function calling支持支持
Structured outputs支持支持
Reasoning支持支持
每秒请求数150150
每分钟 token 数50,000,00050,000,000
可用区域us-east-1、us-west-2us-east-1、us-west-2
输入 / 输出$2.00 / $6.00$2.00 / $6.00
缓存输入$0.50$0.30
别名未列出grok-4.5-latestgrok-build-latest

缓存输入在新模型上贵 67%。这跟通常的方向相反,而且它是「留着 4.5」的全部公开依据。

别名那一行如果你在用 Grok Build,值得再看一眼:grok-build-latest 指向的是 Grok 4.5 而不是 4.6。如果你以为 Build 档会跟着旗舰走,它不跟。订阅什么时候比按量便宜,见我们的 Grok Build 与 API 成本拆解

同一个 prompt 为什么在 Grok 4.5 上更贵?

因为每个请求都带着一块固定的输入 token,而 4.5 上这块比 4.6 大一倍多。

2026-08-19,我们经一个 OpenAI 兼容网关,给四个模型发了 1 词、50 词、200 词三档完全相同的正文,然后拟合直线。每个模型对正文的切分都精确是 1.00 token/词,但截距对不上:

模型固定输入开销其中报为缓存
x-ai/grok-4.6206 token128
x-ai/grok-4.5494 token384
x-ai/grok-4.34 token
z-ai/glm-5.312 token

4 和 12 是正常的 chat 模板。206 和 494 是一段前缀。自己加一条 system 消息,两个数字都只涨了那条消息本身的长度(7 个 token),所以这块东西垫在你发的内容底下,不是被你替换掉。

我们没有第二条通道可以做归因,所以来源按未证实处理:这个开销跟着模型走而不是跟着路由走——同一个端点上 4.3 和一个非 xAI 模型都没有——但要确认它是否来自上游,得有一把直连的 key。不管来源在哪,它都在你的账单上,所以要算进去。

按公开单价折算,在你发出自己的第一个 token 之前:

Grok 4.6Grok 4.5
缓存部分128 × $0.50/M = $0.000064384 × $0.30/M = $0.000115
非缓存部分78 × $2.00/M = $0.000156110 × $2.00/M = $0.000220
每请求$0.000220$0.000335
每 100 万次请求$220$335

4.5 缓存便宜是真的,但在短请求上,更大的前缀把这点便宜吃掉还不止。

它还吃掉你的余量。在 4.5 上,你会比自己数的 token 早 494 个撞上 200K 断崖,4.6 上早 206 个。如果你把 prompt 预算卡在 199,800 token,你其实已经超了。

你的负载该选哪个?

大约 575 个缓存 token,答案翻面。

这个算法小到可以手算。Grok 4.5 每 100 万缓存 token 省 $0.20,也就是每个缓存 token 省 $0.0000002。它每个请求在更大的前缀上多花 $0.000115。两者一除,得 575 个 token。

  • 缓存前缀小于约 575 token:Grok 4.6 每次更便宜
  • 缓存前缀大于约 575 token:Grok 4.5 更便宜,而且差距线性拉大
  • 一段 10 万 token 的缓存 system prompt 加工具定义,在 4.5 上每请求省 $0.02,大约是前缀罚金的 170 倍

200K 阈值不会移动这条线。过线之后两个模型所有单价都翻倍,缓存优势翻到每 100 万 $0.40,前缀罚金也同样翻倍,所以分水岭还是大约 575 个 token。

以上说的是输入。输出侧两个模型才真正分岔,而且完全不按缓存那套逻辑走。我们用同一个代码生成 prompt 各跑 8 次:

Grok 4.6Grok 4.5
completion_tokens 中位数216225
reasoning_tokens 中位数72330
计费输出中位数948263
延迟中位数15.8 秒5.0 秒
每 1000 次任务(含输入的总成本)$6.18$2.64

最后这一行是表里唯一不属于输出维度的数字,所以把口径写清楚:它是输出按 $6.00/100 万,加上输入按 $2.00/100 万,而输入侧包含上一节那块固定的每请求开销——4.6 是 244 个输入 token,4.5 是 532 个。只算输出的话是 $5.69 和 $1.58。这几次运行我们没有记录缓存命中,所以输入全部按未缓存价计,也就是说这个总成本是上界;如果前缀确实命中了缓存,实际更接近 $5.98 和 $1.99。不管按哪种算法,排序都不变。

16 条回答都包含函数定义和 docstring——这是结构检查而不是质量判断,我们没有给代码评分。没有疑问的是花费:这个任务上 Grok 4.6 计费的输出 token 是 4.5 的 3.6 倍,墙钟时间是 3.2 倍,而两个模型都把活干完了。

注意那两个字段名。这些模型上 completion_tokens 不包含 reasoning token:一个报 216 个 completion token 的响应,旁边挂着 723 个 reasoning token,而 total_tokens 是 prompt、completion 和 reasoning 三者之和。任何按 prompt_tokens × 输入价 + completion_tokens × 输出价 估价的工具,在这个负载上会把输出少算 77%,整个请求少算约 71%。这一个字段造成的误差比本文所有价格差都大。

所以短版结论是:长缓存前缀、以及不想为「思考」付钱的短确定性任务,选 4.5;额外的推理本身就是你要的东西时,选 4.6。

怎么调 Grok 4.6?

OpenAI 兼容,所以就是一个 base URL 加一个模型字符串。

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.ofox.ai/v1")

r = client.chat.completions.create(
    model="x-ai/grok-4.6",          # 想要便宜的缓存档就换 x-ai/grok-4.5
    messages=[{"role": "user", "content": "Refactor this module and run the tests."}],
)
u = r.usage
billed_output = u.completion_tokens + u.completion_tokens_details.reasoning_tokens
print(u.prompt_tokens, billed_output)

三件上手时最容易被咬的事:

  • 网关上模型 ID 带命名空间。 直连 xAI 用 grok-4.6;OpenRouter 和 ofox 上是 x-ai/grok-4.6,那个连字符是必须的。
  • logprobs 静默失效。 xAI 文档写明它在 grok-4.20 及更新的模型上不受支持、会被忽略。我们给两个模型都发了 logprobs: truetop_logprobs: 3:HTTP 200、无报错、响应里也没有 logprobs 对象。没有任何东西告诉你它没生效。
  • 两个模型都只在 us-east-1 和 us-west-2。 如果你有美国以外的数据驻留要求,不管价格如何这一对都不是答案。

ofox 充值立减 15%,活动至 2026-08-31,把 x-ai/grok-4.6x-ai/grok-4.5 放在同一把 key、同一个端点后面,跟另外约 130 个模型一起——上面那个 A/B 因此只是改一个字符串。线上目录规格见 Grok 4.6Grok 4.5 的模型页。

各家速率限制的横向对比,见我们的 LLM API 速率限制对比。老一代 Grok 阵容和 key 的完整配置流程,Grok API 定价与接入指南仍然覆盖了基础部分。

References

常见问题

Grok 4.6 API 多少钱?
prompt 在 20 万 token 以内时,输入 $2.00 / 100 万 token、缓存输入 $0.50、输出 $6.00。prompt 达到 20 万 token 及以上时变成 $4.00、$1.00、$12.00,而且高档价适用于该请求里的每一个 token,不是只算超出部分。
Grok 4.6 和 4.5 的区别是什么?
在公开的 model card 上只有一个数字不同。两者都是 500K 上下文、文本+图像输入输出文本、function calling / structured outputs / reasoning 全支持、150 RPS、50M TPM、只在 us-east-1 和 us-west-2 提供,输入 $2.00、输出 $6.00 也完全一致。唯一列出的差异是缓存输入:4.6 是 $0.50,4.5 是 $0.30。
Grok 4.5 比 4.6 便宜吗?
取决于你有多少 prompt 命中缓存。4.5 的缓存读取便宜 40%,但我们实测 4.5 每个请求还带着更大的固定开销,约 494 个输入 token,4.6 是 206 个。分水岭落在约 575 个缓存 token:低于这个数 4.6 每次更便宜,高于它 4.5 更便宜。
200K 阈值是只对超出的 token 收高价吗?
不是。xAI 文档明确写着,prompt 达到阈值的请求,其中所有 token 都按高档价计费。从 19.9 万 token 的 prompt 变成 20.1 万,账单大约翻倍,而不是多 1%。
Grok 4.6 的模型 ID 是什么?
xAI 自家 API 上是 grok-4.6。网关上带命名空间,OpenRouter 和 ofox 都是 x-ai/grok-4.6。另外 Grok 4.5 还带别名 grok-4.5-latest 和 grok-build-latest,也就是说 grok-build-latest 指向的是 4.5 而不是 4.6。
Grok 4.6 支持 logprobs 吗?
不支持。xAI 文档写明 logprobs 和 top_logprobs 在 grok-4.20 及更新的模型上不受支持、会被静默忽略。我们实测确认:请求返回 HTTP 200、没有报错,响应里也没有 logprobs 对象——依赖它的流水线会安静地失效而不是明确报错。
Grok 4.6 实际用掉多少 token?
比 completion 字段显示的多。在一个小的代码生成任务上,8 次运行里 Grok 4.6 报的是 completion token 中位数 216 加 reasoning token 723,而 Grok 4.5 是 225 加 30。reasoning token 与 completion_tokens 分开统计,但计入 total_tokens。