Grok 4.7 与 4.6 标准单价相同,为什么任务费用会变?
查看 Grok 4.7 输入、输出、缓存及长上下文费率,分清 Fast 与地域费用,再按真实用量计算完整 Agent 任务账单。
Grok 4.7 沿用了 Grok 4.6 的标准 token 费率,但完成同一个任务未必花同样的钱。更多思考、重复上下文、重试和工具调用,都可能在单价不变时推高总费用。
因此需要同时回答两个问题:这次请求适用哪档费率,以及任务完成前累计产生了多少用量?下列价格核对于 2026 年 9 月 22 日,属于 xAI 公共价表,不是 Ofox 报价或编程工具的订阅额度。
标准版 token 价格
| 提示词长度 | 未缓存输入/百万 token | 缓存输入/百万 token | 输出/百万 token |
|---|---|---|---|
| 少于 200,000 token | $2.00 | $0.50 | $6.00 |
| 大于或等于 200,000 token | $4.00 | $1.00 | $12.00 |
官方定价页明确:提示词达到 200,000 token 后,整次请求中的全部 token 按长上下文费率计费,并非仅对超出的部分加价。这是计费条件,不是两种上下文容量。
模型上下文窗口为 500,000 token。能装下更多资料,不意味着窗口范围内的所有请求都适用低档价格。估算长上下文任务前,应核对模型卡。
一个可重算的小例子
假设某次低档请求记录了 40,000 个未缓存输入 token、60,000 个缓存输入 token,以及 5,000 个计费输出 token:
未缓存输入:40,000 / 1,000,000 × $2.00 = $0.08
缓存输入: 60,000 / 1,000,000 × $0.50 = $0.03
输出: 5,000 / 1,000,000 × $6.00 = $0.03
token 费用合计: $0.14
这是根据假设用量计算的示例,不是实测账单,也未包含另计的工具或服务费用。如果其中 60,000 个输入 token 没有命中缓存,全部按普通输入计费,合计会变成 $0.23。重复相同文本不等于必然命中缓存,要看实际返回的用量分类。
如果服务商的“总输入”已经包含缓存输入,需要先减去缓存部分再计算未缓存费用,否则会重复计数。
Agent 费用为什么容易超出预期?
一个任务通常会调用多次模型。重试、复核和工具结果都可能触发下一轮。应记录从开始到验收通过的全部请求,包括失败尝试;只看最后一次成功响应,会漏掉前面的成本。
推理设置也要记录。不要拿设置不明的 4.6 与设置不明的 4.7 做对比。Artificial Analysis 在其 Grok 4.7 评估中观察到了更多输出 token,但这属于特定基准和配置的结果,不能直接变成你的应用费用倍率。
| 建议记录的字段 | 用途 |
|---|---|
| 精确模型和推理档位 | 确认比较的是哪些版本与设置 |
| 输入、缓存输入、计费输出 | 复算 token 费用 |
| 工具费用及重试 | 补齐最后一个答案之外的成本 |
| 验收结果 | 区分低价失败和有效完成 |
| 人工修正时间 | 判断是否真正减少工作量 |
Fast 和地域入口还会改变估算
Fast 有单独价表,仅通过 Cursor 和 Grok Build 提供,不是公共 API 型号。本次核对时,概览写了标准费率的两倍,但详细长上下文价表并不遵循该倍率。长提示词应核对当前 Fast 价表,不能把标准估算机械乘二。
美国地域接口另有 10% 的 token 费率溢价,见官方说明。不要把服务商未提供的组合也叠加计算。
网关还可能有自己的价格和活动期。某个平台的限时优惠不会改变 xAI 牌价,也不能证明其他平台支持同一模型。
是否值得从 4.6 升级?
固定一个有代表性的任务和验收测试,对比两版的完整运行。如果新版能完成旧版失败的任务,多消耗一些 token 可能有价值;如果两版都通过,就比较总费用、耗时和返工量,不必只因版本较新就切换。
先用入口指南选择产品,再按 API 接入说明保留用量和对话信息。更早的版本变化见 4.6 与 4.5 对比。
常见问题
- Grok 4.7 的 token 单价比 4.6 高吗?
- 公开标准费率相同,但每个任务的总用量可能不同。
- 文中的 $0.14 是真实账单吗?
- 不是,是按给定用量与标准低档价格计算的假设示例。


