Claude Opus 5 对比 GPT-5.6 Sol(2026):基准 + 真实账单

Opus 5 对比 GPT-5.6 Sol:AA 指数 61 vs 59。前者牌价更低(输出 $25 vs $30),但 ofox 把 Sol 打 -20%($4/$24)反转账单。

Claude Opus 5 对比 GPT-5.6 Sol(2026):基准 + 真实账单

摘要。 Claude Opus 5 与 GPT-5.6 Sol 是两个几乎同价的前沿模型,谁”更便宜”取决于你在哪买。按厂商牌价,两者输入($5/M)和缓存($0.50/M)一致,只在输出上有别:Opus 5 是 $25/M,Sol 是 $30/M,所以按牌价 Opus 5 便宜约 17%。而在 ofox 上(截至 2026 年 7 月 27 日),Sol 正在打 -20% 促销($4/$24/$0.40),Opus 5 则维持牌价,于是局面反转:在 ofox 上,Sol 目前每一项都更便宜。在唯一一个用同一套测评同时给两者打分的第三方基准 Artificial Analysis Intelligence Index v4.1 上,Opus 5 领先两分(满档推理下 61 对 59)。其余所有发布数字都是厂商在各自不同测评上自报的,无法对齐。Sol 出词速度快约 1.4 倍(75.9 对 52.8 tok/s);Opus 5 首字更快约 1.9 倍(69.7s 对 129.5s)。两者都挂在同一个 ofox key 下,所以最实在的决策方式,是在你自己的任务上做一次一行代码的 A/B。本文给你真实可用的数字,标出不可信的那些,再把测评工具交到你手里。

摘要:到底该选哪个?

你的场景选择原因
现在在 ofox 上要最便宜Solofox 把 Sol 打到 -20%($4/$24/$0.40);促销期内每一项都更便宜
按厂商牌价要最便宜Opus 5输出 $25/M vs $30/M;输入和缓存相同
中立综合评分最高Opus 5AA 智能指数满档 61 vs 59
对首字延迟敏感的交互轮次Opus 5同一测试下首字约 69.7s vs 129.5s
尽可能快地流式输出长答案Sol输出约 75.9 tok/s vs 52.8
已在用 OpenAI Responses API 且想要 Pro/UltraSol重算力模式是 Sol 独有
电脑操作与桌面自动化Opus 5Anthropic 的 OSWorld/AutomationBench 口径(厂商数据,未经核实)

一句话:Opus 5 拿下唯一可对比的基准,且启动更快;Sol 出词更快、坐拥重算力天花板,并且在 ofox 促销期内是更便宜的那个。这两者足够接近,决胜局是你自己的工作负载,所以把它们放在同一个 key 上跑一遍 A/B。

规格速览对比

两个模型都是当前旗舰,上线时间相隔不到三周(Sol 于 7 月 9 日 GAOpus 5 于 7 月 24 日)。下表把厂商牌价ofox 价格分开列,因为二者不同:ofox 正在给 Sol 打八折。所有数字均以 2026 年 7 月 27 日各模型的 ofox 页面为准核对。

规格Claude Opus 5GPT-5.6 Sol
ofox 模型 IDanthropic/claude-opus-5openai/gpt-5.6-sol
输入(牌价)$5.00 / M$5.00 / M
输出(牌价)$25.00 / M$30.00 / M
缓存输入(牌价)$0.50 / M$0.50 / M
ofox 价格(7 月 27 日)$5 / $25 / $0.50(牌价,无促销)$4 / $24 / $0.40(-20% 促销)
上下文窗口1,000,000 tokens1,000,000 tokens
最大输出128,000 tokens128,000 tokens
推理控制自适应思考 + effort lowmaxreasoning_effort nonexhigh(chat);max 走 Responses API
重算力模式Fast Mode(提速),无并行子代理档Pro / Ultra(仅 Sol,走 Responses API)
原生 APIAnthropic MessagesOpenAI Responses / chat

纸面上两者几乎打平:相同的上下文、相同的输出上限、相同的 $5 牌价输入。真正把它们区分开的只有两处:价格(牌价上除输出外都相同,但目前被 ofox 的 Sol 促销打乱了)以及你为推理控制要用的原生 API。下面的定价小节会把两种价格都算成一张真实账单。

唯一一个你真能拿来比的数字

这周你会读到的每一篇 GPT-5.6 对 Opus 5 的文章里都藏着同一个陷阱:他们摆出一张大表,这一行放 Terminal-Bench,下一行放 CursorBench,再下面放一个 SWE-Bench 数字,仿佛这些数字都出自同一把尺子。并不是。Opus 5 是 Anthropic 在自家测评上跑的,Sol 是 OpenAI 在自家测评上跑的。基准同名,不等于同一次测量。

唯一由同一个第三方、在同一批任务上、用同一个评分器给两个模型打分的地方,是 Artificial Analysis Intelligence Index v4.1。这个指数是九项评测的加权综合,包含 GDPval-AA v2、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond 和 AA-LCR,权重大致为 agent 类 34%、编码 24%、科学推理 24%、通用智能 18%。因为 Artificial Analysis 是自己在自家测评上同时跑两个模型,它的综合分是目前最接近同标尺对比的东西,而且评测配比正好偏向大多数人在这两者之间纠结时最看重的 agent 和编码工作。

Artificial Analysis Intelligence Index v4.1Claude Opus 5GPT-5.6 Sol
智能指数,满档推理6159

来源:Artificial Analysis 对比页,读取于 2026 年 7 月 27 日。Opus 5 以 Adaptive Reasoning 满档打分,Sol 以 max 打分。AA 是滚动更新的基准,具体数字可能变动,发布当天请重新读取该页面。

Opus 5 在满档推理下领先两分。这是一个真实、可复现、同标尺的结果,也是本次对比里最硬的单一事实。但它同样很小。作为参照,同一个指数给 Claude Fable 5 打了 60 分(满档),也就是说 AA 的综合分把 Opus 5 排在 Anthropic 自家更大的旗舰之上一丝丝,把 Sol 排在其下一丝丝。在你为这两分下重注之前先想清楚:九项评测综合上的两分差距不是一记 KO。它告诉你 Opus 5 在一个广泛的中立测试上至少和 Sol 打平、大概率略好,但它没告诉你在你的重构、你的迁移、你的 agent 循环上谁更强。那正是文末 A/B 要解决的问题。

为什么发布基准对不上

两家厂商都公布了发布数字。它们值得一读,前提是你把它们当成两份独立的营销材料,而绝不当成一张共享的表。按来源拆开:

Anthropic 的 Opus 5 数字(Anthropic 内部,未经核实,出自 Opus 5 公告):

基准Anthropic 的说法
Frontier-Bench v0.1超越所有其他模型;较 Opus 4.8 提升一倍多
CursorBench 3.2达到 Fable 5 峰值的 0.5% 以内,成本只有一半
ARC-AGI-3约为次优模型的 3 倍
OSWorld 2.0(电脑操作)以三分之一成本击败 Fable 5
GDPval-AA(经济性工作)业界最优

OpenAI 的 GPT-5.6 Sol 数字(OpenAI 自家测评,出自 GA 发布):

基准OpenAI 的说法
Terminal-Bench 2.1基础 88.8%,Ultra 模式 91.9%
Agents’ Last Exam53.6(medium 以约 1/4 成本领先 Fable 5 11.4 分)
SWE-Bench Pro64.6%

你没法把一张表从另一张里减出来。试试就知道会发生什么:OpenAI 自己的 SWE-Bench Pro 一行给 Sol 打 64.6%,而 Anthropic 在同名基准上报告 Fable 5 拿 80%,这看上去像是 Claude 家族在这一项上遥遥领先。可这两个数字同样来自不同的测评运行,所以连这个对比都站不太住。诚实的立场是:发布材料只能证明各自的模型在自家测试里属于前沿一档,仅此而已。还有两点值得掰清楚,因为松散的转述已经在流传:

  • 91.9% 是 Ultra,不是基础。 那个被引成”GPT-5.6 拿了 91.9%“的 Terminal-Bench 头条,其实是 Sol 跑重算力的 Ultra 模式,一种并行子代理架构,它不是默认档,每个任务贵得多。基础 Sol 是 88.8%。3.1 分的 Ultra 增益,除了最难的 agent 问题,很少能回本。
  • “只要 Fable 5 一半价”这句话是 Anthropic 说的,讲的是 Opus 5,不是 Sol。 Opus 5 的卖点是接近 Fable 5 的智能、只要 Fable 一半价。别把它安到 GPT-5.6 头上。

想更完整地了解 Claude 旗舰档在编码任务上究竟落在哪,Fable 5 对 Opus 4.8 对 GPT-5.5 的 SWE-Bench 拆解用了和本文同样的方式把各家测评拆开看。

定价算账:牌价说 Opus 5,ofox 眼下反转

这里有两种价格,而且它们不一致,所以别混在一起。

厂商牌价。 Anthropic 给 Opus 5 标价每百万 token $5 输入 / $25 输出 / $0.50 缓存。OpenAI 给 Sol 标 $5 / $30 / $0.50。输入和缓存完全一致,所以按牌价唯一有别的一行是输出,整个金额差就是你的输出量按每百万固定 $5 的差价累计出来的。按牌价,Opus 5 是更便宜的那个,只在输出上便宜 17%,别处不便宜。Artificial Analysis 用它自己的缓存/输入/输出配比混合后也认同:Opus 5 约每百万 $3.85,Sol 约 $4.35

ofox 今日价格。 反转就在这儿。截至 2026 年 7 月 27 日,ofox 给 GPT-5.6 Sol 打八折,$4 输入 / $24 输出 / $0.40 缓存,对比它 $5/$30/$0.50 的牌价。Opus 5 维持牌价 $5/$25/$0.50,无促销。所以此刻在 ofox 上,Sol 每一项都更便宜:输入 $4 < $5,输出 $24 < $25,缓存 $0.40 < $0.50。牌价的结论被反转了。促销会变,落定路由那天请重新核对两个模型页面。

给它套上真实的 ofox 数字。一支编码 agent 集群,每天 10 万次请求,每次 4K 输入、2K 输出:

项目Opus 5($5/$25)Sol -20%($4/$24)
输入:4K × 10 万/天$2,000/天$1,600/天
输出:2K × 10 万/天$5,000/天$4,800/天
每日合计(无缓存)$7,000$6,400
每月(×30)~$210,000~$192,000
差额Sol 每月省 $18,000

再打开一个现实的 70% 输入缓存命中率,排序不变,只是差距收窄。Opus 5 的有效输入单价降到约 $1.85/M,Sol 降到约 $1.48/M,Opus 5 落在约 每月 $172,000,Sol 落在约 $162,000,相差约每月 $10K。缓存下差距变小,是因为一旦大部分输入已被缓存,Sol 更便宜的输入就没那么重要了;但在 ofox 上,只要促销还在,Sol 就一直领先。

所以成本这个答案是有保质期的。按厂商牌价 Opus 5 赢;在 ofox 上截至 7 月下旬,Sol 的促销让它彻底更便宜。如果你走 ofox 买,那就把价格算成 Sol 的一个加分项,直到折扣结束为止,而让真正区分两者的,是 AA 指数领先、延迟分化以及 API 形态。

还有两项基础价掩盖的附加费,而且它们不会均匀抵消。一次网页搜索工具调用是按请求计费的,而且并不相等:在 ofox 上,Sol 每次搜索收 $0.035,Opus 5 收 $0.015,所以搜索密集的 agent 会把天平往 Opus 5 那边掰。速度溢价则是单独的计费项:Opus 5 的 Fast Mode 以最高 2.5 倍输出速度跑同一个模型,价格是基础价的两倍,而 Sol 的 Pro 和 Ultra 模式每个任务要花更多 token。把它们算进你自己的数字里,而不是套基础表。

速度与延迟:它们赢的是不同的赛道

成本是一场取决于你在哪买的近乎平局。速度则是真正的分化,而哪个模型”更快”完全取决于你测的是什么。Artificial Analysis 在负载下对两者做了基准测试(读取于 2026 年 7 月 27 日;这些是滚动数字):

指标(AA,满档推理)Claude Opus 5GPT-5.6 Sol
输出速度52.8 tok/s75.9 tok/s
首字时间69.7 s129.5 s

一旦开始产出 token,Sol 大约快 1.4 倍,所以对于一段用户盯着流式输出的长答案,Sol 先完成。Opus 5 到达首字大约快 1.9 倍,所以对于短交互轮次、工具调用循环、以及任何看重”感知响应速度”的场景,Opus 5 感觉更快。(两个首字时间都很大,是因为它们是重推理测试下的推理模型;重点是排序,不是绝对秒数。)如果你跑的是交互式编码助手,低首字延迟通常胜过纯吞吐,这偏向 Opus 5。如果你跑的是长文档的批量生成,吞吐取胜,这偏向 Sol。

API 的现实:切换时真正会坏掉的东西

基准是近乎平局;API 形态不是。这才是两个模型真正感觉不同的地方,也是大多数对比文章跳过的部分。如果你要迁移一个真实代码库,下面这些才是真会耗掉你一个下午的东西。

推理控制放在不同的地方。 Opus 5 用 Anthropic 的方式:自适应思考默认开启,你用一个从 lowmaxeffort 阶梯来调节深度(默认 high)。Sol 用 OpenAI 的 reasoning_effort 参数,在 /v1/chat/completions 上接受 nonexhigh;OpenAI 把 Pro 和 Ultra 模式、以及它推荐的 max effort,都路由到 Responses API。所以把 Opus 5 调到最高推理是改一个词的事,而 Sol 最重的那些模式一般意味着换到第二个端点。

Opus 5 默认打开思考;这可能把你截断。 在 Opus 4.8 上,一个不带 thinking 字段的请求不会思考。在 Opus 5 上,同样的请求会推理,而由于 max_tokens 是把思考和可见输出合在一起封顶的,一个为静默的 4.8 调好的工作负载可能被截断。设 thinking: {"type": "disabled"} 恢复旧行为,或者调高 max_tokens。一个会让人吃惊的坑:在 Anthropic API 上,只有在 effort high 或更低时才允许禁用思考,所以 disabled 叠加 xhigh/max 会返回 400。

Sol 用裸 ID 会 404。 在 ofox 上,openai/gpt-5.6 解析不出来;你必须传 openai/gpt-5.6-sol(或 -terra/-luna)。如果你靠替换模型字段字符串来做 A/B,请用明确的档位,否则你会花十分钟去 debug 一个 not-found 错误。我们的 GPT-5.6 档位指南完整讲了 Sol/Terra/Luna 的拆分,如果你想把更便宜的档位放进同一张路由表的话。

完整的 Opus 5 迁移清单,包括缓存下限降到 512 tokens、以及从 4.8 延续下来的采样参数拒绝规则,Opus 5 API 指南会逐条讲过每一处变化。

何时该选 Claude Opus 5

在以下情况选 Opus 5:

  • 你按厂商牌价买,且输出主导你的账单。 agent 式编码、长代码生成、啰嗦的工具调用循环。按牌价,17% 的输出折扣在规模上是真金白银,而且可预测、好建模。(在 ofox 上请注意,Sol 的促销目前把这条压了下去;见定价小节。)
  • 你想要最高的中立评分。 Opus 5 在满档推理下以 61 对 59 领先 AA 智能指数。是两分的领先,但它是任何人手里唯一的同标尺领先。
  • 首字延迟重要。 交互式助手和工具调用 agent 在约 69.7s 首字对约 129.5s 时感觉更跟手。
  • 你已经在用 Claude Code 或 Anthropic 协议。 Opus 5 相对 4.8 只是改一个模型字符串就能替换,同样的 $5/$25 牌价,在 ofox 上落到 anthropic/claude-opus-5,无需新 SDK。
  • 电脑操作与桌面自动化在你的范围内。 Anthropic 的 OSWorld 2.0 和 AutomationBench 口径是它材料里最强的部分(仍是厂商自报,请自行核实)。

何时该选 GPT-5.6 Sol

在以下情况选 Sol:

  • 你走 ofox 买,且现在就想要最低账单。 只要 ofox 的 -20% 促销还在,Sol 每一条价格线都比 Opus 5 便宜($4/$24/$0.40)。落定前请重新核对,因为促销会过期。
  • 你流式输出长答案、吞吐是瓶颈。 75.9 tok/s 对 52.8,在持续生成上是 1.4 倍优势。
  • 你需要 Pro 或 Ultra 重算力。 那个在 Terminal-Bench 上刷出 91.9% 的并行子代理 Ultra 模式,Opus 5 没有对等物。如果你最难的 agent 任务真能从那个模式受益,它只在 Sol 上有。
  • 你的技术栈本就是 OpenAI 原生。 如果你深耕在 Responses API、工具 schema 和 OpenAI 生态里,Sol 是零摩擦的升级,而且 max effort 那条路已经接好。
  • 你想在同一个家族里有档位灵活性。 Sol、Terra、Luna 同代同源,所以你可以把大流量降到半价的 Terra,把 Sol 留给难啃的长尾,全都在同一个 key 上。

什么时候两个都别选

有些工作负载压根不该付旗舰价。如果你的任务是高并发分类、路由、短聊天粘合,或任何”一个边界清晰、说明良好的提示词得到一个简短答案”的场景,这两个模型都过剩且过贵。把那类流量发给成本档:在 ofox 上,GPT-5.6 Luna约 $0.80/$4.80 每百万,Claude Sonnet 5约 $2/$10,把 Opus 5 或 Sol 留给重推理的长尾。生产环境 LLM 路由里最贵的错误,就是因为某一个难例需要旗舰,就把每一个请求都塞进旗舰。按难度路由,别按默认路由。如果你想要一个有条理的决策方法,2026 最佳编码 AI 模型2026 最佳 agent AI 模型铺开了完整的分档。

把同一个决策写成一张路由表:

如果请求是……路由到原因
边界清晰、简短、高并发(分类、路由)LunaSonnet 5短而有界的答案上,旗舰价是浪费
重推理,且现在就在意最低的 ofox 账单Sol-20% 促销让它每一项都更便宜
重推理,按厂商牌价买Opus 5输出便宜 17%;领先 AA 指数
交互式,首字延迟重要Opus 5首字约快 1.9 倍
长流式输出,吞吐重要Sol每秒 token 约高 1.4 倍
需要 Pro 或 Ultra 重算力SolOpus 5 无对等物

用 ofox 同时试两个:10 行代码做 A/B

唯一能定案的对比,是你在自己任务上跑的那次,而把它跑起来的摩擦通常正是拦住大家的东西。在 ofox 上,两个模型挂在同一个 OpenAI 兼容端点、同一个 key 下,所以 A/B 就是对两个模型字符串做一次循环。同一个 SDK、同一条计费线、无需第二个账户。两个 ID 是 anthropic/claude-opus-5openai/gpt-5.6-sol

Python:一个循环里 A/B 两个模型

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="your-ofox-key")

MODELS = ["anthropic/claude-opus-5", "openai/gpt-5.6-sol"]
task = "Refactor this module for testability and explain the two riskiest changes:\n\n<paste your real code>"

for model in MODELS:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": task}],
    )
    usage = r.usage
    print(f"\n=== {model} ===")
    print(r.choices[0].message.content)
    print(f"[in={usage.prompt_tokens} out={usage.completion_tokens}]")

在你 20 到 30 个真实任务上跑它,而不是一个玩具提示词,并按模型记录 completion_tokens。把这个数乘以各模型的输出单价(你实际付的那个价,牌价或当前的 ofox 促销价),你就在同一个循环里同时量到了质量和成本。

Node:同样的写法

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.ofox.ai/v1", apiKey: "your-ofox-key" });

const models = ["anthropic/claude-opus-5", "openai/gpt-5.6-sol"];
const task = "Find the race condition in this service and propose a fix:\n\n<paste your real code>";

for (const model of models) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: task }],
  });
  console.log(`\n=== ${model} ===`);
  console.log(r.choices[0].message.content);
  console.log(`[in=${r.usage.prompt_tokens} out=${r.usage.completion_tokens}]`);
}

要动用 Opus 5 的自适应思考或 Sol 的 reasoning_effort,把 Anthropic 原生调用指向 https://api.ofox.ai/anthropic、模型用 claude-opus-5,把 Sol 的 max effort 调用指向 OpenAI Responses API。对于一次纯粹的质量与成本 A/B,上面的 chat/completions 循环就够了,而且它是把发布日的基准之争换成一个来自你自己工作负载的数字的最快方式。

老实说的结论

剥掉发布周的噪音,画面很窄。在唯一一个用同一种方式测量两个模型的基准上,Opus 5 在满档推理下领先两分(61 对 59)。价格上答案取决于你在哪买:按厂商牌价 Opus 5 输出便宜约 17%,但眼下在 ofox 上,Sol 的 -20% 促销让它每一项都更便宜。延迟上 Opus 5 启动更快(首字约快 1.9 倍);吞吐上 Sol 流得更快(约快 1.4 倍)。其余一切,CursorBench 那些数字、Terminal-Bench 的 91.9%、“击败 Fable 5”的说法,都是厂商在私有测评上自报的,在你复现它之前,它们该把你的决策挪动的幅度大约为零。

所以这是一次真正接近的抉择,不是一边倒。Opus 5 握着几处持久的优势:中立综合分领先、更低的首字延迟、以及从 Claude Code 和 Opus 4.8 平滑切换的路径。Sol 用更快的流式输出、Claude 没有对等物的 Pro 和 Ultra 重算力模式、以及促销期内更便宜的 ofox 账单来回击。两者都不该去处理你的大批量分类或路由流量;那属于成本档。

两分的指数差距本身不足以成为迁移一条生产路由的理由,一个下周就可能过期的促销同样不是。它们都是去跑 A/B 的理由,因为选择任一模型的依据都是由一堆小而真实的优势拼起来的,而唯一能把它变成决策的,是你自己的评测。两个模型在同一个 key 上只差一个字符串。花一个下午。

来源

延伸阅读:Claude Opus 5 API 指南(定价、4.8→5 的变化、以及如何调用)。GPT-5.6 档位:Sol、Terra、Luna(哪个档位配哪种活)。GPT-5.6 Terra 对 GPT-5.5(半价的中间档)。Fable 5 对 Opus 4.8 对 GPT-5.5 的 SWE-Bench(编码上的 Claude 旗舰档)。