Claude Opus 5 対 GPT-5.6 Sol(2026):ベンチマークと実際の請求額

Opus 5 対 Sol:AA Index 61 対 59。定価出力 $25 対 $30 は Opus 5 有利、ofox は Sol -20% の $4/$24 で請求が逆転。

Claude Opus 5 対 GPT-5.6 Sol(2026):ベンチマークと実際の請求額

要点。 Claude Opus 5 と GPT-5.6 Sol は、価格がほぼ誤差の範囲で並ぶ2つのフロンティアモデルであり、「安いのはどちらか」の答えは購入場所で変わります。ベンダー定価では入力($5/M)とキャッシュ($0.50/M)が同じで、違うのは出力だけです。Opus 5 が $25/M、Sol が $30/M なので、定価では Opus 5 が約17%安くなります。2026年7月27日時点の ofox では、Sol が -20% プロモ($4/$24/$0.40)中で Opus 5 は定価のままのため、これが逆転します。ofox では現在、Sol が全項目で安いのです。両モデルを同じハーネスで採点する唯一の第三者ベンチマーク Artificial Analysis Intelligence Index v4.1 では、Opus 5 が2ポイントリードします(max effort で 61 対 59)。それ以外の発表数値はすべて別々のハーネスによるベンダー自己申告で、横並びにはできません。Sol はトークンのストリーミングが約1.4倍速く(75.9 対 52.8 tok/s)、Opus 5 は初回トークン到達が約1.9倍速い(69.7秒 対 129.5秒)。どちらも同じ ofox キーで動くので、誠実な決め方は自分のタスクでの1行 A/B です。本記事は、本物の数字を示し、そうでない数字に注意を促し、検証用のハーネスを渡します。

要点:どちらを選ぶべきか

用途おすすめ理由
今 ofox で最も安いSolofox は Sol を -20%($4/$24/$0.40)で提供、プロモ期間中は全項目で安い
ベンダー定価で最も安いOpus 5出力 $25/M 対 $30/M、入力とキャッシュは同一
中立的な総合指標で最高スコアOpus 5AA Intelligence Index が max effort で 61 対 59
レイテンシに敏感な対話ターンOpus 5同一テストで初回トークンまで約69.7秒 対 約129.5秒
長い回答をできるだけ速くストリーミングSol出力 約75.9 tok/s 対 約52.8
すでに OpenAI Responses API を使い Pro/Ultra が欲しいSol高負荷計算モードは Sol のみ
コンピュータ操作とデスクトップ自動化Opus 5Anthropic の OSWorld/AutomationBench の主張(ベンダー発表、未検証)

一言でいうと、Opus 5 は比較可能な唯一のベンチマークで勝ち、立ち上がりが速い。Sol はストリーミングが速く、高負荷計算の上限を握り、プロモが続く間は ofox で安いモデルです。この2つは十分に接近しているので、決め手は自分のワークロードです。両方を1つのキーに載せたまま A/B しましょう。

主要スペック比較

両モデルとも現行フラッグシップで、互いに3週間以内に公開されました(Sol は7月9日に GAOpus 5 は7月24日)。以下の表はベンダーの定価ofox 価格を別々に載せています。両者は食い違っており、ofox は Sol を20%プロモで提供中だからです。すべての数値は2026年7月27日に各モデルの ofox ページと照合済みです。

項目Claude Opus 5GPT-5.6 Sol
ofox モデル IDanthropic/claude-opus-5openai/gpt-5.6-sol
入力(定価)$5.00 / M$5.00 / M
出力(定価)$25.00 / M$30.00 / M
キャッシュ入力(定価)$0.50 / M$0.50 / M
ofox 価格(7月27日)$5 / $25 / $0.50(定価、プロモなし)$4 / $24 / $0.40(-20% プロモ)
コンテキストウィンドウ1,000,000 トークン1,000,000 トークン
最大出力128,000 トークン128,000 トークン
推論制御Adaptive thinking + effort lowmaxreasoning_effort nonexhigh(chat)、max は Responses API
高負荷計算モードFast Mode(速度)、並列サブエージェント層なしPro / Ultra(Sol のみ、Responses API)
ネイティブ APIAnthropic MessagesOpenAI Responses / chat

紙の上では両者はほぼ一致します。同じコンテキスト、同じ出力上限、同じ $5 の定価入力です。実際に両者を分ける2点は、価格(定価では出力を除いて同一だが、現在は ofox の Sol プロモで組み替わっている)と、推論制御のためにどちらのネイティブ API を使うかです。下の価格セクションで両方の価格を実際の請求額に落とし込みます。

本当に比較できる唯一の数字

今週読むことになる GPT-5.6 対 Opus 5 の記事には、共通の罠があります。Terminal-Bench を1行目に、CursorBench を次の行に、その下に SWE-Bench の数字を並べた大きな表を作り、まるでそれらが同じ物差しで測られたかのように見せるのです。実際は違います。Anthropic は Opus 5 を Anthropic のハーネスで走らせ、OpenAI は Sol を OpenAI のハーネスで走らせました。ベンチマーク名が同じでも、測定を共有しているわけではありません。

両モデルが同じ第三者によって、同じタスクを、同じ採点者で採点される唯一の場所が Artificial Analysis Intelligence Index v4.1 です。この指標は9つの評価を重み付けした総合値で、GDPval-AA v2、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、AA-LCR などを含み、重みはおおよそエージェント34%、コーディング24%、科学的推論24%、汎用知能18%です。Artificial Analysis が両モデルを自前のハーネスで走らせているため、この総合値は現時点で存在する最も同条件比較に近いものであり、評価の構成は多くの人がこの2モデルの間で選ぼうとしている、まさにエージェント的・コーディング的な作業に寄っています。

Artificial Analysis Intelligence Index v4.1Claude Opus 5GPT-5.6 Sol
Intelligence Index(max effort)6159

出典:Artificial Analysis 比較ページ、2026年7月27日閲覧。Opus 5 は Adaptive Reasoning の max effort、Sol は max で採点。AA は継続更新されるベンチマークなので、正確な数値は変動する可能性があります。公開日にページを再確認してください。

Opus 5 は max effort で2ポイントリードしています。これは本物で、再現可能で、同一ハーネスの結果であり、この比較における最も強力な単一の事実です。同時に、差は小さいものです。参考までに、同じ指標は Claude Fable 5 を60(max)に置いています。つまり AA の総合値は、Opus 5 を Anthropic 自身のより大きなフラッグシップをわずかに上回ると評価し、Sol をわずかに下回ると評価しているのです。過度に重視する前に、これをよく読んでください。9評価の総合値での2ポイント差はノックアウトではありません。Opus 5 が広範な中立テストで少なくとも Sol と互角、おそらくわずかに上だとは言えますが、あなたのリファクタリング、あなたの移行、あなたのエージェントループでどちらが優れているかは教えてくれません。それを確かめるのが最後の A/B です。

発表ベンチマークが揃わない理由

両ベンダーとも発表数値を公開しています。読む価値はありますが、共有された1つの表としてではなく、別々の2つのマーケティング資料として読む限りにおいてです。出典別に分けます。

Anthropic の Opus 5 数値(Anthropic 社内、未検証、Opus 5 発表より):

ベンチマークAnthropic の主張
Frontier-Bench v0.1他の全モデルを上回る、Opus 4.8 の2倍超
CursorBench 3.2Fable 5 のピークとの差 0.5% 以内、コストは半分
ARC-AGI-3次点モデルの約3倍
OSWorld 2.0(コンピュータ操作)3分の1のコストで Fable 5 に勝る
GDPval-AA(経済的タスク)最高水準(SOTA)

OpenAI の GPT-5.6 Sol 数値(OpenAI 自前のハーネス、GA ローンチより):

ベンチマークOpenAI の主張
Terminal-Bench 2.188.8%(ベース)、91.9%(Ultra モード)
Agents’ Last Exam53.6(medium が約4分の1のコストで Fable 5 を 11.4 ポイント上回る)
SWE-Bench Pro64.6%

一方の表からもう一方を引き算することはできません。試すとどうなるか見てみましょう。OpenAI 自身の SWE-Bench Pro の行では Sol が 64.6% ですが、Anthropic は同名のベンチマークで Fable 5 を 80% と報告しており、これは Claude ファミリーがその項目で大きく先行していることを示唆するように見えます。しかしこの2つの数字も別々のハーネス実行から来ているので、その比較さえ根拠は弱いのです。誠実な立場は、発表資料は各モデルがそれぞれのベンダーのテストでフロンティア級であることを示すにすぎず、それ以上ではない、というものです。緩い言い換えがすでに出回っているので、正しく押さえておくべき点をあと2つ挙げます。

  • 91.9% は Ultra であってベースではありません。 「GPT-5.6 が 91.9% を記録」と引用される Terminal-Bench の見出しは、Sol が高負荷計算の Ultra モード(並列サブエージェント構成)で走った結果で、これはデフォルトではなく、タスクあたりのコストがはるかに高くなります。ベースの Sol は 88.8% です。3.1 ポイントの Ultra の上乗せが割に合うのは、最も難しいエージェント問題を除けばまれです。
  • 「Fable 5 の半額」という表現は Anthropic のもので、対象は Opus 5 であって Sol ではありません。 Opus 5 の売り文句は、Fable 5 に迫る知能を Fable 価格の半分で、というものです。これを GPT-5.6 に結びつけないでください。

Claude フラッグシップ層がコーディングタスクで実際にどう着地するかのより詳しい解説は、Fable 5 対 Opus 4.8 対 GPT-5.5 の SWE-Bench 分析 が本記事と同じようにハーネスを切り分けています。

価格計算:定価では Opus 5、ofox では現在それが逆転

ここには2つの価格があり、両者は食い違うので、分けて考えてください。

ベンダー定価。 Anthropic は Opus 5 を100万トークンあたり入力 $5 / 出力 $25 / キャッシュ $0.50 としています。OpenAI は Sol を $5 / $30 / $0.50 としています。入力とキャッシュは完全に一致するため、定価で違うのは出力の行だけで、ドル差の全体はフラットな $5/M の出力量から生まれます。定価では Opus 5 が安く、その差は出力の17%だけです。Artificial Analysis も、独自のキャッシュ/入力/出力の構成でブレンドして同意しています。Opus 5 が約 $3.85 / 1M、Sol が $4.35 です。

今日の ofox 価格。 ここで逆転します。2026年7月27日時点で、ofox は GPT-5.6 Sol を20%割引の 入力 $4 / 出力 $24 / キャッシュ $0.40 で提供しており、定価の $5/$30/$0.50 に対する値です。Opus 5 は定価の $5/$25/$0.50 でプロモなしです。したがって現在の ofox では、Sol が全項目で安いモデルです。入力 $4 < $5、出力 $24 < $25、キャッシュ $0.40 < $0.50。定価の判定が反転します。プロモは変動するので、ルートを確定する当日に両方のモデルページを再確認してください。

実際の ofox の数字を当てはめてみます。1日10万リクエスト、1リクエストあたり入力 4K・出力 2K のコーディングエージェント群を想定します。

項目Opus 5($5/$25)Sol -20%($4/$24)
入力:4K × 100K/日$2,000/日$1,600/日
出力:2K × 100K/日$5,000/日$4,800/日
1日合計(キャッシュなし)$7,000$6,400
月額(×30)約$210,000約$192,000
差額Sol が月 -$18,000

現実的な70%の入力キャッシュヒット率を有効にすると、順位は保たれますが差は縮まります。Opus 5 の実効入力単価は約 $1.85/M、Sol は約 $1.48/M に下がり、Opus 5 は月 $172,000 前後、Sol は $162,000 前後で、差はおよそ月 $10K です。入力の大半がすでにキャッシュされていると Sol の安い入力の効果が薄れるためキャッシュ下では差が縮まりますが、プロモが有効な間は ofox で Sol が先行し続けます。

つまりコストの答えには賞味期限があります。ベンダー定価では Opus 5 が勝ち、7月下旬時点の ofox では Sol のプロモが明確に安くします。ofox 経由で購入するなら、割引が終わるまでは価格を Sol の加点として扱い、実際に2つを分けるのは AA index のリード、レイテンシの差、API の形だとしましょう。

基本単価が隠す加算要素が2つあり、これらは均等には相殺しません。ウェブ検索のツール呼び出しはリクエストごとに課金され、しかも同額ではありません。ofox では Sol が 1検索あたり $0.035、Opus 5 が $0.015 なので、検索の多いエージェントは Opus 5 側に振れます。また速度の割増は別の項目です。Opus 5 の Fast Mode は同じモデルを最大2.5倍の出力速度で走らせる代わりに基本単価の2倍がかかり、Sol の Pro と Ultra モードはタスクあたりのトークンが増えます。これらは基本の表ではなく、自分の数字に織り込んでください。

速度とレイテンシ:勝つレースが異なる

コストは購入場所に依存するほぼ互角です。速度は本物の分かれ道であり、どちらが「速い」かは何を測るかに完全に依存します。Artificial Analysis は負荷下で両方をベンチマークしました(2026年7月27日閲覧、継続更新される数値です)。

指標(AA、max effort)Claude Opus 5GPT-5.6 Sol
出力速度52.8 tok/s75.9 tok/s
初回トークンまでの時間69.7 s129.5 s

Sol はトークンを生成し始めると約1.4倍速くストリーミングするので、ユーザーがストリームを見ている長い生成回答では Sol が先に完了します。Opus 5 は初回トークンに約1.9倍速く到達するので、短い対話ターン、ツール呼び出しループ、体感の応答性が重要な場面では Opus 5 のほうが速く感じられます。(初回トークンまでの時間がどちらも大きいのは、これらが高 effort テスト下の推論モデルだからです。重要なのは絶対秒数ではなく順序です。)対話型のコーディングアシスタントを運用するなら、通常は初回トークンの低レイテンシが素のスループットに勝ち、これは Opus 5 に振れます。長い文書のバッチ生成を運用するなら、スループットが勝ち、これは Sol に振れます。

API の現実:切り替えで実際に壊れるもの

ベンチマークはほぼ互角ですが、API の形はそうではありません。ここが2つのモデルが本当に違って感じられる部分で、多くの比較記事が飛ばすところです。実際のコードベースを移行するなら、次の点がまさに半日を奪う要因になります。

推論制御の場所が異なります。 Opus 5 は Anthropic の方式で、adaptive thinking がデフォルトで有効、深さは low から max までの effort ラダーで調整します(デフォルトは high)。Sol は OpenAI の reasoning_effort パラメータを使い、/v1/chat/completions では none から xhigh を受け付けます。OpenAI は Pro と Ultra モード、および推奨する max effort を Responses API 経由でルーティングします。したがって Opus 5 を最大推論に上げるのは1語の変更で済みますが、Sol の最重量モードは概ね別のエンドポイントへの移動を意味します。

Opus 5 はデフォルトで thinking を有効にするため、切り詰めが起こり得ます。 Opus 4.8 では thinking フィールドのないリクエストは thinking なしで走りました。Opus 5 では同じリクエストが推論し、max_tokens が thinking と可視出力の合計を上限とするため、無音の 4.8 向けに調整されたワークロードは切り詰められることがあります。以前の挙動に戻すには thinking: {"type": "disabled"} を設定するか、max_tokens を上げてください。人を驚かせる落とし穴が1つあります。Anthropic API では thinking の無効化は effort が high 以下のときだけ許可されるため、disabledxhigh/max の組み合わせは 400 を返します。

Sol は素の ID では 404 になります。 ofox では openai/gpt-5.6 は解決されません。openai/gpt-5.6-sol(または -terra/-luna)を渡す必要があります。model フィールドを文字列で入れ替えて A/B するなら、明示的な階層を使ってください。さもないと not-found エラーのデバッグに10分費やすことになります。より安い階層を同じルーティングテーブルに入れたい場合は、GPT-5.6 階層ガイド が Sol/Terra/Luna の全体像を扱っています。

512 トークンへのキャッシュ最小値の引き下げや、4.8 から引き継がれるサンプリングパラメータの拒否を含む、Opus 5 移行の完全なチェックリストは、Opus 5 API ガイド がすべての変更を解説しています。

Claude Opus 5 を選ぶべきとき

次のような場合は Opus 5 を選びましょう。

  • ベンダー定価で購入し、請求額を出力が支配している。 エージェント的コーディング、長いコード生成、冗長なツール利用ループなど。定価では17%の出力割引は規模が大きいほど実際のお金になり、見積もりも立てやすいです。(ofox では現在 Sol のプロモがこれを下回る点に注意。価格セクション参照。)
  • 中立的な最高スコアが欲しい。 Opus 5 は AA Intelligence Index を max effort で 61 対 59 とリードしています。2ポイント差ですが、誰もが持つ唯一の同一ハーネスでのリードです。
  • 初回トークンのレイテンシが重要。 対話型アシスタントやツール呼び出しエージェントは、TTFT 約69.7秒 対 約129.5秒でよりきびきび感じられます。
  • すでに Claude Code や Anthropic プロトコルを使っている。 Opus 5 は 4.8 からモデル文字列を差し替えるだけのドロップイン、定価も同じ $5/$25 で、新しい SDK なしに ofox の anthropic/claude-opus-5 に収まります。
  • コンピュータ操作やデスクトップ自動化が対象。 Anthropic の OSWorld 2.0 と AutomationBench の主張は資料の中で最も強い部分です(ただしベンダー発表なので検証を)。

GPT-5.6 Sol を選ぶべきとき

次のような場合は Sol を選びましょう。

  • ofox で購入し、今この瞬間に最も安い請求額が欲しい。 ofox の -20% プロモが続く間、Sol は全価格項目で Opus 5 より安いです($4/$24/$0.40)。プロモは失効するので、確定前に再確認を。
  • 長い回答をストリーミングし、スループットがボトルネック。 75.9 tok/s 対 52.8 は、持続生成で1.4倍の優位です。
  • Pro または Ultra の高負荷計算が必要。 Terminal-Bench で 91.9% を出した並列サブエージェントの Ultra モードには、Opus 5 に相当するものがありません。最も難しいエージェントタスクが本当にそのモードの恩恵を受けるなら、それは Sol にしかありません。
  • スタックがすでに OpenAI ネイティブ。 Responses API、ツールスキーマ、OpenAI のエコシステムに深く入り込んでいるなら、Sol は摩擦ゼロのアップグレードで、max effort の経路もすでに配線済みです。
  • 1つのファミリーで階層の柔軟性が欲しい。 Sol、Terra、Luna は同一世代を共有するので、大量トラフィックは 半額の Terra に落とし、難しい末端には Sol を残す、というのがすべて同じキーで可能です。

どちらも選ぶべきでないとき

そもそもフラッグシップ料金を払うべきでないワークロードもあります。タスクが大量の分類、ルーティング、短いチャットのつなぎ、あるいは限定的で明確に仕様化されたプロンプトが短い回答を返すようなものなら、これらのモデルはどちらも過剰で割高です。そうしたトラフィックはコスト階層に送りましょう。ofox では GPT-5.6 Luna が約 $0.80/$4.80 / M、Claude Sonnet 5 が約 $2/$10 で走り、推論負荷の高い末端には Opus 5 か Sol を残します。本番の LLM ルーティングで最も高くつく間違いは、1件の難しいケースのために全リクエストをフラッグシップに通すことです。デフォルトではなく難易度でルーティングしましょう。構造化された決め方が欲しいなら、Best AI Model for Coding 2026Best AI Model for Agents 2026 が階層化の全体像を示しています。

同じ判断をルーティングテーブルにすると次のとおりです。

リクエストが…ルーティング先理由
限定的・短文・大量(分類、ルーティング)Luna または Sonnet 5短く限定的な回答にフラッグシップ料金は無駄
推論負荷が高く、今 ofox の請求額を最小にしたいSol-20% プロモで全項目が安い
推論負荷が高く、ベンダー定価で購入Opus 5出力が17%安く、AA index で首位
対話型で初回トークンのレイテンシが重要Opus 5初回トークンまで約1.9倍速い
長いストリーミング出力でスループットが重要Soltokens/sec が約1.4倍高い
Pro または Ultra の高負荷計算が必要SolOpus 5 に相当機能なし

ofox で両方を試す:10行のコードで A/B

決着をつける唯一の比較は、自分のタスクで走らせるものであり、たいていはそれを走らせる手間が人々を止めます。ofox では両モデルが同じ OpenAI 互換エンドポイントに1つのキーで載っているので、A/B は2つのモデル文字列を回すループになります。同じ SDK、同じ請求項目、2つ目のアカウント不要です。2つの ID は anthropic/claude-opus-5openai/gpt-5.6-sol です。

Python:1つのループで両モデルを A/B

from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="your-ofox-key")

MODELS = ["anthropic/claude-opus-5", "openai/gpt-5.6-sol"]
task = "Refactor this module for testability and explain the two riskiest changes:\n\n<paste your real code>"

for model in MODELS:
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": task}],
    )
    usage = r.usage
    print(f"\n=== {model} ===")
    print(r.choices[0].message.content)
    print(f"[in={usage.prompt_tokens} out={usage.completion_tokens}]")

1つのおもちゃのプロンプトではなく、実際のタスク20〜30件で走らせ、モデルごとに completion_tokens を記録してください。その数に各モデルの出力単価(定価でも現在の ofox プロモでも、実際に払う価格)を掛ければ、同じループで品質とコストを測っていることになります。

Node:同じ構造

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.ofox.ai/v1", apiKey: "your-ofox-key" });

const models = ["anthropic/claude-opus-5", "openai/gpt-5.6-sol"];
const task = "Find the race condition in this service and propose a fix:\n\n<paste your real code>";

for (const model of models) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: task }],
  });
  console.log(`\n=== ${model} ===`);
  console.log(r.choices[0].message.content);
  console.log(`[in=${r.usage.prompt_tokens} out=${r.usage.completion_tokens}]`);
}

Opus 5 の adaptive thinking や Sol の reasoning_effort を試すには、Anthropic ネイティブの呼び出しを https://api.ofox.ai/anthropic にモデル claude-opus-5 で向け、Sol の max effort の呼び出しは OpenAI Responses API に向けてください。素の品質・コスト A/B なら、上の chat/completions ループで十分で、これは発表日のベンチマーク論争を自分のワークロードの数字に置き換える最速の方法です。

率直な結論

発表週のノイズを取り除くと、構図は狭いものです。両モデルを同じ方法で測る唯一のベンチマークでは、Opus 5 が max effort で2ポイント先行しています(61 対 59)。価格の答えは購入場所しだいです。ベンダー定価では Opus 5 が出力で約17%安いですが、今の ofox では Sol の -20% プロモが全項目で安くします。レイテンシでは Opus 5 の立ち上がりが速く(初回トークンまで約1.9倍)、スループットでは Sol のストリーミングが速い(約1.4倍)。それ以外のすべて、CursorBench の数字、Terminal-Bench の 91.9%、「Fable 5 に勝つ」という主張は、非公開ハーネスでのベンダー発表であり、自分で再現するまでは判断をほぼ動かすべきではありません。

だからこれは圧勝ではなく、本当に僅差の判断です。Opus 5 には持続的な強みがあります。中立総合値でのリード、低い初回トークンレイテンシ、Claude Code と Opus 4.8 からのドロップイン経路です。Sol はより速いストリーミング、Claude に相当のない Pro と Ultra の高負荷計算モード、そしてプロモが続く間はより安い ofox 請求額で対抗します。どちらも大量の分類やルーティングのトラフィックを担うべきではありません。それはコスト階層の仕事です。

2ポイントの指標差だけで本番ルートを移行する理由にはならず、来週失効しうるプロモも同様です。どちらも A/B を走らせる理由です。いずれのモデルの根拠も小さく現実的な強みの積み重ねであり、それを決定に変える唯一のものは自分の評価だからです。両モデルは同じキーで文字列1つ分しか離れていません。半日を使いましょう。

参考

関連記事:Claude Opus 5 API ガイドGPT-5.6 の階層:Sol、Terra、LunaGPT-5.6 Terra 対 GPT-5.5SWE-Bench における Fable 5 対 Opus 4.8 対 GPT-5.5