Sonnet 5.5のeffortはどう選ぶ?medium・high・maxの評価方法

Sonnet 5.5のeffortを合格基準、待ち時間、タスク費用で選ぶ方法。APIとClaude Codeの既定値の違いや、高い設定を試す条件を説明します。

コンパスの線画と「Sonnet 5.5 Effort」のタイトル。

Sonnet 5.5のeffortは品質保証ではなく、評価する設定項目です。 Anthropicは、要件が明確なエージェント型コーディングや複数段階のツール作業ではmediumから始め、難しい作業や長い作業ではhighに上げることを推奨しています。応答時間が重要なチャットにはmediumかlowを挙げています。ネイティブAPIの既定値はhighで、Claude Codeには別の既定値があります。

この推奨は2026年9月29日に確認したSonnet 5.5の動作資料に基づきます。本記事はその釣り合いの調べ方を説明するもので、Ofoxが全effortをベンチマークしたという主張ではありません。

作業を決めてから設定を選ぶ

作業資料に基づく出発点確認する結果
応答時間が重要な短いチャットlowかmedium時間と必要な詳細の欠落
要件が明確なエージェント型開発mediumテスト、編集範囲、ツール往復
難しい・長いツール作業high合格結果と繰り返す失敗
難しい作業で失敗が続く基準構成と高いeffortを比較追加費用で結果が変わるか

最後の行は評価の提案であり、xhighやmaxで失敗が解消すると公式に保証されたわけではありません。要件不足、使えないツール、矛盾する指示があれば、どの設定でも解決しない場合があります。

モデルページはAPIの既定をhighとし、Claude Code設定資料は同クライアントでSonnet 5.5をmediumとしています。比較前に入口を記録してください。どちらも「既定のSonnet」と呼んでいても、設定が異なる場合があります。

maxを一律に勧められない理由

Artificial Analysisの公開時評価では、maxの出力トークン消費が多く、一部の代替構成に比べ費用との釣り合いが不利でした。同じレポートは高いベンチマーク能力も示しています。大量のトークンを使って高い結果に到達することはあり、両者は矛盾しません。

この報告は構造化出力のバグがある公開前環境を測定し、関連評価を再実施するとしています。ベンチマーク費用は自分のバグ修正の見積もりではなく、maxの実行がすべて無駄だとも証明しません。費用と品質を一緒に記録する理由として使ってください。

高いeffortでは、見える動作も変わることがあります。関連する仮説を確かめる探索なら役立ちますが、依頼範囲を超えたり無関係な作業に時間を使ったりすると逆効果です。合格基準にはテスト1本の成功だけでなく、作業範囲も含めましょう。

小さな比較実験を設計する

期待出力や合格条件がある代表タスクを用意します。モデル版、ツール、入力、リポジトリの開始状態を固定し、基準設定を実行してから同じタスクで高い・低い設定を試します。最初の試行が次の試行に答えを教えないようにしたい場合は、独立したセッションを使います。

少なくとも次を記録します。

タスク | Effort | 適用設定 | 合格 | 試行回数
経過秒数 | 入力トークン | キャッシュ区分 | 出力トークン
ツール料金 | 合計費用 | 範囲外の編集 | レビュー所見

初回の結果と再試行後の結果を分けます。時間やトークン上限で止めた実行には明示的な印を付け、通常の完了回答として扱いません。失敗も残してください。成功例だけの表では、最も安定した構成は分かりません。

追加費用や遅延に見合うほど重要な結果が改善した場合だけ、高い設定を維持するという判断ができます。結果を見る前に、その基準を定めましょう。たとえば誤ったパッチを減らすことを待ち時間より重視するチームもあれば、チャット製品では逆の場合もあります。他人のベンチマークから万能なしきい値を借りないでください。

無効なリクエストを作らずに設定する

ネイティブAPIのadaptive thinkingでは、次の本文を指定できます。

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 2048,
  "thinking": {"type": "adaptive"},
  "output_config": {"effort": "high"},
  "messages": [{"role": "user", "content": "List the acceptance checks for a CSV parser fix."}]
}

これは資料に沿ったリクエスト本文であり、実APIテストではありません。max_tokensは思考と回答本文の合計を制限します。思考本文が省略されても、そのトークンは出力として課金されます。思考量をその値まで要求する設定でも、すべてを含むドル予算でもありません。認証、バージョンヘッダー、レスポンス処理は別に必要です。

冒頭の思考を無効にするbetween_toolsでは、effortをhigh以下にします。xhighとmaxには対応せず、会話途中のeffort変更にも制約があります。古いdisabledや手動予算設定をコピーする前に移行チェックリストを確認してください。

Claude Codeでは--effort mediumで起動するか、/effortで対応するレベルを選びます。管理設定で実行時の上限が制限される場合があります。クライアントとアカウントの動作を確認せず、要求値と適用値を同一視しないでください。

モデル変更も比較する

難しい作業が残る場合は、Sonnetのeffortを上げる方法と別モデルを試す方法を比べます。Claude内の選択はSonnetとOpus、他社との試験はSonnetとSolで説明しています。構成を変えるときも、タスクと合格テストは固定します。

基準構成を選んだら、理由と、設定を上げるべき失敗を記録します。次のモデル更新も評価しやすくなります。Sonnet 5.5のeffortはSonnet 5から再調整されているため、古いラベルをそのまま使っても同じ動作の証拠にはなりません。

よくある質問

highはどこでも既定ですか?
いいえ。ネイティブAPIとClaude Codeでは文書上の既定値が異なります。アカウント制御や明示的な設定でも適用値は変わります。
between_toolsでmaxを使えますか?
いいえ。対応はlow、medium、highです。それ以上はadaptive thinkingを使います。
effortを下げれば完了タスクの費用も必ず下がりますか?
必ずではありません。1回のトークン数は減っても、試行回数や失敗が増える場合があります。単発応答ではなく、合格したタスク当たりの費用を測ってください。