Sonnet 5.5推理档位怎么选?medium、high和max的取舍

按验收结果、耗时和任务费用选择Sonnet 5.5 effort,分清API与Claude Code默认值,并测试提高推理档位是否值得。

指南针的艺术线稿,配有 Sonnet 5.5 Effort 标题。

把 Sonnet 5.5 的 effort 当作需要评估的参数,不要当作质量保证。Anthropic 建议,需求明确的 Agent 编程和多步工具任务可从 medium 开始,更难或更长的工作再试 high;对延迟敏感的聊天建议 medium 或 low。原生 API 默认值仍是 high,Claude Code 则有自己的默认设置。

这些建议来自 2026 年 9 月 29 日核对的 Sonnet 5.5行为文档。本文介绍怎样测试取舍,不声称 Ofox 对所有 effort 档位做过基准实测。

先看任务,再选起点

工作负载文档建议的起点需要观察
简短、对延迟敏感的聊天low或medium响应时间、是否遗漏必需信息
需求明确的Agent编程medium测试、修改范围、工具轮次
更难或更长的工具任务high结果是否通过验收、是否重复同类失败
仍然失败的难题相对基线测试更高档位多花的钱是否改变结果

最后一行是评估建议,不是官方保证 xhigh 或 max 可以修好问题。缺少需求、没有所需工具或指令互相矛盾的任务,任何档位都可能做不出来。

模型页面规定 API 默认 high,Claude Code配置文档则将该客户端的 Sonnet 5.5 默认值列为 medium。比较前先记录入口,否则两次都写“默认Sonnet”的运行,实际可能不是同一设置。

为什么不建议一律开max

Artificial Analysis发布评测发现 max 档输出 token 消耗很高,与部分替代配置相比成本取舍不利。同一报告也展示了较强的基准能力。这两点可以同时成立:模型可能通过花更多 token 获得更好的结果。

该报告测试了存在结构化输出问题的预发布部署,并说明相关项目将重跑。其基准费用不是你修 Bug 的报价,也不证明每次 max 都浪费。它更适合作为同时收集费用和质量的理由。

更高 effort 也可能改变行为。多探索一些方向,如果能验证相关解释,就有价值;如果扩大了修改范围或研究无关事项,就会产生负担。因此验收标准不仅要包含测试通过,还应包含范围约束。

设计一组小型档位对照

准备有代表性的任务,并写好预期输出或验收检查。固定模型版本、工具、输入和仓库初始状态。先跑基线,再在同样任务上测试高一档或低一档。如果不想让前一次答案影响后一次,应使用独立会话。

至少记录:

任务 | 请求的effort | 生效设置 | 是否验收通过 | 尝试次数
耗时秒数 | 输入token | 缓存分类 | 输出token
工具费用 | 总费用 | 范围外改动 | 审核备注

区分首次结果和重试后结果。设置时间或 token 上限时,明确标记被上限中断的运行,不要当成普通完整回答。保留失败样本;只展示成功案例的表格,无法证明哪个配置最可靠。

可以在看结果之前定一条规则:只有更高档位改善了足够重要的指标,值得增加费用或等待时间,才保留它。例如某团队更在意减少错误补丁,聊天产品可能更在意延迟。不要照搬别人基准里的统一阈值。

设置effort时避免生成无效请求

原生 API 的 adaptive-thinking 请求可以这样写:

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 2048,
  "thinking": {"type": "adaptive"},
  "output_config": {"effort": "high"},
  "messages": [{"role": "user", "content": "List the acceptance checks for a CSV parser fix."}]
}

这是依据文档整理的请求体,不是真实 API 测试。max_tokens 限制思考与回答文本的总量;即使思考文本被省略,思考 token 仍按输出计费。它不是指定思考用量,也不是包含一切费用的美元预算。认证、版本请求头和响应处理仍需分别实现。

如果用 between_tools 关闭执行前思考,effort 应保持 high 或以下;该模式不支持 xhigh 和 max,对话中途修改档位也有约束。复制旧版 disabled 或手动预算配置前,先看迁移清单。

Claude Code 启动可用 --effort medium,交互时可用 /effort 选择受支持档位。托管设置可能限制实际生效值。没有检查客户端与账户行为之前,不能把请求值当作生效值。

什么时候应考虑换模型

任务一直很难时,可以比较提高 Sonnet effort 和换模型两条路线。Sonnet与Opus讨论 Claude 内部选择,Sonnet与Sol讨论跨厂商测试。改变配置时,任务与验收测试保持一致。

选定基线后,记录选择原因,以及哪些失败允许升级处理,下一次模型更新就更容易评估。Sonnet 5.5 相对 Sonnet 5 重新校准过 effort 档位,沿用旧名称却不测试,不能证明行为等价。

常见问题

所有入口都默认high吗?
不是。原生 API 与 Claude Code 有不同的文档默认值,账户控制和显式设置还可能改变最终应用的配置。
between_tools能配max吗?
不能。该模式支持 low、medium、high。更高 effort 使用 adaptive thinking。
降低effort一定能让完整任务更便宜吗?
不一定。单次 token 可能减少,但重试或失败可能增加。应统计通过验收的任务成本,而不只看一条回答。