Sonnet 5.5 или GPT-6 Sol: как выбрать модель для кода и оценить расходы
Сравните Sonnet 5.5 и GPT-6 Sol по задачам, effort, интеграции API и стоимости принятого исправления. Методика для повторяемой оценки без заранее выбранного победителя.
Claude Sonnet 5.5 и GPT-6 Sol разумно сравнивать для повседневного программирования, но нет доказательств, что одна модель дешевле для любой задачи в репозитории. Стандартный ввод/вывод Sonnet в Claude API стоит 2/10 долларов за миллион токенов. У GPT-6 Sol совпадают стандартные тарифы для короткого контекста; длинный контекст рассчитывается отдельно. Одинаковые ставки не означают одинакового расхода токенов или доли успешных решений.
Руководство рассчитано на разработчиков, выбирающих модель для конкретного исправления, небольшой функции или этапа ревью. Оно опирается на официальные документы и независимую стартовую оценку, проверенные 29 сентября 2026 года. Это не собственный сравнительный тест Ofox. Для выбора модели под свой репозиторий используйте предложенную методику, а не воспринимайте таблицу лидеров как гарантию результата в production.
Сначала сравните условия работы
| Критерий | Sonnet 5.5 | GPT-6 Sol |
|---|---|---|
| Документация нативного API | Сценарий Claude Messages | Документация модели и API OpenAI |
| Стандартный ввод/вывод, короткий контекст | 2/10 долларов за миллион токенов | 2/10 долларов за миллион токенов |
| Длинный контекст | Проверить актуальные условия Claude и выбранного сервиса | При вводе свыше 272K токенов весь запрос тарифицируется по 4/15 долларов за миллион входных/выходных токенов |
| Effort | Заново проверить уровни этой версии Sonnet | Использовать поддерживаемые уровни Sol; названия не являются общей единицей вычислений |
| Интеграция | Проверить изменения Sonnet 5.5 | Проверить endpoint OpenAI и цикл работы с инструментами |
| Приёмка | Ваши тесты и требования ревью | Те же тесты и требования |
Источники: спецификация Sonnet, документация GPT-6 Sol и цены OpenAI. Одинаковые названия effort у разных разработчиков намеренно не приравниваются друг к другу.
Что даёт стартовая оценка
Artificial Analysis описывает сильные результаты Sonnet 5.5 на высоких уровнях effort и одновременно большой расход выходных токенов. В анализе соотношения затрат и возможностей уровень high у Sonnet оказался близок к одной из конфигураций Sol, тогда как другие настройки выглядели менее выгодно. Это повод включить обе модели в пробный запуск, а не выбирать по одному максимальному баллу.
Авторы также сообщают о тестировании предварительного развёртывания Sonnet с ошибкой структурированного вывода и планируемом повторе соответствующих оценок. Эту оговорку нельзя опускать. Графики разработчиков, разные наборы тестов и результаты старого развёртывания нельзя соединять так, словно все прогоны имели одинаковые задачи и условия.
Для команды важнее конкретный вопрос: какая конфигурация выдаёт приемлемое исправление на её задачах в пределах бюджета? Терминальный бенчмарк отражает часть возможностей агента, но не измеряет время ревьюеров, правила проекта или стоимость дополнительного отката релиза.
Проведите ограниченное сравнение на коде
Возьмите несколько типичных задач вместо одной эффектной демонстрации: регрессию с известным падающим тестом, функцию с явными критериями приёмки и ревью с заранее внесённой ошибкой. Определите ожидаемый результат до просмотра ответов. Не включайте в материалы секреты production.
Для каждой попытки:
- Начинайте с одинакового чистого коммита и одинаковых разрешений инструментов.
- Передавайте одно описание задачи, инструкции репозитория и одинаковые файлы.
- Фиксируйте точную модель, effort, доступ через API или подписку, версию клиента и дату.
- Выполняйте одинаковые тесты и проверяйте итоговый diff, включая посторонние изменения.
- Сохраняйте расход токенов, категории кэша, повторы, время выполнения и время ручного ревью.
Успех после трёх повторов не равен успеху с первой попытки только потому, что итоговые патчи похожи. При этом одной неудачи недостаточно, чтобы объявить модель неспособной решать задачу. Публикуйте число и характер задач, а не только имя победителя.
Пример, в котором дешёвый запрос обходится дороже
Допустим, попытка стоит 0,10 доллара, и десять попыток дают десять принятых задач. Стоимость принятого результата — 0,10 доллара. Если другая конфигурация делает двадцать попыток по 0,07 доллара для тех же десяти задач, результат стоит 0,14 доллара. Это синтетические числа, а не измерения Sol или Sonnet.
Так меньшая сумма за отдельный запрос может проиграть после повторов. Отдельно сохраняйте число нерешённых задач: если постоянно исключать сложные неудачные случаи из расчёта, дешёвая модель будет выглядеть эффективнее, чем есть в действительности.
В интерактивной работе важно и время. Измеряйте путь до приемлемого патча, а не только токены в секунду. Быстрый первый ответ, запускающий ещё один цикл отладки, способен замедлить выполнение всей задачи.
С какой модели начинать
Если в приложении уже хорошо проверен цикл инструментов Claude, пробный запуск Sonnet может потребовать меньше изменений клиента, чем переход на другое семейство API. Но требования миграции на 5.5 всё равно нужно проверить. Если процесс уже построен на инструментах OpenAI, Sol естественно сохранить как исходную конфигурацию сравнения. Это оценка затрат на интеграцию, а не рейтинг способностей.
Начните с модели, для которой существующая интеграция позволяет провести контролируемый тест. Переключайтесь, когда другая улучшает измеренный показатель: стоимость принятого результата, время, качество патча или конкретную частоту ошибок. Не превращайте такое сравнение в общий рейтинг всех флагманов.
Руководство по стоимости Sonnet разделяет ввод, вывод и кэш. Для выбора внутри Claude есть Sonnet 5.5 против Opus 5.5, а руководство Sol/Luna/Astra по задачам рассматривает уровни OpenAI шире.
Часто задаваемые вопросы
- Эти модели стоят одинаково?
- На дату проверки совпадают стандартные тарифы ввода/вывода для короткого контекста. Это не делает одинаковыми расходы для всех размеров контекста, операций кэша, инструментов, провайдеров и завершённых задач.
- Доказывает ли балл Sonnet, что он лучше исправит мои ошибки?
- Нет. Балл помогает выбрать участников оценки. Полезность патча определяют ваши тесты, ограничения репозитория и результаты ревью.
- Не лучше ли сравнивать с GPT-6 Astra?
- Astra можно включить как ориентир для трудных задач. Здесь прямой участник сравнения — Sol для повседневного кода и затрат на задачу. Смешение уровней без указания нагрузки делает рекомендацию менее полезной.


