Opus 5 против Grok 4.6: в 3.6 раза дороже за 1.75 раза кода

Одна реальная задача, замеры: Opus 5 стоит в 3.6 раза дороже Grok 4.6 и возвращает в 1.75 раза больше кода вдвое быстрее. Плюс поле usage, которое прячет счёт.

Opus 5 против Grok 4.6: в 3.6 раза дороже за 1.75 раза кода

Кратко

На одной и той же задаче Opus 5 выставляет счёт в 3.6 раза больше, чем Grok 4.6, — почти ровно то, что обещает прайс-лист. Он же возвращает в 1.75 раза больше кода и делает это вдвое быстрее по часам, а вот об этом прайс-лист не говорит ничего.

Под этим лежит вторая проблема. Два провайдера расходятся в том, что считать выводом, поэтому одна и та же формула стоимости даёт верный ответ на Opus 5 и ответ на 78% ниже на Grok. Ниже: замеренные числа, поле usage, из-за которого возникает расхождение, и запись в таблице лидеров, которой на деле не существует.

Насколько Opus 5 дороже Grok 4.6?

По прайс-листу — в 3.75 раза: $30 за миллион токенов суммарно против $8. Обе цены прочитаны со страниц моделей ofox 2026-08-20, а не из catalog API, который показывает только один ценовой уровень и теряет второй у Grok.

Claude Opus 5Grok 4.6
Вход / 1M$5.00$2.00
Выход / 1M$25.00$6.00
Чтение кэша / 1M$0.50$0.50
Запись в кэш / 1M$6.25 (5 минут), $10 (1 час)не тарифицируется
Контекстное окно1M500K
Максимум вывода128K66K
Дата выхода2026-07-252026-08-12

Две строки заслуживают больше внимания, чем ставки из заголовка.

Запись в кэш асимметрична. Anthropic берёт деньги за то, чтобы положить промпт в кэш, и ещё раз, по меньшей ставке, за чтение обратно. xAI тарифицирует только чтение. Если ваш агент переписывает длинный системный промпт или большую схему инструментов в каждой сессии, счёт определяет именно эта строка, а не входные $5 против $2.

У Grok 4.6 есть второй ценовой уровень, которого не видно в каталоге. Как только промпт достигает 200K токенов, каждый токен этого запроса тарифицируется вдвое ($4 на вход, $12 на выход), а не только токены сверх порога. Где именно проходит этот обрыв, мы замерили в разборе цен Grok 4.6. Ничто ниже его не пересекает: во всех прогонах здесь по несколько сотен токенов промпта.

Во что реально обходится одна настоящая задача?

$0.1417 на Opus 5 и $0.0397 на Grok 4.6. Opus 5 дороже в 3.6 раза против 3.75, которые подразумевает прайс-лист.

Задача: переписать Python-модуль разбора CSV так, чтобы он работал потоково, а не буферизовал файл целиком, надёжно определял заголовок, показывал некорректные строки вместо их отбрасывания и хранил деньги в Decimal. По четыре прогона на модель, один и тот же промпт, один и тот же OpenAI-совместимый эндпоинт, без стриминга, max_tokens 8000, 2026-08-20.

Opus 5Grok 4.6Grok в % от Opus 5
Токены промпта270381н/д
Видимые токены вывода (медиана)5,6161,308н/д
Токены reasoning (медиана)отдельно не сообщаются5,229н/д
Всего токенов (медиана)5,8866,865н/д
Время по часам (медиана)59.0s109.4s185%, то есть медленнее
Символов вывода (медиана)9,0445,16057%
Счёт за прогон (медиана)$0.1417$0.039728.0%
Стоимость 1,000 символов вывода$0.01567$0.0076949%

Строка со счётом — это итог, а не только вывод: вход по указанной ставке плюс всё, что провайдер считает выводом, посчитанное как total_tokens - prompt_tokens. У Grok это намеренно включает токены reasoning, поэтому строка не сходится со строкой видимого вывода. Следующий раздел как раз об этом разрыве. Вход при таком размере промпта — погрешность: $0.00135 у прогона Opus 5 и $0.00076 у прогона Grok.

То есть заголовочный вывод держится, а потом перестаёт держаться. За прогон Opus 5 дороже в 3.6 раза. Нормируйте на то, что реально вернулось, — и он дороже всего вдвое. Разрыв по-прежнему настоящий, но вдвое меньше, чем вы ожидали по прайс-листу.

Обе модели каждый раз выдавали рабочий модуль. Обрывов не было: все восемь прогонов вернули finish_reason: stop. Разница в дотошности, а не в правильности: Opus 5 написал больше веток обработки ошибок, больше текста в docstring, а в одном прогоне — небольшой пример использования. Нужно вам это или нет, зависит от задачи, и в этом весь смысл.

Почему Grok медленнее, если пишет меньше?

Потому что большую часть написанного вы не видите. Медиана reasoning — 5,229 токенов против 1,308 токенов видимого ответа: четыре токена рассуждения на каждый токен файла, который вам отдают. Opus 5 на этом промпте тоже думает, но разбивку не сообщает.

Скрытую часть Opus 5 видно косвенно. В первом заходе, без явного max_tokens, один прогон Opus 5 сообщил 4,096 токенов completion и вернул 845 символов текста. Четыре тысячи токенов не дают 845 символов Python. Остальное — размышление, за которое выставили счёт и которое не вернули.

Почему оценка стоимости ошибается ровно у одной из этих моделей?

Потому что completion_tokens означает разное в двух API, а привычная формула подходит только к одному из них.

Почти каждый сниппет подсчёта стоимости в интернете считает так:

cost = (usage.prompt_tokens * in_rate + usage.completion_tokens * out_rate) / 1e6

Примените его к тем же четырём ответам Grok 4.6 — получите медиану $0.0086. Реальная медиана — $0.0397. Формула занижает счёт на 78%.

Причина в одном поле:

ПолеOpus 5Grok 4.6
completion_tokensвключает размышлениене включает reasoning
completion_tokens_details.reasoning_tokensотсутствуетприсутствует, и оно большое
total_tokensprompt + completionprompt + completion + reasoning

Проверено коротким стриминговым запросом к обоим: Grok вернул prompt 227 + completion 189 + reasoning 444 = total 860, а 227 + 189 по отдельности дают 416. Opus 5 вернул prompt 40 + completion 891 = total 931, поля reasoning не было вовсе.

Переносимая формула для выходной стороны — total_tokens - prompt_tokens. Она верна для обоих, переживёт добавление поля reasoning у любого провайдера позже, и именно на ней построены все числа в этом тексте.

out_tokens = usage.total_tokens - usage.prompt_tokens
cost = (usage.prompt_tokens * in_rate + out_tokens * out_rate) / 1e6

Одно следствие стоит проговорить прямо: если вы сравнивали эти две модели обычной формулой и заключили, что Grok дешевле в 16 раз, это число было артефактом поля, а не свойством модели.

Стоит ли один и тот же промпт одинакового числа токенов у обоих?

Нет. Opus 5 тарифицирует меньше токенов за идентичный английский текст, и это подъедает разрыв во входных ценах.

Тот самый промпт на 1,130 символов отмерился в 270 токенов на Opus 5 и в 381 на Grok 4.6. Выглядит так, будто экономнее Opus 5, и на входной стороне это действительно так, но только после учёта того, что едет вместе с текстом. У Grok 4.6 есть фиксированная надбавка около 206 токенов на запрос, и это не ваш текст; замеры 4.6 против 4.5 фиксируют её аппроксимацией по трём точкам. Вычтите её — и ваши 1,130 символов стоят около 175 токенов на Grok против 270 на Opus 5, то есть 6.5 символа на токен против 4.2.

Два практических следствия:

  • Короткие частые вызовы одновременно играют на токенизатор Opus 5 и на прайс-лист Grok, а исход решает фиксированная надбавка. При нескольких сотнях символов на вызов 206 токенов преамбулы — это большая часть вашего входного счёта на Grok.
  • Вход здесь в любом случае меньшая половина. Выход стоит впятеро дороже входа и у Grok, и у Opus 5, а эти прогоны дали в 15-25 раз больше выходных токенов, чем входных. Разница токенизаторов на промпте двигает итог на единицы процентов. Не оптимизируйте не тот конец.

Что на самом деле говорят бенчмарки?

Меньше, чем вам рассказали. Ни одной из моделей нет в таблице лидеров Terminal-Bench 2.1.

Это стоит разобрать, потому что широко разошедшаяся в этом месяце сводка поставила Opus 5 на 86.7% в Terminal-Bench 2.1 и назвала это явным лидерством. Официальная доска на 2026-08-20:

МестоAgentМодельТочность
1Claude CodeFable 583.8% ± 1.2%
2CodexGPT-5.583.1% ± 1.1%
3Terminus 2Fable 580.4% ± 1.2%
4Cursor CLIGrok 4.579.3% ± 1.5%
5Claude CodeOpus 4.878.9% ± 1.3%

Всего 17 записей, каждая проверена участником команды Terminal-Bench, самая свежая датирована 2026-07-11. Ни Opus 5, ни Grok 4.6. Верхний результат на доске — 83.8%, так что 86.7% не просто лидировали бы: они оказались бы выше вершины доски, на которой этой модели нет. Terminal-Bench 2.0 — отдельная таблица со 142 записями — тоже не содержит ни одной из двух моделей.

Это не значит, что 86.7% выдуманы. Вендоры прогоняют такие наборы внутри и публикуют до подачи заявки, а сам выбор harness двигает результаты терминальных агентов на несколько пунктов. Это значит, что число заявлено вендором, а не проверено таблицей, и что сравнивать его с числом другого происхождения для второй модели — значит не сравнивать ничего.

Та же осторожность нужна и с цифрами, которые ходят про Grok 4.6. Единственное, что официальная доска действительно говорит про это семейство, — деталь, которую никто не цитирует: у записи Grok 4.5 на четвёртом месте стоит hack rate -9.0%, крупнейший на доске на порядок. Это значит, что проверяющие сочли такую долю успешных прогонов результатом обыгрывания теста, а не решения задачи. У Opus 4.8 на пятом месте — -0.0%. Если вы выбираете модель, которая будет работать по тестовому набору без присмотра, этот столбец полезнее столбца с точностью.

Тогда что сравнивать?

Свою нагрузку по двум числам, которые замеряет этот текст: счёт за выполненную задачу и объём вывода за доллар. Оба воспроизводятся за вечер, и ни одно не зависит от harness вендора. Сравнение Opus 5 и GPT-5.6 Sol проходит то же упражнение с другим соперником и приходит к тому же выводу про стартовые бенчмарки.

О чём на самом деле сообщает сообщество?

Ровный поток жалоб на поведение Opus 5 и почти полная тишина про Grok 4.6 в контексте разработки. Информативны обе половины.

В 30-дневном окне из 1,338 постов, собранных с девелоперских сабреддитов 2026-08-20, треды про Opus 5, собравшие реальное обсуждение, были в подавляющем большинстве негативны именно про опыт работы, а не про способности:

  • Opus 5 is a practically unusable model, r/ClaudeCode, 978 голосов, 617 комментариев. Важна формулировка автора: «регресс, который бенчмарки полностью пропустили», с описанием забытого контекста и повторяющихся ошибок за полторы недели работы.
  • Opus 5 is actually almost rage-inducing to use, r/ClaudeAI, 1,316 голосов, 446 комментариев. Показательно, что автор перед публикацией уже применил обновлённые рекомендации Anthropic по промптингу и переписал свой CLAUDE.md.
  • Opus 5 ARC AGI score was benchmaxxed, r/singularity, 1,607 голосов, 237 комментариев. То же подозрение к заголовочным баллам, которое проверка Terminal-Bench выше превращает в проверяемый факт.

На стороне Grok единственный сколько-нибудь заметный тред в девелоперском контексте за то же окно — Grok 4.6 Benchmarks на r/opencodeCLI со 134 голосами и 93 комментариями. Более крупные сообщества вокруг Grok в этом окне обсуждают модерацию изображений и отмену подписок, а не интеграцию с API.

Всё это — свидетельство того, что люди спорят, а не того, что верно. Ни одно утверждение из этих тредов здесь не воспроизводится как факт. Измеримая версия жалобы — в таблице выше: на этой задаче Opus 5 выдал в 1.75 раза больше вывода, чем Grok 4.6, за 3.6 раза большую цену. Это реальный размен, и для рутинной работы он далеко не очевидно выгоден. Разбор сообщений про Opus 5 по симптомам, включая то, какие из них относятся к промптам, а не к модели, — в альтернативах Claude Opus 5.

Что ломается при переходе?

Четыре вещи, и все чинятся дёшево, если о них знать.

СимптомПричинаРешение
Вывод обрывается посреди файла ровно на 4,096 токенахmax_tokens не задан, это значение по умолчаниюЗадайте явно. Opus 5 допускает 128K, Grok 4.6 — 66K
Счёт на Grok примерно вчетверо больше вашей оценкиcompletion_tokens не включает reasoning_tokensИспользуйте total_tokens - prompt_tokens
В ответе Opus 5 нет текста рассужденияРазмышление тарифицируется внутри completion_tokens и не возвращается в нестриминговых ответахВключите стриминг, если оно нужно, и ждите reasoning_details, а не строку reasoning
Промпт свыше 200K внезапно удваивает счёт на GrokВторой ценовой уровень применяется ко всему запросуДержите промпт ниже 200K или закладывайте $4/$12

Сам переход — замена строки, если вы уже на OpenAI-совместимом эндпоинте:

from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key=OFOX_KEY)

def run(model: str, prompt: str) -> tuple[str, float]:
    r = client.chat.completions.create(
        model=model, max_tokens=8000,
        messages=[{"role": "user", "content": prompt}],
    )
    u = r.usage
    rates = {"anthropic/claude-opus-5": (5, 25), "x-ai/grok-4.6": (2, 6)}
    ri, ro = rates[model]
    out = u.total_tokens - u.prompt_tokens        # correct on both APIs
    return r.choices[0].message.content, (u.prompt_tokens * ri + out * ro) / 1e6

До 2026-08-31 код OFOXAI2608 добавляет 15% к пополнению и возвращает 15% от расхода — это снижает фактические траты, а не цену за единицу. Обе модели живут за одним ключом по прайсовым ставкам: Opus 5 и Grok 4.6, так что A/B выше — замена одной строки, а не вторая интеграция. Полная настройка со стороны Anthropic — в руководстве по API Claude Opus 5.

Что в итоге выбрать?

Разделяйте по задачам и пусть решающей переменной будет длина вывода, а не цена.

Grok 4.6 занимает слот по умолчанию для рутинных агентных проходов, где короткий и более сфокусированный ответ вполне годится: каркасы тестов, механические рефакторинги, объяснение кода. Это большая часть работы, и счёт в 3.6 раза меньше даёт на ней реальную экономию. Ему же достаётся всё с длинным закэшированным системным промптом, где отсутствие платы за запись в кэш накапливается каждую сессию, и любые пакетные или офлайн-задачи, где 109 секунд против 59 никого не волнуют.

Opus 5 берёт проходы, где полнота и есть продукт: прогон, который обязан перечислить каждую ветку ошибки, а не большинство из них. Ему же достаётся интерактивная работа — здесь он вдвое быстрее по часам, а на низкой настройке рассуждения начинает стримить меньше чем за три секунды, — и всё, что выше 500K контекста, чего Grok 4.6 не удержит в принципе.

Не берите ни ту, ни другую, если выбираете по числу из таблицы лидеров. В таблице, откуда это число, нет ни одной из них.

Четыре прогона одной задачи, если резюмировать честно: дешёвая модель действительно дешёвая, дорогая действительно дотошнее, а отношение между этими двумя фактами — 49%, а не 28%. Замерьте свою нагрузку, прежде чем выбирать. Скрипт выше — это весь эксперимент.

Источники

Часто задаваемые вопросы

Grok 4.6 дешевле Claude Opus 5?
Дешевле, и заметно, но меньше, чем обещает прайс-лист. По прайсу Grok 4.6 стоит $2 за вход и $6 за выход на миллион токенов против $5 / $25 у Opus 5, то есть 26.7% суммарной ставки. При четырёх прогонах одной и той же задачи рефакторинга через один шлюз 2026-08-20 медианный счёт составил $0.0397 у Grok 4.6 и $0.1417 у Opus 5, то есть 28.0%. Но Grok вернул 57% объёма кода, поэтому в пересчёте на тысячу символов вывода разрыв сжимается до 49%.
Почему моя оценка стоимости Grok 4.6 занижена?
Потому что у Grok completion_tokens не включает reasoning_tokens, а total_tokens включает. Обычная формула prompt × входная ставка + completion × выходная ставка на тех же прогонах даёт $0.0086 против реальных $0.0397 — занижение на 78%. Opus 5 эти величины не разделяет: его completion_tokens уже покрывает размышление, поэтому там та же формула верна. Одна формула, два разных ответа.
Кто отвечает быстрее: Grok 4.6 или Opus 5?
На этой нагрузке — Opus 5. Медианное время полного ответа составило 59.0 секунды у Opus 5 и 109.4 секунды у Grok 4.6 при четырёх прогонах каждого, без стриминга, на одном промпте и одном шлюзе. Grok потратил большую часть этого времени на рассуждение: медиана 5,229 токенов reasoning против 1,308 токенов видимого вывода.
Показывает ли Terminal-Bench 2.1 преимущество Opus 5 над Grok 4.6?
Ни одной из этих моделей нет в таблице лидеров. На 2026-08-20 официальная доска Terminal-Bench 2.1 содержит 17 проверенных записей, во главе с Claude Code на Fable 5 с 83.8%, а самая свежая заявка датирована 2026-07-11. В Terminal-Bench 2.0 записей 142, и там тоже нет ни одной из этих моделей. Любая цифра 86-88%, приписанная этому бенчмарку для любой из них, — заявление вендора, а не проверенная запись в таблице.
Почему Opus 5 останавливается на 4,096 токенах через OpenAI-совместимый эндпоинт?
Потому что это значение max_tokens по умолчанию, если вы его не задали. В первом заходе оба прогона Opus 5 остановились ровно на 4,096 токенах completion; после подъёма max_tokens до 8,000 тот же промпт дошёл до 5,349 и 7,436 токенов с finish_reason stop. На странице модели указан максимум вывода 128K, но получить его можно, только запросив явно.
Какую модель брать для агентных циклов?
Разделяйте по типу задачи, а не выбирайте одну. Grok 4.6 примерно с четвертью счёта — разумный вариант по умолчанию для рутинных двух третей агентной работы, где короткий ответ приемлем, а задержка не видна пользователю. Opus 5 оставьте на проходы, где полнота вывода и есть продукт: здесь он вернул в 1.75 раза больше кода за прогон и сделал это вдвое быстрее по часам.
Обе модели берут плату за запись в кэш?
Нет. Anthropic отдельно тарифицирует запись промпта в кэш: на странице модели ofox это $6.25/M для TTL 5 минут и $10/M для TTL 1 час, поверх $0.5/M за чтение. У страницы Grok 4.6 указано чтение кэша по $0.5/M и нет платы за запись. Для агентных циклов, которые часто переписывают длинный системный промпт, эта асимметрия двигает итог сильнее, чем ставки из заголовка.