Qwen3.8-Max-0902: та же цена, на 38 входных токенов больше за вызов
Снапшот 0902 тарифицируется так же, как августовская сборка, по $2/$6 за миллион, но мы измерили фиксированные +38 токенов промпта на каждом вызове. Во что это обходится и когда закреплять версию.
Снапшот 0902 у Qwen3.8-Max стоит ровно столько же, сколько предыдущая сборка: $2.00 за миллион входных токенов и $6.00 за миллион выходных. При этом он тратит на 38 входных токенов больше на каждом запросе. Мы измерили этот разрыв на трёх промптах и получили 38 токенов каждый раз, без разброса. Всё изложенное ниже — из живого каталога Ofox и живых вызовов API 4 сентября 2026 года.
Что мы измерили
Один и тот же промпт, одни и те же параметры, две строки модели. Единственное различие — какой снапшот отвечает.
| Промпт | qwen3.8-max | qwen3.8-max-0902 | Разница |
|---|---|---|---|
Reply with exactly: ok | 28 | 66 | +38 |
What is 2+2? | 30 | 68 | +38 |
Rewrite this GROUP BY as a window function. | 33 | 71 | +38 |
Это usage.prompt_tokens из /v1/chat/completions, тело запроса одинаковое во всём, кроме строки модели. Постоянное смещение на трёх промптах разной длины означает фиксированные накладные расходы, добавляемые в начало каждого вызова, а не изменение токенизатора, которое масштабировалось бы с длиной входа.
При $2.00 за миллион входных токенов 38 токенов стоят $0.000076 за запрос. Это ничто на горстке вызовов и реальные деньги на объёме:
| Запросов | Дополнительных входных токенов | Дополнительная стоимость |
|---|---|---|
| 10 000 | 380 000 | $0.76 |
| 1 000 000 | 38 000 000 | $76 |
| 10 000 000 | 380 000 000 | $760 |
Честный итог такой: цена за токен не изменилась, изменился пол на каждом вызове, и важно это или нет — функция от количества ваших запросов, а не от объёма токенов. Сильнее всего это чувствуют высокочастотные нагрузки с короткими промптами, потому что 38 токенов поверх промпта в 28 токенов больше чем удваивают входную часть.
Прейскурант идентичен
| Ставка за 1M токенов | qwen3.8-max | qwen3.8-max-0902 |
|---|---|---|
| Вход | $2.00 | $2.00 |
| Выход | $6.00 | $6.00 |
| Чтение кеша | $0.25 | $0.25 |
| Запись в кеш | $2.50 | $2.50 |
| Веб-поиск | $0.01 за вызов | $0.01 за вызов |
Прочитано из объекта pricing в живом ответе /v1/models 4 сентября 2026 года. Совпадает каждое поле. Снапшот, который улучшает возможности, не поднимая ставку, — это хороший случай; как эти ставки соотносятся с предыдущим поколением флагманов и с прямым обращением к QwenCloud, разобрано в руководстве по ценам и доступу Qwen3.8 Max.
Что, по словам Alibaba, изменилось
Программирование, способность агентов к совместной работе и понимание изображений. Описание в каталоге для снапшота от 2026-09-02 указывает на существенно усиленные способности к кодированию и агентской кооперации с оптимизированным пониманием изображений, явно сохраняя контекст в 1M, режим глубоких рассуждений и приём изображений и видео из предыдущей сборки.
Чего в этом описании нет, так это цифр бенчмарков, поэтому сверить пока не с чем. Считайте заявление о возможностях словами вендора, а измерение в 38 токенов — той частью, которую можно проверить независимо, потому что её действительно можно.
Строке с контекстным окном нужна оговорка
Обе сборки — модели с контекстом 1M, но каталог сообщает о них по-разному. Недатированная сборка сообщает context_length: 1131072; снапшот 0902 сообщает 1000000. Оба описания говорят про 1M, и оба сообщают одинаковый максимум ответа в 131 072 токена.
Это выглядит как урезание возможностей и почти наверняка им не является. 1 131 072 — это 1 048 576 плюс 82 496, что читается скорее как потолок входа с некоторым запасом, чем как круглая заявленная величина; 1 000 000 — как раз круглое маркетинговое число. Безопасное прочтение: изменилось соглашение об отчётности, а не модель. Небезопасное — заключить из меньшего числа, что Alibaba сократила окно, и затем проектировать под ограничение, которого может не существовать.
Если ваша нагрузка действительно подходит к миллиону токенов контекста, измерьте реальный потолок на том снапшоте, который собираетесь выпускать, а не доверяйте ни одному из чисел в каталоге. Всё ниже 1 000 000 токенов безопасно на обеих.
Всё остальное совпадает
| Атрибут | Обе сборки |
|---|---|
| Максимум токенов ответа | 131 072 |
| Входные модальности | текст, изображения |
| Выходные модальности | текст |
| Эндпоинты | /v1/chat/completions, /v1/responses |
| Параметры | temperature, top_p, max_tokens, stop, tools, tool_choice, response_format, reasoning |
| Токенизатор | qwen |
Список параметров совпадает побайтово, и именно поэтому миграция сводится к смене одной строки:
- "model": "bailian/qwen3.8-max"
+ "model": "bailian/qwen3.8-max-0902"
Ловушка, о которой стоит знать: пустой content
Обе сборки — модели с рассуждением, и это порождает результат, который выглядит как сбой, но им не является:
{"usage": {"prompt_tokens": 66, "completion_tokens": 20,
"completion_tokens_details": {"reasoning_tokens": 20}}}
Двадцать токенов ответа, все они — токены рассуждения, а content вернулся пустой строкой. Ничего не сломалось. При max_tokens, равном 20, на модели с рассуждением бюджет был потрачен на размышление до того, как был выдан хоть один видимый символ, и ответ обрезался по потолку.
Чинится это повышением max_tokens, а не повтором запроса и не сменой модели. Практическое правило: на модели с рассуждением max_tokens должен покрывать и рассуждение, и ответ, а рассуждение тарифицируется по выходной ставке независимо от того, видите вы его или нет. Планирование max_tokens как длины ответа — это то, из-за чего рабочая модель выглядит сломанной.
Закрепить дату или следовать за указателем
bailian/qwen3.8-max-0902 заморожен. bailian/qwen3.8-max — нет.
Закрепляйте датированную строку, когда:
- Вывод должен быть воспроизводимым, например в рамках процесса ревью или согласования.
- Большая библиотека промптов проверена под одну сборку, и повторная валидация дорога.
- Вы хотите сами управлять моментом, когда поведение изменится, а не обнаруживать это в продакшене.
Используйте недатированную строку, когда:
- Вы предпочитаете следовать текущей рекомендации Alibaba без передеплоя.
- Ваши промпты достаточно устойчивы, чтобы смена снапшота не была риском регресса.
Компромисс обычный, и цена есть у обеих сторон: закрепление означает, что улучшения перестают до вас доходить, пока вы не предпримете действие, а следование за указателем означает, что модель под вашим продуктом может измениться без всякого релиза с вашей стороны. Что бы вы ни выбрали, выбирайте осознанно, потому что вариант по умолчанию «та строка, которую я когда-то набрал» — это ровно тот путь, которым закреплённая навсегда модель тихо устаревает.
Где эта модель находится
На фоне более широкого поля Qwen3.8 Max по $2.00 / $6.00 — цена флагманского уровня. Вопрос более дешёвой альтернативы разобран в Qwen3.8 Max против DeepSeek V4 Flash, а запуск модели как бэкенда для программирования — в руководстве по настройке Codex CLI, и это как раз та нагрузка, которую снапшот 0902 заявляет как наиболее улучшенную.
Источники
Цены, длины контекста, параметры и модальности прочитаны из живого эндпоинта Ofox /v1/models 4 сентября 2026 года. Разница в 38 токенов измерена тремя живыми вызовами /v1/chat/completions на каждую модель в тот же день, с идентичными телами запросов во всём, кроме строки модели.
Часто задаваемые вопросы
- Qwen3.8-Max-0902 дороже предыдущего снапшота?
- Не за токен. Обе сборки тарифицируются по $2.00 за миллион входных токенов и $6.00 за миллион выходных на Ofox, с идентичными ставками за чтение кеша, запись в кеш и веб-поиск. За вызов — немного дороже: мы измерили, что снапшот 0902 потребляет ровно на 38 токенов промпта больше, чем недатированная сборка, на трёх разных промптах, то есть примерно $0.000076 за запрос по входной ставке.
- Что изменилось в снапшоте 0902 у Qwen3.8-Max?
- Описание в каталоге Alibaba для снапшота от 2026-09-02 указывает на существенно улучшенные способности к программированию и совместной работе агентов плюс оптимизированное понимание изображений, при сохранении контекста в 1M, глубоких рассуждений и приёма изображений и видео из предыдущей сборки. Цены, список параметров и эндпоинты не изменились.
- Закреплять qwen3.8-max-0902 или использовать недатированную строку модели?
- Закрепляйте датированную строку, когда нужен воспроизводимый вывод, например в рамках процесса согласования или когда библиотека промптов проверена под одну сборку. Используйте недатированную bailian/qwen3.8-max, когда хотите следовать текущей рекомендации Alibaba без передеплоя. Недатированная строка не заморожена и рано или поздно перейдёт на более новый снапшот.
- У снапшота 0902 по-прежнему контекст в 1M?
- Да. Ofox сообщает 1 000 000 токенов контекста у снапшота 0902 против 1 131 072 у недатированной сборки, и оба описания говорят про 1M. Разница в том, как сообщается потолок, а не в урезании возможностей, и обе принимают максимум 131 072 токена в ответе.
- Какие идентификаторы у двух сборок Qwen3.8-Max?
- bailian/qwen3.8-max для недатированной сборки и bailian/qwen3.8-max-0902 для сентябрьского снапшота, который также отзывается на алиас qwen3.8-max-2026-09-02. Обе находятся на /v1/chat/completions и /v1/responses и принимают один и тот же набор параметров.
- Почему мой ответ приходит с пустым content?
- Потому что рассуждение израсходовало ваш бюджет токенов до того, как был выдан хоть какой-то видимый ответ. Обе сборки — модели с рассуждением, и при низком max_tokens объект usage показывает, что completion_tokens полностью потрачены как reasoning_tokens, а content пуст. Поднимите max_tokens, а не считайте, что модель сломалась.


