Qwen 3.8 Flash API: $0.15/$0.47 и токены рассуждений, за которые вы платите

У Qwen 3.8 Flash самая низкая цена вывода в классе Flash — $0.47 за миллион. Это ещё и модель с рассуждениями: маленький max_tokens вернёт пустой ответ, за который вы всё равно заплатите.

Qwen 3.8 Flash API: $0.15/$0.47 и токены рассуждений, за которые вы платите

Qwen 3.8 Flash стоит $0.15 за миллион входных токенов и $0.47 за выходные — самая низкая цена вывода в классе Flash. Это ещё и модель с рассуждениями, и вот на чём люди спотыкаются: задайте маленький max_tokens — и получите пустую строку, заплатив за токены, которых так и не увидели.

ID модели:     bailian/qwen3.8-flash   (псевдоним: qwen3.8-flash)
Цена:          $0.15 вход / $0.47 выход за 1 млн
Контекст:      1 131 072 токена
Макс. вывод:   131 072 токена
Модальность:   текст + изображение → текст
Эндпоинты:     /v1/chat/completions, /v1/responses
Параметры:     temperature, top_p, max_tokens, stop, tools,
               tool_choice, response_format, reasoning

Считано с живого эндпоинта Ofox /v1/models 6 сентября 2026 года. Поведение ниже измерено на том же эндпоинте в тот же день.

Пустой ответ, на который натыкаются первым

Мы отправили max_tokens: 30 и получили пустую строку. Не ошибку — успешный ответ, за который выставлен счёт:

{"content": "",
 "usage": {"prompt_tokens": 66, "completion_tokens": 30,
           "completion_tokens_details": {"reasoning_tokens": 30}}}

Тридцать токенов ответа, все до одного — токены рассуждений, видимого текста нет. Модель израсходовала весь бюджет на размышления, не выдав ни единого символа ответа.

Два способа это исправить, оба измерены на одном и том же запросе:

Конфигурацияcompletion_tokensreasoning_tokenscontent
max_tokens: 303030"" — пусто
max_tokens: 8002723"ok"
max_tokens: 50, effort: none1"ok"

Поднять лимит работает, потому что модели требовалось всего 27 токенов, а ограничение в 30 обрывало её на середине размышления.

Отключить рассуждения работает лучше. Для настолько тривиального запроса effort: none дал тот же ответ за 1 токен вместо 27 — разница в 27 раз. На потоке коротких ответов это разница между $0.47 за миллион и малой долей от этой суммы.

Практическое правило для любой модели с рассуждениями: max_tokens должен покрывать и рассуждения, и сам ответ, а рассуждения тарифицируются по цене вывода независимо от того, видите вы их или нет. Планировать max_tokens как длину ответа — верный способ заставить работающую модель выглядеть сломанной.

Где $0.47 находится внутри класса Flash

Все тарифы из живого каталога Ofox, 6 сентября 2026 года:

МодельВход / 1 млнВыход / 1 млнКонтекстМакс. вывод
bailian/qwen3.8-flash$0.15$0.471 131 072131 072
z-ai/glm-5.3-flash$0.15$0.501 048 576131 072
deepseek/deepseek-v4-flash-0731$0.44$1.321 000 000384 000
openai/gpt-5.6-luna$1.00$6.001 050 000128 000
google/gemini-3.8-flash$1.50$7.501 000 00065 536

Qwen 3.8 Flash и GLM-5.3 Flash фактически идут вровень — одинаковая цена входа и три цента разницы на выводе. Между этими двумя цена не решает ничего, и стоит прогнать обе на своей реальной задаче.

С остальным классом разрыв большой. Вывод Qwen 3.8 Flash в 2,8 раза дешевле, чем у DeepSeek V4 Flash, и в 16 раз дешевле, чем у Gemini 3.8 Flash.

Чего этот разрыв не показывает:

  • У DeepSeek V4 Flash есть независимая оценка, у Qwen 3.8 Flash — нет. У DeepSeek V4 Flash 0731 88,80% на vals.ai SWE-Bench Verified — выше, чем у Claude Opus 4.8, — а Qwen 3.8 Flash в этом рейтинге вообще отсутствует. Вы платите меньше за модель, за которой стоит меньше публичных свидетельств. Возможно, это нормально, но знать об этом стоит.
  • DeepSeek V4 Flash допускает ответ до 384 000 токенов против 131 072 у Qwen. Если вы генерируете очень длинные одиночные выводы, этот потолок важнее тарифа.

Во что это обходится на практике

При $0.15 / $0.47, с учётом оговорки про рассуждения выше:

НагрузкаТокеныСтоимость
10 тыс. коротких классификаций (200 вход / 20 выход, effort: none)2 млн вход / 0,2 млн выход$0.39
10 тыс. коротких классификаций (200 вход / 300 выход, рассуждения включены)2 млн вход / 3 млн выход$1.71
Документ на 1 млн токенов, один проход1 млн вход / 5 тыс. выход$0.15

Первые две строки — одна и та же работа. Разница только в том, включены ли рассуждения: примерно 4,3 раза на нагрузке такой формы. Это то число, которое стоит усвоить, прежде чем выбирать эту модель для высоконагруженного конвейера.

Как вызывать

curl -X POST https://api.ofox.ai/v1/chat/completions \
  -H "Authorization: Bearer $OFOX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bailian/qwen3.8-flash",
    "messages": [{"role": "user", "content": "Classify the sentiment: ..."}],
    "reasoning": {"effort": "none"},
    "max_tokens": 50
  }'

На первых вызовах читайте usage.completion_tokens_details.reasoning_tokens. Если на задачах, не требующих обдумывания, это большая доля от completion_tokens, то effort: none — это деньги, лежащие под ногами.

Модель принимает не только текст, но и изображения, так что она закрывает и дешёвую работу со зрением — подписи, извлечение в духе OCR, классификацию скриншотов — по тарифу заметно ниже, чем у перечисленных выше Flash-моделей с поддержкой зрения.

Когда её не стоит брать

  • Вам нужен независимый бенчмарк как обоснование выбора. Qwen 3.8 Flash нет ни в vals.ai SWE-Bench, ни в индексе Artificial Analysis. У DeepSeek V4 Flash при $0.44 / $1.32 есть опубликованные 88,80%.
  • Вы генерируете очень длинные одиночные ответы. Потолок в 131 072 токена — треть от DeepSeek V4 Flash.
  • Задача действительно сложная. Это модель класса Flash. Если результат решает точность на сложных рассуждениях, сравнение флагманов объясняет, что вы получаете за дополнительные деньги.
  • Вы уже на GLM-5.3 Flash. Три цента за миллион вывода — не повод для миграции.

Читайте также

Источники

Цены, длины контекста, потолки ответа, поддерживаемые параметры и эндпоинты считаны с живого эндпоинта Ofox /v1/models 6 сентября 2026 года. Поведение токенов рассуждений получено из трёх живых вызовов /v1/chat/completions к bailian/qwen3.8-flash в тот же день: запрос одинаковый, менялись только max_tokens и reasoning.effort. Это малая выборка на одном маршруте за один день, а не спецификация — измерьте на своей нагрузке, прежде чем рассчитывать под неё конвейер. Показатель SWE-Bench для DeepSeek V4 Flash взят с vals.ai, рейтинг обновлён 2026-08-26.

Часто задаваемые вопросы

Сколько стоит Qwen 3.8 Flash?
$0.15 за миллион входных токенов и $0.47 за миллион выходных в Ofox под идентификатором bailian/qwen3.8-flash — значения считаны из живого каталога 6 сентября 2026 года. Это самая низкая цена вывода в классе Flash: у GLM-5.3 Flash $0.50, у DeepSeek V4 Flash 0731 $1.32, у GPT-5.6 Luna $6.00, у Gemini 3.8 Flash $7.50.
Почему Qwen 3.8 Flash возвращает пустой content?
Потому что это модель с рассуждениями, и заданный вами лимит токенов был израсходован на рассуждения до того, как появился хоть какой-то видимый текст. Мы отправили max_tokens 30 и получили content в виде пустой строки при completion_tokens 30, целиком ушедших в reasoning_tokens. Поднимите лимит или задайте reasoning effort равным none. Это не сбой, и за эти токены вы платите.
Как отключить токены рассуждений у Qwen 3.8 Flash?
Передайте reasoning с effort равным none. На том же коротком запросе это снизило completion_tokens с 27 до 1 — двадцатисемикратная разница на тривиальном вызове. Для классификации, извлечения, маршрутизации и другой работы с коротким выводом, где обдумывание не нужно, это главный рычаг экономии на этой модели.
Какое контекстное окно у Qwen 3.8 Flash?
1 131 072 токена контекста при максимальном ответе в 131 072 токена — по данным живого каталога Ofox. Модель принимает текст и изображения, возвращает текст и доступна и на /v1/chat/completions, и на /v1/responses.
Qwen 3.8 Flash дешевле, чем DeepSeek V4 Flash?
Да, примерно в 2,8 раза по выводу. Qwen 3.8 Flash — $0.15 / $0.47 против $0.44 / $1.32 у DeepSeek V4 Flash 0731. Но у DeepSeek V4 Flash есть опубликованные 88,80% на vals.ai SWE-Bench Verified, а Qwen 3.8 Flash в этом рейтинге нет вовсе, так что более низкая цена идёт без сопоставимой независимой оценки.
Какой идентификатор модели у Qwen 3.8 Flash?
bailian/qwen3.8-flash в Ofox, с псевдонимом qwen3.8-flash. Поддерживаются temperature, top_p, max_tokens, stop, tools, tool_choice, response_format и reasoning.