Qwen 3.8 Max против DeepSeek V4 Flash: 3 балла, счёт в 345 раз

Qwen 3.8 Max набирает 53 в AA Intelligence Index против 50 у DeepSeek V4 Flash 0731. На трёх замеренных задачах он обошёлся в 345 раз дороже и работал в 6 раз дольше.

Qwen 3.8 Max против DeepSeek V4 Flash: 3 балла, счёт в 345 раз

Короткая версия, полями, которые можно скопировать:

AA Intelligence Index v4.1:  Qwen 3.8 Max 53 · DeepSeek V4 Flash 0731 50
Elo текстовой доски Arena:   1496 ±10 против 1436 ±4 (+60 у Qwen)
Параметры:                   2.4T / 95B активных против 284B / 13B активных (8.5x)
Цена ofox за 1M:             $2.00 / $6.00 против $0.14 / $0.28 (14.3x, 21.4x)
Замер на 3 задачах:          $0.052328 против $0.000151 (345x), 181с против 30с (6x)
Видит только одна:           Qwen 3.8 Max (изображения + видео + веб-поиск)
Больше максимальный вывод:   DeepSeek V4 Flash, 384K против 131K
ID моделей ofox:             bailian/qwen3.8-max · deepseek/deepseek-v4-flash
Снимок:                      2026-08-04

Вчера r/DeepSeek спорил о графике, где эти две модели стоят в трёх баллах друг от друга по Artificial Analysis Intelligence Index, притом что у одной в 8.5 раза больше параметров. Заголовок поста называл это «схожей производительностью». Верхние комментарии с этим не согласились, и они правы: три балла индекса это не шум. Чего в той ветке никто не посчитал, так это вторую половину сделки. Мы прогнали обе модели на одних и тех же трёх задачах через один шлюз, и эти три балла стоили в 345 раз дороже.

Кратко: что выбрать

Ваша ситуацияВыборПочему
Объёмная работа с текстом, где стоимость это ограничениеDeepSeek V4 FlashВыход в 21.4 раза дешевле при отставании в 3 балла
Всё, где есть скриншоты, сканы или видеоQwen 3.8 MaxИзображения, видео и веб-поиск; DeepSeek только текст
Самые сложные рассуждения, где 3 балла решаютQwen 3.8 MaxAA 53 против 50, +60 Elo на текстовой доске
Длинная генерация одним ответомDeepSeek V4 FlashМаксимальный вывод 384K против 131K
Интерактивный продукт, чувствительный к задержкеDeepSeek V4 Flash30с против 181с на трёх задачах
Вывод обязан совпадать по формату или числу строкQwen 3.8 MaxВыдал все 40 запрошенных строк; DeepSeek выдал 29
Агентный цикл с большим кэшируемым префиксомDeepSeek V4 FlashЧтение кэша $0.0028 против $0.25, разрыв в 89 раз
Нужен самый дешёвый путь к фронтирному баллуНи та, ни другая, см. нижеKimi K3 на 57, GLM-5.2 на 51

Сравнение характеристик

Цены сняты со страниц моделей ofox 2026-08-04. Число параметров взято из релизных материалов вендоров.

ХарактеристикаQwen 3.8 MaxDeepSeek V4 Flash 0731
ID модели на ofoxbailian/qwen3.8-maxdeepseek/deepseek-v4-flash
Вход / 1M$2.00$0.14
Выход / 1M$6.00$0.28
Чтение кэша / 1M$0.25$0.0028 (строка провайдера DeepSeek)
Запись кэша / 1M$2.50$0.175 (строка провайдера BaiLian)
Всего параметров2.4T284B
Активных на токен95B13B
Контекстное окно1M1M
Максимальный вывод131K384K
Ввод изображенийДаНет
Ввод видеоДаНет
Веб-поискДаНет
ПротоколыOpenAI + AnthropicOpenAI + Anthropic
Релиз2026-08-032026-07-31

Две строки несут почти всё решение. Только Qwen умеет смотреть на картинку, а DeepSeek пишет в 2.9 раза больше токенов одним ответом. Всё остальное сводится к вопросу, сколько для вас стоят три балла индекса.

Кто выше в сторонних бенчмарках?

Qwen 3.8 Max, во всех источниках, где есть обе модели. Отрывы при этом стабильно небольшие.

Источник (снимок 2026-08-04)Qwen 3.8 MaxDeepSeek V4 Flash 0731
AA Intelligence Index v4.15350
Elo текстовой доски Arena1496 ±101436 ±4
Elo доски WebDev Arena1668 +18/-181577 (flash-high)
Elo доски Vision Arena1305 ±9не участвует, только текст
LiveBench 2026-06-25нет записи74.2

Прежде чем пользоваться этими числами, посмотрите на их происхождение.

  • 53 от AA это самая слабо подтверждённая цифра здесь, и мы её помечаем, а не прячем. У Artificial Analysis нет страницы модели для Qwen 3.8 Max: балл существует только внутри виджета графика Intelligence Index, поэтому обычные помодельные показатели (стоимость прогона индекса, verbosity, скорость вывода) для него не опубликованы. Для ориентира на том же индексе: Kimi K3 набирает 57, GLM-5.2 51, Gemini 3.6 Flash 50, DeepSeek V4 Pro 44, Qwen 3.7 Max 46.
  • Цифры Arena мы читали прямо с досок. Elo там пересчитывается ежедневно, поэтому долговечная часть это порядок, а конкретные значения это снимок. Разрыв в 60 пунктов при интервалах ±10 и ±4 это настоящее преимущество.
  • LiveBench вообще не оценивал Qwen 3.8 Max. DeepSeek V4 Flash 0731 у него на 74.2 против 65.5 у апрельского релиза, и это самое ясное измерение того, что дало июльское переобучение.

Аргумент об эффективности, с которого началась ветка на Reddit, арифметически верен: 284B параметров в трёх баллах от модели на 2.4T, при 13B активных на токен против 95B. Важно ли это вам, зависит от того, покупаете вы веса или токены. Если токены, то число параметров это проблема вендора, а цена это ваша проблема.

Как они показали себя на трёх реальных задачах?

Обе модели справились с работой правильно, но счета оказались несопоставимы. 2026-08-04 мы отправили три запроса через api.ofox.ai/v1/chat/completions с параметрами по умолчанию и без системного промпта, а число токенов взяли из объекта usage в ответе API.

ЗадачаQwen 3.8 MaxDeepSeek V4 Flash 0731
Извлечение чека в JSON1,332 выход, 26.0с, верно133 выход, 13.6с, верно
Починить сломанный median()3,385 выход, 73.2с, тесты пройдены67 выход, 6.6с, тесты пройдены
CSV из 40 строк, HTTP 400-4393,881 выход, 82.1с, 40 строк236 выход, 10.1с, 29 строк
Всего выходных токенов8,598 (19.7x)436
Общее время по часам181.3с (6.0x)30.3с
Стоимость всех трёх$0.052328 (345x)$0.000151

Три наблюдения ценнее итогов.

  • Ни одна модель не ошиблась в рассуждении. По чеку обе выдали одинаковый JSON с верной построчной арифметикой. Обе вернули рабочую медиану для чётной длины, и мы выполнили обе функции на четырёх случаях, прежде чем назвать их правильными. Три балла индекса не проявились как разница «верно или неверно» на работе такого размера, и это ожидаемо: разрывы бенчмарков живут в сложном хвосте, а не в рутине.
  • Задачу на строгий формат Qwen выиграл однозначно. На запрос из 40 строк, покрывающих коды с 400 по 439, Qwen выдал ровно 40, заполнив неназначенные коды заглушками. DeepSeek выдал 29, молча пропустив все неназначенные коды, а затем вышел за диапазон и добавил 451. Если парсер ниже по конвейеру ждёт фиксированную форму, это отказ по корректности, а не вопрос стиля.
  • Задержка усиливается многословием, и 6x это не заявление о пропускной способности. Наша цифра это сквозное время трёх вызовов, и её задаёт количество токенов, а не скорость: Qwen выдал в 19.7 раза больше вывода. Показатели «в секунду» это другое измерение, и в этой паре оно есть только у одной стороны. Artificial Analysis указывает для DeepSeek V4 Flash 0731 122.7 выходных токенов в секунду (8 место из 101 в этом представлении, прочитано 2026-08-04) и не публикует пропускную способность для Qwen 3.8 Max, поскольку страницы модели у него нет. Так что 6x читается как «эта работа закончилась в шесть раз раньше», а не «эта модель в шесть раз быстрее на токен». Для пакетной обработки это статья расходов, для интерактива это продуктовое решение.

Три запроса это выборка, а не исследование. Направление совпало на всех трёх, а самый дешёвый способ проверить это на вашей работе есть в цикле в конце статьи.

Что лучше для кода?

Qwen 3.8 Max по доске, которая это измеряет, DeepSeek V4 Flash по счёту. На доске WebDev Arena, где люди сравнивают сгенерированный фронтенд-код бок о бок, qwen3.8-max стоит на 1668 (+18/-18) против 1577 у deepseek-v4-flash-high. Этот разрыв в 91 пункт шире, чем 60 пунктов на общей текстовой доске, так что часть того, что покупают лишние параметры Qwen, это как раз генерация фронтенда.

Контекст для 1668: на той же доске kimi-k3-max на 1676, а claude-opus-5-high на 1669, и все три интервала перекрываются. Qwen 3.8 Max действительно в верхней группе на этой задаче, а цена входа в $2 обычно такого места не покупает.

Наша собственная задача на код разрыв не воспроизвела, и это информативно, а не противоречиво. Обе модели с первой попытки правильно починили баг медианы для чётной длины, а исправление занимает шесть строк. Рутинный ремонт не разделяет 53 и 50. Разделяет хвост: незнакомый фреймворк, размытое требование, рефакторинг, который должен держаться сразу в нескольких файлах. Если ваша работа в основном рутинная, вы платите 21x за разницу, которая не проявится. Если в основном сложная, доска WebDev говорит, что деньги работают.

Что на самом деле изменило переобучение 0731?

Оно перевело DeepSeek V4 Flash из «явно позади» в «в трёх баллах». ID модели не изменился, архитектура не изменилась, цена не изменилась. Изменились веса.

LiveBench оценивает два релиза отдельно, и разница читается прямо:

LiveBench 2026-06-25Средний балл
DeepSeek V4 Flash 073174.2
DeepSeek V4 Pro71.6
DeepSeek V4 Flash (апрельский релиз)65.5

Прирост 8.7 балла на том же наборе, и он вынес дешёвый уровень выше собственного флагмана DeepSeek. На индексе Artificial Analysis та же инверсия: V4 Flash 0731 на 50 против 44 у V4 Pro.

Два практических следствия:

  • Запись на ofox уже указывает на 0731. На странице каталога deepseek/deepseek-v4-flash стоит дата релиза 2026-07-31, так что вы получаете переобученные веса без указания суффикса с датой. Всё, что написано про V4 Flash до августа, описывает заметно более слабую модель.
  • Сравнения, написанные в июне, устарели, а не ошибочны. Июньский текст, ставивший Qwen далеко впереди, был точен тогда. Сегодня остаётся разрыв в три балла индекса, и статья именно про них.

Работают ли обе модели по протоколу Anthropic?

Да, обе отвечают на POST https://api.ofox.ai/anthropic/v1/messages. 2026-08-04 мы отправили каждой одну и ту же однословную инструкцию:

curl https://api.ofox.ai/anthropic/v1/messages \
  -H "x-api-key: $OFOX_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{"model":"bailian/qwen3.8-max","max_tokens":64,
       "messages":[{"role":"user","content":"Reply with exactly: ok"}]}'

Обе ответили ok. Объекты usage при этом не совпали: Qwen 3.8 Max отчитался о 98 входных и 27 выходных токенах, DeepSeek V4 Flash о 15 входных и 2 выходных. Один и тот же ответ из двух букв, но в 13 раз больше выходных токенов и в 6.5 раза больше входных, ещё до применения 21.4-кратной разницы в тарифе.

Это важно, если команда работает с инструментами в форме Anthropic и хочет поставить за ними модель подешевле. Форма запроса не меняется, в ответе возвращаются cache_creation_input_tokens и cache_read_input_tokens, и двигается только строка с моделью.

Сколько каждая обойдётся в месяц?

От 15 до 82 раз, в зависимости от того, считаете вы по прайсу или по токенам, которые реально возвращаются. Оба сценария ниже используют каталожные ставки ofox при 30 днях в месяце. Это арифметика по опубликованным ценам, а не счета.

Нагрузка A, по прайсу. 5M входных и 0.5M выходных токенов в день, без кэширования.

МодельВ деньВ месяцПротив DeepSeek
DeepSeek V4 Flash$0.84$25.20база
Qwen 3.8 Max$13.00$390.0015.5x

Нагрузка B, та же работа по замеренному соотношению токенов. Qwen возвращает в 19.7 раза больше вывода, так что его 0.5M превращаются в 9.85M в день, а у DeepSeek остаётся 0.5M.

МодельВ деньВ месяцПротив DeepSeek
DeepSeek V4 Flash$0.84$25.20база
Qwen 3.8 Max, замеренное соотношение$69.10$2,073.0082x

Месячный счёт за одну и ту же работуОдна работа: 5M входа + 0.5M выхода в деньМесячный счёт по каталожным ставкам ofox, 2026-08-04$25DeepSeek V4 Flash$390Qwen 3.8 Maxпо прайсу$2,073Qwen 3.8 Maxзамер: 19.7x токенов436 токенов на 3 задачах

Стоит посчитать, сколько каждая модель реально возвращает, и прайс оказывается заниженной оценкой разрыва впятеро.

К строке с кэшем нужна оговорка, потому что ofox показывает для DeepSeek V4 Flash трёх провайдеров, и кэш они тарифицируют по-разному:

Строка провайдера на ofoxВход / ВыходЧтение кэша
DeepSeek$0.14 / $0.28$0.0028
BaiLian (Aliyun)$0.14 / $0.28$0.028
Azure$0.19 / $0.51$0.19

Преимущество в 89 раз над $0.25 у Qwen держится на строке DeepSeek, и именно её отражает Artificial Analysis со своими $0.003 за 1M в рейтинге цены попадания в кэш. На строке BaiLian то же сравнение даёт 8.9x, что всё ещё много, но на порядок меньше. Проверьте, на какого провайдера уходит ваш трафик, прежде чем строить бюджет на нижней цифре.

Что умеет Qwen 3.8 Max, чего не умеет DeepSeek V4 Flash?

Видеть. В каталоге ofox у bailian/qwen3.8-max указаны Vision, Video Input и Web Search, а у deepseek/deepseek-v4-flash только Function Calling и Prompt Caching. Это линия возможностей, и никакое ценовое преимущество её не пересекает.

Работа, которая упирается в эту стену:

  • Разбор скриншотов, ревью интерфейса, любой агент, проверяющий собственный отрендеренный результат
  • Сканы документов, чеки, анкеты, всё, что приходит фотографией
  • Разметка ключевых кадров видео, где нужен именно путь ввода видео
  • Графики и схемы, где числа существуют только на картинке
  • Слайды, дашборды и вёрстка документов, куда Alibaba направила свои демо на запуске

Один комментатор в той ветке сформулировал это резче всех: модель с вводом изображений может написать интерфейс, снять скриншот и проверить собственную работу. Текстовая модель не войдёт в этот цикл ни за какие деньги.

Обратный разрыв уже, но реален. 384K максимального вывода у DeepSeek против 131K у Qwen это 2.9x, и он решает, вернётся ли длинный перевод, полный набор тестов или крупное структурированное извлечение одним ответом, или вам придётся писать логику разбиения.

О чём на самом деле спорил r/DeepSeek?

Ветка опровергла собственный заголовок, и именно это опровержение оказалось полезным. Пост подал 53 против 50 при 8.5-кратном размере как «схожую производительность». Два самых залайканных ответа: «это не схожая производительность» и «3 балла это большая разница», и по числам оба правы.

Три аргумента из той ветки стоит унести в решение, потому что они покрывают то, чего не покрывает ни один рейтинг.

  • Разрыв по офисным документам. Один комментатор напомнил, что апрельский DeepSeek V4 Flash плохо показал себя в оценке AA briefcase, которая измеряет работу с таблицами, документами, слайдами и PDF, и что июльское переобучение по ней ещё не мерили. Демо Alibaba для 3.8 Max сильно опирались на слайды, дашборды и аналитическую вёрстку. Если ваша нагрузка офисной формы, общий балл индекса это не тот прибор, и опубликованного числа, которое закрыло бы вопрос, нет ни у одной из моделей.
  • Цикл самопроверки. Модель с вводом изображений может сгенерировать интерфейс, снять скриншот и проверить свой вывод. DeepSeek V4 Flash в этот цикл не входит вовсе, и это структурное различие, а не разница в качестве.
  • Аргумент об эффективности работает в обе стороны. 284B параметров в трёх баллах от модели на 2.4T это настоящий инженерный результат. Но к вашему счёту он отношения не имеет, если вы не хостите сами: через API вы покупаете токены, а не параметры, и в экономию эту эффективность превращает именно ценник DeepSeek.

Чего в ветке никто не посчитал, так это того, что мы замерили: те же три задачи, разница в 345 раз по стоимости и в 6 раз по времени. Спорили про эффективность параметров, а бюджет меняет эффективность по токенам.

Как маршрутизировать между ними?

По умолчанию дешёвая, повышение по правилу, которое умещается в одну строку. Обе модели стоят за одним эндпоинтом, так что решение о маршруте живёт в вашем коде, а не во второй интеграции.

Лестница, совпадающая с замерами:

  • По умолчанию deepseek/deepseek-v4-flash. Текст на входе, текст на выходе, большой объём, выход в 21.4 раза дешевле.
  • Повышайте до bailian/qwen3.8-max, когда запрос несёт изображение или кадр видео. Это не оценка качества, а проверка возможностей, и её можно сделать однострочной веткой по типу контента.
  • Повышайте, когда вывод обязан совпадать с фиксированной формой. Проверяйте ответ DeepSeek схемой и при неудаче повторяйте на Qwen. При соотношении стоимости 345x, которое мы замерили, «проверить и повторить» вы точно можете себе позволить, вместо того чтобы гнать всё на дорогую модель.
  • Повышайте по повторяющемуся отказу, а не по предполагаемой сложности. Две попытки DeepSeek плюс одна Qwen всё равно стоят долю от маршрутизации всего на Qwen, и при этом вы получаете данные о том, как часто эти три балла действительно кусаются.

Последнее правило стоит воспринять всерьёз. Разрыв индекса это статистика по популяции. Ваш трафик это не популяция, и единственный способ узнать, где именно кусаются три балла, это дать дешёвой модели попробовать первой и вести счёт.

Когда выбирать Qwen 3.8 Max?

Когда работа визуальная или когда последние три балла решают, годится ли вывод. Именно эти два случая выдерживают 21-кратную цену вывода.

  • Любой конвейер, где в запросе может появиться изображение или кадр видео.
  • Генерация по фиксированной схеме. В нашем прогоне он выдал все 40 запрошенных строк, а DeepSeek 29 и с выходом за диапазон.
  • Сложные рассуждения при малом объёме, когда счёт настолько мал, что 15x от $25 ни для кого не реальная цифра.
  • Задачи, где важен веб-поиск и иначе слой поиска пришлось бы собирать самим.

Где больно: в 19.7 раза больше выходных токенов, в 6 раз дольше по часам на наших задачах, потолок вывода 131K и отсутствие страницы модели на Artificial Analysis, из-за чего нельзя посмотреть его стоимость за балл. Детали запуска, статус открытых весов и полная спецификация в разборе релиза Qwen 3.8 Max.

Когда выбирать DeepSeek V4 Flash?

Когда работа это текст на входе и текст на выходе, а объём настоящий. Три балла индекса позади, выход в 21.4 раза дешевле, в наших прогонах в шесть раз быстрее сквозняком, и самая дешёвая цена попадания в кэш из тех, что сейчас ранжирует Artificial Analysis.

  • Пакетная классификация, извлечение, суммаризация, разметка.
  • Кодовые агенты со стабильным системным промптом и префиксом репозитория, где работает ставка чтения кэша $0.0028.
  • Сценарии с длинным одиночным ответом, где помогает потолок 384K.
  • Всё, где разницу в деньгах вы предпочтёте потратить на большее число попыток, а не на модель получше. При таких ставках задачу можно прогнать десять раз и всё равно заплатить меньше одного вызова Qwen.

Где больно: не читает изображения и слабее держит строгие требования к формату вывода. Проверяйте форму ответа, а не доверяйте ей. Бесплатные пути доступа с их реальными лимитами собраны в DeepSeek V4 Flash бесплатно, а сравнение с Gemini 3.6 Flash при равном балле в DeepSeek V4 Flash против Gemini 3.6 Flash.

Когда не стоит брать ни одну из них?

Когда нужен верх индекса или когда вы оптимизируете стоимость за балл, а не за токен.

  • Фронтирные рассуждения. Kimi K3 набирает 57 на том же индексе против 53 у Qwen, а во что обходится этот разрыв, посчитано в Qwen 3.7 Max против Kimi K3 и DeepSeek V4 по реальным тратам Artificial Analysis на прогон собственного индекса.
  • Открытые веса с разрешительной лицензией. DeepSeek V4 Flash на доске Arena помечен как MIT; API Qwen 3.8 Max проприетарный, открытые веса анонсированы, но по состоянию на 2026-08-04 не выпущены.
  • Более дешёвая модель с тем же баллом. Gemini 3.6 Flash тоже набирает 50 на этом индексе, а ловушка с числом токенов в той паре разобрана по ссылке выше.

Попробовать обе через ofox: заменить одну строку

Обе модели стоят за одним ключом ofox на OpenAI-совместимом эндпоинте. Актуальные ставки на страницах моделей: bailian/qwen3.8-max и deepseek/deepseek-v4-flash.

Python: один промпт, обе модели, печать usage

import os, time
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.ai/v1", api_key=os.environ["OFOX_API_KEY"])

MODELS = ["bailian/qwen3.8-max", "deepseek/deepseek-v4-flash"]
PRICES = {"bailian/qwen3.8-max": (2.00, 6.00), "deepseek/deepseek-v4-flash": (0.14, 0.28)}
PROMPT = "Rewrite this changelog as 5 release-note bullets:\n\n" + open("CHANGELOG.md").read()

for model in MODELS:
    t0 = time.time()
    r = client.chat.completions.create(model=model, messages=[{"role": "user", "content": PROMPT}])
    pin, pout = PRICES[model]
    cost = r.usage.prompt_tokens / 1e6 * pin + r.usage.completion_tokens / 1e6 * pout
    print(f"{model:<28} out={r.usage.completion_tokens:<6} {time.time()-t0:5.1f}s  ${cost:.6f}")

Печатайте стоимость, а не только ответ. Прайс это число за токен, а ваш счёт это число за задачу, и на наших трёх задачах они разошлись впятеро.

Node: та же форма

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.ofox.ai/v1",
  apiKey: process.env.OFOX_API_KEY,
});

for (const model of ["bailian/qwen3.8-max", "deepseek/deepseek-v4-flash"]) {
  const r = await client.chat.completions.create({
    model,
    messages: [{ role: "user", content: "Summarize this incident report in 5 bullets:\n" + report }],
  });
  console.log(model, r.usage.completion_tokens, r.choices[0].message.content.slice(0, 200));
}

Только Qwen: отправить скриншот

Замените строку модели на deepseek/deepseek-v4-flash, и этот запрос упадёт на типе контента. Это самый быстрый способ увидеть линию возможностей своими глазами.

import base64, os
from openai import OpenAI

client = OpenAI(base_url="https://api.ofox.ai/v1", api_key=os.environ["OFOX_API_KEY"])
img = base64.b64encode(open("dashboard.png", "rb").read()).decode()

r = client.chat.completions.create(
    model="bailian/qwen3.8-max",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Which number on this dashboard contradicts the chart above it?"},
            {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{img}"}},
        ],
    }],
)
print(r.choices[0].message.content)

Частые вопросы

Три балла индекса это реальная разница? Да, но живёт она в сложном хвосте. На наших трёх рутинных задачах обе модели ответили верно, и разрыв не проявился как «верно или неверно». Ожидайте его на задачах, которые вы и так не отдали бы дешёвой модели.

Почему DeepSeek настолько дешевле при близких баллах? Размер. 284B всего и 13B активных на токен против 2.4T и 95B. Обслуживать 13B активных параметров стоит долю от 95B, и DeepSeek передаёт эту разницу в цену, а не тарифицирует по баллу.

Открыты ли веса Qwen 3.8 Max? По состоянию на 2026-08-04 нет. Alibaba анонсировала открытые веса для уровня Max на запуске, но без лицензии и без даты. DeepSeek V4 Flash уже помечен как MIT на доске Arena.

Что ставить по умолчанию в агентный цикл? DeepSeek V4 Flash, если только цикл не может получить изображение. После стабилизации префикса ставка чтения кэша ($0.0028 против $0.25) значит больше любого другого числа, и вы можете позволить себе повторять неудачи, а не предотвращать их.

Источники, проверенные для этого материала

  • Наш собственный прогон A/B, 2026-08-04: три промпта (извлечение чека, починка median(), CSV на 40 строк), по одному вызову на модель и задачу через https://api.ofox.ai/v1/chat/completions, параметры по умолчанию, без системного промпта. Число токенов из объекта usage в ответе API; обе функции медианы выполнялись на четырёх случаях до вывода о корректности.
  • Страницы каталога моделей ofox, прочитаны 2026-08-04: https://ofox.ai/ru/models/bailian/qwen3.8-max · https://ofox.ai/ru/models/deepseek/deepseek-v4-flash
  • Текстовая доска Arena и доска WebDev Arena, прочитаны 2026-08-04
  • LiveBench, выпуск LiveBench-2026-06-25, прочитан 2026-08-04: DeepSeek V4 Flash 0731 на 74.2, записи про Qwen 3.8 нет
  • График Artificial Analysis Intelligence Index v4.1, прочитан 2026-08-04. У Qwen 3.8 Max нет страницы модели на Artificial Analysis, его 53 балла есть только в графике индекса. Сверено со страницами моделей, которые существуют: https://artificialanalysis.ai/models/deepseek-v4-flash
  • Пост о запуске Qwen 3.8 Max для числа параметров и статуса открытых весов

Часто задаваемые вопросы

Qwen 3.8 Max лучше, чем DeepSeek V4 Flash?
По измеряемому качеству да, но с узким перевесом. Artificial Analysis Intelligence Index v4.1 даёт Qwen 3.8 Max 53 балла против 50 у DeepSeek V4 Flash 0731, а текстовая доска Arena ставит его на 60 Elo выше (1496 против 1436). Разрыв реален, но это самые дорогие 3 балла в этом сравнении.
Насколько Qwen 3.8 Max дороже DeepSeek V4 Flash?
По каталожным ценам ofox: в 14.3 раза на входе ($2.00 против $0.14 за 1M) и в 21.4 раза на выходе ($6.00 против $0.28). Чтение кэша различается в 89 раз ($0.25 против $0.0028, строка провайдера DeepSeek). На трёх задачах, которые мы прогнали 2026-08-04, разница в счёте вышла 345-кратной, потому что Qwen вернул ещё и в 19.7 раза больше выходных токенов.
Какие ID моделей на ofox?
bailian/qwen3.8-max и deepseek/deepseek-v4-flash. Обе работают по одному ключу и через один OpenAI-совместимый эндпоинт, обе отвечают и по протоколу Anthropic, так что прямое сравнение это замена одной строки.
Какая модель больше?
Qwen 3.8 Max, в 8.5 раза. Это 2.4T параметров с 95B активных на токен; DeepSeek V4 Flash это 284B всего с 13B активных. Такой разрыв в размере ради 3 баллов индекса и делает темой эффективность DeepSeek, а не результат Qwen.
Умеет ли DeepSeek V4 Flash читать изображения?
Нет. В каталоге ofox у него указаны только Function Calling и Prompt Caching. У Qwen 3.8 Max есть Vision, Video Input, Web Search, Function Calling, Reasoning и Prompt Caching. Для любого конвейера, где приходят скриншоты, сканы или кадры видео, вариант здесь ровно один.
У кого больше максимальный вывод?
У DeepSeek V4 Flash: 384K против 131K у Qwen 3.8 Max, то есть в 2.9 раза больше у более дешёвой модели. Контекстное окно на ofox у обеих 1M.
Есть ли Qwen 3.8 Max на LiveBench или на страницах моделей AA?
Пока нет. В выпуске LiveBench 2026-06-25 записи про Qwen 3.8 нет, а у Artificial Analysis нет страницы модели, поэтому стоимость прогона индекса, verbosity и скорость вывода для него не опубликованы. Его 53 балла есть только в самом графике Intelligence Index.