DeepSeek V4 Flash: 6 способов платить меньше (2026)

DeepSeek предупредил о росте цен на API. Попадание в кэш дешевле в 50 раз, разброс цены кэша между хостами 28x, очевидный slug выдаёт старую сборку 0423.

DeepSeek V4 Flash: 6 способов платить меньше (2026)

Что изменилось и во сколько это обходится сегодня

Объявление:        «Значительный» рост цен на API, опубликован 2026-08-06, без величины и даты
Текущий V4 Flash:  $0.14/M вход (промах кэша), $0.0028/M вход (попадание), $0.28/M выход
Попадание к промаху: вход дешевле в 50 раз
Разброс по хостам: от $0.0028 до $0.078 за 1M у 22 хостов (28x)
Самый дешёвый вход: DeepInfra $0.09/M, но квантизация fp4
Безубыточность:    ~77% попаданий в кэш решают, прямо или через посредника
Ловушка slug:      deepseek/deepseek-v4-flash это старая сборка 0423
Режим размышления: включён по умолчанию, effort высокий, тарифицируется как вывод

6 августа 2026 года DeepSeek повесил уведомление на странице тарифов: компания планирует в ближайшее время повысить общую стоимость сервисов DeepSeek API, ожидается значительный рост, планируйте использование соответственно. Ни числа, ни даты. Ветка на r/DeepSeek про это за сутки набрала 115 комментариев, а самая заплюсованная реакция состояла из двух слов.

Полезная реакция это не паническая миграция. Большинство тех, кто крутит V4 Flash, уже переплачивают в несколько раз по причинам, никак не связанным с прайс-листом. Шесть из этих причин можно устранить сегодня, до того как придут новые цены.

Какие рычаги реально двигают счёт

Поведение кэша и выбор хоста, именно в таком порядке. Прайс-лист значит меньше всего. Ниже рейтинг по тому, сколько денег двигает каждый рычаг, на основе ценовых данных из этой статьи.

РычагВеличина эффектаТрудозатраты
Попадание против промаха кэша50x на входных токенахСредние
Ставка хоста за чтение кэшаДо 28x на кэшированном входеНизкие
Режим размышления вкл/выклСрезает токены рассуждения по ставке выводаНизкие
Правильная версия моделиТа же цена, более новая модельНизкие
Квантизация и контекстКачество и риск обрезанияНизкие
Выбор harnessМеняет объём токенов на задачуВысокие

Первые два взаимодействуют, поэтому у вопроса «кто дешевле» нет фиксированного ответа. Проходите их по порядку.

Стоит ли это вашего дня

Если вы тратите на V4 Flash больше примерно $50 в месяц, да. Если меньше, сделайте пункты 3 и 5 и остановитесь. Не всякая нагрузка оправдывает такой аудит.

Весь список стоит пройти, когда:

  • Вы гоняете агентов, то есть длинные многошаговые сессии, где один и тот же контекст переигрывается десятки раз. Именно здесь пятидесятикратный разрыв по кэшу складывается в реальные деньги.
  • Ваши месячные траты достаточно велики, чтобы рост в 2 или 4 раза заставил пойти с кем-то разговаривать про бюджет.
  • Вы сидите на стороннем хосте и ни разу не проверяли его ставку за чтение кэша, квантизацию и лимит контекста.

Не стоит, когда:

  • Вы шлёте редкие одиночные запросы без общего префикса. Попадать некуда, так что большая часть статьи к вам не относится. Возьмите самый дешёвый вход и идите дальше.
  • Вы всё ещё прототипируете. Выбор модели поменяется раньше, чем счёт станет важен.
  • Ваш трафик уже идёт напрямую в DeepSeek со стабильным префиксом и размышлением, настроенным по задачам. Вы своё уже сделали.

Правило остановки: если вы починили slug (раздел 3), проверили колонку чтения кэша у своего хоста (раздел 2) и ничего подозрительного не нашли, остальные пункты стоят однозначных процентов. Возвращайтесь к работе.

1. Почему попадание в кэш дешевле промаха в 50 раз

Потому что DeepSeek тарифицирует кэшированный вход по $0.0028/M против $0.14/M при промахе. Это самое большое число на странице, и оно затмевает всё остальное, что вы можете подкрутить.

ПозицияV4 FlashV4 Pro
Вход, попадание в кэш$0.0028$0.003625
Вход, промах кэша$0.14$0.435
Выход$0.28$0.87
Контекст1M1M
Максимальный вывод384K384K

Кэширование включено по умолчанию и не требует правок в коде, но правило совпадения строже, чем префиксное кэширование, которое вы могли видеть у других вендоров, и в нём стоит разобраться.

DeepSeek хранит префиксные единицы кэша, и запрос попадает только при полном совпадении с одной из них. Единицы сохраняются на границах запроса (конец вашего ввода и конец вывода модели), через фиксированные интервалы токенов внутри длинного ввода, и когда система замечает общий префикс у нескольких запросов.

Практическое следствие ловит людей врасплох. Дописывание работает: отправьте A + B, затем A + B + C, и второй запрос попадёт в единицу от первого. Ветвление не работает, по крайней мере не сразу. Отправьте A + B, затем A + C, и второй запрос будет полным промахом, хотя оба разделяют A. Происходит вот что: система замечает общий A и сохраняет его как отдельную единицу, так что третий запрос A + D наконец попадает.

Значит, схема fan-out, один длинный документ и много разных вопросов к нему, платит полную цену на первых двух вызовах и начинает экономить только с третьего. Если вы измеряли кэш двумя запросами и решили, что он не работает, вот почему.

Порядок всё равно важен, потому что единица, которая никогда не повторяется, никогда и не переиспользуется.

Четыре вещи, чаще всего ломающие префикс, примерно по частоте появления:

  • Таймстамп или дата в системном промпте. «Today is 2026-08-06T14:22:11Z» инвалидирует кэш на каждом без исключения вызове. Если модели нужна дата, положите её в последнее сообщение пользователя.
  • Список инструментов, собранный из словаря или множества. Порядок обхода меняется между запусками, JSON выходит перетасованным, и префикс не совпадает никогда. Сортируйте список.
  • Найденные чанки, поставленные перед инструкциями. Вывод RAG по замыслу каждый раз разный. Его место после стабильного системного промпта, а не перед ним.
  • ID сессии или запроса, вставленный для трассировки. Полезно, и перенести его в конец ничего не стоит.

Исправление во всех случаях одно: стабильное вперёд, изменчивое назад. Проверяйте результат чтением объекта usage, а не доверяя раскладке. DeepSeek возвращает prompt_cache_hit_tokens и prompt_cache_miss_tokens; их соотношение это то самое число, от которого зависит каждое решение в этой статье, и на его измерение уходит один запрос.

Один пользователь r/DeepSeek выложил разбивку за семь дней: $1.87 суммарно примерно за 24M входных и 6M выходных токенов, и приписал кэшированию контекста сокращение счёта примерно на 70%. Прежде чем брать это за эталон, стоит проверить арифметику: по официальным ставкам 24M входа и 6M выхода при 70% попаданий дают около $2.74, а чтобы получить $1.87, доля попаданий должна быть ближе к 96%. Либо кэш отработал лучше, чем сообщили, либо часть трафика шла в другом месте. Верхний ответ на тот пост тоже стоит прочитать: человек, сжигающий 200M входных токенов в день, называет 24M «даже близко не тяжёлой работой». Оба числа настоящие, просто описывают разные задачи.

2. Какой хост дешевле всего для DeepSeek V4 Flash

Тот, что соответствует вашей доле попаданий в кэш, а переключается ответ около 77%. OpenRouter перечисляет 22 хоста для сборки 0731. Цены входа и выхода держатся примерно в двукратном диапазоне. Чтение кэша нет.

ХостВходВыходЧтение кэшак прямомуКвантКонтекст
DeepInfra$0.09$0.18$0.0186.4xfp41M
GMICloud$0.126$0.252$0.02529.0xfp81M
BaseTen$0.13$0.26$0.02810xfp81M
DeepSeek напрямую$0.14$0.28$0.00281xfp81M
Fireworks$0.14$0.28$0.02810xнеизвестно1M
Cloudflare$0.14$0.28$0.02810xfp8384K
AkashML$0.14$0.28$0.027.1xfp8131K
Parasail$0.14$0.28$0.0725xfp81M
Io Net$0.16$0.32$0.07828xfp8262K
Phala$0.20$0.40$0.0725xнеизвестно1M

Перечитайте строку Parasail. Та же цена входа, что и напрямую, та же цена выхода, и в 25 раз дороже чтение кэша. Нет такой нагрузки, где это правильный выбор. То же самое с Phala, Io Net и Morph. Ветка на Reddit отметила эту картину у OpenRouter и списала её на маршрутизацию с нулевым хранением данных; более полное объяснение пришло в ответе, где указали, что это просто другие компании, хостящие веса без кэширующей инфраструктуры DeepSeek и без его маржи.

По-настоящему дешевле по входу оказываются DeepInfra, GMICloud и BaseTen. Сэкономят ли они вам деньги, зависит от формы трафика:

Выход в % от входаТочка безубыточности по попаданиям (DeepInfra против прямого)
0%77%
5%84%
10%92%
20%+Никогда; DeepInfra остаётся дешевле

Ниже точки безубыточности берите более дешёвый хост. Выше идите напрямую. Посчитано на форме 24M/6M из того поста на Reddit при 70% попаданий: DeepInfra $2.03, напрямую $2.74, Parasail $3.86. При нулевом кэше: DeepInfra $3.24, напрямую $5.04.

3. Ту ли модель вы покупаете

Скорее всего нет, если вы взяли очевидный slug. На OpenRouter deepseek/deepseek-v4-flash резолвится в DeepSeek V4 Flash 0423. Текущая сборка лежит отдельным листингом deepseek/deepseek-v4-flash-0731.

deepseek/deepseek-v4-flash          -> V4 Flash 0423   (older)
deepseek/deepseek-v4-flash-0731     -> V4 Flash 0731   (current)
~deepseek/deepseek-v4-flash-latest  -> tracks current

Именно сборку 0731 хвалят ветки r/LocalLLaMA и r/DeepSeek за то, что она чинит деградацию контекста в длинных агентных сессиях. Платить сопоставимую ставку за апрельскую сборку из-за дефолтного slug это самая дешёвая в устранении ошибка в списке.

4. Во что реально обходятся fp4 и контекст 131K

В качество, которого не видно в счёте, и в обрезание, о котором узнаёшь посреди сессии. Хосты с дешёвым входом продают не то же самое.

Вход за $0.09 у DeepInfra, самый низкий в списке, работает на квантизации fp4. Так же у Sail Research, Ambient и Ionstream. Большинство остальных крутят fp8, а несколько сообщают «неизвестно». Собственный эндпоинт DeepSeek сообщает fp8. Никто не публикует замер разницы между своей подачей этой модели в fp4 и в fp8, так что относитесь к 36% скидке на входе у fp4-эндпоинта как к сделке с неизмеренной обратной стороной, а не как к бесплатному выигрышу.

Контекстные окна разбегаются сильнее, чем цены:

  • AkashML: 131K
  • CoreWeave, AtlasCloud, Io Net: 262K
  • Cloudflare: 384K
  • DeepSeek напрямую и большинство остальных: 1M

Если вы выбрали хост по цене входа, а ваш агент молча начал обрезать на 131K, вот откуда это. Модель поддерживает 1M; ограничивает вас хост.

5. Стоит ли выключать режим размышления

Иногда стоит, и он включён по умолчанию с высоким effort, о чём большинство не догадывается. Документация DeepSeek говорит прямо: режим размышления включён по умолчанию, а effort по умолчанию высокий. Эти токены рассуждения тарифицируются по ставке вывода.

# OpenAI format: disable thinking
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[...],
    extra_body={"thinking": {"type": "disabled"}},
)

В формате Anthropic эквивалент это {"reasoning": {"effort": "none"}}. Уровни effort мапятся по-разному в разных моделях: на V4 Flash low идёт в low, а xhigh опускается до high, тогда как V4 Pro поднимает low до high.

Прежде чем щёлкать это глобально, стоит знать две вещи. Режим размышления игнорирует temperature, top_p, presence_penalty и frequency_penalty, и их установка не вызывает ошибки, так что конфиг, выглядящий настроенным, может не делать ничего. И отключение стоит точности на многошаговой работе, а это ровно то, ради чего люди берут V4 Flash. Выключайте на извлечении, классификации и форматировании; оставляйте на рефакторингах и отладке.

Мы мерили это через шлюз, а не напрямую по эндпоинту DeepSeek, и цифры оказались смазаны обработкой параметров на стороне шлюза, поэтому множитель здесь мы не публикуем. Измерьте на своём трафике, читая completion_tokens_details.reasoning_tokens в объекте usage, на своих промптах, до и после.

Полезная эвристика, пока вы собираете эти данные: если человек-ревьюер принял бы ответ, не проверяя выкладки, размышление, вероятно, не отбивает свою стоимость. Вытащить поля из счёта, проставить тег на тикете поддержки, переформатировать JSON, написать сообщение коммита, всё это попадает в эту корзину. Всё, где неверный ответ дорог и не очевидно неверен, а это большая часть рефакторингов и почти вся отладка, там токены рассуждения себя окупают. Маршрутизируйте по типу задачи, а не щёлкайте один глобальный переключатель, и вернитесь к вопросу после появления новых цен, потому что эти токены тарифицируются по ставке вывода.

6. Меняет ли harness ваш счёт

Сильнее, чем прайс-лист, потому что именно он решает, во сколько токенов обойдётся задача. На r/DeepSeek никто не сходится в том, какой именно, но все сходятся, что это важно.

Повторяющиеся имена это OpenCode, Reasonix, Pi и Codex. Один пользователь сообщил, что Reasonix сократил длинную задачу «с 20 минут до 5» за счёт лучших попаданий в кэш; другой назвал его «всё ещё немного глючным и трудным для расширения» рядом с Pi или OpenCode. Третий отметил, что нативная поддержка Codex у DeepSeek полностью убрала нужду в прокси. Консенсусного выбора нет, и честное прочтение в том, что накладные расходы harness реальны, велики и специфичны для вашей нагрузки.

Внутрь стоит взять сам механизм: каждый ход агента переигрывает разговор. Harness, удерживающий стабильный префикс, попадает в кэш и платит $0.0028/M за переигровку. Тот, что пересобирает контекст на каждом ходу, платит $0.14/M за те же токены. Это те самые 50x из раздела 1, применённые десятки раз за сессию.

Что станет с этой математикой, если цены удвоятся

Прямое подключение перестаёт выигрывать почти везде, потому что у сторонних хостов нет причин следовать за ним. Хосты на OpenRouter крутят открытые веса на своём железе. Изменение ставок DeepSeek двигает эндпоинт DeepSeek и оставляет их нетронутыми, а это сразу сдвигает все точки безубыточности из этой статьи.

Множитель пока никому не известен, поэтому вот та же нагрузка 24M входа / 6M выхода при 70% попаданий в кэш в трёх сценариях, где DeepInfra зафиксирована как эталонный сторонний хост:

СценарийDeepSeek напрямуюDeepInfraДешевле
Сегодня$2.74$2.03DeepInfra
Прямые цены 2x$5.47$2.03DeepInfra
Прямые цены 4x$10.94$2.03DeepInfra

Эта нагрузка уже сегодня в пользу стороннего хоста, потому что 6M выхода против 24M входа достаточно смещены в сторону вывода, чтобы более дешёвая ставка вывода стала решающей. Преимущество кэша спасает прямое подключение только тогда, когда вывод составляет малую долю от ввода. Но и там земля уходит: на чистом входном трафике точка безубыточности против DeepInfra сегодня около 77% попаданий и поднимается примерно до 94%, если прямые цены удвоятся. Выше этой черты вам всё ещё нужен официальный эндпоинт ради чтения кэша по $0.0028. Ниже неё вы субсидируете кэш, в который не попадаете.

Практический вывод: если ваша доля попаданий действительно выше 90%, а объём вывода мал, повышение будет болезненным, но прямое подключение может остаться выигрышным. Всем остальным стоит иметь протестированный второй путь до того, как появится число.

Когда всё-таки менять модель

Когда новые цены появятся и математика перестанет сходиться, но не раньше. Ветки полны людей, заранее записавшихся на GPT-5.6 Luna, самую часто называемую альтернативу, у которой действительно есть поддержка зрения. Это разумная позиция в шорт-листе и плохое решение, если принимать его сегодня, потому что DeepSeek не опубликовал ни одной цифры.

Для калибровки того, насколько далеко это может зайти: один комментатор вспомнил, что DeepSeek снижал цены примерно на 75% в апреле и мае, а затем сделал снижение постоянным, и рассудил, что «значительный» может означать возврат примерно к прежнему уровню, то есть рост в 4 раза. Это вывод одного человека из публичной истории, а не утечка. Готовьтесь к диапазону, а не к числу.

Что стоит сделать сейчас:

  • Снять свою фактическую долю попаданий в кэш. От неё зависит каждое решение выше, и её почти никто не измеряет.
  • Поднять второго провайдера за флагом, чтобы переключение было изменением конфига, а не проектом.
  • Пересчитать таблицу безубыточности, когда опубликуют новые ставки. Цифра 77% привязана к сегодняшним ценам.

Как это настроить команде

Хост и политику размышления решают централизованно, а дальше перестают давать выбирать каждому по отдельности. В команде режим отказа это не один плохой выбор, а шесть разных, которых никто не видит.

Три вещи, о которых стоит договориться один раз:

  • Зафиксируйте строку модели в общем конфиге, а не в каждом сервисе. Проблема 0423 против 0731 множится, когда четыре сервиса хардкодят каждый свой slug. Одна константа, одно место, и обновление версии становится одним ревью.
  • Задайте политику размышления по классу нагрузки, а не по разработчику. Сервисы извлечения и классификации работают с выключенным размышлением. Агентные и рефакторинговые оставляют его включённым. Запишите правило, потому что по умолчанию оно включено, а дефолтов никто не замечает.
  • Мерьте долю попаданий в кэш по сервисам, а не по организации. Агрегированное число прячет тот единственный сервис с таймстампом в системном промпте, который платит 50x на каждом вызове. Логируйте prompt_cache_hit_tokens и prompt_cache_miss_tokens рядом с существующими метриками запросов, и выброс проявится сразу.

Последствия ошибки распределяются неравномерно. Один неверно настроенный высоконагруженный сервис может стоить больше, чем вся остальная команда вместе, и снаружи он выглядит точно так же, как настроенный правильно.

Как держать второй путь тёплым

Маршрутизируйте через что-то, говорящее на обоих протоколах, чтобы запасной вариант сводился к строке модели. DeepSeek отдаёт и эндпоинт в формате OpenAI, и эндпоинт в формате Anthropic по адресу https://api.deepseek.com/anthropic, поэтому V4 Flash встаёт в инструменты под Claude без прослойки.

Если не хочется держать отдельные аккаунты у каждого вендора, пока всё это утрясается, ofox отдаёт V4 Flash по тем же $0.14 / $0.28 / $0.0028, что и напрямую, с обоими протоколами на одном ключе. Это не дешевле, чем DeepSeek напрямую, и всякий, кто рассказывает, что шлюз обходит источник на собственной модели источника, что-то вам продаёт. Что вы получаете, так это одну интеграцию, за которой можно менять модели, когда придут новые цены.

Типичные ошибки, которые тихо стоят денег

ОшибкаВо что обходитсяИсправление
Изменчивый префикс в системном промптеКаждый запрос это промах кэша, 50xПеренести таймстампы и найденные чанки в конец
Выбор хоста только по цене входаДо 28x на кэшированном входеПроверить колонку чтения кэша
Использование deepseek/deepseek-v4-flashСборка 0423Взять slug с -0731
Предположение о 1M контексте вездеМолчаливое обрезание на 131KПроверить колонку контекста у хоста
Оставленное размышление на извлеченииТокены рассуждения по ставке выводаОтключать по типу задачи
Настройка temperature в режиме размышленияНичего не происходит, ошибки нетВ режиме размышления параметры игнорируются
Доверие расписанию часов пикПланирование вокруг неопубликованной политикиНа официальной странице этого нет на 2026-08-06

Альтернативы, которые стоит рассмотреть

  • DeepSeek напрямую. Самое дешёвое чтение кэша, в 6.4 раза дешевле следующего хоста, fp8, полный контекст 1M. Лучший вариант для агентной работы с активным кэшем.
  • DeepInfra, GMICloud, BaseTen. Действительно дешевле по входу. Лучше для одиночных запросов с низкой долей кэша. Сначала проверьте квантизацию.
  • ofox. Те же ставки, что напрямую, оба протокола на одном ключе, полезно, когда нужен переключаемый путь. Не скидка.
  • GPT-5.6 Luna. Альтернатива, которую r/DeepSeek называет чаще всего, с поддержкой зрения. Сравнивайте, когда DeepSeek опубликует цифры.
  • Самостоятельный хостинг. Веса открыты. На r/LocalLLaMA есть люди, крутящие сборку 0731 на двух RTX 3090 плюс б/у сервер. Разумно только если железо у вас уже есть.

Про пути, которые не стоят вообще ничего, у нас есть отдельный разбор: DeepSeek V4 Flash бесплатно: 4 бесплатных пути. Полную разбивку прайс-листа, включая V4 Pro, смотрите в DeepSeek V4 API pricing guide, а про то, куда реально уходят деньги на Pro, в cache miss and thinking costs. Если после повышения Flash перестанет быть выгодным выбором, сравнение Flash и Gemini 3.6 Flash разбирает ближайшего бюджетного конкурента, а как снизить расходы на AI API обобщает описанные выше приёмы с кэшем.

Источники

Часто задаваемые вопросы

DeepSeek действительно поднимает цены на API?
Да. На 6 августа 2026 года на официальной странице тарифов висит уведомление: «We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.» Ни величина, ни дата не опубликованы. Текущие ставки пока действуют: у V4 Flash это $0.14/M на входе при промахе кэша, $0.0028/M при попадании и $0.28/M на выходе.
Вводит ли DeepSeek двойной тариф в часы пик?
На официальной странице тарифов по состоянию на 2026-08-06 этого нет. Популярный комментарий на Reddit цитирует политику пик/не-пик с двойными ставками в 9:00-12:00 и 14:00-18:00 по пекинскому времени, но этого текста нет на живой странице, где есть только общее уведомление о повышении. Считайте расписание часов пик непроверенным, пока DeepSeek его не опубликует.
Какой провайдер дешевле всего для DeepSeek V4 Flash?
Это целиком зависит от вашей доли попаданий в кэш. DeepInfra заявляет $0.09/M на входе против $0.14/M у самого DeepSeek, но берёт $0.018/M за чтение кэша против $0.0028/M у DeepSeek. Примерно ниже 77% попаданий выигрывает сторонний хост, выше этого выигрывает прямое подключение. Если ваш объём вывода превышает примерно 20% от объёма ввода, дешёвый хост выигрывает при любой доле попаданий.
Почему чтение кэша у других провайдеров настолько дороже?
Сторонние хосты крутят открытые веса на собственной инфраструктуре, без кэширующего стека DeepSeek и без его ценовой субсидии. Среди 22 хостов, перечисленных на OpenRouter для сборки 0731, чтение кэша варьируется от $0.0028 до $0.078 за 1M, то есть разброс в 28 раз, тогда как цены входа и выхода укладываются примерно в двукратный диапазон.
Даёт ли deepseek/deepseek-v4-flash последнюю модель?
Нет. На OpenRouter этот slug резолвится в DeepSeek V4 Flash 0423. Текущая сборка это отдельный листинг deepseek/deepseek-v4-flash-0731. Выбирая очевидный на вид slug, вы тихо покупаете более старую модель примерно по той же цене.
Экономит ли деньги отключение режима размышления?
Оно срезает токены рассуждения, за которые вы платите по ставке вывода. Согласно документации DeepSeek, размышление включено по умолчанию, а effort по умолчанию высокий. Отключается через thinking type disabled в формате OpenAI или reasoning effort none в формате Anthropic. Ждите просадки качества на многошаговых задачах: это решение на уровне задачи, а не глобальный переключатель.
Будет ли GPT-5.6 Luna дешевле DeepSeek после повышения?
Это невозможно знать, пока DeepSeek не опубликует цифры. Luna это альтернатива, которую пользователи r/DeepSeek называют чаще всего в ветках про подорожание, отчасти из-за поддержки зрения. Любое сравнение, написанное до появления новых ставок DeepSeek, это гадание.