Скидки на LLM API: 13 моделей ниже прайса вендора
Тринадцать моделей из пяти серий тарифицируются ниже зачёркнутой цены. Сверили с прайсами вендоров: где скидка настоящая, а где это акция самого вендора.
Тринадцать моделей из пяти серий прямо сейчас тарифицируются на ofox ниже своей зачёркнутой цены. Страница best-value перечисляет их по размеру скидки, и на неё стоит потратить две минуты — но интересна там не процентовка.
Интересно, от чего каждый процент отсчитан. Три этих снижения означают три разные вещи, и только в одном случае шлюз выкладывает на стол собственную маржу.
Какие модели идут со скидкой
Пять серий: GPT, Gemini, GLM, Doubao и Seedance. Текстовые модели тарифицируются за миллион токенов, Seedance — за секунду вывода.
| Модель | Вход / 1M | Выход / 1M | Кешированный вход |
|---|---|---|---|
openai/gpt-5.6-luna | $0.20 | $1.20 | $0.02 |
openai/gpt-5.6-terra | $2.00 | $12.00 | $0.20 |
openai/gpt-5.6-sol | $2.50 | $15.00 | $0.25 |
google/gemini-3.7-flash | $0.75 | $3.75 | $0.075 |
google/gemini-3.6-flash | $0.75 | $3.75 | $0.075 |
z-ai/glm-5.2 | $0.98 | $3.08 | $0.182 |
z-ai/glm-5.3 | $1.26 | $3.96 | $0.234 |
volcengine/doubao-seed-2.1-pro | $0.7072 | $3.536 | $0.1416 |
volcengine/doubao-seed-2.1-turbo | $0.3536 | $1.7696 | $0.068 |
Четыре модели Seedance считаются по другому счётчику: seedance-2.0-mini от $0.02 за секунду вывода, seedance-2.0-fast — $0.042, seedance-2.0 — $0.063, а seedance-2.5 — от $0.11 на 480p, $0.48 на 1080p text-to-video и $0.568 на 1080p video-to-video. Последняя модель тарифицируется по разрешению и режиму, а не одним числом, поэтому страница скидок показывает только её значение для 1080p, а полная сетка лежит на странице модели. Счёт определяют длительность и разрешение, а не длина промпта — поэтому 30-секундный ролик стоит примерно в пять раз дороже 6-секундного при том же разрешении.
Действительно ли тариф со скидкой дешевле вендора
Иногда да, и честный ответ делится натрое. Каждый текстовый тариф из таблицы выше мы 2026-08-21 сверили со страницей цен самого вендора. Они распадаются на три группы, и понимание того, в какой группе модель, — это разница между реальной экономией и числом, которое просто выглядит как экономия.
Группа первая: ниже прайса вендора. GLM-5.2 здесь стоит $0.98 / $3.08 против собственных $1.40 / $4.40 у Z.ai, то есть на 30% дешевле, чем при прямом обращении к Z.ai. GLM-5.3 — $1.26 / $3.96 против того же прайса $1.40 / $4.40, то есть на 10% дешевле. Сюда же попадают обе модели Doubao: Seed 2.1 Pro тарифицируется по $0.7072 / $3.536, Turbo — по $0.3536 / $1.7696, против ¥6 / ¥30 за миллион, опубликованных ByteDance на запуске, что по курсу, зафиксированному в нашем руководстве по доступу к Seed 2.1, составляет примерно $0.88 / $4.41. Volcano Engine считает в юанях, так что этот пересчёт стоит воспринимать как приблизительный, а не как сравнение до цента. Самая крупная разница в этой группе — GPT-5.6 Sol: $2.50 / $15 против стандартного тарифа OpenAI $5 / $30. Это ровно половина, причём на том тарифе, который вы реально вызываете синхронно.
Группа вторая: совпадает с вендором в точности. GPT-5.6 Luna тарифицируется по $0.20 / $1.20 — это стандартный тариф OpenAI для этой модели до цента. GPT-5.6 Terra идёт по $2 / $12, тоже идентично. На токенах вы не экономите ничего по сравнению с прямым вызовом OpenAI, и в этом весь смысл: никакой наценки, один ключ, а резервная маршрутизация достаётся бесплатно, а не за премию.
Группа третья: акция самого вендора, переданная как есть. Gemini 3.7 Flash и 3.6 Flash обе стоят $0.75 / $3.75. У Google — столько же. Это вводная цена Google, напечатанная на странице прайса с датой окончания 2026-12-31, после которой обе модели возвращаются к $1.50 / $7.50 с 2027-01-01. Никто не делает вам скидку на Gemini. Шлюз без изменений передаёт собственное временное число Google — это правильное поведение, но означает оно вот что: экономия исчезнет в день, который контролирует Google, а не шлюз.
Если вы планируете бюджет за новый год, именно третью группу стоит просчитать дважды. Мы разобрали, с чем на самом деле сравнивается тариф Gemini 3.7 Flash, включая архивные страницы прайса, показывающие, что база сравнения сдвинулась в те же 48 часов, что и запуск.
Сколько GPT-5.6 стоит здесь против OpenAI
Из трёх тарифов по-настоящему вдвое дешевле только один, два других совпадают с источником.
| Модель | Тариф здесь | Стандартный тариф OpenAI | Разница |
|---|---|---|---|
| GPT-5.6 Sol | $2.50 / $15 | $5.00 / $30.00 | вдвое |
| GPT-5.6 Terra | $2.00 / $12.00 | $2.00 / $12.00 | идентично |
| GPT-5.6 Luna | $0.20 / $1.20 | $0.20 / $1.20 | идентично |
Про строку Sol стоит знать вот что: $2.50 / $15 — это ещё и то, что OpenAI берёт за Sol на тарифах Batch и Flex. Те тарифы меняют задержку на цену: Batch возвращает результат асинхронно внутри окна, а не в самом вызове. Здесь вы получаете это число на обычном синхронном запросе, и в этом вся суть конкретно этой скидки.
Кешированный вход устроен так же: $0.25 за миллион на Sol, $0.20 на Terra, $0.02 на Luna. У долгоживущего агента, который на каждом шаге переигрывает один и тот же системный промпт, месячный счёт обычно определяет именно строка кешированного входа, а не заглавная цена входа.
Какие скидки следуют за акцией вендора
Gemini и Seedance, обе. У тарифа Google на Flash напечатана дата окончания. Скидки Seedance следуют промо-окнам BytePlus, у которых есть напечатанные даты начала и конца, а не бессрочный режим, и окно для 2.5 покрывает только вывод в 1080p.
Это важно для одного конкретного решения: зашивать ли цену в модель затрат жёстко. Тариф из первой группы — это коммерческая договорённость, которая двигается медленно. Тариф из третьей группы двигается тогда, когда двигается маркетинговый календарь вендора. Оба сегодня — настоящие деньги. Но только одно из этих чисел можно вписать в ячейку с подписью «следующий квартал».
Страница best-value говорит об этом своими словами, и это та фраза на ней, которую стоит прочитать дважды: акции следуют за изменениями вендора и могут закончиться в любой момент.
Как воспользоваться ценой со скидкой
Ничего делать не нужно. Нет поля для промокода, нет плана, на который надо переключиться, нет минимального пополнения. Цена на странице модели — это то, по чему тарифицируется запрос.
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="z-ai/glm-5.2", # $0.98 вход / $3.08 выход за 1M
messages=[{"role": "user", "content": "Summarise this changelog"}],
)
print(r.usage)
Смена модели — это правка одной строки, и в этом практическая причина вообще интересоваться списком скидок: если задача классификации, которая сейчас крутится на фронтир-модели за $5, проходит вашу планку качества на GLM-5.2 за $0.98, миграция занимает одну строку, а экономия пятикратная. Подборщик моделей ранжирует каталог по типу задачи и бюджету, если хотите, чтобы сравнение сделали за вас, а наше сравнение цен на AI API охватывает более широкое поле, включая модели без скидки.
Ещё два материала, если кандидат у вас — конкретная серия: цены GLM 5.3 и ловушка reasoning_effort, где настройка effort по умолчанию тарифицируется в 35 раз дороже самой дешёвой, и руководство по доступу к Doubao Seed 2.1, если модели Volcengine нужны без регистрации в Volcengine.
Какую модель выбрать из списка
| Если нужно | Выбирайте | Тариф |
|---|---|---|
| Самый дешёвый пригодный текст на объёме | GPT-5.6 Luna | $0.20 / $1.20 |
| Самый дешёвый с приёмом видео на входе | Doubao Seed 2.1 Turbo | $0.3536 / $1.7696 |
| Фронтир-рассуждения за половину прайса | GPT-5.6 Sol | $2.50 / $15 |
| Длинный контекст и видео на входе | Gemini 3.7 Flash | $0.75 / $3.75 |
| Кодинг и агенты на семействе с открытыми весами | GLM-5.2 | $0.98 / $3.08 |
| Генерация видео, дешевле всего за секунду | Seedance 2.0 Mini | от $0.02/с |
Тарифы выше — это то, что консоль списывает сегодня. Проценты рядом с ними на странице — контекст того, как это число получилось, и весь тезис этого материала в том, что контекст стоит дороже процента.
References
Часто задаваемые вопросы
- Какие LLM API идут со скидкой на ofox?
- Тринадцать моделей из пяти серий: GPT (5.6 Luna, Sol, Terra), Gemini (3.7 Flash, 3.6 Flash), GLM (5.2, 5.3), Doubao (Seed 2.1 Pro, Seed 2.1 Turbo) и Seedance (2.0, 2.0 Fast, 2.0 Mini, 2.5). Актуальный список лежит на странице best-value, отсортирован по размеру скидки и меняется, когда вендоры меняют собственные цены.
- Тариф со скидкой через шлюз действительно дешевле, чем напрямую у вендора?
- Зависит от модели, и ответ делится на три группы. GLM-5.2 за $0.98 / $3.08 действительно ниже собственных $1.40 / $4.40 у Z.ai. GPT-5.6 Luna за $0.20 / $1.20 совпадает со стандартным тарифом OpenAI до цента: на токенах вы не экономите, но и наценки не платите. Gemini 3.7 Flash за $0.75 / $3.75 — это вводная цена самого Google, она истекает 2026-12-31 и вообще не является скидкой шлюза.
- Сколько стоит GPT-5.6 через шлюз?
- Sol — $2.50 на входе и $15 на выходе за миллион токенов, Terra — $2 и $12, Luna — $0.20 и $1.20. Собственный стандартный тариф OpenAI для тех же моделей: $5 / $30, $2 / $12 и $0.20 / $1.20. Только у Sol тариф шлюза вдвое ниже стандартного тарифа вендора, остальные два совпадают с ним.
- Нужен ли промокод, чтобы получить цену со скидкой?
- Нет. Цена на странице модели — это та цена, по которой вас тарифицируют. Нет поля для промокода, нет минимального пополнения и нет отдельного тарифного плана, который надо включать. Зачёркнутое число — это контекст, а не условие, которое нужно разблокировать.
- Как долго действуют эти скидки?
- Единой даты окончания нет, потому что тарифы следуют за ценами каждого вендора. Цена Google на Gemini 3.7 и 3.6 Flash датирована 2026-12-31 на странице прайса Google. Акции Seedance следуют окнам BytePlus. У тарифов GLM опубликованной даты окончания нет. Считайте любой из них действующим на сегодня и перепроверяйте перед тем, как закладывать в квартальный бюджет.
- Какая модель со скидкой дешевле всего для больших объёмов текста?
- GPT-5.6 Luna: $0.20 на входе и $1.20 на выходе за миллион токенов, кешированный вход — $0.02. Следом идёт Doubao Seed 2.1 Turbo с $0.3536 и $1.7696. Обе на порядок дешевле фронтир-уровня и обе сохраняют вызов инструментов и работу с изображениями.
- Видеомодели тоже со скидкой?
- Четыре модели Seedance — да, и они тарифицируются за секунду вывода, а не за токены: Seedance 2.0 Mini от $0.02/с, 2.0 Fast — $0.042/с, 2.0 — $0.063/с, 2.5 — от $0.11/с на 480p, $0.48/с на 1080p text-to-video и $0.568/с на 1080p video-to-video. Посекундная тарификация означает, что счёт определяют запрошенные разрешение и длительность, а не длина промпта.


