Gemini 3.8 Flash vs 3.7 Flash: та же цена, счёт на 45% выше
Gemini 3.8 Flash и 3.7 Flash стоят одинаково за токен, но 3.8 Flash пишет на 30% больше вывода, поэтому стоимость задачи растёт с $0.40 до $0.58 ради трёх лишних баллов.
Gemini 3.8 Flash стоит ровно столько же, сколько Gemini 3.7 Flash. Каждая ячейка на странице цен Google у двух моделей одинакова, вплоть до сноски, которая удваивает обе 1 января 2027 года. Счёт при этом не одинаков. Artificial Analysis измерила, что 3.8 Flash тратит на 30% больше выходных токенов на задачу, а стоимость задачи Intelligence Index растёт с $0.40 до $0.58.
Коротко
- За токен: одинаково. $0.75 вход, $3.75 выход, $0.075 кэшированный вход, Batch и Flex вдвое дешевле, Priority в 1.8 раза дороже, всё удваивается 1 января 2027 года. Сравнивать нечего.
- За задачу: 3.8 Flash примерно на 45% дороже при высоком effort. $0.58 против $0.40 на Artificial Analysis за 59 баллов против 56. Сама AA округляет тот же разрыв до «~40%».
- Почти бесплатный апгрейд — средний effort. 3.8 Flash на своём medium по умолчанию набирает 57 за $0.41 на задачу: на балл выше 3.7 Flash за один цент.
- Google говорит, что оставаться нормально. 3.7 Flash «остаётся полностью поддерживаемой для нагрузок, где важна эффективность». Это фраза вендора, не наша.
Что Google изменила, а что нет
Gemini 3.8 Flash вышла 2 сентября 2026 года, через три недели после 3.7 Flash 13 августа. Анонс Google описывает разницу как поведение, а не цену (цитаты далее — в переводе): «3.8 Flash работает усерднее. На сложных задачах она проявляет большую старательность — выполняет дополнительные шаги рассуждения и итеративно вызывает инструменты. Иногда модель может использовать больше токенов, чтобы максимизировать результат, особенно на более высоких уровнях effort».
Дальше — рекомендация, которую большинство обзоров пропускает: «разработчики могут использовать более низкие уровни effort, чтобы минимизировать накладные расходы на токены, или продолжать полагаться на Gemini 3.7 Flash, которая остаётся полностью поддерживаемой для нагрузок, где важна эффективность». Документация для разработчиков повторяет: «Gemini 3.8 Flash может использовать больше токенов на длительных и сложных задачах — так задумано».
Итак, позиция вендора: та же цена, больше работы на вызов и явный путь назад к 3.7 Flash.
Gemini 3.8 Flash vs 3.7 Flash: характеристики и цена
| Параметр | Gemini 3.7 Flash | Gemini 3.8 Flash |
|---|---|---|
| Релиз | 13 авг 2026 | 2 сен 2026 |
| Вход / выход, за 1M токенов | $0.75 / $3.75 | $0.75 / $3.75 |
| С 1 янв 2027 | $1.50 / $7.50 | $1.50 / $7.50 |
| Кэшированный вход | $0.075 | $0.075 |
| Контекстное окно | 1M токенов | 1M токенов |
| Максимальный вывод | 64K токенов | 64K токенов |
| Уровни thinking | low / medium (по умолчанию) / high | low / medium (по умолчанию) / high |
minimal | возвращает ошибку | возвращает ошибку |
| AA Intelligence Index (high) | 56 | 59 |
| Стоимость задачи по AA (high) | $0.40 | $0.58 |
| Выходных токенов на задачу по AA (high) | — | 48k, «рост на 30%» |
| Выходных токенов на прогон индекса AA | 64M | 120M |
| Стоимость прогона индекса AA | $484.73 | $825.83 |
| Скорость вывода по AA | ~287 токенов/с | ~302 токена/с |
| Время на задачу по AA (high) | 2.2 мин | 2.5 мин |
Цены — со страницы цен Google; индекс, токены, стоимость и скорость — от Artificial Analysis, все данные сняты 3 сентября 2026 года. Если не считать даты релиза, различаются последние семь строк. AA объясняет изменение строк стоимости и времени двумя вещами: на 30% больше выходных токенов на задачу и больше ходов в агентных оценках.
Насколько Gemini 3.8 Flash лучше, чем 3.7 Flash?
Gemini 3.8 Flash набирает 59 на Artificial Analysis Intelligence Index при высоком effort; Gemini 3.7 Flash — 56. Три балла стоят примерно на 45% дороже за задачу: $0.58 против $0.40. Artificial Analysis публикует один сводный балл на модель и уровень effort:
| Модель, effort | AA Intelligence Index | Стоимость задачи по AA |
|---|---|---|
| Gemini 3.8 Flash, high | 59 | $0.58 |
| Gemini 3.8 Flash, medium (по умолчанию) | 57 | $0.41 |
| Gemini 3.7 Flash, high | 56 | $0.40 |
| Gemini 3.8 Flash, low | 52 | $0.24 |
| Gemini 3.6 Flash, high | 52 | — |
Прочитайте колонку стоимости сверху вниз, и картина ясна. Gemini 3.8 Flash на high (59) стоит на 45% дороже за задачу, чем 3.7 Flash на high (56); на medium (57) — на 2.5% дороже; на low (52) — на 40% дешевле, и 52 — это балл, который уже был у 3.6 Flash.
Собственное резюме AA по релизу — «улучшение Intelligence Index на 3 балла» ценой «роста среднего числа выходных токенов на задачу на 30%, до 48k». Обе цифры — при высоком effort. На medium, по умолчанию, вы получаете большую часть улучшения почти без дополнительных затрат; именно эту конфигурацию мы бы и запустили.
Расход токенов Gemini 3.8 Flash: куда уходят лишние 30%
Gemini 3.8 Flash пишет примерно на 30% больше выходных токенов на задачу, чем 3.7 Flash при высоком effort, в среднем 48k по данным Artificial Analysis, и лишние токены уходят на дополнительные шаги рассуждения и итеративные вызовы инструментов. Цена за токен — меньшая половина счёта. Другая половина — сколько токенов модель пишет, прежде чем остановиться, и в этом поколении эта цифра сдвинулась.
За весь индекс AA зафиксировала 64M выходных токенов у 3.7 Flash, которые описывает как «довольно лаконично по сравнению с медианой 71M», и 120M у 3.8 Flash — «очень многословно по сравнению с медианой». Средний показатель на задачу, который приводит AA, — 48k у 3.8 Flash при высоком effort, на 30% больше, чем у 3.7 Flash.
Токены уходят туда, куда и говорила Google: на дополнительные шаги рассуждения и итеративные вызовы инструментов. На задачах, которым это нужно, это и есть три балла. На задачах, которым не нужно, это на 30% больше вывода по $3.75 за миллион за тот же ответ. Какой из вариантов описывает ваш трафик, бенчмарк не скажет; скажет поле completion_tokens в ваших собственных вызовах.
Скорость — вничью
3.8 Flash выдаёт примерно 302 выходных токена в секунду по измерению AA, 3.7 Flash — 287. Выигрыш в скорости на 5% не компенсирует рост токенов на 30%, поэтому время на задачу по AA растёт, а не падает: с 2.2 минуты до 2.5 при высоком effort. Если вы оптимизируете реальную задержку, рычаг — низкий effort на 3.8 Flash с 0.8 минуты на задачу, и он стоит вам баллов.
Миграция — одна строка
В запросе меняется только имя модели:
- model="gemini-3.7-flash"
+ model="gemini-3.8-flash"
Обе модели принимают low, medium и high, по умолчанию medium, и отвергают minimal с ошибкой; в руководстве по API 3.7 Flash есть точный ответ 400 и стоимость самого дешёвого допустимого уровня. Контекстное окно и потолок вывода 64K не изменились. В OpenAI-совместимом интерфейсе параметр называется reasoning_effort; в нативном протоколе Google — thinking_level.
Две вещи стоит перепроверить после замены:
- Бюджеты вывода и алерты. Та же ставка, примерно на 30% больше токенов на задачу при высоком effort. Всё, что откалибровано по объёму вывода 3.7 Flash, сработает.
- Уровень effort. Если вы держали 3.7 Flash на
high, потому что требовался балл, попробуйте сначала 3.8 Flash наmedium. Она на балл выше 3.7 Flash на high при разнице в один цент на задачу AA.
Стоит ли переходить на Gemini 3.8 Flash?
- Задаче нужны 59, и вы проверили, что 3.7 Flash с 56 действительно не справлялась, а не предположили это.
- Вы можете запускаться на среднем effort: 57 баллов за $0.41 на задачу — строгое улучшение относительно 3.7 Flash с 56 за $0.40.
- Ваш трафик агентный и с интенсивными вызовами инструментов — именно там, по словам Google, и уходят дополнительные шаги.
Когда оставаться на 3.7 Flash
- 3.7 Flash уже справляется. Слова Google — «полностью поддерживается»; ценовых причин переходить нет, а причина не переходить — 45% за задачу при высоком effort — есть.
- Вы платите за объём вывода, и запаса на рост в 30% нет.
- Ваши промпты настроены под поведение 3.7 Flash, и перенастройка стоит дороже, чем один балл.
Обрыв, общий для обеих моделей
1 января 2027 года обе модели дорожают вдвое: до $1.50 за вход и $7.50 за выход. Лесенка 3.8 Flash $0.58 / $0.41 / $0.24 за задачу превращается примерно в $1.16 / $0.82 / $0.48, если число токенов не изменится, а $0.40 у 3.7 Flash — примерно в $0.80. Разрыв в 45% между ними переживает эту дату нетронутым; движутся только абсолютные числа. Бюджету, который выходит за декабрь, нужна вторая строка.
Вызов через Ofox
google/gemini-3.7-flash есть в каталоге Ofox по $0.75 за вход и $3.75 за выход через провайдера Google (маршрут CloudVertex на той же странице модели — $1.50 / $7.50, и именно эту, большую, цифру сейчас отдаёт поле pricing в /v1/models), доступна через OpenAI-совместимый эндпоинт https://api.ofox.ai/v1 и через нативный протокол Gemini. Gemini 3.8 Flash нет в каталоге по состоянию на 3 сентября 2026 года. Когда её добавят, миграция через Ofox — та же замена одной строки, что выше, с префиксом google/. Последнее слово о том, что можно вызвать, — за живым каталогом GET /v1/models.
from openai import OpenAI
client = OpenAI(base_url="https://api.ofox.ai/v1", api_key="YOUR_OFOX_API_KEY")
for model in ["google/gemini-3.7-flash"]: # добавьте "google/gemini-3.8-flash", когда появится в каталоге
for effort in ["low", "medium", "high"]:
r = client.chat.completions.create(
model=model,
reasoning_effort=effort,
messages=[{"role": "user", "content": "Rewrite this GROUP BY as a window function."}],
)
print(f"{model:28} {effort:7} out={r.usage.completion_tokens:6}")
Прогоните это на своих промптах и прочитайте колонку out. Решение об апгрейде — это разница между строками 3.7 Flash и 3.8 Flash на том уровне effort, который вы реально запустите, умноженная на $3.75 за миллион. Из этого текста вы эту цифру не получите; из цикла — получите.
Источники
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
- https://ai.google.dev/gemini-api/docs/pricing
- https://ai.google.dev/gemini-api/docs/latest-model
- https://artificialanalysis.ai/articles/gemini-3-8-flash
- https://artificialanalysis.ai/models/gemini-3-8-flash
- https://artificialanalysis.ai/models/gemini-3-7-flash
- https://ofox.ai/models/google/gemini-3.7-flash
Цены, баллы индекса, число токенов и скорость проверены 3 сентября 2026 года. Наличие в каталоге Ofox проверено по живому эндпоинту /v1/models в тот же день; цены Ofox — со страницы модели.
Часто задаваемые вопросы
- Gemini 3.8 Flash дороже, чем Gemini 3.7 Flash?
- За токен — нет. Обе стоят $0.75 за миллион входных токенов и $3.75 за выходные до 31 декабря 2026 года, затем $1.50 и $7.50 с 1 января 2027-го, с одинаковыми тарифами на кэширование, Batch, Flex и Priority. За задачу — да: Artificial Analysis измерила $0.58 за задачу Intelligence Index у 3.8 Flash против $0.40 у 3.7 Flash при высоком effort, потому что 3.8 Flash пишет примерно на 30% больше выходных токенов на задачу.
- Насколько Gemini 3.8 Flash лучше, чем 3.7 Flash?
- На три балла по Artificial Analysis Intelligence Index при высоком effort: 59 против 56. При среднем effort по умолчанию у 3.8 Flash 57 баллов — на один выше 3.7 Flash — при почти той же стоимости задачи $0.41. При низком effort 3.8 Flash набирает 52, ниже 3.7 Flash.
- Стоит ли переходить с Gemini 3.7 Flash на 3.8 Flash?
- Собственная рекомендация Google — что 3.7 Flash «остаётся полностью поддерживаемой для нагрузок, где важна эффективность». Переходите, если вам нужны 59 баллов при высоком effort и вы готовы к росту стоимости задачи примерно на 45%. Переключение на medium даёт 57 примерно за ту же стоимость задачи, что у 3.7 Flash. Если 3.7 Flash уже справляется, ценовых причин переходить нет.
- Одинаковы ли параметры API у Gemini 3.8 Flash и 3.7 Flash?
- Да. Обе принимают уровни thinking low, medium и high, по умолчанию medium, и возвращают ошибку на minimal. У обеих контекстное окно 1M токенов и потолок вывода 64K токенов. Меняется строка модели с gemini-3.7-flash на gemini-3.8-flash, и больше ничего в запросе менять не нужно.
- Доступна ли Gemini 3.8 Flash через Ofox?
- По состоянию на 3 сентября 2026 года — нет. google/gemini-3.7-flash есть в каталоге Ofox по $0.75 за вход и $3.75 за выход через провайдера Google (маршрут CloudVertex на той же странице — $1.50 / $7.50), по OpenAI-совместимому и нативному протоколу Gemini. Когда добавят 3.8 Flash, миграция — та же замена одной строки, что и при прямом вызове Google.


