Gemini 3.7 Flash API: цена $0.75 временная, minimal отдаёт 400
Gemini 3.7 Flash стоит $0.75 на входе и $3.75 на выходе — ровно столько же, сколько 3.6 Flash. Уровней thinking осталось три, minimal теперь возвращает 400, а самый дешёвый доступный уровень обходится в 8.4 раза дороже.
Gemini 3.7 Flash вышел 13 августа 2026 года по цене $0.75 за миллион входных токенов и $3.75 за миллион выходных. В этой цене легко упустить две вещи: она истекает 31 декабря 2026 и на следующий день удваивается, а у Gemini 3.6 Flash теперь ровно те же цифры.
Ломает сборки не цена. Уровней thinking стало три вместо четырёх. minimal исчез — и исчез громко, без тихой деградации.
Цена: $0.75 вход / $3.75 выход за 1M до 2026-12-31
$1.50 / $7.50 с 2027-01-01
Batch и Flex: $0.375 / $1.875, та же дата удвоения
Кэш: чтение $0.075, хранение $0.50 за 1M в час
Контекст: 1 048 576 вход / 65 536 выход
Thinking: thinking_level low | medium | high, по умолчанию medium
minimal возвращает HTTP 400
Шлюзы: google/gemini-3.7-flash на ofox
Замерено: minimal — 400, none и xhigh принимаются и тарифицируются
Срез: 2026-08-21, по 10 стриминговых вызовов на уровень
Последнее обновление: 2026-08-21. Стартовая цена действует до 2026-12-31 — пересчитайте бюджет, прежде чем планировать за эту дату.
Сколько стоит API Gemini 3.7 Flash
$0.75 на входе, $3.75 на выходе — пока это так. Страница цен Google кладёт два тарифа в одну ячейку, и именно так в бюджетную таблицу попадает не тот.
| Уровень | Вход / 1M | Выход / 1M | Действует |
|---|---|---|---|
| Standard | $0.75 | $3.75 | до 2026-12-31 |
| Standard | $1.50 | $7.50 | с 2027-01-01 |
| Batch / Flex | $0.375 | $1.875 | до 2026-12-31 |
| Batch / Flex | $0.75 | $3.75 | с 2027-01-01 |
Чтение из кэша — $0.075 за миллион, хранение — $0.50 за миллион токенов в час, и то и другое удваивается в ту же дату. Search grounding даёт 5 000 бесплатных запросов в месяц на все модели Gemini 3.x сразу, а не на каждую отдельно, дальше — $14 за тысячу.
Одна строка на этой странице влияет на счёт сильнее заголовочного тарифа: в строке выхода написано «Output price (including thinking tokens)». Reasoning считается по выходной ставке, поэтому настройка effort — это множитель цены, а не ручка качества с погрешностью округления.
Дешевле ли Gemini 3.7 Flash, чем 3.6 Flash
Нет. Цена совпадает ячейка в ячейку. Если вы видели 3.7 Flash в подаче «вдвое дешевле 3.6 Flash», у этого сравнения был срок годности примерно в сутки — и история самой страницы цен объясняет почему.
- 2026-07-22, сразу после выхода 3.6 Flash 21 июля, по архивной копии страницы цен: 3.6 Flash стоит $1.50 / $7.50.
- 2026-08-12, по последней копии до запуска 3.7: 3.6 Flash всё ещё $1.50 / $7.50, ровно, без строки скидки. 3.7 Flash на странице ещё нет.
- 2026-08-13: выходит 3.7 Flash.
- 2026-08-14, по следующей архивной копии: и 3.6 Flash, и 3.7 Flash читаются как $0.75 / $3.75 до 2026-12-31 и $1.50 / $7.50 после.
- 2027-01-01: обе возвращаются к $1.50 / $7.50 — столько 3.6 Flash стоил в день собственного запуска.
То есть база сравнения сдвинулась внутри тех же 48 часов, что и само сравнение. Карточка модели Google фиксирует финал сноской без комментариев: звёздочка у обеих ценовых строк говорит, что стартовая цена истекает 31 декабря 2026 года. Переход с 3.6 ничего не удорожает и ничего не экономит. Скидка покупает четыре с половиной месяца — одинаково для обеих моделей.
На странице модели в ofox есть тарифы, которые Google отдельно не расписывает: запись в кэш $0.0415 за миллион, часовая запись в кэш $0.50, аудиовход $0.75, веб-поиск $0.014 за запрос.
Как вызывать Gemini 3.7 Flash
Два маршрута, и отличаются они только базовым URL и строкой модели.
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://api.ofox.ai/v1")
r = client.chat.completions.create(
model="google/gemini-3.7-flash",
reasoning_effort="low",
messages=[{"role": "user", "content": "Rewrite this query with a window function"}],
)
print(r.choices[0].message.content)
Напрямую к Google строка модели теряет префикс google/, а базовый URL меняется:
client = OpenAI(
api_key="AIza...",
base_url="https://generativelanguage.googleapis.com/v1beta/openai/",
)
r = client.chat.completions.create(model="gemini-3.7-flash", reasoning_effort="low", messages=[...])
В нативном протоколе Google параметр называется не reasoning_effort. Это thinking_level, он принимает low, medium и high и по умолчанию равен medium. На ofox открыты оба протокола, наверху — Google и Cloud Vertex.
Список возможностей дешевле переписать со страницы модели, чем выяснять по ошибкам 400: function calling, структурированный вывод, кэширование контекста, выполнение кода, search grounding, URL context, file search и Maps grounding поддерживаются, computer use помечен как Preview, доступны Batch, Flex и Priority. Live API, генерация изображений и генерация аудио не поддерживаются. На вход идут текст, изображения, видео, аудио и PDF, на выходе только текст.
Почему minimal возвращает ошибку
Потому что уровень убрали, и запрос падает вместо отката на соседний. Страница модели говорит это прямым текстом в строке Thinking: Supported (low, medium, high), а следом Note: minimal is not supported and returns an error.
Мы всё равно отправили. Через маршрут ofox reasoning_effort: "minimal" возвращает HTTP 400 с телом:
{"error": {"code": null,
"message": "Thinking level is unsupported: THINKING_LEVEL_MINIMAL",
"param": null, "type": "invalid_request_error"}}
3.6 Flash значение minimal пока принимает, и мы замерили, что этот уровень делал для вас, пока он у вас есть. На 3.6 Flash тот же промпт на minimal дал медиану 42 completion-токена при нуле токенов размышления и первом токене через 1.36 секунды. Самый дешёвый уровень, который примет 3.7, — low — дал медиану 354 токена за 4.19 секунды. Это 8.4 раза по тарифицируемому выходу и втрое по ожиданию, при том что видимый ответ в обоих случаях — те же 40 токенов.
Так что миграция здесь — не «поменять ID модели и жить дальше». Конфиг с захардкоженным minimal перестаёт работать в момент подмены ID, а ближайшее допустимое значение молча стоит в восемь раз дороже. Уровня «не думать» у 3.7 Flash нет вообще.
Более интересная половина этой пробы — то, что не упало. none и xhigh для этой модели не документированы, но оба вернули HTTP 200 и токены размышления в счёте: медианы 271 и 604 за десять прогонов, что и даёт 308 и 637 completion-токенов в таблице ниже. Отвергается только minimal. Ответ 200 не подтверждает, что отправленное значение выбрало уровень, который обещает его имя, — та же ловушка, что GLM 5.3 расставляет недокументированными значениями reasoning_effort, где валидация живёт на маршруте, а не в модели. Пробуйте свой маршрут до релиза: «вернулось 200» и «сделало то, что я просил» — разные утверждения.
Страница OpenAI-совместимости Google стоит двух минут: в её таблице соответствий для reasoning_effort перечислены Gemini 3.1 Pro, 3.1 Flash-Lite, Gemini 3 Flash и 2.5, колонки 3.7 нет, а OpenAI-овский minimal отображается вниз. Страница модели при этом говорит, что 3.7 его отвергает. Две страницы Google, согласия нет, и одна короткая проба решает вопрос для того маршрута, который вы реально вызываете.
Сколько на самом деле стоит каждый уровень thinking
Ответ тот же, счёт — до двух раз больше. Mak, product lead в ofox, 21 августа 2026 года прогнал по десять стриминговых вызовов на уровень через один и тот же маршрут ofox, на одном коротком промпте (переписать GROUP BY через оконную функцию), фиксируя время до первого содержательного токена и usage, который вернул API.
reasoning_effort | Медиана TTFT | Диапазон TTFT | Completion-токены | Диапазон | Видимый ответ |
|---|---|---|---|---|---|
low | 4.19 с | 2.22–5.40 | 354 | 40–418 | ~41 |
medium | 5.47 с | 4.47–6.98 | 384 | 291–558 | ~41 |
high | 7.69 с | 5.97–9.68 | 688 | 560–806 | ~40 |
| не задан | 5.58 с | 4.32–5.98 | 431 | 333–583 | ~36 |
none (не документирован) | 4.64 с | 1.88–5.05 | 308 | 40–361 | ~40 |
xhigh (не документирован) | 7.35 с | 5.89–9.10 | 637 | 513–892 | ~39 |
Медианы по десяти прогонам; диапазоны — наблюдаемые минимум и максимум, они расширяются с числом прогонов, так что читайте их как разброс, а не как границы. Всё это один промпт на одном маршруте, а обработка параметров у разных маршрутов к одной модели может отличаться — форму считайте переносимой, а числа нашими.
Размер ответа не меняется. Меняется невидимая часть. Текстовых токенов на каждом уровне было около 40, потому что запрошенный SQL-запрос занимает 40 токенов, сколько над ним ни думай. Всё, что выше этой линии, — reasoning, тарифицируемый по выходной ставке. Только по выходу при $3.75 за миллион тысяча таких вызовов стоит $1.33 на low и $2.58 на high; промпт в 34 токена добавляет меньше трёх центов на тысячу в обоих случаях, так что всю разницу делает именно настройка effort.
low в одном прогоне из десяти опустился до 40 completion-токенов при ровно нулевом reasoning; none сделал так дважды. Ни medium, ни high не делали этого ни разу, и этот пол — основная причина, почему их диапазоны разошлись.
low и high разделяются чисто. low и medium — нет. Диапазон high (560–806) не пересекается с диапазоном low (40–418), так что на этом промпте разрыв настоящий. У low и medium разница медиан 30 токенов, а диапазоны перекрываются почти на всём протяжении — десять прогонов их не различают. Полезен ли medium как середина — вопрос про ваш промпт, и ответить на него своими данными занимает минуты четыре.
Недокументированные значения не падают и не делают того, что обещают. none вернул HTTP 200 и потратил медианно 271 токен размышления — почти столько же, сколько тратит low. Если вы прочитали это имя как выключатель, вы платите за размышления, которые считаете отключёнными. xhigh встаёт рядом с high. Отвергается только minimal.
Ничто из этого не противоречит тому, что модель быстрая. Artificial Analysis ставит 3.7 Flash на 1-е место из 182 по скорости выдачи — 389.5 токена в секунду. На той же странице они меряют 14.52 секунды до первого токена на high при прямом обращении к API Google, против медианы 2.80 секунды у моделей его ценовой группы и примерно вдвое больше нашей медианы на high через этот маршрут. Ожидание стоит перед потоком, а не внутри него — поэтому пользователь чувствует настройку effort, а не токены в секунду.
В чём Gemini 3.7 Flash хорош
Карточка модели Google публикует сравнение с 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra и Muse Spark 1.2. Строки, где разрыв реальный:
| Бенчмарк | 3.7 Flash | 3.6 Flash | Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| AA Intelligence Index | 56 | 52 | 55 | 57 |
| GDM-MRCR v2 (128k) | 97.0% | 91.8% | 81.5% | 93.5% |
| LVBench (длинное видео) | 85.4% | 84.2% | 68.5% | 78.9% |
| Code Arena (веб-разработка, Elo) | 1588 | 1538 | 1541 | 1523 |
| AutomationBench | 30.4% | 17.0% | 10.7% | 23.6% |
| FrontierCode 1.1 | 43.6% | 34.4% | 42.7% | 41.3% |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% |
| GDPVal-AA v2 (Elo) | 1525 | 1422 | 1598 | 1578 |
| Agent’s Last Exam | 26.3% | 24.2% | 33.3% | 28.0% |
| CharXiv, без инструментов | 84.5% | 85.2% | 77.0% | 85.9% |
Сильные стороны группируются: поиск по длинному контексту, видео, фронтенд-код и автоматизация браузера. 97.0% на поиске иголки в 128k — единственный результат выше 95 в таблице, а 30.4% на AutomationBench против 10.7% у Sonnet 5 — не тот отрыв, который получают правкой промпта.
Слабые стороны группируются так же плотно, и все они про работу, которая идёт долго. По обеим версиям Terminal-bench модель стоит позади GPT-5.6 Terra: 85.8% против 87.4% на 2.1 и 14.9% против 20.8% на 3.0. DeepSWE v1.1 тоже отстаёт от Terra на 4.3 пункта, а 1525 на GDPVal-AA v2 — последнее место в таблице. Берите эту модель на шаг процесса, а не на восьмичасовой автономный цикл.
Две строки в этой таблице стоит читать внимательно. CharXiv — единственная строка, где 3.7 хуже модели, которую заменяет: 84.5% против 85.2% без инструментов и 88.7% против 89.4% с ними, так что насыщенную графиками мультимодальную работу стоит прогнать через собственный A/B до замены. И строки Terminal-bench получены самим вендором. Карточка заявляет 85.8% на Terminal-bench 2.1 — это выше, чем 83.8% ± 1.2% у лидера публичной таблицы Terminal-Bench 2.1, где на момент нашей выгрузки было 17 проверенных заявок и ни одной от 3.7 Flash. Самозаявленный результат, перекрывающий проверенного лидера, — единственное число в этой таблице, которое стоит читать как утверждение, а не как результат.
Ещё две строки из карточки, словами самого Google: обучающие данные обрываются в марте 2026, часть областей — ещё в январе 2025, и «may also be occasional slowness or timeout issues».
Когда стоит выбирать Gemini 3.7 Flash
| Нагрузка | Решение | Почему |
|---|---|---|
| RAG и поиск за пределами 128k | Берите | MRCR v2 на 97.0%, максимум в карточке |
| Понимание видео и вопросы к нему | Берите | LVBench 85.4%, на 17 пунктов выше Sonnet 5 |
| Генерация фронтенда и веб-кода | Берите | Code Arena 1588, вершина таблицы |
| Автоматизация браузера и GUI | Берите | AutomationBench 30.4% против 10.7% у Sonnet 5 |
| Долгоживущие терминальные агенты | Осторожно | Terminal-bench 3.0 на 14.9% |
| Интерактивный чат и голосовой фронтенд | Ищите другое | Нет Live API, а время размышления стоит перед первым токеном |
| Мультимодальный анализ с обилием графиков | Сначала проверьте | CharXiv — единственный откат относительно 3.6 |
| Одиночные ответы длиннее 64k токенов | Режьте на части | Потолок вывода — 65 536 |
Если вашей задачи в списке нет, подборщик моделей ofox ранжирует 100+ моделей по качеству, цене и скорости под выбранный тип задачи (код, агенты, RAG по длинным документам, зрение, извлечение, перевод), подтягивая актуальные цены и лимиты контекста. Без регистрации и без ключа.
Какие модели набирают примерно столько же
Четыре модели укладываются в три пункта друг от друга по индексу Artificial Analysis Intelligence Index при разбросе цен больше чем втрое. Оценки и тарифы ниже — те, что напечатаны в карточке модели Google, то есть это один источник, а не четыре: перед тем как закладывать бюджет, перепроверьте на странице самого вендора.
| Модель | AA Index | Вход / 1M | Выход / 1M |
|---|---|---|---|
| GPT-5.6 Terra | 57 | $2.00 | $12.00 |
| Muse Spark 1.2 | 57 | $1.25 | $4.25 |
| Gemini 3.7 Flash | 56 | $0.75 | $3.75 |
| Claude Sonnet 5 | 55 | $2.00 | $10.00 |
| Gemini 3.6 Flash | 52 | $0.75 | $3.75 |
Самый дешёвый из четырёх по выходу, в 3.2 раза ниже Terra, и на пункт позади него по сводному индексу. Подвох как раз в сводном индексе: он прячет терминальные строки и GDPVal, где 3.7 Flash приходит последним, так что «сопоставимо» — утверждение об индексе и ни о чём больше.
Строкой ниже 3.6 Flash теперь стоит столько же при четырёх пунктах отставания, и оснований оставаться на нём не остаётся — кроме промптов, уже подогнанных под его поведение. Если вы всё ещё на нём, в нашем сравнении стоимости задачи с DeepSeek V4 Flash есть подсчёты, а уровень ниже разбирает сравнение бюджетных агентов на 3.1 Flash-Lite. Если переходите через поколение, руководство по кодинг-агентам на 3.5 Flash применимо к 3.7 без изменений, не считая ID модели и отсутствующего minimal.
В ofox до 2026-08-31 действует +15% к пополнению и возврат 15% от расхода по коду OFOXAI2608: google/gemini-3.7-flash и google/gemini-3.6-flash стоят за одним OpenAI-совместимым эндпоинтом, так что A/B из сниппета выше — замена одной строки.
References
- Google: страница модели Gemini 3.7 Flash
- Google: цены Gemini API
- Google: thinking и thinking_level
- Google: OpenAI-совместимость
- DeepMind: карточка модели Gemini 3.7 Flash
- Artificial Analysis: Gemini 3.7 Flash
- Таблица лидеров Terminal-Bench 2.1
- Internet Archive: цены Gemini API, 2026-07-22
- Internet Archive: цены Gemini API, 2026-08-12
- Internet Archive: цены Gemini API, 2026-08-14
- Страница модели ofox: Gemini 3.7 Flash
Часто задаваемые вопросы
- Сколько стоит API Gemini 3.7 Flash?
- $0.75 за миллион входных токенов и $3.75 за миллион выходных — до 31 декабря 2026 года, а с 1 января 2027 будет $1.50 и $7.50. Страница цен Google печатает обе строки в одной ячейке. Batch и Flex стоят вдвое меньше, $0.375 / $1.875, и дорожают в ту же дату. В цену выхода входят токены размышления, то есть reasoning тарифицируется по выходной ставке.
- Gemini 3.7 Flash дешевле, чем 3.6 Flash?
- Нет, они стоят одинаково. На странице цен Google у обеих моделей одни и те же четыре уровня и одни и те же две даты. Архивные копии показывают, почему формулировка «вдвое дешевле» не выдерживает проверки: 12 августа 2026 у 3.6 Flash было ровно $1.50 / $7.50 без всякой скидки, а 3.7 Flash на странице ещё не было; 14 августа обе модели читаются как $0.75 / $3.75. База сравнения сдвинулась в те же 48 часов, что и само сравнение.
- Почему reasoning_effort minimal падает на Gemini 3.7 Flash?
- Потому что этот уровень убрали. На странице модели прямо написано: «Note: minimal is not supported and returns an error.» В нашей пробе запрос вернул HTTP 400 с телом «Thinking level is unsupported: THINKING_LEVEL_MINIMAL» и типом invalid_request_error. 3.6 Flash значение minimal принимает, поэтому конфиг с захардкоженным minimal ломается ровно в момент подмены ID модели, а не деградирует тихо.
- Какие уровни thinking есть у Gemini 3.7 Flash?
- Нативный параметр называется thinking_level и принимает low, medium и high, по умолчанию medium. Через OpenAI-совместимый слой параметр называется reasoning_effort. Мы прогнали по десять стриминговых вызовов на уровень на одном коротком промпте: медиана completion-токенов на low — 354 против 688 на high, диапазоны не пересекаются, а видимый ответ на всех уровнях остаётся около 40 токенов.
- Какие лимиты контекста и вывода у Gemini 3.7 Flash?
- 1 048 576 входных токенов и 65 536 выходных. Окно на миллион токенов не означает ответов на миллион токенов, так что переписывание длинных документов и генерацию целого репозитория всё равно придётся резать на части. На вход идут текст, изображения, видео, аудио и PDF, на выходе только текст.
- Gemini 3.7 Flash быстрый?
- Смотря какую половину мерить. Artificial Analysis ставит его на 1-е место из 182 по скорости выдачи — 389.5 токена в секунду, — и на той же странице фиксирует 14.52 секунды до первого токена на уровне high при прямом обращении к API Google, против медианы 2.80 секунды у моделей его ценовой группы. Время размышления стоит перед первым токеном, поэтому задержка и пропускная способность — разные истории. Наши медианы через маршрут ofox: 4.19 с на low, 5.47 на medium и 7.69 на high.
- Какие модели набирают примерно столько же, сколько Gemini 3.7 Flash?
- По индексу Artificial Analysis Intelligence Index, напечатанному в карточке модели Google, у 3.7 Flash 56 против 57 у GPT-5.6 Terra и Muse Spark 1.2 и 55 у Claude Sonnet 5. Там же указаны цены: $2.00 / $12.00, $1.25 / $4.25 и $2.00 / $10.00 за миллион, то есть по цене выхода 3.7 Flash из этой четвёрки самый дешёвый.
- Какой ID у Gemini 3.7 Flash на шлюзах?
- На ofox это google/gemini-3.7-flash, доступный и по протоколу OpenAI /v1/chat/completions, и по нативному протоколу Gemini. При прямом обращении к Google код модели — gemini-3.7-flash, а OpenAI-совместимый base URL — https://generativelanguage.googleapis.com/v1beta/openai/.


