Google представляет Gemini 3.7 Flash: гибридное рассуждение для кодинга, агентов и работы со знаниями
Gemini 3.7 Flash выходит 13 августа 2026 года с нативным гибридным рассуждением, настраиваемым thinking budget, frontier-бенчмарками кодинга и 50% скидкой на ввод до декабря.
Новый флагман гибридного рассуждения
13 августа 2026 года Google выпустил Gemini 3.7 Flash — флагманскую модель гибридного рассуждения для кодинга, агентов и сложной работы со знаниями. В отличие от прежних поколений Flash, жертвовавших глубиной ради скорости, 3.7 Flash включает нативное настраиваемое рассуждение прямо в API: вы регулируете глубину мышления на каждый запрос без переключения на отдельную «модель рассуждения».
Релиз одновременно нацелен на три аудитории: разработчиков production-агентов, команды с длительными задачами кодинга и предприятия, которым нужен надёжный мультимодальный анализ огромных наборов документов. Google позиционирует 3.7 Flash как модель, где один endpoint наконец обслуживает и чат-ответы быстрее 100 мс, и многоминутные глубокие исследования.
Нативное гибридное рассуждение и thinking budget
Ключевой параметр — thinking_config.thinking_budget, целое число, задающее, сколько внутренних токенов рассуждения модель может потратить перед ответом.
thinking_budget | Поведение | Лучше всего для |
|---|---|---|
| 0 | Режим сверхнизкой задержки (первый токен < 85 мс) | Живой чат, автодополнение, маршрутизация с высоким QPS |
| 256–1024 | Лёгкое многошаговое планирование | Маршрутизация инструментов, простой рефакторинг, RAG-синтез |
| 4096–16384 | Глубокое многошаговое рассуждение | Циклы агентов, сложная отладка, исследовательские отчёты |
| 32768–65536 | Максимальная глубина | Долгий кодинг, архитектурные изменения в нескольких файлах |
Настройка в Gemini API:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Отрефакторь этот React-компонент на hooks и добавь error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = быстрый режим; до 65536 для глубокого рассуждения
)
),
)
print(response.text)
Поскольку рассуждение нативное, а не прикрученное, задержка масштабируется плавно: thinking_budget = 0 ведёт себя как классический Flash, более высокие значения дают chain-of-thought без смены ID модели. Биллинг разделяет видимые выходные токены и внутренние thinking-токены — вы платите только за запрошенную глубину.
Основные бенчмарки
Google опубликовал прямые сравнения с Gemini 3.6 Flash, Claude Sonnet 5 и GPT-5.6 Terra. 3.7 Flash лидирует во всех перечисленных оценках:
| Бенчмарк | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Два числа особенно важны для разработчиков:
- DeepSWE v1.1 — 65.3%: скачок на 16 пунктов относительно 3.6 Flash; агентный кодинг — главная цель обучения.
- GDM-MRCR v2 — 97.0%: почти идеальное извлечение из длинного контекста в окне 2,5M токенов, критично для документных workflow.
Контекст предыдущего поколения: сравнение Gemini 3.6 Flash vs 3.5 Flash.
Цены и 50% вводная скидка
Google проводит агрессивную промо-акцию:
| Вводная цена (до 31 дек. 2026) | Стандартная цена (с 1 янв. 2027) | |
|---|---|---|
| Ввод | $0,75 / 1M токенов | $1,50 / 1M токенов |
| Вывод | $3,75 / 1M токенов | $7,50 / 1M токенов |
| Кэширование контекста | $0,075 / 1M токенов | $0,075 / 1M токенов |
50% скидка на ввод и вывод до конца 2026 года. Кэширование контекста — полезно при повторном использовании больших системных промптов или корпусов — остаётся $0,075 за миллион токенов независимо от промо.
В сочетании с меньшим числом round-trip вызовов инструментов при высоких thinking budget эффективная стоимость завершённой задачи агента может быть значительно ниже цены за токен. Наш гайд по оценке стоимости API разбирает типичные нагрузки.
Мультимодальность, web dev и агенты
Помимо бенчмарков, 3.7 Flash предлагает production-ready возможности:
- Контекстное окно 2,5M токенов — целые codebase, пакеты контрактов или исследовательские корпуса за один проход.
- 245 выходных токенов/с — достаточно быстро для стриминга UI-кода и длинных отчётов.
- 99,7% точности выполнения JSON-инструментов — надёжные структурированные выходы для цепочек инструментов агентов.
- Computer use — встроенная клиентская автоматизация для браузера и рабочего стола.
- Точность генерации UI — более высокая точность вёрстки на WebDev Arena (1588 Elo) означает более чистые сгенерированные фронтенды.
Доступно через Gemini API, Google AI Studio, Gemini Enterprise и Google Antigravity.
Гайд для разработчиков и миграция
При обновлении с 3.6 Flash или 3.5 Flash-Lite начните с этих паттернов:
- Замените ID модели —
gemini-3.6-flashнаgemini-3.7-flash; API обратно совместим. - Настройте thinking budget по типу задачи —
0для пользовательского чата,1024для RAG Q&A,8192+для coding-агентов,32768только для ночных batch-задач без требований к задержке. - Включите кэширование контекста — при системных промптах или наборах документов > 32K токенов, повторяющихся между запросами, стоимость ввода падает на 90%.
- Настройте схемы инструментов — 99,7% JSON-точности вознаграждает строгие схемы; расплывчатые определения всё равно падают на уровне приложения.
- Мониторьте использование thinking-токенов — логируйте
usage_metadata, чтобы понять, какие шаги агента действительно требуют глубокого рассуждения.
Паттерны агентных workflow: гайд 3.5 Flash-Lite agentic workflows — концепция thinking budget естественно расширяется на 3.7 Flash с более тонкой гранулярностью.
Итог
Gemini 3.7 Flash — первая модель уровня Flash, где скорость и глубина не взаимоисключающи. Настраиваемый thinking_budget позволяет одной модели обслуживать latency-чувствительный чат и глубокий агентный кодинг, а стартовые цены делают эксперименты дешёвыми до конца 2026 года.