Gemini Omni
Назад к статьям
9 мин. чтения

Google представляет Gemini 3.7 Flash: гибридное рассуждение для кодинга, агентов и работы со знаниями

Gemini 3.7 Flash выходит 13 августа 2026 года с нативным гибридным рассуждением, настраиваемым thinking budget, frontier-бенчмарками кодинга и 50% скидкой на ввод до декабря.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Русский

Новый флагман гибридного рассуждения

13 августа 2026 года Google выпустил Gemini 3.7 Flash — флагманскую модель гибридного рассуждения для кодинга, агентов и сложной работы со знаниями. В отличие от прежних поколений Flash, жертвовавших глубиной ради скорости, 3.7 Flash включает нативное настраиваемое рассуждение прямо в API: вы регулируете глубину мышления на каждый запрос без переключения на отдельную «модель рассуждения».

Релиз одновременно нацелен на три аудитории: разработчиков production-агентов, команды с длительными задачами кодинга и предприятия, которым нужен надёжный мультимодальный анализ огромных наборов документов. Google позиционирует 3.7 Flash как модель, где один endpoint наконец обслуживает и чат-ответы быстрее 100 мс, и многоминутные глубокие исследования.

Нативное гибридное рассуждение и thinking budget

Ключевой параметр — thinking_config.thinking_budget, целое число, задающее, сколько внутренних токенов рассуждения модель может потратить перед ответом.

thinking_budgetПоведениеЛучше всего для
0Режим сверхнизкой задержки (первый токен < 85 мс)Живой чат, автодополнение, маршрутизация с высоким QPS
256–1024Лёгкое многошаговое планированиеМаршрутизация инструментов, простой рефакторинг, RAG-синтез
4096–16384Глубокое многошаговое рассуждениеЦиклы агентов, сложная отладка, исследовательские отчёты
32768–65536Максимальная глубинаДолгий кодинг, архитектурные изменения в нескольких файлах

Настройка в Gemini API:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Отрефакторь этот React-компонент на hooks и добавь error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = быстрый режим; до 65536 для глубокого рассуждения
        )
    ),
)
print(response.text)

Поскольку рассуждение нативное, а не прикрученное, задержка масштабируется плавно: thinking_budget = 0 ведёт себя как классический Flash, более высокие значения дают chain-of-thought без смены ID модели. Биллинг разделяет видимые выходные токены и внутренние thinking-токены — вы платите только за запрошенную глубину.

Основные бенчмарки

Google опубликовал прямые сравнения с Gemini 3.6 Flash, Claude Sonnet 5 и GPT-5.6 Terra. 3.7 Flash лидирует во всех перечисленных оценках:

БенчмаркGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Два числа особенно важны для разработчиков:

  • DeepSWE v1.1 — 65.3%: скачок на 16 пунктов относительно 3.6 Flash; агентный кодинг — главная цель обучения.
  • GDM-MRCR v2 — 97.0%: почти идеальное извлечение из длинного контекста в окне 2,5M токенов, критично для документных workflow.

Контекст предыдущего поколения: сравнение Gemini 3.6 Flash vs 3.5 Flash.

Цены и 50% вводная скидка

Google проводит агрессивную промо-акцию:

Вводная цена (до 31 дек. 2026)Стандартная цена (с 1 янв. 2027)
Ввод$0,75 / 1M токенов$1,50 / 1M токенов
Вывод$3,75 / 1M токенов$7,50 / 1M токенов
Кэширование контекста$0,075 / 1M токенов$0,075 / 1M токенов

50% скидка на ввод и вывод до конца 2026 года. Кэширование контекста — полезно при повторном использовании больших системных промптов или корпусов — остаётся $0,075 за миллион токенов независимо от промо.

В сочетании с меньшим числом round-trip вызовов инструментов при высоких thinking budget эффективная стоимость завершённой задачи агента может быть значительно ниже цены за токен. Наш гайд по оценке стоимости API разбирает типичные нагрузки.

Мультимодальность, web dev и агенты

Помимо бенчмарков, 3.7 Flash предлагает production-ready возможности:

  • Контекстное окно 2,5M токенов — целые codebase, пакеты контрактов или исследовательские корпуса за один проход.
  • 245 выходных токенов/с — достаточно быстро для стриминга UI-кода и длинных отчётов.
  • 99,7% точности выполнения JSON-инструментов — надёжные структурированные выходы для цепочек инструментов агентов.
  • Computer use — встроенная клиентская автоматизация для браузера и рабочего стола.
  • Точность генерации UI — более высокая точность вёрстки на WebDev Arena (1588 Elo) означает более чистые сгенерированные фронтенды.

Доступно через Gemini API, Google AI Studio, Gemini Enterprise и Google Antigravity.

Гайд для разработчиков и миграция

При обновлении с 3.6 Flash или 3.5 Flash-Lite начните с этих паттернов:

  1. Замените ID моделиgemini-3.6-flash на gemini-3.7-flash; API обратно совместим.
  2. Настройте thinking budget по типу задачи0 для пользовательского чата, 1024 для RAG Q&A, 8192+ для coding-агентов, 32768 только для ночных batch-задач без требований к задержке.
  3. Включите кэширование контекста — при системных промптах или наборах документов > 32K токенов, повторяющихся между запросами, стоимость ввода падает на 90%.
  4. Настройте схемы инструментов — 99,7% JSON-точности вознаграждает строгие схемы; расплывчатые определения всё равно падают на уровне приложения.
  5. Мониторьте использование thinking-токенов — логируйте usage_metadata, чтобы понять, какие шаги агента действительно требуют глубокого рассуждения.

Паттерны агентных workflow: гайд 3.5 Flash-Lite agentic workflows — концепция thinking budget естественно расширяется на 3.7 Flash с более тонкой гранулярностью.

Итог

Gemini 3.7 Flash — первая модель уровня Flash, где скорость и глубина не взаимоисключающи. Настраиваемый thinking_budget позволяет одной модели обслуживать latency-чувствительный чат и глубокий агентный кодинг, а стартовые цены делают эксперименты дешёвыми до конца 2026 года.

Связанные материалы