Gemini Omni
Назад к статьям
10 мин. чтения

Гид по Gemini 3.5 Flash-Lite: масштабирование агентных процессов на 350 токенах/с (2026)

Gemini 3.5 Flash-Lite выдаёт 350 токенов/с при $0.30/1M на входе. Бенчмарки против 3.1 Flash-Lite и Gemini 3 Flash, уровни рассуждения, расчёт затрат и таблица выбора.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Русский

Сегмент объёма стал серьёзным

Gemini 3.5 Flash-Lite, анонсированная 21 июля 2026 года, — самая быстрая и экономичная модель Google класса 3.5: 350 выходных токенов в секунду (Artificial Analysis) по цене $0.30 за 1M входных токенов и $2.50 за 1M выходных. Исторически уровни «Lite» были местом, где качество умирало: годились для классификации и шаблонного текста, но были рискованны для чего-либо агентного. Этот релиз ломает шаблон: на нескольких агентных и кодинговых оценках 3.5 Flash-Lite прямо обходит более крупный Gemini 3 Flash.

Этот гид объясняет, где Flash-Lite стоит в линейке, как настраивать её уровни рассуждения, сколько она реально стоит на масштабе и какую модель выбирать под какую нагрузку. Контекст запуска — в нашем обзоре анонса.

Поколенческий скачок: против 3.1 Flash-Lite

Скачок относительно предыдущего поколения Lite — крупнейший в истории семейства:

БенчмаркЧто измеряетGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Кодинг и агентные задачи в терминале54%31%
GDM-MRCR v2Извлечение из длинного контекста72.2%60.1%
GDPval-AA v2Выполнение реальных задач1140642

Сравнение бенчмарков Gemini 3.5 Flash-Lite с предыдущими поколениями Flash-Lite

Почти удвоившийся показатель GDPval-AA v2 (642 → 1140) — цифра, которую стоит запомнить: именно на выполнении реальных задач старые Lite-модели разваливались в продакшн-агентах.

Сенсация: победа над Gemini 3 Flash

Ещё удивительнее поколенческого прироста — межуровневый. На нескольких агентных и кодинговых оценках 3.5 Flash-Lite превосходит Gemini 3 Flash — более крупную и дорогую модель:

БенчмаркGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Если сегодня вы держите нагрузки на 2.5 Flash или 3 Flash, потому что Lite-уровням нельзя было доверять агентную работу, это предположение устарело — Flash-Lite на этих задачах и быстрее, и способнее.

Уровни рассуждения: одна модель, два режима работы

Flash-Lite поставляется с настраиваемыми уровнями рассуждения, которые фактически делают из неё два продукта:

  • Minimal / low рассуждение — приоритет задержке и стоимости для высоконагруженных задач: агентный поиск, обработка документов, извлечение, классификация, маршрутизация. Это режим 350 токенов/с.
  • Более высокие уровни рассуждения — включают более глубокое мышление для многошаговых субагентных нагрузок, где Flash-Lite работает исполнителем под моделью-оркестратором.

Второй режим соответствует паттерну из демо самого Google: 3.6 Flash как главный агент, флоты субагентов 3.5 Flash-Lite, работающих параллельно (одно демо генерирует 25 концептов веб-дизайна одновременно). Управление компьютером на Flash-Lite тоже встроенный инструмент, так что субагенты могут работать с интерфейсами без дополнительной обвязки. Разницу в задержке на высоконагруженных задачах смотрите в демо скорости Flash-Lite vs 3.5 Flash (видео).

Анализ затрат: сколько на самом деле стоит масштаб

Цены: $0.30/1M на входе, $2.50/1M на выходе. Пример нагрузки — агент обработки документов, который обрабатывает 1 миллион документов в месяц, в среднем 3K входных и 500 выходных токенов на документ:

Статья затратРасчётСтоимость в месяц
Входные токены1M док. × 3K токенов = 3B токенов × $0.30/1M$900
Выходные токены1M док. × 500 токенов = 0.5B токенов × $2.50/1M$1,250
Итого на 3.5 Flash-Lite$2,150
Та же нагрузка на 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Примерно 4-кратная разница в затратах для нагрузки, с которой Lite отлично справляется, — а на скорости 350 токенов/с 500-токенное резюме каждого документа выводится стримом менее чем за 1.5 секунды. Отсюда стратегия: направляйте 90% рутинного объёма на Flash-Lite, а сложные 10% эскалируйте на 3.6 Flash.

Таблица выбора: какая модель под какую нагрузку

НагрузкаВыборПочему
Агентный поиск / RAG при высоком QPS3.5 Flash-Lite (minimal рассуждение)350 токенов/с, минимальная стоимость запроса
Массовая обработка документов / извлечение3.5 Flash-LiteВ 4 раза дешевле 3.6 Flash; GDM-MRCR v2 72.2% на длинном контексте
Классификация, маршрутизация, модерация3.5 Flash-Lite (minimal рассуждение)Критичная задержка, запас качества с избытком
Параллельные флоты субагентов под оркестратором3.5 Flash-Lite (высокие уровни рассуждения)Режим создан именно для этого; управление компьютером встроено
Сложный агентный кодинг (SWE-агенты)3.6 FlashDeepSWE 49%; выше точность, меньше плохих правок
ML-исследовательские процессы3.6 FlashMLE Bench 63.9% против 49.7% у 3.5 Flash
Агенты управления компьютером на сложных задачах3.6 FlashOSWorld-Verified 83.0% (против 74.0% у Lite)
Мультимодальный анализ документов и подготовка отчётов3.6 FlashПодтверждено Harvey / Hebbia на запуске
Легаси-конвейеры всё ещё на 3.5 FlashМигрируйте вверх или вниз3.6 Flash — ради качества, Flash-Lite — ради объёма; см. гид по миграции
Поиск и исправление уязвимостей безопасности3.5 Flash CyberТолько через пилот CodeMender (правительства и доверенные партнёры)

Эмпирическое правило: по умолчанию берите Flash-Lite и эскалируйте при неудаче, а не берите по умолчанию большую модель, чтобы оптимизировать потом. Провал виден сразу (плохие результаты); растрата от избыточного резервирования — молчалива.

Где доступна

3.5 Flash-Lite уже работает в Gemini API (Google AI Studio, Android Studio), на Gemini Enterprise Agent Platform и в приложении Gemini — и разворачивается внутри Google Search, что многое говорит об уверенности Google в её профиле затрат на планетарном масштабе. Среди первых клиентов — Ashler, Palo Alto Networks и Ramp.

На полях: 3.5 Flash Cyber и CodeMender

Тот же запуск представил Gemini 3.5 Flash Cyber — 3.5 Flash, дообученную находить и исправлять уязвимости безопасности. Внутри CodeMender несколько агентов Flash Cyber работают параллельно и объединяют находки в единый сводный отчёт, достигая конкурентной с фронтир-моделями производительности на CyberGym. Обратите внимание на архитектуру: это тот же паттерн «флота эффективных специалистов», который описывает этот гид, применённый к безопасности.

Доступ намеренно узкий: пилот с ограниченным доступом исключительно для правительств и доверенных партнёров через CodeMender — отражение риска двойного назначения автоматического поиска уязвимостей. Подробности — в нашем обзоре анонса.

Итог

3.5 Flash-Lite перечерчивает границу цены и производительности для агентных нагрузок: быстрее всего в серии 3.5, примерно в 4 раза дешевле 3.6 Flash и — впервые для Lite-модели — по-настоящему надёжна на агентных бенчмарках. Постройте маршрутизацию так, чтобы Flash-Lite была моделью по умолчанию, а 3.6 Flash — путём эскалации, и ваша кривая затрат скажет вам спасибо.

Связанные материалы