Гид по Gemini 3.5 Flash-Lite: масштабирование агентных процессов на 350 токенах/с (2026)
Gemini 3.5 Flash-Lite выдаёт 350 токенов/с при $0.30/1M на входе. Бенчмарки против 3.1 Flash-Lite и Gemini 3 Flash, уровни рассуждения, расчёт затрат и таблица выбора.
Сегмент объёма стал серьёзным
Gemini 3.5 Flash-Lite, анонсированная 21 июля 2026 года, — самая быстрая и экономичная модель Google класса 3.5: 350 выходных токенов в секунду (Artificial Analysis) по цене $0.30 за 1M входных токенов и $2.50 за 1M выходных. Исторически уровни «Lite» были местом, где качество умирало: годились для классификации и шаблонного текста, но были рискованны для чего-либо агентного. Этот релиз ломает шаблон: на нескольких агентных и кодинговых оценках 3.5 Flash-Lite прямо обходит более крупный Gemini 3 Flash.
Этот гид объясняет, где Flash-Lite стоит в линейке, как настраивать её уровни рассуждения, сколько она реально стоит на масштабе и какую модель выбирать под какую нагрузку. Контекст запуска — в нашем обзоре анонса.
Поколенческий скачок: против 3.1 Flash-Lite
Скачок относительно предыдущего поколения Lite — крупнейший в истории семейства:
| Бенчмарк | Что измеряет | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Кодинг и агентные задачи в терминале | 54% | 31% |
| GDM-MRCR v2 | Извлечение из длинного контекста | 72.2% | 60.1% |
| GDPval-AA v2 | Выполнение реальных задач | 1140 | 642 |

Почти удвоившийся показатель GDPval-AA v2 (642 → 1140) — цифра, которую стоит запомнить: именно на выполнении реальных задач старые Lite-модели разваливались в продакшн-агентах.
Сенсация: победа над Gemini 3 Flash
Ещё удивительнее поколенческого прироста — межуровневый. На нескольких агентных и кодинговых оценках 3.5 Flash-Lite превосходит Gemini 3 Flash — более крупную и дорогую модель:
| Бенчмарк | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Если сегодня вы держите нагрузки на 2.5 Flash или 3 Flash, потому что Lite-уровням нельзя было доверять агентную работу, это предположение устарело — Flash-Lite на этих задачах и быстрее, и способнее.
Уровни рассуждения: одна модель, два режима работы
Flash-Lite поставляется с настраиваемыми уровнями рассуждения, которые фактически делают из неё два продукта:
- Minimal / low рассуждение — приоритет задержке и стоимости для высоконагруженных задач: агентный поиск, обработка документов, извлечение, классификация, маршрутизация. Это режим 350 токенов/с.
- Более высокие уровни рассуждения — включают более глубокое мышление для многошаговых субагентных нагрузок, где Flash-Lite работает исполнителем под моделью-оркестратором.
Второй режим соответствует паттерну из демо самого Google: 3.6 Flash как главный агент, флоты субагентов 3.5 Flash-Lite, работающих параллельно (одно демо генерирует 25 концептов веб-дизайна одновременно). Управление компьютером на Flash-Lite тоже встроенный инструмент, так что субагенты могут работать с интерфейсами без дополнительной обвязки. Разницу в задержке на высоконагруженных задачах смотрите в демо скорости Flash-Lite vs 3.5 Flash (видео).
Анализ затрат: сколько на самом деле стоит масштаб
Цены: $0.30/1M на входе, $2.50/1M на выходе. Пример нагрузки — агент обработки документов, который обрабатывает 1 миллион документов в месяц, в среднем 3K входных и 500 выходных токенов на документ:
| Статья затрат | Расчёт | Стоимость в месяц |
|---|---|---|
| Входные токены | 1M док. × 3K токенов = 3B токенов × $0.30/1M | $900 |
| Выходные токены | 1M док. × 500 токенов = 0.5B токенов × $2.50/1M | $1,250 |
| Итого на 3.5 Flash-Lite | $2,150 | |
| Та же нагрузка на 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Примерно 4-кратная разница в затратах для нагрузки, с которой Lite отлично справляется, — а на скорости 350 токенов/с 500-токенное резюме каждого документа выводится стримом менее чем за 1.5 секунды. Отсюда стратегия: направляйте 90% рутинного объёма на Flash-Lite, а сложные 10% эскалируйте на 3.6 Flash.
Таблица выбора: какая модель под какую нагрузку
| Нагрузка | Выбор | Почему |
|---|---|---|
| Агентный поиск / RAG при высоком QPS | 3.5 Flash-Lite (minimal рассуждение) | 350 токенов/с, минимальная стоимость запроса |
| Массовая обработка документов / извлечение | 3.5 Flash-Lite | В 4 раза дешевле 3.6 Flash; GDM-MRCR v2 72.2% на длинном контексте |
| Классификация, маршрутизация, модерация | 3.5 Flash-Lite (minimal рассуждение) | Критичная задержка, запас качества с избытком |
| Параллельные флоты субагентов под оркестратором | 3.5 Flash-Lite (высокие уровни рассуждения) | Режим создан именно для этого; управление компьютером встроено |
| Сложный агентный кодинг (SWE-агенты) | 3.6 Flash | DeepSWE 49%; выше точность, меньше плохих правок |
| ML-исследовательские процессы | 3.6 Flash | MLE Bench 63.9% против 49.7% у 3.5 Flash |
| Агенты управления компьютером на сложных задачах | 3.6 Flash | OSWorld-Verified 83.0% (против 74.0% у Lite) |
| Мультимодальный анализ документов и подготовка отчётов | 3.6 Flash | Подтверждено Harvey / Hebbia на запуске |
| Легаси-конвейеры всё ещё на 3.5 Flash | Мигрируйте вверх или вниз | 3.6 Flash — ради качества, Flash-Lite — ради объёма; см. гид по миграции |
| Поиск и исправление уязвимостей безопасности | 3.5 Flash Cyber | Только через пилот CodeMender (правительства и доверенные партнёры) |
Эмпирическое правило: по умолчанию берите Flash-Lite и эскалируйте при неудаче, а не берите по умолчанию большую модель, чтобы оптимизировать потом. Провал виден сразу (плохие результаты); растрата от избыточного резервирования — молчалива.
Где доступна
3.5 Flash-Lite уже работает в Gemini API (Google AI Studio, Android Studio), на Gemini Enterprise Agent Platform и в приложении Gemini — и разворачивается внутри Google Search, что многое говорит об уверенности Google в её профиле затрат на планетарном масштабе. Среди первых клиентов — Ashler, Palo Alto Networks и Ramp.
На полях: 3.5 Flash Cyber и CodeMender
Тот же запуск представил Gemini 3.5 Flash Cyber — 3.5 Flash, дообученную находить и исправлять уязвимости безопасности. Внутри CodeMender несколько агентов Flash Cyber работают параллельно и объединяют находки в единый сводный отчёт, достигая конкурентной с фронтир-моделями производительности на CyberGym. Обратите внимание на архитектуру: это тот же паттерн «флота эффективных специалистов», который описывает этот гид, применённый к безопасности.
Доступ намеренно узкий: пилот с ограниченным доступом исключительно для правительств и доверенных партнёров через CodeMender — отражение риска двойного назначения автоматического поиска уязвимостей. Подробности — в нашем обзоре анонса.
Итог
3.5 Flash-Lite перечерчивает границу цены и производительности для агентных нагрузок: быстрее всего в серии 3.5, примерно в 4 раза дешевле 3.6 Flash и — впервые для Lite-модели — по-настоящему надёжна на агентных бенчмарках. Постройте маршрутизацию так, чтобы Flash-Lite была моделью по умолчанию, а 3.6 Flash — путём эскалации, и ваша кривая затрат скажет вам спасибо.