Gemini 3.6 Flash vs 3.5 Flash: бенчмарки, цены и когда мигрировать (2026)
Gemini 3.6 Flash обходит 3.5 Flash на каждом бенчмарке, режет выходные токены на 17% и стоит дешевле. Полные таблицы сравнения плюс план миграции для разработчиков.
Редкий апгрейд «строго лучше»
Большинство обновлений моделей чем-то жертвуют — качеством ради скорости, ценой ради возможностей. Gemini 3.6 Flash vs Gemini 3.5 Flash — тот необычный случай, когда новая модель выигрывает по каждой оси, опубликованной Google 21 июля 2026 года: выше баллы на бенчмарках, меньше выходных токенов, меньше шагов рассуждения и вызовов инструментов, и при этом ниже цена за токен. Этот разбор сначала проходит по цифрам, а затем переходит к практике: кому мигрировать, когда и что перепроверить.
Если сначала нужен полный контекст запуска трёх моделей, начните с нашего обзора анонса.
Токен-эффективность: заголовок, который нельзя пропускать
Самая значимая цифра релиза — не балл бенчмарка. По индексу Artificial Analysis 3.6 Flash потребляет на 17% меньше выходных токенов, чем 3.5 Flash, при эквивалентной работе. На DeepSWE от Datacurve Google наблюдал сокращения до 65%.

Почему это важнее, чем кажется:
- Выходные токены — самые дорогие ($7.50/1M против $1.50/1M на входе). Сокращение их на 17–65% бьёт по главной статье затрат.
- Меньше токенов = меньше задержка. Агент, который говорит меньше, заканчивает раньше, а многошаговые цепочки усиливают эффект.
- Меньше шагов рассуждения и вызовов инструментов — это меньше обменов с сервером, меньше точек отказа и меньше накладных расходов на оркестрацию каждой задачи.
Google опубликовал параллельное демо на задаче управления компьютером — смотрите видео сравнения токен-эффективности.
Полное сравнение бенчмарков
| Бенчмарк | Что измеряет | Gemini 3.6 Flash | Gemini 3.5 Flash | Разница |
|---|---|---|---|---|
| DeepSWE | Агентная разработка ПО | 49% | 37% | +12 п. |
| MLE Bench | ML-исследования и инженерия | 63.9% | 49.7% | +14.2 п. |
| OSWorld-Verified | Работа с компьютером | 83.0% | 78.4% | +4.6 п. |
| GDPval-AA v2 | Реальная работа со знаниями | 1421 | 1349 | +72 |

Три прочтения таблицы:
- Скачок на DeepSWE (37% → 49%) — тот, что важен командам разработки: Google объясняет его более высокой точностью — меньше нежелательных правок кода и меньше циклов исполнения, а не просто больше «сырой» мощности.
- MLE Bench (+14.2 пункта) — самый большой прирост, сигнализирующий о реальном шаге вперёд в ML-исследовательских процессах: каркасы экспериментов, анализ данных, отладка обучающих циклов.
- OSWorld-Verified на 83.0% важен потому, что управление компьютером теперь — встроенный клиентский инструмент в Gemini API и Gemini Enterprise. Скачок возможностей и смена упаковки приходят одновременно.
Цены: дешевле за токен, дешевле за задачу
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Цена входа | $1.50 / 1M токенов | Выше |
| Цена выхода | $7.50 / 1M токенов | Выше |
| Выходных токенов на задачу | ~17% меньше (до 65% на DeepSWE) | База |
| Фактическая стоимость агентной задачи | Заметно ниже | База |
Суть — в накоплении эффектов. Задача, которая раньше выдавала 100K выходных токенов, теперь выдаёт ~83K, и каждый из этих токенов стоит меньше. Для нагрузки в миллионы агентных задач в месяц экономия проявится в счёте без единого изменения в промптах.
Управление компьютером: из надстройки — во встроенную функцию
С 3.6 Flash управление компьютером поставляется как встроенный клиентский инструмент через Gemini API и Gemini Enterprise. В сочетании с улучшением на OSWorld-Verified (78.4% → 83.0%) команды, строящие браузерных агентов, автоматизацию в стиле RPA или QA-ботов, получают и более сильную модель, и меньше интеграционного кода. Если вы поддерживали собственную обвязку для управления компьютером вокруг 3.5 Flash, планируйте удалить её часть.
Позиция по безопасности
3.6 Flash выходит с усиленными мерами Frontier Safety в областях ХБРЯ и кибернаступательных операций, и Google сообщает, что модель существенно устойчивее к джейлбрейкам, чем 3.5 Flash. Не менее важно для продуктовых команд: её также обучили снижать отказы на безобидных запросах. Если 3.5 Flash иногда отказывал в вашем продукте на легитимных промптах около темы безопасности или медицины, перепроверьте эти сценарии — доля ложных отказов должна снизиться.
Что говорят первые клиенты
Список запуска от Google — Figma, Harvey, Hebbia, JetBrains — стоит расшифровать:
- Figma и JetBrains — компании-разработчики инструментов с высоконагруженным, чувствительным к задержке инференсом: это подтверждение истории про скорость и эффективность.
- Harvey (юриспруденция) и Hebbia (финансы) особо похвалили мультимодальную работу с документами: разбор, анализ графиков и данных, подготовку отчётов. Если ваша нагрузка — работа со знаниями, насыщенная документами, ваш релевантный ориентир — прирост на GDPval-AA v2 (1349 → 1421).
План миграции: когда переключаться
| Ваша ситуация | Рекомендация |
|---|---|
| Агентный кодинг (SWE-агенты, боты код-ревью) | Мигрируйте сейчас — крупнейший выигрыш в качестве и токен-эффективности (DeepSWE +12 п., до 65% меньше токенов) |
| Управление компьютером / автоматизация браузера | Мигрируйте сейчас — лучшие результаты, а встроенные инструменты заменяют самодельную обвязку |
| Разбор документов / анализ / подготовка отчётов | Мигрируйте сейчас — подтверждено кейсами Harvey и Hebbia |
| Простые высоконагруженные задачи с критичной задержкой | Рассмотрите 3.5 Flash-Lite — см. наш гид по Flash-Lite |
| Тщательно настроенные промпты со строгим парсингом формата вывода | Мигрируйте осторожно — токен-эффективность меняет многословность; перепроверьте парсеры и few-shot-примеры |
| Продакшн-системы, замороженные из-за комплаенса | Запланируйте миграцию — принудительного вывода из эксплуатации не объявлено, но цена и эффективность делают простой дорогим |
Практический чек-лист перед сменой строки модели:
- Перезапустите набор оценок — стиль вывода стал плотнее и короче; проверки на длину или формулировки ответов могут сломаться.
- Перепроверьте парсинг структурированного вывода — меньшая многословность обычно хороша для надёжности JSON, но убедитесь.
- Перетестируйте сценарии, чувствительные к отказам — ожидайте меньше ложных отказов, но подтвердите, что ваши фильтры безопасности по-прежнему согласованы.
- Пересчитайте стоимость на задачу, а не на токен — сокращение токенов на 17–65% означает, что сравнение по цене токена занижает экономию.
Вердикт
Gemini 3.6 Flash — редкий преемник без опубликованных компромиссов: лучше в кодинге, ML-исследованиях, работе с компьютером и работе со знаниями, при этом выдаёт меньше токенов по более низким ценам. Если ваш стек не завязан на замороженные форматы вывода, миграция с 3.5 Flash — вопрос не стоит ли, а в каком спринте.