Gemini Omni
Назад к статьям
9 мин. чтения

Gemini 3.6 Flash vs 3.5 Flash: бенчмарки, цены и когда мигрировать (2026)

Gemini 3.6 Flash обходит 3.5 Flash на каждом бенчмарке, режет выходные токены на 17% и стоит дешевле. Полные таблицы сравнения плюс план миграции для разработчиков.

Gemini 3.6 FlashGemini 3.5 FlashComparisonBenchmarksMigration2026Русский

Редкий апгрейд «строго лучше»

Большинство обновлений моделей чем-то жертвуют — качеством ради скорости, ценой ради возможностей. Gemini 3.6 Flash vs Gemini 3.5 Flash — тот необычный случай, когда новая модель выигрывает по каждой оси, опубликованной Google 21 июля 2026 года: выше баллы на бенчмарках, меньше выходных токенов, меньше шагов рассуждения и вызовов инструментов, и при этом ниже цена за токен. Этот разбор сначала проходит по цифрам, а затем переходит к практике: кому мигрировать, когда и что перепроверить.

Если сначала нужен полный контекст запуска трёх моделей, начните с нашего обзора анонса.

Токен-эффективность: заголовок, который нельзя пропускать

Самая значимая цифра релиза — не балл бенчмарка. По индексу Artificial Analysis 3.6 Flash потребляет на 17% меньше выходных токенов, чем 3.5 Flash, при эквивалентной работе. На DeepSWE от Datacurve Google наблюдал сокращения до 65%.

Gemini 3.6 Flash демонстрирует лучшую токен-эффективность и меньшую многословность, чем 3.5 Flash, на задаче OSWorld-Verified

Почему это важнее, чем кажется:

  • Выходные токены — самые дорогие ($7.50/1M против $1.50/1M на входе). Сокращение их на 17–65% бьёт по главной статье затрат.
  • Меньше токенов = меньше задержка. Агент, который говорит меньше, заканчивает раньше, а многошаговые цепочки усиливают эффект.
  • Меньше шагов рассуждения и вызовов инструментов — это меньше обменов с сервером, меньше точек отказа и меньше накладных расходов на оркестрацию каждой задачи.

Google опубликовал параллельное демо на задаче управления компьютером — смотрите видео сравнения токен-эффективности.

Полное сравнение бенчмарков

БенчмаркЧто измеряетGemini 3.6 FlashGemini 3.5 FlashРазница
DeepSWEАгентная разработка ПО49%37%+12 п.
MLE BenchML-исследования и инженерия63.9%49.7%+14.2 п.
OSWorld-VerifiedРабота с компьютером83.0%78.4%+4.6 п.
GDPval-AA v2Реальная работа со знаниями14211349+72

Прирост качества Gemini 3.6 Flash относительно 3.5 Flash в кодинге, ML-исследованиях, работе с компьютером и работе со знаниями

Три прочтения таблицы:

  • Скачок на DeepSWE (37% → 49%) — тот, что важен командам разработки: Google объясняет его более высокой точностью — меньше нежелательных правок кода и меньше циклов исполнения, а не просто больше «сырой» мощности.
  • MLE Bench (+14.2 пункта) — самый большой прирост, сигнализирующий о реальном шаге вперёд в ML-исследовательских процессах: каркасы экспериментов, анализ данных, отладка обучающих циклов.
  • OSWorld-Verified на 83.0% важен потому, что управление компьютером теперь — встроенный клиентский инструмент в Gemini API и Gemini Enterprise. Скачок возможностей и смена упаковки приходят одновременно.

Цены: дешевле за токен, дешевле за задачу

Gemini 3.6 FlashGemini 3.5 Flash
Цена входа$1.50 / 1M токеновВыше
Цена выхода$7.50 / 1M токеновВыше
Выходных токенов на задачу~17% меньше (до 65% на DeepSWE)База
Фактическая стоимость агентной задачиЗаметно нижеБаза

Суть — в накоплении эффектов. Задача, которая раньше выдавала 100K выходных токенов, теперь выдаёт ~83K, и каждый из этих токенов стоит меньше. Для нагрузки в миллионы агентных задач в месяц экономия проявится в счёте без единого изменения в промптах.

Управление компьютером: из надстройки — во встроенную функцию

С 3.6 Flash управление компьютером поставляется как встроенный клиентский инструмент через Gemini API и Gemini Enterprise. В сочетании с улучшением на OSWorld-Verified (78.4% → 83.0%) команды, строящие браузерных агентов, автоматизацию в стиле RPA или QA-ботов, получают и более сильную модель, и меньше интеграционного кода. Если вы поддерживали собственную обвязку для управления компьютером вокруг 3.5 Flash, планируйте удалить её часть.

Позиция по безопасности

3.6 Flash выходит с усиленными мерами Frontier Safety в областях ХБРЯ и кибернаступательных операций, и Google сообщает, что модель существенно устойчивее к джейлбрейкам, чем 3.5 Flash. Не менее важно для продуктовых команд: её также обучили снижать отказы на безобидных запросах. Если 3.5 Flash иногда отказывал в вашем продукте на легитимных промптах около темы безопасности или медицины, перепроверьте эти сценарии — доля ложных отказов должна снизиться.

Что говорят первые клиенты

Список запуска от Google — Figma, Harvey, Hebbia, JetBrains — стоит расшифровать:

  • Figma и JetBrains — компании-разработчики инструментов с высоконагруженным, чувствительным к задержке инференсом: это подтверждение истории про скорость и эффективность.
  • Harvey (юриспруденция) и Hebbia (финансы) особо похвалили мультимодальную работу с документами: разбор, анализ графиков и данных, подготовку отчётов. Если ваша нагрузка — работа со знаниями, насыщенная документами, ваш релевантный ориентир — прирост на GDPval-AA v2 (1349 → 1421).

План миграции: когда переключаться

Ваша ситуацияРекомендация
Агентный кодинг (SWE-агенты, боты код-ревью)Мигрируйте сейчас — крупнейший выигрыш в качестве и токен-эффективности (DeepSWE +12 п., до 65% меньше токенов)
Управление компьютером / автоматизация браузераМигрируйте сейчас — лучшие результаты, а встроенные инструменты заменяют самодельную обвязку
Разбор документов / анализ / подготовка отчётовМигрируйте сейчас — подтверждено кейсами Harvey и Hebbia
Простые высоконагруженные задачи с критичной задержкойРассмотрите 3.5 Flash-Lite — см. наш гид по Flash-Lite
Тщательно настроенные промпты со строгим парсингом формата выводаМигрируйте осторожно — токен-эффективность меняет многословность; перепроверьте парсеры и few-shot-примеры
Продакшн-системы, замороженные из-за комплаенсаЗапланируйте миграцию — принудительного вывода из эксплуатации не объявлено, но цена и эффективность делают простой дорогим

Практический чек-лист перед сменой строки модели:

  1. Перезапустите набор оценок — стиль вывода стал плотнее и короче; проверки на длину или формулировки ответов могут сломаться.
  2. Перепроверьте парсинг структурированного вывода — меньшая многословность обычно хороша для надёжности JSON, но убедитесь.
  3. Перетестируйте сценарии, чувствительные к отказам — ожидайте меньше ложных отказов, но подтвердите, что ваши фильтры безопасности по-прежнему согласованы.
  4. Пересчитайте стоимость на задачу, а не на токен — сокращение токенов на 17–65% означает, что сравнение по цене токена занижает экономию.

Вердикт

Gemini 3.6 Flash — редкий преемник без опубликованных компромиссов: лучше в кодинге, ML-исследованиях, работе с компьютером и работе со знаниями, при этом выдаёт меньше токенов по более низким ценам. Если ваш стек не завязан на замороженные форматы вывода, миграция с 3.5 Flash — вопрос не стоит ли, а в каком спринте.

Связанные материалы