Guide Gemini 3.5 Flash-Lite : des workflows agentiques à l'échelle, à 350 tokens/s (2026)
Gemini 3.5 Flash-Lite tourne à 350 tokens/s pour $0.30/1M en entrée. Benchmarks vs 3.1 Flash-Lite et Gemini 3 Flash, niveaux de réflexion, coûts et tableau de décision.
Le niveau « volume » est devenu sérieux
Gemini 3.5 Flash-Lite, annoncé le 21 juillet 2026, est le modèle de classe 3.5 le plus rapide et le plus économique de Google : 350 tokens de sortie par seconde (Artificial Analysis), au prix de $0.30 par 1M de tokens d’entrée et $2.50 par 1M de tokens de sortie. Historiquement, les niveaux « Lite » étaient là où la qualité venait mourir — corrects pour la classification et le texte standard, risqués pour tout ce qui est agentique. Cette sortie brise ce schéma : sur plusieurs évaluations agentiques et de code, 3.5 Flash-Lite bat carrément le plus gros Gemini 3 Flash.
Ce guide couvre la place de Flash-Lite dans la gamme, la configuration de ses niveaux de réflexion, ce que coûte réellement le passage à l’échelle, et quel modèle choisir pour quelle charge. Le contexte du lancement se trouve dans notre tour d’horizon de l’annonce.
Bond générationnel : vs 3.1 Flash-Lite
Le saut depuis la génération Lite précédente est le plus grand de l’histoire de la famille :
| Benchmark | Ce qu’il mesure | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Tâches de terminal, code et agents | 54 % | 31 % |
| GDM-MRCR v2 | Récupération en contexte long | 72.2 % | 60.1 % |
| GDPval-AA v2 | Exécution de tâches réelles | 1140 | 642 |

Le chiffre à retenir est le GDPval-AA v2 qui double presque (642 → 1140) : l’exécution de tâches réelles était exactement là où les anciens modèles Lite s’effondraient dans les agents en production.
La surprise : battre Gemini 3 Flash
Plus étonnant que le gain générationnel, il y a le gain inter-niveaux. Sur plusieurs évaluations agentiques et de code, 3.5 Flash-Lite surpasse Gemini 3 Flash — un modèle plus gros et plus cher :
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2 % | 49.6 % |
| OSWorld-Verified | 74.0 % | 65.1 % |
Si vous faites tourner vos charges sur 2.5 Flash ou 3 Flash aujourd’hui parce qu’on ne pouvait pas confier de travail agentique aux niveaux Lite, cette hypothèse est désormais périmée — Flash-Lite est à la fois plus rapide et plus capable sur ces tâches.
Niveaux de réflexion : un modèle, deux modes de fonctionnement
Flash-Lite est livré avec des niveaux de réflexion configurables, ce qui en fait de facto deux produits :
- Réflexion minimal / low — priorité à la latence et au coût pour les tâches à haut volume : recherche agentique, traitement de documents, extraction, classification, routage. C’est le mode à 350 tokens/s.
- Niveaux de réflexion plus élevés — un raisonnement plus profond pour les charges de sous-agents multi-étapes, où Flash-Lite agit comme exécutant sous un modèle orchestrateur.
Ce second mode correspond au schéma des démos de Google : 3.6 Flash comme agent maître, des flottes de sous-agents 3.5 Flash-Lite travaillant en parallèle (une démo génère 25 concepts de design web simultanément). L’usage d’ordinateur est aussi un outil intégré sur Flash-Lite, donc les sous-agents peuvent piloter des interfaces sans échafaudage supplémentaire. Voir la démo de vitesse Flash-Lite vs 3.5 Flash de Google (vidéo) pour la différence de latence sur les tâches à haut volume.
Analyse des coûts : ce que coûte vraiment l’échelle
Prix : $0.30/1M en entrée, $2.50/1M en sortie. Exemple de charge — un agent de traitement documentaire gérant 1 million de documents par mois, avec en moyenne 3K tokens d’entrée et 500 tokens de sortie par document :
| Poste de coût | Calcul | Coût mensuel |
|---|---|---|
| Tokens d’entrée | 1M docs × 3K tokens = 3B tokens × $0.30/1M | $900 |
| Tokens de sortie | 1M docs × 500 tokens = 0.5B tokens × $2.50/1M | $1,250 |
| Total sur 3.5 Flash-Lite | $2,150 | |
| La même charge sur 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Environ un écart de coût de 4× pour une charge que Lite gère bien — et à 350 tokens/s, le résumé de 500 tokens de chaque document s’écoule en moins de 1,5 seconde. La stratégie qui en découle : routez les 90 % de volume routinier vers Flash-Lite, et escaladez les 10 % difficiles vers 3.6 Flash.
Tableau de décision : quel modèle pour quelle charge
| Charge de travail | Choix | Pourquoi |
|---|---|---|
| Recherche agentique / RAG à haut QPS | 3.5 Flash-Lite (réflexion minimal) | 350 tokens/s, coût par requête le plus bas |
| Traitement / extraction massive de documents | 3.5 Flash-Lite | 4× moins cher que 3.6 Flash ; GDM-MRCR v2 à 72.2 % en contexte long |
| Classification, routage, modération | 3.5 Flash-Lite (réflexion minimal) | Latence critique, marge de qualité confortable |
| Flottes de sous-agents parallèles sous un orchestrateur | 3.5 Flash-Lite (réflexion élevée) | Mode conçu pour cela ; usage d’ordinateur intégré |
| Code agentique complexe (agents SWE) | 3.6 Flash | DeepSWE 49 % ; plus de précision, moins de mauvaises éditions |
| Workflows de recherche ML | 3.6 Flash | MLE Bench 63.9 % contre 49.7 % pour 3.5 Flash |
| Agents d’usage d’ordinateur sur tâches difficiles | 3.6 Flash | OSWorld-Verified 83.0 % (contre 74.0 % pour Lite) |
| Analyse documentaire multimodale et rédaction de rapports | 3.6 Flash | Validé par Harvey / Hebbia au lancement |
| Pipelines hérités encore sur 3.5 Flash | Migrez vers le haut ou le bas | 3.6 Flash pour la qualité, Flash-Lite pour le volume — voir le guide de migration |
| Détection et correction de vulnérabilités de sécurité | 3.5 Flash Cyber | Uniquement via le pilote CodeMender (gouvernements et partenaires de confiance) |
Règle empirique : partez de Flash-Lite par défaut et escaladez en cas d’échec, plutôt que de partir du gros modèle et d’optimiser ensuite. Le mode d’échec est visible (mauvaises sorties) ; le gaspillage du surdimensionnement est silencieux.
Où il est disponible
3.5 Flash-Lite est actif dès aujourd’hui dans l’API Gemini (Google AI Studio, Android Studio), la Gemini Enterprise Agent Platform et l’app Gemini — et il est en cours de déploiement dans la recherche Google, ce qui en dit long sur la confiance de Google dans son profil de coûts à l’échelle planétaire. Les premiers clients incluent Ashler, Palo Alto Networks et Ramp.
Encadré : 3.5 Flash Cyber et CodeMender
Le même lancement a introduit Gemini 3.5 Flash Cyber — 3.5 Flash affiné pour trouver et corriger les vulnérabilités de sécurité. Au sein de CodeMender, plusieurs agents Flash Cyber travaillent en parallèle et fusionnent leurs découvertes en un unique rapport combiné, atteignant une performance compétitive de niveau frontière sur CyberGym. Notez l’architecture : c’est exactement le schéma de « flotte de spécialistes efficaces » décrit dans ce guide, appliqué à la sécurité.
L’accès est délibérément étroit : un pilote à accès limité, exclusivement pour les gouvernements et partenaires de confiance via CodeMender, reflet du risque de double usage de la découverte automatisée de vulnérabilités. Détails dans notre tour d’horizon de l’annonce.
En résumé
3.5 Flash-Lite redessine la frontière prix-performance des charges agentiques : plus rapide que tout ce que compte la série 3.5, environ 4× moins cher que 3.6 Flash, et — une première pour un modèle Lite — véritablement fiable sur les benchmarks agentiques. Construisez votre routage avec Flash-Lite par défaut et 3.6 Flash comme voie d’escalade, et votre courbe de coûts vous dira merci.