Google annonce Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber : tout ce qu'il faut savoir
Google vient de lancer Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber. Prix, benchmarks, disponibilité, sécurité et la feuille de route vers Gemini 4 — analyse complète.
Trois nouveaux modèles Flash en une seule journée
Le 21 juillet 2026, Google a annoncé trois nouveaux modèles Gemini d’un coup : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et Gemini 3.5 Flash Cyber. Le fil conducteur est limpide — chacun s’attaque au même problème que les développeurs remontent sans cesse : les agents IA en production ont besoin d’une meilleure efficacité en tokens, d’une latence plus faible et de performances plus fiables, pas seulement de scores plus impressionnants.
Cet article détaille à quoi sert chaque modèle, combien il coûte, où l’utiliser dès aujourd’hui, et ce que Google a laissé entrevoir pour la suite (spoiler : Gemini 3.5 Pro est en test chez des partenaires, et le pré-entraînement de Gemini 4 a déjà commencé). Tous les chiffres proviennent de l’annonce officielle.
La gamme en un coup d’œil
| Modèle | Rôle | Chiffre clé | Accès |
|---|---|---|---|
| Gemini 3.6 Flash | Cheval de trait : code, travail intellectuel, multimodal | 17 % de tokens de sortie en moins que 3.5 Flash, à prix réduit | Disponibilité générale dès aujourd’hui |
| Gemini 3.5 Flash-Lite | Le modèle de classe 3.5 le plus rapide et le plus économique | 350 tokens de sortie/s (Artificial Analysis) | Disponibilité générale dès aujourd’hui |
| Gemini 3.5 Flash Cyber | Spécialiste sécurité pour trouver et corriger les vulnérabilités | Performance de niveau frontière sur CyberGym dans CodeMender | Pilote à accès limité uniquement |
Gemini 3.6 Flash : le nouveau cheval de trait
3.6 Flash s’appuie directement sur les retours des développeurs concernant 3.5 Flash. L’argument est inhabituel pour un lancement de modèle : il n’est pas seulement meilleur, il est plus économe. Sur l’Artificial Analysis Index, il consomme 17 % de tokens de sortie en moins que 3.5 Flash, et sur certains benchmarks — comme DeepSWE de Datacurve — Google a observé des réductions allant jusqu’à 65 %. Il lui faut aussi moins d’étapes de raisonnement et d’appels d’outils pour boucler des workflows multi-étapes, ce qui se cumule en économies réelles sur les tâches agentiques.

Points forts des benchmarks face à 3.5 Flash :
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| DeepSWE (code agentique) | 49 % | 37 % |
| MLE Bench (recherche en ML) | 63.9 % | 49.7 % |
| OSWorld-Verified (usage d’ordinateur) | 83.0 % | 78.4 % |
| GDPval-AA v2 (travail intellectuel) | 1421 | 1349 |
Deux autres détails du jour du lancement comptent pour les développeurs :
- L’usage d’ordinateur (computer use) est désormais un outil intégré côté client via l’API Gemini et Gemini Enterprise — plus besoin d’échafaudage séparé.
- Les premiers clients incluent Figma, Harvey, Hebbia et JetBrains ; Hebbia et Harvey soulignent notamment les forces multimodales : analyse de documents, de graphiques et de données, et rédaction de rapports.
La démo de Google comparant l’efficacité en tokens côte à côte sur une tâche OSWorld vaut le détour : démo d’efficacité en tokens 3.6 Flash vs 3.5 Flash (vidéo).
Pour le face-à-face complet, consultez notre analyse approfondie Gemini 3.6 Flash vs 3.5 Flash.
Gemini 3.5 Flash-Lite : conçu pour faire passer les workflows agentiques à l’échelle
Flash-Lite, c’est le pari du volume. C’est le modèle le plus rapide de la série 3.5 avec 350 tokens de sortie par seconde (Artificial Analysis), visant la recherche agentique, le traitement de documents et tout pipeline où le débit est le goulot d’étranglement.
Le bond en qualité par rapport à 3.1 Flash-Lite est spectaculaire — Terminal-Bench 2.1 à 54 % contre 31 %, GDM-MRCR v2 en contexte long à 72.2 % contre 60.1 %, et GDPval-AA v2 à 1140 contre 642. Fait remarquable, il bat même le plus gros Gemini 3 Flash sur plusieurs évaluations agentiques, dont SWE-Bench Pro (54.2 % contre 49.6 %) et OSWorld-Verified (74.0 % contre 65.1 %).
Il embarque des niveaux de réflexion configurables — minimal/low pour les tâches à haut volume sensibles à la latence, ou un niveau plus élevé pour les charges de sous-agents multi-étapes — et l’usage d’ordinateur y est également intégré. Les premiers clients incluent Ashler, Palo Alto Networks et Ramp, et le modèle est en cours de déploiement dans la recherche Google et l’app Gemini.
Notre guide des workflows agentiques avec 3.5 Flash-Lite couvre en profondeur les niveaux de réflexion, les calculs de coûts et le choix de modèle.
Prix : moins cher aux deux niveaux
| Modèle | Entrée ($/1M tokens) | Sortie ($/1M tokens) | Notes |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | Moins cher que 3.5 Flash, avec ~17 % de tokens de sortie en moins |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Meilleur rapport prix/performance pour le trafic à haut débit |
| Gemini 3.5 Flash Cyber | — | — | Pas de prix public ; pilote à accès limité via CodeMender |
La vraie histoire de coûts, c’est la multiplication : 3.6 Flash facture moins par token et émet moins de tokens par tâche, si bien que le coût effectif par tâche agentique baisse davantage que ne le suggère la grille tarifaire.
Gemini 3.5 Flash Cyber : un spécialiste derrière un cordon de velours
Le troisième modèle est à part. 3.5 Flash Cyber est construit sur 3.5 Flash et affiné pour trouver et corriger les vulnérabilités de sécurité, à un prix par token inférieur à celui des modèles plus gros. Il fonctionne au sein de CodeMender, l’agent de sécurité du code de Google, où plusieurs agents 3.5 Flash Cyber collaborent pour produire un unique rapport combiné — atteignant une performance compétitive de niveau frontière sur le benchmark CyberGym.

La technologie étant à double usage, Google choisit délibérément de ne pas la diffuser largement : elle sera exclusivement disponible pour les gouvernements et partenaires de confiance via CodeMender, dans le cadre d’un pilote à accès limité. L’objectif : donner aux défenseurs de première ligne une longueur d’avance pour corriger les vulnérabilités critiques avant qu’elles ne soient exploitées.
Sécurité : moins de jailbreaks, moins de refus
3.6 Flash est livré avec des garde-fous Frontier Safety renforcés couvrant les usages détournés CBRN (chimique, biologique, radiologique, nucléaire) et cyberoffensifs. Google indique que le modèle est nettement plus résistant aux jailbreaks tout en étant entraîné à minimiser les refus pour les usages bénins — la combinaison que les développeurs attendent vraiment, plutôt qu’une posture obtuse de refus systématique.
Où les utiliser dès aujourd’hui
| Surface | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| API Gemini (Google AI Studio, Android Studio) | ✅ | ✅ |
| Google Antigravity | ✅ | — |
| Gemini Enterprise Agent Platform | ✅ | ✅ |
| App Gemini Enterprise | ✅ | — |
| App Gemini | ✅ | ✅ |
| Recherche Google | — | ✅ En déploiement |
| CodeMender (3.5 Flash Cyber) | Pilote limité : gouvernements et partenaires de confiance uniquement |
L’aperçu de la feuille de route : 3.5 Pro et Gemini 4
Deux notes tournées vers l’avenir, enfouies dans l’annonce, méritent attention :
- Gemini 3.5 Pro est actuellement en test chez des partenaires, avec une disponibilité large prévue « dès qu’il sera prêt ».
- Google a lancé son pré-entraînement le plus ambitieux à ce jour — pour Gemini 4 — et se dit « enthousiasmé par les progrès ».
Lues ensemble, ces sorties de niveau Flash ressemblent à la couche d’efficacité qu’on verrouille avant la prochaine percée de frontière.
En résumé
Si vous construisez des agents, c’est un lancement rare où le bon choix est évident : 3.6 Flash pour le travail agentique sensible à la qualité, 3.5 Flash-Lite pour le haut volume, tous deux moins chers que ce qu’ils remplacent. Flash Cyber, lui, signale où Google pense que vont les affinages spécialisés — puissants, étroits et délibérément verrouillés.