Gemini 3.6 Flash vs 3.5 Flash : benchmarks, prix et quand migrer (2026)
Gemini 3.6 Flash bat 3.5 Flash sur tous les benchmarks tout en réduisant les tokens de sortie de 17 % et les prix. Tableaux comparatifs complets et guide de migration.
Une rare mise à niveau « strictement meilleure »
La plupart des mises à niveau de modèles sacrifient quelque chose — la qualité contre la vitesse, le prix contre la capacité. Gemini 3.6 Flash vs Gemini 3.5 Flash est le cas inhabituel où le nouveau modèle gagne sur tous les axes publiés par Google le 21 juillet 2026 : meilleurs scores de benchmark, moins de tokens de sortie, moins d’étapes de raisonnement et d’appels d’outils, et un prix par token plus bas. Cette analyse passe les chiffres en revue, puis devient concrète : qui doit migrer, quand, et quoi retester.
Si vous voulez d’abord le contexte complet du lancement des trois modèles, commencez par notre tour d’horizon de l’annonce.
Efficacité en tokens : le titre que personne ne devrait zapper
Le chiffre le plus lourd de conséquences de cette sortie n’est pas un score de benchmark. Sur l’Artificial Analysis Index, 3.6 Flash consomme 17 % de tokens de sortie en moins que 3.5 Flash pour un travail équivalent. Sur DeepSWE de Datacurve, Google a observé des réductions allant jusqu’à 65 %.

Pourquoi cela compte plus qu’il n’y paraît :
- Les tokens de sortie sont les plus chers ($7.50/1M contre $1.50/1M en entrée). Les réduire de 17 à 65 % attaque le terme dominant du coût.
- Moins de tokens = moins de latence. Un agent qui parle moins finit plus tôt, et les chaînes multi-étapes amplifient l’effet.
- Moins d’étapes de raisonnement et d’appels d’outils, c’est moins d’allers-retours, moins de points de défaillance et moins de surcharge d’orchestration par tâche.
Google a publié une démo comparative sur une tâche d’usage d’ordinateur — voir la vidéo de comparaison d’efficacité en tokens.
Comparaison complète des benchmarks
| Benchmark | Ce qu’il mesure | Gemini 3.6 Flash | Gemini 3.5 Flash | Écart |
|---|---|---|---|---|
| DeepSWE | Ingénierie logicielle agentique | 49 % | 37 % | +12 pts |
| MLE Bench | Recherche et ingénierie ML | 63.9 % | 49.7 % | +14.2 pts |
| OSWorld-Verified | Usage d’ordinateur | 83.0 % | 78.4 % | +4.6 pts |
| GDPval-AA v2 | Travail intellectuel réel | 1421 | 1349 | +72 |

Trois lectures de ce tableau :
- Le bond sur DeepSWE (37 % → 49 %) est celui qui doit intéresser les équipes de code : Google l’attribue à une précision accrue — moins de modifications de code indésirables et moins de boucles d’exécution, pas seulement plus de capacité brute.
- MLE Bench (+14.2 points) est le plus gros gain, signe d’un vrai progrès dans les workflows de recherche ML — échafaudage d’expériences, analyse de données, débogage de boucles d’entraînement.
- OSWorld-Verified à 83.0 % compte parce que l’usage d’ordinateur est désormais un outil intégré côté client dans l’API Gemini et Gemini Enterprise. Le saut de capacité et le changement de packaging arrivent ensemble.
Prix : moins cher par token, moins cher par tâche
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Prix d’entrée | $1.50 / 1M tokens | Plus élevé |
| Prix de sortie | $7.50 / 1M tokens | Plus élevé |
| Tokens de sortie par tâche | ~17 % de moins (jusqu’à 65 % sur DeepSWE) | Référence |
| Coût effectif par tâche agentique | Nettement plus bas | Référence |
L’effet cumulé est tout l’enjeu. Une tâche qui émettait 100K tokens de sortie n’en émet plus qu’environ 83K, et chacun de ces tokens coûte moins cher. Pour une charge qui exécute des millions de tâches agentiques par mois, les économies apparaissent sur la facture sans toucher à vos prompts.
Usage d’ordinateur : du module externe à l’outil intégré
Avec 3.6 Flash, l’usage d’ordinateur est livré comme outil intégré côté client via l’API Gemini et Gemini Enterprise. Combiné à l’amélioration sur OSWorld-Verified (78.4 % → 83.0 %), les équipes qui construisent des agents de navigateur, de l’automatisation type RPA ou des bots de QA obtiennent à la fois un modèle plus fort et moins de code d’intégration. Si vous mainteniez un échafaudage maison autour de 3.5 Flash pour l’usage d’ordinateur, prévoyez d’en supprimer une partie.
Posture de sécurité
3.6 Flash embarque des garde-fous Frontier Safety renforcés dans les domaines CBRN et cyberoffensif, et Google le déclare nettement plus résistant aux jailbreaks que 3.5 Flash. Tout aussi pertinent pour les équipes produit : il a aussi été entraîné à réduire les refus sur les requêtes bénignes. Si 3.5 Flash refusait parfois des prompts légitimes proches de la sécurité ou de la médecine dans votre produit, retestez ces parcours — le taux de faux refus devrait baisser.
Ce que disent les premiers clients
La liste de lancement de Google — Figma, Harvey, Hebbia, JetBrains — mérite d’être décodée :
- Figma et JetBrains sont des entreprises d’outils avec une inférence à haut volume et sensible à la latence : une caution pour l’histoire vitesse/efficacité.
- Harvey (juridique) et Hebbia (finance) ont spécifiquement salué le travail documentaire multimodal : analyse de documents, de graphiques et de données, rédaction de rapports. Si votre charge est du travail intellectuel riche en documents, le gain GDPval-AA v2 (1349 → 1421) est votre indicateur de référence.
Guide de migration : quand basculer
| Votre situation | Recommandation |
|---|---|
| Code agentique (agents SWE, bots de revue de code) | Migrez maintenant — les plus gros gains en qualité et efficacité en tokens (DeepSWE +12 pts, jusqu’à 65 % de tokens en moins) |
| Usage d’ordinateur / automatisation de navigateur | Migrez maintenant — de meilleurs scores et l’outil intégré remplace l’échafaudage maison |
| Analyse de documents / rédaction de rapports | Migrez maintenant — validé par les cas d’usage Harvey et Hebbia |
| Tâches simples à haut volume et latence critique | Envisagez plutôt 3.5 Flash-Lite — voir notre guide Flash-Lite |
| Prompts très ajustés avec parsing strict du format de sortie | Migrez avec prudence — l’efficacité en tokens change la verbosité ; revalidez les parseurs et exemples few-shot |
| Systèmes de production gelés par la conformité | Planifiez-le — aucune dépréciation forcée annoncée, mais prix + efficacité rendent le statu quo coûteux |
Check-list pratique avant de changer la chaîne du modèle :
- Relancez votre suite d’évaluation — le style de sortie est plus resserré et plus court ; les assertions sur la longueur ou la formulation des réponses peuvent casser.
- Revérifiez le parsing des sorties structurées — la verbosité réduite est généralement une bonne nouvelle pour la fiabilité du JSON, mais vérifiez.
- Retestez les parcours sensibles aux refus — attendez-vous à moins de faux refus, mais confirmez que vos filtres de sécurité restent alignés.
- Remesurez le coût par tâche, pas par token — la réduction de 17 à 65 % des tokens fait que les comparaisons par token sous-estiment les économies.
Verdict
Gemini 3.6 Flash est le rare successeur sans compromis publié : meilleur en code, recherche ML, usage d’ordinateur et travail intellectuel, tout en émettant moins de tokens à des prix plus bas. À moins que votre stack ne dépende de formats de sortie figés, migrer depuis 3.5 Flash n’est plus une question de si, mais de quel sprint.