Gemini Omni
Retour aux articles
9 min de lecture

Google lance Gemini 3.7 Flash : raisonnement hybride pour le code, les agents et le travail de connaissance

Gemini 3.7 Flash arrive le 13 août 2026 avec un raisonnement hybride natif, des budgets de réflexion configurables, des benchmarks de code de pointe et 50 % de réduction tarifaire jusqu'en décembre.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Français

Un nouveau fleuron pour le raisonnement hybride

Le 13 août 2026, Google a publié Gemini 3.7 Flash — son modèle phare de raisonnement hybride conçu pour le code, les agents et le travail de connaissance complexe. Contrairement aux générations Flash précédentes qui sacrifiaient la profondeur à la vitesse, 3.7 Flash intègre un raisonnement natif configurable directement dans l’API : vous réglez la profondeur de réflexion par requête sans basculer vers un « modèle de raisonnement » distinct.

Ce lancement vise trois publics simultanément : les développeurs déployant des agents en production, les équipes exécutant des tâches de code à long terme et les entreprises ayant besoin d’analyses multimodales fiables sur d’immenses corpus documentaires. Google positionne 3.7 Flash comme le modèle qui permet enfin un seul endpoint pour des réponses chat en moins de 100 ms et des recherches approfondies de plusieurs minutes.

Raisonnement hybride natif et budget de réflexion

L’élément central est thinking_config.thinking_budget — un entier qui contrôle combien de tokens de raisonnement interne le modèle peut consommer avant de répondre.

thinking_budgetComportementIdéal pour
0Mode rapide ultra-faible latence (premier token en moins de 85 ms)Chat en direct, autocomplétion, routage haut QPS
256–1024Planification légère multi-étapesRoutage d’outils, refactors simples, synthèse RAG
4096–16384Raisonnement profond multi-étapesBoucles d’agents, débogage complexe, rapports de recherche
32768–65536Profondeur maximaleCode long terme, changements d’architecture multi-fichiers

Configurez-le dans l’API Gemini ainsi :

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refactorisez ce composant React pour utiliser les hooks et ajoutez des error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = mode rapide ; jusqu'à 65536 pour raisonnement profond
        )
    ),
)
print(response.text)

Le raisonnement étant natif plutôt qu’ajouté, la latence évolue progressivement : un thinking_budget de 0 se comporte comme un Flash classique, tandis que des valeurs plus élevées débloquent la qualité chain-of-thought sans changer d’ID de modèle. La facturation sépare les tokens de sortie visibles des tokens de réflexion internes : vous ne payez que la profondeur demandée.

Points forts des benchmarks

Google a publié des chiffres comparatifs face à Gemini 3.6 Flash, Claude Sonnet 5 et GPT-5.6 Terra. 3.7 Flash mène sur toutes les évaluations listées :

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Deux chiffres ressortent pour les builders :

  • DeepSWE v1.1 à 65.3% — un bond de 16 points sur 3.6 Flash, signe que le code agentique est la cible principale d’entraînement.
  • GDM-MRCR v2 à 97.0% — récupération quasi parfaite en contexte long sur une fenêtre de 2,5M tokens, cruciale pour les workflows documentaires.

Pour le contexte de la génération précédente, voir notre comparaison Gemini 3.6 Flash vs 3.5 Flash.

Tarifs et réduction introductive de 50 %

Google propose une promotion de lancement agressive :

Prix intro (jusqu’au 31 déc. 2026)Prix standard (à partir du 1er janv. 2027)
Entrée0,75 $ / 1M tokens1,50 $ / 1M tokens
Sortie3,75 $ / 1M tokens7,50 $ / 1M tokens
Cache de contexte0,075 $ / 1M tokens0,075 $ / 1M tokens

Soit 50 % de réduction sur l’entrée et la sortie pour le reste de 2026. Le cache de contexte — utile quand vous réutilisez de grands prompts système ou corpus documentaires — reste à 0,075 $ par million de tokens quelle que soit la période promo.

Combiné à moins d’aller-retours d’appels d’outils à des budgets de réflexion plus élevés, le coût effectif par tâche d’agent terminée peut descendre bien en dessous du prix affiché par token. Notre guide d’estimation des coûts API détaille le calcul pour des charges typiques.

Capacités multimodales, web dev et agents

Au-delà des benchmarks, 3.7 Flash embarque des capacités prêtes pour la production :

  • Fenêtre de contexte de 2,5M tokens — ingérer des codebases entières, des lots de contrats ou des corpus de recherche en une passe.
  • 245 tokens de sortie/s — assez rapide pour streamer du code UI et de longs rapports sans dégrader l’expérience.
  • 99,7 % de précision d’exécution d’outils JSON — sorties structurées fiables pour les chaînes d’outils d’agents.
  • Computer use — automatisation client intégrée pour les workflows navigateur et bureau.
  • Fidélité de génération UI — une meilleure précision de mise en page sur WebDev Arena (1588 Elo) se traduit par des frontends générés plus propres.

Ces fonctionnalités sont disponibles dès aujourd’hui via Gemini API, Google AI Studio, Gemini Enterprise et Google Antigravity.

Guide développeur et migration

Si vous migrez depuis 3.6 Flash ou 3.5 Flash-Lite, commencez par ces patterns :

  1. Remplacez l’ID de modèle — échangez gemini-3.6-flash contre gemini-3.7-flash ; la surface API est rétrocompatible.
  2. Définissez des budgets de réflexion par type de tâche0 pour le chat utilisateur, 1024 pour le Q&A RAG, 8192+ pour les agents de code, 32768 uniquement pour les jobs batch nocturnes où la latence n’importe pas.
  3. Activez le cache de contexte — si votre prompt système ou jeu de documents dépasse 32K tokens et se répète entre requêtes, le cache réduit le coût d’entrée de 90 %.
  4. Affinez les schémas d’outils — la précision JSON à 99,7 % récompense des schémas stricts ; des définitions laxistes échouent toujours au niveau applicatif.
  5. Surveillez l’usage de tokens de réflexion — loggez usage_metadata pour identifier quelles étapes d’agent nécessitent vraiment un raisonnement profond.

Pour les patterns de workflows agentiques, voir notre guide des workflows agentiques 3.5 Flash-Lite — le concept de budget de réflexion s’étend naturellement à 3.7 Flash avec une granularité plus fine.

En bref

Gemini 3.7 Flash est le premier modèle de niveau Flash où vitesse et profondeur ne s’excluent plus. Le thinking_budget configurable permet à un seul modèle de servir le chat sensible à la latence et le code agentique profond, et le tarif de lancement rend l’expérimentation bon marché jusqu’à fin 2026.

Liens connexes