Google lanceert Gemini 3.7 Flash: hybride redeneren voor coding, agents en kenniswerk
Gemini 3.7 Flash verschijnt op 13 augustus 2026 met native hybride redeneren, instelbare thinking budgets, frontier coding-benchmarks en 50% introductiekorting tot december.
Een nieuw vlaggenschip voor hybride redeneren
Op 13 augustus 2026 bracht Google Gemini 3.7 Flash uit — het vlaggenschipmodel voor hybride redeneren, gebouwd voor coding, agents en complex kenniswerk. In tegenstelling tot eerdere Flash-generaties die diepte inruilten voor snelheid, heeft 3.7 Flash native instelbaar redeneren ingebouwd in de API: u stelt de denkdiepte per request in zonder over te schakelen naar een apart «redeneringsmodel».
De lancering richt zich op drie doelgroepen tegelijk: ontwikkelaars die productie-agents draaien, teams met langdurige coding-taken en enterprises die betrouwbare multimodale analyse over enorme documentsets nodig hebben. Google positioneert 3.7 Flash als het model waarbij één endpoint eindelijk zowel sub-100ms chatantwoorden als diepgaand onderzoek van meerdere minuten aankan.
Native hybride redeneren en thinking budget
Het middelpunt is thinking_config.thinking_budget — een geheel getal dat bepaalt hoeveel interne redeneringstokens het model mag verbruiken vóór het antwoordt.
thinking_budget | Gedrag | Het beste voor |
|---|---|---|
| 0 | Ultra-lage latency snelle modus (eerste token onder 85 ms) | Live chat, autocomplete, high-QPS routing |
| 256–1024 | Lichte multi-step planning | Tool routing, eenvoudige refactors, RAG-synthese |
| 4096–16384 | Diep multi-step redeneren | Agent loops, complex debuggen, onderzoeksrapporten |
| 32768–65536 | Maximale diepte | Langdurige coding, multi-file architectuurwijzigingen |
Zo stelt u het in via de Gemini API:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactor deze React-component naar hooks en voeg error boundaries toe.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = snelle modus; tot 65536 voor diep redeneren
)
),
)
print(response.text)
Omdat redeneren native is in plaats van opgeplakt, schaalt latency soepel: een thinking_budget van 0 gedraagt zich als een klassiek Flash-model, hogere waarden ontgrendelen chain-of-thought-kwaliteit zonder van model-ID te wisselen. Facturatie scheidt zichtbare outputtokens van interne thinkingtokens — u betaalt alleen voor de gevraagde diepte.
Benchmark-highlights
Google publiceerde head-to-head cijfers tegen Gemini 3.6 Flash, Claude Sonnet 5 en GPT-5.6 Terra. 3.7 Flash leidt op elke genoemde eval:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Twee cijfers vallen op voor builders:
- DeepSWE v1.1 op 65.3% — een sprong van 16 punten boven 3.6 Flash; agentisch coding is het primaire trainingdoel.
- GDM-MRCR v2 op 97.0% — bijna perfecte long-context retrieval over een 2,5M-token venster, cruciaal voor documentzware workflows.
Voor context over de vorige generatie, zie onze Gemini 3.6 Flash vs 3.5 Flash vergelijking.
Prijzen en 50% introductiekorting
Google draait een agressieve launchpromotie:
| Introductieprijs (t/m 31 dec 2026) | Standaardprijs (vanaf 1 jan 2027) | |
|---|---|---|
| Input | $0,75 / 1M tokens | $1,50 / 1M tokens |
| Output | $3,75 / 1M tokens | $7,50 / 1M tokens |
| Context caching | $0,075 / 1M tokens | $0,075 / 1M tokens |
Dat is 50% korting op input en output voor de rest van 2026. Context caching — nuttig bij hergebruik van grote system prompts of documentcorpora — blijft $0,075 per miljoen tokens ongeacht de promoperiode.
Gecombineerd met minder tool-call roundtrips bij hogere thinking budgets kan de effectieve kosten per voltooide agenttaak ver onder de token-prijs liggen. Onze API-kostenschattinggids doorrekent typische workloads.
Multimodale, web dev- en agentmogelijkheden
Naast benchmarks levert 3.7 Flash productieklare features:
- 2,5M-token contextvenster — hele codebases, contractbundels of onderzoekscorpora in één keer.
- 245 output tokens/s — snel genoeg om UI-code en lange rapporten te streamen zonder UX te knijpen.
- 99,7% JSON tool execution precision — betrouwbare gestructureerde outputs voor agent tool chains.
- Computer use — ingebouwde client-side automatisering voor browser- en desktopworkflows.
- UI-generatietrouw — hogere layoutnauwkeurigheid op WebDev Arena (1588 Elo) betekent schonere gegenereerde frontends.
Beschikbaar via Gemini API, Google AI Studio, Gemini Enterprise en Google Antigravity.
Ontwikkelaarsgids en migratie
Bij upgrade van 3.6 Flash of 3.5 Flash-Lite, begin met deze patronen:
- Vervang model-ID — wissel
gemini-3.6-flashvoorgemini-3.7-flash; API-oppervlak is achterwaarts compatibel. - Stel thinking budgets in per taaktype —
0voor user-facing chat,1024voor RAG Q&A,8192+voor coding agents,32768alleen voor nachtelijke batchjobs waar latency niet telt. - Schakel context caching in — bij system prompts of documentsets boven 32K tokens die herhaald worden, daalt inputkosten met 90%.
- Tune tool schemas — 99,7% JSON-precisie beloont strikte schemas; losse definities falen nog steeds op applicatieniveau.
- Monitor thinking token-gebruik — log
usage_metadataom te zien welke agentstappen echt diep redeneren nodig hebben.
Voor agentische workflowpatronen, zie onze 3.5 Flash-Lite agentic workflows gids — het thinking budget-concept breidt natuurlijk uit naar 3.7 Flash met fijnere granulariteit.
Conclusie
Gemini 3.7 Flash is het eerste Flash-tier model waarbij snelheid en diepte elkaar niet uitsluiten. Het instelbare thinking_budget laat één model zowel latency-gevoelige chat als diep agentisch coding bedienen, en de launchprijzen maken experimenteren tot eind 2026 goedkoop.