Gemini 3.5 Flash-Lite-gids: agentische workflows schalen op 350 tokens/s (2026)
Gemini 3.5 Flash-Lite draait 350 tokens/s voor $0.30/1M input. Benchmarks vs 3.1 Flash-Lite en Gemini 3 Flash, denkniveaus, kostenberekening en beslistabel.
Het volumesegment is serieus geworden
Gemini 3.5 Flash-Lite, aangekondigd op 21 juli 2026, is Googles snelste en meest kostenefficiënte model in de 3.5-klasse: 350 outputtokens per seconde (Artificial Analysis), geprijsd op $0.30 per 1M inputtokens en $2.50 per 1M outputtokens. Van oudsher waren “Lite”-niveaus de plek waar kwaliteit stierf — prima voor classificatie en boilerplate, riskant voor alles wat agentisch is. Deze release breekt met dat patroon: op meerdere agentische en codeer-evals verslaat 3.5 Flash-Lite het grotere Gemini 3 Flash ronduit.
Deze gids behandelt waar Flash-Lite in de line-up staat, hoe je de denkniveaus configureert, wat het op schaal echt kost en welk model je voor welke workload kiest. De lanceringscontext staat in ons overzicht van de aankondiging.
Generatiesprong: vs 3.1 Flash-Lite
De sprong ten opzichte van de vorige Lite-generatie is de grootste in de geschiedenis van de familie:
| Benchmark | Wat het meet | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Coderen en agentische terminaltaken | 54% | 31% |
| GDM-MRCR v2 | Long-context-retrieval | 72.2% | 60.1% |
| GDPval-AA v2 | Uitvoering van taken in de praktijk | 1140 | 642 |

Het bijna verdubbelde GDPval-AA v2-cijfer (642 → 1140) is het getal om te onthouden: uitvoering van taken in de praktijk was precies waar oude Lite-modellen in productie-agents door de mand vielen.
De verrassing: Gemini 3 Flash verslaan
Verrassender dan de generatiewinst is de winst over de niveaus heen. Op meerdere agentische en codeer-evals presteert 3.5 Flash-Lite beter dan Gemini 3 Flash — een groter, duurder model:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Draai je vandaag workloads op 2.5 Flash of 3 Flash omdat Lite-niveaus niet te vertrouwen waren met agentisch werk, dan is die aanname nu achterhaald — Flash-Lite is op deze taken zowel sneller als capabeler.
Denkniveaus: één model, twee bedrijfsmodi
Flash-Lite wordt geleverd met configureerbare denkniveaus, waardoor het feitelijk twee producten is:
- Minimal / low thinking — prioriteit voor latentie en kosten bij taken met hoog volume: agentisch zoeken, documentverwerking, extractie, classificatie, routing. Dit is de 350 tokens/s-modus.
- Hogere denkniveaus — activeer dieper redeneren voor meerstaps-subagentworkloads, waarbij Flash-Lite als worker onder een orkestratormodel werkt.
Die tweede modus komt overeen met Googles eigen demopatroon: 3.6 Flash als master-agent, vloten van 3.5 Flash-Lite-subagents die parallel werken (één demo genereert 25 webdesignconcepten tegelijk). Ook op Flash-Lite is computergebruik een ingebouwde tool, zodat subagents interfaces kunnen bedienen zonder extra scaffolding. Bekijk Googles snelheidsdemo Flash-Lite vs 3.5 Flash (video) voor het latentieverschil bij taken met hoog volume.
Kostenanalyse: wat schaal werkelijk kost
Prijzen: $0.30/1M input, $2.50/1M output. Hier een voorbeeldworkload — een documentverwerkingsagent die 1 miljoen documenten per maand verwerkt, met gemiddeld 3K inputtokens en 500 outputtokens per document:
| Kostenpost | Berekening | Maandelijkse kosten |
|---|---|---|
| Inputtokens | 1M docs × 3K tokens = 3B tokens × $0.30/1M | $900 |
| Outputtokens | 1M docs × 500 tokens = 0.5B tokens × $2.50/1M | $1,250 |
| Totaal op 3.5 Flash-Lite | $2,150 | |
| Dezelfde workload op 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Grofweg een kostenverschil van 4× voor een workload die Lite prima aankan — en op 350 tokens/s streamt de samenvatting van 500 tokens per document in minder dan 1.5 seconde naar buiten. De strategie die daaruit volgt: routeer de 90% routinevolume naar Flash-Lite en escaleer de moeilijke 10% naar 3.6 Flash.
Beslistabel: welk model voor welke workload
| Workload | Keuze | Waarom |
|---|---|---|
| Agentisch zoeken / RAG op hoge QPS | 3.5 Flash-Lite (minimal thinking) | 350 tokens/s, laagste kosten per query |
| Bulkdocumentverwerking / extractie | 3.5 Flash-Lite | 4× goedkoper dan 3.6 Flash; GDM-MRCR v2 72.2% long-context |
| Classificatie, routing, moderatie | 3.5 Flash-Lite (minimal thinking) | Latentiekritisch, kwaliteitsmarge over |
| Parallelle subagentvloten onder een orkestrator | 3.5 Flash-Lite (hogere denkniveaus) | Speciaal ontworpen modus; computergebruik ingebouwd |
| Complex agentisch coderen (SWE-agents) | 3.6 Flash | DeepSWE 49%; hogere precisie, minder slechte edits |
| ML-onderzoeksworkflows | 3.6 Flash | MLE Bench 63.9% versus 49.7% voor 3.5 Flash |
| Computergebruik-agents op moeilijke taken | 3.6 Flash | OSWorld-Verified 83.0% (versus 74.0% voor Lite) |
| Multimodale documentanalyse en rapporten opstellen | 3.6 Flash | Bij de lancering gevalideerd door Harvey / Hebbia |
| Legacy-pipelines die nog op 3.5 Flash draaien | Migreer omhoog of omlaag | 3.6 Flash voor kwaliteit, Flash-Lite voor volume — zie de migratiegids |
| Detectie en patching van beveiligingskwetsbaarheden | 3.5 Flash Cyber | Alleen via de CodeMender-pilot (overheden en vertrouwde partners) |
Vuistregel: maak Flash-Lite de standaard en escaleer bij falen, in plaats van standaard het grote model te nemen en later te optimaliseren. De faalmodus is zichtbaar (slechte output); de verspilling van overprovisioning is stil.
Waar het beschikbaar is
3.5 Flash-Lite is vandaag live in de Gemini API (Google AI Studio, Android Studio), het Gemini Enterprise Agent Platform en de Gemini-app — en het wordt uitgerold binnen Google Search, wat veel zegt over Googles vertrouwen in het kostenprofiel op planetaire schaal. Vroege klanten zijn onder meer Ashler, Palo Alto Networks en Ramp.
Zijspoor: 3.5 Flash Cyber en CodeMender
Dezelfde lancering introduceerde Gemini 3.5 Flash Cyber — 3.5 Flash gefinetuned voor het vinden en verhelpen van beveiligingskwetsbaarheden. Binnen CodeMender werken meerdere Flash Cyber-agents parallel en voegen ze hun bevindingen samen tot één gecombineerd rapport, met frontier-competitieve prestaties op CyberGym. Let op de architectuur: het is hetzelfde patroon van een “vloot van efficiënte specialisten” dat deze gids beschrijft, toegepast op beveiliging.
De toegang is bewust smal: een pilot met beperkte toegang, exclusief voor overheden en vertrouwde partners via CodeMender, als weerspiegeling van het dual-use-risico van geautomatiseerde kwetsbaarheidsdetectie. Details in ons overzicht van de aankondiging.
Kortom
3.5 Flash-Lite hertekent de prijs-prestatiegrens voor agentische workloads: sneller dan alles in de 3.5-serie, ruwweg 4× goedkoper dan 3.6 Flash en — voor het eerst bij een Lite-model — echt betrouwbaar op agentische benchmarks. Bouw je routing zo dat Flash-Lite de standaard is en 3.6 Flash het escalatiepad, en je kostencurve zal je dankbaar zijn.