Gemini Omni
Terug naar alle artikelen
10 min leestijd

Gemini 3.5 Flash-Lite-gids: agentische workflows schalen op 350 tokens/s (2026)

Gemini 3.5 Flash-Lite draait 350 tokens/s voor $0.30/1M input. Benchmarks vs 3.1 Flash-Lite en Gemini 3 Flash, denkniveaus, kostenberekening en beslistabel.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Nederlands

Het volumesegment is serieus geworden

Gemini 3.5 Flash-Lite, aangekondigd op 21 juli 2026, is Googles snelste en meest kostenefficiënte model in de 3.5-klasse: 350 outputtokens per seconde (Artificial Analysis), geprijsd op $0.30 per 1M inputtokens en $2.50 per 1M outputtokens. Van oudsher waren “Lite”-niveaus de plek waar kwaliteit stierf — prima voor classificatie en boilerplate, riskant voor alles wat agentisch is. Deze release breekt met dat patroon: op meerdere agentische en codeer-evals verslaat 3.5 Flash-Lite het grotere Gemini 3 Flash ronduit.

Deze gids behandelt waar Flash-Lite in de line-up staat, hoe je de denkniveaus configureert, wat het op schaal echt kost en welk model je voor welke workload kiest. De lanceringscontext staat in ons overzicht van de aankondiging.

Generatiesprong: vs 3.1 Flash-Lite

De sprong ten opzichte van de vorige Lite-generatie is de grootste in de geschiedenis van de familie:

BenchmarkWat het meetGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Coderen en agentische terminaltaken54%31%
GDM-MRCR v2Long-context-retrieval72.2%60.1%
GDPval-AA v2Uitvoering van taken in de praktijk1140642

Benchmarkvergelijking van Gemini 3.5 Flash-Lite met eerdere Flash-Lite-generaties

Het bijna verdubbelde GDPval-AA v2-cijfer (642 → 1140) is het getal om te onthouden: uitvoering van taken in de praktijk was precies waar oude Lite-modellen in productie-agents door de mand vielen.

De verrassing: Gemini 3 Flash verslaan

Verrassender dan de generatiewinst is de winst over de niveaus heen. Op meerdere agentische en codeer-evals presteert 3.5 Flash-Lite beter dan Gemini 3 Flash — een groter, duurder model:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Draai je vandaag workloads op 2.5 Flash of 3 Flash omdat Lite-niveaus niet te vertrouwen waren met agentisch werk, dan is die aanname nu achterhaald — Flash-Lite is op deze taken zowel sneller als capabeler.

Denkniveaus: één model, twee bedrijfsmodi

Flash-Lite wordt geleverd met configureerbare denkniveaus, waardoor het feitelijk twee producten is:

  • Minimal / low thinking — prioriteit voor latentie en kosten bij taken met hoog volume: agentisch zoeken, documentverwerking, extractie, classificatie, routing. Dit is de 350 tokens/s-modus.
  • Hogere denkniveaus — activeer dieper redeneren voor meerstaps-subagentworkloads, waarbij Flash-Lite als worker onder een orkestratormodel werkt.

Die tweede modus komt overeen met Googles eigen demopatroon: 3.6 Flash als master-agent, vloten van 3.5 Flash-Lite-subagents die parallel werken (één demo genereert 25 webdesignconcepten tegelijk). Ook op Flash-Lite is computergebruik een ingebouwde tool, zodat subagents interfaces kunnen bedienen zonder extra scaffolding. Bekijk Googles snelheidsdemo Flash-Lite vs 3.5 Flash (video) voor het latentieverschil bij taken met hoog volume.

Kostenanalyse: wat schaal werkelijk kost

Prijzen: $0.30/1M input, $2.50/1M output. Hier een voorbeeldworkload — een documentverwerkingsagent die 1 miljoen documenten per maand verwerkt, met gemiddeld 3K inputtokens en 500 outputtokens per document:

KostenpostBerekeningMaandelijkse kosten
Inputtokens1M docs × 3K tokens = 3B tokens × $0.30/1M$900
Outputtokens1M docs × 500 tokens = 0.5B tokens × $2.50/1M$1,250
Totaal op 3.5 Flash-Lite$2,150
Dezelfde workload op 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Grofweg een kostenverschil van 4× voor een workload die Lite prima aankan — en op 350 tokens/s streamt de samenvatting van 500 tokens per document in minder dan 1.5 seconde naar buiten. De strategie die daaruit volgt: routeer de 90% routinevolume naar Flash-Lite en escaleer de moeilijke 10% naar 3.6 Flash.

Beslistabel: welk model voor welke workload

WorkloadKeuzeWaarom
Agentisch zoeken / RAG op hoge QPS3.5 Flash-Lite (minimal thinking)350 tokens/s, laagste kosten per query
Bulkdocumentverwerking / extractie3.5 Flash-Lite4× goedkoper dan 3.6 Flash; GDM-MRCR v2 72.2% long-context
Classificatie, routing, moderatie3.5 Flash-Lite (minimal thinking)Latentiekritisch, kwaliteitsmarge over
Parallelle subagentvloten onder een orkestrator3.5 Flash-Lite (hogere denkniveaus)Speciaal ontworpen modus; computergebruik ingebouwd
Complex agentisch coderen (SWE-agents)3.6 FlashDeepSWE 49%; hogere precisie, minder slechte edits
ML-onderzoeksworkflows3.6 FlashMLE Bench 63.9% versus 49.7% voor 3.5 Flash
Computergebruik-agents op moeilijke taken3.6 FlashOSWorld-Verified 83.0% (versus 74.0% voor Lite)
Multimodale documentanalyse en rapporten opstellen3.6 FlashBij de lancering gevalideerd door Harvey / Hebbia
Legacy-pipelines die nog op 3.5 Flash draaienMigreer omhoog of omlaag3.6 Flash voor kwaliteit, Flash-Lite voor volume — zie de migratiegids
Detectie en patching van beveiligingskwetsbaarheden3.5 Flash CyberAlleen via de CodeMender-pilot (overheden en vertrouwde partners)

Vuistregel: maak Flash-Lite de standaard en escaleer bij falen, in plaats van standaard het grote model te nemen en later te optimaliseren. De faalmodus is zichtbaar (slechte output); de verspilling van overprovisioning is stil.

Waar het beschikbaar is

3.5 Flash-Lite is vandaag live in de Gemini API (Google AI Studio, Android Studio), het Gemini Enterprise Agent Platform en de Gemini-app — en het wordt uitgerold binnen Google Search, wat veel zegt over Googles vertrouwen in het kostenprofiel op planetaire schaal. Vroege klanten zijn onder meer Ashler, Palo Alto Networks en Ramp.

Zijspoor: 3.5 Flash Cyber en CodeMender

Dezelfde lancering introduceerde Gemini 3.5 Flash Cyber — 3.5 Flash gefinetuned voor het vinden en verhelpen van beveiligingskwetsbaarheden. Binnen CodeMender werken meerdere Flash Cyber-agents parallel en voegen ze hun bevindingen samen tot één gecombineerd rapport, met frontier-competitieve prestaties op CyberGym. Let op de architectuur: het is hetzelfde patroon van een “vloot van efficiënte specialisten” dat deze gids beschrijft, toegepast op beveiliging.

De toegang is bewust smal: een pilot met beperkte toegang, exclusief voor overheden en vertrouwde partners via CodeMender, als weerspiegeling van het dual-use-risico van geautomatiseerde kwetsbaarheidsdetectie. Details in ons overzicht van de aankondiging.

Kortom

3.5 Flash-Lite hertekent de prijs-prestatiegrens voor agentische workloads: sneller dan alles in de 3.5-serie, ruwweg 4× goedkoper dan 3.6 Flash en — voor het eerst bij een Lite-model — echt betrouwbaar op agentische benchmarks. Bouw je routing zo dat Flash-Lite de standaard is en 3.6 Flash het escalatiepad, en je kostencurve zal je dankbaar zijn.

Gerelateerd