Gemini 3.5 Flash-Lite Guide: agentische Workflows mit 350 Tokens/s skalieren (2026)
Gemini 3.5 Flash-Lite läuft mit 350 Tokens/s für $0.30/1M Input. Benchmarks vs. 3.1 Flash-Lite und Gemini 3 Flash, Denkstufen, Kostenrechnung und Entscheidungstabelle.
Die Volumen-Stufe meint es jetzt ernst
Gemini 3.5 Flash-Lite, angekündigt am 21. Juli 2026, ist Googles schnellstes und kosteneffizientestes Modell der 3.5-Klasse: 350 Output-Tokens pro Sekunde (Artificial Analysis), zum Preis von $0.30 pro 1M Input-Tokens und $2.50 pro 1M Output-Tokens. Historisch waren „Lite”-Stufen der Ort, an dem Qualität zum Sterben hinging — gut für Klassifikation und Boilerplate, riskant für alles Agentische. Dieses Release bricht das Muster: In mehreren agentischen und Coding-Evals schlägt 3.5 Flash-Lite das größere Gemini 3 Flash glatt.
Dieser Guide behandelt, wo Flash-Lite im Line-up steht, wie du seine Denkstufen konfigurierst, was Skalierung tatsächlich kostet und welches Modell für welchen Workload das richtige ist. Den Launch-Kontext findest du in unserem Überblick zur Ankündigung.
Generationensprung: vs. 3.1 Flash-Lite
Der Sprung von der vorherigen Lite-Generation ist der größte in der Geschichte der Familie:
| Benchmark | Was er misst | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Coding- & agentische Terminal-Aufgaben | 54 % | 31 % |
| GDM-MRCR v2 | Abruf aus langem Kontext | 72.2 % | 60.1 % |
| GDPval-AA v2 | Ausführung realer Aufgaben | 1140 | 642 |

Die Zahl, die man verinnerlichen sollte, ist der sich fast verdoppelnde GDPval-AA-v2-Wert (642 → 1140): Die Ausführung realer Aufgaben war genau die Stelle, an der alte Lite-Modelle in Produktionsagenten zerbrachen.
Die Überraschung: Gemini 3 Flash geschlagen
Überraschender als der Generationengewinn ist der stufenübergreifende. In mehreren agentischen und Coding-Evals übertrifft 3.5 Flash-Lite Gemini 3 Flash — ein größeres, teureres Modell:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2 % | 49.6 % |
| OSWorld-Verified | 74.0 % | 65.1 % |
Wenn du heute Workloads auf 2.5 Flash oder 3 Flash betreibst, weil man Lite-Stufen keine agentische Arbeit anvertrauen konnte, ist diese Annahme jetzt überholt — Flash-Lite ist bei diesen Aufgaben sowohl schneller als auch fähiger.
Denkstufen: ein Modell, zwei Betriebsmodi
Flash-Lite kommt mit konfigurierbaren Denkstufen (thinking levels), die es effektiv zu zwei Produkten machen:
- Minimal / low Denkstufe — priorisiert Latenz und Kosten für Aufgaben mit hohem Volumen: agentische Suche, Dokumentenverarbeitung, Extraktion, Klassifikation, Routing. Das ist der 350-Tokens/s-Modus.
- Höhere Denkstufen — aktivieren tieferes Reasoning für mehrstufige Subagenten-Workloads, bei denen Flash-Lite als Arbeiter unter einem Orchestrator-Modell agiert.
Dieser zweite Modus entspricht Googles eigenem Demo-Muster: 3.6 Flash als Master-Agent, Flotten von 3.5-Flash-Lite-Subagenten für parallele Arbeit (eine Demo generiert 25 Webdesign-Konzepte gleichzeitig). Computernutzung ist auch bei Flash-Lite ein eingebautes Tool, sodass Subagenten Benutzeroberflächen ohne zusätzliches Scaffolding bedienen können. Sieh dir Googles Geschwindigkeits-Demo Flash-Lite vs. 3.5 Flash (Video) für den Latenzunterschied bei Aufgaben mit hohem Volumen an.
Kostenanalyse: was Skalierung wirklich kostet
Preise: $0.30/1M Input, $2.50/1M Output. Ein Beispiel-Workload — ein Dokumentenverarbeitungs-Agent, der 1 Million Dokumente pro Monat bearbeitet, mit durchschnittlich 3K Input-Tokens und 500 Output-Tokens pro Dokument:
| Kostenposition | Rechnung | Monatliche Kosten |
|---|---|---|
| Input-Tokens | 1M Dokumente × 3K Tokens = 3B Tokens × $0.30/1M | $900 |
| Output-Tokens | 1M Dokumente × 500 Tokens = 0.5B Tokens × $2.50/1M | $1,250 |
| Gesamt auf 3.5 Flash-Lite | $2,150 | |
| Derselbe Workload auf 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Rund ein 4-facher Kostenunterschied für einen Workload, den Lite gut bewältigt — und bei 350 Tokens/s streamt die 500-Token-Zusammenfassung jedes Dokuments in unter 1,5 Sekunden heraus. Die Strategie, die daraus folgt: Route die 90 % Routine-Volumen zu Flash-Lite und eskaliere die schwierigen 10 % zu 3.6 Flash.
Entscheidungstabelle: welches Modell für welchen Workload
| Workload | Wahl | Warum |
|---|---|---|
| Agentische Suche / RAG bei hohem QPS | 3.5 Flash-Lite (minimal Denkstufe) | 350 Tokens/s, niedrigste Kosten pro Anfrage |
| Massenhafte Dokumentenverarbeitung / Extraktion | 3.5 Flash-Lite | 4× günstiger als 3.6 Flash; GDM-MRCR v2 mit 72.2 % im langen Kontext |
| Klassifikation, Routing, Moderation | 3.5 Flash-Lite (minimal Denkstufe) | Latenzkritisch, mit Qualitätsreserven |
| Parallele Subagenten-Flotten unter einem Orchestrator | 3.5 Flash-Lite (höhere Denkstufe) | Genau dafür gebauter Modus; Computernutzung eingebaut |
| Komplexes agentisches Coding (SWE-Agenten) | 3.6 Flash | DeepSWE 49 %; höhere Präzision, weniger schlechte Edits |
| ML-Forschungs-Workflows | 3.6 Flash | MLE Bench 63.9 % vs. 49.7 % bei 3.5 Flash |
| Computernutzungs-Agenten bei schweren Aufgaben | 3.6 Flash | OSWorld-Verified 83.0 % (vs. 74.0 % bei Lite) |
| Multimodale Dokumentenanalyse & Berichte | 3.6 Flash | Von Harvey / Hebbia zum Launch bestätigt |
| Legacy-Pipelines noch auf 3.5 Flash | Nach oben oder unten migrieren | 3.6 Flash für Qualität, Flash-Lite für Volumen — siehe den Migrations-Guide |
| Erkennung & Behebung von Sicherheitslücken | 3.5 Flash Cyber | Nur über das CodeMender-Pilotprogramm (Regierungen & vertrauenswürdige Partner) |
Faustregel: Nimm Flash-Lite als Standard und eskaliere bei Fehlschlägen, statt standardmäßig das große Modell zu nehmen und später zu optimieren. Der Fehlermodus ist sichtbar (schlechte Outputs); die Verschwendung durch Überprovisionierung ist lautlos.
Wo es verfügbar ist
3.5 Flash-Lite ist ab heute live in der Gemini API (Google AI Studio, Android Studio), der Gemini Enterprise Agent Platform und der Gemini-App — und es wird schrittweise in der Google-Suche ausgerollt, was viel über Googles Vertrauen in sein Kostenprofil im planetaren Maßstab aussagt. Zu den ersten Kunden zählen Ashler, Palo Alto Networks und Ramp.
Randnotiz: 3.5 Flash Cyber und CodeMender
Derselbe Launch führte Gemini 3.5 Flash Cyber ein — 3.5 Flash, feinabgestimmt auf das Finden und Beheben von Sicherheitslücken. Innerhalb von CodeMender arbeiten mehrere Flash-Cyber-Agenten parallel und führen ihre Funde in einem einzigen kombinierten Bericht zusammen — mit wettbewerbsfähiger Frontier-Leistung auf CyberGym. Beachte die Architektur: Es ist dasselbe Muster der „Flotte effizienter Spezialisten”, das dieser Guide beschreibt — angewandt auf Sicherheit.
Der Zugang ist bewusst eng: ein Pilotprogramm mit begrenztem Zugang, exklusiv für Regierungen und vertrauenswürdige Partner über CodeMender — eine Reaktion auf das Dual-Use-Risiko automatisierter Schwachstellensuche. Details in unserem Überblick zur Ankündigung.
Fazit
3.5 Flash-Lite zeichnet die Preis-Leistungs-Grenze für agentische Workloads neu: schneller als alles andere in der 3.5-Serie, rund 4× günstiger als 3.6 Flash und — zum ersten Mal bei einem Lite-Modell — auf agentischen Benchmarks wirklich vertrauenswürdig. Baue dein Routing so, dass Flash-Lite der Standard und 3.6 Flash der Eskalationspfad ist, und deine Kostenkurve wird es dir danken.