Gemini Omni
Zurück zu allen Artikeln
10 Min. Lesezeit

Gemini 3.5 Flash-Lite Guide: agentische Workflows mit 350 Tokens/s skalieren (2026)

Gemini 3.5 Flash-Lite läuft mit 350 Tokens/s für $0.30/1M Input. Benchmarks vs. 3.1 Flash-Lite und Gemini 3 Flash, Denkstufen, Kostenrechnung und Entscheidungstabelle.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Deutsch

Die Volumen-Stufe meint es jetzt ernst

Gemini 3.5 Flash-Lite, angekündigt am 21. Juli 2026, ist Googles schnellstes und kosteneffizientestes Modell der 3.5-Klasse: 350 Output-Tokens pro Sekunde (Artificial Analysis), zum Preis von $0.30 pro 1M Input-Tokens und $2.50 pro 1M Output-Tokens. Historisch waren „Lite”-Stufen der Ort, an dem Qualität zum Sterben hinging — gut für Klassifikation und Boilerplate, riskant für alles Agentische. Dieses Release bricht das Muster: In mehreren agentischen und Coding-Evals schlägt 3.5 Flash-Lite das größere Gemini 3 Flash glatt.

Dieser Guide behandelt, wo Flash-Lite im Line-up steht, wie du seine Denkstufen konfigurierst, was Skalierung tatsächlich kostet und welches Modell für welchen Workload das richtige ist. Den Launch-Kontext findest du in unserem Überblick zur Ankündigung.

Generationensprung: vs. 3.1 Flash-Lite

Der Sprung von der vorherigen Lite-Generation ist der größte in der Geschichte der Familie:

BenchmarkWas er misstGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Coding- & agentische Terminal-Aufgaben54 %31 %
GDM-MRCR v2Abruf aus langem Kontext72.2 %60.1 %
GDPval-AA v2Ausführung realer Aufgaben1140642

Benchmark-Vergleich von Gemini 3.5 Flash-Lite mit früheren Flash-Lite-Generationen

Die Zahl, die man verinnerlichen sollte, ist der sich fast verdoppelnde GDPval-AA-v2-Wert (642 → 1140): Die Ausführung realer Aufgaben war genau die Stelle, an der alte Lite-Modelle in Produktionsagenten zerbrachen.

Die Überraschung: Gemini 3 Flash geschlagen

Überraschender als der Generationengewinn ist der stufenübergreifende. In mehreren agentischen und Coding-Evals übertrifft 3.5 Flash-Lite Gemini 3 Flash — ein größeres, teureres Modell:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2 %49.6 %
OSWorld-Verified74.0 %65.1 %

Wenn du heute Workloads auf 2.5 Flash oder 3 Flash betreibst, weil man Lite-Stufen keine agentische Arbeit anvertrauen konnte, ist diese Annahme jetzt überholt — Flash-Lite ist bei diesen Aufgaben sowohl schneller als auch fähiger.

Denkstufen: ein Modell, zwei Betriebsmodi

Flash-Lite kommt mit konfigurierbaren Denkstufen (thinking levels), die es effektiv zu zwei Produkten machen:

  • Minimal / low Denkstufe — priorisiert Latenz und Kosten für Aufgaben mit hohem Volumen: agentische Suche, Dokumentenverarbeitung, Extraktion, Klassifikation, Routing. Das ist der 350-Tokens/s-Modus.
  • Höhere Denkstufen — aktivieren tieferes Reasoning für mehrstufige Subagenten-Workloads, bei denen Flash-Lite als Arbeiter unter einem Orchestrator-Modell agiert.

Dieser zweite Modus entspricht Googles eigenem Demo-Muster: 3.6 Flash als Master-Agent, Flotten von 3.5-Flash-Lite-Subagenten für parallele Arbeit (eine Demo generiert 25 Webdesign-Konzepte gleichzeitig). Computernutzung ist auch bei Flash-Lite ein eingebautes Tool, sodass Subagenten Benutzeroberflächen ohne zusätzliches Scaffolding bedienen können. Sieh dir Googles Geschwindigkeits-Demo Flash-Lite vs. 3.5 Flash (Video) für den Latenzunterschied bei Aufgaben mit hohem Volumen an.

Kostenanalyse: was Skalierung wirklich kostet

Preise: $0.30/1M Input, $2.50/1M Output. Ein Beispiel-Workload — ein Dokumentenverarbeitungs-Agent, der 1 Million Dokumente pro Monat bearbeitet, mit durchschnittlich 3K Input-Tokens und 500 Output-Tokens pro Dokument:

KostenpositionRechnungMonatliche Kosten
Input-Tokens1M Dokumente × 3K Tokens = 3B Tokens × $0.30/1M$900
Output-Tokens1M Dokumente × 500 Tokens = 0.5B Tokens × $2.50/1M$1,250
Gesamt auf 3.5 Flash-Lite$2,150
Derselbe Workload auf 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Rund ein 4-facher Kostenunterschied für einen Workload, den Lite gut bewältigt — und bei 350 Tokens/s streamt die 500-Token-Zusammenfassung jedes Dokuments in unter 1,5 Sekunden heraus. Die Strategie, die daraus folgt: Route die 90 % Routine-Volumen zu Flash-Lite und eskaliere die schwierigen 10 % zu 3.6 Flash.

Entscheidungstabelle: welches Modell für welchen Workload

WorkloadWahlWarum
Agentische Suche / RAG bei hohem QPS3.5 Flash-Lite (minimal Denkstufe)350 Tokens/s, niedrigste Kosten pro Anfrage
Massenhafte Dokumentenverarbeitung / Extraktion3.5 Flash-Lite4× günstiger als 3.6 Flash; GDM-MRCR v2 mit 72.2 % im langen Kontext
Klassifikation, Routing, Moderation3.5 Flash-Lite (minimal Denkstufe)Latenzkritisch, mit Qualitätsreserven
Parallele Subagenten-Flotten unter einem Orchestrator3.5 Flash-Lite (höhere Denkstufe)Genau dafür gebauter Modus; Computernutzung eingebaut
Komplexes agentisches Coding (SWE-Agenten)3.6 FlashDeepSWE 49 %; höhere Präzision, weniger schlechte Edits
ML-Forschungs-Workflows3.6 FlashMLE Bench 63.9 % vs. 49.7 % bei 3.5 Flash
Computernutzungs-Agenten bei schweren Aufgaben3.6 FlashOSWorld-Verified 83.0 % (vs. 74.0 % bei Lite)
Multimodale Dokumentenanalyse & Berichte3.6 FlashVon Harvey / Hebbia zum Launch bestätigt
Legacy-Pipelines noch auf 3.5 FlashNach oben oder unten migrieren3.6 Flash für Qualität, Flash-Lite für Volumen — siehe den Migrations-Guide
Erkennung & Behebung von Sicherheitslücken3.5 Flash CyberNur über das CodeMender-Pilotprogramm (Regierungen & vertrauenswürdige Partner)

Faustregel: Nimm Flash-Lite als Standard und eskaliere bei Fehlschlägen, statt standardmäßig das große Modell zu nehmen und später zu optimieren. Der Fehlermodus ist sichtbar (schlechte Outputs); die Verschwendung durch Überprovisionierung ist lautlos.

Wo es verfügbar ist

3.5 Flash-Lite ist ab heute live in der Gemini API (Google AI Studio, Android Studio), der Gemini Enterprise Agent Platform und der Gemini-App — und es wird schrittweise in der Google-Suche ausgerollt, was viel über Googles Vertrauen in sein Kostenprofil im planetaren Maßstab aussagt. Zu den ersten Kunden zählen Ashler, Palo Alto Networks und Ramp.

Randnotiz: 3.5 Flash Cyber und CodeMender

Derselbe Launch führte Gemini 3.5 Flash Cyber ein — 3.5 Flash, feinabgestimmt auf das Finden und Beheben von Sicherheitslücken. Innerhalb von CodeMender arbeiten mehrere Flash-Cyber-Agenten parallel und führen ihre Funde in einem einzigen kombinierten Bericht zusammen — mit wettbewerbsfähiger Frontier-Leistung auf CyberGym. Beachte die Architektur: Es ist dasselbe Muster der „Flotte effizienter Spezialisten”, das dieser Guide beschreibt — angewandt auf Sicherheit.

Der Zugang ist bewusst eng: ein Pilotprogramm mit begrenztem Zugang, exklusiv für Regierungen und vertrauenswürdige Partner über CodeMender — eine Reaktion auf das Dual-Use-Risiko automatisierter Schwachstellensuche. Details in unserem Überblick zur Ankündigung.

Fazit

3.5 Flash-Lite zeichnet die Preis-Leistungs-Grenze für agentische Workloads neu: schneller als alles andere in der 3.5-Serie, rund 4× günstiger als 3.6 Flash und — zum ersten Mal bei einem Lite-Modell — auf agentischen Benchmarks wirklich vertrauenswürdig. Baue dein Routing so, dass Flash-Lite der Standard und 3.6 Flash der Eskalationspfad ist, und deine Kostenkurve wird es dir danken.

Verwandte Artikel