Google stellt Gemini 3.7 Flash vor: Hybrid-Reasoning für Coding, Agenten und Wissensarbeit
Gemini 3.7 Flash erscheint am 13. August 2026 mit nativem Hybrid-Reasoning, steuerbarem Thinking Budget, Frontier-Coding-Benchmarks und 50 % Einführungsrabatt bis Dezember.
Ein neues Flaggschiff für Hybrid-Reasoning
Am 13. August 2026 veröffentlichte Google Gemini 3.7 Flash — sein Flaggschiff-Modell für Hybrid-Reasoning, entwickelt für Coding, Agenten und komplexe Wissensarbeit. Im Gegensatz zu früheren Flash-Generationen, die Tiefe zugunsten von Geschwindigkeit opferten, bringt 3.7 Flash natives steuerbares Reasoning direkt in die API: Sie regeln die Denktiefe pro Anfrage, ohne auf ein separates „Reasoning-Modell“ umzuschalten.
Der Launch richtet sich gleichzeitig an drei Zielgruppen: Entwickler, die Produktions-Agenten betreiben, Teams mit langfristigen Coding-Aufgaben und Unternehmen, die zuverlässige multimodale Analysen über riesige Dokumentensätze benötigen. Google positioniert 3.7 Flash als das Modell, bei dem ein Endpoint endlich sowohl Sub-100-ms-Chat-Antworten als auch mehrminütige Deep-Research-Läufe bedient.
Natives Hybrid-Reasoning und Thinking Budget
Im Mittelpunkt steht thinking_config.thinking_budget — eine Ganzzahl, die festlegt, wie viele interne Reasoning-Tokens das Modell vor der Antwort verbrauchen darf.
thinking_budget | Verhalten | Ideal für |
|---|---|---|
| 0 | Ultra-niedrige Latenz im Fast Mode (Erstes Token unter 85 ms) | Live-Chat, Autocomplete, High-QPS-Routing |
| 256–1024 | Leichte Multi-Step-Planung | Tool-Routing, einfache Refactors, RAG-Synthese |
| 4096–16384 | Tiefes Multi-Step-Reasoning | Agent-Loops, komplexes Debugging, Research-Reports |
| 32768–65536 | Maximale Tiefe | Langfristiges Coding, Multi-File-Architekturänderungen |
So konfigurieren Sie es in der Gemini API:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refaktoriere diese React-Komponente auf Hooks und füge Error Boundaries hinzu.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = Fast Mode; bis 65536 für tiefes Reasoning
)
),
)
print(response.text)
Da Reasoning nativ statt aufgesetzt ist, skaliert die Latenz sanft: Ein thinking_budget von 0 verhält sich wie ein klassisches Flash-Modell, höhere Werte erschließen Chain-of-Thought-Qualität ohne Modell-ID-Wechsel. Die Abrechnung trennt sichtbare Output-Tokens von internen Thinking-Tokens — Sie zahlen nur für die angeforderte Tiefe.
Benchmark-Highlights
Google veröffentlichte Head-to-Head-Zahlen gegen Gemini 3.6 Flash, Claude Sonnet 5 und GPT-5.6 Terra. 3.7 Flash führt bei allen gelisteten Evals:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Zwei Zahlen fallen für Builder besonders auf:
- DeepSWE v1.1 mit 65.3% — ein Sprung von 16 Punkten gegenüber 3.6 Flash; agentisches Coding ist das primäre Trainingsziel.
- GDM-MRCR v2 mit 97.0% — nahezu perfekte Long-Context-Retrieval über ein 2,5M-Token-Fenster, entscheidend für dokumentenlastige Workflows.
Kontext zur Vorgängergeneration: Gemini 3.6 Flash vs 3.5 Flash Vergleich.
Preise und 50 % Einführungsrabatt
Google fährt eine aggressive Launch-Promotion:
| Einführungspreis (bis 31. Dez. 2026) | Standardpreis (ab 1. Jan. 2027) | |
|---|---|---|
| Input | $0,75 / 1M Tokens | $1,50 / 1M Tokens |
| Output | $3,75 / 1M Tokens | $7,50 / 1M Tokens |
| Context Caching | $0,075 / 1M Tokens | $0,075 / 1M Tokens |
Das sind 50 % Rabatt auf Input und Output für den Rest von 2026. Context Caching — nützlich bei wiederholten großen System-Prompts oder Dokumentenkorpora — bleibt bei $0,075 pro Million Tokens unabhängig vom Promo-Zeitraum.
Kombiniert mit weniger Tool-Call-Roundtrips bei höheren Thinking Budgets kann der effektive Kosten pro abgeschlossener Agent-Aufgabe deutlich unter dem Token-Stickerpreis liegen. Unser API-Kostenschätzungs-Guide rechnet typische Workloads durch.
Multimodal-, Web-Dev- und Agent-Fähigkeiten
Neben Benchmarks liefert 3.7 Flash produktionsreife Features:
- 2,5M-Token-Kontextfenster — ganze Codebases, Vertragspakete oder Research-Korpora in einem Durchlauf.
- 245 Output-Tokens/s — schnell genug zum Streamen von UI-Code und langen Reports ohne UX-Drosselung.
- 99,7 % JSON-Tool-Execution-Präzision — zuverlässige strukturierte Outputs für Agent-Tool-Chains.
- Computer Use — eingebaute Client-seitige Automatisierung für Browser- und Desktop-Workflows.
- UI-Generierungs-Treue — höhere Layout-Genauigkeit auf WebDev Arena (1588 Elo) bedeutet sauberere generierte Frontends.
Verfügbar über Gemini API, Google AI Studio, Gemini Enterprise und Google Antigravity.
Entwickler-Guide und Migration
Beim Upgrade von 3.6 Flash oder 3.5 Flash-Lite beginnen Sie mit diesen Mustern:
- Modell-ID ersetzen —
gemini-3.6-flashdurchgemini-3.7-flashtauschen; API-Oberfläche ist abwärtskompatibel. - Thinking Budgets pro Aufgabentyp setzen —
0für User-Chat,1024für RAG-Q&A,8192+für Coding-Agenten,32768nur für nächtliche Batch-Jobs ohne Latenz-Anforderung. - Context Caching aktivieren — bei System-Prompts oder Dokumentensätzen über 32K Tokens, die sich wiederholen, senkt Caching Input-Kosten um 90 %.
- Tool-Schemas optimieren — 99,7 % JSON-Präzision belohnt strikte Schemas; lockere Definitionen scheitern weiterhin auf App-Ebene.
- Thinking-Token-Nutzung überwachen —
usage_metadataloggen, um zu erkennen, welche Agent-Schritte wirklich Deep Reasoning brauchen.
Agent-Workflow-Muster: 3.5 Flash-Lite Agentic Workflows Guide — das Thinking-Budget-Konzept erweitert sich natürlich auf 3.7 Flash mit feinerer Granularität.
Fazit
Gemini 3.7 Flash ist das erste Flash-Tier-Modell, bei dem Geschwindigkeit und Tiefe sich nicht ausschließen. Das steuerbare thinking_budget lässt ein Modell latenzkritischen Chat und tiefes agentisches Coding bedienen — und die Launch-Preise machen Experimente bis Ende 2026 günstig.