Gemini Omni
Zurück zu allen Artikeln
9 Min. Lesezeit

Google stellt Gemini 3.7 Flash vor: Hybrid-Reasoning für Coding, Agenten und Wissensarbeit

Gemini 3.7 Flash erscheint am 13. August 2026 mit nativem Hybrid-Reasoning, steuerbarem Thinking Budget, Frontier-Coding-Benchmarks und 50 % Einführungsrabatt bis Dezember.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Deutsch

Ein neues Flaggschiff für Hybrid-Reasoning

Am 13. August 2026 veröffentlichte Google Gemini 3.7 Flash — sein Flaggschiff-Modell für Hybrid-Reasoning, entwickelt für Coding, Agenten und komplexe Wissensarbeit. Im Gegensatz zu früheren Flash-Generationen, die Tiefe zugunsten von Geschwindigkeit opferten, bringt 3.7 Flash natives steuerbares Reasoning direkt in die API: Sie regeln die Denktiefe pro Anfrage, ohne auf ein separates „Reasoning-Modell“ umzuschalten.

Der Launch richtet sich gleichzeitig an drei Zielgruppen: Entwickler, die Produktions-Agenten betreiben, Teams mit langfristigen Coding-Aufgaben und Unternehmen, die zuverlässige multimodale Analysen über riesige Dokumentensätze benötigen. Google positioniert 3.7 Flash als das Modell, bei dem ein Endpoint endlich sowohl Sub-100-ms-Chat-Antworten als auch mehrminütige Deep-Research-Läufe bedient.

Natives Hybrid-Reasoning und Thinking Budget

Im Mittelpunkt steht thinking_config.thinking_budget — eine Ganzzahl, die festlegt, wie viele interne Reasoning-Tokens das Modell vor der Antwort verbrauchen darf.

thinking_budgetVerhaltenIdeal für
0Ultra-niedrige Latenz im Fast Mode (Erstes Token unter 85 ms)Live-Chat, Autocomplete, High-QPS-Routing
256–1024Leichte Multi-Step-PlanungTool-Routing, einfache Refactors, RAG-Synthese
4096–16384Tiefes Multi-Step-ReasoningAgent-Loops, komplexes Debugging, Research-Reports
32768–65536Maximale TiefeLangfristiges Coding, Multi-File-Architekturänderungen

So konfigurieren Sie es in der Gemini API:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refaktoriere diese React-Komponente auf Hooks und füge Error Boundaries hinzu.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = Fast Mode; bis 65536 für tiefes Reasoning
        )
    ),
)
print(response.text)

Da Reasoning nativ statt aufgesetzt ist, skaliert die Latenz sanft: Ein thinking_budget von 0 verhält sich wie ein klassisches Flash-Modell, höhere Werte erschließen Chain-of-Thought-Qualität ohne Modell-ID-Wechsel. Die Abrechnung trennt sichtbare Output-Tokens von internen Thinking-Tokens — Sie zahlen nur für die angeforderte Tiefe.

Benchmark-Highlights

Google veröffentlichte Head-to-Head-Zahlen gegen Gemini 3.6 Flash, Claude Sonnet 5 und GPT-5.6 Terra. 3.7 Flash führt bei allen gelisteten Evals:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Zwei Zahlen fallen für Builder besonders auf:

  • DeepSWE v1.1 mit 65.3% — ein Sprung von 16 Punkten gegenüber 3.6 Flash; agentisches Coding ist das primäre Trainingsziel.
  • GDM-MRCR v2 mit 97.0% — nahezu perfekte Long-Context-Retrieval über ein 2,5M-Token-Fenster, entscheidend für dokumentenlastige Workflows.

Kontext zur Vorgängergeneration: Gemini 3.6 Flash vs 3.5 Flash Vergleich.

Preise und 50 % Einführungsrabatt

Google fährt eine aggressive Launch-Promotion:

Einführungspreis (bis 31. Dez. 2026)Standardpreis (ab 1. Jan. 2027)
Input$0,75 / 1M Tokens$1,50 / 1M Tokens
Output$3,75 / 1M Tokens$7,50 / 1M Tokens
Context Caching$0,075 / 1M Tokens$0,075 / 1M Tokens

Das sind 50 % Rabatt auf Input und Output für den Rest von 2026. Context Caching — nützlich bei wiederholten großen System-Prompts oder Dokumentenkorpora — bleibt bei $0,075 pro Million Tokens unabhängig vom Promo-Zeitraum.

Kombiniert mit weniger Tool-Call-Roundtrips bei höheren Thinking Budgets kann der effektive Kosten pro abgeschlossener Agent-Aufgabe deutlich unter dem Token-Stickerpreis liegen. Unser API-Kostenschätzungs-Guide rechnet typische Workloads durch.

Multimodal-, Web-Dev- und Agent-Fähigkeiten

Neben Benchmarks liefert 3.7 Flash produktionsreife Features:

  • 2,5M-Token-Kontextfenster — ganze Codebases, Vertragspakete oder Research-Korpora in einem Durchlauf.
  • 245 Output-Tokens/s — schnell genug zum Streamen von UI-Code und langen Reports ohne UX-Drosselung.
  • 99,7 % JSON-Tool-Execution-Präzision — zuverlässige strukturierte Outputs für Agent-Tool-Chains.
  • Computer Use — eingebaute Client-seitige Automatisierung für Browser- und Desktop-Workflows.
  • UI-Generierungs-Treue — höhere Layout-Genauigkeit auf WebDev Arena (1588 Elo) bedeutet sauberere generierte Frontends.

Verfügbar über Gemini API, Google AI Studio, Gemini Enterprise und Google Antigravity.

Entwickler-Guide und Migration

Beim Upgrade von 3.6 Flash oder 3.5 Flash-Lite beginnen Sie mit diesen Mustern:

  1. Modell-ID ersetzengemini-3.6-flash durch gemini-3.7-flash tauschen; API-Oberfläche ist abwärtskompatibel.
  2. Thinking Budgets pro Aufgabentyp setzen0 für User-Chat, 1024 für RAG-Q&A, 8192+ für Coding-Agenten, 32768 nur für nächtliche Batch-Jobs ohne Latenz-Anforderung.
  3. Context Caching aktivieren — bei System-Prompts oder Dokumentensätzen über 32K Tokens, die sich wiederholen, senkt Caching Input-Kosten um 90 %.
  4. Tool-Schemas optimieren — 99,7 % JSON-Präzision belohnt strikte Schemas; lockere Definitionen scheitern weiterhin auf App-Ebene.
  5. Thinking-Token-Nutzung überwachenusage_metadata loggen, um zu erkennen, welche Agent-Schritte wirklich Deep Reasoning brauchen.

Agent-Workflow-Muster: 3.5 Flash-Lite Agentic Workflows Guide — das Thinking-Budget-Konzept erweitert sich natürlich auf 3.7 Flash mit feinerer Granularität.

Fazit

Gemini 3.7 Flash ist das erste Flash-Tier-Modell, bei dem Geschwindigkeit und Tiefe sich nicht ausschließen. Das steuerbare thinking_budget lässt ein Modell latenzkritischen Chat und tiefes agentisches Coding bedienen — und die Launch-Preise machen Experimente bis Ende 2026 günstig.

Verwandt