Google wprowadza Gemini 3.7 Flash: hybrydowe rozumowanie dla kodowania, agentów i pracy wiedzy
Gemini 3.7 Flash debiutuje 13 sierpnia 2026 r. z natywnym hybrydowym rozumowaniem, konfigurowalnym thinking budget, benchmarkami kodowania frontier i 50% zniżką wprowadzającą do grudnia.
Nowy flagowiec hybrydowego rozumowania
13 sierpnia 2026 r. Google opublikował Gemini 3.7 Flash — flagowy model hybrydowego rozumowania stworzony do kodowania, agentów i złożonej pracy wiedzy. W przeciwieństwie do wcześniejszych generacji Flash, które wymieniały głębię na szybkość, 3.7 Flash ma natywne konfigurowalne rozumowanie wbudowane w API: regulujesz głębokość myślenia na żądanie, bez przełączania na osobny „model rozumowania”.
Premiera celuje jednocześnie w trzy grupy: deweloperów wdrażających agentów produkcyjnych, zespoły wykonujące długoterminowe zadania kodowania oraz przedsiębiorstwa potrzebujące niezawodnej analizy multimodalnej ogromnych zbiorów dokumentów. Google pozycjonuje 3.7 Flash jako model, w którym jeden endpoint wreszcie obsługuje zarówno odpowiedzi czatu poniżej 100 ms, jak i wielominutowe głębokie badania.
Natywne hybrydowe rozumowanie i thinking budget
Kluczem jest thinking_config.thinking_budget — liczba całkowita określająca, ile wewnętrznych tokenów rozumowania model może zużyć przed odpowiedzią.
thinking_budget | Zachowanie | Najlepsze dla |
|---|---|---|
| 0 | Tryb szybki ultra-niskiej latencji (pierwszy token poniżej 85 ms) | Czat na żywo, autouzupełnianie, routing wysokiego QPS |
| 256–1024 | Lekkie planowanie wieloetapowe | Routing narzędzi, proste refaktory, synteza RAG |
| 4096–16384 | Głębokie rozumowanie wieloetapowe | Pętle agentów, złożony debug, raporty badawcze |
| 32768–65536 | Maksymalna głębokość | Długoterminowe kodowanie, zmiany architektury w wielu plikach |
Konfiguracja w Gemini API:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Zrefaktoryzuj ten komponent React na hooki i dodaj error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = tryb szybki; do 65536 dla głębokiego rozumowania
)
),
)
print(response.text)
Ponieważ rozumowanie jest natywne, a nie doklejone, latencja skaluje się płynnie: thinking_budget równy 0 zachowuje się jak klasyczny Flash, wyższe wartości odblokowują jakość chain-of-thought bez zmiany ID modelu. Rozliczenia oddzielają widoczne tokeny wyjściowe od wewnętrznych tokenów myślenia — płacisz tylko za żądaną głębokość.
Najważniejsze benchmarki
Google opublikował liczby head-to-head z Gemini 3.6 Flash, Claude Sonnet 5 i GPT-5.6 Terra. 3.7 Flash prowadzi we wszystkich wymienionych ewaluacjach:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Dwie liczby wyróżniają się dla twórców:
- DeepSWE v1.1 na poziomie 65.3% — skok o 16 punktów względem 3.6 Flash; agentowe kodowanie to główny cel treningu.
- GDM-MRCR v2 na poziomie 97.0% — niemal idealne odzyskiwanie długiego kontekstu w oknie 2,5M tokenów, kluczowe dla workflow opartych na dokumentach.
Kontekst poprzedniej generacji: porównanie Gemini 3.6 Flash vs 3.5 Flash.
Ceny i 50% zniżki wprowadzającej
Google prowadzi agresywną promocję premierową:
| Cena wprowadzająca (do 31 grudnia 2026) | Cena standardowa (od 1 stycznia 2027) | |
|---|---|---|
| Wejście | $0,75 / 1M tokenów | $1,50 / 1M tokenów |
| Wyjście | $3,75 / 1M tokenów | $7,50 / 1M tokenów |
| Context caching | $0,075 / 1M tokenów | $0,075 / 1M tokenów |
To 50% zniżki na wejście i wyjście do końca 2026 r. Context caching — przydatny przy ponownym użyciu dużych promptów systemowych lub korpusów dokumentów — pozostaje $0,075 za milion tokenów niezależnie od promocji.
W połączeniu z mniejszą liczbą rund wywołań narzędzi przy wyższych thinking budget, efektywny koszt ukończonego zadania agenta może spaść znacznie poniżej ceny za token. Nasz przewodnik szacowania kosztów API pokazuje kalkulacje typowych obciążeń.
Możliwości multimodalne, web dev i agentów
Poza benchmarkami 3.7 Flash oferuje funkcje gotowe do produkcji:
- Okno kontekstu 2,5M tokenów — całe codebase’y, pakiety umów lub korpusy badawcze w jednym przebiegu.
- 245 tokenów wyjściowych/s — wystarczająco szybko do streamowania kodu UI i długich raportów.
- 99,7% precyzji wykonania narzędzi JSON — niezawodne strukturalne wyjścia dla łańcuchów narzędzi agentów.
- Computer use — wbudowana automatyzacja po stronie klienta dla workflow przeglądarki i pulpitu.
- Wierność generowania UI — wyższa dokładność layoutu na WebDev Arena (1588 Elo) oznacza czystsze generowane frontendy.
Dostępne dziś przez Gemini API, Google AI Studio, Gemini Enterprise i Google Antigravity.
Przewodnik dla deweloperów i migracja
Przy aktualizacji z 3.6 Flash lub 3.5 Flash-Lite zacznij od tych wzorców:
- Zamień ID modelu — podmień
gemini-3.6-flashnagemini-3.7-flash; powierzchnia API jest wstecznie kompatybilna. - Ustaw thinking budget według typu zadania —
0dla czatu użytkownika,1024dla RAG Q&A,8192+dla agentów kodowania,32768tylko dla nocnych zadań batch bez wymagań latencji. - Włącz context caching — gdy prompt systemowy lub zestaw dokumentów przekracza 32K tokenów i powtarza się między żądaniami, caching obcina koszt wejścia o 90%.
- Dostosuj schematy narzędzi — 99,7% precyzji JSON nagradza ścisłe schematy; luźne definicje nadal zawodzą na warstwie aplikacji.
- Monitoruj użycie tokenów myślenia — loguj
usage_metadata, aby zrozumieć, które kroki agenta naprawdę wymagają głębokiego rozumowania.
Wzorce workflow agentowych: przewodnik 3.5 Flash-Lite agentic workflows — koncepcja thinking budget naturalnie rozszerza się na 3.7 Flash z większą granularnością.
Podsumowanie
Gemini 3.7 Flash to pierwszy model klasy Flash, w którym szybkość i głębokość się nie wykluczają. Konfigurowalny thinking_budget pozwala jednemu modelowi obsłużyć czat wrażliwy na latencję i głębokie agentowe kodowanie, a ceny premierowe czynią eksperymenty tanimi do końca 2026 r.