Inilunsad ng Google ang Gemini 3.7 Flash: Hybrid Reasoning para sa Coding, Agents, at Knowledge Work
Dumating ang Gemini 3.7 Flash noong Agosto 13, 2026 na may native hybrid reasoning, kontroladong thinking budget, frontier coding benchmarks, at 50% introductory discount hanggang Disyembre.
Bagong flagship para sa hybrid reasoning
Noong Agosto 13, 2026, inilabas ng Google ang Gemini 3.7 Flash — ang flagship hybrid reasoning model para sa coding, agents, at complex knowledge work. Hindi tulad ng mga naunang henerasyon ng Flash na ipinapalit ang lalim para sa bilis, ang 3.7 Flash ay may native controllable reasoning sa API: inaayos mo ang lalim ng pag-iisip bawat request nang hindi lumilipat sa hiwalay na «reasoning model».
Tatlong audience ang target sabay-sabay: developers na nagde-deploy ng production agents, teams na nagpapatakbo ng long-horizon coding tasks, at enterprises na kailangan ng maaasahang multimodal analysis sa napakalaking document sets. Inilalagay ng Google ang 3.7 Flash bilang model kung saan isang endpoint ang naglilingkod sa sub-100ms chat replies at multi-minute deep research.
Native hybrid reasoning at thinking budget
Sentro nito ang thinking_config.thinking_budget — integer na kumokontrol kung ilang internal reasoning tokens ang maaaring gamitin ng model bago sumagot.
thinking_budget | Pag-uugali | Pinakamainam para sa |
|---|---|---|
| 0 | Ultra-low latency fast mode (unang token sa ilalim ng 85 ms) | Live chat, autocomplete, high-QPS routing |
| 256–1024 | Magaan na multi-step planning | Tool routing, simpleng refactor, RAG synthesis |
| 4096–16384 | Malalim na multi-step reasoning | Agent loops, complex debugging, research reports |
| 32768–65536 | Maximum depth | Long-horizon coding, multi-file architecture changes |
Itakda sa Gemini API ganito:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="I-refactor ang React component na ito para gumamit ng hooks at magdagdag ng error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = fast mode; hanggang 65536 para sa deep reasoning
)
),
)
print(response.text)
Dahil native ang reasoning at hindi bolt-on, smooth ang pag-scale ng latency: ang thinking_budget na 0 ay parang classic Flash, mas mataas na values ay nagbubukas ng chain-of-thought quality nang hindi nagpapalit ng model ID. Hihiwalayin ng billing ang visible output tokens mula sa internal thinking tokens — babayaran mo lang ang lalim na hiniling mo.
Benchmark highlights
Nag-publish ang Google ng head-to-head numbers laban sa Gemini 3.6 Flash, Claude Sonnet 5, at GPT-5.6 Terra. Nangunguna ang 3.7 Flash sa lahat ng nakalistang eval:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Dalawang numero ang kapansin-pansin para sa builders:
- DeepSWE v1.1 sa 65.3% — 16-point jump sa 3.6 Flash; agentic coding ang primary training target.
- GDM-MRCR v2 sa 97.0% — halos perpektong long-context retrieval sa 2.5M-token window, kritikal para sa document-heavy workflows.
Para sa konteksto ng nakaraang henerasyon, tingnan ang aming Gemini 3.6 Flash vs 3.5 Flash comparison.
Presyo at 50% introductory discount
May aggressive launch promotion ang Google:
| Intro price (hanggang Dis 31, 2026) | Standard price (simula Ene 1, 2027) | |
|---|---|---|
| Input | $0.75 / 1M tokens | $1.50 / 1M tokens |
| Output | $3.75 / 1M tokens | $7.50 / 1M tokens |
| Context caching | $0.075 / 1M tokens | $0.075 / 1M tokens |
50% discount sa input at output para sa natitirang bahagi ng 2026. Ang context caching — kapaki-pakinabang kapag inuulit ang malalaking system prompts o document corpora — ay nananatiling $0.075 bawat milyong tokens anuman ang promo.
Kasama ang mas kaunting tool-call round trips sa mas mataas na thinking budgets, maaaring bumaba nang husto ang effective cost bawat natapos na agent task kaysa sa per-token sticker price. Ang aming API cost estimate guide ay naglalakad sa math para sa typical workloads.
Multimodal, web dev, at agent capabilities
Bukod sa benchmarks, may production-ready capabilities ang 3.7 Flash:
- 2.5M-token context window — kumain ng buong codebases, contract bundles, o research corpora sa isang pass.
- 245 output tokens/s — sapat na mabilis para i-stream ang UI code at mahahabang report nang hindi sinasakal ang UX.
- 99.7% JSON tool execution precision — maaasahang structured outputs para sa agent tool chains.
- Computer use — built-in client-side automation para sa browser at desktop workflows.
- UI generation fidelity — mas mataas na layout accuracy sa WebDev Arena (1588 Elo) ay mas malinis na generated frontends.
Available ngayon sa Gemini API, Google AI Studio, Gemini Enterprise, at Google Antigravity.
Developer guide at migration
Kung nag-a-upgrade mula sa 3.6 Flash o 3.5 Flash-Lite, magsimula sa mga pattern na ito:
- Palitan ang model ID — swap
gemini-3.6-flashsagemini-3.7-flash; backward compatible ang API surface. - Itakda ang thinking budgets bawat task type —
0para sa user-facing chat,1024para sa RAG Q&A,8192+para sa coding agents,32768lang para sa overnight batch jobs kung saan hindi mahalaga ang latency. - I-enable ang context caching — kung ang system prompt o document set ay lampas 32K tokens at inuulit sa mga request, 90% bawas ang input cost.
- I-tune ang tool schemas — ang 99.7% JSON precision ay gumagantimpala sa strict schemas; maluwag na definitions ay nabibigo pa rin sa application layer.
- I-monitor ang thinking token usage — i-log ang
usage_metadatapara malaman kung aling agent steps ang talagang kailangan ng deep reasoning.
Para sa agentic workflow patterns, tingnan ang aming 3.5 Flash-Lite agentic workflows guide — natural na umaabot ang thinking budget concept sa 3.7 Flash na may mas pinong granularity.
Konklusyon
Ang Gemini 3.7 Flash ang unang Flash-tier model kung saan hindi magkasalungat ang bilis at lalim. Pinapayagan ng controllable thinking_budget na ang isang model ay maglingkod sa latency-critical chat at deep agentic coding, at ginagawang mura ng launch pricing ang experimentation hanggang katapusan ng 2026.