Gemini Omni
Bumalik sa lahat ng artikulo
9 min basa

Inilunsad ng Google ang Gemini 3.7 Flash: Hybrid Reasoning para sa Coding, Agents, at Knowledge Work

Dumating ang Gemini 3.7 Flash noong Agosto 13, 2026 na may native hybrid reasoning, kontroladong thinking budget, frontier coding benchmarks, at 50% introductory discount hanggang Disyembre.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Tagalog

Bagong flagship para sa hybrid reasoning

Noong Agosto 13, 2026, inilabas ng Google ang Gemini 3.7 Flash — ang flagship hybrid reasoning model para sa coding, agents, at complex knowledge work. Hindi tulad ng mga naunang henerasyon ng Flash na ipinapalit ang lalim para sa bilis, ang 3.7 Flash ay may native controllable reasoning sa API: inaayos mo ang lalim ng pag-iisip bawat request nang hindi lumilipat sa hiwalay na «reasoning model».

Tatlong audience ang target sabay-sabay: developers na nagde-deploy ng production agents, teams na nagpapatakbo ng long-horizon coding tasks, at enterprises na kailangan ng maaasahang multimodal analysis sa napakalaking document sets. Inilalagay ng Google ang 3.7 Flash bilang model kung saan isang endpoint ang naglilingkod sa sub-100ms chat replies at multi-minute deep research.

Native hybrid reasoning at thinking budget

Sentro nito ang thinking_config.thinking_budget — integer na kumokontrol kung ilang internal reasoning tokens ang maaaring gamitin ng model bago sumagot.

thinking_budgetPag-uugaliPinakamainam para sa
0Ultra-low latency fast mode (unang token sa ilalim ng 85 ms)Live chat, autocomplete, high-QPS routing
256–1024Magaan na multi-step planningTool routing, simpleng refactor, RAG synthesis
4096–16384Malalim na multi-step reasoningAgent loops, complex debugging, research reports
32768–65536Maximum depthLong-horizon coding, multi-file architecture changes

Itakda sa Gemini API ganito:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="I-refactor ang React component na ito para gumamit ng hooks at magdagdag ng error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = fast mode; hanggang 65536 para sa deep reasoning
        )
    ),
)
print(response.text)

Dahil native ang reasoning at hindi bolt-on, smooth ang pag-scale ng latency: ang thinking_budget na 0 ay parang classic Flash, mas mataas na values ay nagbubukas ng chain-of-thought quality nang hindi nagpapalit ng model ID. Hihiwalayin ng billing ang visible output tokens mula sa internal thinking tokens — babayaran mo lang ang lalim na hiniling mo.

Benchmark highlights

Nag-publish ang Google ng head-to-head numbers laban sa Gemini 3.6 Flash, Claude Sonnet 5, at GPT-5.6 Terra. Nangunguna ang 3.7 Flash sa lahat ng nakalistang eval:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Dalawang numero ang kapansin-pansin para sa builders:

  • DeepSWE v1.1 sa 65.3% — 16-point jump sa 3.6 Flash; agentic coding ang primary training target.
  • GDM-MRCR v2 sa 97.0% — halos perpektong long-context retrieval sa 2.5M-token window, kritikal para sa document-heavy workflows.

Para sa konteksto ng nakaraang henerasyon, tingnan ang aming Gemini 3.6 Flash vs 3.5 Flash comparison.

Presyo at 50% introductory discount

May aggressive launch promotion ang Google:

Intro price (hanggang Dis 31, 2026)Standard price (simula Ene 1, 2027)
Input$0.75 / 1M tokens$1.50 / 1M tokens
Output$3.75 / 1M tokens$7.50 / 1M tokens
Context caching$0.075 / 1M tokens$0.075 / 1M tokens

50% discount sa input at output para sa natitirang bahagi ng 2026. Ang context caching — kapaki-pakinabang kapag inuulit ang malalaking system prompts o document corpora — ay nananatiling $0.075 bawat milyong tokens anuman ang promo.

Kasama ang mas kaunting tool-call round trips sa mas mataas na thinking budgets, maaaring bumaba nang husto ang effective cost bawat natapos na agent task kaysa sa per-token sticker price. Ang aming API cost estimate guide ay naglalakad sa math para sa typical workloads.

Multimodal, web dev, at agent capabilities

Bukod sa benchmarks, may production-ready capabilities ang 3.7 Flash:

  • 2.5M-token context window — kumain ng buong codebases, contract bundles, o research corpora sa isang pass.
  • 245 output tokens/s — sapat na mabilis para i-stream ang UI code at mahahabang report nang hindi sinasakal ang UX.
  • 99.7% JSON tool execution precision — maaasahang structured outputs para sa agent tool chains.
  • Computer use — built-in client-side automation para sa browser at desktop workflows.
  • UI generation fidelity — mas mataas na layout accuracy sa WebDev Arena (1588 Elo) ay mas malinis na generated frontends.

Available ngayon sa Gemini API, Google AI Studio, Gemini Enterprise, at Google Antigravity.

Developer guide at migration

Kung nag-a-upgrade mula sa 3.6 Flash o 3.5 Flash-Lite, magsimula sa mga pattern na ito:

  1. Palitan ang model ID — swap gemini-3.6-flash sa gemini-3.7-flash; backward compatible ang API surface.
  2. Itakda ang thinking budgets bawat task type0 para sa user-facing chat, 1024 para sa RAG Q&A, 8192+ para sa coding agents, 32768 lang para sa overnight batch jobs kung saan hindi mahalaga ang latency.
  3. I-enable ang context caching — kung ang system prompt o document set ay lampas 32K tokens at inuulit sa mga request, 90% bawas ang input cost.
  4. I-tune ang tool schemas — ang 99.7% JSON precision ay gumagantimpala sa strict schemas; maluwag na definitions ay nabibigo pa rin sa application layer.
  5. I-monitor ang thinking token usage — i-log ang usage_metadata para malaman kung aling agent steps ang talagang kailangan ng deep reasoning.

Para sa agentic workflow patterns, tingnan ang aming 3.5 Flash-Lite agentic workflows guide — natural na umaabot ang thinking budget concept sa 3.7 Flash na may mas pinong granularity.

Konklusyon

Ang Gemini 3.7 Flash ang unang Flash-tier model kung saan hindi magkasalungat ang bilis at lalim. Pinapayagan ng controllable thinking_budget na ang isang model ay maglingkod sa latency-critical chat at deep agentic coding, at ginagawang mura ng launch pricing ang experimentation hanggang katapusan ng 2026.

Kaugnay