Google Lancarkan Gemini 3.7 Flash: Penaakulan Hibrid untuk Coding, Ejen dan Kerja Pengetahuan
Gemini 3.7 Flash tiba 13 Ogos 2026 dengan penaakulan hibrid native, thinking budget boleh kawal, benchmark coding frontier dan diskaun pengenalan 50% sehingga Disember.
Kapal perdana baharu untuk penaakulan hibrid
Pada 13 Ogos 2026, Google melancarkan Gemini 3.7 Flash — model penaakulan hibrid unggul untuk coding, ejen dan kerja pengetahuan kompleks. Berbeza generasi Flash terdahulu yang mengorbankan kedalaman demi kelajuan, 3.7 Flash membawa penaakulan native boleh kawal terus dalam API: anda laraskan kedalaman berfikir setiap permintaan tanpa beralih ke «model penaakulan» berasingan.
Pelancaran ini mensasarkan tiga audiens serentak: pembangun yang melaksanakan ejen produksi, pasukan menjalankan tugas coding jangka panjang, dan perusahaan yang memerlukan analisis multimodal boleh dipercayai ke atas set dokumen besar. Google meletakkan 3.7 Flash sebagai model di mana satu endpoint akhirnya melayani balasan sembang bawah 100 ms dan penyelidikan mendalam berminit-minit.
Penaakulan hibrid native dan thinking budget
Terasnya ialah thinking_config.thinking_budget — integer yang mengawal berapa token penaakulan dalaman model boleh guna sebelum menjawab.
thinking_budget | Kelakuan | Terbaik untuk |
|---|---|---|
| 0 | Mod pantas latensi ultra rendah (token pertama bawah 85 ms) | Sembang langsung, autolengkap, routing QPS tinggi |
| 256–1024 | Perancangan multi-langkah ringan | Routing alat, refactor mudah, sintesis RAG |
| 4096–16384 | Penaakulan multi-langkah mendalam | Gelung ejen, debug kompleks, laporan penyelidikan |
| 32768–65536 | Kedalaman maksimum | Coding jangka panjang, perubahan seni bina multi-fail |
Tetapkan dalam Gemini API seperti ini:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactor komponen React ini untuk guna hooks dan tambah error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = mod pantas; sehingga 65536 untuk penaakulan mendalam
)
),
)
print(response.text)
Memandangkan penaakulan native bukan tambahan, latensi menskala dengan lancar: thinking_budget 0 berkelakuan seperti Flash klasik, nilai lebih tinggi membuka kualiti chain-of-thought tanpa tukar ID model. Bil memisahkan token output kelihatan daripada token berfikir dalaman — anda bayar hanya kedalaman yang diminta.
Sorotan benchmark
Google menerbitkan angka head-to-head berbanding Gemini 3.6 Flash, Claude Sonnet 5 dan GPT-5.6 Terra. 3.7 Flash mendahului semua penilaian disenaraikan:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Dua angka menonjol untuk pembina:
- DeepSWE v1.1 pada 65.3% — lonjakan 16 mata atas 3.6 Flash; coding ejenik ialah sasaran latihan utama.
- GDM-MRCR v2 pada 97.0% — retrieval konteks panjang hampir sempurna dalam tetingkap 2.5M token, kritikal untuk aliran kerja dokumen.
Konteks generasi sebelum: perbandingan Gemini 3.6 Flash vs 3.5 Flash.
Harga dan diskaun pengenalan 50%
Google menjalankan promosi pelancaran agresif:
| Harga intro (hingga 31 Dis 2026) | Harga standard (dari 1 Jan 2027) | |
|---|---|---|
| Input | $0.75 / 1M token | $1.50 / 1M token |
| Output | $3.75 / 1M token | $7.50 / 1M token |
| Context caching | $0.075 / 1M token | $0.075 / 1M token |
Itu diskaun 50% input dan output sepanjang baki 2026. Context caching — berguna apabila anda guna semula prompt sistem atau korpus dokumen besar — kekal $0.075 setiap juta token tanpa mengira promo.
Digabung dengan kurang pusingan panggilan alat pada thinking budget lebih tinggi, kos efektif setiap tugas ejen siap boleh jauh di bawah harga token. Panduan anggaran kos API kami mengira beban kerja tipikal.
Keupayaan multimodal, web dev dan ejen
Selain benchmark, 3.7 Flash membawa ciri sedia produksi:
- Tetingkap konteks 2.5M token — telan codebase penuh, bundle kontrak atau korpus penyelidikan sekali gus.
- 245 token output/saat — cukup pantas untuk stream kod UI dan laporan panjang tanpa mengekang UX.
- Ketepatan pelaksanaan alat JSON 99.7% — output berstruktur boleh dipercayai untuk rantai alat ejen.
- Computer use — automasi client-side terbina untuk aliran kerja pelayar dan desktop.
- Kesetiaan penjanaan UI — ketepatan layout lebih tinggi di WebDev Arena (1588 Elo) bermaksud frontend dijana lebih kemas.
Tersedia hari ini melalui Gemini API, Google AI Studio, Gemini Enterprise dan Google Antigravity.
Panduan pembangun dan migrasi
Jika naik taraf dari 3.6 Flash atau 3.5 Flash-Lite, mulakan dengan corak ini:
- Ganti ID model — tukar
gemini-3.6-flashkegemini-3.7-flash; permukaan API backward compatible. - Tetapkan thinking budget mengikut jenis tugas —
0untuk sembang pengguna,1024untuk RAG Q&A,8192+untuk ejen coding,32768hanya untuk job batch malam tanpa keperluan latensi. - Dayakan context caching — jika prompt sistem atau set dokumen melebihi 32K token dan berulang antara permintaan, caching potong kos input 90%.
- Tala skema alat — ketepatan JSON 99.7% ganjaran skema ketat; definisi longgar masih gagal di lapisan aplikasi.
- Pantau penggunaan token berfikir — log
usage_metadatauntuk fahami langkah ejen yang benar-benar perlukan penaakulan mendalam.
Untuk corak aliran kerja ejenik, lihat panduan aliran kerja ejenik 3.5 Flash-Lite — konsep thinking budget meluas secara semula jadi ke 3.7 Flash dengan granulariti lebih halus.
Kesimpulan
Gemini 3.7 Flash ialah model peringkat Flash pertama di mana kelajuan dan kedalaman tidak saling mengecualikan. thinking_budget boleh kawal membolehkan satu model melayani sembang sensitif latensi dan coding ejenik mendalam, dan harga pelancaran menjadikan percubaan murah sehingga akhir 2026.