Google Meluncurkan Gemini 3.7 Flash: Penalaran Hibrida untuk Coding, Agen, dan Pekerjaan Pengetahuan
Gemini 3.7 Flash hadir 13 Agustus 2026 dengan penalaran hibrida native, thinking budget yang dapat dikontrol, benchmark coding frontier, dan diskon perkenalan 50% hingga Desember.
Flagship baru untuk penalaran hibrida
Pada 13 Agustus 2026, Google merilis Gemini 3.7 Flash — model penalaran hibrida andalan yang dibangun untuk coding, agen, dan pekerjaan pengetahuan kompleks. Berbeda dengan generasi Flash sebelumnya yang menukar kedalaman demi kecepatan, 3.7 Flash membawa penalaran native yang dapat dikontrol langsung ke API: Anda menyesuaikan kedalaman berpikir per permintaan tanpa beralih ke «model penalaran» terpisah.
Peluncuran ini menarget tiga audiens sekaligus: pengembang yang men-deploy agen produksi, tim yang menjalankan tugas coding jangka panjang, dan perusahaan yang membutuhkan analisis multimodal andal atas set dokumen masif. Google memosisikan 3.7 Flash sebagai model di mana satu endpoint akhirnya melayani balasan chat di bawah 100 ms sekaligus riset mendalam berdurasi beberapa menit.
Penalaran hibrida native dan thinking budget
Intinya adalah thinking_config.thinking_budget — bilangan bulat yang mengontrol berapa token penalaran internal yang boleh dikonsumsi model sebelum menjawab.
thinking_budget | Perilaku | Terbaik untuk |
|---|---|---|
| 0 | Mode cepat latensi ultra rendah (token pertama di bawah 85 ms) | Chat langsung, autocomplete, routing QPS tinggi |
| 256–1024 | Perencanaan multi-langkah ringan | Routing tool, refactor sederhana, sintesis RAG |
| 4096–16384 | Penalaran multi-langkah mendalam | Loop agen, debugging kompleks, laporan riset |
| 32768–65536 | Kedalaman maksimum | Coding jangka panjang, perubahan arsitektur multi-file |
Atur di Gemini API seperti ini:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactor komponen React ini agar memakai hooks dan tambahkan error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = mode cepat; hingga 65536 untuk penalaran mendalam
)
),
)
print(response.text)
Karena penalaran native bukan add-on, latensi skala mulus: thinking_budget 0 berperilaku seperti Flash klasik, nilai lebih tinggi membuka kualitas chain-of-thought tanpa ganti ID model. Penagihan memisahkan token output terlihat dari token berpikir internal — Anda hanya membayar kedalaman yang diminta.
Sorotan benchmark
Google menerbitkan angka head-to-head melawan Gemini 3.6 Flash, Claude Sonnet 5, dan GPT-5.6 Terra. 3.7 Flash memimpin di semua evaluasi yang tercantum:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Dua angka menonjol bagi builder:
- DeepSWE v1.1 di 65.3% — loncatan 16 poin atas 3.6 Flash; coding agenik adalah target pelatihan utama.
- GDM-MRCR v2 di 97.0% — retrieval konteks panjang hampir sempurna di jendela 2,5M token, kritis untuk alur kerja dokumen.
Konteks generasi sebelumnya: perbandingan Gemini 3.6 Flash vs 3.5 Flash.
Harga dan diskon perkenalan 50%
Google menjalankan promosi peluncuran agresif:
| Harga intro (hingga 31 Des 2026) | Harga standar (dari 1 Jan 2027) | |
|---|---|---|
| Input | $0,75 / 1M token | $1,50 / 1M token |
| Output | $3,75 / 1M token | $7,50 / 1M token |
| Context caching | $0,075 / 1M token | $0,075 / 1M token |
Itu diskon 50% untuk input dan output sepanjang sisa 2026. Context caching — berguna saat Anda memakai ulang prompt sistem atau korpus dokumen besar — tetap $0,075 per juta token terlepas dari promo.
Dikombinasikan dengan lebih sedikit round-trip panggilan tool pada thinking budget lebih tinggi, biaya efektif per tugas agen selesai bisa jauh di bawah harga per token. Panduan estimasi biaya API kami menghitung beban kerja tipikal.
Kemampuan multimodal, web dev, dan agen
Di luar benchmark, 3.7 Flash membawa fitur siap produksi:
- Jendela konteks 2,5M token — telan codebase utuh, bundel kontrak, atau korpus riset sekaligus.
- 245 token output/detik — cukup cepat untuk streaming kode UI dan laporan panjang tanpa mengganggu UX.
- Presisi eksekusi tool JSON 99,7% — output terstruktur andal untuk rantai tool agen.
- Computer use — otomasi client-side bawaan untuk alur browser dan desktop.
- Fidelitas generasi UI — akurasi layout lebih tinggi di WebDev Arena (1588 Elo) berarti frontend hasil generate lebih rapi.
Tersedia hari ini via Gemini API, Google AI Studio, Gemini Enterprise, dan Google Antigravity.
Panduan developer dan migrasi
Jika upgrade dari 3.6 Flash atau 3.5 Flash-Lite, mulai dengan pola ini:
- Ganti ID model — tukar
gemini-3.6-flashkegemini-3.7-flash; permukaan API backward compatible. - Atur thinking budget per jenis tugas —
0untuk chat pengguna,1024untuk RAG Q&A,8192+untuk agen coding,32768hanya untuk job batch malam tanpa syarat latensi. - Aktifkan context caching — jika prompt sistem atau set dokumen melebihi 32K token dan berulang antar permintaan, caching memotong biaya input 90%.
- Tune schema tool — presisi JSON 99,7% menghargai schema ketat; definisi longgar tetap gagal di lapisan aplikasi.
- Pantau penggunaan token berpikir — log
usage_metadatauntuk memahami langkah agen mana yang benar-benar butuh penalaran mendalam.
Untuk pola alur kerja agenik, lihat panduan alur kerja agenik 3.5 Flash-Lite — konsep thinking budget secara alami meluas ke 3.7 Flash dengan granularitas lebih halus.
Kesimpulan
Gemini 3.7 Flash adalah model tingkat Flash pertama di mana kecepatan dan kedalaman tidak saling mengecualikan. thinking_budget yang dapat dikontrol memungkinkan satu model melayani chat sensitif latensi sekaligus coding agenik mendalam, dan harga peluncuran membuat eksperimen murah hingga akhir 2026.