Gemini 3.6 Flash vs 3.5 Flash: Benchmark, Harga, dan Kapan Harus Migrasi (2026)
Gemini 3.6 Flash mengalahkan 3.5 Flash di semua benchmark sambil memangkas token output 17% dan harganya. Tabel perbandingan lengkap plus panduan migrasi developer.
Upgrade “unggul mutlak” yang langka
Kebanyakan upgrade model harus menukar sesuatu — kualitas demi kecepatan, harga demi kemampuan. Gemini 3.6 Flash vs Gemini 3.5 Flash adalah kasus tak biasa di mana model yang lebih baru menang di semua sumbu yang dipublikasikan Google pada 21 Juli 2026: skor benchmark lebih tinggi, token output lebih sedikit, langkah penalaran dan pemanggilan alat lebih sedikit, sekaligus harga per token lebih murah. Ulasan mendalam ini menelusuri angka-angkanya, lalu masuk ke sisi praktis: siapa yang harus migrasi, kapan, dan apa yang perlu diuji ulang.
Jika ingin konteks lengkap peluncuran tiga model terlebih dahulu, mulailah dari ringkasan pengumuman kami.
Efisiensi token: berita utama yang tak boleh dilewatkan
Angka paling berpengaruh dalam rilis ini bukanlah skor benchmark. Pada Artificial Analysis Index, 3.6 Flash mengonsumsi 17% lebih sedikit token output dibanding 3.5 Flash untuk pekerjaan setara. Pada DeepSWE dari Datacurve, Google mengamati penurunan hingga 65%.

Mengapa ini lebih penting dari kedengarannya:
- Token output adalah yang mahal ($7.50/1M vs $1.50/1M untuk input). Memangkasnya 17–65% menyerang komponen biaya yang dominan.
- Lebih sedikit token = latensi lebih rendah. Agen yang bicara lebih ringkas selesai lebih cepat, dan rantai multi-langkah melipatgandakan efeknya.
- Lebih sedikit langkah penalaran dan pemanggilan alat berarti lebih sedikit bolak-balik, lebih sedikit titik kegagalan, dan lebih ringan beban orkestrasi per tugas.
Google mempublikasikan demo berdampingan untuk ini pada tugas penggunaan komputer — lihat video perbandingan efisiensi token.
Perbandingan benchmark lengkap
| Benchmark | Yang diukur | Gemini 3.6 Flash | Gemini 3.5 Flash | Delta |
|---|---|---|---|---|
| DeepSWE | Rekayasa perangkat lunak agentik | 49% | 37% | +12 poin |
| MLE Bench | Riset & rekayasa ML | 63,9% | 49,7% | +14,2 poin |
| OSWorld-Verified | Penggunaan komputer | 83,0% | 78,4% | +4,6 poin |
| GDPval-AA v2 | Pekerjaan pengetahuan dunia nyata | 1421 | 1349 | +72 |

Tiga cara membaca tabel di atas:
- Lonjakan DeepSWE (37% → 49%) adalah yang paling relevan bagi tim coding: Google mengaitkannya dengan presisi lebih tinggi — lebih sedikit editan kode yang tidak diinginkan dan berkurangnya loop eksekusi, bukan sekadar kemampuan mentah yang lebih besar.
- MLE Bench (+14,2 poin) adalah kenaikan terbesar, menandakan lompatan nyata dalam alur kerja riset ML — perancah eksperimen, analisis data, debugging loop pelatihan.
- OSWorld-Verified di 83,0% penting karena penggunaan komputer kini menjadi alat sisi klien bawaan di Gemini API dan Gemini Enterprise. Lompatan kemampuan dan perubahan kemasannya datang bersamaan.
Harga: lebih murah per token, lebih murah per tugas
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Harga input | $1.50 / 1M token | Lebih tinggi |
| Harga output | $7.50 / 1M token | Lebih tinggi |
| Token output per tugas | ~17% lebih sedikit (hingga 65% di DeepSWE) | Baseline |
| Biaya efektif per tugas agentik | Jauh lebih rendah | Baseline |
Poinnya ada di efek berganda. Tugas yang dulu menghasilkan 100 ribu token output kini menghasilkan ~83 ribu, dan setiap token itu lebih murah. Untuk beban kerja yang menjalankan jutaan tugas agentik per bulan, penghematannya langsung tampak di tagihan tanpa menyentuh prompt Anda.
Penggunaan komputer: dari add-on menjadi bawaan
Dengan 3.6 Flash, penggunaan komputer hadir sebagai alat sisi klien bawaan melalui Gemini API dan Gemini Enterprise. Digabung dengan peningkatan OSWorld-Verified (78,4% → 83,0%), tim yang membangun agen browser, otomatisasi ala RPA, atau bot QA mendapat model yang lebih kuat sekaligus kode integrasi yang lebih sedikit. Jika sebelumnya Anda memelihara perancah penggunaan komputer kustom di sekitar 3.5 Flash, bersiaplah menghapus sebagiannya.
Postur keamanan
3.6 Flash hadir dengan pengaman Frontier Safety yang ditingkatkan di domain CBRN dan serangan siber, dan Google melaporkan model ini jauh lebih tahan jailbreak dibanding 3.5 Flash. Yang sama relevannya bagi tim produk: ia juga dilatih untuk mengurangi penolakan atas permintaan yang sah. Jika 3.5 Flash kadang menolak prompt yang berhubungan dengan keamanan atau medis yang sebenarnya sah di produk Anda, uji ulang alur tersebut — tingkat penolakan keliru semestinya turun.
Kata pelanggan awal
Daftar peluncuran Google — Figma, Harvey, Hebbia, JetBrains — layak diurai:
- Figma dan JetBrains adalah perusahaan tooling dengan inferensi bervolume tinggi yang sensitif latensi: sebuah dukungan bagi cerita kecepatan/efisiensi.
- Harvey (hukum) dan Hebbia (keuangan) secara khusus memuji pekerjaan dokumen multimodal: parsing, analisis grafik dan data, serta penyusunan laporan. Jika beban kerja Anda adalah pekerjaan pengetahuan yang padat dokumen, kenaikan GDPval-AA v2 (1349 → 1421) adalah proksi yang relevan bagi Anda.
Panduan migrasi: kapan harus pindah
| Situasi Anda | Rekomendasi |
|---|---|
| Coding agentik (agen SWE, bot review kode) | Migrasi sekarang — kemenangan kualitas + efisiensi token terbesar (DeepSWE +12 poin, hingga 65% lebih sedikit token) |
| Penggunaan komputer / otomatisasi browser | Migrasi sekarang — skor lebih baik dan tooling bawaan menggantikan perancah kustom |
| Parsing dokumen / analisis / penyusunan laporan | Migrasi sekarang — tervalidasi oleh kasus penggunaan Harvey & Hebbia |
| Tugas sederhana bervolume tinggi, kritis latensi | Pertimbangkan 3.5 Flash-Lite saja — lihat panduan Flash-Lite kami |
| Prompt yang di-tuning ketat dengan parsing format output kaku | Migrasi hati-hati — efisiensi token mengubah verbositas; validasi ulang parser dan contoh few-shot |
| Sistem produksi yang dibekukan karena kepatuhan | Jadwalkan — tak ada deprekasi paksa yang diumumkan, tetapi harga + efisiensi membuat bertahan jadi mahal |
Daftar periksa praktis sebelum mengganti string model:
- Jalankan ulang suite evaluasi Anda — gaya output lebih ketat dan pendek; asersi soal panjang atau susunan kalimat respons bisa gagal.
- Periksa ulang parsing output terstruktur — verbositas yang berkurang biasanya kabar baik bagi keandalan JSON, tetapi verifikasilah.
- Uji ulang alur yang sensitif penolakan — harapkan lebih sedikit penolakan keliru, tetapi pastikan filter keamanan Anda tetap selaras.
- Ukur ulang biaya per tugas, bukan per token — pengurangan token 17–65% membuat perbandingan per token meremehkan penghematan sebenarnya.
Putusan
Gemini 3.6 Flash adalah penerus langka tanpa trade-off yang dipublikasikan: lebih baik di coding, riset ML, penggunaan komputer dan pekerjaan pengetahuan, sambil menghasilkan lebih sedikit token dengan harga lebih rendah. Kecuali stack Anda bergantung pada format output yang dibekukan, migrasi dari 3.5 Flash bukan lagi soal apakah, melainkan sprint yang mana.