Gemini Omni
Kembali ke semua artikel
9 mnt baca

Gemini 3.6 Flash vs 3.5 Flash: Benchmark, Harga, dan Kapan Harus Migrasi (2026)

Gemini 3.6 Flash mengalahkan 3.5 Flash di semua benchmark sambil memangkas token output 17% dan harganya. Tabel perbandingan lengkap plus panduan migrasi developer.

Gemini 3.6 FlashGemini 3.5 FlashComparisonBenchmarksMigration2026Bahasa Indonesia

Upgrade “unggul mutlak” yang langka

Kebanyakan upgrade model harus menukar sesuatu — kualitas demi kecepatan, harga demi kemampuan. Gemini 3.6 Flash vs Gemini 3.5 Flash adalah kasus tak biasa di mana model yang lebih baru menang di semua sumbu yang dipublikasikan Google pada 21 Juli 2026: skor benchmark lebih tinggi, token output lebih sedikit, langkah penalaran dan pemanggilan alat lebih sedikit, sekaligus harga per token lebih murah. Ulasan mendalam ini menelusuri angka-angkanya, lalu masuk ke sisi praktis: siapa yang harus migrasi, kapan, dan apa yang perlu diuji ulang.

Jika ingin konteks lengkap peluncuran tiga model terlebih dahulu, mulailah dari ringkasan pengumuman kami.

Efisiensi token: berita utama yang tak boleh dilewatkan

Angka paling berpengaruh dalam rilis ini bukanlah skor benchmark. Pada Artificial Analysis Index, 3.6 Flash mengonsumsi 17% lebih sedikit token output dibanding 3.5 Flash untuk pekerjaan setara. Pada DeepSWE dari Datacurve, Google mengamati penurunan hingga 65%.

Gemini 3.6 Flash menunjukkan efisiensi token lebih baik dan verbositas lebih rendah dibanding 3.5 Flash pada tugas OSWorld-Verified

Mengapa ini lebih penting dari kedengarannya:

  • Token output adalah yang mahal ($7.50/1M vs $1.50/1M untuk input). Memangkasnya 17–65% menyerang komponen biaya yang dominan.
  • Lebih sedikit token = latensi lebih rendah. Agen yang bicara lebih ringkas selesai lebih cepat, dan rantai multi-langkah melipatgandakan efeknya.
  • Lebih sedikit langkah penalaran dan pemanggilan alat berarti lebih sedikit bolak-balik, lebih sedikit titik kegagalan, dan lebih ringan beban orkestrasi per tugas.

Google mempublikasikan demo berdampingan untuk ini pada tugas penggunaan komputer — lihat video perbandingan efisiensi token.

Perbandingan benchmark lengkap

BenchmarkYang diukurGemini 3.6 FlashGemini 3.5 FlashDelta
DeepSWERekayasa perangkat lunak agentik49%37%+12 poin
MLE BenchRiset & rekayasa ML63,9%49,7%+14,2 poin
OSWorld-VerifiedPenggunaan komputer83,0%78,4%+4,6 poin
GDPval-AA v2Pekerjaan pengetahuan dunia nyata14211349+72

Peningkatan kualitas Gemini 3.6 Flash atas 3.5 Flash di coding, riset ML, penggunaan komputer dan pekerjaan pengetahuan

Tiga cara membaca tabel di atas:

  • Lonjakan DeepSWE (37% → 49%) adalah yang paling relevan bagi tim coding: Google mengaitkannya dengan presisi lebih tinggi — lebih sedikit editan kode yang tidak diinginkan dan berkurangnya loop eksekusi, bukan sekadar kemampuan mentah yang lebih besar.
  • MLE Bench (+14,2 poin) adalah kenaikan terbesar, menandakan lompatan nyata dalam alur kerja riset ML — perancah eksperimen, analisis data, debugging loop pelatihan.
  • OSWorld-Verified di 83,0% penting karena penggunaan komputer kini menjadi alat sisi klien bawaan di Gemini API dan Gemini Enterprise. Lompatan kemampuan dan perubahan kemasannya datang bersamaan.

Harga: lebih murah per token, lebih murah per tugas

Gemini 3.6 FlashGemini 3.5 Flash
Harga input$1.50 / 1M tokenLebih tinggi
Harga output$7.50 / 1M tokenLebih tinggi
Token output per tugas~17% lebih sedikit (hingga 65% di DeepSWE)Baseline
Biaya efektif per tugas agentikJauh lebih rendahBaseline

Poinnya ada di efek berganda. Tugas yang dulu menghasilkan 100 ribu token output kini menghasilkan ~83 ribu, dan setiap token itu lebih murah. Untuk beban kerja yang menjalankan jutaan tugas agentik per bulan, penghematannya langsung tampak di tagihan tanpa menyentuh prompt Anda.

Penggunaan komputer: dari add-on menjadi bawaan

Dengan 3.6 Flash, penggunaan komputer hadir sebagai alat sisi klien bawaan melalui Gemini API dan Gemini Enterprise. Digabung dengan peningkatan OSWorld-Verified (78,4% → 83,0%), tim yang membangun agen browser, otomatisasi ala RPA, atau bot QA mendapat model yang lebih kuat sekaligus kode integrasi yang lebih sedikit. Jika sebelumnya Anda memelihara perancah penggunaan komputer kustom di sekitar 3.5 Flash, bersiaplah menghapus sebagiannya.

Postur keamanan

3.6 Flash hadir dengan pengaman Frontier Safety yang ditingkatkan di domain CBRN dan serangan siber, dan Google melaporkan model ini jauh lebih tahan jailbreak dibanding 3.5 Flash. Yang sama relevannya bagi tim produk: ia juga dilatih untuk mengurangi penolakan atas permintaan yang sah. Jika 3.5 Flash kadang menolak prompt yang berhubungan dengan keamanan atau medis yang sebenarnya sah di produk Anda, uji ulang alur tersebut — tingkat penolakan keliru semestinya turun.

Kata pelanggan awal

Daftar peluncuran Google — Figma, Harvey, Hebbia, JetBrains — layak diurai:

  • Figma dan JetBrains adalah perusahaan tooling dengan inferensi bervolume tinggi yang sensitif latensi: sebuah dukungan bagi cerita kecepatan/efisiensi.
  • Harvey (hukum) dan Hebbia (keuangan) secara khusus memuji pekerjaan dokumen multimodal: parsing, analisis grafik dan data, serta penyusunan laporan. Jika beban kerja Anda adalah pekerjaan pengetahuan yang padat dokumen, kenaikan GDPval-AA v2 (1349 → 1421) adalah proksi yang relevan bagi Anda.

Panduan migrasi: kapan harus pindah

Situasi AndaRekomendasi
Coding agentik (agen SWE, bot review kode)Migrasi sekarang — kemenangan kualitas + efisiensi token terbesar (DeepSWE +12 poin, hingga 65% lebih sedikit token)
Penggunaan komputer / otomatisasi browserMigrasi sekarang — skor lebih baik dan tooling bawaan menggantikan perancah kustom
Parsing dokumen / analisis / penyusunan laporanMigrasi sekarang — tervalidasi oleh kasus penggunaan Harvey & Hebbia
Tugas sederhana bervolume tinggi, kritis latensiPertimbangkan 3.5 Flash-Lite saja — lihat panduan Flash-Lite kami
Prompt yang di-tuning ketat dengan parsing format output kakuMigrasi hati-hati — efisiensi token mengubah verbositas; validasi ulang parser dan contoh few-shot
Sistem produksi yang dibekukan karena kepatuhanJadwalkan — tak ada deprekasi paksa yang diumumkan, tetapi harga + efisiensi membuat bertahan jadi mahal

Daftar periksa praktis sebelum mengganti string model:

  1. Jalankan ulang suite evaluasi Anda — gaya output lebih ketat dan pendek; asersi soal panjang atau susunan kalimat respons bisa gagal.
  2. Periksa ulang parsing output terstruktur — verbositas yang berkurang biasanya kabar baik bagi keandalan JSON, tetapi verifikasilah.
  3. Uji ulang alur yang sensitif penolakan — harapkan lebih sedikit penolakan keliru, tetapi pastikan filter keamanan Anda tetap selaras.
  4. Ukur ulang biaya per tugas, bukan per token — pengurangan token 17–65% membuat perbandingan per token meremehkan penghematan sebenarnya.

Putusan

Gemini 3.6 Flash adalah penerus langka tanpa trade-off yang dipublikasikan: lebih baik di coding, riset ML, penggunaan komputer dan pekerjaan pengetahuan, sambil menghasilkan lebih sedikit token dengan harga lebih rendah. Kecuali stack Anda bergantung pada format output yang dibekukan, migrasi dari 3.5 Flash bukan lagi soal apakah, melainkan sprint yang mana.

Terkait