Gemini Omni
Kembali ke semua artikel
10 mnt baca

Panduan Gemini 3.5 Flash-Lite: Menskalakan Alur Kerja Agentik di 350 Token/detik (2026)

Gemini 3.5 Flash-Lite berjalan 350 token/detik dengan input $0.30/1M. Benchmark vs 3.1 Flash-Lite dan Gemini 3 Flash, tingkat berpikir, kalkulasi biaya, tabel keputusan.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Bahasa Indonesia

Tingkatan volume kini jadi serius

Gemini 3.5 Flash-Lite, diumumkan 21 Juli 2026, adalah model kelas 3.5 tercepat dan paling hemat biaya dari Google: 350 token output per detik (Artificial Analysis), dengan harga $0.30 per 1M token input dan $2.50 per 1M token output. Secara historis, tingkatan “Lite” adalah tempat kualitas dikorbankan — bagus untuk klasifikasi dan pekerjaan templat, berisiko untuk apa pun yang agentik. Rilis ini mematahkan pola tersebut: di beberapa evaluasi agentik dan coding, 3.5 Flash-Lite mengalahkan Gemini 3 Flash yang lebih besar secara langsung.

Panduan ini membahas posisi Flash-Lite dalam jajaran model, cara mengonfigurasi tingkat berpikirnya, berapa biaya sebenarnya pada skala besar, dan model mana untuk beban kerja mana. Konteks peluncurannya ada di ringkasan pengumuman kami.

Lompatan generasi: vs 3.1 Flash-Lite

Lompatan dari generasi Lite sebelumnya adalah yang terbesar dalam sejarah keluarga ini:

BenchmarkYang diukurGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Tugas terminal coding & agentik54%31%
GDM-MRCR v2Pengambilan konteks panjang72,2%60,1%
GDPval-AA v2Eksekusi tugas dunia nyata1140642

Perbandingan benchmark Gemini 3.5 Flash-Lite terhadap generasi Flash-Lite sebelumnya

Angka GDPval-AA v2 yang nyaris berlipat ganda (642 → 1140) adalah yang perlu diresapi: eksekusi tugas dunia nyata adalah persis titik di mana model Lite lama berantakan dalam agen produksi.

Kejutan: mengalahkan Gemini 3 Flash

Yang lebih mengejutkan daripada kenaikan generasional adalah kemenangan lintas tingkatan. Di beberapa evaluasi agentik dan coding, 3.5 Flash-Lite mengungguli Gemini 3 Flash — model yang lebih besar dan lebih mahal:

BenchmarkGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54,2%49,6%
OSWorld-Verified74,0%65,1%

Jika hari ini Anda menjalankan beban kerja di 2.5 Flash atau 3 Flash karena tingkatan Lite tak bisa dipercaya untuk pekerjaan agentik, asumsi itu kini usang — Flash-Lite lebih cepat sekaligus lebih mampu pada tugas-tugas ini.

Tingkat berpikir: satu model, dua mode operasi

Flash-Lite hadir dengan tingkat berpikir yang dapat dikonfigurasi, yang efektif menjadikannya dua produk:

  • Berpikir minimal / rendah — prioritaskan latensi dan biaya untuk tugas bervolume tinggi: pencarian agentik, pemrosesan dokumen, ekstraksi, klasifikasi, routing. Inilah mode 350 token/detik.
  • Tingkat berpikir lebih tinggi — aktifkan penalaran lebih dalam untuk beban kerja subagen multi-langkah, di mana Flash-Lite bertindak sebagai pekerja di bawah model orkestrator.

Mode kedua itu cocok dengan pola demo Google sendiri: 3.6 Flash sebagai agen utama, armada subagen 3.5 Flash-Lite mengerjakan tugas paralel (satu demo menghasilkan 25 konsep desain web sekaligus). Penggunaan komputer juga merupakan alat bawaan di Flash-Lite, sehingga subagen bisa mengoperasikan UI tanpa perancah tambahan. Lihat demo kecepatan Flash-Lite vs 3.5 Flash dari Google (video) untuk perbedaan latensi pada tugas bervolume tinggi.

Analisis biaya: berapa harga skala sesungguhnya

Harga: $0.30/1M input, $2.50/1M output. Berikut contoh beban kerja — agen pemrosesan dokumen yang menangani 1 juta dokumen per bulan, rata-rata 3 ribu token input dan 500 token output per dokumen:

Komponen biayaKalkulasiBiaya bulanan
Token input1M dok × 3K token = 3B token × $0.30/1M$900
Token output1M dok × 500 token = 0.5B token × $2.50/1M$1,250
Total di 3.5 Flash-Lite$2,150
Beban kerja sama di 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Kira-kira selisih biaya 4× untuk beban kerja yang ditangani Lite dengan baik — dan pada 350 token/detik, ringkasan 500 token tiap dokumen mengalir keluar dalam waktu kurang dari 1,5 detik. Strategi yang mengikutinya: arahkan 90% volume yang rutin ke Flash-Lite, eskalasikan 10% yang sulit ke 3.6 Flash.

Tabel keputusan: model mana untuk beban kerja mana

Beban kerjaPilihanAlasan
Pencarian agentik / RAG dengan QPS tinggi3.5 Flash-Lite (berpikir minimal)350 token/detik, biaya per kueri terendah
Pemrosesan / ekstraksi dokumen massal3.5 Flash-Lite4× lebih murah dari 3.6 Flash; konteks panjang GDM-MRCR v2 72,2%
Klasifikasi, routing, moderasi3.5 Flash-Lite (berpikir minimal)Kritis latensi, ruang kualitas berlimpah
Armada subagen paralel di bawah orkestrator3.5 Flash-Lite (berpikir lebih tinggi)Mode yang memang dirancang untuk ini; penggunaan komputer bawaan
Coding agentik kompleks (agen SWE)3.6 FlashDeepSWE 49%; presisi lebih tinggi, lebih sedikit editan buruk
Alur kerja riset ML3.6 FlashMLE Bench 63,9% vs 49,7% untuk 3.5 Flash
Agen penggunaan komputer pada tugas berat3.6 FlashOSWorld-Verified 83,0% (vs 74,0% Lite)
Analisis dokumen multimodal & penyusunan laporan3.6 FlashDivalidasi oleh Harvey / Hebbia saat peluncuran
Pipeline lama yang masih di 3.5 FlashMigrasi naik atau turun3.6 Flash untuk kualitas, Flash-Lite untuk volume — lihat panduan migrasi
Deteksi & penambalan kerentanan keamanan3.5 Flash CyberHanya via pilot CodeMender (pemerintah & mitra tepercaya)

Aturan praktisnya: jadikan Flash-Lite default dan eskalasikan saat gagal, alih-alih default ke model besar lalu optimasi belakangan. Mode kegagalannya terlihat (output buruk); pemborosan over-provisioning berjalan diam-diam.

Di mana tersedia

3.5 Flash-Lite sudah aktif hari ini di Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform, dan aplikasi Gemini — dan sedang diluncurkan di dalam Google Search, yang banyak bercerita tentang keyakinan Google pada profil biayanya di skala planet. Pelanggan awal termasuk Ashler, Palo Alto Networks, dan Ramp.

Catatan samping: 3.5 Flash Cyber dan CodeMender

Peluncuran yang sama memperkenalkan Gemini 3.5 Flash Cyber — 3.5 Flash yang di-fine-tune untuk menemukan dan memperbaiki kerentanan keamanan. Di dalam CodeMender, beberapa agen Flash Cyber bekerja paralel dan menggabungkan temuan mereka ke dalam satu laporan gabungan, mencapai performa yang bersaing dengan model frontier di CyberGym. Perhatikan arsitekturnya: ini pola “armada spesialis efisien” yang sama seperti dijelaskan panduan ini, diterapkan pada keamanan.

Aksesnya sengaja dibuat sempit: pilot akses terbatas eksklusif untuk pemerintah dan mitra tepercaya via CodeMender, mencerminkan risiko dwiguna dari penemuan kerentanan otomatis. Detailnya di ringkasan pengumuman kami.

Intinya

3.5 Flash-Lite menggambar ulang batas harga-performa untuk beban kerja agentik: lebih cepat dari apa pun di seri 3.5, kira-kira 4× lebih murah dari 3.6 Flash, dan — untuk pertama kalinya pada model Lite — benar-benar layak dipercaya di benchmark agentik. Bangun routing Anda sehingga Flash-Lite jadi default dan 3.6 Flash jadi jalur eskalasi, dan kurva biaya Anda akan berterima kasih.

Terkait