Panduan Gemini 3.5 Flash-Lite: Menskalakan Aliran Kerja Agentik pada 350 Token/saat (2026)
Gemini 3.5 Flash-Lite berjalan 350 token/saat dengan input $0.30/1M. Penanda aras vs 3.1 Flash-Lite dan Gemini 3 Flash, tahap pemikiran, kiraan kos dan jadual keputusan.
Peringkat volum kini serius
Gemini 3.5 Flash-Lite, diumumkan pada 21 Julai 2026, ialah model kelas 3.5 terpantas dan paling menjimatkan daripada Google: 350 token output sesaat (Artificial Analysis), berharga $0.30 setiap 1M token input dan $2.50 setiap 1M token output. Dari segi sejarah, peringkat “Lite” ialah tempat kualiti dikorbankan — bagus untuk pengelasan dan kerja templat, berisiko untuk apa-apa yang agentik. Keluaran ini memecahkan corak itu: pada beberapa penilaian agentik dan pengekodan, 3.5 Flash-Lite menewaskan Gemini 3 Flash yang lebih besar secara langsung.
Panduan ini merangkumi kedudukan Flash-Lite dalam barisan model, cara mengkonfigurasi tahap pemikirannya, kos sebenar pada skala besar, dan model mana untuk beban kerja mana. Konteks pelancaran ada dalam ringkasan pengumuman kami.
Lonjakan generasi: vs 3.1 Flash-Lite
Lonjakan daripada generasi Lite sebelumnya ialah yang terbesar dalam sejarah keluarga ini:
| Penanda aras | Apa yang diukur | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Tugas terminal pengekodan & agentik | 54% | 31% |
| GDM-MRCR v2 | Dapatan semula konteks panjang | 72.2% | 60.1% |
| GDPval-AA v2 | Pelaksanaan tugas dunia sebenar | 1140 | 642 |

Angka GDPval-AA v2 yang hampir berganda (642 → 1140) ialah yang perlu dihayati: pelaksanaan tugas dunia sebenar ialah tepat tempat model Lite lama tumbang dalam ejen produksi.
Kejutan: menewaskan Gemini 3 Flash
Lebih mengejutkan daripada peningkatan generasi ialah kemenangan merentas peringkat. Pada beberapa penilaian agentik dan pengekodan, 3.5 Flash-Lite mengatasi Gemini 3 Flash — model yang lebih besar dan lebih mahal:
| Penanda aras | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
Jika hari ini anda menjalankan beban kerja pada 2.5 Flash atau 3 Flash kerana peringkat Lite tidak boleh dipercayai dengan kerja agentik, andaian itu kini lapuk — Flash-Lite lebih pantas dan lebih berkebolehan pada tugas-tugas ini.
Tahap pemikiran: satu model, dua mod operasi
Flash-Lite hadir dengan tahap pemikiran boleh dikonfigurasi, yang secara berkesan menjadikannya dua produk:
- Pemikiran minimal / rendah — utamakan kependaman dan kos untuk tugas bervolum tinggi: carian agentik, pemprosesan dokumen, pengekstrakan, pengelasan, penghalaan. Inilah mod 350 token/saat.
- Tahap pemikiran lebih tinggi — aktifkan penaakulan lebih mendalam untuk beban kerja subejen berbilang langkah, di mana Flash-Lite bertindak sebagai pekerja di bawah model orkestrator.
Mod kedua itu sepadan dengan corak demo Google sendiri: 3.6 Flash sebagai ejen induk, armada subejen 3.5 Flash-Lite melakukan kerja selari (satu demo menjana 25 konsep reka bentuk web serentak). Penggunaan komputer juga merupakan alat terbina dalam pada Flash-Lite, jadi subejen boleh mengendalikan UI tanpa perancah tambahan. Lihat demo kelajuan Flash-Lite vs 3.5 Flash daripada Google (video) untuk perbezaan kependaman pada tugas bervolum tinggi.
Analisis kos: berapa sebenarnya kos pada skala besar
Harga: $0.30/1M input, $2.50/1M output. Berikut contoh beban kerja — ejen pemprosesan dokumen yang mengendalikan 1 juta dokumen sebulan, dengan purata 3K token input dan 500 token output setiap dokumen:
| Komponen kos | Pengiraan | Kos bulanan |
|---|---|---|
| Token input | 1M dok × 3K token = 3B token × $0.30/1M | $900 |
| Token output | 1M dok × 500 token = 0.5B token × $2.50/1M | $1,250 |
| Jumlah pada 3.5 Flash-Lite | $2,150 | |
| Beban kerja sama pada 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Kira-kira perbezaan kos 4× untuk beban kerja yang Lite kendalikan dengan baik — dan pada 350 token/saat, ringkasan 500 token setiap dokumen mengalir keluar dalam masa kurang 1.5 saat. Strategi yang menyusul: halakan 90% volum yang rutin ke Flash-Lite, eskalasikan 10% yang sukar ke 3.6 Flash.
Jadual keputusan: model mana untuk beban kerja mana
| Beban kerja | Pilihan | Sebab |
|---|---|---|
| Carian agentik / RAG pada QPS tinggi | 3.5 Flash-Lite (pemikiran minimal) | 350 token/saat, kos terendah setiap pertanyaan |
| Pemprosesan / pengekstrakan dokumen pukal | 3.5 Flash-Lite | 4× lebih murah daripada 3.6 Flash; konteks panjang GDM-MRCR v2 72.2% |
| Pengelasan, penghalaan, penyederhanaan | 3.5 Flash-Lite (pemikiran minimal) | Kritikal kependaman, ruang kualiti berlebihan |
| Armada subejen selari di bawah orkestrator | 3.5 Flash-Lite (pemikiran lebih tinggi) | Mod yang dibina khas; penggunaan komputer terbina dalam |
| Pengekodan agentik kompleks (ejen SWE) | 3.6 Flash | DeepSWE 49%; ketepatan lebih tinggi, kurang suntingan buruk |
| Aliran kerja penyelidikan ML | 3.6 Flash | MLE Bench 63.9% vs 49.7% untuk 3.5 Flash |
| Ejen penggunaan komputer pada tugas sukar | 3.6 Flash | OSWorld-Verified 83.0% (vs 74.0% Lite) |
| Analisis dokumen multimodal & penggubalan laporan | 3.6 Flash | Disahkan oleh Harvey / Hebbia semasa pelancaran |
| Saluran paip lama masih pada 3.5 Flash | Berhijrah naik atau turun | 3.6 Flash untuk kualiti, Flash-Lite untuk volum — lihat panduan penghijrahan |
| Pengesanan & penampalan kerentanan keselamatan | 3.5 Flash Cyber | Hanya melalui perintis CodeMender (kerajaan & rakan kongsi dipercayai) |
Peraturan praktikal: jadikan Flash-Lite lalai dan eskalasikan apabila gagal, bukannya bermula dengan model besar dan mengoptimumkan kemudian. Mod kegagalan kelihatan (output buruk); pembaziran peruntukan berlebihan pula senyap.
Di mana ia tersedia
3.5 Flash-Lite sudah aktif hari ini dalam Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform dan apl Gemini — dan ia sedang dilancarkan dalam Google Search, yang banyak menceritakan keyakinan Google terhadap profil kosnya pada skala planet. Pelanggan awal termasuk Ashler, Palo Alto Networks dan Ramp.
Nota sisi: 3.5 Flash Cyber dan CodeMender
Pelancaran yang sama memperkenalkan Gemini 3.5 Flash Cyber — 3.5 Flash yang ditala halus untuk mencari dan membaiki kerentanan keselamatan. Dalam CodeMender, beberapa ejen Flash Cyber bekerja selari dan menggabungkan penemuan mereka ke dalam satu laporan gabungan, mencapai prestasi yang bersaing dengan model frontier pada CyberGym. Perhatikan seni binanya: ia corak “armada pakar cekap” yang sama seperti diterangkan panduan ini, diterapkan pada keselamatan.
Aksesnya sengaja disempitkan: perintis akses terhad eksklusif untuk kerajaan dan rakan kongsi dipercayai melalui CodeMender, mencerminkan risiko dwiguna penemuan kerentanan automatik. Butiran dalam ringkasan pengumuman kami.
Kesimpulannya
3.5 Flash-Lite melukis semula sempadan harga-prestasi untuk beban kerja agentik: lebih pantas daripada apa-apa dalam siri 3.5, kira-kira 4× lebih murah daripada 3.6 Flash, dan — buat kali pertama dalam model Lite — benar-benar boleh dipercayai pada penanda aras agentik. Bina penghalaan anda supaya Flash-Lite menjadi lalai dan 3.6 Flash menjadi laluan eskalasi, dan lengkung kos anda akan berterima kasih.