Gemini Omni
Kembali ke semua artikel
10 min baca

Panduan Gemini 3.5 Flash-Lite: Menskalakan Aliran Kerja Agentik pada 350 Token/saat (2026)

Gemini 3.5 Flash-Lite berjalan 350 token/saat dengan input $0.30/1M. Penanda aras vs 3.1 Flash-Lite dan Gemini 3 Flash, tahap pemikiran, kiraan kos dan jadual keputusan.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026Bahasa Melayu

Peringkat volum kini serius

Gemini 3.5 Flash-Lite, diumumkan pada 21 Julai 2026, ialah model kelas 3.5 terpantas dan paling menjimatkan daripada Google: 350 token output sesaat (Artificial Analysis), berharga $0.30 setiap 1M token input dan $2.50 setiap 1M token output. Dari segi sejarah, peringkat “Lite” ialah tempat kualiti dikorbankan — bagus untuk pengelasan dan kerja templat, berisiko untuk apa-apa yang agentik. Keluaran ini memecahkan corak itu: pada beberapa penilaian agentik dan pengekodan, 3.5 Flash-Lite menewaskan Gemini 3 Flash yang lebih besar secara langsung.

Panduan ini merangkumi kedudukan Flash-Lite dalam barisan model, cara mengkonfigurasi tahap pemikirannya, kos sebenar pada skala besar, dan model mana untuk beban kerja mana. Konteks pelancaran ada dalam ringkasan pengumuman kami.

Lonjakan generasi: vs 3.1 Flash-Lite

Lonjakan daripada generasi Lite sebelumnya ialah yang terbesar dalam sejarah keluarga ini:

Penanda arasApa yang diukurGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1Tugas terminal pengekodan & agentik54%31%
GDM-MRCR v2Dapatan semula konteks panjang72.2%60.1%
GDPval-AA v2Pelaksanaan tugas dunia sebenar1140642

Perbandingan penanda aras Gemini 3.5 Flash-Lite dengan generasi Flash-Lite terdahulu

Angka GDPval-AA v2 yang hampir berganda (642 → 1140) ialah yang perlu dihayati: pelaksanaan tugas dunia sebenar ialah tepat tempat model Lite lama tumbang dalam ejen produksi.

Kejutan: menewaskan Gemini 3 Flash

Lebih mengejutkan daripada peningkatan generasi ialah kemenangan merentas peringkat. Pada beberapa penilaian agentik dan pengekodan, 3.5 Flash-Lite mengatasi Gemini 3 Flash — model yang lebih besar dan lebih mahal:

Penanda arasGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

Jika hari ini anda menjalankan beban kerja pada 2.5 Flash atau 3 Flash kerana peringkat Lite tidak boleh dipercayai dengan kerja agentik, andaian itu kini lapuk — Flash-Lite lebih pantas dan lebih berkebolehan pada tugas-tugas ini.

Tahap pemikiran: satu model, dua mod operasi

Flash-Lite hadir dengan tahap pemikiran boleh dikonfigurasi, yang secara berkesan menjadikannya dua produk:

  • Pemikiran minimal / rendah — utamakan kependaman dan kos untuk tugas bervolum tinggi: carian agentik, pemprosesan dokumen, pengekstrakan, pengelasan, penghalaan. Inilah mod 350 token/saat.
  • Tahap pemikiran lebih tinggi — aktifkan penaakulan lebih mendalam untuk beban kerja subejen berbilang langkah, di mana Flash-Lite bertindak sebagai pekerja di bawah model orkestrator.

Mod kedua itu sepadan dengan corak demo Google sendiri: 3.6 Flash sebagai ejen induk, armada subejen 3.5 Flash-Lite melakukan kerja selari (satu demo menjana 25 konsep reka bentuk web serentak). Penggunaan komputer juga merupakan alat terbina dalam pada Flash-Lite, jadi subejen boleh mengendalikan UI tanpa perancah tambahan. Lihat demo kelajuan Flash-Lite vs 3.5 Flash daripada Google (video) untuk perbezaan kependaman pada tugas bervolum tinggi.

Analisis kos: berapa sebenarnya kos pada skala besar

Harga: $0.30/1M input, $2.50/1M output. Berikut contoh beban kerja — ejen pemprosesan dokumen yang mengendalikan 1 juta dokumen sebulan, dengan purata 3K token input dan 500 token output setiap dokumen:

Komponen kosPengiraanKos bulanan
Token input1M dok × 3K token = 3B token × $0.30/1M$900
Token output1M dok × 500 token = 0.5B token × $2.50/1M$1,250
Jumlah pada 3.5 Flash-Lite$2,150
Beban kerja sama pada 3.6 Flash ($1.50 / $7.50)$4,500 + $3,750$8,250

Kira-kira perbezaan kos 4× untuk beban kerja yang Lite kendalikan dengan baik — dan pada 350 token/saat, ringkasan 500 token setiap dokumen mengalir keluar dalam masa kurang 1.5 saat. Strategi yang menyusul: halakan 90% volum yang rutin ke Flash-Lite, eskalasikan 10% yang sukar ke 3.6 Flash.

Jadual keputusan: model mana untuk beban kerja mana

Beban kerjaPilihanSebab
Carian agentik / RAG pada QPS tinggi3.5 Flash-Lite (pemikiran minimal)350 token/saat, kos terendah setiap pertanyaan
Pemprosesan / pengekstrakan dokumen pukal3.5 Flash-Lite4× lebih murah daripada 3.6 Flash; konteks panjang GDM-MRCR v2 72.2%
Pengelasan, penghalaan, penyederhanaan3.5 Flash-Lite (pemikiran minimal)Kritikal kependaman, ruang kualiti berlebihan
Armada subejen selari di bawah orkestrator3.5 Flash-Lite (pemikiran lebih tinggi)Mod yang dibina khas; penggunaan komputer terbina dalam
Pengekodan agentik kompleks (ejen SWE)3.6 FlashDeepSWE 49%; ketepatan lebih tinggi, kurang suntingan buruk
Aliran kerja penyelidikan ML3.6 FlashMLE Bench 63.9% vs 49.7% untuk 3.5 Flash
Ejen penggunaan komputer pada tugas sukar3.6 FlashOSWorld-Verified 83.0% (vs 74.0% Lite)
Analisis dokumen multimodal & penggubalan laporan3.6 FlashDisahkan oleh Harvey / Hebbia semasa pelancaran
Saluran paip lama masih pada 3.5 FlashBerhijrah naik atau turun3.6 Flash untuk kualiti, Flash-Lite untuk volum — lihat panduan penghijrahan
Pengesanan & penampalan kerentanan keselamatan3.5 Flash CyberHanya melalui perintis CodeMender (kerajaan & rakan kongsi dipercayai)

Peraturan praktikal: jadikan Flash-Lite lalai dan eskalasikan apabila gagal, bukannya bermula dengan model besar dan mengoptimumkan kemudian. Mod kegagalan kelihatan (output buruk); pembaziran peruntukan berlebihan pula senyap.

Di mana ia tersedia

3.5 Flash-Lite sudah aktif hari ini dalam Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform dan apl Gemini — dan ia sedang dilancarkan dalam Google Search, yang banyak menceritakan keyakinan Google terhadap profil kosnya pada skala planet. Pelanggan awal termasuk Ashler, Palo Alto Networks dan Ramp.

Nota sisi: 3.5 Flash Cyber dan CodeMender

Pelancaran yang sama memperkenalkan Gemini 3.5 Flash Cyber — 3.5 Flash yang ditala halus untuk mencari dan membaiki kerentanan keselamatan. Dalam CodeMender, beberapa ejen Flash Cyber bekerja selari dan menggabungkan penemuan mereka ke dalam satu laporan gabungan, mencapai prestasi yang bersaing dengan model frontier pada CyberGym. Perhatikan seni binanya: ia corak “armada pakar cekap” yang sama seperti diterangkan panduan ini, diterapkan pada keselamatan.

Aksesnya sengaja disempitkan: perintis akses terhad eksklusif untuk kerajaan dan rakan kongsi dipercayai melalui CodeMender, mencerminkan risiko dwiguna penemuan kerentanan automatik. Butiran dalam ringkasan pengumuman kami.

Kesimpulannya

3.5 Flash-Lite melukis semula sempadan harga-prestasi untuk beban kerja agentik: lebih pantas daripada apa-apa dalam siri 3.5, kira-kira 4× lebih murah daripada 3.6 Flash, dan — buat kali pertama dalam model Lite — benar-benar boleh dipercayai pada penanda aras agentik. Bina penghalaan anda supaya Flash-Lite menjadi lalai dan 3.6 Flash menjadi laluan eskalasi, dan lengkung kos anda akan berterima kasih.

Berkaitan