Gemini 3.6 Flash vs 3.5 Flash: Penanda Aras, Harga dan Bila Perlu Berhijrah (2026)
Gemini 3.6 Flash menewaskan 3.5 Flash pada setiap penanda aras sambil memotong token output 17% dan harga sekali. Jadual perbandingan penuh serta panduan penghijrahan.
Naik taraf “menang mutlak” yang jarang ditemui
Kebanyakan naik taraf model perlu menukar sesuatu — kualiti demi kelajuan, harga demi keupayaan. Gemini 3.6 Flash vs Gemini 3.5 Flash ialah kes luar biasa di mana model yang lebih baharu menang pada setiap paksi yang Google terbitkan pada 21 Julai 2026: skor penanda aras lebih tinggi, token output lebih sedikit, langkah penaakulan dan panggilan alat lebih sedikit, dan harga setiap token lebih rendah. Ulasan mendalam ini menelusuri angka-angkanya, kemudian beralih ke sisi praktikal: siapa patut berhijrah, bila, dan apa yang perlu diuji semula.
Jika anda mahu konteks penuh pelancaran tiga model itu dahulu, mulakan dengan ringkasan pengumuman kami.
Kecekapan token: tajuk utama yang tidak patut dilangkau sesiapa
Angka paling penting dalam keluaran ini bukanlah skor penanda aras. Pada Artificial Analysis Index, 3.6 Flash menggunakan 17% kurang token output berbanding 3.5 Flash untuk kerja setara. Pada DeepSWE oleh Datacurve, Google memerhatikan pengurangan sehingga 65%.

Mengapa ia lebih penting daripada yang didengar:
- Token output ialah yang mahal ($7.50/1M vs $1.50/1M untuk input). Memotongnya 17–65% menyerang komponen kos yang dominan.
- Kurang token = kependaman lebih rendah. Ejen yang bercakap kurang siap lebih awal, dan rantaian berbilang langkah menggandakan kesannya.
- Kurang langkah penaakulan dan panggilan alat bermakna kurang perjalanan ulang-alik, kurang titik kegagalan dan kurang beban orkestrasi setiap tugas.
Google menerbitkan demo bersebelahan untuk ini pada tugas penggunaan komputer — lihat video perbandingan kecekapan token.
Perbandingan penanda aras penuh
| Penanda aras | Apa yang diukur | Gemini 3.6 Flash | Gemini 3.5 Flash | Delta |
|---|---|---|---|---|
| DeepSWE | Kejuruteraan perisian agentik | 49% | 37% | +12 mata |
| MLE Bench | Penyelidikan & kejuruteraan ML | 63.9% | 49.7% | +14.2 mata |
| OSWorld-Verified | Penggunaan komputer | 83.0% | 78.4% | +4.6 mata |
| GDPval-AA v2 | Kerja pengetahuan dunia sebenar | 1421 | 1349 | +72 |

Tiga bacaan daripada jadual itu:
- Lonjakan DeepSWE (37% → 49%) ialah yang paling patut diambil berat oleh pasukan pengekodan: Google mengaitkannya dengan ketepatan lebih tinggi — kurang suntingan kod yang tidak diingini dan gelung pelaksanaan berkurang, bukan sekadar keupayaan mentah yang lebih besar.
- MLE Bench (+14.2 mata) ialah peningkatan terbesar, menandakan lonjakan sebenar dalam aliran kerja penyelidikan ML — perancah eksperimen, analisis data, penyahpepijatan gelung latihan.
- OSWorld-Verified pada 83.0% penting kerana penggunaan komputer kini menjadi alat sisi klien terbina dalam pada Gemini API dan Gemini Enterprise. Lonjakan keupayaan dan perubahan pembungkusan tiba serentak.
Harga: lebih murah setiap token, lebih murah setiap tugas
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Harga input | $1.50 / 1M token | Lebih tinggi |
| Harga output | $7.50 / 1M token | Lebih tinggi |
| Token output setiap tugas | ~17% kurang (sehingga 65% pada DeepSWE) | Garis asas |
| Kos berkesan setiap tugas agentik | Jauh lebih rendah | Garis asas |
Kesan berganda itulah intinya. Tugas yang dahulu menghasilkan 100K token output kini menghasilkan ~83K, dan setiap token itu berkos lebih rendah. Untuk beban kerja yang menjalankan berjuta-juta tugas agentik sebulan, penjimatan terus muncul pada invois tanpa menyentuh prompt anda.
Penggunaan komputer: daripada tambahan kepada terbina dalam
Dengan 3.6 Flash, penggunaan komputer hadir sebagai alat sisi klien terbina dalam melalui Gemini API dan Gemini Enterprise. Digabungkan dengan penambahbaikan OSWorld-Verified (78.4% → 83.0%), pasukan yang membina ejen pelayar, automasi gaya RPA atau bot QA mendapat model yang lebih kukuh serta kod integrasi yang lebih sedikit. Jika sebelum ini anda menyelenggara perancah penggunaan komputer tersuai di sekeliling 3.5 Flash, bersedialah untuk memadamkan sebahagiannya.
Postur keselamatan
3.6 Flash hadir dengan perlindungan Frontier Safety dipertingkat dalam domain CBRN dan serangan siber, dan Google melaporkan ia jauh lebih tahan jailbreak berbanding 3.5 Flash. Sama pentingnya bagi pasukan produk: ia juga dilatih untuk mengurangkan penolakan atas permintaan yang sah. Jika 3.5 Flash kadangkala menolak prompt sah berkaitan keselamatan atau perubatan dalam produk anda, uji semula aliran tersebut — kadar penolakan palsu sepatutnya menurun.
Apa kata pelanggan awal
Senarai pelancaran Google — Figma, Harvey, Hebbia, JetBrains — wajar dirungkai:
- Figma dan JetBrains ialah syarikat perkakasan dengan inferens bervolum tinggi yang sensitif kependaman: satu sokongan kepada kisah kelajuan/kecekapan.
- Harvey (undang-undang) dan Hebbia (kewangan) secara khusus memuji kerja dokumen multimodal: penghuraian, analisis carta dan data, serta penggubalan laporan. Jika beban kerja anda ialah kerja pengetahuan sarat dokumen, peningkatan GDPval-AA v2 (1349 → 1421) ialah proksi yang relevan untuk anda.
Panduan penghijrahan: bila perlu bertukar
| Situasi anda | Cadangan |
|---|---|
| Pengekodan agentik (ejen SWE, bot semakan kod) | Berhijrah sekarang — kemenangan kualiti + kecekapan token terbesar (DeepSWE +12 mata, sehingga 65% kurang token) |
| Penggunaan komputer / automasi pelayar | Berhijrah sekarang — skor lebih baik dan perkakasan terbina dalam menggantikan perancah tersuai |
| Penghuraian dokumen / analisis / penggubalan laporan | Berhijrah sekarang — disahkan oleh kes penggunaan Harvey & Hebbia |
| Tugas mudah bervolum tinggi, kritikal kependaman | Pertimbangkan 3.5 Flash-Lite sebaliknya — lihat panduan Flash-Lite kami |
| Prompt yang ditala rapi dengan penghuraian format output ketat | Berhijrah dengan berhati-hati — kecekapan token mengubah kemeleretan; sahkan semula penghurai dan contoh few-shot |
| Sistem produksi yang dibekukan atas pematuhan | Jadualkannya — tiada penamatan paksa diumumkan, tetapi harga + kecekapan menjadikan kekal di tempat lama itu mahal |
Senarai semak praktikal sebelum menukar rentetan model:
- Jalankan semula suite penilaian anda — gaya output lebih kemas dan pendek; penegasan tentang panjang atau frasa respons mungkin gagal.
- Semak semula penghuraian output berstruktur — kemeleretan yang berkurang biasanya berita baik untuk kebolehpercayaan JSON, tetapi sahkan.
- Uji semula aliran yang sensitif penolakan — jangkakan lebih sedikit penolakan palsu, tetapi pastikan penapis keselamatan anda masih sejajar.
- Ukur semula kos setiap tugas, bukan setiap token — pengurangan token 17–65% bermakna perbandingan setiap token memperkecil penjimatan sebenar.
Keputusan
Gemini 3.6 Flash ialah pengganti yang jarang ditemui tanpa sebarang pertukaran yang diterbitkan: lebih baik dalam pengekodan, penyelidikan ML, penggunaan komputer dan kerja pengetahuan, sambil menghasilkan lebih sedikit token pada harga lebih rendah. Melainkan stack anda bergantung pada format output yang dibekukan, berhijrah daripada 3.5 Flash bukan lagi soal sama ada, tetapi sprint yang mana.