Gemini 3.5 Flash-Lite Rehberi: Ajan İş Akışlarını 350 Token/sn ile Ölçekleme (2026)
Gemini 3.5 Flash-Lite, $0.30/1M girdiyle 350 token/sn çalışıyor. 3.1 Flash-Lite ve Gemini 3 Flash benchmark'ları, düşünme seviyeleri, maliyet hesabı ve karar tablosu.
Hacim kademesi artık ciddi bir iş
21 Temmuz 2026’da duyurulan Gemini 3.5 Flash-Lite, Google’ın en hızlı ve en uygun maliyetli 3.5 sınıfı modeli: saniyede 350 çıkış token’ı (Artificial Analysis), 1M girdi token’ı başına $0.30 ve 1M çıktı token’ı başına $2.50 fiyatıyla. Tarihsel olarak “Lite” kademeleri kalitenin öldüğü yerdi — sınıflandırma ve kalıp işler için iyi, ajan gerektiren her şey için riskli. Bu sürüm o kalıbı kırıyor: birçok ajan ve kodlama değerlendirmesinde 3.5 Flash-Lite, daha büyük Gemini 3 Flash’ı düpedüz geçiyor.
Bu rehber, Flash-Lite’ın seride nerede durduğunu, düşünme seviyelerinin nasıl yapılandırılacağını, ölçekte gerçekte ne kadara mal olduğunu ve hangi iş yükü için hangi modelin seçileceğini ele alıyor. Lansman bağlamı duyuru özetimizde.
Kuşak sıçraması: 3.1 Flash-Lite’a karşı
Önceki Lite kuşağından sıçrama, ailenin tarihindeki en büyüğü:
| Benchmark | Neyi ölçüyor | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Kodlama ve ajan tabanlı terminal görevleri | %54 | %31 |
| GDM-MRCR v2 | Uzun bağlam getirme | %72,2 | %60,1 |
| GDPval-AA v2 | Gerçek dünya görev yürütme | 1140 | 642 |

İçselleştirilmesi gereken rakam, neredeyse ikiye katlanan GDPval-AA v2 skoru (642 → 1140): eski Lite modellerinin üretim ajanlarında çuvalladığı yer tam da gerçek dünya görev yürütmeydi.
Sürpriz: Gemini 3 Flash’ı geçmek
Kuşak kazanımından daha şaşırtıcı olan, kademeler arası olanı. Birçok ajan ve kodlama değerlendirmesinde 3.5 Flash-Lite, daha büyük ve daha pahalı bir model olan Gemini 3 Flash’tan daha iyi performans gösteriyor:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | %54,2 | %49,6 |
| OSWorld-Verified | %74,0 | %65,1 |
Bugün iş yüklerinizi 2.5 Flash veya 3 Flash üzerinde çalıştırıyorsanız — çünkü Lite kademelerine ajan işleri emanet edilemezdi — o varsayım artık geçersiz: Flash-Lite bu görevlerde hem daha hızlı hem de daha yetenekli.
Düşünme seviyeleri: tek model, iki çalışma modu
Flash-Lite, yapılandırılabilir düşünme seviyeleriyle geliyor; bu da onu fiilen iki ayrı ürüne dönüştürüyor:
- Minimal / düşük düşünme — yüksek hacimli görevlerde gecikme ve maliyeti önceliklendirin: ajan tabanlı arama, belge işleme, veri çıkarma, sınıflandırma, yönlendirme. 350 token/sn modu bu.
- Daha yüksek düşünme seviyeleri — Flash-Lite’ın bir orkestratör modelin altında işçi olarak çalıştığı çok adımlı alt-ajan iş yükleri için daha derin akıl yürütmeyi devreye alın.
İkinci mod, Google’ın kendi demo desenine denk düşüyor: ana ajan olarak 3.6 Flash, paralel iş yapan 3.5 Flash-Lite alt-ajan filoları (bir demo aynı anda 25 web tasarım konsepti üretiyor). Bilgisayar kullanımı Flash-Lite’ta da yerleşik bir araç, dolayısıyla alt-ajanlar ek altyapı olmadan arayüzleri kullanabiliyor. Yüksek hacimli görevlerdeki gecikme farkı için Google’ın Flash-Lite vs 3.5 Flash hız demosuna (video) bakın.
Maliyet analizi: ölçek gerçekte ne kadar tutuyor
Fiyatlar: $0.30/1M girdi, $2.50/1M çıktı. Örnek bir iş yükü — ayda 1 milyon belge işleyen, belge başına ortalama 3 bin girdi ve 500 çıktı token’ı kullanan bir belge işleme ajanı:
| Maliyet kalemi | Hesaplama | Aylık maliyet |
|---|---|---|
| Girdi token’ları | 1M belge × 3K token = 3B token × $0.30/1M | $900 |
| Çıktı token’ları | 1M belge × 500 token = 0.5B token × $2.50/1M | $1,250 |
| 3.5 Flash-Lite toplamı | $2,150 | |
| Aynı iş yükü 3.6 Flash’ta ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Lite’ın gayet iyi başa çıktığı bir iş yükünde kabaca 4 kat maliyet farkı — üstelik 350 token/sn hızda, her belgenin 500 token’lık özeti 1,5 saniyeden kısa sürede akıyor. Bundan çıkan strateji: hacmin rutin olan %90’ını Flash-Lite’a yönlendirin, zor %10’u 3.6 Flash’a yükseltin.
Karar tablosu: hangi iş yükü için hangi model
| İş yükü | Seçim | Neden |
|---|---|---|
| Yüksek QPS’te ajan tabanlı arama / RAG | 3.5 Flash-Lite (minimal düşünme) | 350 token/sn, sorgu başına en düşük maliyet |
| Toplu belge işleme / veri çıkarma | 3.5 Flash-Lite | 3.6 Flash’tan 4× daha ucuz; GDM-MRCR v2 %72,2 uzun bağlam |
| Sınıflandırma, yönlendirme, moderasyon | 3.5 Flash-Lite (minimal düşünme) | Gecikme kritik, kalite payı fazlasıyla var |
| Orkestratör altında paralel alt-ajan filoları | 3.5 Flash-Lite (yüksek düşünme) | Bu iş için tasarlanmış mod; bilgisayar kullanımı yerleşik |
| Karmaşık ajan tabanlı kodlama (SWE ajanları) | 3.6 Flash | DeepSWE %49; daha yüksek hassasiyet, daha az hatalı düzenleme |
| ML araştırma iş akışları | 3.6 Flash | MLE Bench %63,9’a karşı 3.5 Flash %49,7 |
| Zor görevlerde bilgisayar kullanımı ajanları | 3.6 Flash | OSWorld-Verified %83,0 (Lite %74,0) |
| Multimodal belge analizi ve rapor taslağı | 3.6 Flash | Lansman sırasında Harvey / Hebbia tarafından doğrulandı |
| Hâlâ 3.5 Flash’taki eski hatlar | Yukarı veya aşağı geçin | Kalite için 3.6 Flash, hacim için Flash-Lite — geçiş rehberine bakın |
| Güvenlik açığı tespiti ve yamalama | 3.5 Flash Cyber | Yalnızca CodeMender pilotu (hükümetler ve güvenilir iş ortakları) |
Pratik kural: önce büyük modeli seçip sonra optimize etmek yerine, varsayılan olarak Flash-Lite’ı kullanın ve başarısızlıkta yükseltin. Başarısızlık modu görünürdür (kötü çıktılar); aşırı kaynak ayırmanın israfı ise sessizdir.
Nerede kullanılabilir
3.5 Flash-Lite bugün Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform ve Gemini uygulamasında canlı — ayrıca Google Arama’da kademeli olarak devreye giriyor, ki bu Google’ın gezegen ölçeğindeki maliyet profiline duyduğu güven hakkında çok şey söylüyor. İlk müşteriler arasında Ashler, Palo Alto Networks ve Ramp var.
Kenar notu: 3.5 Flash Cyber ve CodeMender
Aynı lansman Gemini 3.5 Flash Cyber’ı da tanıttı — güvenlik açıklarını bulmak ve düzeltmek için ince ayarlanmış 3.5 Flash. CodeMender içinde birden fazla Flash Cyber ajanı paralel çalışıp bulgularını tek bir birleşik raporda topluyor ve CyberGym’de sınır düzeyindeki modellerle rekabet edebilen performansa ulaşıyor. Mimarîye dikkat: bu rehberin anlattığı “verimli uzmanlardan oluşan filo” deseninin ta kendisi, güvenliğe uygulanmış hali.
Erişim bilinçli olarak dar tutuluyor: otomatik açık keşfinin çift kullanımlı riskini yansıtan, CodeMender üzerinden yalnızca hükümetler ve güvenilir iş ortaklarına açık sınırlı erişimli bir pilot. Ayrıntılar duyuru özetimizde.
Sonuç
3.5 Flash-Lite, ajan iş yükleri için fiyat-performans sınırını yeniden çiziyor: 3.5 serisindeki her şeyden hızlı, 3.6 Flash’tan kabaca 4 kat ucuz ve — bir Lite modelde ilk kez — ajan benchmark’larında gerçekten güvenilir. Yönlendirmenizi Flash-Lite varsayılan, 3.6 Flash yükseltme yolu olacak şekilde kurun; maliyet eğriniz size teşekkür edecek.