Gemini 3.5 Flash-Lite गाइड: 350 टोकन/सेकंड पर एजेंटिक वर्कफ़्लो की स्केलिंग (2026)
Gemini 3.5 Flash-Lite $0.30/1M इनपुट पर 350 टोकन/सेकंड चलता है। 3.1 Flash-Lite और Gemini 3 Flash से बेंचमार्क, थिंकिंग लेवल, लागत गणित और मॉडल निर्णय तालिका।
वॉल्यूम टियर अब गंभीर हो गया है
Gemini 3.5 Flash-Lite, जिसकी घोषणा 21 जुलाई 2026 को हुई, Google का सबसे तेज़ और सबसे किफ़ायती 3.5-श्रेणी का मॉडल है: 350 आउटपुट टोकन प्रति सेकंड (Artificial Analysis), कीमत $0.30 प्रति 1M इनपुट टोकन और $2.50 प्रति 1M आउटपुट टोकन। ऐतिहासिक रूप से, “Lite” टियर वह जगह थी जहाँ गुणवत्ता दम तोड़ देती थी — क्लासिफ़िकेशन और बॉयलरप्लेट के लिए ठीक, किसी भी एजेंटिक काम के लिए जोखिम भरी। यह रिलीज़ उस ढर्रे को तोड़ती है: कई एजेंटिक और कोडिंग मूल्यांकनों में 3.5 Flash-Lite बड़े Gemini 3 Flash को सीधे-सीधे हरा देता है।
यह गाइड बताती है कि Flash-Lite लाइनअप में कहाँ बैठता है, इसके थिंकिंग लेवल कैसे कॉन्फ़िगर करें, स्केल पर इसकी असल लागत क्या है, और किस वर्कलोड के लिए कौन-सा मॉडल चुनें। लॉन्च का संदर्भ हमारे घोषणा अवलोकन में है।
पीढ़ीगत छलांग: बनाम 3.1 Flash-Lite
पिछली Lite पीढ़ी से यह छलांग इस परिवार के इतिहास में सबसे बड़ी है:
| बेंचमार्क | क्या मापता है | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | कोडिंग और एजेंटिक टर्मिनल कार्य | 54% | 31% |
| GDM-MRCR v2 | लॉन्ग-कॉन्टेक्स्ट रिट्रीवल | 72.2% | 60.1% |
| GDPval-AA v2 | वास्तविक कार्य निष्पादन | 1140 | 642 |

GDPval-AA v2 का लगभग दोगुना होना (642 → 1140) वह आँकड़ा है जिसे आत्मसात करना चाहिए: वास्तविक कार्य निष्पादन ही वह जगह थी जहाँ पुराने Lite मॉडल प्रोडक्शन एजेंट्स में बिखर जाते थे।
उलटफेर: Gemini 3 Flash को मात
पीढ़ीगत बढ़त से भी ज़्यादा हैरान करने वाली है क्रॉस-टियर जीत। कई एजेंटिक और कोडिंग मूल्यांकनों में, 3.5 Flash-Lite Gemini 3 Flash — एक बड़े, महँगे मॉडल — से आगे निकल जाता है:
| बेंचमार्क | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
अगर आप आज 2.5 Flash या 3 Flash पर वर्कलोड इसलिए चला रहे हैं क्योंकि Lite टियर पर एजेंटिक काम के लिए भरोसा नहीं किया जा सकता था, तो वह धारणा अब पुरानी हो चुकी है — Flash-Lite इन कामों में तेज़ भी है और अधिक सक्षम भी।
थिंकिंग लेवल: एक मॉडल, दो ऑपरेटिंग मोड
Flash-Lite कॉन्फ़िगर करने योग्य थिंकिंग लेवल के साथ आता है, जो इसे प्रभावी रूप से दो प्रोडक्ट बना देते हैं:
- Minimal / low थिंकिंग — हाई-वॉल्यूम कार्यों के लिए लेटेंसी और लागत को प्राथमिकता दें: एजेंटिक सर्च, डॉक्युमेंट प्रोसेसिंग, एक्सट्रैक्शन, क्लासिफ़िकेशन, रूटिंग। यही 350 टोकन/सेकंड वाला मोड है।
- ऊँचे थिंकिंग लेवल — मल्टी-स्टेप सबएजेंट वर्कलोड के लिए गहरी रीज़निंग सक्रिय करें, जहाँ Flash-Lite किसी ऑर्केस्ट्रेटर मॉडल के अधीन वर्कर की तरह काम करता है।
दूसरा मोड Google के अपने डेमो पैटर्न से मेल खाता है: मास्टर एजेंट के रूप में 3.6 Flash, समानांतर काम करते 3.5 Flash-Lite सबएजेंट्स के बेड़े (एक डेमो एक साथ 25 वेब-डिज़ाइन कॉन्सेप्ट बनाता है)। Flash-Lite पर कंप्यूटर उपयोग भी बिल्ट-इन टूल है, इसलिए सबएजेंट बिना अतिरिक्त स्कैफ़ोल्डिंग के UI चला सकते हैं। हाई-वॉल्यूम कार्यों पर लेटेंसी के अंतर के लिए Google का Flash-Lite बनाम 3.5 Flash स्पीड डेमो (वीडियो) देखें।
लागत विश्लेषण: स्केल की असल कीमत
कीमतें: $0.30/1M इनपुट, $2.50/1M आउटपुट। यहाँ एक उदाहरण वर्कलोड है — एक डॉक्युमेंट-प्रोसेसिंग एजेंट जो महीने में 10 लाख दस्तावेज़ संभालता है, प्रति दस्तावेज़ औसतन 3K इनपुट टोकन और 500 आउटपुट टोकन:
| लागत घटक | गणना | मासिक लागत |
|---|---|---|
| इनपुट टोकन | 1M docs × 3K tokens = 3B tokens × $0.30/1M | $900 |
| आउटपुट टोकन | 1M docs × 500 tokens = 0.5B tokens × $2.50/1M | $1,250 |
| 3.5 Flash-Lite पर कुल | $2,150 | |
| वही वर्कलोड 3.6 Flash पर ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
एक ऐसे वर्कलोड के लिए, जिसे Lite अच्छी तरह संभालता है, लगभग 4× का लागत अंतर — और 350 टोकन/सेकंड पर, हर दस्तावेज़ का 500-टोकन सारांश 1.5 सेकंड से कम में स्ट्रीम हो जाता है। इससे निकलने वाली रणनीति: नियमित 90% वॉल्यूम Flash-Lite को भेजें, कठिन 10% को 3.6 Flash तक बढ़ाएँ।
निर्णय तालिका: किस वर्कलोड के लिए कौन-सा मॉडल
| वर्कलोड | चुनें | क्यों |
|---|---|---|
| हाई QPS पर एजेंटिक सर्च / RAG | 3.5 Flash-Lite (minimal थिंकिंग) | 350 टोकन/सेकंड, प्रति क्वेरी सबसे कम लागत |
| बल्क डॉक्युमेंट प्रोसेसिंग / एक्सट्रैक्शन | 3.5 Flash-Lite | 3.6 Flash से 4× सस्ता; GDM-MRCR v2 72.2% लॉन्ग-कॉन्टेक्स्ट |
| क्लासिफ़िकेशन, रूटिंग, मॉडरेशन | 3.5 Flash-Lite (minimal थिंकिंग) | लेटेंसी-संवेदनशील, गुणवत्ता की भरपूर गुंजाइश |
| ऑर्केस्ट्रेटर के अधीन समानांतर सबएजेंट बेड़े | 3.5 Flash-Lite (ऊँची थिंकिंग) | इसी के लिए बना मोड; कंप्यूटर उपयोग बिल्ट-इन |
| जटिल एजेंटिक कोडिंग (SWE एजेंट) | 3.6 Flash | DeepSWE 49%; उच्च परिशुद्धता, कम ग़लत बदलाव |
| ML रिसर्च वर्कफ़्लो | 3.6 Flash | MLE Bench 63.9% बनाम 3.5 Flash का 49.7% |
| कठिन कार्यों पर कंप्यूटर-उपयोग एजेंट | 3.6 Flash | OSWorld-Verified 83.0% (बनाम Lite का 74.0%) |
| मल्टीमॉडल डॉक्युमेंट विश्लेषण और रिपोर्ट ड्राफ़्टिंग | 3.6 Flash | लॉन्च पर Harvey / Hebbia से प्रमाणित |
| अब भी 3.5 Flash पर चल रहीं लेगेसी पाइपलाइनें | ऊपर या नीचे माइग्रेट करें | गुणवत्ता के लिए 3.6 Flash, वॉल्यूम के लिए Flash-Lite — माइग्रेशन गाइड देखें |
| सुरक्षा कमज़ोरियों की खोज और पैचिंग | 3.5 Flash Cyber | केवल CodeMender पायलट के ज़रिए (सरकारें और भरोसेमंद पार्टनर) |
अंगूठे का नियम: Flash-Lite को डिफ़ॉल्ट बनाएँ और विफलता पर एस्केलेट करें, बजाय इसके कि बड़े मॉडल को डिफ़ॉल्ट रखकर बाद में ऑप्टिमाइज़ करें। विफलता का लक्षण दिखाई देता है (ख़राब आउटपुट); ओवर-प्रोविज़निंग की बर्बादी ख़ामोश रहती है।
यह कहाँ उपलब्ध है
3.5 Flash-Lite आज Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform और Gemini ऐप में लाइव है — और यह Google Search के अंदर चरणबद्ध रूप से आ रहा है, जो ग्रह-स्तरीय पैमाने पर इसकी लागत प्रोफ़ाइल में Google के भरोसे के बारे में बहुत कुछ कहता है। शुरुआती ग्राहकों में Ashler, Palo Alto Networks और Ramp शामिल हैं।
साइडबार: 3.5 Flash Cyber और CodeMender
इसी लॉन्च में Gemini 3.5 Flash Cyber भी पेश हुआ — सुरक्षा कमज़ोरियाँ खोजने और ठीक करने के लिए फ़ाइन-ट्यून किया गया 3.5 Flash। CodeMender के अंदर, कई Flash Cyber एजेंट समानांतर काम करते हैं और अपने निष्कर्ष एक संयुक्त रिपोर्ट में मिलाते हैं, जो CyberGym पर फ्रंटियर-स्तर के प्रतिस्पर्धी प्रदर्शन तक पहुँचती है। आर्किटेक्चर पर ध्यान दें: यह वही “कुशल विशेषज्ञों का बेड़ा” पैटर्न है जिसका वर्णन यह गाइड करती है — सुरक्षा पर लागू।
एक्सेस जानबूझकर संकीर्ण है: CodeMender के ज़रिए केवल सरकारों और भरोसेमंद पार्टनर्स के लिए सीमित-एक्सेस पायलट, जो स्वचालित कमज़ोरी-खोज के दोधारी जोखिम को दर्शाता है। विवरण हमारे घोषणा अवलोकन में।
निष्कर्ष
3.5 Flash-Lite एजेंटिक वर्कलोड के लिए प्राइस-परफ़ॉर्मेंस की सीमा फिर से खींचता है: 3.5 सीरीज़ में सबसे तेज़, 3.6 Flash से लगभग 4× सस्ता, और — किसी Lite मॉडल में पहली बार — एजेंटिक बेंचमार्क पर वाक़ई भरोसेमंद। अपनी रूटिंग ऐसी बनाएँ कि Flash-Lite डिफ़ॉल्ट हो और 3.6 Flash एस्केलेशन पथ, और आपका लागत वक्र आपको धन्यवाद देगा।