Gemini Omni
सभी लेखों पर वापस
10 मिनट का पढ़ाव

Gemini 3.5 Flash-Lite गाइड: 350 टोकन/सेकंड पर एजेंटिक वर्कफ़्लो की स्केलिंग (2026)

Gemini 3.5 Flash-Lite $0.30/1M इनपुट पर 350 टोकन/सेकंड चलता है। 3.1 Flash-Lite और Gemini 3 Flash से बेंचमार्क, थिंकिंग लेवल, लागत गणित और मॉडल निर्णय तालिका।

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026हिन्दी

वॉल्यूम टियर अब गंभीर हो गया है

Gemini 3.5 Flash-Lite, जिसकी घोषणा 21 जुलाई 2026 को हुई, Google का सबसे तेज़ और सबसे किफ़ायती 3.5-श्रेणी का मॉडल है: 350 आउटपुट टोकन प्रति सेकंड (Artificial Analysis), कीमत $0.30 प्रति 1M इनपुट टोकन और $2.50 प्रति 1M आउटपुट टोकन। ऐतिहासिक रूप से, “Lite” टियर वह जगह थी जहाँ गुणवत्ता दम तोड़ देती थी — क्लासिफ़िकेशन और बॉयलरप्लेट के लिए ठीक, किसी भी एजेंटिक काम के लिए जोखिम भरी। यह रिलीज़ उस ढर्रे को तोड़ती है: कई एजेंटिक और कोडिंग मूल्यांकनों में 3.5 Flash-Lite बड़े Gemini 3 Flash को सीधे-सीधे हरा देता है

यह गाइड बताती है कि Flash-Lite लाइनअप में कहाँ बैठता है, इसके थिंकिंग लेवल कैसे कॉन्फ़िगर करें, स्केल पर इसकी असल लागत क्या है, और किस वर्कलोड के लिए कौन-सा मॉडल चुनें। लॉन्च का संदर्भ हमारे घोषणा अवलोकन में है।

पीढ़ीगत छलांग: बनाम 3.1 Flash-Lite

पिछली Lite पीढ़ी से यह छलांग इस परिवार के इतिहास में सबसे बड़ी है:

बेंचमार्कक्या मापता हैGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1कोडिंग और एजेंटिक टर्मिनल कार्य54%31%
GDM-MRCR v2लॉन्ग-कॉन्टेक्स्ट रिट्रीवल72.2%60.1%
GDPval-AA v2वास्तविक कार्य निष्पादन1140642

पिछली Flash-Lite पीढ़ियों के मुक़ाबले Gemini 3.5 Flash-Lite की बेंचमार्क तुलना

GDPval-AA v2 का लगभग दोगुना होना (642 → 1140) वह आँकड़ा है जिसे आत्मसात करना चाहिए: वास्तविक कार्य निष्पादन ही वह जगह थी जहाँ पुराने Lite मॉडल प्रोडक्शन एजेंट्स में बिखर जाते थे।

उलटफेर: Gemini 3 Flash को मात

पीढ़ीगत बढ़त से भी ज़्यादा हैरान करने वाली है क्रॉस-टियर जीत। कई एजेंटिक और कोडिंग मूल्यांकनों में, 3.5 Flash-Lite Gemini 3 Flash — एक बड़े, महँगे मॉडल — से आगे निकल जाता है:

बेंचमार्कGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

अगर आप आज 2.5 Flash या 3 Flash पर वर्कलोड इसलिए चला रहे हैं क्योंकि Lite टियर पर एजेंटिक काम के लिए भरोसा नहीं किया जा सकता था, तो वह धारणा अब पुरानी हो चुकी है — Flash-Lite इन कामों में तेज़ भी है और अधिक सक्षम भी।

थिंकिंग लेवल: एक मॉडल, दो ऑपरेटिंग मोड

Flash-Lite कॉन्फ़िगर करने योग्य थिंकिंग लेवल के साथ आता है, जो इसे प्रभावी रूप से दो प्रोडक्ट बना देते हैं:

  • Minimal / low थिंकिंग — हाई-वॉल्यूम कार्यों के लिए लेटेंसी और लागत को प्राथमिकता दें: एजेंटिक सर्च, डॉक्युमेंट प्रोसेसिंग, एक्सट्रैक्शन, क्लासिफ़िकेशन, रूटिंग। यही 350 टोकन/सेकंड वाला मोड है।
  • ऊँचे थिंकिंग लेवलमल्टी-स्टेप सबएजेंट वर्कलोड के लिए गहरी रीज़निंग सक्रिय करें, जहाँ Flash-Lite किसी ऑर्केस्ट्रेटर मॉडल के अधीन वर्कर की तरह काम करता है।

दूसरा मोड Google के अपने डेमो पैटर्न से मेल खाता है: मास्टर एजेंट के रूप में 3.6 Flash, समानांतर काम करते 3.5 Flash-Lite सबएजेंट्स के बेड़े (एक डेमो एक साथ 25 वेब-डिज़ाइन कॉन्सेप्ट बनाता है)। Flash-Lite पर कंप्यूटर उपयोग भी बिल्ट-इन टूल है, इसलिए सबएजेंट बिना अतिरिक्त स्कैफ़ोल्डिंग के UI चला सकते हैं। हाई-वॉल्यूम कार्यों पर लेटेंसी के अंतर के लिए Google का Flash-Lite बनाम 3.5 Flash स्पीड डेमो (वीडियो) देखें।

लागत विश्लेषण: स्केल की असल कीमत

कीमतें: $0.30/1M इनपुट, $2.50/1M आउटपुट। यहाँ एक उदाहरण वर्कलोड है — एक डॉक्युमेंट-प्रोसेसिंग एजेंट जो महीने में 10 लाख दस्तावेज़ संभालता है, प्रति दस्तावेज़ औसतन 3K इनपुट टोकन और 500 आउटपुट टोकन:

लागत घटकगणनामासिक लागत
इनपुट टोकन1M docs × 3K tokens = 3B tokens × $0.30/1M$900
आउटपुट टोकन1M docs × 500 tokens = 0.5B tokens × $2.50/1M$1,250
3.5 Flash-Lite पर कुल$2,150
वही वर्कलोड 3.6 Flash पर ($1.50 / $7.50)$4,500 + $3,750$8,250

एक ऐसे वर्कलोड के लिए, जिसे Lite अच्छी तरह संभालता है, लगभग 4× का लागत अंतर — और 350 टोकन/सेकंड पर, हर दस्तावेज़ का 500-टोकन सारांश 1.5 सेकंड से कम में स्ट्रीम हो जाता है। इससे निकलने वाली रणनीति: नियमित 90% वॉल्यूम Flash-Lite को भेजें, कठिन 10% को 3.6 Flash तक बढ़ाएँ।

निर्णय तालिका: किस वर्कलोड के लिए कौन-सा मॉडल

वर्कलोडचुनेंक्यों
हाई QPS पर एजेंटिक सर्च / RAG3.5 Flash-Lite (minimal थिंकिंग)350 टोकन/सेकंड, प्रति क्वेरी सबसे कम लागत
बल्क डॉक्युमेंट प्रोसेसिंग / एक्सट्रैक्शन3.5 Flash-Lite3.6 Flash से 4× सस्ता; GDM-MRCR v2 72.2% लॉन्ग-कॉन्टेक्स्ट
क्लासिफ़िकेशन, रूटिंग, मॉडरेशन3.5 Flash-Lite (minimal थिंकिंग)लेटेंसी-संवेदनशील, गुणवत्ता की भरपूर गुंजाइश
ऑर्केस्ट्रेटर के अधीन समानांतर सबएजेंट बेड़े3.5 Flash-Lite (ऊँची थिंकिंग)इसी के लिए बना मोड; कंप्यूटर उपयोग बिल्ट-इन
जटिल एजेंटिक कोडिंग (SWE एजेंट)3.6 FlashDeepSWE 49%; उच्च परिशुद्धता, कम ग़लत बदलाव
ML रिसर्च वर्कफ़्लो3.6 FlashMLE Bench 63.9% बनाम 3.5 Flash का 49.7%
कठिन कार्यों पर कंप्यूटर-उपयोग एजेंट3.6 FlashOSWorld-Verified 83.0% (बनाम Lite का 74.0%)
मल्टीमॉडल डॉक्युमेंट विश्लेषण और रिपोर्ट ड्राफ़्टिंग3.6 Flashलॉन्च पर Harvey / Hebbia से प्रमाणित
अब भी 3.5 Flash पर चल रहीं लेगेसी पाइपलाइनेंऊपर या नीचे माइग्रेट करेंगुणवत्ता के लिए 3.6 Flash, वॉल्यूम के लिए Flash-Lite — माइग्रेशन गाइड देखें
सुरक्षा कमज़ोरियों की खोज और पैचिंग3.5 Flash Cyberकेवल CodeMender पायलट के ज़रिए (सरकारें और भरोसेमंद पार्टनर)

अंगूठे का नियम: Flash-Lite को डिफ़ॉल्ट बनाएँ और विफलता पर एस्केलेट करें, बजाय इसके कि बड़े मॉडल को डिफ़ॉल्ट रखकर बाद में ऑप्टिमाइज़ करें। विफलता का लक्षण दिखाई देता है (ख़राब आउटपुट); ओवर-प्रोविज़निंग की बर्बादी ख़ामोश रहती है।

यह कहाँ उपलब्ध है

3.5 Flash-Lite आज Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform और Gemini ऐप में लाइव है — और यह Google Search के अंदर चरणबद्ध रूप से आ रहा है, जो ग्रह-स्तरीय पैमाने पर इसकी लागत प्रोफ़ाइल में Google के भरोसे के बारे में बहुत कुछ कहता है। शुरुआती ग्राहकों में Ashler, Palo Alto Networks और Ramp शामिल हैं।

साइडबार: 3.5 Flash Cyber और CodeMender

इसी लॉन्च में Gemini 3.5 Flash Cyber भी पेश हुआ — सुरक्षा कमज़ोरियाँ खोजने और ठीक करने के लिए फ़ाइन-ट्यून किया गया 3.5 Flash। CodeMender के अंदर, कई Flash Cyber एजेंट समानांतर काम करते हैं और अपने निष्कर्ष एक संयुक्त रिपोर्ट में मिलाते हैं, जो CyberGym पर फ्रंटियर-स्तर के प्रतिस्पर्धी प्रदर्शन तक पहुँचती है। आर्किटेक्चर पर ध्यान दें: यह वही “कुशल विशेषज्ञों का बेड़ा” पैटर्न है जिसका वर्णन यह गाइड करती है — सुरक्षा पर लागू।

एक्सेस जानबूझकर संकीर्ण है: CodeMender के ज़रिए केवल सरकारों और भरोसेमंद पार्टनर्स के लिए सीमित-एक्सेस पायलट, जो स्वचालित कमज़ोरी-खोज के दोधारी जोखिम को दर्शाता है। विवरण हमारे घोषणा अवलोकन में।

निष्कर्ष

3.5 Flash-Lite एजेंटिक वर्कलोड के लिए प्राइस-परफ़ॉर्मेंस की सीमा फिर से खींचता है: 3.5 सीरीज़ में सबसे तेज़, 3.6 Flash से लगभग 4× सस्ता, और — किसी Lite मॉडल में पहली बार — एजेंटिक बेंचमार्क पर वाक़ई भरोसेमंद। अपनी रूटिंग ऐसी बनाएँ कि Flash-Lite डिफ़ॉल्ट हो और 3.6 Flash एस्केलेशन पथ, और आपका लागत वक्र आपको धन्यवाद देगा।

संबंधित