راهنمای Gemini 3.5 Flash-Lite: مقیاسدادن جریانهای کاری ایجنتیک با ۳۵۰ توکن بر ثانیه (۲۰۲۶)
Gemini 3.5 Flash-Lite با ۳۵۰ توکن بر ثانیه و ۰٫۳۰ دلار به ازای هر میلیون ورودی اجرا میشود. بنچمارک در برابر 3.1 Flash-Lite و Gemini 3 Flash، سطوح تفکر، محاسبات هزینه و جدول انتخاب مدل.
رده حجم بالاخره جدی شد
Gemini 3.5 Flash-Lite که در ۲۱ ژوئیه ۲۰۲۶ معرفی شد، سریعترین و مقرونبهصرفهترین مدل رده 3.5 گوگل است: ۳۵۰ توکن خروجی در ثانیه (Artificial Analysis)، با قیمت ۰٫۳۰ دلار به ازای هر میلیون توکن ورودی و ۲٫۵۰ دلار به ازای هر میلیون توکن خروجی. از نظر تاریخی، ردههای «Lite» جایی بودند که کیفیت در آنها میمرد — برای دستهبندی و کارهای قالبی خوب، برای هر چیز ایجنتیک پرریسک. این انتشار آن الگو را میشکند: در چند ارزیابی ایجنتیک و کدنویسی، 3.5 Flash-Lite آشکارا از Gemini 3 Flash بزرگتر جلو میزند.
این راهنما پوشش میدهد که Flash-Lite کجای چیدمان مدلها مینشیند، سطوح تفکر آن را چگونه پیکربندی کنید، در مقیاس واقعی چقدر هزینه دارد، و برای هر بار کاری کدام مدل را انتخاب کنید. زمینه عرضه در مرور اطلاعیه ما آمده است.
جهش نسلی: در برابر 3.1 Flash-Lite
پرش از نسل قبلی Lite بزرگترین جهش در تاریخ این خانواده است:
| بنچمارک | چه چیزی را میسنجد | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | کدنویسی و وظایف ترمینال ایجنتیک | 54% | 31% |
| GDM-MRCR v2 | بازیابی در متن بلند | 72.2% | 60.1% |
| GDPval-AA v2 | اجرای وظایف دنیای واقعی | 1140 | 642 |

عدد GDPval-AA v2 که تقریباً دوبرابر شده (از ۶۴۲ به ۱۱۴۰) همانی است که باید در ذهن بماند: اجرای وظایف دنیای واقعی دقیقاً همانجایی بود که مدلهای Lite قدیمی در ایجنتهای تولیدی از هم میپاشیدند.
شگفتی: شکستدادن Gemini 3 Flash
شگفتانگیزتر از رشد نسلی، رشد میانردهای است. در چند ارزیابی ایجنتیک و کدنویسی، 3.5 Flash-Lite از Gemini 3 Flash — مدلی بزرگتر و گرانتر — بهتر عمل میکند:
| بنچمارک | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
اگر امروز به این دلیل بارهای کاری را روی 2.5 Flash یا 3 Flash اجرا میکنید که به ردههای Lite در کار ایجنتیک نمیشد اعتماد کرد، آن فرض حالا کهنه شده — Flash-Lite در این وظایف هم سریعتر است و هم تواناتر.
سطوح تفکر: یک مدل، دو حالت کاری
Flash-Lite با سطوح تفکر قابلتنظیم عرضه میشود که عملاً آن را به دو محصول تبدیل میکند:
- تفکر minimal / low — اولویت با تأخیر و هزینه برای کارهای پرحجم: جستوجوی ایجنتیک، پردازش اسناد، استخراج، دستهبندی، مسیریابی. این همان حالت ۳۵۰ توکن بر ثانیه است.
- سطوح تفکر بالاتر — فعالکردن استدلال عمیقتر برای بارهای کاری زیرایجنت چندمرحلهای، جایی که Flash-Lite بهعنوان کارگر زیر نظر یک مدل هماهنگکننده عمل میکند.
آن حالت دوم با الگوی دموی خود Google همخوان است: 3.6 Flash در نقش ایجنت اصلی و ناوگانهایی از زیرایجنتهای 3.5 Flash-Lite که موازی کار میکنند (یک دمو همزمان ۲۵ کانسپت طراحی وب تولید میکند). استفاده از رایانه هم در Flash-Lite یک ابزار توکار است، پس زیرایجنتها میتوانند بدون داربست اضافه با رابطهای کاربری کار کنند. برای دیدن تفاوت تأخیر در کارهای پرحجم، دموی سرعت Flash-Lite در برابر 3.5 Flash گوگل (ویدیو) را ببینید.
تحلیل هزینه: مقیاس واقعاً چقدر خرج دارد
قیمتها: ۰٫۳۰ دلار در هر میلیون ورودی، ۲٫۵۰ دلار در هر میلیون خروجی. یک بار کاری نمونه — ایجنت پردازش اسناد که ماهانه ۱ میلیون سند را رسیدگی میکند، با میانگین ۳ هزار توکن ورودی و ۵۰۰ توکن خروجی برای هر سند:
| جزء هزینه | محاسبه | هزینه ماهانه |
|---|---|---|
| توکنهای ورودی | ۱ میلیون سند × ۳ هزار توکن = ۳ میلیارد توکن × ۰٫۳۰ دلار در هر میلیون | ۹۰۰ دلار |
| توکنهای خروجی | ۱ میلیون سند × ۵۰۰ توکن = ۰٫۵ میلیارد توکن × ۲٫۵۰ دلار در هر میلیون | ۱٬۲۵۰ دلار |
| جمع روی 3.5 Flash-Lite | ۲٬۱۵۰ دلار | |
| همان بار کاری روی 3.6 Flash (۱٫۵۰ / ۷٫۵۰ دلار) | ۴٬۵۰۰ دلار + ۳٬۷۵۰ دلار | ۸٬۲۵۰ دلار |
تقریباً ۴ برابر اختلاف هزینه برای بار کاریای که Lite بهخوبی از پس آن برمیآید — و با ۳۵۰ توکن بر ثانیه، خلاصه ۵۰۰ توکنی هر سند در کمتر از ۱٫۵ ثانیه استریم میشود. استراتژی حاصل: ۹۰٪ حجم روتین را به Flash-Lite بسپارید و ۱۰٪ دشوار را به 3.6 Flash ارجاع دهید.
جدول تصمیم: کدام مدل برای کدام بار کاری
| بار کاری | انتخاب | چرا |
|---|---|---|
| جستوجوی ایجنتیک / RAG با QPS بالا | 3.5 Flash-Lite (تفکر minimal) | ۳۵۰ توکن بر ثانیه، کمترین هزینه به ازای هر پرسوجو |
| پردازش / استخراج انبوه اسناد | 3.5 Flash-Lite | ۴ برابر ارزانتر از 3.6 Flash؛ متن بلند GDM-MRCR v2 با ۷۲٫۲٪ |
| دستهبندی، مسیریابی، نظارت محتوا | 3.5 Flash-Lite (تفکر minimal) | حساس به تأخیر، با حاشیه کیفیت فراوان |
| ناوگان زیرایجنتهای موازی زیر یک هماهنگکننده | 3.5 Flash-Lite (تفکر بالاتر) | حالتی که برای همین ساخته شده؛ استفاده از رایانه توکار |
| کدنویسی ایجنتیک پیچیده (ایجنتهای SWE) | 3.6 Flash | DeepSWE با ۴۹٪؛ دقت بالاتر، ویرایشهای بد کمتر |
| جریانهای کاری پژوهش یادگیری ماشین | 3.6 Flash | MLE Bench با ۶۳٫۹٪ در برابر ۴۹٫۷٪ برای 3.5 Flash |
| ایجنتهای استفاده از رایانه در وظایف دشوار | 3.6 Flash | OSWorld-Verified با ۸۳٫۰٪ (در برابر ۷۴٫۰٪ برای Lite) |
| تحلیل چندوجهی اسناد و تهیه گزارش | 3.6 Flash | در زمان عرضه توسط Harvey / Hebbia تأیید شد |
| خطوط لوله قدیمی که هنوز روی 3.5 Flash هستند | به بالا یا پایین مهاجرت کنید | 3.6 Flash برای کیفیت، Flash-Lite برای حجم — راهنمای مهاجرت را ببینید |
| تشخیص و وصله آسیبپذیریهای امنیتی | 3.5 Flash Cyber | فقط از طریق پایلوت CodeMender (دولتها و شرکای مورد اعتماد) |
قاعده سرانگشتی: پیشفرض را Flash-Lite بگذارید و هنگام شکست ارتقا دهید، نه اینکه مدل بزرگ را پیشفرض کنید و بعداً بهینهسازی کنید. حالت شکست قابل مشاهده است (خروجیهای بد)؛ اتلافِ بیشتأمین اما بیصداست.
کجا در دسترس است
3.5 Flash-Lite امروز در Gemini API (Google AI Studio، Android Studio)، Gemini Enterprise Agent Platform و اپ Gemini فعال است — و بهتدریج درون جستوجوی Google عرضه میشود، که درباره اعتماد Google به پروفایل هزینه آن در مقیاس سیارهای حرف زیادی میزند. از مشتریان اولیه میتوان Ashler، Palo Alto Networks و Ramp را نام برد.
حاشیه: 3.5 Flash Cyber و CodeMender
همین عرضه Gemini 3.5 Flash Cyber را نیز معرفی کرد — نسخهای از 3.5 Flash که برای یافتن و رفع آسیبپذیریهای امنیتی تنظیم دقیق شده است. درون CodeMender، چندین ایجنت Flash Cyber بهصورت موازی کار میکنند و یافتههایشان را در یک گزارش ترکیبی واحد ادغام میکنند و در CyberGym به عملکردی همتراز مدلهای پیشتاز میرسند. به معماری دقت کنید: این همان الگوی «ناوگان متخصصان بهرهور» است که این راهنما توصیف میکند، این بار در حوزه امنیت.
دسترسی عمداً باریک است: پایلوت با دسترسی محدود، بهطور انحصاری برای دولتها و شرکای مورد اعتماد از طریق CodeMender، که بازتاب ریسک دومنظوره کشف خودکار آسیبپذیری است. جزئیات در مرور اطلاعیه ما.
جمعبندی
3.5 Flash-Lite مرز قیمت-عملکرد را برای بارهای کاری ایجنتیک از نو ترسیم میکند: سریعتر از هر چیزی در سری 3.5، تقریباً ۴ برابر ارزانتر از 3.6 Flash، و — برای نخستین بار در یک مدل Lite — واقعاً قابلاعتماد در بنچمارکهای ایجنتیک. مسیریابیتان را طوری بسازید که Flash-Lite پیشفرض و 3.6 Flash مسیر ارتقا باشد؛ منحنی هزینهتان از شما تشکر خواهد کرد.