Gemini Omni
بازگشت به همه مقالات
10 دقیقه مطالعه

راهنمای Gemini 3.5 Flash-Lite: مقیاس‌دادن جریان‌های کاری ایجنتیک با ۳۵۰ توکن بر ثانیه (۲۰۲۶)

Gemini 3.5 Flash-Lite با ۳۵۰ توکن بر ثانیه و ۰٫۳۰ دلار به ازای هر میلیون ورودی اجرا می‌شود. بنچمارک در برابر 3.1 Flash-Lite و Gemini 3 Flash، سطوح تفکر، محاسبات هزینه و جدول انتخاب مدل.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026فارسی

رده حجم بالاخره جدی شد

Gemini 3.5 Flash-Lite که در ۲۱ ژوئیه ۲۰۲۶ معرفی شد، سریع‌ترین و مقرون‌به‌صرفه‌ترین مدل رده 3.5 گوگل است: ۳۵۰ توکن خروجی در ثانیه (Artificial Analysis)، با قیمت ۰٫۳۰ دلار به ازای هر میلیون توکن ورودی و ۲٫۵۰ دلار به ازای هر میلیون توکن خروجی. از نظر تاریخی، رده‌های «Lite» جایی بودند که کیفیت در آن‌ها می‌مرد — برای دسته‌بندی و کارهای قالبی خوب، برای هر چیز ایجنتیک پرریسک. این انتشار آن الگو را می‌شکند: در چند ارزیابی ایجنتیک و کدنویسی، 3.5 Flash-Lite آشکارا از Gemini 3 Flash بزرگ‌تر جلو می‌زند.

این راهنما پوشش می‌دهد که Flash-Lite کجای چیدمان مدل‌ها می‌نشیند، سطوح تفکر آن را چگونه پیکربندی کنید، در مقیاس واقعی چقدر هزینه دارد، و برای هر بار کاری کدام مدل را انتخاب کنید. زمینه عرضه در مرور اطلاعیه ما آمده است.

جهش نسلی: در برابر 3.1 Flash-Lite

پرش از نسل قبلی Lite بزرگ‌ترین جهش در تاریخ این خانواده است:

بنچمارکچه چیزی را می‌سنجدGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1کدنویسی و وظایف ترمینال ایجنتیک54%31%
GDM-MRCR v2بازیابی در متن بلند72.2%60.1%
GDPval-AA v2اجرای وظایف دنیای واقعی1140642

مقایسه بنچمارک Gemini 3.5 Flash-Lite با نسل‌های قبلی Flash-Lite

عدد GDPval-AA v2 که تقریباً دوبرابر شده (از ۶۴۲ به ۱۱۴۰) همانی است که باید در ذهن بماند: اجرای وظایف دنیای واقعی دقیقاً همان‌جایی بود که مدل‌های Lite قدیمی در ایجنت‌های تولیدی از هم می‌پاشیدند.

شگفتی: شکست‌دادن Gemini 3 Flash

شگفت‌انگیزتر از رشد نسلی، رشد میان‌رده‌ای است. در چند ارزیابی ایجنتیک و کدنویسی، 3.5 Flash-Lite از Gemini 3 Flash — مدلی بزرگ‌تر و گران‌تر — بهتر عمل می‌کند:

بنچمارکGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

اگر امروز به این دلیل بارهای کاری را روی 2.5 Flash یا 3 Flash اجرا می‌کنید که به رده‌های Lite در کار ایجنتیک نمی‌شد اعتماد کرد، آن فرض حالا کهنه شده — Flash-Lite در این وظایف هم سریع‌تر است و هم تواناتر.

سطوح تفکر: یک مدل، دو حالت کاری

Flash-Lite با سطوح تفکر قابل‌تنظیم عرضه می‌شود که عملاً آن را به دو محصول تبدیل می‌کند:

  • تفکر minimal / low — اولویت با تأخیر و هزینه برای کارهای پرحجم: جست‌وجوی ایجنتیک، پردازش اسناد، استخراج، دسته‌بندی، مسیریابی. این همان حالت ۳۵۰ توکن بر ثانیه است.
  • سطوح تفکر بالاتر — فعال‌کردن استدلال عمیق‌تر برای بارهای کاری زیرایجنت چندمرحله‌ای، جایی که Flash-Lite به‌عنوان کارگر زیر نظر یک مدل هماهنگ‌کننده عمل می‌کند.

آن حالت دوم با الگوی دموی خود Google هم‌خوان است: 3.6 Flash در نقش ایجنت اصلی و ناوگان‌هایی از زیرایجنت‌های 3.5 Flash-Lite که موازی کار می‌کنند (یک دمو هم‌زمان ۲۵ کانسپت طراحی وب تولید می‌کند). استفاده از رایانه هم در Flash-Lite یک ابزار توکار است، پس زیرایجنت‌ها می‌توانند بدون داربست اضافه با رابط‌های کاربری کار کنند. برای دیدن تفاوت تأخیر در کارهای پرحجم، دموی سرعت Flash-Lite در برابر 3.5 Flash گوگل (ویدیو) را ببینید.

تحلیل هزینه: مقیاس واقعاً چقدر خرج دارد

قیمت‌ها: ۰٫۳۰ دلار در هر میلیون ورودی، ۲٫۵۰ دلار در هر میلیون خروجی. یک بار کاری نمونه — ایجنت پردازش اسناد که ماهانه ۱ میلیون سند را رسیدگی می‌کند، با میانگین ۳ هزار توکن ورودی و ۵۰۰ توکن خروجی برای هر سند:

جزء هزینهمحاسبههزینه ماهانه
توکن‌های ورودی۱ میلیون سند × ۳ هزار توکن = ۳ میلیارد توکن × ۰٫۳۰ دلار در هر میلیون۹۰۰ دلار
توکن‌های خروجی۱ میلیون سند × ۵۰۰ توکن = ۰٫۵ میلیارد توکن × ۲٫۵۰ دلار در هر میلیون۱٬۲۵۰ دلار
جمع روی 3.5 Flash-Lite۲٬۱۵۰ دلار
همان بار کاری روی 3.6 Flash (۱٫۵۰ / ۷٫۵۰ دلار)۴٬۵۰۰ دلار + ۳٬۷۵۰ دلار۸٬۲۵۰ دلار

تقریباً ۴ برابر اختلاف هزینه برای بار کاری‌ای که Lite به‌خوبی از پس آن برمی‌آید — و با ۳۵۰ توکن بر ثانیه، خلاصه ۵۰۰ توکنی هر سند در کمتر از ۱٫۵ ثانیه استریم می‌شود. استراتژی حاصل: ۹۰٪ حجم روتین را به Flash-Lite بسپارید و ۱۰٪ دشوار را به 3.6 Flash ارجاع دهید.

جدول تصمیم: کدام مدل برای کدام بار کاری

بار کاریانتخابچرا
جست‌وجوی ایجنتیک / RAG با QPS بالا3.5 Flash-Lite (تفکر minimal)۳۵۰ توکن بر ثانیه، کمترین هزینه به ازای هر پرس‌وجو
پردازش / استخراج انبوه اسناد3.5 Flash-Lite۴ برابر ارزان‌تر از 3.6 Flash؛ متن بلند GDM-MRCR v2 با ۷۲٫۲٪
دسته‌بندی، مسیریابی، نظارت محتوا3.5 Flash-Lite (تفکر minimal)حساس به تأخیر، با حاشیه کیفیت فراوان
ناوگان زیرایجنت‌های موازی زیر یک هماهنگ‌کننده3.5 Flash-Lite (تفکر بالاتر)حالتی که برای همین ساخته شده؛ استفاده از رایانه توکار
کدنویسی ایجنتیک پیچیده (ایجنت‌های SWE)3.6 FlashDeepSWE با ۴۹٪؛ دقت بالاتر، ویرایش‌های بد کمتر
جریان‌های کاری پژوهش یادگیری ماشین3.6 FlashMLE Bench با ۶۳٫۹٪ در برابر ۴۹٫۷٪ برای 3.5 Flash
ایجنت‌های استفاده از رایانه در وظایف دشوار3.6 FlashOSWorld-Verified با ۸۳٫۰٪ (در برابر ۷۴٫۰٪ برای Lite)
تحلیل چندوجهی اسناد و تهیه گزارش3.6 Flashدر زمان عرضه توسط Harvey / Hebbia تأیید شد
خطوط لوله قدیمی که هنوز روی 3.5 Flash هستندبه بالا یا پایین مهاجرت کنید3.6 Flash برای کیفیت، Flash-Lite برای حجم — راهنمای مهاجرت را ببینید
تشخیص و وصله آسیب‌پذیری‌های امنیتی3.5 Flash Cyberفقط از طریق پایلوت CodeMender (دولت‌ها و شرکای مورد اعتماد)

قاعده سرانگشتی: پیش‌فرض را Flash-Lite بگذارید و هنگام شکست ارتقا دهید، نه اینکه مدل بزرگ را پیش‌فرض کنید و بعداً بهینه‌سازی کنید. حالت شکست قابل مشاهده است (خروجی‌های بد)؛ اتلافِ بیش‌تأمین اما بی‌صداست.

کجا در دسترس است

3.5 Flash-Lite امروز در Gemini API (Google AI Studio، Android Studio)، Gemini Enterprise Agent Platform و اپ Gemini فعال است — و به‌تدریج درون جست‌وجوی Google عرضه می‌شود، که درباره اعتماد Google به پروفایل هزینه آن در مقیاس سیاره‌ای حرف زیادی می‌زند. از مشتریان اولیه می‌توان Ashler، Palo Alto Networks و Ramp را نام برد.

حاشیه: 3.5 Flash Cyber و CodeMender

همین عرضه Gemini 3.5 Flash Cyber را نیز معرفی کرد — نسخه‌ای از 3.5 Flash که برای یافتن و رفع آسیب‌پذیری‌های امنیتی تنظیم دقیق شده است. درون CodeMender، چندین ایجنت Flash Cyber به‌صورت موازی کار می‌کنند و یافته‌هایشان را در یک گزارش ترکیبی واحد ادغام می‌کنند و در CyberGym به عملکردی هم‌تراز مدل‌های پیشتاز می‌رسند. به معماری دقت کنید: این همان الگوی «ناوگان متخصصان بهره‌ور» است که این راهنما توصیف می‌کند، این بار در حوزه امنیت.

دسترسی عمداً باریک است: پایلوت با دسترسی محدود، به‌طور انحصاری برای دولت‌ها و شرکای مورد اعتماد از طریق CodeMender، که بازتاب ریسک دومنظوره کشف خودکار آسیب‌پذیری است. جزئیات در مرور اطلاعیه ما.

جمع‌بندی

3.5 Flash-Lite مرز قیمت-عملکرد را برای بارهای کاری ایجنتیک از نو ترسیم می‌کند: سریع‌تر از هر چیزی در سری 3.5، تقریباً ۴ برابر ارزان‌تر از 3.6 Flash، و — برای نخستین بار در یک مدل Lite — واقعاً قابل‌اعتماد در بنچمارک‌های ایجنتیک. مسیریابی‌تان را طوری بسازید که Flash-Lite پیش‌فرض و 3.6 Flash مسیر ارتقا باشد؛ منحنی هزینه‌تان از شما تشکر خواهد کرد.

مطالب مرتبط