Gemini Omni
بازگشت به همه مقالات
9 دقیقه مطالعه

Gemini 3.6 Flash در برابر 3.5 Flash: بنچمارک‌ها، قیمت‌گذاری و زمان مهاجرت (۲۰۲۶)

Gemini 3.6 Flash در همه بنچمارک‌ها از 3.5 Flash جلو می‌زند و هم‌زمان توکن خروجی را ۱۷٪ و قیمت‌ها را کاهش می‌دهد. جدول‌های مقایسه کامل به‌همراه راهنمای مهاجرت برای توسعه‌دهندگان.

Gemini 3.6 FlashGemini 3.5 FlashComparisonBenchmarksMigration2026فارسی

ارتقایی نادر از نوع «در همه‌چیز بهتر»

بیشتر ارتقاهای مدل چیزی را قربانی می‌کنند — کیفیت در برابر سرعت، قیمت در برابر توانایی. Gemini 3.6 Flash در برابر Gemini 3.5 Flash آن مورد غیرمعمولی است که مدل جدیدتر در همه محورهایی که Google در ۲۱ ژوئیه ۲۰۲۶ منتشر کرد برنده می‌شود: امتیازهای بنچمارک بالاتر، توکن خروجی کمتر، گام‌های استدلال و فراخوانی ابزار کمتر، و قیمت کمتر به ازای هر توکن. این تحلیل عمیق ابتدا اعداد را مرور می‌کند و سپس عملی می‌شود: چه کسی باید مهاجرت کند، چه زمانی، و چه چیزهایی را باید دوباره آزمود.

اگر ابتدا زمینه کامل عرضه سه‌مدلی را می‌خواهید، از مرور اطلاعیه ما شروع کنید.

بهره‌وری توکن: تیتری که هیچ‌کس نباید از آن بگذرد

تأثیرگذارترین عدد این انتشار یک امتیاز بنچمارک نیست. در شاخص Artificial Analysis، 3.6 Flash برای کار هم‌ارز ۱۷٪ توکن خروجی کمتر از 3.5 Flash مصرف می‌کند. در DeepSWE از Datacurve، Google کاهش‌هایی تا ۶۵٪ مشاهده کرده است.

Gemini 3.6 Flash در یک وظیفه OSWorld-Verified بهره‌وری توکن بهتر و پرگویی کمتری نسبت به 3.5 Flash نشان می‌دهد

چرا این از آنچه به نظر می‌رسد مهم‌تر است:

  • توکن‌های خروجی همان توکن‌های گران‌اند (۷٫۵۰ دلار در هر میلیون در برابر ۱٫۵۰ دلار در هر میلیون برای ورودی). کاهش ۱۷ تا ۶۵ درصدی آن‌ها به بزرگ‌ترین جزء هزینه حمله می‌کند.
  • توکن کمتر = تأخیر کمتر. ایجنتی که کمتر حرف می‌زند زودتر تمام می‌کند، و زنجیره‌های چندمرحله‌ای این اثر را چند برابر می‌کنند.
  • گام‌های استدلال و فراخوانی ابزار کمتر یعنی رفت‌وبرگشت کمتر، نقاط شکست کمتر و سربار هماهنگ‌سازی کمتر برای هر وظیفه.

Google یک دموی مقایسه هم‌زمان از این موضوع روی یک وظیفه استفاده از رایانه منتشر کرده — ویدیوی مقایسه بهره‌وری توکن را ببینید.

مقایسه کامل بنچمارک‌ها

بنچمارکچه چیزی را می‌سنجدGemini 3.6 FlashGemini 3.5 Flashاختلاف
DeepSWEمهندسی نرم‌افزار ایجنتیک49%37%+12 واحد
MLE Benchپژوهش و مهندسی یادگیری ماشین63.9%49.7%+14.2 واحد
OSWorld-Verifiedاستفاده از رایانه83.0%78.4%+4.6 واحد
GDPval-AA v2کار دانشی دنیای واقعی14211349+72

پیشرفت‌های کیفی Gemini 3.6 Flash نسبت به 3.5 Flash در کدنویسی، پژوهش یادگیری ماشین، استفاده از رایانه و کار دانشی

سه خوانش از این جدول:

  • جهش DeepSWE (از ۳۷٪ به ۴۹٪) همانی است که تیم‌های کدنویسی باید به آن اهمیت بدهند: Google آن را به دقت بالاتر نسبت می‌دهد — ویرایش‌های ناخواسته کد کمتر و حلقه‌های اجرای کوتاه‌تر، نه صرفاً توانایی خام بیشتر.
  • MLE Bench (با ۱۴٫۲+ واحد) بزرگ‌ترین رشد است و نشانه پیشرفتی واقعی در جریان‌های کاری پژوهش یادگیری ماشین — داربست آزمایش‌ها، تحلیل داده، اشکال‌زدایی حلقه آموزش.
  • OSWorld-Verified با ۸۳٫۰٪ از این رو مهم است که استفاده از رایانه اکنون در Gemini API و Gemini Enterprise یک ابزار توکار سمت کلاینت است. جهش توانایی و تغییر بسته‌بندی هم‌زمان از راه می‌رسند.

قیمت‌گذاری: ارزان‌تر به ازای هر توکن، ارزان‌تر به ازای هر وظیفه

Gemini 3.6 FlashGemini 3.5 Flash
قیمت ورودی۱٫۵۰ دلار / ۱ میلیون توکنبالاتر
قیمت خروجی۷٫۵۰ دلار / ۱ میلیون توکنبالاتر
توکن خروجی به ازای هر وظیفهحدود ۱۷٪ کمتر (تا ۶۵٪ در DeepSWE)خط پایه
هزینه مؤثر هر وظیفه ایجنتیکبه‌طور محسوس پایین‌ترخط پایه

نکته اصلی همین اثر مرکب است. وظیفه‌ای که پیش‌تر ۱۰۰ هزار توکن خروجی تولید می‌کرد، اکنون حدود ۸۳ هزار تولید می‌کند، و هر یک از آن توکن‌ها هم ارزان‌تر است. برای بار کاری‌ای که ماهانه میلیون‌ها وظیفه ایجنتیک اجرا می‌کند، صرفه‌جویی بدون دست‌زدن به پرامپت‌ها در صورتحساب ظاهر می‌شود.

استفاده از رایانه: از افزونه تا قابلیت توکار

با 3.6 Flash، استفاده از رایانه به‌صورت ابزار توکار سمت کلاینت از طریق Gemini API و Gemini Enterprise عرضه می‌شود. در کنار بهبود OSWorld-Verified (از ۷۸٫۴٪ به ۸۳٫۰٪)، تیم‌هایی که ایجنت‌های مرورگر، اتوماسیون به‌سبک RPA یا بات‌های QA می‌سازند، هم مدلی قوی‌تر می‌گیرند و هم کد یکپارچه‌سازی کمتری خواهند داشت. اگر پیش‌تر داربست اختصاصی استفاده از رایانه دور 3.5 Flash نگه می‌داشتید، برای حذف بخشی از آن برنامه بریزید.

وضعیت ایمنی

3.6 Flash با حفاظ‌های تقویت‌شده Frontier Safety در حوزه‌های CBRN و حملات سایبری عرضه می‌شود و Google گزارش می‌دهد که این مدل نسبت به 3.5 Flash به‌مراتب در برابر جیلبریک مقاوم‌تر است. برای تیم‌های محصول به همان اندازه مهم: این مدل همچنین آموزش دیده تا امتناع از درخواست‌های بی‌خطر را کاهش دهد. اگر 3.5 Flash گاهی پرامپت‌های مشروعِ نزدیک به حوزه امنیت یا پزشکی را در محصول شما رد می‌کرد، آن جریان‌ها را دوباره بیازمایید — نرخ امتناع اشتباه باید کاهش یابد.

مشتریان اولیه چه می‌گویند

فهرست عرضه Google — Figma، Harvey، Hebbia، JetBrains — ارزش رمزگشایی دارد:

  • Figma و JetBrains شرکت‌های ابزارسازی با استنتاج پرحجم و حساس به تأخیرند: تأییدی بر روایت سرعت و بهره‌وری.
  • Harvey (حقوقی) و Hebbia (مالی) به‌طور خاص کار چندوجهی روی اسناد را ستوده‌اند: تجزیه، تحلیل نمودار و داده، و تهیه پیش‌نویس گزارش. اگر بار کاری شما کار دانشیِ سندمحور است، رشد GDPval-AA v2 (از ۱۳۴۹ به ۱۴۲۱) شاخص مرتبط شماست.

راهنمای مهاجرت: چه زمانی جابه‌جا شوید

وضعیت شماتوصیه
کدنویسی ایجنتیک (ایجنت‌های SWE، بات‌های بازبینی کد)همین حالا مهاجرت کنید — بزرگ‌ترین دستاورد کیفیت + بهره‌وری توکن (DeepSWE با ۱۲+ واحد، تا ۶۵٪ توکن کمتر)
استفاده از رایانه / اتوماسیون مرورگرهمین حالا مهاجرت کنید — امتیازهای بهتر و ابزار توکار جایگزین داربست اختصاصی می‌شود
تجزیه اسناد / تحلیل / تهیه گزارشهمین حالا مهاجرت کنید — با موارد استفاده Harvey و Hebbia اعتبارسنجی شده
کارهای ساده پرحجم و حساس به تأخیربه‌جای آن 3.5 Flash-Lite را در نظر بگیریدراهنمای Flash-Lite ما را ببینید
پرامپت‌های به‌شدت تنظیم‌شده با تجزیه سخت‌گیرانه قالب خروجیبا احتیاط مهاجرت کنید — بهره‌وری توکن میزان پرگویی را تغییر می‌دهد؛ تجزیه‌کننده‌ها و مثال‌های few-shot را دوباره اعتبارسنجی کنید
سیستم‌های تولیدی منجمدشده به دلایل انطباقزمان‌بندی کنید — بازنشستگی اجباری اعلام نشده، اما قیمت + بهره‌وری ماندن را پرهزینه می‌کند

چک‌لیست عملی پیش از عوض‌کردن رشته مدل:

  1. مجموعه ارزیابی‌های خود را دوباره اجرا کنید — سبک خروجی فشرده‌تر و کوتاه‌تر است؛ اظهاراتی که به طول یا عبارت‌بندی پاسخ وابسته‌اند ممکن است بشکنند.
  2. تجزیه خروجی ساخت‌یافته را دوباره بررسی کنید — پرگویی کمتر معمولاً برای قابلیت اطمینان JSON خبر خوبی است، اما مطمئن شوید.
  3. جریان‌های حساس به امتناع را دوباره بیازمایید — انتظار امتناع اشتباه کمتری داشته باشید، اما تأیید کنید فیلترهای ایمنی‌تان همچنان هم‌راستا هستند.
  4. هزینه را به ازای هر وظیفه بسنجید، نه هر توکن — کاهش ۱۷ تا ۶۵ درصدی توکن یعنی مقایسه‌های به‌ازای‌هر‌توکن، صرفه‌جویی را کمتر از واقع نشان می‌دهند.

حکم نهایی

Gemini 3.6 Flash آن جانشین نادری است که هیچ بده‌بستان منتشرشده‌ای ندارد: در کدنویسی، پژوهش یادگیری ماشین، استفاده از رایانه و کار دانشی بهتر است و هم‌زمان توکن کمتری با قیمت‌های پایین‌تر تولید می‌کند. مگر آنکه پشته شما به قالب‌های خروجی منجمد وابسته باشد، مهاجرت از 3.5 Flash کمتر پرسشِ آیا است و بیشتر پرسشِ کدام اسپرینت.

مطالب مرتبط