Gemini 3.6 Flash مقابل 3.5 Flash: المعايير والأسعار ومتى تنتقل (2026)
يتفوق Gemini 3.6 Flash على 3.5 Flash في كل معيار مع خفض توكنات الإخراج 17% والأسعار أيضًا. جداول مقارنة كاملة مع خطة انتقال عملية للمطورين.
ترقية نادرة “أفضل من كل النواحي”
معظم ترقيات النماذج تضحّي بشيء ما — الجودة مقابل السرعة، أو السعر مقابل القدرة. أما Gemini 3.6 Flash مقابل Gemini 3.5 Flash فهو الحالة غير المعتادة التي يفوز فيها النموذج الأحدث على كل محور نشرته Google في 21 يوليو 2026: نتائج معايير أعلى، وتوكنات إخراج أقل، وخطوات استدلال واستدعاءات أدوات أقل، وسعر أقل لكل توكن. يستعرض هذا التحليل المعمّق الأرقام أولًا، ثم ينتقل إلى الجانب العملي: من ينبغي أن ينتقل، ومتى، وما الذي يجب إعادة اختباره.
إن أردت أولًا السياق الكامل لإطلاق النماذج الثلاثة، فابدأ بـنظرتنا العامة على الإعلان.
كفاءة التوكنات: العنوان الذي لا ينبغي لأحد تجاوزه
الرقم الأكثر تأثيرًا في هذا الإصدار ليس نتيجة معيار. فعلى مؤشر Artificial Analysis، يستهلك 3.6 Flash توكنات إخراج أقل بنسبة 17% من 3.5 Flash للعمل نفسه. وعلى DeepSWE من Datacurve، رصدت Google انخفاضًا يصل إلى 65%.

لماذا يهم هذا أكثر مما يبدو:
- توكنات الإخراج هي الأغلى (7.50$ لكل مليون مقابل 1.50$ لكل مليون للإدخال). وخفضها بنسبة 17–65% يضرب أكبر بند في التكلفة.
- توكنات أقل = زمن استجابة أقل. الوكيل الذي يقول أقل ينتهي أسرع، وتضاعف السلاسل متعددة الخطوات هذا الأثر.
- خطوات استدلال واستدعاءات أدوات أقل تعني جولات ذهاب وإياب أقل، ونقاط فشل أقل، وعبء تنسيق أقل لكل مهمة.
نشرت Google عرضًا توضيحيًا جنبًا إلى جنب لذلك على مهمة استخدام حاسوب — شاهد فيديو مقارنة كفاءة التوكنات.
مقارنة المعايير الكاملة
| المعيار | ما يقيسه | Gemini 3.6 Flash | Gemini 3.5 Flash | الفارق |
|---|---|---|---|---|
| DeepSWE | هندسة البرمجيات الوكيلية | 49% | 37% | +12 نقطة |
| MLE Bench | أبحاث وهندسة تعلم الآلة | 63.9% | 49.7% | +14.2 نقطة |
| OSWorld-Verified | استخدام الحاسوب | 83.0% | 78.4% | +4.6 نقطة |
| GDPval-AA v2 | الأعمال المعرفية الواقعية | 1421 | 1349 | +72 |

ثلاث قراءات للجدول:
- قفزة DeepSWE (37% ← 49%) هي التي ينبغي أن تهتم بها فرق البرمجة: تعزوها Google إلى دقة أعلى — تعديلات أكواد غير مرغوبة أقل وحلقات تنفيذ أقصر، لا مجرد قدرة خام أكبر.
- MLE Bench (+14.2 نقطة) هي المكسب الأكبر، وتشير إلى نقلة حقيقية في مسارات أبحاث تعلم الآلة — إعداد التجارب، وتحليل البيانات، وتصحيح حلقات التدريب.
- OSWorld-Verified بنسبة 83.0% يهم لأن استخدام الحاسوب أصبح الآن أداة مدمجة على جانب العميل في Gemini API وGemini Enterprise. القفزة في القدرة وتغيير طريقة التغليف وصلا معًا.
التسعير: أرخص لكل توكن، وأرخص لكل مهمة
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| سعر الإدخال | 1.50$ / مليون توكن | أعلى |
| سعر الإخراج | 7.50$ / مليون توكن | أعلى |
| توكنات الإخراج لكل مهمة | أقل بنحو 17% (حتى 65% على DeepSWE) | خط الأساس |
| التكلفة الفعلية لكل مهمة وكيلية | أقل بشكل ملموس | خط الأساس |
التراكم هو بيت القصيد. المهمة التي كانت تُصدر 100 ألف توكن إخراج تُصدر الآن نحو 83 ألفًا، وكل توكن منها يكلف أقل. وبالنسبة لحمل عمل يشغّل ملايين المهام الوكيلية شهريًا، تظهر الوفورات في الفاتورة دون أن تلمس مطالباتك.
استخدام الحاسوب: من إضافة إلى ميزة مدمجة
مع 3.6 Flash، يأتي استخدام الحاسوب كأداة مدمجة على جانب العميل عبر Gemini API وGemini Enterprise. وبضم ذلك إلى تحسّن OSWorld-Verified (78.4% ← 83.0%)، تحصل الفرق التي تبني وكلاء متصفح أو أتمتة على نمط RPA أو روبوتات فحص الجودة على نموذج أقوى وكود تكامل أقل معًا. إن كنت تحافظ سابقًا على بنية استخدام حاسوب مخصصة حول 3.5 Flash، فخطط لحذف جزء منها.
الموقف الأمني
يأتي 3.6 Flash مع ضمانات Frontier Safety معزّزة في مجالي CBRN والهجمات السيبرانية، وتفيد Google بأنه أكثر مقاومة بكثير لكسر الحماية من 3.5 Flash. وما يهم فرق المنتجات بالقدر نفسه: أنه دُرّب أيضًا على تقليل الرفض للطلبات المشروعة. إن كان 3.5 Flash يرفض أحيانًا مطالبات مشروعة قريبة من الأمن أو الطب في منتجك، فأعد اختبار تلك المسارات — يُفترض أن ينخفض معدل الرفض الخاطئ.
ماذا يقول العملاء الأوائل
قائمة إطلاق Google — Figma وHarvey وHebbia وJetBrains — تستحق فك شفرتها:
- Figma وJetBrains شركتا أدوات ذواتا استدلال عالي الحجم وحساس لزمن الاستجابة: أي تزكية لقصة السرعة والكفاءة.
- Harvey (القانون) وHebbia (المال) أشادتا تحديدًا بالعمل متعدد الوسائط على المستندات: التحليل، وقراءة الرسوم البيانية والبيانات، وصياغة التقارير. إن كان عملك معرفيًا كثيف المستندات، فمكسب GDPval-AA v2 (1349 ← 1421) هو مؤشرك الأنسب.
خطة الانتقال: متى تبدّل
| وضعك | التوصية |
|---|---|
| برمجة وكيلية (وكلاء SWE، روبوتات مراجعة الأكواد) | انتقل الآن — أكبر مكاسب الجودة وكفاءة التوكنات (DeepSWE +12 نقطة، وحتى 65% توكنات أقل) |
| استخدام الحاسوب / أتمتة المتصفح | انتقل الآن — نتائج أفضل وأدوات مدمجة تحل محل البنية المخصصة |
| تحليل المستندات / التحليل / صياغة التقارير | انتقل الآن — أثبتته حالات استخدام Harvey وHebbia |
| مهام بسيطة عالية الحجم وحساسة لزمن الاستجابة | فكّر في 3.5 Flash-Lite بدلًا منه — راجع دليل Flash-Lite |
| مطالبات مضبوطة بعناية مع تحليل صارم لتنسيق الإخراج | انتقل بحذر — تغيّر كفاءة التوكنات درجة الإسهاب؛ أعد التحقق من المحلّلات وأمثلة few-shot |
| أنظمة إنتاج مجمّدة لأسباب امتثالية | جدوله — لا إيقاف إجباري معلن، لكن السعر والكفاءة يجعلان البقاء مكلفًا |
قائمة تحقق عملية قبل تبديل سلسلة النموذج:
- أعد تشغيل حزمة التقييمات لديك — أسلوب الإخراج أصبح أكثر إحكامًا وأقصر؛ وقد تنكسر التوكيدات المعتمدة على طول الاستجابة أو صياغتها.
- أعد فحص تحليل المخرجات المهيكلة — الإسهاب الأقل خبر سار عادة لموثوقية JSON، لكن تحقق بنفسك.
- أعد اختبار المسارات الحساسة للرفض — توقّع رفضًا خاطئًا أقل، لكن تأكد من أن مرشحات الأمان لديك لا تزال متوافقة.
- أعد قياس التكلفة لكل مهمة، لا لكل توكن — انخفاض التوكنات بنسبة 17–65% يعني أن المقارنات لكل توكن تبخس الوفورات حقها.
الحكم النهائي
Gemini 3.6 Flash هو الخلَف النادر بلا أي مقايضة منشورة: أفضل في البرمجة وأبحاث تعلم الآلة واستخدام الحاسوب والأعمال المعرفية، مع إصدار توكنات أقل بأسعار أدنى. وما لم يعتمد نظامك على تنسيقات إخراج مجمّدة، فالانتقال من 3.5 Flash ليس سؤال هل، بل سؤال أي سبرنت.