دليل Gemini 3.5 Flash-Lite: توسيع مسارات العمل الوكيلية بسرعة 350 توكن/ثانية (2026)
يعمل Gemini 3.5 Flash-Lite بسرعة 350 توكن/ثانية وبسعر 0.30$ لكل مليون إدخال. معايير مقابل 3.1 Flash-Lite وGemini 3 Flash، ومستويات التفكير، وحسابات التكلفة، وجدول اختيار النموذج.
فئة الحجم الكبير أصبحت جادّة أخيرًا
Gemini 3.5 Flash-Lite، المُعلن عنه في 21 يوليو 2026، هو أسرع نماذج Google في فئة 3.5 وأكثرها فعالية من حيث التكلفة: 350 توكن إخراج في الثانية (Artificial Analysis)، بسعر 0.30$ لكل مليون توكن إدخال و2.50$ لكل مليون توكن إخراج. تاريخيًا، كانت فئات “Lite” هي المكان الذي تذهب فيه الجودة لتموت — جيدة للتصنيف والقوالب الجاهزة، وخطرة على أي شيء وكيلي. هذا الإصدار يكسر ذلك النمط: ففي عدة تقييمات وكيلية وبرمجية، يتفوق 3.5 Flash-Lite صراحة على Gemini 3 Flash الأكبر حجمًا.
يغطي هذا الدليل موقع Flash-Lite في التشكيلة، وكيفية ضبط مستويات تفكيره، وتكلفته الفعلية على نطاق واسع، وأي نموذج تختار لأي حمل عمل. سياق الإطلاق موجود في نظرتنا العامة على الإعلان.
قفزة جيلية: مقابل 3.1 Flash-Lite
القفزة عن جيل Lite السابق هي الأكبر في تاريخ هذه العائلة:
| المعيار | ما يقيسه | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | مهام البرمجة والطرفية الوكيلية | 54% | 31% |
| GDM-MRCR v2 | الاسترجاع في السياق الطويل | 72.2% | 60.1% |
| GDPval-AA v2 | تنفيذ المهام الواقعية | 1140 | 642 |

رقم GDPval-AA v2 الذي كاد يتضاعف (642 ← 1140) هو ما يجب استيعابه: تنفيذ المهام الواقعية كان بالضبط المكان الذي كانت تنهار فيه نماذج Lite القديمة داخل وكلاء الإنتاج.
المفاجأة: التفوق على Gemini 3 Flash
الأكثر إدهاشًا من المكسب الجيلي هو المكسب عبر الفئات. ففي عدة تقييمات وكيلية وبرمجية، يتفوق 3.5 Flash-Lite على Gemini 3 Flash — نموذج أكبر وأغلى:
| المعيار | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
إن كنت تشغّل أحمال عمل على 2.5 Flash أو 3 Flash اليوم لأن فئات Lite لم تكن جديرة بالثقة في العمل الوكيلي، فهذا الافتراض أصبح باليًا — فـ Flash-Lite أسرع وأقدر معًا في هذه المهام.
مستويات التفكير: نموذج واحد، وضعا تشغيل
يأتي Flash-Lite مع مستويات تفكير قابلة للضبط، ما يجعله فعليًا منتجَين اثنين:
- تفكير minimal / low — أولوية لزمن الاستجابة والتكلفة في المهام عالية الحجم: البحث الوكيلي، ومعالجة المستندات، والاستخلاص، والتصنيف، والتوجيه. هذا هو وضع 350 توكن/ثانية.
- مستويات تفكير أعلى — تفعيل استدلال أعمق لأحمال الوكلاء الفرعيين متعددة الخطوات، حيث يعمل Flash-Lite عاملًا تحت إمرة نموذج منسّق.
الوضع الثاني يطابق نمط عروض Google نفسها: 3.6 Flash وكيلًا رئيسيًا، وأساطيل من وكلاء 3.5 Flash-Lite الفرعيين تنجز العمل بالتوازي (أحد العروض يولّد 25 مفهوم تصميم ويب في آن واحد). واستخدام الحاسوب أداة مدمجة في Flash-Lite أيضًا، فيمكن للوكلاء الفرعيين تشغيل الواجهات دون بنية إضافية. شاهد عرض Google لسرعة Flash-Lite مقابل 3.5 Flash (فيديو) لفارق زمن الاستجابة في المهام عالية الحجم.
تحليل التكلفة: كم يكلّف التوسع فعليًا
الأسعار: 0.30$ لكل مليون إدخال، و2.50$ لكل مليون إخراج. إليك حمل عمل نموذجيًا — وكيل معالجة مستندات يتعامل مع مليون مستند شهريًا، بمتوسط 3 آلاف توكن إدخال و500 توكن إخراج لكل مستند:
| بند التكلفة | الحساب | التكلفة الشهرية |
|---|---|---|
| توكنات الإدخال | مليون مستند × 3 آلاف توكن = 3 مليارات توكن × 0.30$ لكل مليون | 900$ |
| توكنات الإخراج | مليون مستند × 500 توكن = 0.5 مليار توكن × 2.50$ لكل مليون | 1,250$ |
| الإجمالي على 3.5 Flash-Lite | 2,150$ | |
| الحمل نفسه على 3.6 Flash (1.50$ / 7.50$) | 4,500$ + 3,750$ | 8,250$ |
فارق تكلفة يقارب 4 أضعاف لحمل عمل يجيد Lite التعامل معه — وبسرعة 350 توكن/ثانية، يتدفق ملخص كل مستند البالغ 500 توكن في أقل من 1.5 ثانية. والاستراتيجية المترتبة على ذلك: وجّه الـ 90% الروتينية من الحجم إلى Flash-Lite، وصعّد الـ 10% الصعبة إلى 3.6 Flash.
جدول القرار: أي نموذج لأي حمل عمل
| حمل العمل | الاختيار | السبب |
|---|---|---|
| بحث وكيلي / RAG بمعدل استعلامات مرتفع | 3.5 Flash-Lite (تفكير minimal) | 350 توكن/ثانية، أقل تكلفة لكل استعلام |
| معالجة / استخلاص مستندات بالجملة | 3.5 Flash-Lite | أرخص 4 مرات من 3.6 Flash؛ سياق طويل GDM-MRCR v2 بنسبة 72.2% |
| تصنيف وتوجيه وإشراف على المحتوى | 3.5 Flash-Lite (تفكير minimal) | حساس لزمن الاستجابة، مع هامش جودة وافر |
| أساطيل وكلاء فرعيين متوازية تحت منسّق | 3.5 Flash-Lite (تفكير أعلى) | وضع مصمم لهذا الغرض؛ استخدام الحاسوب مدمج |
| برمجة وكيلية معقدة (وكلاء SWE) | 3.6 Flash | DeepSWE بنسبة 49%؛ دقة أعلى وتعديلات سيئة أقل |
| مسارات أبحاث تعلم الآلة | 3.6 Flash | MLE Bench بنسبة 63.9% مقابل 49.7% لـ 3.5 Flash |
| وكلاء استخدام الحاسوب في المهام الصعبة | 3.6 Flash | OSWorld-Verified بنسبة 83.0% (مقابل 74.0% لـ Lite) |
| تحليل مستندات متعدد الوسائط وصياغة تقارير | 3.6 Flash | أثبتته Harvey / Hebbia عند الإطلاق |
| خطوط قديمة لا تزال على 3.5 Flash | انتقل للأعلى أو للأسفل | 3.6 Flash للجودة، وFlash-Lite للحجم — راجع دليل الانتقال |
| اكتشاف الثغرات الأمنية وترقيعها | 3.5 Flash Cyber | فقط عبر برنامج CodeMender التجريبي (الحكومات والشركاء الموثوقون) |
القاعدة الذهبية: اجعل Flash-Lite الخيار الافتراضي وصعّد عند الفشل، بدلًا من اعتماد النموذج الكبير افتراضيًا ثم التحسين لاحقًا. فنمط الفشل مرئي (مخرجات سيئة)؛ أما هدر الإفراط في التجهيز فصامت.
أين هو متاح
3.5 Flash-Lite متاح اليوم في Gemini API (Google AI Studio وAndroid Studio)، وGemini Enterprise Agent Platform، وتطبيق Gemini — وهو يُطرح تدريجيًا داخل بحث Google، وهذا يقول الكثير عن ثقة Google في ملف تكلفته على نطاق كوكبي. من العملاء الأوائل: Ashler وPalo Alto Networks وRamp.
على الهامش: 3.5 Flash Cyber وCodeMender
قدّم الإطلاق نفسه Gemini 3.5 Flash Cyber — نسخة 3.5 Flash مضبوطة بدقة لاكتشاف الثغرات الأمنية وإصلاحها. داخل CodeMender، يعمل عدة وكلاء Flash Cyber بالتوازي ويدمجون نتائجهم في تقرير موحّد واحد، محققين أداءً منافسًا للنماذج الرائدة على CyberGym. لاحظ البنية: إنه نمط “أسطول المتخصصين ذوي الكفاءة” نفسه الذي يصفه هذا الدليل، مطبقًا على الأمن.
الوصول ضيق عن قصد: برنامج تجريبي محدود الوصول حصريًا للحكومات والشركاء الموثوقين عبر CodeMender، بما يعكس خطر الاستخدام المزدوج لاكتشاف الثغرات الآلي. التفاصيل في نظرتنا العامة على الإعلان.
الخلاصة
يعيد 3.5 Flash-Lite رسم حدود السعر مقابل الأداء لأحمال العمل الوكيلية: أسرع من أي شيء في سلسلة 3.5، وأرخص بنحو 4 أضعاف من 3.6 Flash، و— لأول مرة في نموذج Lite — جدير بالثقة فعلًا في المعايير الوكيلية. ابنِ توجيهك بحيث يكون Flash-Lite هو الافتراضي و3.6 Flash هو مسار التصعيد، وسيشكرك منحنى تكاليفك.