מדריך Gemini 3.5 Flash-Lite: הרחבת תהליכי עבודה סוכניים ב-350 טוקנים/שנייה (2026)
Gemini 3.5 Flash-Lite רץ ב-350 טוקנים/שנייה במחיר 0.30$ למיליון קלט. בנצ'מרקים מול 3.1 Flash-Lite ו-Gemini 3 Flash, רמות חשיבה, חישובי עלות וטבלת החלטות.
דרגת הנפח נהייתה רצינית
Gemini 3.5 Flash-Lite, שהוכרז ב-21 ביולי 2026, הוא המודל המהיר והמשתלם ביותר של Google בדרגת 3.5: 350 טוקני פלט בשנייה (Artificial Analysis), במחיר של 0.30$ למיליון טוקני קלט ו-2.50$ למיליון טוקני פלט. היסטורית, דרגות “Lite” היו המקום שבו האיכות הלכה למות — טובות לסיווג ולתבניות, מסוכנות לכל דבר סוכני. השחרור הזה שובר את הדפוס: בכמה הערכות סוכניות וקוד, 3.5 Flash-Lite גובר על Gemini 3 Flash הגדול יותר באופן מוחלט.
המדריך הזה מכסה איפה Flash-Lite יושב במערך, איך להגדיר את רמות החשיבה שלו, כמה הוא באמת עולה בקנה מידה גדול, ואיזה מודל לבחור לאיזה עומס עבודה. הקשר ההשקה נמצא בסקירת ההכרזה שלנו.
קפיצה דורית: מול 3.1 Flash-Lite
הקפיצה מדור ה-Lite הקודם היא הגדולה בתולדות המשפחה:
| בנצ’מרק | מה הוא מודד | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | משימות קוד וטרמינל סוכניות | 54% | 31% |
| GDM-MRCR v2 | אחזור בהקשר ארוך | 72.2% | 60.1% |
| GDPval-AA v2 | ביצוע משימות בעולם האמיתי | 1140 | 642 |

מספר ה-GDPval-AA v2 שכמעט הוכפל (642 ← 1140) הוא זה שכדאי להפנים: ביצוע משימות בעולם האמיתי היה בדיוק המקום שבו מודלי Lite ישנים קרסו בסוכני פרודקשן.
ההפתעה: ניצחון על Gemini 3 Flash
מפתיע יותר מהרווח הדורי הוא הרווח חוצה-הדרגות. בכמה הערכות סוכניות וקוד, 3.5 Flash-Lite עוקף את Gemini 3 Flash — מודל גדול ויקר יותר:
| בנצ’מרק | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
אם אתם מריצים היום עומסי עבודה על 2.5 Flash או 3 Flash כי אי אפשר היה לסמוך על דרגות Lite בעבודה סוכנית, ההנחה הזו התיישנה — Flash-Lite גם מהיר יותר וגם מסוגל יותר במשימות האלה.
רמות חשיבה: מודל אחד, שני מצבי פעולה
Flash-Lite מגיע עם רמות חשיבה הניתנות להגדרה, שהופכות אותו בפועל לשני מוצרים:
- חשיבה minimal / low — עדיפות לזמן תגובה ולעלות במשימות בנפח גבוה: חיפוש סוכני, עיבוד מסמכים, חילוץ, סיווג, ניתוב. זה מצב ה-350 טוקנים/שנייה.
- רמות חשיבה גבוהות יותר — הפעלת חשיבה עמוקה יותר לעומסי תת-סוכנים רב-שלביים, שבהם Flash-Lite פועל כעובד תחת מודל מתזמר.
המצב השני תואם את דפוס ההדגמות של Google עצמה: 3.6 Flash כסוכן ראשי, וציי תת-סוכני 3.5 Flash-Lite שעובדים במקביל (הדגמה אחת מייצרת 25 קונספטים של עיצוב אתרים בו-זמנית). שימוש במחשב הוא גם כלי מובנה ב-Flash-Lite, כך שתת-סוכנים יכולים לתפעל ממשקים בלי תשתית נוספת. ראו את הדגמת המהירות של Google: Flash-Lite מול 3.5 Flash (וידאו) להבדל בזמן התגובה במשימות בנפח גבוה.
ניתוח עלות: כמה קנה מידה באמת עולה
מחירים: 0.30$ למיליון קלט, 2.50$ למיליון פלט. הנה עומס עבודה לדוגמה — סוכן עיבוד מסמכים שמטפל במיליון מסמכים בחודש, בממוצע 3K טוקני קלט ו-500 טוקני פלט למסמך:
| רכיב עלות | חישוב | עלות חודשית |
|---|---|---|
| טוקני קלט | מיליון מסמכים × 3K טוקנים = 3 מיליארד טוקנים × 0.30$ למיליון | 900$ |
| טוקני פלט | מיליון מסמכים × 500 טוקנים = 0.5 מיליארד טוקנים × 2.50$ למיליון | 1,250$ |
| סה”כ על 3.5 Flash-Lite | 2,150$ | |
| אותו עומס על 3.6 Flash (1.50$ / 7.50$) | 4,500$ + 3,750$ | 8,250$ |
הבדל עלות של בערך פי 4 עבור עומס עבודה ש-Lite מטפל בו היטב — וב-350 טוקנים/שנייה, סיכום 500 הטוקנים של כל מסמך זורם החוצה בפחות מ-1.5 שניות. האסטרטגיה שנגזרת מכך: נתבו את 90% הנפח השגרתי ל-Flash-Lite, והסלימו את 10% הקשים ל-3.6 Flash.
טבלת החלטות: איזה מודל לאיזה עומס עבודה
| עומס עבודה | בחרו | למה |
|---|---|---|
| חיפוש סוכני / RAG ב-QPS גבוה | 3.5 Flash-Lite (חשיבה minimal) | 350 טוקנים/שנייה, העלות הנמוכה ביותר לשאילתה |
| עיבוד / חילוץ מסמכים בכמויות | 3.5 Flash-Lite | זול פי 4 מ-3.6 Flash; הקשר ארוך GDM-MRCR v2 72.2% |
| סיווג, ניתוב, מודרציה | 3.5 Flash-Lite (חשיבה minimal) | רגיש לזמן תגובה, עם מרווח איכות לרוב |
| ציי תת-סוכנים מקבילים תחת מתזמר | 3.5 Flash-Lite (חשיבה גבוהה) | מצב שנבנה בדיוק לזה; שימוש במחשב מובנה |
| קוד סוכני מורכב (סוכני SWE) | 3.6 Flash | DeepSWE 49%; דיוק גבוה יותר, פחות עריכות רעות |
| תהליכי מחקר ML | 3.6 Flash | MLE Bench 63.9% מול 49.7% של 3.5 Flash |
| סוכני שימוש במחשב במשימות קשות | 3.6 Flash | OSWorld-Verified 83.0% (מול 74.0% של Lite) |
| ניתוח מסמכים מולטימודלי וכתיבת דוחות | 3.6 Flash | אומת על ידי Harvey / Hebbia בהשקה |
| צינורות ישנים שעדיין על 3.5 Flash | עברו למעלה או למטה | 3.6 Flash לאיכות, Flash-Lite לנפח — ראו את מדריך המעבר |
| איתור ותיקון פרצות אבטחה | 3.5 Flash Cyber | רק דרך פיילוט CodeMender (ממשלות ושותפים מהימנים) |
כלל אצבע: ברירת המחדל היא Flash-Lite, והסלימו בכישלון, במקום לברור את המודל הגדול כברירת מחדל ולבצע אופטימיזציה אחר כך. מצב הכשל נראה לעין (פלטים גרועים); הבזבוז של הקצאת-יתר שקט.
איפה הוא זמין
3.5 Flash-Lite פעיל היום ב-Gemini API (Google AI Studio, Android Studio), ב-Gemini Enterprise Agent Platform ובאפליקציית Gemini — והוא מושק בהדרגה בתוך חיפוש Google, מה שאומר הרבה על הביטחון של Google בפרופיל העלות שלו בקנה מידה פלנטרי. בין הלקוחות הראשונים: Ashler, Palo Alto Networks ו-Ramp.
בצד: 3.5 Flash Cyber ו-CodeMender
אותה השקה הציגה גם את Gemini 3.5 Flash Cyber — 3.5 Flash שכוונן לאיתור ותיקון פרצות אבטחה. בתוך CodeMender, כמה סוכני Flash Cyber עובדים במקביל וממזגים את ממצאיהם לדוח משולב אחד, ומגיעים לביצועים תחרותיים למודלי חזית ב-CyberGym. שימו לב לארכיטקטורה: זה בדיוק דפוס “צי המומחים היעילים” שהמדריך הזה מתאר, מיושם על אבטחה.
הגישה צרה בכוונה: פיילוט בגישה מוגבלת בלעדית לממשלות ולשותפים מהימנים דרך CodeMender, כשיקוף של סיכון השימוש הכפול בגילוי פרצות אוטומטי. פרטים בסקירת ההכרזה שלנו.
שורה תחתונה
3.5 Flash-Lite משרטט מחדש את גבול המחיר-ביצועים לעומסי עבודה סוכניים: מהיר מכל דבר בסדרת 3.5, זול בערך פי 4 מ-3.6 Flash, ו— לראשונה במודל Lite — אמין באמת בבנצ’מרקים סוכניים. בנו את הניתוב שלכם כך ש-Flash-Lite הוא ברירת המחדל ו-3.6 Flash הוא נתיב ההסלמה, ועקומת העלויות שלכם תודה לכם.