Gemini Omni
חזרה לכל המאמרים
10 דק׳ קריאה

מדריך Gemini 3.5 Flash-Lite: הרחבת תהליכי עבודה סוכניים ב-350 טוקנים/שנייה (2026)

Gemini 3.5 Flash-Lite רץ ב-350 טוקנים/שנייה במחיר 0.30$ למיליון קלט. בנצ'מרקים מול 3.1 Flash-Lite ו-Gemini 3 Flash, רמות חשיבה, חישובי עלות וטבלת החלטות.

Gemini 3.5 Flash-LiteAgentic WorkflowsGuideBenchmarksPricing2026עברית

דרגת הנפח נהייתה רצינית

Gemini 3.5 Flash-Lite, שהוכרז ב-21 ביולי 2026, הוא המודל המהיר והמשתלם ביותר של Google בדרגת 3.5: 350 טוקני פלט בשנייה (Artificial Analysis), במחיר של 0.30$ למיליון טוקני קלט ו-2.50$ למיליון טוקני פלט. היסטורית, דרגות “Lite” היו המקום שבו האיכות הלכה למות — טובות לסיווג ולתבניות, מסוכנות לכל דבר סוכני. השחרור הזה שובר את הדפוס: בכמה הערכות סוכניות וקוד, 3.5 Flash-Lite גובר על Gemini 3 Flash הגדול יותר באופן מוחלט.

המדריך הזה מכסה איפה Flash-Lite יושב במערך, איך להגדיר את רמות החשיבה שלו, כמה הוא באמת עולה בקנה מידה גדול, ואיזה מודל לבחור לאיזה עומס עבודה. הקשר ההשקה נמצא בסקירת ההכרזה שלנו.

קפיצה דורית: מול 3.1 Flash-Lite

הקפיצה מדור ה-Lite הקודם היא הגדולה בתולדות המשפחה:

בנצ’מרקמה הוא מודדGemini 3.5 Flash-LiteGemini 3.1 Flash-Lite
Terminal-Bench 2.1משימות קוד וטרמינל סוכניות54%31%
GDM-MRCR v2אחזור בהקשר ארוך72.2%60.1%
GDPval-AA v2ביצוע משימות בעולם האמיתי1140642

השוואת הבנצ'מרקים של Gemini 3.5 Flash-Lite מול דורות Flash-Lite קודמים

מספר ה-GDPval-AA v2 שכמעט הוכפל (642 ← 1140) הוא זה שכדאי להפנים: ביצוע משימות בעולם האמיתי היה בדיוק המקום שבו מודלי Lite ישנים קרסו בסוכני פרודקשן.

ההפתעה: ניצחון על Gemini 3 Flash

מפתיע יותר מהרווח הדורי הוא הרווח חוצה-הדרגות. בכמה הערכות סוכניות וקוד, 3.5 Flash-Lite עוקף את Gemini 3 Flash — מודל גדול ויקר יותר:

בנצ’מרקGemini 3.5 Flash-LiteGemini 3 Flash
SWE-Bench Pro54.2%49.6%
OSWorld-Verified74.0%65.1%

אם אתם מריצים היום עומסי עבודה על 2.5 Flash או 3 Flash כי אי אפשר היה לסמוך על דרגות Lite בעבודה סוכנית, ההנחה הזו התיישנה — Flash-Lite גם מהיר יותר וגם מסוגל יותר במשימות האלה.

רמות חשיבה: מודל אחד, שני מצבי פעולה

Flash-Lite מגיע עם רמות חשיבה הניתנות להגדרה, שהופכות אותו בפועל לשני מוצרים:

  • חשיבה minimal / low — עדיפות לזמן תגובה ולעלות במשימות בנפח גבוה: חיפוש סוכני, עיבוד מסמכים, חילוץ, סיווג, ניתוב. זה מצב ה-350 טוקנים/שנייה.
  • רמות חשיבה גבוהות יותר — הפעלת חשיבה עמוקה יותר לעומסי תת-סוכנים רב-שלביים, שבהם Flash-Lite פועל כעובד תחת מודל מתזמר.

המצב השני תואם את דפוס ההדגמות של Google עצמה: 3.6 Flash כסוכן ראשי, וציי תת-סוכני 3.5 Flash-Lite שעובדים במקביל (הדגמה אחת מייצרת 25 קונספטים של עיצוב אתרים בו-זמנית). שימוש במחשב הוא גם כלי מובנה ב-Flash-Lite, כך שתת-סוכנים יכולים לתפעל ממשקים בלי תשתית נוספת. ראו את הדגמת המהירות של Google: ‏Flash-Lite מול 3.5 Flash (וידאו) להבדל בזמן התגובה במשימות בנפח גבוה.

ניתוח עלות: כמה קנה מידה באמת עולה

מחירים: 0.30$ למיליון קלט, 2.50$ למיליון פלט. הנה עומס עבודה לדוגמה — סוכן עיבוד מסמכים שמטפל במיליון מסמכים בחודש, בממוצע 3K טוקני קלט ו-500 טוקני פלט למסמך:

רכיב עלותחישובעלות חודשית
טוקני קלטמיליון מסמכים × 3K טוקנים = 3 מיליארד טוקנים × 0.30$ למיליון900$
טוקני פלטמיליון מסמכים × 500 טוקנים = 0.5 מיליארד טוקנים × 2.50$ למיליון1,250$
סה”כ על 3.5 Flash-Lite2,150$
אותו עומס על 3.6 Flash ‏(1.50$ / 7.50$)4,500$ + 3,750$8,250$

הבדל עלות של בערך פי 4 עבור עומס עבודה ש-Lite מטפל בו היטב — וב-350 טוקנים/שנייה, סיכום 500 הטוקנים של כל מסמך זורם החוצה בפחות מ-1.5 שניות. האסטרטגיה שנגזרת מכך: נתבו את 90% הנפח השגרתי ל-Flash-Lite, והסלימו את 10% הקשים ל-3.6 Flash.

טבלת החלטות: איזה מודל לאיזה עומס עבודה

עומס עבודהבחרולמה
חיפוש סוכני / RAG ב-QPS גבוה3.5 Flash-Lite (חשיבה minimal)350 טוקנים/שנייה, העלות הנמוכה ביותר לשאילתה
עיבוד / חילוץ מסמכים בכמויות3.5 Flash-Liteזול פי 4 מ-3.6 Flash; הקשר ארוך GDM-MRCR v2 ‏72.2%
סיווג, ניתוב, מודרציה3.5 Flash-Lite (חשיבה minimal)רגיש לזמן תגובה, עם מרווח איכות לרוב
ציי תת-סוכנים מקבילים תחת מתזמר3.5 Flash-Lite (חשיבה גבוהה)מצב שנבנה בדיוק לזה; שימוש במחשב מובנה
קוד סוכני מורכב (סוכני SWE)3.6 FlashDeepSWE ‏49%; דיוק גבוה יותר, פחות עריכות רעות
תהליכי מחקר ML3.6 FlashMLE Bench ‏63.9% מול 49.7% של 3.5 Flash
סוכני שימוש במחשב במשימות קשות3.6 FlashOSWorld-Verified ‏83.0% (מול 74.0% של Lite)
ניתוח מסמכים מולטימודלי וכתיבת דוחות3.6 Flashאומת על ידי Harvey / Hebbia בהשקה
צינורות ישנים שעדיין על 3.5 Flashעברו למעלה או למטה‏3.6 Flash לאיכות, Flash-Lite לנפח — ראו את מדריך המעבר
איתור ותיקון פרצות אבטחה3.5 Flash Cyberרק דרך פיילוט CodeMender (ממשלות ושותפים מהימנים)

כלל אצבע: ברירת המחדל היא Flash-Lite, והסלימו בכישלון, במקום לברור את המודל הגדול כברירת מחדל ולבצע אופטימיזציה אחר כך. מצב הכשל נראה לעין (פלטים גרועים); הבזבוז של הקצאת-יתר שקט.

איפה הוא זמין

3.5 Flash-Lite פעיל היום ב-Gemini API ‏(Google AI Studio, ‏Android Studio), ב-Gemini Enterprise Agent Platform ובאפליקציית Gemini — והוא מושק בהדרגה בתוך חיפוש Google, מה שאומר הרבה על הביטחון של Google בפרופיל העלות שלו בקנה מידה פלנטרי. בין הלקוחות הראשונים: Ashler, ‏Palo Alto Networks ו-Ramp.

בצד: 3.5 Flash Cyber ו-CodeMender

אותה השקה הציגה גם את Gemini 3.5 Flash Cyber — ‏3.5 Flash שכוונן לאיתור ותיקון פרצות אבטחה. בתוך CodeMender, כמה סוכני Flash Cyber עובדים במקביל וממזגים את ממצאיהם לדוח משולב אחד, ומגיעים לביצועים תחרותיים למודלי חזית ב-CyberGym. שימו לב לארכיטקטורה: זה בדיוק דפוס “צי המומחים היעילים” שהמדריך הזה מתאר, מיושם על אבטחה.

הגישה צרה בכוונה: פיילוט בגישה מוגבלת בלעדית לממשלות ולשותפים מהימנים דרך CodeMender, כשיקוף של סיכון השימוש הכפול בגילוי פרצות אוטומטי. פרטים בסקירת ההכרזה שלנו.

שורה תחתונה

3.5 Flash-Lite משרטט מחדש את גבול המחיר-ביצועים לעומסי עבודה סוכניים: מהיר מכל דבר בסדרת 3.5, זול בערך פי 4 מ-3.6 Flash, ו— לראשונה במודל Lite — אמין באמת בבנצ’מרקים סוכניים. בנו את הניתוב שלכם כך ש-Flash-Lite הוא ברירת המחדל ו-3.6 Flash הוא נתיב ההסלמה, ועקומת העלויות שלכם תודה לכם.

קשור