Google משיקה את Gemini 3.7 Flash: חשיבה היברידית לקידוד, סוכנים ועבודת ידע
Gemini 3.7 Flash מגיע ב-13 באוגוסט 2026 עם חשיבה היברידית מקורית, thinking budget ניתן לשליטה, benchmarkי קידוד frontier והנחת השקה של 50% עד דצמבר.
דגל חדש לחשיבה היברידית
ב-13 באוגוסט 2026 Google השיקה את Gemini 3.7 Flash — מודל הדגל של חשיבה היברידית לקידוד, סוכנים ועבודת ידע מורכבת. בניגוד לדורות Flash קודמים שהקריבו עומק למהירות, 3.7 Flash מגיע עם חשיבה מקורית ניתנת לשליטה מובנית ב-API: מכוונים את עומק החשיבה לכל בקשה בלי לעבור ל«מודל חשיבה» נפרד.
ההשקה מכוונת לשלוש קהלים בו-זמנית: מפתחים שמפריסים סוכני production, צוותים שמריצים משימות קידוד ארוכות טווח, וארגונים שצריכים ניתוח multimodal אמין על מערכי מסמכים עצומים. Google ממקמת את 3.7 Flash כמודל שבו נקודת קצה אחת משרתת סוף סוף תשובות צ’אט מתחת ל-100ms וגם מחקר עמוק של דקות.
חשיבה היברידית מקורית ו-thinking budget
הלב הוא thinking_config.thinking_budget — מספר שלם שקובע כמה tokens חשיבה פנימיים המודל רשאי לצרוך לפני התשובה.
thinking_budget | התנהגות | הכי מתאים ל |
|---|---|---|
| 0 | מצב מהיר latency ultra נמוך (token ראשון מתחת ל-85ms) | צ’אט חי, autocomplete, routing QPS גבוה |
| 256–1024 | תכנון multi-step קל | routing כלים, refactor פשוט, סינתזת RAG |
| 4096–16384 | חשיבה multi-step עמוקה | לולאות סוכנים, debug מורכב, דוחות מחקר |
| 32768–65536 | עומק מקסימלי | קידוד ארוך טווח, שינויי ארכיטקטורה multi-file |
הגדרה ב-Gemini API:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactor את רכיב React זה ל-hooks והוסף error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = מצב מהיר; עד 65536 לחשיבה עמוקה
)
),
)
print(response.text)
מכיוון שהחשיבה מקורית ולא תוספת, ה-latency מתscale בצורה חלקה: thinking_budget 0 מתנהג כמו Flash קלאסי, ערכים גבוהים פותחים איכות chain-of-thought בלי להחליף ID מודל. החיוב מפריד tokens פלט גלויים מ-tokens חשיבה פנימיים — משלמים רק על העומק שביקשתם.
דגשי benchmark
Google פרסמה מספרים head-to-head מול Gemini 3.6 Flash, Claude Sonnet 5 ו-GPT-5.6 Terra. 3.7 Flash מוביל בכל ההערכות ברשימה:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
שני מספרים בולטים לבונים:
- DeepSWE v1.1 ב-65.3% — קפיצה של 16 נקודות על 3.6 Flash; קידוד agentic הוא יעד האימון העיקרי.
- GDM-MRCR v2 ב-97.0% — retrieval הקשר ארוך כמעט מושלם בחלון 2.5M tokens, קריטי ל-workflows מסמכים.
הקשר לדור הקודם: השוואת Gemini 3.6 Flash vs 3.5 Flash.
תמחור והנחת השקה 50%
Google מריצה promotion השקה aggressive:
| מחיר intro (עד 31 בדצמבר 2026) | מחיר standard (מ-1 בינואר 2027) | |
|---|---|---|
| Input | $0.75 / 1M tokens | $1.50 / 1M tokens |
| Output | $3.75 / 1M tokens | $7.50 / 1M tokens |
| Context caching | $0.075 / 1M tokens | $0.075 / 1M tokens |
זה הנחה של 50% על input ו-output ליתרת 2026. Context caching — שימושי כשמ reuse prompts מערכת או corpuses מסמכים גדולים — נשאר $0.075 למיליון tokens ללא קשר ל-promo.
בשילוב עם פחות round-trips של קריאות כלים ב-thinking budgets גבוהים, העלות האפektיבית למשימת סוכן שהושלמה יכולה לרדת הרבה מתחת למחיר token. מדריך הערכת עלות API מפרק את החשבון ל-workloads טיפוסיים.
יכולות multimodal, web dev וסוכנים
מעבר ל-benchmarks, 3.7 Flash מגיע עם יכולות production-ready:
- חלון context 2.5M tokens — בליעת codebases שלמים, חבילות חוזים או corpuses מחקר ב-pass אחד.
- 245 output tokens/s — מספיק מהיר ל-stream קוד UI ודוחות ארוכים בלי לחנוק UX.
- 99.7% דיוק ביצוע כלי JSON — פלטים structured אמינים לשרשראות כלי סוכנים.
- Computer use — אוטומציה client-side מובנית ל-workflows דפדפן ו-desktop.
- נאמנות יצירת UI — דיוק layout גבוה יותר ב-WebDev Arena (1588 Elo) משמעותו frontends שנוצרו נקיים יותר.
זמין היום דרך Gemini API, Google AI Studio, Gemini Enterprise ו-Google Antigravity.
מדריך מפתחים ו-migration
אם משדרגים מ-3.6 Flash או 3.5 Flash-Lite, התחילו בדפוסים האלה:
- החליפו ID מודל — swap
gemini-3.6-flashל-gemini-3.7-flash; משטח API backward compatible. - הגדירו thinking budgets לפי סוג משימה —
0לצ’אט user-facing,1024ל-RAG Q&A,8192+לסוכני קידוד,32768רק ל-batch jobs ליליים שבהם latency לא חשוב. - הפעילו context caching — אם prompt מערכת או set מסמכים עובר 32K tokens וחוזר בין בקשות, caching מוריד 90% מעלות input.
- כוונו schemas כלים — דיוק JSON 99.7% מתגמל schemas קפדניים; הגדרות רופפות עדיין נכשלות בשכבת האפליקציה.
- נטרו שימוש tokens חשיבה — log
usage_metadataלהבין אילו שלבי סוכן באמת צריכים חשיבה עמוקה.
לדפוסי workflow agentic, ראו מדריך workflows agentic 3.5 Flash-Lite — מושג thinking budget מתרחב באופן טבעי ל-3.7 Flash עם granularity עדינה יותר.
סיכום
Gemini 3.7 Flash הוא מודל רמת Flash הראשון שבו מהירות ועומק לא mutually exclusive. thinking_budget הניתן לשליטה מאפשר למודל אחד לשרת צ’אט רגיש latency וקידוד agentic עמוק, ומחירי ההשקה הופכים ניסויים לזולים עד סוף 2026.