Gemini Omni
חזרה לכל המאמרים
9 דק׳ קריאה

Google משיקה את Gemini 3.7 Flash: חשיבה היברידית לקידוד, סוכנים ועבודת ידע

Gemini 3.7 Flash מגיע ב-13 באוגוסט 2026 עם חשיבה היברידית מקורית, thinking budget ניתן לשליטה, benchmarkי קידוד frontier והנחת השקה של 50% עד דצמבר.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026עברית

דגל חדש לחשיבה היברידית

ב-13 באוגוסט 2026 Google השיקה את Gemini 3.7 Flash — מודל הדגל של חשיבה היברידית לקידוד, סוכנים ועבודת ידע מורכבת. בניגוד לדורות Flash קודמים שהקריבו עומק למהירות, 3.7 Flash מגיע עם חשיבה מקורית ניתנת לשליטה מובנית ב-API: מכוונים את עומק החשיבה לכל בקשה בלי לעבור ל«מודל חשיבה» נפרד.

ההשקה מכוונת לשלוש קהלים בו-זמנית: מפתחים שמפריסים סוכני production, צוותים שמריצים משימות קידוד ארוכות טווח, וארגונים שצריכים ניתוח multimodal אמין על מערכי מסמכים עצומים. Google ממקמת את 3.7 Flash כמודל שבו נקודת קצה אחת משרתת סוף סוף תשובות צ’אט מתחת ל-100ms וגם מחקר עמוק של דקות.

חשיבה היברידית מקורית ו-thinking budget

הלב הוא thinking_config.thinking_budget — מספר שלם שקובע כמה tokens חשיבה פנימיים המודל רשאי לצרוך לפני התשובה.

thinking_budgetהתנהגותהכי מתאים ל
0מצב מהיר latency ultra נמוך (token ראשון מתחת ל-85ms)צ’אט חי, autocomplete, routing QPS גבוה
256–1024תכנון multi-step קלrouting כלים, refactor פשוט, סינתזת RAG
4096–16384חשיבה multi-step עמוקהלולאות סוכנים, debug מורכב, דוחות מחקר
32768–65536עומק מקסימליקידוד ארוך טווח, שינויי ארכיטקטורה multi-file

הגדרה ב-Gemini API:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refactor את רכיב React זה ל-hooks והוסף error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = מצב מהיר; עד 65536 לחשיבה עמוקה
        )
    ),
)
print(response.text)

מכיוון שהחשיבה מקורית ולא תוספת, ה-latency מתscale בצורה חלקה: thinking_budget 0 מתנהג כמו Flash קלאסי, ערכים גבוהים פותחים איכות chain-of-thought בלי להחליף ID מודל. החיוב מפריד tokens פלט גלויים מ-tokens חשיבה פנימיים — משלמים רק על העומק שביקשתם.

דגשי benchmark

Google פרסמה מספרים head-to-head מול Gemini 3.6 Flash, Claude Sonnet 5 ו-GPT-5.6 Terra. 3.7 Flash מוביל בכל ההערכות ברשימה:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

שני מספרים בולטים לבונים:

  • DeepSWE v1.1 ב-65.3% — קפיצה של 16 נקודות על 3.6 Flash; קידוד agentic הוא יעד האימון העיקרי.
  • GDM-MRCR v2 ב-97.0% — retrieval הקשר ארוך כמעט מושלם בחלון 2.5M tokens, קריטי ל-workflows מסמכים.

הקשר לדור הקודם: השוואת Gemini 3.6 Flash vs 3.5 Flash.

תמחור והנחת השקה 50%

Google מריצה promotion השקה aggressive:

מחיר intro (עד 31 בדצמבר 2026)מחיר standard (מ-1 בינואר 2027)
Input$0.75 / 1M tokens$1.50 / 1M tokens
Output$3.75 / 1M tokens$7.50 / 1M tokens
Context caching$0.075 / 1M tokens$0.075 / 1M tokens

זה הנחה של 50% על input ו-output ליתרת 2026. Context caching — שימושי כשמ reuse prompts מערכת או corpuses מסמכים גדולים — נשאר $0.075 למיליון tokens ללא קשר ל-promo.

בשילוב עם פחות round-trips של קריאות כלים ב-thinking budgets גבוהים, העלות האפektיבית למשימת סוכן שהושלמה יכולה לרדת הרבה מתחת למחיר token. מדריך הערכת עלות API מפרק את החשבון ל-workloads טיפוסיים.

יכולות multimodal, web dev וסוכנים

מעבר ל-benchmarks, 3.7 Flash מגיע עם יכולות production-ready:

  • חלון context 2.5M tokens — בליעת codebases שלמים, חבילות חוזים או corpuses מחקר ב-pass אחד.
  • 245 output tokens/s — מספיק מהיר ל-stream קוד UI ודוחות ארוכים בלי לחנוק UX.
  • 99.7% דיוק ביצוע כלי JSON — פלטים structured אמינים לשרשראות כלי סוכנים.
  • Computer use — אוטומציה client-side מובנית ל-workflows דפדפן ו-desktop.
  • נאמנות יצירת UI — דיוק layout גבוה יותר ב-WebDev Arena (1588 Elo) משמעותו frontends שנוצרו נקיים יותר.

זמין היום דרך Gemini API, Google AI Studio, Gemini Enterprise ו-Google Antigravity.

מדריך מפתחים ו-migration

אם משדרגים מ-3.6 Flash או 3.5 Flash-Lite, התחילו בדפוסים האלה:

  1. החליפו ID מודל — swap gemini-3.6-flash ל-gemini-3.7-flash; משטח API backward compatible.
  2. הגדירו thinking budgets לפי סוג משימה0 לצ’אט user-facing, 1024 ל-RAG Q&A, 8192+ לסוכני קידוד, 32768 רק ל-batch jobs ליליים שבהם latency לא חשוב.
  3. הפעילו context caching — אם prompt מערכת או set מסמכים עובר 32K tokens וחוזר בין בקשות, caching מוריד 90% מעלות input.
  4. כוונו schemas כלים — דיוק JSON 99.7% מתגמל schemas קפדניים; הגדרות רופפות עדיין נכשלות בשכבת האפליקציה.
  5. נטרו שימוש tokens חשיבה — log usage_metadata להבין אילו שלבי סוכן באמת צריכים חשיבה עמוקה.

לדפוסי workflow agentic, ראו מדריך workflows agentic 3.5 Flash-Lite — מושג thinking budget מתרחב באופן טבעי ל-3.7 Flash עם granularity עדינה יותר.

סיכום

Gemini 3.7 Flash הוא מודל רמת Flash הראשון שבו מהירות ועומק לא mutually exclusive. thinking_budget הניתן לשליטה מאפשר למודל אחד לשרת צ’אט רגיש latency וקידוד agentic עמוק, ומחירי ההשקה הופכים ניסויים לזולים עד סוף 2026.

קשור