Gemini Omni
بازگشت به همه مقالات
9 دقیقه مطالعه

Google Gemini 3.7 Flash را معرفی کرد: استدلال ترکیبی برای کدنویسی، عامل‌ها و کار دانشی

Gemini 3.7 Flash در ۱۳ اوت ۲۰۲۶ با استدلال ترکیبی بومی، thinking budget قابل کنترل، بنچمارک‌های کدنویسی frontier و ۵۰٪ تخفیف معرفی تا دسامبر عرضه شد.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026فارسی

پرچمدار جدید استدلال ترکیبی

در ۱۳ اوت ۲۰۲۶، Google Gemini 3.7 Flash را منتشر کرد — مدل پرچمدار استدلال ترکیبی برای کدنویسی، عامل‌ها و کار دانشی پیچیده. برخلاف نسل‌های قبلی Flash که عمق را فدای سرعت می‌کردند، 3.7 Flash استدلال بومی قابل کنترل را مستقیماً در API دارد: عمق تفکر را برای هر درخواست تنظیم می‌کنید بدون جابه‌جایی به «مدل استدلال» جداگانه.

این عرضه هم‌زمان سه مخاطب را هدف می‌گیرد: توسعه‌دهندگانی که عامل‌های production مستقر می‌کنند، تیم‌هایی که وظایف کدنویسی بلندمدت اجرا می‌کنند، و سازمان‌هایی که به تحلیل چندوجهی قابل اعتماد روی مجموعه‌های عظیم اسناد نیاز دارند. Google، 3.7 Flash را مدلی می‌داند که یک endpoint بالاخره هم پاسخ چت زیر ۱۰۰ میلی‌ثانیه و هم پژوهش عمیق چنددقیقه‌ای را سرو می‌کند.

استدلال ترکیبی بومی و thinking budget

محور thinking_config.thinking_budget است — عدد صحیحی که میزان tokenهای استدلال داخلی را قبل از پاسخ کنترل می‌کند.

thinking_budgetرفتاربهترین برای
0حالت سریع با latency بسیار پایین (اولین token زیر ۸۵ms)چت زنده، autocomplete، مسیریابی QPS بالا
256–1024برنامه‌ریزی چندمرحله‌ای سبکمسیریابی ابزار، refactor ساده، ترکیب RAG
4096–16384استدلال چندمرحله‌ای عمیقحلقه‌های عامل، دیباگ پیچیده، گزارش‌های پژوهشی
32768–65536حداکثر عمقکدنویسی بلندمدت، تغییرات معماری چندفایلی

در Gemini API این‌گونه تنظیم کنید:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="این کامپوننت React را به hooks refactor کنید و error boundary اضافه کنید.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = حالت سریع؛ تا 65536 برای استدلال عمیق
        )
    ),
)
print(response.text)

چون استدلال بومی است نه افزونه، latency به‌صورت نرم scale می‌شود: thinking_budget برابر 0 مانند Flash کلاسیک رفتار می‌کند، مقادیر بالاتر کیفیت chain-of-thought را بدون تغییر ID مدل باز می‌کنند. صورتحساب tokenهای خروجی visible را از tokenهای تفکر داخلی جدا می‌کند — فقط برای عمق درخواستی پرداخت می‌کنید.

نکات برجسته بنچمارک

Google اعداد head-to-head در برابر Gemini 3.6 Flash، Claude Sonnet 5 و GPT-5.6 Terra منتشر کرد. 3.7 Flash در همه ارزیابی‌های فهرست‌شده پیشتاز است:

بنچمارکGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.1۴۳٫۶٪۳۴٫۴٪۳۹٫۱٪۳۷٫۸٪
DeepSWE v1.1۶۵٫۳٪۴۹٫۰٪۵۶٫۲٪۵۳٫۴٪
WebDev Arena (Elo)۱۵۸۸۱۵۳۸۱۵۵۲۱۵۴۴
GDP.pdf۳۴٫۰٪۲۲٫۰٪۲۸٫۵٪۲۶٫۸٪
AutomationBench۳۰٫۴٪۱۷٫۰٪۲۳٫۱٪۲۱٫۵٪
GDM-MRCR v2۹۷٫۰٪۹۱٫۲٪۹۴٫۵٪۹۳٫۱٪
HLE-Verified۵۳٫۶٪۴۴٫۸٪۴۸٫۲٪۴۶٫۷٪

دو عدد برای سازندگان برجسته است:

  • DeepSWE v1.1 با ۶۵٫۳٪ — جهش ۱۶ امتیازی نسبت به 3.6 Flash؛ کدنویسی agentic هدف اصلی آموزش است.
  • GDM-MRCR v2 با ۹۷٫۰٪ — بازیابی تقریباً کامل context بلند در پنجره ۲٫۵M token، حیاتی برای workflowهای سنگین اسناد.

برای بافت نسل قبلی: مقایسه Gemini 3.6 Flash vs 3.5 Flash.

قیمت‌گذاری و ۵۰٪ تخفیف معرفی

Google پروموشن aggressive عرضه دارد:

قیمت intro (تا ۳۱ دسامبر ۲۰۲۶)قیمت استاندارد (از ۱ ژانویه ۲۰۲۷)
ورودی$0.75 / 1M token$1.50 / 1M token
خروجی$3.75 / 1M token$7.50 / 1M token
کش context$0.075 / 1M token$0.075 / 1M token

۵۰٪ تخفیف روی ورودی و خروجی برای باقیمانده ۲۰۲۶. کش context — مفید هنگام استفاده مجدد از promptهای سیستم یا corpusهای بزرگ — بدون توجه به promo، $0.075 به ازای هر میلیون token باقی می‌ماند.

با round-trip کمتر فراخوانی ابزار در thinking budgetهای بالاتر، هزینه مؤثر هر وظیفه عامل تکمیل‌شده می‌تواند بسیار پایین‌تر از قیمت sticker token باشد. راهنمای برآورد هزینه API محاسبات workloadهای معمول را شرح می‌دهد.

قابلیت‌های چندوجهی، web dev و عامل

فراتر از بنچمارک‌ها، 3.7 Flash قابلیت‌های آماده production دارد:

  • پنجره context ۲٫۵M token — بلعیدن codebaseهای کامل، بسته‌های قرارداد یا corpusهای پژوهش در یک pass.
  • ۲۴۵ token خروجی/ثانیه — به‌اندازه کافی سریع برای stream کد UI و گزارش‌های بلند بدون خفه کردن UX.
  • دقت اجرای ابزار JSON ۹۹٫۷٪ — خروجی‌های structured قابل اعتماد برای زنجیره ابزار عامل.
  • Computer use — خودکارسازی client-side داخلی برای workflow مرورگر و دسکتاپ.
  • وفاداری تولید UI — دقت layout بالاتر در WebDev Arena (1588 Elo) یعنی frontendهای تولیدشده تمیزتر.

امروز از طریق Gemini API، Google AI Studio، Gemini Enterprise و Google Antigravity در دسترس است.

راهنمای توسعه‌دهنده و migration

اگر از 3.6 Flash یا 3.5 Flash-Lite ارتقا می‌دهید، با این الگوها شروع کنید:

  1. جایگزینی ID مدلgemini-3.6-flash را با gemini-3.7-flash؛ سطح API backward compatible است.
  2. تنظیم thinking budget بر اساس نوع وظیفه0 برای چت کاربر، 1024 برای RAG Q&A، 8192+ برای عامل‌های کدنویسی، 32768 فقط برای jobهای batch شبانه که latency مهم نیست.
  3. فعال‌سازی کش context — اگر prompt سیستم یا set اسناد از 32K token فراتر رود و بین درخواست‌ها تکرار شود، کش ۹۰٪ هزینه ورودی را کاهش می‌دهد.
  4. تنظیم schema ابزار — دقت JSON ۹۹٫۷٪ schemaهای سخت را پاداش می‌دهد؛ تعاریف شل در لایه اپلیکیشن شکست می‌خورند.
  5. پایش مصرف token تفکرusage_metadata را log کنید تا بفهمید کدام گام‌های عامل واقعاً به استدلال عمیق نیاز دارند.

برای الگوهای workflow agentic، راهنمای workflow agentic 3.5 Flash-Lite را ببینید — مفهوم thinking budget به‌طور طبیعی به 3.7 Flash با granularity ریزتر گسترش می‌یابد.

جمع‌بندی

Gemini 3.7 Flash اولین مدل سطح Flash است که سرعت و عمق mutually exclusive نیستند. thinking_budget قابل کنترل به یک مدل اجازه می‌دهد هم چت حساس به latency و هم کدنویسی agentic عمیق را سرو کند، و قیمت عرضه آزمایش را تا پایان ۲۰۲۶ ارزان نگه می‌دارد.

مرتبط