Google Gemini 3.7 Flash را معرفی کرد: استدلال ترکیبی برای کدنویسی، عاملها و کار دانشی
Gemini 3.7 Flash در ۱۳ اوت ۲۰۲۶ با استدلال ترکیبی بومی، thinking budget قابل کنترل، بنچمارکهای کدنویسی frontier و ۵۰٪ تخفیف معرفی تا دسامبر عرضه شد.
پرچمدار جدید استدلال ترکیبی
در ۱۳ اوت ۲۰۲۶، Google Gemini 3.7 Flash را منتشر کرد — مدل پرچمدار استدلال ترکیبی برای کدنویسی، عاملها و کار دانشی پیچیده. برخلاف نسلهای قبلی Flash که عمق را فدای سرعت میکردند، 3.7 Flash استدلال بومی قابل کنترل را مستقیماً در API دارد: عمق تفکر را برای هر درخواست تنظیم میکنید بدون جابهجایی به «مدل استدلال» جداگانه.
این عرضه همزمان سه مخاطب را هدف میگیرد: توسعهدهندگانی که عاملهای production مستقر میکنند، تیمهایی که وظایف کدنویسی بلندمدت اجرا میکنند، و سازمانهایی که به تحلیل چندوجهی قابل اعتماد روی مجموعههای عظیم اسناد نیاز دارند. Google، 3.7 Flash را مدلی میداند که یک endpoint بالاخره هم پاسخ چت زیر ۱۰۰ میلیثانیه و هم پژوهش عمیق چنددقیقهای را سرو میکند.
استدلال ترکیبی بومی و thinking budget
محور thinking_config.thinking_budget است — عدد صحیحی که میزان tokenهای استدلال داخلی را قبل از پاسخ کنترل میکند.
thinking_budget | رفتار | بهترین برای |
|---|---|---|
| 0 | حالت سریع با latency بسیار پایین (اولین token زیر ۸۵ms) | چت زنده، autocomplete، مسیریابی QPS بالا |
| 256–1024 | برنامهریزی چندمرحلهای سبک | مسیریابی ابزار، refactor ساده، ترکیب RAG |
| 4096–16384 | استدلال چندمرحلهای عمیق | حلقههای عامل، دیباگ پیچیده، گزارشهای پژوهشی |
| 32768–65536 | حداکثر عمق | کدنویسی بلندمدت، تغییرات معماری چندفایلی |
در Gemini API اینگونه تنظیم کنید:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="این کامپوننت React را به hooks refactor کنید و error boundary اضافه کنید.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = حالت سریع؛ تا 65536 برای استدلال عمیق
)
),
)
print(response.text)
چون استدلال بومی است نه افزونه، latency بهصورت نرم scale میشود: thinking_budget برابر 0 مانند Flash کلاسیک رفتار میکند، مقادیر بالاتر کیفیت chain-of-thought را بدون تغییر ID مدل باز میکنند. صورتحساب tokenهای خروجی visible را از tokenهای تفکر داخلی جدا میکند — فقط برای عمق درخواستی پرداخت میکنید.
نکات برجسته بنچمارک
Google اعداد head-to-head در برابر Gemini 3.6 Flash، Claude Sonnet 5 و GPT-5.6 Terra منتشر کرد. 3.7 Flash در همه ارزیابیهای فهرستشده پیشتاز است:
| بنچمارک | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | ۴۳٫۶٪ | ۳۴٫۴٪ | ۳۹٫۱٪ | ۳۷٫۸٪ |
| DeepSWE v1.1 | ۶۵٫۳٪ | ۴۹٫۰٪ | ۵۶٫۲٪ | ۵۳٫۴٪ |
| WebDev Arena (Elo) | ۱۵۸۸ | ۱۵۳۸ | ۱۵۵۲ | ۱۵۴۴ |
| GDP.pdf | ۳۴٫۰٪ | ۲۲٫۰٪ | ۲۸٫۵٪ | ۲۶٫۸٪ |
| AutomationBench | ۳۰٫۴٪ | ۱۷٫۰٪ | ۲۳٫۱٪ | ۲۱٫۵٪ |
| GDM-MRCR v2 | ۹۷٫۰٪ | ۹۱٫۲٪ | ۹۴٫۵٪ | ۹۳٫۱٪ |
| HLE-Verified | ۵۳٫۶٪ | ۴۴٫۸٪ | ۴۸٫۲٪ | ۴۶٫۷٪ |
دو عدد برای سازندگان برجسته است:
- DeepSWE v1.1 با ۶۵٫۳٪ — جهش ۱۶ امتیازی نسبت به 3.6 Flash؛ کدنویسی agentic هدف اصلی آموزش است.
- GDM-MRCR v2 با ۹۷٫۰٪ — بازیابی تقریباً کامل context بلند در پنجره ۲٫۵M token، حیاتی برای workflowهای سنگین اسناد.
برای بافت نسل قبلی: مقایسه Gemini 3.6 Flash vs 3.5 Flash.
قیمتگذاری و ۵۰٪ تخفیف معرفی
Google پروموشن aggressive عرضه دارد:
| قیمت intro (تا ۳۱ دسامبر ۲۰۲۶) | قیمت استاندارد (از ۱ ژانویه ۲۰۲۷) | |
|---|---|---|
| ورودی | $0.75 / 1M token | $1.50 / 1M token |
| خروجی | $3.75 / 1M token | $7.50 / 1M token |
| کش context | $0.075 / 1M token | $0.075 / 1M token |
۵۰٪ تخفیف روی ورودی و خروجی برای باقیمانده ۲۰۲۶. کش context — مفید هنگام استفاده مجدد از promptهای سیستم یا corpusهای بزرگ — بدون توجه به promo، $0.075 به ازای هر میلیون token باقی میماند.
با round-trip کمتر فراخوانی ابزار در thinking budgetهای بالاتر، هزینه مؤثر هر وظیفه عامل تکمیلشده میتواند بسیار پایینتر از قیمت sticker token باشد. راهنمای برآورد هزینه API محاسبات workloadهای معمول را شرح میدهد.
قابلیتهای چندوجهی، web dev و عامل
فراتر از بنچمارکها، 3.7 Flash قابلیتهای آماده production دارد:
- پنجره context ۲٫۵M token — بلعیدن codebaseهای کامل، بستههای قرارداد یا corpusهای پژوهش در یک pass.
- ۲۴۵ token خروجی/ثانیه — بهاندازه کافی سریع برای stream کد UI و گزارشهای بلند بدون خفه کردن UX.
- دقت اجرای ابزار JSON ۹۹٫۷٪ — خروجیهای structured قابل اعتماد برای زنجیره ابزار عامل.
- Computer use — خودکارسازی client-side داخلی برای workflow مرورگر و دسکتاپ.
- وفاداری تولید UI — دقت layout بالاتر در WebDev Arena (1588 Elo) یعنی frontendهای تولیدشده تمیزتر.
امروز از طریق Gemini API، Google AI Studio، Gemini Enterprise و Google Antigravity در دسترس است.
راهنمای توسعهدهنده و migration
اگر از 3.6 Flash یا 3.5 Flash-Lite ارتقا میدهید، با این الگوها شروع کنید:
- جایگزینی ID مدل —
gemini-3.6-flashرا باgemini-3.7-flash؛ سطح API backward compatible است. - تنظیم thinking budget بر اساس نوع وظیفه —
0برای چت کاربر،1024برای RAG Q&A،8192+برای عاملهای کدنویسی،32768فقط برای jobهای batch شبانه که latency مهم نیست. - فعالسازی کش context — اگر prompt سیستم یا set اسناد از 32K token فراتر رود و بین درخواستها تکرار شود، کش ۹۰٪ هزینه ورودی را کاهش میدهد.
- تنظیم schema ابزار — دقت JSON ۹۹٫۷٪ schemaهای سخت را پاداش میدهد؛ تعاریف شل در لایه اپلیکیشن شکست میخورند.
- پایش مصرف token تفکر —
usage_metadataرا log کنید تا بفهمید کدام گامهای عامل واقعاً به استدلال عمیق نیاز دارند.
برای الگوهای workflow agentic، راهنمای workflow agentic 3.5 Flash-Lite را ببینید — مفهوم thinking budget بهطور طبیعی به 3.7 Flash با granularity ریزتر گسترش مییابد.
جمعبندی
Gemini 3.7 Flash اولین مدل سطح Flash است که سرعت و عمق mutually exclusive نیستند. thinking_budget قابل کنترل به یک مدل اجازه میدهد هم چت حساس به latency و هم کدنویسی agentic عمیق را سرو کند، و قیمت عرضه آزمایش را تا پایان ۲۰۲۶ ارزان نگه میدارد.