Google Gemini 3.7 Flash চালু করল: কোডিং, এজেন্ট ও জ্ঞানকর্মের জন্য হাইব্রিড রিজনিং
Gemini 3.7 Flash ১৩ আগস্ট ২০২৬-এ এসেছে নেটিভ হাইব্রিড রিজনিং, নিয়ন্ত্রণযোগ্য thinking budget, frontier কোডিং বেঞ্চমার্ক ও ডিসেম্বর পর্যন্ত ৫০% পরিচয়মূলক ছাড় সহ।
হাইব্রিড রিজনিংয়ের নতুন ফ্ল্যাগশিপ
১৩ আগস্ট ২০২৬-এ Google Gemini 3.7 Flash প্রকাশ করেছে — কোডিং, এজেন্ট ও জটিল জ্ঞানকর্ম-এর জন্য তৈরি ফ্ল্যাগশিপ হাইব্রিড রিজনিং মডেল। গভীরতা বিনিময়ে গতির পুরনো Flash প্রজন্মের বিপরীতে, 3.7 Flash API-তে নেটিভ নিয়ন্ত্রণযোগ্য রিজনিং এনেছে: প্রতিটি অনুরোধে চিন্তার গভীরতা সামঞ্জস্য করুন, আলাদা «রিজনিং মডেল»-এ যাওয়ার দরকার নেই।
লঞ্চ একসাথে তিন দর্শককে লক্ষ্য করে: প্রোডাকশন এজেন্ট চালানো ডেভেলপার, দীর্ঘমেয়াদি কোডিং টাস্ক চালানো দল, এবং বিশাল ডকুমেন্ট সেটে নির্ভরযোগ্য মাল্টিমোডাল বিশ্লেষণ চাওয়া প্রতিষ্ঠান। Google 3.7 Flash-কে সেই মডেল হিসেবে দাঁড় করিয়েছে যেখানে একটি endpoint অবশেষে sub-100ms চ্যাট উত্তর ও কয়েক মিনিটের গভীর গবেষণা দুটোই serve করে।
নেটিভ হাইব্রিড রিজনিং ও thinking budget
কেন্দ্রে thinking_config.thinking_budget — একটি পূর্ণসংখ্যা যা নিয়ন্ত্রণ করে উত্তর দেওয়ার আগে মডেল কত internal reasoning token খরচ করতে পারে।
thinking_budget | আচরণ | সবচেয়ে উপযুক্ত |
|---|---|---|
| 0 | অল্ট্রা-লো লেটেন্সি ফাস্ট মোড (প্রথম token ৮৫ms-এর নিচে) | লাইভ চ্যাট, autocomplete, high-QPS routing |
| 256–1024 | হালকা multi-step planning | Tool routing, সহজ refactor, RAG synthesis |
| 4096–16384 | গভীর multi-step reasoning | Agent loops, জটিল debugging, গবেষণা রিপোর্ট |
| 32768–65536 | সর্বোচ্চ গভীরতা | দীর্ঘমেয়াদি coding, multi-file architecture changes |
Gemini API-তে এভাবে সেট করুন:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="এই React component-টি hooks-এ refactor করুন এবং error boundaries যোগ করুন।",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = fast mode; গভীর reasoning-এর জন্য ৬৫৫৩৬ পর্যন্ত
)
),
)
print(response.text)
রিজনিং নেটিভ হওয়ায় latency মসৃণভাবে scale হয়: thinking_budget 0 হলে classic Flash-এর মতো, উচ্চ মান model ID না বদলে chain-of-thought quality unlock করে। Billing visible output token ও internal thinking token আলাদা করে — আপনি শুধু চাওয়া গভীরতার জন্য pay করেন।
বেঞ্চমার্ক হাইলাইট
Google Gemini 3.6 Flash, Claude Sonnet 5 ও GPT-5.6 Terra-র বিরুদ্ধে head-to-head সংখ্যা প্রকাশ করেছে। 3.7 Flash তালিকাভুক্ত সব eval-এ এগিয়ে:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | ৪৩.৬% | ৩৪.৪% | ৩৯.১% | ৩৭.৮% |
| DeepSWE v1.1 | ৬৫.৩% | ৪৯.০% | ৫৬.২% | ৫৩.৪% |
| WebDev Arena (Elo) | ১৫৮৮ | ১৫৩৮ | ১৫৫২ | ১৫৪৪ |
| GDP.pdf | ৩৪.০% | ২২.০% | ২৮.৫% | ২৬.৮% |
| AutomationBench | ৩০.৪% | ১৭.০% | ২৩.১% | ২১.৫% |
| GDM-MRCR v2 | ৯৭.০% | ৯১.২% | ৯৪.৫% | ৯৩.১% |
| HLE-Verified | ৫৩.৬% | ৪৪.৮% | ৪৮.২% | ৪৬.৭% |
builders-এর জন্য দুটি সংখ্যা বিশেষ:
- DeepSWE v1.1-এ ৬৫.৩% — 3.6 Flash-এর চেয়ে ১৬ পয়েন্ট jump; agentic coding প্রাথমিক training target।
- GDM-MRCR v2-এ ৯৭.০% — ২.৫M-token window-এ প্রায় perfect long-context retrieval, document-heavy workflows-এর জন্য গুরুত্বপূর্ণ।
পূর্ববর্তী প্রজন্মের প্রসঙ্গ: Gemini 3.6 Flash vs 3.5 Flash comparison।
মূল্য ও ৫০% পরিচয়মূলক ছাড়
Google আক্রমণাত্মক launch promotion চালাচ্ছে:
| Intro price (৩১ ডিসেম্বর ২০২৬ পর্যন্ত) | Standard price (১ জানুয়ারি ২০২৭ থেকে) | |
|---|---|---|
| Input | $0.75 / 1M tokens | $1.50 / 1M tokens |
| Output | $3.75 / 1M tokens | $7.50 / 1M tokens |
| Context caching | $0.075 / 1M tokens | $0.075 / 1M tokens |
২০২৬-এর বাকি সময় input ও output-এ ৫০% ছাড়। Context caching — বড় system prompt বা document corpus পুনরায় ব্যবহারে উপযোগী — promo সময় নির্বিশেষে million tokens-এ $0.075।
উচ্চ thinking budget-এ কম tool-call round trip-এর সাথে, সম্পূর্ণ agent task-এর effective cost token sticker price-এর অনেক নিচে যেতে পারে। আমাদের API cost estimate guide typical workloads-এর math দেখায়।
মাল্টিমোডাল, web dev ও agent ক্ষমতা
benchmarks-এর বাইরে 3.7 Flash production-ready capabilities নিয়ে আসে:
- ২.৫M-token context window — পুরো codebase, contract bundle বা research corpus এক pass-এ।
- ২৪৫ output tokens/s — UI code ও দীর্ঘ report stream করতে যথেষ্ট দ্রুত, UX throttle ছাড়াই।
- ৯৯.৭% JSON tool execution precision — agent tool chain-এর জন্য reliable structured output।
- Computer use — browser ও desktop workflow-এর built-in client-side automation।
- UI generation fidelity — WebDev Arena (1588 Elo)-তে উচ্চ layout accuracy মানে cleaner generated frontend।
আজ Gemini API, Google AI Studio, Gemini Enterprise ও Google Antigravity-র মাধ্যমে উপলব্ধ।
ডেভেলপার গাইড ও migration
3.6 Flash বা 3.5 Flash-Lite থেকে upgrade করলে এই patterns দিয়ে শুরু করুন:
- Model ID প্রতিস্থাপন —
gemini-3.6-flash-কেgemini-3.7-flashদিয়ে; API surface backward compatible। - Task type অনুযায়ী thinking budget — user-facing chat-এ
0, RAG Q&A-তে1024, coding agent-এ8192+, latency irrelevant overnight batch job-এ শুধু32768। - Context caching enable — system prompt বা document set 32K token ছাড়ালে ও request-এ repeat হলে input cost ৯০% কম।
- Tool schema tune — ৯৯.৭% JSON precision strict schema reward করে; loose definition application layer-এ fail।
- Thinking token usage monitor —
usage_metadatalog করে বুঝুন কোন agent step-এ সত্যি deep reasoning দরকার।
Agentic workflow patterns: 3.5 Flash-Lite agentic workflows guide — thinking budget concept 3.7 Flash-এ finer granularity-তে naturally extend হয়।
উপসংহার
Gemini 3.7 Flash প্রথম Flash-tier model যেখানে গতি ও গভীরতা mutually exclusive নয়। Controllable thinking_budget এক model-কে latency-critical chat ও deep agentic coding serve করতে দেয়, launch pricing ২০২৬ শেষ পর্যন্ত experimentation সস্তা রাখে।