Gemini Omni
সব নিবন্ধে ফিরে
9 মিনিট পঠনযোগ্য

Google Gemini 3.7 Flash চালু করল: কোডিং, এজেন্ট ও জ্ঞানকর্মের জন্য হাইব্রিড রিজনিং

Gemini 3.7 Flash ১৩ আগস্ট ২০২৬-এ এসেছে নেটিভ হাইব্রিড রিজনিং, নিয়ন্ত্রণযোগ্য thinking budget, frontier কোডিং বেঞ্চমার্ক ও ডিসেম্বর পর্যন্ত ৫০% পরিচয়মূলক ছাড় সহ।

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026বাংলা

হাইব্রিড রিজনিংয়ের নতুন ফ্ল্যাগশিপ

১৩ আগস্ট ২০২৬-এ Google Gemini 3.7 Flash প্রকাশ করেছে — কোডিং, এজেন্ট ও জটিল জ্ঞানকর্ম-এর জন্য তৈরি ফ্ল্যাগশিপ হাইব্রিড রিজনিং মডেল। গভীরতা বিনিময়ে গতির পুরনো Flash প্রজন্মের বিপরীতে, 3.7 Flash API-তে নেটিভ নিয়ন্ত্রণযোগ্য রিজনিং এনেছে: প্রতিটি অনুরোধে চিন্তার গভীরতা সামঞ্জস্য করুন, আলাদা «রিজনিং মডেল»-এ যাওয়ার দরকার নেই।

লঞ্চ একসাথে তিন দর্শককে লক্ষ্য করে: প্রোডাকশন এজেন্ট চালানো ডেভেলপার, দীর্ঘমেয়াদি কোডিং টাস্ক চালানো দল, এবং বিশাল ডকুমেন্ট সেটে নির্ভরযোগ্য মাল্টিমোডাল বিশ্লেষণ চাওয়া প্রতিষ্ঠান। Google 3.7 Flash-কে সেই মডেল হিসেবে দাঁড় করিয়েছে যেখানে একটি endpoint অবশেষে sub-100ms চ্যাট উত্তর ও কয়েক মিনিটের গভীর গবেষণা দুটোই serve করে।

নেটিভ হাইব্রিড রিজনিং ও thinking budget

কেন্দ্রে thinking_config.thinking_budget — একটি পূর্ণসংখ্যা যা নিয়ন্ত্রণ করে উত্তর দেওয়ার আগে মডেল কত internal reasoning token খরচ করতে পারে।

thinking_budgetআচরণসবচেয়ে উপযুক্ত
0অল্ট্রা-লো লেটেন্সি ফাস্ট মোড (প্রথম token ৮৫ms-এর নিচে)লাইভ চ্যাট, autocomplete, high-QPS routing
256–1024হালকা multi-step planningTool routing, সহজ refactor, RAG synthesis
4096–16384গভীর multi-step reasoningAgent loops, জটিল debugging, গবেষণা রিপোর্ট
32768–65536সর্বোচ্চ গভীরতাদীর্ঘমেয়াদি coding, multi-file architecture changes

Gemini API-তে এভাবে সেট করুন:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="এই React component-টি hooks-এ refactor করুন এবং error boundaries যোগ করুন।",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = fast mode; গভীর reasoning-এর জন্য ৬৫৫৩৬ পর্যন্ত
        )
    ),
)
print(response.text)

রিজনিং নেটিভ হওয়ায় latency মসৃণভাবে scale হয়: thinking_budget 0 হলে classic Flash-এর মতো, উচ্চ মান model ID না বদলে chain-of-thought quality unlock করে। Billing visible output token ও internal thinking token আলাদা করে — আপনি শুধু চাওয়া গভীরতার জন্য pay করেন।

বেঞ্চমার্ক হাইলাইট

Google Gemini 3.6 Flash, Claude Sonnet 5GPT-5.6 Terra-র বিরুদ্ধে head-to-head সংখ্যা প্রকাশ করেছে। 3.7 Flash তালিকাভুক্ত সব eval-এ এগিয়ে:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.1৪৩.৬%৩৪.৪%৩৯.১%৩৭.৮%
DeepSWE v1.1৬৫.৩%৪৯.০%৫৬.২%৫৩.৪%
WebDev Arena (Elo)১৫৮৮১৫৩৮১৫৫২১৫৪৪
GDP.pdf৩৪.০%২২.০%২৮.৫%২৬.৮%
AutomationBench৩০.৪%১৭.০%২৩.১%২১.৫%
GDM-MRCR v2৯৭.০%৯১.২%৯৪.৫%৯৩.১%
HLE-Verified৫৩.৬%৪৪.৮%৪৮.২%৪৬.৭%

builders-এর জন্য দুটি সংখ্যা বিশেষ:

  • DeepSWE v1.1-এ ৬৫.৩% — 3.6 Flash-এর চেয়ে ১৬ পয়েন্ট jump; agentic coding প্রাথমিক training target।
  • GDM-MRCR v2-এ ৯৭.০% — ২.৫M-token window-এ প্রায় perfect long-context retrieval, document-heavy workflows-এর জন্য গুরুত্বপূর্ণ।

পূর্ববর্তী প্রজন্মের প্রসঙ্গ: Gemini 3.6 Flash vs 3.5 Flash comparison

মূল্য ও ৫০% পরিচয়মূলক ছাড়

Google আক্রমণাত্মক launch promotion চালাচ্ছে:

Intro price (৩১ ডিসেম্বর ২০২৬ পর্যন্ত)Standard price (১ জানুয়ারি ২০২৭ থেকে)
Input$0.75 / 1M tokens$1.50 / 1M tokens
Output$3.75 / 1M tokens$7.50 / 1M tokens
Context caching$0.075 / 1M tokens$0.075 / 1M tokens

২০২৬-এর বাকি সময় input ও output-এ ৫০% ছাড়। Context caching — বড় system prompt বা document corpus পুনরায় ব্যবহারে উপযোগী — promo সময় নির্বিশেষে million tokens-এ $0.075।

উচ্চ thinking budget-এ কম tool-call round trip-এর সাথে, সম্পূর্ণ agent task-এর effective cost token sticker price-এর অনেক নিচে যেতে পারে। আমাদের API cost estimate guide typical workloads-এর math দেখায়।

মাল্টিমোডাল, web dev ও agent ক্ষমতা

benchmarks-এর বাইরে 3.7 Flash production-ready capabilities নিয়ে আসে:

  • ২.৫M-token context window — পুরো codebase, contract bundle বা research corpus এক pass-এ।
  • ২৪৫ output tokens/s — UI code ও দীর্ঘ report stream করতে যথেষ্ট দ্রুত, UX throttle ছাড়াই।
  • ৯৯.৭% JSON tool execution precision — agent tool chain-এর জন্য reliable structured output।
  • Computer use — browser ও desktop workflow-এর built-in client-side automation।
  • UI generation fidelity — WebDev Arena (1588 Elo)-তে উচ্চ layout accuracy মানে cleaner generated frontend।

আজ Gemini API, Google AI Studio, Gemini EnterpriseGoogle Antigravity-র মাধ্যমে উপলব্ধ।

ডেভেলপার গাইড ও migration

3.6 Flash বা 3.5 Flash-Lite থেকে upgrade করলে এই patterns দিয়ে শুরু করুন:

  1. Model ID প্রতিস্থাপনgemini-3.6-flash-কে gemini-3.7-flash দিয়ে; API surface backward compatible।
  2. Task type অনুযায়ী thinking budget — user-facing chat-এ 0, RAG Q&A-তে 1024, coding agent-এ 8192+, latency irrelevant overnight batch job-এ শুধু 32768
  3. Context caching enable — system prompt বা document set 32K token ছাড়ালে ও request-এ repeat হলে input cost ৯০% কম।
  4. Tool schema tune — ৯৯.৭% JSON precision strict schema reward করে; loose definition application layer-এ fail।
  5. Thinking token usage monitorusage_metadata log করে বুঝুন কোন agent step-এ সত্যি deep reasoning দরকার।

Agentic workflow patterns: 3.5 Flash-Lite agentic workflows guide — thinking budget concept 3.7 Flash-এ finer granularity-তে naturally extend হয়।

উপসংহার

Gemini 3.7 Flash প্রথম Flash-tier model যেখানে গতি ও গভীরতা mutually exclusive নয়। Controllable thinking_budget এক model-কে latency-critical chat ও deep agentic coding serve করতে দেয়, launch pricing ২০২৬ শেষ পর্যন্ত experimentation সস্তা রাখে।

সম্পর্কিত