Gemini Omni
กลับไปดูทุกบทความ
9 นาทีอ่าน

Google เปิดตัว Gemini 3.7 Flash: การให้เหตุผลแบบไฮบริดสำหรับ coding เอเจนต์ และงานความรู้

Gemini 3.7 Flash มาถึงวันที่ 13 สิงหาคม 2026 พร้อมการให้เหตุผลแบบไฮบริดในตัว thinking budget ที่ควบคุมได้ benchmark coding ระดับ frontier และส่วนลดเปิดตัว 50% จนถึงธันวาคม

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026ไทย

เรือธงใหม่สำหรับการให้เหตุผลแบบไฮบริด

เมื่อวันที่ 13 สิงหาคม 2026 Google เปิดตัว Gemini 3.7 Flash — โมเดล การให้เหตุผลแบบไฮบริด ระดับเรือธงที่ออกแบบมาสำหรับ coding เอเจนต์ และงานความรู้ที่ซับซ้อน ต่างจากรุ่น Flash ก่อนหน้าที่แลกความลึกด้วยความเร็ว 3.7 Flash มี การให้เหตุผลในตัวที่ควบคุมได้ ใน API: คุณปรับความลึกของการคิดต่อคำขอได้โดยไม่ต้องสลับไปใช้ «โมเดลให้เหตุผล» แยก

การเปิดตัวนี้มุ่งสามกลุ่มพร้อมกัน: นักพัฒนาที่ deploy เอเจนต์ production ทีมที่รันงาน coding ระยะยาว และองค์กรที่ต้องการการวิเคราะห์มัลติโมดัลที่เชื่อถือได้บนชุดเอกสารขนาดใหญ่ Google วางตำแหน่ง 3.7 Flash เป็นโมเดลที่ endpoint เดียว รองรับทั้งการตอบแชทต่ำกว่า 100 ms และการวิจัยเชิงลึกหลายนาที

การให้เหตุผลแบบไฮบริดในตัวและ thinking budget

หัวใจคือ thinking_config.thinking_budget — จำนวนเต็มที่ควบคุมว่าโมเดลใช้ token การให้เหตุผลภายในได้เท่าใดก่อนตอบ

thinking_budgetพฤติกรรมเหมาะที่สุดสำหรับ
0โหมดเร็ว latency ต่ำมาก (token แรกต่ำกว่า 85 ms)แชทสด autocomplete routing QPS สูง
256–1024การวางแผนหลายขั้นเบาrouting เครื่องมือ refactor ง่าย สังเคราะห์ RAG
4096–16384การให้เหตุผลหลายขั้นเชิงลึกลูปเอเจนต์ debug ซับซ้อน รายงานวิจัย
32768–65536ความลึกสูงสุดcoding ระยะยาว เปลี่ยนสถาปัตยกรรมหลายไฟล์

ตั้งค่าใน Gemini API ดังนี้:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refactor คอมโพเนนต์ React นี้ให้ใช้ hooks และเพิ่ม error boundaries",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = โหมดเร็ว; สูงสุด 65536 สำหรับการให้เหตุผลเชิงลึก
        )
    ),
)
print(response.text)

เพราะการให้เหตุผลเป็น native ไม่ใช่ส่วนเสริม latency ขยายได้อย่างราบรื่น: thinking_budget เป็น 0 ทำงานเหมือน Flash คลassic ค่าที่สูงขึ้นปลดล็อกคุณภาพ chain-of-thought โดยไม่เปลี่ยน ID โมเดล การเรียกเก็บเงินแยก token เอาต์พุตที่มองเห็นได้จาก token การคิดภายใน — คุณจ่ายเฉพาะความลึกที่ขอ

ไฮไลท์ benchmark

Google เผยตัวเลข head-to-head กับ Gemini 3.6 Flash Claude Sonnet 5 และ GPT-5.6 Terra 3.7 Flash นำในทุกการประเมินที่ระบุ:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

สองตัวเลขเด่นสำหรับผู้สร้าง:

  • DeepSWE v1.1 ที่ 65.3% — กระโดด 16 จุดจาก 3.6 Flash; coding แบบเอเจนต์เป็นเป้าหมายฝึกหลัก
  • GDM-MRCR v2 ที่ 97.0% — การดึง context ยาวเกือบสมบูรณ์ในหน้าต่าง 2.5M token สำคัญสำหรับ workflow เอกสาร

บริบทรุ่นก่อน: เปรียบเทียบ Gemini 3.6 Flash vs 3.5 Flash

ราคาและส่วนลดเปิดตัว 50%

Google จัดโปรโมชันเปิดตัวเข้มข้น:

ราคา intro (ถึง 31 ธ.ค. 2026)ราคามาตรฐาน (ตั้งแต่ 1 ม.ค. 2027)
Input$0.75 / 1M tokens$1.50 / 1M tokens
Output$3.75 / 1M tokens$7.50 / 1M tokens
Context caching$0.075 / 1M tokens$0.075 / 1M tokens

คือ ส่วนลด 50% ทั้ง input และ output ตลอดช่วงที่เหลือของ 2026 Context caching — มีประโยชน์เมื่อใช้ system prompt หรือ corpus เอกสารใหญ่ซ้ำ — ยังคง $0.075 ต่อล้าน token ไม่ว่าโปรโมชัน

ร่วมกับ round-trip เรียกเครื่องมือน้อยลงเมื่อ thinking budget สูง ต้นทุนจริงต่องานเอเจนต์ที่เสร็จอาจต่ำกว่าราคา token มาก คู่มือประมาณการต้นทุน API คำนวณ workload ทั่วไป

ความสามารถมัลติโมดัล web dev และเอเจนต์

นอกจาก benchmark 3.7 Flash มีฟีเจอร์พร้อม production:

  • หน้าต่าง context 2.5M tokens — กลืน codebase ทั้งชุด ชุดสัญญา หรือ corpus วิจัยครั้งเดียว
  • 245 output tokens/วินาที — เร็วพอสตรีมโค้ด UI และรายงานยาวโดยไม่กระทบ UX
  • ความแม่นยำการ execute tool JSON 99.7% — เอาต์พุตมีโครงสร้างเชื่อถือได้สำหรับ chain เครื่องมือเอเจนต์
  • Computer use — อัตโนมัติฝั่ง client ในตัวสำหรับ workflow เบราว์เซอร์และเดสก์ท็อป
  • ความซื่อสัตย์การสร้าง UI — ความแม่นยำ layout สูงขึ้นบน WebDev Arena (1588 Elo) หมายถึง frontend ที่ generate สะอาดขึ้น

พร้อมใช้วันนี้ผ่าน Gemini API Google AI Studio Gemini Enterprise และ Google Antigravity

คู่มือนักพัฒนาและการย้าย

หากอัปเกรดจาก 3.6 Flash หรือ 3.5 Flash-Lite เริ่มจากรูปแบบเหล่านี้:

  1. แทนที่ ID โมเดล — เปลี่ยน gemini-3.6-flash เป็น gemini-3.7-flash; API surface รองรับย้อนหลัง
  2. ตั้ง thinking budget ตามประเภทงาน0 สำหรับแชทผู้ใช้ 1024 สำหรับ RAG Q&A 8192+ สำหรับเอเจนต์ coding 32768 เฉพาะงาน batch กลางคืนที่ไม่สน latency
  3. เปิด context caching — หาก system prompt หรือชุดเอกสารเกิน 32K tokens และซ้ำระหว่างคำขอ caching ลดต้นทุน input 90%
  4. ปรับ schema เครื่องมือ — ความแม่นยำ JSON 99.7% ให้รางวัล schema เข้ม; นิยามหลวมยังล้มเหลวที่ชั้นแอป
  5. ติดตามการใช้ token การคิด — log usage_metadata เพื่อเข้าใจขั้นตอนเอเจนต์ที่ต้องการการให้เหตุผลเชิงลึกจริง

สำหรับรูปแบบ workflow เอเจนต์ ดู คู่มือ workflow เอเจนต์ 3.5 Flash-Lite — แนวคิด thinking budget ขยายไป 3.7 Flash อย่างเป็นธรรมชาติด้วยความละเอียดมากขึ้น

สรุป

Gemini 3.7 Flash เป็นโมเดลระดับ Flash แรกที่ ความเร็วและความลึกไม่ตัดกัน thinking_budget ที่ควบคุมได้ทำให้โมเดลเดียวรองรับแชทที่ sensitive ต่อ latency และ coding เอเจนต์เชิงลึก และราคาเปิดตัวทำให้ทดลองถูกจนถึงสิ้นปี 2026

ที่เกี่ยวข้อง