Google เปิดตัว Gemini 3.7 Flash: การให้เหตุผลแบบไฮบริดสำหรับ coding เอเจนต์ และงานความรู้
Gemini 3.7 Flash มาถึงวันที่ 13 สิงหาคม 2026 พร้อมการให้เหตุผลแบบไฮบริดในตัว thinking budget ที่ควบคุมได้ benchmark coding ระดับ frontier และส่วนลดเปิดตัว 50% จนถึงธันวาคม
เรือธงใหม่สำหรับการให้เหตุผลแบบไฮบริด
เมื่อวันที่ 13 สิงหาคม 2026 Google เปิดตัว Gemini 3.7 Flash — โมเดล การให้เหตุผลแบบไฮบริด ระดับเรือธงที่ออกแบบมาสำหรับ coding เอเจนต์ และงานความรู้ที่ซับซ้อน ต่างจากรุ่น Flash ก่อนหน้าที่แลกความลึกด้วยความเร็ว 3.7 Flash มี การให้เหตุผลในตัวที่ควบคุมได้ ใน API: คุณปรับความลึกของการคิดต่อคำขอได้โดยไม่ต้องสลับไปใช้ «โมเดลให้เหตุผล» แยก
การเปิดตัวนี้มุ่งสามกลุ่มพร้อมกัน: นักพัฒนาที่ deploy เอเจนต์ production ทีมที่รันงาน coding ระยะยาว และองค์กรที่ต้องการการวิเคราะห์มัลติโมดัลที่เชื่อถือได้บนชุดเอกสารขนาดใหญ่ Google วางตำแหน่ง 3.7 Flash เป็นโมเดลที่ endpoint เดียว รองรับทั้งการตอบแชทต่ำกว่า 100 ms และการวิจัยเชิงลึกหลายนาที
การให้เหตุผลแบบไฮบริดในตัวและ thinking budget
หัวใจคือ thinking_config.thinking_budget — จำนวนเต็มที่ควบคุมว่าโมเดลใช้ token การให้เหตุผลภายในได้เท่าใดก่อนตอบ
thinking_budget | พฤติกรรม | เหมาะที่สุดสำหรับ |
|---|---|---|
| 0 | โหมดเร็ว latency ต่ำมาก (token แรกต่ำกว่า 85 ms) | แชทสด autocomplete routing QPS สูง |
| 256–1024 | การวางแผนหลายขั้นเบา | routing เครื่องมือ refactor ง่าย สังเคราะห์ RAG |
| 4096–16384 | การให้เหตุผลหลายขั้นเชิงลึก | ลูปเอเจนต์ debug ซับซ้อน รายงานวิจัย |
| 32768–65536 | ความลึกสูงสุด | coding ระยะยาว เปลี่ยนสถาปัตยกรรมหลายไฟล์ |
ตั้งค่าใน Gemini API ดังนี้:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactor คอมโพเนนต์ React นี้ให้ใช้ hooks และเพิ่ม error boundaries",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = โหมดเร็ว; สูงสุด 65536 สำหรับการให้เหตุผลเชิงลึก
)
),
)
print(response.text)
เพราะการให้เหตุผลเป็น native ไม่ใช่ส่วนเสริม latency ขยายได้อย่างราบรื่น: thinking_budget เป็น 0 ทำงานเหมือน Flash คลassic ค่าที่สูงขึ้นปลดล็อกคุณภาพ chain-of-thought โดยไม่เปลี่ยน ID โมเดล การเรียกเก็บเงินแยก token เอาต์พุตที่มองเห็นได้จาก token การคิดภายใน — คุณจ่ายเฉพาะความลึกที่ขอ
ไฮไลท์ benchmark
Google เผยตัวเลข head-to-head กับ Gemini 3.6 Flash Claude Sonnet 5 และ GPT-5.6 Terra 3.7 Flash นำในทุกการประเมินที่ระบุ:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
สองตัวเลขเด่นสำหรับผู้สร้าง:
- DeepSWE v1.1 ที่ 65.3% — กระโดด 16 จุดจาก 3.6 Flash; coding แบบเอเจนต์เป็นเป้าหมายฝึกหลัก
- GDM-MRCR v2 ที่ 97.0% — การดึง context ยาวเกือบสมบูรณ์ในหน้าต่าง 2.5M token สำคัญสำหรับ workflow เอกสาร
บริบทรุ่นก่อน: เปรียบเทียบ Gemini 3.6 Flash vs 3.5 Flash
ราคาและส่วนลดเปิดตัว 50%
Google จัดโปรโมชันเปิดตัวเข้มข้น:
| ราคา intro (ถึง 31 ธ.ค. 2026) | ราคามาตรฐาน (ตั้งแต่ 1 ม.ค. 2027) | |
|---|---|---|
| Input | $0.75 / 1M tokens | $1.50 / 1M tokens |
| Output | $3.75 / 1M tokens | $7.50 / 1M tokens |
| Context caching | $0.075 / 1M tokens | $0.075 / 1M tokens |
คือ ส่วนลด 50% ทั้ง input และ output ตลอดช่วงที่เหลือของ 2026 Context caching — มีประโยชน์เมื่อใช้ system prompt หรือ corpus เอกสารใหญ่ซ้ำ — ยังคง $0.075 ต่อล้าน token ไม่ว่าโปรโมชัน
ร่วมกับ round-trip เรียกเครื่องมือน้อยลงเมื่อ thinking budget สูง ต้นทุนจริงต่องานเอเจนต์ที่เสร็จอาจต่ำกว่าราคา token มาก คู่มือประมาณการต้นทุน API คำนวณ workload ทั่วไป
ความสามารถมัลติโมดัล web dev และเอเจนต์
นอกจาก benchmark 3.7 Flash มีฟีเจอร์พร้อม production:
- หน้าต่าง context 2.5M tokens — กลืน codebase ทั้งชุด ชุดสัญญา หรือ corpus วิจัยครั้งเดียว
- 245 output tokens/วินาที — เร็วพอสตรีมโค้ด UI และรายงานยาวโดยไม่กระทบ UX
- ความแม่นยำการ execute tool JSON 99.7% — เอาต์พุตมีโครงสร้างเชื่อถือได้สำหรับ chain เครื่องมือเอเจนต์
- Computer use — อัตโนมัติฝั่ง client ในตัวสำหรับ workflow เบราว์เซอร์และเดสก์ท็อป
- ความซื่อสัตย์การสร้าง UI — ความแม่นยำ layout สูงขึ้นบน WebDev Arena (1588 Elo) หมายถึง frontend ที่ generate สะอาดขึ้น
พร้อมใช้วันนี้ผ่าน Gemini API Google AI Studio Gemini Enterprise และ Google Antigravity
คู่มือนักพัฒนาและการย้าย
หากอัปเกรดจาก 3.6 Flash หรือ 3.5 Flash-Lite เริ่มจากรูปแบบเหล่านี้:
- แทนที่ ID โมเดล — เปลี่ยน
gemini-3.6-flashเป็นgemini-3.7-flash; API surface รองรับย้อนหลัง - ตั้ง thinking budget ตามประเภทงาน —
0สำหรับแชทผู้ใช้1024สำหรับ RAG Q&A8192+สำหรับเอเจนต์ coding32768เฉพาะงาน batch กลางคืนที่ไม่สน latency - เปิด context caching — หาก system prompt หรือชุดเอกสารเกิน 32K tokens และซ้ำระหว่างคำขอ caching ลดต้นทุน input 90%
- ปรับ schema เครื่องมือ — ความแม่นยำ JSON 99.7% ให้รางวัล schema เข้ม; นิยามหลวมยังล้มเหลวที่ชั้นแอป
- ติดตามการใช้ token การคิด — log
usage_metadataเพื่อเข้าใจขั้นตอนเอเจนต์ที่ต้องการการให้เหตุผลเชิงลึกจริง
สำหรับรูปแบบ workflow เอเจนต์ ดู คู่มือ workflow เอเจนต์ 3.5 Flash-Lite — แนวคิด thinking budget ขยายไป 3.7 Flash อย่างเป็นธรรมชาติด้วยความละเอียดมากขึ้น
สรุป
Gemini 3.7 Flash เป็นโมเดลระดับ Flash แรกที่ ความเร็วและความลึกไม่ตัดกัน thinking_budget ที่ควบคุมได้ทำให้โมเดลเดียวรองรับแชทที่ sensitive ต่อ latency และ coding เอเจนต์เชิงลึก และราคาเปิดตัวทำให้ทดลองถูกจนถึงสิ้นปี 2026