Google ra mắt Gemini 3.7 Flash: suy luận lai cho coding, agent và công việc tri thức
Gemini 3.7 Flash ra mắt ngày 13/8/2026 với suy luận lai native, thinking budget có thể điều khiển, benchmark coding frontier và giảm giá 50% đến hết tháng 12.
Hàng flagship mới cho suy luận lai
Ngày 13 tháng 8 năm 2026, Google phát hành Gemini 3.7 Flash — mô hình suy luận lai flagship dành cho coding, agent và công việc tri thức phức tạp. Khác với các thế hệ Flash trước hy sinh độ sâu để đổi lấy tốc độ, 3.7 Flash tích hợp suy luận native có thể điều khiển ngay trong API: bạn điều chỉnh độ sâu suy nghĩ theo từng request mà không cần chuyển sang «mô hình suy luận» riêng.
Ra mắt nhắm đồng thời ba nhóm: developer triển khai agent production, team chạy tác vụ coding dài hạn, và doanh nghiệp cần phân tích đa phương thức đáng tin trên tập tài liệu khổng lồ. Google định vị 3.7 Flash là mô hình mà một endpoint cuối cùng phục vụ cả phản hồi chat dưới 100 ms lẫn nghiên cứu sâu kéo dài nhiều phút.
Suy luận lai native và thinking budget
Trọng tâm là thinking_config.thinking_budget — số nguyên kiểm soát số token suy luận nội bộ model được tiêu thụ trước khi trả lời.
thinking_budget | Hành vi | Phù hợp nhất |
|---|---|---|
| 0 | Chế độ nhanh độ trễ cực thấp (token đầu dưới 85 ms) | Chat trực tiếp, autocomplete, routing QPS cao |
| 256–1024 | Lập kế hoạch đa bước nhẹ | Routing tool, refactor đơn giản, tổng hợp RAG |
| 4096–16384 | Suy luận đa bước sâu | Vòng lặp agent, debug phức tạp, báo cáo nghiên cứu |
| 32768–65536 | Độ sâu tối đa | Coding dài hạn, thay đổi kiến trúc đa file |
Cấu hình trong Gemini API:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="Refactor component React này sang hooks và thêm error boundaries.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = chế độ nhanh; tới 65536 cho suy luận sâu
)
),
)
print(response.text)
Vì suy luận là native chứ không gắn thêm, độ trễ scale mượt: thinking_budget = 0 hoạt động như Flash cổ điển, giá trị cao hơn mở chất lượng chain-of-thought mà không đổi ID model. Thanh toán tách token output hiển thị khỏi token suy nghĩ nội bộ — bạn chỉ trả cho độ sâu yêu cầu.
Điểm nổi bật benchmark
Google công bố số liệu đối đầu với Gemini 3.6 Flash, Claude Sonnet 5 và GPT-5.6 Terra. 3.7 Flash dẫn đầu mọi đánh giá được liệt kê:
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
Hai con số nổi bật với builder:
- DeepSWE v1.1 đạt 65.3% — nhảy 16 điểm so với 3.6 Flash; coding agentic là mục tiêu huấn luyện chính.
- GDM-MRCR v2 đạt 97.0% — truy xuất ngữ cảnh dài gần hoàn hảo trên cửa sổ 2,5M token, quan trọng cho workflow tài liệu.
Bối cảnh thế hệ trước: so sánh Gemini 3.6 Flash vs 3.5 Flash.
Giá và giảm 50% ra mắt
Google đang chạy khuyến mãi ra mắt mạnh:
| Giá intro (đến 31/12/2026) | Giá chuẩn (từ 1/1/2027) | |
|---|---|---|
| Input | $0,75 / 1M token | $1,50 / 1M token |
| Output | $3,75 / 1M token | $7,50 / 1M token |
| Context caching | $0,075 / 1M token | $0,075 / 1M token |
Đó là giảm 50% input và output trong phần còn lại của 2026. Context caching — hữu ích khi tái sử dụng system prompt hoặc corpus tài liệu lớn — vẫn $0,075/triệu token bất kể promo.
Kết hợp ít vòng gọi tool hơn ở thinking budget cao, chi phí thực tế mỗi tác vụ agent hoàn thành có thể thấp hơn nhiều so với giá token. Hướng dẫn ước tính chi phí API tính toán workload điển hình.
Khả năng đa phương thức, web dev và agent
Ngoài benchmark, 3.7 Flash có tính năng sẵn sàng production:
- Cửa sổ ngữ cảnh 2,5M token — nuốt cả codebase, gói hợp đồng hoặc corpus nghiên cứu một lần.
- 245 token output/giây — đủ nhanh stream code UI và báo cáo dài không nghẽn UX.
- Độ chính xác thực thi tool JSON 99,7% — output có cấu trúc đáng tin cho chuỗi tool agent.
- Computer use — tự động hóa client-side tích hợp cho workflow trình duyệt và desktop.
- Độ trung thực sinh UI — độ chính xác layout cao hơn trên WebDev Arena (1588 Elo) nghĩa là frontend sinh ra sạch hơn.
Có sẵn hôm nay qua Gemini API, Google AI Studio, Gemini Enterprise và Google Antigravity.
Hướng dẫn developer và migration
Nếu nâng cấp từ 3.6 Flash hoặc 3.5 Flash-Lite, bắt đầu với các mẫu sau:
- Thay ID model — đổi
gemini-3.6-flashthànhgemini-3.7-flash; API surface tương thích ngược. - Đặt thinking budget theo loại tác vụ —
0cho chat người dùng,1024cho RAG Q&A,8192+cho agent coding,32768chỉ cho job batch đêm không quan tâm độ trễ. - Bật context caching — nếu system prompt hoặc tập tài liệu vượt 32K token và lặp giữa các request, caching cắt 90% chi phí input.
- Tinh chỉnh schema tool — độ chính xác JSON 99,7% thưởng schema chặt; định nghĩa lỏng vẫn fail ở tầng ứng dụng.
- Theo dõi dùng token suy nghĩ — log
usage_metadatađể biết bước agent nào thực sự cần suy luận sâu.
Về mẫu workflow agentic, xem hướng dẫn workflow agentic 3.5 Flash-Lite — khái niệm thinking budget mở rộng tự nhiên sang 3.7 Flash với độ chi tiết cao hơn.
Kết luận
Gemini 3.7 Flash là mô hình cấp Flash đầu tiên mà tốc độ và độ sâu không loại trừ nhau. thinking_budget có thể điều khiển cho phép một model phục vụ chat nhạy độ trễ lẫn coding agentic sâu, và giá ra mắt giúp thử nghiệm rẻ đến cuối 2026.