Gemini Omni
Quay lại tất cả bài
9 phút đọc

Google ra mắt Gemini 3.7 Flash: suy luận lai cho coding, agent và công việc tri thức

Gemini 3.7 Flash ra mắt ngày 13/8/2026 với suy luận lai native, thinking budget có thể điều khiển, benchmark coding frontier và giảm giá 50% đến hết tháng 12.

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026Tiếng Việt

Hàng flagship mới cho suy luận lai

Ngày 13 tháng 8 năm 2026, Google phát hành Gemini 3.7 Flash — mô hình suy luận lai flagship dành cho coding, agent và công việc tri thức phức tạp. Khác với các thế hệ Flash trước hy sinh độ sâu để đổi lấy tốc độ, 3.7 Flash tích hợp suy luận native có thể điều khiển ngay trong API: bạn điều chỉnh độ sâu suy nghĩ theo từng request mà không cần chuyển sang «mô hình suy luận» riêng.

Ra mắt nhắm đồng thời ba nhóm: developer triển khai agent production, team chạy tác vụ coding dài hạn, và doanh nghiệp cần phân tích đa phương thức đáng tin trên tập tài liệu khổng lồ. Google định vị 3.7 Flash là mô hình mà một endpoint cuối cùng phục vụ cả phản hồi chat dưới 100 ms lẫn nghiên cứu sâu kéo dài nhiều phút.

Suy luận lai native và thinking budget

Trọng tâm là thinking_config.thinking_budget — số nguyên kiểm soát số token suy luận nội bộ model được tiêu thụ trước khi trả lời.

thinking_budgetHành viPhù hợp nhất
0Chế độ nhanh độ trễ cực thấp (token đầu dưới 85 ms)Chat trực tiếp, autocomplete, routing QPS cao
256–1024Lập kế hoạch đa bước nhẹRouting tool, refactor đơn giản, tổng hợp RAG
4096–16384Suy luận đa bước sâuVòng lặp agent, debug phức tạp, báo cáo nghiên cứu
32768–65536Độ sâu tối đaCoding dài hạn, thay đổi kiến trúc đa file

Cấu hình trong Gemini API:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="Refactor component React này sang hooks và thêm error boundaries.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = chế độ nhanh; tới 65536 cho suy luận sâu
        )
    ),
)
print(response.text)

Vì suy luận là native chứ không gắn thêm, độ trễ scale mượt: thinking_budget = 0 hoạt động như Flash cổ điển, giá trị cao hơn mở chất lượng chain-of-thought mà không đổi ID model. Thanh toán tách token output hiển thị khỏi token suy nghĩ nội bộ — bạn chỉ trả cho độ sâu yêu cầu.

Điểm nổi bật benchmark

Google công bố số liệu đối đầu với Gemini 3.6 Flash, Claude Sonnet 5GPT-5.6 Terra. 3.7 Flash dẫn đầu mọi đánh giá được liệt kê:

BenchmarkGemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

Hai con số nổi bật với builder:

  • DeepSWE v1.1 đạt 65.3% — nhảy 16 điểm so với 3.6 Flash; coding agentic là mục tiêu huấn luyện chính.
  • GDM-MRCR v2 đạt 97.0% — truy xuất ngữ cảnh dài gần hoàn hảo trên cửa sổ 2,5M token, quan trọng cho workflow tài liệu.

Bối cảnh thế hệ trước: so sánh Gemini 3.6 Flash vs 3.5 Flash.

Giá và giảm 50% ra mắt

Google đang chạy khuyến mãi ra mắt mạnh:

Giá intro (đến 31/12/2026)Giá chuẩn (từ 1/1/2027)
Input$0,75 / 1M token$1,50 / 1M token
Output$3,75 / 1M token$7,50 / 1M token
Context caching$0,075 / 1M token$0,075 / 1M token

Đó là giảm 50% input và output trong phần còn lại của 2026. Context caching — hữu ích khi tái sử dụng system prompt hoặc corpus tài liệu lớn — vẫn $0,075/triệu token bất kể promo.

Kết hợp ít vòng gọi tool hơn ở thinking budget cao, chi phí thực tế mỗi tác vụ agent hoàn thành có thể thấp hơn nhiều so với giá token. Hướng dẫn ước tính chi phí API tính toán workload điển hình.

Khả năng đa phương thức, web dev và agent

Ngoài benchmark, 3.7 Flash có tính năng sẵn sàng production:

  • Cửa sổ ngữ cảnh 2,5M token — nuốt cả codebase, gói hợp đồng hoặc corpus nghiên cứu một lần.
  • 245 token output/giây — đủ nhanh stream code UI và báo cáo dài không nghẽn UX.
  • Độ chính xác thực thi tool JSON 99,7% — output có cấu trúc đáng tin cho chuỗi tool agent.
  • Computer use — tự động hóa client-side tích hợp cho workflow trình duyệt và desktop.
  • Độ trung thực sinh UI — độ chính xác layout cao hơn trên WebDev Arena (1588 Elo) nghĩa là frontend sinh ra sạch hơn.

Có sẵn hôm nay qua Gemini API, Google AI Studio, Gemini EnterpriseGoogle Antigravity.

Hướng dẫn developer và migration

Nếu nâng cấp từ 3.6 Flash hoặc 3.5 Flash-Lite, bắt đầu với các mẫu sau:

  1. Thay ID model — đổi gemini-3.6-flash thành gemini-3.7-flash; API surface tương thích ngược.
  2. Đặt thinking budget theo loại tác vụ0 cho chat người dùng, 1024 cho RAG Q&A, 8192+ cho agent coding, 32768 chỉ cho job batch đêm không quan tâm độ trễ.
  3. Bật context caching — nếu system prompt hoặc tập tài liệu vượt 32K token và lặp giữa các request, caching cắt 90% chi phí input.
  4. Tinh chỉnh schema tool — độ chính xác JSON 99,7% thưởng schema chặt; định nghĩa lỏng vẫn fail ở tầng ứng dụng.
  5. Theo dõi dùng token suy nghĩ — log usage_metadata để biết bước agent nào thực sự cần suy luận sâu.

Về mẫu workflow agentic, xem hướng dẫn workflow agentic 3.5 Flash-Lite — khái niệm thinking budget mở rộng tự nhiên sang 3.7 Flash với độ chi tiết cao hơn.

Kết luận

Gemini 3.7 Flash là mô hình cấp Flash đầu tiên mà tốc độ và độ sâu không loại trừ nhau. thinking_budget có thể điều khiển cho phép một model phục vụ chat nhạy độ trễ lẫn coding agentic sâu, và giá ra mắt giúp thử nghiệm rẻ đến cuối 2026.

Liên quan