Gemini 3.6 Flash vs 3.5 Flash: Benchmark, giá cả và khi nào nên chuyển đổi (2026)
Gemini 3.6 Flash vượt 3.5 Flash trên mọi benchmark, đồng thời giảm 17% token đầu ra và cả giá. Bảng so sánh đầy đủ kèm cẩm nang chuyển đổi cho nhà phát triển.
Bản nâng cấp “tốt hơn toàn diện” hiếm có
Hầu hết các bản nâng cấp mô hình đều phải đánh đổi thứ gì đó — chất lượng đổi lấy tốc độ, giá đổi lấy năng lực. Gemini 3.6 Flash vs Gemini 3.5 Flash là trường hợp khác thường: mô hình mới thắng trên mọi trục mà Google công bố ngày 21 tháng 7 năm 2026 — điểm benchmark cao hơn, ít token đầu ra hơn, ít bước suy luận và lượt gọi công cụ hơn, và giá mỗi token thấp hơn. Bài phân tích này đi qua từng con số, rồi chuyển sang phần thực tiễn: ai nên chuyển, khi nào, và cần kiểm thử lại những gì.
Nếu muốn nắm bối cảnh đầy đủ về đợt ra mắt ba mô hình trước, hãy bắt đầu từ bài tổng quan thông báo của chúng tôi.
Hiệu suất token: tiêu điểm không ai nên bỏ qua
Con số quan trọng nhất trong bản phát hành này không phải là điểm benchmark. Trên Artificial Analysis Index, 3.6 Flash tiêu thụ ít hơn 17% token đầu ra so với 3.5 Flash cho khối lượng công việc tương đương. Trên DeepSWE của Datacurve, Google ghi nhận mức giảm lên tới 65%.

Vì sao điều này quan trọng hơn vẻ ngoài:
- Token đầu ra mới là thứ đắt đỏ ($7.50/1M so với $1.50/1M cho đầu vào). Cắt giảm 17–65% là tấn công thẳng vào cấu phần chi phí lớn nhất.
- Ít token hơn = độ trễ thấp hơn. Agent nói ít hơn sẽ hoàn thành sớm hơn, và các chuỗi nhiều bước khuếch đại hiệu ứng này.
- Ít bước suy luận và lượt gọi công cụ hơn nghĩa là ít vòng lặp qua lại, ít điểm hỏng hóc và ít gánh nặng điều phối cho mỗi tác vụ.
Google đã công bố bản demo so sánh trực tiếp trên một tác vụ sử dụng máy tính — xem video so sánh hiệu suất token.
So sánh benchmark đầy đủ
| Benchmark | Đo lường gì | Gemini 3.6 Flash | Gemini 3.5 Flash | Chênh lệch |
|---|---|---|---|---|
| DeepSWE | Kỹ thuật phần mềm agent | 49% | 37% | +12 điểm |
| MLE Bench | Nghiên cứu & kỹ thuật ML | 63,9% | 49,7% | +14,2 điểm |
| OSWorld-Verified | Sử dụng máy tính | 83,0% | 78,4% | +4,6 điểm |
| GDPval-AA v2 | Công việc tri thức thực tế | 1421 | 1349 | +72 |

Ba cách đọc bảng số liệu này:
- Cú nhảy DeepSWE (37% → 49%) là điều các đội lập trình nên quan tâm nhất: Google quy nó cho độ chính xác cao hơn — ít chỉnh sửa mã ngoài ý muốn và giảm vòng lặp thực thi, chứ không chỉ là năng lực thô lớn hơn.
- MLE Bench (+14,2 điểm) là mức tăng lớn nhất, báo hiệu bước tiến thực sự trong quy trình nghiên cứu ML — dựng khung thí nghiệm, phân tích dữ liệu, gỡ lỗi vòng huấn luyện.
- OSWorld-Verified ở mức 83,0% quan trọng vì sử dụng máy tính giờ là công cụ phía client tích hợp sẵn trong Gemini API và Gemini Enterprise. Bước nhảy năng lực và thay đổi cách đóng gói đến cùng lúc.
Giá: rẻ hơn mỗi token, rẻ hơn mỗi tác vụ
| Gemini 3.6 Flash | Gemini 3.5 Flash | |
|---|---|---|
| Giá đầu vào | $1.50 / 1M token | Cao hơn |
| Giá đầu ra | $7.50 / 1M token | Cao hơn |
| Token đầu ra mỗi tác vụ | Ít hơn ~17% (lên tới 65% trên DeepSWE) | Mốc chuẩn |
| Chi phí thực tế mỗi tác vụ agent | Thấp hơn đáng kể | Mốc chuẩn |
Điểm mấu chốt là hiệu ứng nhân đôi. Một tác vụ trước đây sinh ra 100 nghìn token đầu ra giờ chỉ sinh ~83 nghìn, và mỗi token đó lại rẻ hơn. Với khối lượng công việc chạy hàng triệu tác vụ agent mỗi tháng, khoản tiết kiệm hiện ngay trên hóa đơn mà không cần chạm vào prompt của bạn.
Sử dụng máy tính: từ tiện ích bổ sung thành tích hợp sẵn
Với 3.6 Flash, sử dụng máy tính được xuất xưởng như một công cụ phía client tích hợp sẵn qua Gemini API và Gemini Enterprise. Kết hợp với cải thiện OSWorld-Verified (78,4% → 83,0%), các đội xây dựng agent trình duyệt, tự động hóa kiểu RPA hoặc bot QA nhận được cả mô hình mạnh hơn lẫn ít mã tích hợp hơn. Nếu trước đây bạn duy trì khung sử dụng máy tính tự chế quanh 3.5 Flash, hãy chuẩn bị xóa bớt một phần.
Tư thế an toàn
3.6 Flash đi kèm các biện pháp bảo vệ Frontier Safety nâng cao trong lĩnh vực CBRN và tấn công mạng, và Google báo cáo nó kháng jailbreak tốt hơn đáng kể so với 3.5 Flash. Điều quan trọng không kém với các đội sản phẩm: mô hình cũng được huấn luyện để giảm từ chối với các yêu cầu vô hại. Nếu 3.5 Flash thỉnh thoảng từ chối các prompt hợp pháp liên quan đến bảo mật hoặc y tế trong sản phẩm của bạn, hãy kiểm thử lại các luồng đó — tỷ lệ từ chối sai sẽ giảm.
Khách hàng đầu tiên nói gì
Danh sách ra mắt của Google — Figma, Harvey, Hebbia, JetBrains — đáng để giải mã:
- Figma và JetBrains là các công ty công cụ với suy luận khối lượng lớn, nhạy độ trễ: một sự chứng thực cho câu chuyện tốc độ/hiệu suất.
- Harvey (pháp lý) và Hebbia (tài chính) đặc biệt khen ngợi công việc tài liệu đa phương thức: phân tích cú pháp, phân tích biểu đồ và dữ liệu, soạn thảo báo cáo. Nếu khối lượng công việc của bạn là công việc tri thức nặng về tài liệu, mức tăng GDPval-AA v2 (1349 → 1421) là chỉ dấu phù hợp với bạn.
Cẩm nang chuyển đổi: khi nào nên đổi
| Tình huống của bạn | Khuyến nghị |
|---|---|
| Lập trình agent (agent SWE, bot review code) | Chuyển ngay — lợi ích chất lượng + hiệu suất token lớn nhất (DeepSWE +12 điểm, giảm tới 65% token) |
| Sử dụng máy tính / tự động hóa trình duyệt | Chuyển ngay — điểm số tốt hơn và công cụ tích hợp sẵn thay thế khung tự chế |
| Phân tích tài liệu / phân tích / soạn báo cáo | Chuyển ngay — được xác thực bởi các ca sử dụng của Harvey & Hebbia |
| Tác vụ đơn giản khối lượng lớn, độ trễ quan trọng | Cân nhắc 3.5 Flash-Lite thay thế — xem hướng dẫn Flash-Lite của chúng tôi |
| Prompt được tinh chỉnh kỹ với phân tích định dạng đầu ra nghiêm ngặt | Chuyển thận trọng — hiệu suất token làm thay đổi độ dài; xác thực lại parser và ví dụ few-shot |
| Hệ thống production bị đóng băng vì tuân thủ | Lên lịch — chưa có thông báo ngừng hỗ trợ bắt buộc, nhưng giá + hiệu suất khiến việc ở lại trở nên tốn kém |
Danh sách kiểm tra thực tế trước khi đổi chuỗi model:
- Chạy lại bộ đánh giá của bạn — phong cách đầu ra gọn và ngắn hơn; các kiểm định về độ dài hoặc cách diễn đạt phản hồi có thể hỏng.
- Kiểm tra lại việc phân tích đầu ra có cấu trúc — bớt dài dòng thường là tin tốt cho độ tin cậy JSON, nhưng hãy xác minh.
- Kiểm thử lại các luồng nhạy cảm với từ chối — kỳ vọng ít từ chối sai hơn, nhưng xác nhận bộ lọc an toàn của bạn vẫn khớp.
- Đo lại chi phí theo tác vụ, không theo token — mức giảm token 17–65% khiến so sánh theo token đánh giá thấp khoản tiết kiệm.
Kết luận
Gemini 3.6 Flash là bản kế nhiệm hiếm hoi không có đánh đổi nào được công bố: tốt hơn ở lập trình, nghiên cứu ML, sử dụng máy tính và công việc tri thức, trong khi sinh ít token hơn với giá thấp hơn. Trừ khi hệ thống của bạn phụ thuộc vào các định dạng đầu ra bị đóng băng, việc chuyển từ 3.5 Flash không còn là câu hỏi có nên hay không mà là sprint nào.