Google công bố Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber: Tất cả những gì bạn cần biết
Google vừa ra mắt Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber. Giá cả, benchmark, khả năng truy cập, an toàn và lộ trình Gemini 4 — phân tích đầy đủ.
Ba mô hình Flash mới trong một ngày
Ngày 21 tháng 7 năm 2026, Google công bố ba mô hình Gemini mới trong cùng một đợt: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber. Điểm chung không thể nhầm lẫn — cả ba đều nhắm vào vấn đề mà các nhà phát triển liên tục nêu ra: agent AI trong môi trường production cần hiệu suất token cao hơn, độ trễ thấp hơn và hiệu năng ổn định hơn, chứ không chỉ những điểm số hào nhoáng trên tiêu đề.
Bài viết này phân tích từng mô hình dùng để làm gì, giá bao nhiêu, có thể dùng ở đâu ngay hôm nay, và những gì Google hé lộ về chặng đường phía trước (bật mí: Gemini 3.5 Pro đang được thử nghiệm với đối tác, và quá trình tiền huấn luyện Gemini 4 đã bắt đầu). Mọi số liệu đều lấy từ thông báo chính thức.
Toàn cảnh dàn mô hình
| Mô hình | Vai trò | Con số nổi bật | Truy cập |
|---|---|---|---|
| Gemini 3.6 Flash | Chủ lực: lập trình, công việc tri thức, đa phương thức | Ít hơn 17% token đầu ra so với 3.5 Flash, với giá thấp hơn | Đã sẵn sàng rộng rãi hôm nay |
| Gemini 3.5 Flash-Lite | Mô hình lớp 3.5 nhanh nhất, tiết kiệm nhất | 350 token đầu ra/giây (Artificial Analysis) | Đã sẵn sàng rộng rãi hôm nay |
| Gemini 3.5 Flash Cyber | Chuyên gia bảo mật tìm & vá lỗ hổng | Cạnh tranh với các mô hình frontier trên CyberGym trong CodeMender | Chỉ thí điểm truy cập hạn chế |
Gemini 3.6 Flash: chủ lực mới
3.6 Flash được xây dựng trực tiếp từ phản hồi của nhà phát triển về 3.5 Flash. Thông điệp ra mắt khá lạ với một mô hình mới: không chỉ tốt hơn, mà còn tiết kiệm hơn. Trên Artificial Analysis Index, nó tiêu thụ ít hơn 17% token đầu ra so với 3.5 Flash, và ở một số benchmark — như DeepSWE của Datacurve — Google ghi nhận mức giảm lên tới 65%. Nó cũng cần ít bước suy luận và lượt gọi công cụ hơn để hoàn thành quy trình nhiều bước, cộng dồn thành khoản tiết kiệm thực sự trên các tác vụ agent.

Điểm nhấn benchmark so với 3.5 Flash:
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| DeepSWE (lập trình agent) | 49% | 37% |
| MLE Bench (nghiên cứu ML) | 63,9% | 49,7% |
| OSWorld-Verified (sử dụng máy tính) | 83,0% | 78,4% |
| GDPval-AA v2 (công việc tri thức) | 1421 | 1349 |
Hai chi tiết ngày ra mắt khác đáng chú ý với người xây dựng sản phẩm:
- Sử dụng máy tính giờ là công cụ phía client tích hợp sẵn qua Gemini API và Gemini Enterprise — không cần dựng khung riêng.
- Khách hàng đầu tiên gồm Figma, Harvey, Hebbia và JetBrains; Hebbia và Harvey đặc biệt nhấn mạnh các thế mạnh đa phương thức như phân tích tài liệu, phân tích biểu đồ và dữ liệu, cùng soạn thảo báo cáo.
Bản demo của Google so sánh trực tiếp hiệu suất token trên một tác vụ OSWorld rất đáng xem: demo hiệu suất token 3.6 Flash vs 3.5 Flash (video).
Để xem so sánh đối đầu đầy đủ, hãy đọc bài phân tích chuyên sâu Gemini 3.6 Flash vs 3.5 Flash của chúng tôi.
Gemini 3.5 Flash-Lite: sinh ra để mở rộng quy trình agent
Flash-Lite là quân bài số lượng lớn. Đây là mô hình nhanh nhất trong dòng 3.5 với 350 token đầu ra mỗi giây (Artificial Analysis), nhắm vào tìm kiếm agent, xử lý tài liệu và mọi pipeline mà thông lượng là nút thắt cổ chai.
Bước nhảy chất lượng so với 3.1 Flash-Lite rất ấn tượng — Terminal-Bench 2.1 đạt 54% so với 31%, GDM-MRCR v2 ngữ cảnh dài đạt 72,2% so với 60,1%, và GDPval-AA v2 đạt 1140 so với 642. Đáng chú ý là nó thậm chí vượt mô hình lớn hơn Gemini 3 Flash trên nhiều bài đánh giá agent, gồm SWE-Bench Pro (54,2% so với 49,6%) và OSWorld-Verified (74,0% so với 65,1%).
Mô hình đi kèm các mức tư duy có thể cấu hình — chạy ở mức tối thiểu/thấp cho các tác vụ khối lượng lớn nhạy độ trễ, hoặc nâng mức lên cho khối lượng công việc subagent nhiều bước — và sử dụng máy tính cũng được tích hợp sẵn ở đây. Khách hàng đầu tiên gồm Ashler, Palo Alto Networks và Ramp, và mô hình đang được triển khai dần trong Google Search và ứng dụng Gemini.
Hướng dẫn quy trình agent với 3.5 Flash-Lite của chúng tôi phân tích sâu các mức tư duy, bài toán chi phí và cách chọn mô hình.
Giá: rẻ hơn ở cả hai phân khúc
| Mô hình | Đầu vào ($/1M token) | Đầu ra ($/1M token) | Ghi chú |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | Thấp hơn 3.5 Flash, cộng thêm ~17% ít token đầu ra hơn |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Tỷ lệ giá/hiệu năng tốt nhất cho lưu lượng khối lượng lớn |
| Gemini 3.5 Flash Cyber | — | — | Không công bố giá; thí điểm truy cập hạn chế qua CodeMender |
Câu chuyện chi phí thực sự nằm ở phép nhân: 3.6 Flash tính phí mỗi token thấp hơn và sinh ra ít token hơn cho mỗi tác vụ, nên chi phí thực tế cho mỗi tác vụ agent giảm nhiều hơn những gì bảng giá thể hiện.
Gemini 3.5 Flash Cyber: chuyên gia sau tấm rèm nhung
Mô hình thứ ba thì khác. 3.5 Flash Cyber được xây trên nền 3.5 Flash và tinh chỉnh chuyên cho việc tìm và vá lỗ hổng bảo mật với chi phí mỗi token thấp hơn các mô hình lớn. Nó chạy bên trong CodeMender, agent bảo mật mã nguồn của Google, nơi nhiều agent 3.5 Flash Cyber phối hợp để tạo ra một báo cáo tổng hợp duy nhất — đạt hiệu năng cạnh tranh với các mô hình frontier trên benchmark CyberGym.

Vì công nghệ này có tính lưỡng dụng, Google chủ động không phát hành rộng rãi: nó sẽ chỉ dành riêng cho các chính phủ và đối tác tin cậy thông qua CodeMender trong khuôn khổ thí điểm truy cập hạn chế. Mục tiêu là giúp các lực lượng phòng thủ tuyến đầu có lợi thế vá các lỗ hổng nghiêm trọng trước khi chúng bị khai thác.
An toàn: ít jailbreak hơn, ít từ chối hơn
3.6 Flash đi kèm các biện pháp bảo vệ Frontier Safety nâng cao bao trùm lạm dụng CBRN (Hóa học, Sinh học, Phóng xạ, Hạt nhân) và tấn công mạng. Google cho biết mô hình kháng jailbreak tốt hơn đáng kể trong khi đồng thời được huấn luyện để giảm thiểu từ chối với các yêu cầu vô hại — đúng tổ hợp mà nhà phát triển thực sự mong muốn, thay vì thái độ từ chối tất cả một cách máy móc.
Có thể dùng ở đâu ngay hôm nay
| Nền tảng | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Gemini API (Google AI Studio, Android Studio) | ✅ | ✅ |
| Google Antigravity | ✅ | — |
| Gemini Enterprise Agent Platform | ✅ | ✅ |
| Ứng dụng Gemini Enterprise | ✅ | — |
| Ứng dụng Gemini | ✅ | ✅ |
| Google Search | — | ✅ Đang triển khai dần |
| CodeMender (3.5 Flash Cyber) | Thí điểm hạn chế: chỉ chính phủ & đối tác tin cậy |
Gợi mở lộ trình: 3.5 Pro và Gemini 4
Hai ghi chú hướng tới tương lai ẩn trong thông báo rất đáng chú ý:
- Gemini 3.5 Pro hiện đang được thử nghiệm với các đối tác, và sẽ ra mắt rộng rãi “ngay khi sẵn sàng”.
- Google đã khởi động đợt tiền huấn luyện tham vọng nhất từ trước đến nay — cho Gemini 4 — và cho biết “rất hào hứng với tiến độ”.
Đọc chung với nhau, các bản phát hành lớp Flash này giống như tầng hiệu suất đang được củng cố trước cú đẩy frontier tiếp theo.
Tóm lại
Nếu bạn xây dựng agent, đây là đợt ra mắt hiếm hoi mà nước đi đúng đắn quá rõ ràng: 3.6 Flash cho công việc agent đòi hỏi chất lượng, 3.5 Flash-Lite cho thông lượng khối lượng lớn — cả hai đều rẻ hơn những gì chúng thay thế. Còn Flash Cyber báo hiệu hướng đi mà Google tin các bản tinh chỉnh chuyên biệt sẽ tiến tới: mạnh mẽ, hẹp và được kiểm soát có chủ đích.