Gemini Omni
Quay lại tất cả bài
8 phút đọc

Google công bố Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber: Tất cả những gì bạn cần biết

Google vừa ra mắt Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber. Giá cả, benchmark, khả năng truy cập, an toàn và lộ trình Gemini 4 — phân tích đầy đủ.

Gemini 3.6 FlashGemini 3.5 Flash-LiteGemini 3.5 Flash CyberModelsAnnouncement2026Tiếng Việt

Ba mô hình Flash mới trong một ngày

Ngày 21 tháng 7 năm 2026, Google công bố ba mô hình Gemini mới trong cùng một đợt: Gemini 3.6 Flash, Gemini 3.5 Flash-LiteGemini 3.5 Flash Cyber. Điểm chung không thể nhầm lẫn — cả ba đều nhắm vào vấn đề mà các nhà phát triển liên tục nêu ra: agent AI trong môi trường production cần hiệu suất token cao hơn, độ trễ thấp hơn và hiệu năng ổn định hơn, chứ không chỉ những điểm số hào nhoáng trên tiêu đề.

Bài viết này phân tích từng mô hình dùng để làm gì, giá bao nhiêu, có thể dùng ở đâu ngay hôm nay, và những gì Google hé lộ về chặng đường phía trước (bật mí: Gemini 3.5 Pro đang được thử nghiệm với đối tác, và quá trình tiền huấn luyện Gemini 4 đã bắt đầu). Mọi số liệu đều lấy từ thông báo chính thức.

Toàn cảnh dàn mô hình

Mô hìnhVai tròCon số nổi bậtTruy cập
Gemini 3.6 FlashChủ lực: lập trình, công việc tri thức, đa phương thứcÍt hơn 17% token đầu ra so với 3.5 Flash, với giá thấp hơnĐã sẵn sàng rộng rãi hôm nay
Gemini 3.5 Flash-LiteMô hình lớp 3.5 nhanh nhất, tiết kiệm nhất350 token đầu ra/giây (Artificial Analysis)Đã sẵn sàng rộng rãi hôm nay
Gemini 3.5 Flash CyberChuyên gia bảo mật tìm & vá lỗ hổngCạnh tranh với các mô hình frontier trên CyberGym trong CodeMenderChỉ thí điểm truy cập hạn chế

Gemini 3.6 Flash: chủ lực mới

3.6 Flash được xây dựng trực tiếp từ phản hồi của nhà phát triển về 3.5 Flash. Thông điệp ra mắt khá lạ với một mô hình mới: không chỉ tốt hơn, mà còn tiết kiệm hơn. Trên Artificial Analysis Index, nó tiêu thụ ít hơn 17% token đầu ra so với 3.5 Flash, và ở một số benchmark — như DeepSWE của Datacurve — Google ghi nhận mức giảm lên tới 65%. Nó cũng cần ít bước suy luận và lượt gọi công cụ hơn để hoàn thành quy trình nhiều bước, cộng dồn thành khoản tiết kiệm thực sự trên các tác vụ agent.

Mức cải thiện benchmark của Gemini 3.6 Flash so với 3.5 Flash trên DeepSWE, MLE Bench, OSWorld-Verified và GDPval-AA v2

Điểm nhấn benchmark so với 3.5 Flash:

BenchmarkGemini 3.6 FlashGemini 3.5 Flash
DeepSWE (lập trình agent)49%37%
MLE Bench (nghiên cứu ML)63,9%49,7%
OSWorld-Verified (sử dụng máy tính)83,0%78,4%
GDPval-AA v2 (công việc tri thức)14211349

Hai chi tiết ngày ra mắt khác đáng chú ý với người xây dựng sản phẩm:

  • Sử dụng máy tính giờ là công cụ phía client tích hợp sẵn qua Gemini API và Gemini Enterprise — không cần dựng khung riêng.
  • Khách hàng đầu tiên gồm Figma, Harvey, Hebbia và JetBrains; Hebbia và Harvey đặc biệt nhấn mạnh các thế mạnh đa phương thức như phân tích tài liệu, phân tích biểu đồ và dữ liệu, cùng soạn thảo báo cáo.

Bản demo của Google so sánh trực tiếp hiệu suất token trên một tác vụ OSWorld rất đáng xem: demo hiệu suất token 3.6 Flash vs 3.5 Flash (video).

Để xem so sánh đối đầu đầy đủ, hãy đọc bài phân tích chuyên sâu Gemini 3.6 Flash vs 3.5 Flash của chúng tôi.

Gemini 3.5 Flash-Lite: sinh ra để mở rộng quy trình agent

Flash-Lite là quân bài số lượng lớn. Đây là mô hình nhanh nhất trong dòng 3.5 với 350 token đầu ra mỗi giây (Artificial Analysis), nhắm vào tìm kiếm agent, xử lý tài liệu và mọi pipeline mà thông lượng là nút thắt cổ chai.

Bước nhảy chất lượng so với 3.1 Flash-Lite rất ấn tượng — Terminal-Bench 2.1 đạt 54% so với 31%, GDM-MRCR v2 ngữ cảnh dài đạt 72,2% so với 60,1%, và GDPval-AA v2 đạt 1140 so với 642. Đáng chú ý là nó thậm chí vượt mô hình lớn hơn Gemini 3 Flash trên nhiều bài đánh giá agent, gồm SWE-Bench Pro (54,2% so với 49,6%) và OSWorld-Verified (74,0% so với 65,1%).

Mô hình đi kèm các mức tư duy có thể cấu hình — chạy ở mức tối thiểu/thấp cho các tác vụ khối lượng lớn nhạy độ trễ, hoặc nâng mức lên cho khối lượng công việc subagent nhiều bước — và sử dụng máy tính cũng được tích hợp sẵn ở đây. Khách hàng đầu tiên gồm Ashler, Palo Alto Networks và Ramp, và mô hình đang được triển khai dần trong Google Search và ứng dụng Gemini.

Hướng dẫn quy trình agent với 3.5 Flash-Lite của chúng tôi phân tích sâu các mức tư duy, bài toán chi phí và cách chọn mô hình.

Giá: rẻ hơn ở cả hai phân khúc

Mô hìnhĐầu vào ($/1M token)Đầu ra ($/1M token)Ghi chú
Gemini 3.6 Flash$1.50$7.50Thấp hơn 3.5 Flash, cộng thêm ~17% ít token đầu ra hơn
Gemini 3.5 Flash-Lite$0.30$2.50Tỷ lệ giá/hiệu năng tốt nhất cho lưu lượng khối lượng lớn
Gemini 3.5 Flash CyberKhông công bố giá; thí điểm truy cập hạn chế qua CodeMender

Câu chuyện chi phí thực sự nằm ở phép nhân: 3.6 Flash tính phí mỗi token thấp hơn sinh ra ít token hơn cho mỗi tác vụ, nên chi phí thực tế cho mỗi tác vụ agent giảm nhiều hơn những gì bảng giá thể hiện.

Gemini 3.5 Flash Cyber: chuyên gia sau tấm rèm nhung

Mô hình thứ ba thì khác. 3.5 Flash Cyber được xây trên nền 3.5 Flash và tinh chỉnh chuyên cho việc tìm và vá lỗ hổng bảo mật với chi phí mỗi token thấp hơn các mô hình lớn. Nó chạy bên trong CodeMender, agent bảo mật mã nguồn của Google, nơi nhiều agent 3.5 Flash Cyber phối hợp để tạo ra một báo cáo tổng hợp duy nhất — đạt hiệu năng cạnh tranh với các mô hình frontier trên benchmark CyberGym.

Kết quả benchmark CyberGym của Gemini 3.5 Flash Cyber bên trong CodeMender

Vì công nghệ này có tính lưỡng dụng, Google chủ động không phát hành rộng rãi: nó sẽ chỉ dành riêng cho các chính phủ và đối tác tin cậy thông qua CodeMender trong khuôn khổ thí điểm truy cập hạn chế. Mục tiêu là giúp các lực lượng phòng thủ tuyến đầu có lợi thế vá các lỗ hổng nghiêm trọng trước khi chúng bị khai thác.

An toàn: ít jailbreak hơn, ít từ chối hơn

3.6 Flash đi kèm các biện pháp bảo vệ Frontier Safety nâng cao bao trùm lạm dụng CBRN (Hóa học, Sinh học, Phóng xạ, Hạt nhân) và tấn công mạng. Google cho biết mô hình kháng jailbreak tốt hơn đáng kể trong khi đồng thời được huấn luyện để giảm thiểu từ chối với các yêu cầu vô hại — đúng tổ hợp mà nhà phát triển thực sự mong muốn, thay vì thái độ từ chối tất cả một cách máy móc.

Có thể dùng ở đâu ngay hôm nay

Nền tảngGemini 3.6 FlashGemini 3.5 Flash-Lite
Gemini API (Google AI Studio, Android Studio)
Google Antigravity
Gemini Enterprise Agent Platform
Ứng dụng Gemini Enterprise
Ứng dụng Gemini
Google Search✅ Đang triển khai dần
CodeMender (3.5 Flash Cyber)Thí điểm hạn chế: chỉ chính phủ & đối tác tin cậy

Gợi mở lộ trình: 3.5 Pro và Gemini 4

Hai ghi chú hướng tới tương lai ẩn trong thông báo rất đáng chú ý:

  1. Gemini 3.5 Pro hiện đang được thử nghiệm với các đối tác, và sẽ ra mắt rộng rãi “ngay khi sẵn sàng”.
  2. Google đã khởi động đợt tiền huấn luyện tham vọng nhất từ trước đến nay — cho Gemini 4 — và cho biết “rất hào hứng với tiến độ”.

Đọc chung với nhau, các bản phát hành lớp Flash này giống như tầng hiệu suất đang được củng cố trước cú đẩy frontier tiếp theo.

Tóm lại

Nếu bạn xây dựng agent, đây là đợt ra mắt hiếm hoi mà nước đi đúng đắn quá rõ ràng: 3.6 Flash cho công việc agent đòi hỏi chất lượng, 3.5 Flash-Lite cho thông lượng khối lượng lớn — cả hai đều rẻ hơn những gì chúng thay thế. Còn Flash Cyber báo hiệu hướng đi mà Google tin các bản tinh chỉnh chuyên biệt sẽ tiến tới: mạnh mẽ, hẹp và được kiểm soát có chủ đích.

Bài liên quan