Hướng dẫn Gemini 3.5 Flash-Lite: Mở rộng quy trình agent ở tốc độ 350 token/giây (2026)
Gemini 3.5 Flash-Lite chạy 350 token/giây với giá đầu vào $0.30/1M. Benchmark so với 3.1 Flash-Lite và Gemini 3 Flash, mức tư duy, bài toán chi phí và bảng chọn mô hình.
Phân khúc số lượng lớn giờ đã nghiêm túc
Gemini 3.5 Flash-Lite, công bố ngày 21 tháng 7 năm 2026, là mô hình lớp 3.5 nhanh nhất và tiết kiệm nhất của Google: 350 token đầu ra mỗi giây (Artificial Analysis), với giá $0.30 mỗi 1M token đầu vào và $2.50 mỗi 1M token đầu ra. Trước đây, phân khúc “Lite” là nơi chất lượng bị hy sinh — tốt cho phân loại và việc lặp mẫu, nhưng rủi ro với bất cứ thứ gì mang tính agent. Bản phát hành này phá vỡ khuôn mẫu đó: trên nhiều bài đánh giá agent và lập trình, 3.5 Flash-Lite thắng thẳng mô hình lớn hơn Gemini 3 Flash.
Hướng dẫn này bao quát vị trí của Flash-Lite trong dàn mô hình, cách cấu hình các mức tư duy, chi phí thực tế ở quy mô lớn, và nên chọn mô hình nào cho khối lượng công việc nào. Bối cảnh ra mắt nằm trong bài tổng quan thông báo của chúng tôi.
Bước nhảy thế hệ: so với 3.1 Flash-Lite
Cú nhảy từ thế hệ Lite trước đó là lớn nhất trong lịch sử dòng mô hình này:
| Benchmark | Đo lường gì | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | Tác vụ terminal lập trình & agent | 54% | 31% |
| GDM-MRCR v2 | Truy xuất ngữ cảnh dài | 72,2% | 60,1% |
| GDPval-AA v2 | Thực thi tác vụ thực tế | 1140 | 642 |

Con số GDPval-AA v2 gần như tăng gấp đôi (642 → 1140) là điều cần khắc cốt ghi tâm: thực thi tác vụ thực tế chính là nơi các mô hình Lite cũ sụp đổ trong các agent production.
Cú lật đổ: đánh bại Gemini 3 Flash
Bất ngờ hơn cả mức tăng thế hệ là chiến thắng vượt phân khúc. Trên nhiều bài đánh giá agent và lập trình, 3.5 Flash-Lite vượt trội Gemini 3 Flash — một mô hình lớn hơn, đắt hơn:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54,2% | 49,6% |
| OSWorld-Verified | 74,0% | 65,1% |
Nếu hôm nay bạn đang chạy khối lượng công việc trên 2.5 Flash hoặc 3 Flash chỉ vì phân khúc Lite không đáng tin với công việc agent, giả định đó giờ đã lỗi thời — Flash-Lite vừa nhanh hơn vừa giỏi hơn ở những tác vụ này.
Các mức tư duy: một mô hình, hai chế độ vận hành
Flash-Lite đi kèm các mức tư duy có thể cấu hình, thực chất biến nó thành hai sản phẩm:
- Tư duy tối thiểu / thấp — ưu tiên độ trễ và chi phí cho tác vụ khối lượng lớn: tìm kiếm agent, xử lý tài liệu, trích xuất, phân loại, định tuyến. Đây là chế độ 350 token/giây.
- Mức tư duy cao hơn — kích hoạt suy luận sâu hơn cho khối lượng công việc subagent nhiều bước, nơi Flash-Lite đóng vai công nhân dưới quyền một mô hình điều phối.
Chế độ thứ hai đúng với mẫu demo của chính Google: 3.6 Flash làm agent chủ, các đội subagent 3.5 Flash-Lite làm việc song song (một demo tạo cùng lúc 25 concept thiết kế web). Sử dụng máy tính cũng là công cụ tích hợp sẵn trên Flash-Lite, nên các subagent có thể thao tác giao diện mà không cần khung bổ sung. Xem demo tốc độ Flash-Lite vs 3.5 Flash của Google (video) để thấy khác biệt độ trễ trên các tác vụ khối lượng lớn.
Phân tích chi phí: quy mô lớn thực sự tốn bao nhiêu
Giá: $0.30/1M đầu vào, $2.50/1M đầu ra. Ví dụ một khối lượng công việc — agent xử lý tài liệu đảm nhận 1 triệu tài liệu mỗi tháng, trung bình 3 nghìn token đầu vào và 500 token đầu ra mỗi tài liệu:
| Cấu phần chi phí | Cách tính | Chi phí hằng tháng |
|---|---|---|
| Token đầu vào | 1M tài liệu × 3K token = 3B token × $0.30/1M | $900 |
| Token đầu ra | 1M tài liệu × 500 token = 0.5B token × $2.50/1M | $1,250 |
| Tổng trên 3.5 Flash-Lite | $2,150 | |
| Cùng khối lượng trên 3.6 Flash ($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
Chênh lệch chi phí khoảng 4 lần cho một khối lượng công việc mà Lite xử lý tốt — và ở tốc độ 350 token/giây, bản tóm tắt 500 token của mỗi tài liệu tuôn ra trong chưa đầy 1,5 giây. Chiến lược rút ra: định tuyến 90% khối lượng thường quy về Flash-Lite, leo thang 10% khó lên 3.6 Flash.
Bảng quyết định: mô hình nào cho khối lượng công việc nào
| Khối lượng công việc | Chọn | Vì sao |
|---|---|---|
| Tìm kiếm agent / RAG với QPS cao | 3.5 Flash-Lite (tư duy tối thiểu) | 350 token/giây, chi phí mỗi truy vấn thấp nhất |
| Xử lý / trích xuất tài liệu hàng loạt | 3.5 Flash-Lite | Rẻ hơn 3.6 Flash 4 lần; GDM-MRCR v2 72,2% ngữ cảnh dài |
| Phân loại, định tuyến, kiểm duyệt | 3.5 Flash-Lite (tư duy tối thiểu) | Độ trễ quan trọng, dư dả biên chất lượng |
| Đội subagent song song dưới mô hình điều phối | 3.5 Flash-Lite (tư duy cao hơn) | Chế độ được thiết kế riêng; sử dụng máy tính tích hợp sẵn |
| Lập trình agent phức tạp (agent SWE) | 3.6 Flash | DeepSWE 49%; độ chính xác cao hơn, ít chỉnh sửa lỗi hơn |
| Quy trình nghiên cứu ML | 3.6 Flash | MLE Bench 63,9% so với 49,7% của 3.5 Flash |
| Agent sử dụng máy tính cho tác vụ khó | 3.6 Flash | OSWorld-Verified 83,0% (so với 74,0% của Lite) |
| Phân tích tài liệu đa phương thức & soạn báo cáo | 3.6 Flash | Được Harvey / Hebbia xác thực ngay lúc ra mắt |
| Pipeline cũ vẫn chạy 3.5 Flash | Chuyển lên hoặc xuống | 3.6 Flash cho chất lượng, Flash-Lite cho số lượng — xem hướng dẫn chuyển đổi |
| Phát hiện & vá lỗ hổng bảo mật | 3.5 Flash Cyber | Chỉ qua thí điểm CodeMender (chính phủ & đối tác tin cậy) |
Quy tắc kinh nghiệm: mặc định dùng Flash-Lite và leo thang khi thất bại, thay vì mặc định dùng mô hình lớn rồi tối ưu sau. Chế độ thất bại thì nhìn thấy được (đầu ra kém); sự lãng phí do cấp phát dư thừa thì âm thầm.
Có mặt ở đâu
3.5 Flash-Lite đã hoạt động hôm nay trong Gemini API (Google AI Studio, Android Studio), Gemini Enterprise Agent Platform và ứng dụng Gemini — và đang được triển khai dần trong Google Search, điều nói lên rất nhiều về sự tự tin của Google vào cấu trúc chi phí của nó ở quy mô toàn cầu. Khách hàng đầu tiên gồm Ashler, Palo Alto Networks và Ramp.
Ghi chú bên lề: 3.5 Flash Cyber và CodeMender
Cùng đợt ra mắt còn giới thiệu Gemini 3.5 Flash Cyber — bản 3.5 Flash được tinh chỉnh chuyên tìm và vá lỗ hổng bảo mật. Bên trong CodeMender, nhiều agent Flash Cyber làm việc song song và hợp nhất phát hiện của mình thành một báo cáo tổng hợp duy nhất, đạt hiệu năng cạnh tranh với các mô hình frontier trên CyberGym. Hãy để ý kiến trúc: đó chính là mẫu hình “đội quân chuyên gia hiệu quả” mà hướng dẫn này mô tả, áp dụng cho bảo mật.
Quyền truy cập được thu hẹp có chủ đích: một chương trình thí điểm truy cập hạn chế dành riêng cho các chính phủ và đối tác tin cậy qua CodeMender, phản ánh rủi ro lưỡng dụng của việc tự động phát hiện lỗ hổng. Chi tiết trong bài tổng quan thông báo của chúng tôi.
Tóm lại
3.5 Flash-Lite vẽ lại ranh giới giá-hiệu năng cho khối lượng công việc agent: nhanh hơn mọi thứ trong dòng 3.5, rẻ hơn 3.6 Flash khoảng 4 lần, và — lần đầu tiên ở một mô hình Lite — thực sự đáng tin trên các benchmark agent. Hãy xây dựng hệ thống định tuyến sao cho Flash-Lite là mặc định và 3.6 Flash là đường leo thang, và đường cong chi phí của bạn sẽ cảm ơn bạn.