Gemini 3.5 Flash-Lite 指南:以每秒 350 token 规模化智能体工作流(2026)
Gemini 3.5 Flash-Lite 速度 350 token/秒,输入仅 $0.30/百万。对比 3.1 Flash-Lite 与 Gemini 3 Flash 的基准、思考等级配置、成本测算与选型决策表。
“走量档”这次玩真的了
Gemini 3.5 Flash-Lite 于 2026 年 7 月 21 日发布,是谷歌 3.5 系列中最快、最具性价比的模型:每秒 350 输出 token(Artificial Analysis),定价输入 $0.30/百万 token、输出 $2.50/百万 token。以往的”Lite”档位向来是质量的坟场——做做分类和模板填充还行,碰智能体任务就露怯。这次不一样:在多项智能体与编码评测中,3.5 Flash-Lite 直接打赢了更大的 Gemini 3 Flash。
本指南覆盖 Flash-Lite 在产品线中的位置、思考等级怎么配、规模化跑起来到底花多少钱,以及哪种负载该选哪个模型。发布背景见我们的发布综述。
代际飞跃:对比 3.1 Flash-Lite
相较上一代 Lite 的提升是这条产品线历史上最大的一次:
| 基准测试 | 衡量什么 | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| Terminal-Bench 2.1 | 编码与智能体终端任务 | 54% | 31% |
| GDM-MRCR v2 | 长上下文检索 | 72.2% | 60.1% |
| GDPval-AA v2 | 真实世界任务执行 | 1140 | 642 |

GDPval-AA v2 接近翻倍(642 → 1140)是最该记住的数字:真实世界任务执行恰恰是老一代 Lite 模型在生产智能体中崩掉的地方。
爆冷:赢了 Gemini 3 Flash
比代际提升更意外的是跨档位的胜利。在多项智能体与编码评测中,3.5 Flash-Lite 超越了更大、更贵的 Gemini 3 Flash:
| 基准测试 | Gemini 3.5 Flash-Lite | Gemini 3 Flash |
|---|---|---|
| SWE-Bench Pro | 54.2% | 49.6% |
| OSWorld-Verified | 74.0% | 65.1% |
如果你今天还因为”Lite 档做不了智能体”而把负载压在 2.5 Flash 或 3 Flash 上,这个假设已经过时——在这些任务上 Flash-Lite 既更快又更强。
思考等级:一个模型,两种工作模式
Flash-Lite 带有可配置的思考等级(thinking levels),实际上等于两个产品:
- Minimal / low 思考——为高并发任务优先延迟和成本:智能体搜索、文档处理、信息抽取、分类、路由。350 token/秒说的就是这个模式。
- 更高思考等级——为多步子智能体负载启用更深的推理,让 Flash-Lite 在编排模型之下充当工作单元。
第二种模式正对应谷歌自己的演示套路:3.6 Flash 当主智能体,成群的 3.5 Flash-Lite 子智能体并行干活(其中一个演示同时生成 25 个网页设计方案)。计算机操作在 Flash-Lite 上同样是内置工具,子智能体操作界面无需额外脚手架。高并发任务上的延迟差距,可看谷歌的 Flash-Lite 对比 3.5 Flash 速度演示(视频)。
成本测算:规模化到底花多少钱
价格:输入 $0.30/百万,输出 $2.50/百万。举一个示例负载——文档处理智能体每月处理 100 万份文档,平均每份输入 3K token、输出 500 token:
| 成本项 | 计算 | 月成本 |
|---|---|---|
| 输入 token | 100 万份 × 3K = 30 亿 token × $0.30/百万 | $900 |
| 输出 token | 100 万份 × 500 = 5 亿 token × $2.50/百万 | $1,250 |
| 3.5 Flash-Lite 合计 | $2,150 | |
| 同一负载放 3.6 Flash($1.50 / $7.50) | $4,500 + $3,750 | $8,250 |
对 Lite 能胜任的负载而言,差距约为 4 倍——而且在 350 token/秒的速度下,每份文档 500 token 的摘要不到 1.5 秒就流式输出完毕。由此得出的策略:把 90% 的常规流量路由给 Flash-Lite,难啃的 10% 升级到 3.6 Flash。
选型决策表:哪种负载配哪个模型
| 负载 | 选择 | 理由 |
|---|---|---|
| 高 QPS 智能体搜索 / RAG | 3.5 Flash-Lite(minimal 思考) | 350 token/秒,单次查询成本最低 |
| 批量文档处理 / 信息抽取 | 3.5 Flash-Lite | 比 3.6 Flash 便宜 4 倍;GDM-MRCR v2 长上下文 72.2% |
| 分类、路由、内容审核 | 3.5 Flash-Lite(minimal 思考) | 延迟敏感,质量绰绰有余 |
| 编排器下的并行子智能体舰队 | 3.5 Flash-Lite(更高思考) | 专为此设计的模式;计算机操作内置 |
| 复杂智能体编码(SWE 智能体) | 3.6 Flash | DeepSWE 49%;精度更高、坏改动更少 |
| 机器学习研究工作流 | 3.6 Flash | MLE Bench 63.9%,对比 3.5 Flash 的 49.7% |
| 高难度计算机操作智能体 | 3.6 Flash | OSWorld-Verified 83.0%(Lite 为 74.0%) |
| 多模态文档分析与报告起草 | 3.6 Flash | Harvey / Hebbia 发布日实证 |
| 仍在 3.5 Flash 上的存量流水线 | 向上或向下迁移 | 要质量选 3.6 Flash,要吞吐选 Flash-Lite——见迁移指南 |
| 安全漏洞检测与修补 | 3.5 Flash Cyber | 仅通过 CodeMender 试点(政府与可信合作伙伴) |
经验法则:默认用 Flash-Lite,失败再升级,而不是默认用大模型、事后再优化。失败模式是看得见的(输出变差);过度配置的浪费却是无声的。
哪里可以用
3.5 Flash-Lite 今天已上线 Gemini API(Google AI Studio、Android Studio)、Gemini Enterprise 智能体平台和 Gemini App——并正在逐步接入 Google 搜索,这本身就说明谷歌对它在行星级规模下成本曲线的信心。首批客户包括 Ashler、Palo Alto Networks 和 Ramp。
补充:3.5 Flash Cyber 与 CodeMender
同场发布的还有 Gemini 3.5 Flash Cyber——基于 3.5 Flash、专为发现和修复安全漏洞微调的模型。在 CodeMender 内部,多个 Flash Cyber 智能体并行工作并把发现合并成一份报告,在 CyberGym 上达到前沿竞争水平。注意这个架构:正是本指南描述的”高效专才舰队”模式在安全领域的应用。
访问权限刻意收窄:仅面向政府与可信合作伙伴的受控试点,通过 CodeMender 提供,以对冲自动化漏洞挖掘的双重用途风险。详见发布综述。
结论
3.5 Flash-Lite 重新划定了智能体负载的性价比边界:3.5 系列里最快,比 3.6 Flash 便宜约 4 倍,并且——Lite 档位史上第一次——在智能体基准上真正值得信赖。把路由架构设计成 Flash-Lite 兜底、3.6 Flash 兜难,你的成本曲线会感谢你。