谷歌发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber:一文看懂三款新模型
谷歌一次性发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型。价格、基准测试、可用渠道、安全能力与 Gemini 4 路线图,全面解读。
一天之内,三款 Flash 新模型
2026 年 7 月 21 日,谷歌一次性官宣了三款 Gemini 新模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。三者的主线高度一致——直击开发者反复提出的痛点:生产环境的 AI 智能体需要的是更高的 token 效率、更低的延迟、更稳定可靠的表现,而不只是更漂亮的榜单分数。
本文拆解每款模型的定位、定价、当前可用渠道,以及谷歌顺带透露的路线图(剧透:Gemini 3.5 Pro 正在与合作伙伴测试,Gemini 4 的预训练已经启动)。所有数据均来自官方公告。
三款模型速览
| 模型 | 定位 | 核心数据 | 获取方式 |
|---|---|---|---|
| Gemini 3.6 Flash | 主力干活模型:编码、知识工作、多模态 | 输出 token 比 3.5 Flash 少 17%,价格反而更低 | 今日起正式可用 |
| Gemini 3.5 Flash-Lite | 3.5 系列中最快、最具性价比 | 350 输出 token/秒(Artificial Analysis) | 今日起正式可用 |
| Gemini 3.5 Flash Cyber | 安全专家模型:发现并修复漏洞 | 在 CodeMender 中于 CyberGym 达到前沿水平 | 仅限受控试点 |
Gemini 3.6 Flash:新一代主力模型
3.6 Flash 直接建立在 3.5 Flash 的开发者反馈之上。这次的卖点很特别:不只是更强,还更省。在 Artificial Analysis Index 上,它比 3.5 Flash 少消耗 17% 的输出 token;在 Datacurve 的 DeepSWE 等基准上,谷歌观察到的降幅最高可达 65%。完成多步工作流所需的推理步骤和工具调用也更少,这些在智能体任务上会叠加成实打实的成本节省。

对比 3.5 Flash 的基准亮点:
| 基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| DeepSWE(智能体编码) | 49% | 37% |
| MLE Bench(机器学习研究) | 63.9% | 49.7% |
| OSWorld-Verified(计算机操作) | 83.0% | 78.4% |
| GDPval-AA v2(知识工作) | 1421 | 1349 |
还有两个对开发者重要的发布日细节:
- 计算机操作(Computer Use)现已成为内置的客户端工具,通过 Gemini API 和 Gemini Enterprise 直接调用,无需自建脚手架。
- 首批客户包括 Figma、Harvey、Hebbia 和 JetBrains;其中 Hebbia 与 Harvey 特别称赞了文档解析、图表与数据分析、报告起草等多模态能力。
谷歌放出了一段 OSWorld 任务上的 token 效率对比演示,值得一看:3.6 Flash 对比 3.5 Flash token 效率演示(视频)。
完整的正面对决,见我们的《Gemini 3.6 Flash vs 3.5 Flash 深度对比》。
Gemini 3.5 Flash-Lite:为规模化智能体工作流而生
Flash-Lite 是走量路线。它是 3.5 系列中最快的模型,达到 每秒 350 输出 token(Artificial Analysis),主打智能体搜索、文档处理等一切以吞吐量为瓶颈的流水线。
相较 3.1 Flash-Lite 的质量提升非常夸张——Terminal-Bench 2.1 达到 54%(对比 31%)、GDM-MRCR v2 长上下文 72.2%(对比 60.1%)、GDPval-AA v2 1140(对比 642)。更令人意外的是,它在多项智能体评测中甚至打赢了更大的 Gemini 3 Flash:SWE-Bench Pro 54.2% 对 49.6%,OSWorld-Verified 74.0% 对 65.1%。
它带有可配置的思考等级(thinking levels)——高并发任务用 minimal/low 追求延迟,多步子智能体负载则调高等级——计算机操作同样是内置工具。首批客户包括 Ashler、Palo Alto Networks 和 Ramp,模型也正逐步接入 Google 搜索和 Gemini App。
我们的《3.5 Flash-Lite 智能体工作流指南》详细覆盖了思考等级、成本测算与选型建议。
定价:两档同时降价
| 模型 | 输入($/百万 token) | 输出($/百万 token) | 备注 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 低于 3.5 Flash,且输出 token 还少约 17% |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 高吞吐生产流量的最优性价比 |
| Gemini 3.5 Flash Cyber | — | — | 无公开定价;仅通过 CodeMender 受控试点 |
真正的成本故事在于乘法效应:3.6 Flash 的单价更低,同时每个任务产出的 token 也更少,因此单个智能体任务的实际成本降幅比价目表看起来更大。
Gemini 3.5 Flash Cyber:藏在门禁后的专才
第三款模型走的是另一条路。3.5 Flash Cyber 基于 3.5 Flash 构建,专门微调用于发现并修复安全漏洞,单 token 成本低于更大的模型。它运行在谷歌的代码安全智能体 CodeMender 内部——多个 3.5 Flash Cyber 智能体协同工作,产出一份合并报告——在 CyberGym 基准上达到前沿竞争水平。

由于该技术具有双重用途属性,谷歌刻意不做大范围开放:模型将仅面向政府机构与可信合作伙伴,通过 CodeMender 以受控试点形式提供。目标是让一线防御者抢在漏洞被利用之前完成发现与修补。
安全:更难越狱,也更少误拒
3.6 Flash 附带增强的 Frontier Safety 防护,覆盖 CBRN(化学、生物、放射性、核)与网络攻击滥用两大领域。谷歌表示模型对越狱的抵抗力显著增强,同时又经过训练以尽量减少对正当用途的误拒——这才是开发者真正想要的组合,而不是一刀切的拒绝策略。
今天就能在哪里用
| 渠道 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Gemini API(Google AI Studio、Android Studio) | ✅ | ✅ |
| Google Antigravity | ✅ | — |
| Gemini Enterprise 智能体平台 | ✅ | ✅ |
| Gemini Enterprise 应用 | ✅ | — |
| Gemini App | ✅ | ✅ |
| Google 搜索 | — | ✅ 逐步上线 |
| CodeMender(3.5 Flash Cyber) | 受控试点:仅限政府与可信合作伙伴 |
路线图彩蛋:3.5 Pro 与 Gemini 4
公告里埋着两条值得留意的前瞻信息:
- Gemini 3.5 Pro 正在与合作伙伴测试,“准备就绪后尽快”全面开放。
- 谷歌已启动迄今最具野心的预训练——Gemini 4,并称”对进展感到兴奋”。
两条放在一起看:Flash 层级的效率地基先打牢,下一轮前沿冲刺随后就到。
结论
如果你在做智能体,这次发布的选型结论罕见地清晰:质量敏感的智能体任务选 3.6 Flash,高并发走量选 3.5 Flash-Lite,两者都比前代更便宜。Flash Cyber 则预示着谷歌眼中专业微调模型的走向——强大、垂直、且刻意设限。