谷歌发布 Gemini 3.7 Flash:面向编码、智能体与知识工作的混合推理旗舰模型
Gemini 3.7 Flash 于 2026 年 8 月 13 日正式发布,搭载原生混合推理、可控思考预算、前沿编码基准测试,以及截至 12 月的 50% 首发优惠定价。
混合推理的新旗舰
2026 年 8 月 13 日,谷歌正式发布 Gemini 3.7 Flash——面向编码、智能体与复杂知识工作的旗舰混合推理模型。与早期以速度换深度的 Flash 系列不同,3.7 Flash 在 API 中内置了原生可控推理:你可以按请求调节思考深度,而无需切换到单独的「推理模型」。
此次发布同时瞄准三类用户:部署生产级智能体的开发者、执行长周期编码任务的团队,以及需要对海量文档进行可靠多模态分析的企业。谷歌将 3.7 Flash 定位为一个端点即可同时满足亚 100 毫秒聊天回复与数分钟深度研究任务的模型。
原生混合推理与思考预算
核心参数是 thinking_config.thinking_budget——一个整数,控制模型在回答前可消耗的内部推理 token 数量。
thinking_budget | 行为 | 适用场景 |
|---|---|---|
| 0 | 超低延迟快速模式(首 token 低于 85 毫秒) | 实时聊天、自动补全、高 QPS 路由 |
| 256–1024 | 轻量多步规划 | 工具路由、简单重构、RAG 综合 |
| 4096–16384 | 深度多步推理 | 智能体循环、复杂调试、研究报告 |
| 32768–65536 | 最大深度 | 长周期编码、多文件架构变更 |
在 Gemini API 中设置方式如下:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.7-flash",
contents="将这个 React 组件重构为使用 hooks 并添加错误边界。",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_budget=8192 # 0 = 快速模式;最高 65536 用于深度推理
)
),
)
print(response.text)
由于推理能力是原生集成而非外挂模块,延迟平滑缩放:thinking_budget 为 0 时表现类似经典 Flash 模型,更高数值则在不切换模型 ID 的情况下解锁链式思考质量。计费将可见输出 token 与内部思考 token 分开,你只需为请求的深度付费。
基准测试亮点
谷歌公布了与 Gemini 3.6 Flash、Claude Sonnet 5 和 GPT-5.6 Terra 的正面对比数据。3.7 Flash 在以下所有评测中均领先:
| 基准测试 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| FrontierCode 1.1 | 43.6% | 34.4% | 39.1% | 37.8% |
| DeepSWE v1.1 | 65.3% | 49.0% | 56.2% | 53.4% |
| WebDev Arena (Elo) | 1588 | 1538 | 1552 | 1544 |
| GDP.pdf | 34.0% | 22.0% | 28.5% | 26.8% |
| AutomationBench | 30.4% | 17.0% | 23.1% | 21.5% |
| GDM-MRCR v2 | 97.0% | 91.2% | 94.5% | 93.1% |
| HLE-Verified | 53.6% | 44.8% | 48.2% | 46.7% |
对开发者而言,两个数字尤为突出:
- DeepSWE v1.1 达到 65.3%——较 3.6 Flash 提升 16 个百分点,表明智能体编码是主要训练目标。
- GDM-MRCR v2 达到 97.0%——在 250 万 token 上下文窗口中实现近乎完美的长上下文检索,对文档密集型工作流至关重要。
了解上一代表现,请参阅我们的《Gemini 3.6 Flash vs 3.5 Flash 深度对比》。
定价与 50% 首发优惠
谷歌推出了激进的发布促销:
| 首发价(截至 2026 年 12 月 31 日) | 标准价(2027 年 1 月 1 日起) | |
|---|---|---|
| 输入 | $0.75 / 百万 token | $1.50 / 百万 token |
| 输出 | $3.75 / 百万 token | $7.50 / 百万 token |
| 上下文缓存 | $0.075 / 百万 token | $0.075 / 百万 token |
2026 年底前,输入与输出均享 50% 折扣。上下文缓存——适用于复用大型系统提示或文档语料的场景——无论是否在促销期内,均为每百万 token $0.075。
结合更高思考预算下更少的工具调用轮次,单个智能体任务的实际成本可远低于 token 单价。我们的 API 成本估算指南 详细演算了典型工作负载。
多模态、Web 开发与智能体能力
除基准测试外,3.7 Flash 还具备真实部署中至关重要的生产级能力:
- 250 万 token 上下文窗口——一次摄入完整代码库、合同包或研究语料。
- 245 输出 token/秒——足够快速流式输出 UI 代码与长报告,不影响用户体验。
- 99.7% JSON 工具执行精度——智能体工具链的可靠结构化输出。
- 计算机操作(Computer Use)——内置客户端自动化,支持浏览器与桌面工作流。
- UI 生成保真度——WebDev Arena 1588 Elo 意味着开箱即用的前端生成布局更精准。
上述功能现已通过 Gemini API、Google AI Studio、Gemini Enterprise 和 Google Antigravity 提供。
开发者指南与迁移建议
若从 3.6 Flash 或 3.5 Flash-Lite 升级,建议从以下模式入手:
- 替换模型 ID——将现有调用中的
gemini-3.6-flash换为gemini-3.7-flash;API 接口向后兼容。 - 按任务类型设置思考预算——面向用户的聊天用
0,RAG 问答用1024,编码智能体用8192+,仅对延迟无关的夜间批处理任务使用32768。 - 启用上下文缓存——若系统提示或文档集超过 32K token 且在请求间重复,缓存可将输入成本降低 90%。
- 优化工具 schema——99.7% 的 JSON 精度奖励严格 schema;宽松或模糊的工具定义仍会在应用层失败。
- 监控思考 token 用量——记录
usage_metadata,了解哪些智能体步骤真正需要深度推理,哪些用快速模式即可。
关于智能体工作流模式,请参阅我们的《3.5 Flash-Lite 智能体工作流指南》——思考预算概念可自然延伸至 3.7 Flash,且粒度更细。
总结
Gemini 3.7 Flash 是首款速度与深度不再互斥的 Flash 级模型。可控的 thinking_budget 让同一模型同时服务延迟敏感的聊天与深度智能体编码,首发定价则让 2026 年底前的实验成本极低。