Gemini Omni
返回文章列表
9 分钟阅读

谷歌发布 Gemini 3.7 Flash:面向编码、智能体与知识工作的混合推理旗舰模型

Gemini 3.7 Flash 于 2026 年 8 月 13 日正式发布,搭载原生混合推理、可控思考预算、前沿编码基准测试,以及截至 12 月的 50% 首发优惠定价。

Gemini 3.7 FlashHybrid ReasoningCodingBenchmarksPricingAnnouncement2026中文

混合推理的新旗舰

2026 年 8 月 13 日,谷歌正式发布 Gemini 3.7 Flash——面向编码、智能体与复杂知识工作的旗舰混合推理模型。与早期以速度换深度的 Flash 系列不同,3.7 Flash 在 API 中内置了原生可控推理:你可以按请求调节思考深度,而无需切换到单独的「推理模型」。

此次发布同时瞄准三类用户:部署生产级智能体的开发者、执行长周期编码任务的团队,以及需要对海量文档进行可靠多模态分析的企业。谷歌将 3.7 Flash 定位为一个端点即可同时满足亚 100 毫秒聊天回复与数分钟深度研究任务的模型。

原生混合推理与思考预算

核心参数是 thinking_config.thinking_budget——一个整数,控制模型在回答前可消耗的内部推理 token 数量。

thinking_budget行为适用场景
0超低延迟快速模式(首 token 低于 85 毫秒)实时聊天、自动补全、高 QPS 路由
256–1024轻量多步规划工具路由、简单重构、RAG 综合
4096–16384深度多步推理智能体循环、复杂调试、研究报告
32768–65536最大深度长周期编码、多文件架构变更

在 Gemini API 中设置方式如下:

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="将这个 React 组件重构为使用 hooks 并添加错误边界。",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(
            thinking_budget=8192  # 0 = 快速模式;最高 65536 用于深度推理
        )
    ),
)
print(response.text)

由于推理能力是原生集成而非外挂模块,延迟平滑缩放:thinking_budget 为 0 时表现类似经典 Flash 模型,更高数值则在不切换模型 ID 的情况下解锁链式思考质量。计费将可见输出 token 与内部思考 token 分开,你只需为请求的深度付费。

基准测试亮点

谷歌公布了与 Gemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra 的正面对比数据。3.7 Flash 在以下所有评测中均领先:

基准测试Gemini 3.7 FlashGemini 3.6 FlashClaude Sonnet 5GPT-5.6 Terra
FrontierCode 1.143.6%34.4%39.1%37.8%
DeepSWE v1.165.3%49.0%56.2%53.4%
WebDev Arena (Elo)1588153815521544
GDP.pdf34.0%22.0%28.5%26.8%
AutomationBench30.4%17.0%23.1%21.5%
GDM-MRCR v297.0%91.2%94.5%93.1%
HLE-Verified53.6%44.8%48.2%46.7%

对开发者而言,两个数字尤为突出:

  • DeepSWE v1.1 达到 65.3%——较 3.6 Flash 提升 16 个百分点,表明智能体编码是主要训练目标。
  • GDM-MRCR v2 达到 97.0%——在 250 万 token 上下文窗口中实现近乎完美的长上下文检索,对文档密集型工作流至关重要。

了解上一代表现,请参阅我们的《Gemini 3.6 Flash vs 3.5 Flash 深度对比》

定价与 50% 首发优惠

谷歌推出了激进的发布促销:

首发价(截至 2026 年 12 月 31 日)标准价(2027 年 1 月 1 日起)
输入$0.75 / 百万 token$1.50 / 百万 token
输出$3.75 / 百万 token$7.50 / 百万 token
上下文缓存$0.075 / 百万 token$0.075 / 百万 token

2026 年底前,输入与输出均享 50% 折扣。上下文缓存——适用于复用大型系统提示或文档语料的场景——无论是否在促销期内,均为每百万 token $0.075。

结合更高思考预算下更少的工具调用轮次,单个智能体任务的实际成本可远低于 token 单价。我们的 API 成本估算指南 详细演算了典型工作负载。

多模态、Web 开发与智能体能力

除基准测试外,3.7 Flash 还具备真实部署中至关重要的生产级能力:

  • 250 万 token 上下文窗口——一次摄入完整代码库、合同包或研究语料。
  • 245 输出 token/秒——足够快速流式输出 UI 代码与长报告,不影响用户体验。
  • 99.7% JSON 工具执行精度——智能体工具链的可靠结构化输出。
  • 计算机操作(Computer Use)——内置客户端自动化,支持浏览器与桌面工作流。
  • UI 生成保真度——WebDev Arena 1588 Elo 意味着开箱即用的前端生成布局更精准。

上述功能现已通过 Gemini APIGoogle AI StudioGemini EnterpriseGoogle Antigravity 提供。

开发者指南与迁移建议

若从 3.6 Flash 或 3.5 Flash-Lite 升级,建议从以下模式入手:

  1. 替换模型 ID——将现有调用中的 gemini-3.6-flash 换为 gemini-3.7-flash;API 接口向后兼容。
  2. 按任务类型设置思考预算——面向用户的聊天用 0,RAG 问答用 1024,编码智能体用 8192+,仅对延迟无关的夜间批处理任务使用 32768
  3. 启用上下文缓存——若系统提示或文档集超过 32K token 且在请求间重复,缓存可将输入成本降低 90%。
  4. 优化工具 schema——99.7% 的 JSON 精度奖励严格 schema;宽松或模糊的工具定义仍会在应用层失败。
  5. 监控思考 token 用量——记录 usage_metadata,了解哪些智能体步骤真正需要深度推理,哪些用快速模式即可。

关于智能体工作流模式,请参阅我们的《3.5 Flash-Lite 智能体工作流指南》——思考预算概念可自然延伸至 3.7 Flash,且粒度更细。

总结

Gemini 3.7 Flash 是首款速度与深度不再互斥的 Flash 级模型。可控的 thinking_budget 让同一模型同时服务延迟敏感的聊天与深度智能体编码,首发定价则让 2026 年底前的实验成本极低。

相关阅读