Gemini Omni
返回文章列表
6 分钟阅读

Gemini Omni 2026年8月最新动态:API 私测开启、Omni Pro 预览与功能更新

Google I/O 发布三个月后:Gemini Omni Flash API 在 Google AI Studio 与 Vertex AI 开启私测,Omni Pro 预览最长 30 秒视频,Google Flow 新增时间轴控制,2026 下半年定价与额度全面厘清。

Gemini OmniGemini Omni FlashGemini Omni ProAPIGoogle Flow2026中文

Google I/O 发布三个月后

Gemini Omni 于 2026 年 5 月 19 日 在 Google I/O 上正式发布。三个月过去,局面有了实质性变化:开发者 API 不再只是口头承诺,Gemini Omni Pro 有了具体预览,Google Flow 也补齐了自发布以来用户最期待的专业创作控件。

本文是 2026 年 8 月的状态盘点——API 接入、Pro 档位预览、Flow 与 Gemini App 升级,以及面向下半年的更新定价模型。

开发者 API 状态:私测已开启

今夏最大的工程新闻:谷歌通过 Google AI StudioVertex AI 开放了 Gemini Omni Flash API 的私测(Private Beta)。这还不是公开 GA——目前仅限加入等候名单的企业合作伙伴与获批开发者

私测合作伙伴能获得什么

  • 端点generateVideoeditVideogenerateWithAvatar——与 Gemini App 和 Flow 中消费者已有的能力一致。
  • 速率限制:私测档位起步为每个项目 10 个并发操作每日 500 次生成,生产合作伙伴可协商更高上限。
  • SynthID + C2PA:每次 API 响应均包含强制水印元数据,符合谷歌负责任 AI 政策。

定价信号(非最终版)

谷歌尚未公布官方 API 定价,但私测文档引用了预估费率:每秒生成视频 $0.12–$0.28,取决于分辨率及是否启用 Avatar 模式。这使 Omni Flash 在许多工作负载上可与 Runway Gen-4 竞争,并低于高端 Veo 3.1 档位。

I/O 发布时分析师按 $0.10–$0.30/秒 建模的假设,如今有了真实数字可参考——不过谷歌提醒 GA 前费率可能调整。

等候名单与时间线

个人开发者可通过 Gemini API 等候名单 申请。企业团队应通过 Google Cloud 客户经理 申请 Vertex AI 接入。谷歌目标在 2026 年秋季公开 GA,提供更宽松的速率限制与自助计费。

Omni API 与 Veo 3.1 对比

维度Veo 3.1 APIOmni Flash API(私测)
可用性正式可用(GA)仅私测
多轮编辑需从头重新生成原生对话式编辑
Avatar 支持不支持内置
最长片段最长 8 秒最长 10 秒(Flash)
定价已公布($0.15–$0.40/秒)预估($0.12–$0.28/秒)

给开发者的结论:若今天就需要生产级 API,Veo 3.1 仍是受支持的路径。若能等到 2026 年秋季——或符合私测资格——现在就开始按 Provider 接口架构代码。详见我们的 API 开发者指南

Gemini Omni Pro:首次预览

谷歌在 8 月预告了 Gemini Omni Pro——I/O 上宣布但一直没有时间表的高能力档位。早期预览正分批向 AI Ultra 订阅者 与部分企业私测合作伙伴开放。

Pro 相较 Flash 的升级

能力Omni FlashOmni Pro(预览)
最长片段10 秒最长 30 秒
分辨率720p1080p,4K 内测中
音频同步原生音频原生音频合成,多角色声线同步
角色一致性多轮表现良好更长序列中更强的身份锁定

谷歌 8 月合作伙伴简报上的 headline demo 展示了一段 30 秒叙事短片,三个不同说话角色——各自独立音色、口型与生成对白同步——无需后期混音。这是与 Flash 最清晰的分野:Pro 面向故事级内容,而不只是短视频钩子。

Pro 预览暂不提供 API。谷歌表示 Pro 端点将在 Flash GA 之后推出,预计 2026 年底。

Google Flow 与 Gemini App 功能升级

8 月带来了三项面向日常创作者的重要升级:

Google Flow 时间轴控制

Flow 现已提供可视化场景时间轴——拖拽重排镜头、裁剪单段、导出前预览完整序列。此前场景顺序只能通过对话驱动;时间轴在不离开 Omni 工作流的前提下,给予剪辑师传统 NLE 的精度。

Avatar 角色一致性

个人 AI Avatar 功能新增跨场景身份锁定:数字分身在整个多镜头项目中保持外观、着装与音色一致,而不只是单次生成内有效。这缩小了 Omni Avatar 与专业 Deepfake 流水线之间最大的差距。

对话式音色微调

在 Gemini App 内,你现在可以在对话中调整音色特征——「让旁白听起来更温暖」或「给角色加上英式口音」——Omni 会在不破坏场景上下文的前提下应用到下一次生成。

以上三项功能已向 AI Plus、Pro、Ultra 订阅者 在 Web 与移动端上线。

更新后的定价与算力额度

谷歌在 8 月更新中厘清了 2026 下半年的订阅结构:

档位月费Omni 权限算力额度
AI Plus$7.99Gemini App + Flow 中的 Flash入门额度,约 5 小时刷新
AI Pro$19.99更高 Flash 额度 + 更多 Flow 额度约 3× Plus,约 5 小时刷新
AI Ultra$100Flash + Pro 预览,5× Pro 额度最高消费档位

算力额度模型——I/O 上引入——现已完整文档化:额度取决于提示词复杂度、片段长度与所用功能(Avatar、多轮编辑等),大约每 五小时 刷新一次,直至触及每周上限。Flow 重度用户即使用 Plus 也可能比 Gemini App 轻度 Pro 用户更快触顶,因此选档应匹配主要使用场景。

YouTube Shorts Remix 与 YouTube Create 对 18 岁以上用户仍免费,与发布时一致。

总结与 2026 秋季路线图

2026 年 8 月标志着 Omni 从「消费者产品」向「平台」的转变。API 私测、Pro 预览与 Flow 时间轴控件,是这一转变的三根支柱。

秋季展望:

  1. Omni Flash API 公开 GA——通过 Gemini API 与 Vertex AI 自助接入,公布正式定价。
  2. Omni Pro 更广铺开——从 Ultra 预览扩展至 Pro 订阅者,默认 30 秒片段与 1080p。
  3. 图像与音频输出模态——仍已承诺、仍无定档,但谷歌确认内部测试进行中。
  4. Workspace 集成——Omni 分批接入 Google Docs、Slides 与 Vids,面向企业客户。

完整发布故事见 2026 年 5 月发布说明6 月状态更新。API 架构见 开发者指南;与 Veo 对比见 Gemini Omni 与 Veo 3.1