Gemini Omni Flash API 已上线:公开预览、$0.10/秒与开发者必知限制
2026 年 6 月 30 日起,gemini-omni-flash-preview 在 Gemini API、Google AI Studio 与 Gemini Enterprise Agent Platform 进入公开预览——对话式编辑、单段 10 秒上限、视频输出 $0.10/秒。
等待结束了
I/O 2026 上 Google 说 Gemini Omni Flash 的开发者 API「未来数周内」上线。2026 年 6 月 30 日,这个接口真正落地:模型 ID gemini-omni-flash-preview 已可在 Google AI Studio、Gemini API 与 Gemini Enterprise Agent Platform 使用。
消费端(Gemini 应用、Google Flow、YouTube Shorts / Create)早已能用 Flash。本文聚焦 开发者 这一刻:价格、上限,以及仍未就绪的能力。
官方说明:Start building with Nano Banana 2 Lite and Gemini Omni Flash。
今天能调什么
| 项目 | 数值 |
|---|---|
| 模型 ID | gemini-omni-flash-preview |
| 状态 | 公开预览(public preview) |
| 视频输出价格 | $0.10 / 秒(与 Veo 3.1 Fast 同价) |
| 单段最长 | 10 秒(更长时长即将开放) |
| API 分辨率 | 720p |
| 输入 | 文本、图像、视频 |
| 输出 | 视频(可附带文本回复) |
| 编辑 | 多轮对话式编辑 |
| 溯源 | SynthID 水印 + C2PA 内容凭证 |
Omni Flash 被定位为 Omni 家族里高性价比的视频主力:多模态参考、依托 Gemini 的世界知识,以及不必整段重生成的聊天式修改。
可用入口
消费者
- Gemini 应用(Google AI Plus / Pro / Ultra)
- Google Flow
- YouTube Shorts 与 YouTube Create(18+ 免费)
开发者
- Google AI Studio playground
- Gemini API
- Gemini Enterprise Agent Platform
价格怎么算
官方把 Omni Flash 视频输出定为 $0.10/秒。满额 10 秒片段大约 $1.00 输出费用(另计输入 token)。预览期目前没有宣传 Batch 半价通道,所以暂时没有「能等就更便宜」的杠杆。
消费端配额仍跟 Google AI 订阅的算力额度走。做代理商或产品单价模型时,不要和 API 计费混为一谈。
设计时就要吃进的限制
Google 对预览约束写得很清楚:
- 单段 10 秒 —— 当前产品硬上限;更长时长在路线图上。
- API 不支持音频参考 —— 暂不能上传音频参考驱动生成(输出仍可带原生同步音轨)。
- 短视频参考仍不稳 —— schema 可能接受最长约 3 秒的视频参考,但官方说明模型目前处理不正确。
- 切镜与运镜 —— 角色一致性仍可能在场景切换时漂移;预留额外编辑轮次或更紧的参考素材。
把这些当产品约束,而不是临时工单。
Omni Flash API vs Veo 3.1
| 维度 | Omni Flash(预览) | Veo 3.1 |
|---|---|---|
| 架构 | Omni 多模态家族 | 专用视频模型 |
| 编辑 | 原生对话式编辑 | 重新提示 / 重生成 |
| 价格信号 | 输出 $0.10/秒 | Veo Fast 同价 $0.10/秒;更高档更贵 |
| 时长 | 最长 10 秒 | 生产文档常见约 8 秒 |
| 成熟度 | 公开预览 | 正式可用(GA) |
今天就要稳的生产路径,Veo 3.1 仍然重要。若需要 对话内编辑 与 Omni 式多模态驾驭,Flash 预览是新入口。干净做法仍是一个 VideoProvider 接口、两套实现 —— 迁移形状见 API 开发者指南(该文写于预览上线前;本文是状态更新)。
与图像模型搭配
6 月 30 日同场还上线了 Nano Banana 2 Lite,适合快速、便宜出静帧。推荐闭环:先快速生成/改图,再把选定帧作为图生视频参考喂给 Omni Flash。AI Studio 上的 demo 应用完整演示了这条链路。
结论
Gemini Omni Flash 不再是「API 即将到来」。 自 2026 年 6 月 30 日起,你可以用 gemini-omni-flash-preview 以 $0.10/秒 构建,受 10 秒 上限与音频参考、短视频参考等预览限制约束。把对话编辑流放在 provider 接口后面,需要 GA 稳定性时继续用 Veo,并关注官方文档里更长时长与音频参考的开放节奏。