Google Gemini Omni 1.1 Flash (Gemini Omni Flash 1.1)
Google 于 2026 年 8 月 27 日正式发布的 GA 原生多模态视频生成与编辑模型,稳定 Gemini API ID 为 gemini-omni-1.1-flash。它支持文本、图像、音频和视频输入,生成带原生音频的视频,并提供对话式编辑、首尾帧插值、视频引用、最长 40 秒的多轮续写,以及 360p 草稿和最高 4K 上采样输出。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 文本 | - | $1.50/ 1M | $9.00/ 1M |
| 图像 | - | $1.50/ 1M | — |
| 音频 | - | $1.50/ 1M | — |
| 视频 | - | $1.50/ 1M | $17.50/ 1M |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
发布机构
模型解读
正式发布与定位
Gemini Omni 1.1 Flash 是 Google 于 2026 年 8 月 27 日发布的原生多模态视频生成与编辑模型,稳定 Gemini API 标识为 gemini-omni-1.1-flash。Google 将其列为正式可用(GA)的开发者模型;此前的 gemini-omni-flash-preview 预览端点计划于 2026 年 9 月 30 日弃用。
输入、输出与规格
模型可联合处理文本、图像、音频和视频输入,生成带原生同步音频的视频。Gemini API 官方模型页给出的上下文窗口为 1,048,576 tokens;单次输出为 3–10 秒、24 FPS,支持 16:9 与 9:16,默认 720p,也可生成 360p 草稿并将结果上采样到 1080p 或 4K。Google 未公开参数量、训练权重或知识截止日期,模型权重不开源。
核心能力
- 多输入视频生成:支持文生视频、图生视频、首尾帧插值,以及最多 3 段、每段最长 3 秒的视频引用。
- 对话式编辑:通过 Interactions API 和
previous_interaction_id逐轮修改视频,同时尽量保持未指定内容一致。 - 视频续写:可分析最多 10 秒既有上下文,并以 10 秒为增量续写,连续多轮最长可达 40 秒。
- 原生音频与溯源:生成语音、音乐和音效;输出包含 SynthID 水印,Google 的产品渠道还支持 C2PA Content Credentials。
评测与局限
Google 报告 Gemini Omni Flash 在视频编辑、MovieGenBench 文生视频、快速运动、VBench 图生视频和多参考生成的人类偏好测试中达到领先或并列领先,但公开页面没有提供可独立写入本站结构化评测表的完整数值分数。因此本条目保留官方测试方法和定性结论,不虚构 benchmark 分数。
官方列出的已知限制包括:复杂运动和长序列编辑仍可能出现一致性问题,视频中文字未必完全准确;上传视频的编辑或续写通常限 10 秒,续写只能追加到片尾;当前 API 不支持语音编辑、音频引用、系统指令、函数调用、结构化输出、上下文缓存或 Provisioned Throughput,部分编辑能力还受地区限制。
API 与价格
Gemini Developer API 仅提供付费层。标准价格为每百万输入 tokens 1.50 美元(文本、图像、视频或音频)、每百万文本输出 tokens 9.00 美元、每百万视频输出 tokens 17.50 美元。720p 视频按每秒 5,792 个输出 tokens 计费,官方折算约为 0.10 美元/秒。
官方来源
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
