DataLearner 标志
GE

Gemini Omni 1.1 Flash(Gemini Omni Flash 1.1)

多模态大模型Gemini Omni

Google Gemini Omni 1.1 Flash (Gemini Omni Flash 1.1)

发布时间: 2026-08-27更新于: 2026-08-28浏览量: 10
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
1M
多语言支持
暂无数据
推理能力
3/5

Google 于 2026 年 8 月 27 日正式发布的 GA 原生多模态视频生成与编辑模型,稳定 Gemini API ID 为 gemini-omni-1.1-flash。它支持文本、图像、音频和视频输入,生成带原生音频的视频,并提供对话式编辑、首尾帧插值、视频引用、最长 40 秒的多轮续写,以及 360p 草稿和最高 4K 上采样输出。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Gemini Omni 1.1 Flash(Gemini Omni Flash 1.1)

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
1M tokens
最大输出长度
3–10 秒(24 FPS) tokens
模型类型
多模态大模型
输入/输出模态
文本、图像、音频、视频 → 音频、视频
发布时间
2026-08-27
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不适用
知识截止
暂无数据
Gemini Omni 1.1 Flash(Gemini Omni Flash 1.1)

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
Gemini Omni 1.1 Flash(Gemini Omni Flash 1.1)

官方介绍与博客

DataLearnerAI博客
暂无
Gemini Omni 1.1 Flash(Gemini Omni Flash 1.1)

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
文本-$1.50/ 1M$9.00/ 1M
图像-$1.50/ 1M
音频-$1.50/ 1M
视频-$1.50/ 1M$17.50/ 1M

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

Gemini Omni 1.1 Flash(Gemini Omni Flash 1.1)

发布机构

Google Gemini Omni 1.1 Flash (Gemini Omni Flash 1.1)

模型解读

正式发布与定位

Gemini Omni 1.1 Flash 是 Google 于 2026 年 8 月 27 日发布的原生多模态视频生成与编辑模型,稳定 Gemini API 标识为 gemini-omni-1.1-flash。Google 将其列为正式可用(GA)的开发者模型;此前的 gemini-omni-flash-preview 预览端点计划于 2026 年 9 月 30 日弃用。

输入、输出与规格

模型可联合处理文本、图像、音频和视频输入,生成带原生同步音频的视频。Gemini API 官方模型页给出的上下文窗口为 1,048,576 tokens;单次输出为 3–10 秒、24 FPS,支持 16:9 与 9:16,默认 720p,也可生成 360p 草稿并将结果上采样到 1080p 或 4K。Google 未公开参数量、训练权重或知识截止日期,模型权重不开源。

核心能力

  • 多输入视频生成:支持文生视频、图生视频、首尾帧插值,以及最多 3 段、每段最长 3 秒的视频引用。
  • 对话式编辑:通过 Interactions API 和 previous_interaction_id 逐轮修改视频,同时尽量保持未指定内容一致。
  • 视频续写:可分析最多 10 秒既有上下文,并以 10 秒为增量续写,连续多轮最长可达 40 秒。
  • 原生音频与溯源:生成语音、音乐和音效;输出包含 SynthID 水印,Google 的产品渠道还支持 C2PA Content Credentials。

评测与局限

Google 报告 Gemini Omni Flash 在视频编辑、MovieGenBench 文生视频、快速运动、VBench 图生视频和多参考生成的人类偏好测试中达到领先或并列领先,但公开页面没有提供可独立写入本站结构化评测表的完整数值分数。因此本条目保留官方测试方法和定性结论,不虚构 benchmark 分数。

官方列出的已知限制包括:复杂运动和长序列编辑仍可能出现一致性问题,视频中文字未必完全准确;上传视频的编辑或续写通常限 10 秒,续写只能追加到片尾;当前 API 不支持语音编辑、音频引用、系统指令、函数调用、结构化输出、上下文缓存或 Provisioned Throughput,部分编辑能力还受地区限制。

API 与价格

Gemini Developer API 仅提供付费层。标准价格为每百万输入 tokens 1.50 美元(文本、图像、视频或音频)、每百万文本输出 tokens 9.00 美元、每百万视频输出 tokens 17.50 美元。720p 视频按每秒 5,792 个输出 tokens 计费,官方折算约为 0.10 美元/秒

官方来源

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码