Google家的Text-to-Video模型——高清晰度高帧率的视频生成模型Imagen Video
1,252 阅读
谷歌研究院的研究人员提出了一个新的基于Diffusion的视频生成模型Imagen Video。此前,他们提出的Text-to-Image模型Imagen效果十分惊艳(Imagen 预训练模型详情)。从名字看,这也是基于Imagen架构演化的视频生成模型。
与其它的Text-to-Video模型不同,Imagen Video有一些独特功能,如生成不同艺术风格的视频,3D理解,以及文本渲染和动画等。在渐进式蒸馏的帮助下,Imagen Video可以生成高质量的视频,每个子模型只用8个扩散步骤。这大大加快了视频生成的时间,约为18倍。
下面是一些样例:



这是压缩之后的gif,原版的视频是1024*768且24fps的视频,效果更好。
这是Diffusion Model的又一个成果,也是Tex-to-Video最新的模型。
这个模型的主要贡献:
- 我们展示了用于高清视频生成的级联扩散视频模型的简单性和有效性。
- 我们确认最近在文本到图像设置中的发现转移到了视频生成中,如冻结编码器文本调节和无分类器指导的有效性。
- 我们展示了对一般扩散模型有影响的视频扩散模型的新发现,如v-预测参数化对样本质量的有效性,以及在文本调节视频生成设置中引导扩散模型的渐进式提炼的有效性。
- 我们展示了Imagen Video的定性可控性,如三维物体的理解、文本动画的生成以及各种艺术风格的视频的生成。
Imagen Video使用的是Video U-Net架构:

Imagen Video使用视频U-Net架构来捕捉空间保真度和时间动态。时间上的自我注意(如图所示)用于基本的视频扩散模型,而时间上的卷积(未在图中显示)用于时间和空间上的超分辨率模型。视频U-Net架构使Imagen Video有能力建立长期的时间动态模型!
不过可惜的是,官方没有放出预训练模型的结果和开源代码,不知道后续是否会有。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
