DataLearner 标志

基于少量图片生成3D模型的扩散模型3DiM

769 阅读

扩散概率模型(DPM),也被称为简单的扩散模型,最近作为一个强大的生成模型家族出现,在音频和图像合成上实现了最先进的性能,同时比对抗性方法具有更好的训练稳定性,以及似然计算,这使得进一步的应用,如压缩和密度估计。扩散模型在各种图像到图像的翻译任务中取得了令人印象深刻的经验结果,不仅限于文本到图像、超分辨率、绘画、着色、解剪和去除伪影。

扩散模型尚未被研究的一个特定的图像到图像的转换问题是新的视图合成,其中,给定的三维场景的一组图像,任务是推断场景从新的视角看起来如何。在最近出现的场景表征网络(SRN)和神经辐射场(NeRF)之前,最先进的新型视图合成方法通常建立在生成模型或更多关于插值或差异估计的经典技术。今天,这些模型已经被NeRF级模型所超越,其中3D一致性是通过构建来保证的,因为图像是通过单一底层3D表示的体积渲染产生的(又称 “几何感知 “模型)。然而,这些方法的特点是具有不同的局限性。

在这些观察和扩散模型在图像对图像任务中的成功激励下,我们引入了三维扩散模型(3DiMs)。3DiMs是在同一场景的成对图像上训练的图像到图像的扩散模型,我们假设这两张图像的位置是已知的。从场景表示变换器(Sajjadi等人,2021年)中获得的灵感,3DiMs被训练来建立一个给定另一个视图和它们的姿势的条件生成模型。我们的关键发现是,我们可以通过自回归生成将这种图像到图像的模型转化为可以产生一整套三维一致的帧的模型,我们用我们新颖的随机调节采样算法实现了这一点。

与之前的工作相比,3DiMs是生成的(相对于回归的)无几何模型,它们允许训练扩展到大量的场景,并提供一个简单的端到端方法。我们现在总结一下我们的核心贡献:

  1. 我们介绍了3DiM,一个用于新的视图合成的无几何图形的图像到图像的扩散模型。
  2. 我们介绍了随机调节采样算法,该算法鼓励3DiM产生3D一致的输出。
  3. 我们介绍了X-UNet,一种新的UNet架构(Ronneberger等人,2015)变体,用于3D新视点合成,证明架构的变化对于高保真结果至关重要。
  4. 我们为无几何的视图合成模型引入了一种评估方案,即三维一致性评分,它可以通过训练模型输出的神经场来数值化地捕捉三维一致性。

下面是这个模型的一些效果和对比,看起来的确十分优秀:




下面是更多的动态例子,可以看到,对于许多照片都有很好的效果。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码
基于少量图片生成3D模型的扩散模型3DiM | DataLearnerAI