DataLearner 标志

DALL·E2的对手来了,谷歌Text-to-Image模型(Imagen)来临!

371 阅读

OpenAI的DALL·E2模型的发布让大家发现原来文本转图像已经可以逼真到这个地步。而本月,Google家的Text-to-Image也发布了,相比较DALL·E2,Google发布的Imagen似乎在细节上更加逼真,清晰度更高。需要注意的是,这也是一个diffusion model,也就是说,diffusion model目前已经被证明在文本转图像方面具有很好的特性。

下图是示例:



下面是谷歌官方发的Imagen与DALL·E2的对比结果,左边是Imagen结果,右边是DALL·E2,这么看Imagen似乎细节更加丰富:


A brain riding a rocketship heading towards the moon.




An alien octopus floats through a portal reading a newspaper.



A single beam of light enter the room from the ceiling. The beam of light is illuminating an easel. On the easel there is a Rembrandt painting of a raccoon


不得不说,这个逼真程度真的是感觉要干死一大片做设计、UI和摄影师了。

模型的主要思路如下:

他们论文的主要贡献:

  1. 我们发现,仅在文本数据上训练的大型冷冻语言模型是令人惊讶的非常有效的文本编码器,用于文本到图像的生成,缩放冷冻文本编码器的大小比缩放图像扩散模型的大小更能提高样本质量。
  2. 我们介绍了动态阈值,这是一种新的扩散采样技术,可以利用高指导权重,生成比以前更逼真和详细的图像。3. 我们强调了几个重要的扩散架构设计选择,并提出了高效U-Net,一个新的架构变体,它更简单,收敛更快,内存效率更高。
  3. 我们实现了新的最先进的COCO FID,即7.27。人类评审员发现伊玛格在图像-文本对齐方面与参考图像不相上下。
  4. 我们介绍了DrawBench,这是一个新的全面和具有挑战性的文本到图像任务的评估基准。在DrawBench的人类评估中,我们发现Imagen的表现优于所有其他工作,包括同时进行的DALL-E 2的工作。

可惜的是,这个模型并没有公开,也没有试用的途经,上面都是谷歌家自己公布的结果。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码