DataLearner 标志

视觉与自然语言多模态预训练模型的综述来了

669 阅读

这篇综述来自于中科院自动化所的Feilong Chen老师。主要是综述了最近很火热的多模态模型的预训练模型的进展。主要包括五个方面:

  • 特征提取:本节包括VLP模型中图像、视频和文本的预处理和表示方法。

  • 模型结构:我们从两个不同的角度介绍VLP模型的结构。从多模态融合的角度看,单流与双流;从整体架构设计的角度看,仅编码器与编码器-解码器。VLP:关于视觉语言预训练的调查

  • 预训练目标:预训练目标是VLP的核心,主要用于指导模型学习视觉语言相关信息。我们总结了典型的和有特色的预训练目标,分为完成、匹配、时间和特殊类型。

  • 预训练数据集:数据对于VLP至关重要。我们简要介绍VLP的主流语料库及其具体规模。

  • 下游任务:各种任务需要视觉和语言的合作知识。我们讨论这些任务的基本细节和目标。


下图是总结的下游任务概览。十分的清晰明白。


DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码