视觉与自然语言多模态预训练模型的综述来了
669 阅读
这篇综述来自于中科院自动化所的Feilong Chen老师。主要是综述了最近很火热的多模态模型的预训练模型的进展。主要包括五个方面:
特征提取:本节包括VLP模型中图像、视频和文本的预处理和表示方法。
模型结构:我们从两个不同的角度介绍VLP模型的结构。从多模态融合的角度看,单流与双流;从整体架构设计的角度看,仅编码器与编码器-解码器。VLP:关于视觉语言预训练的调查
预训练目标:预训练目标是VLP的核心,主要用于指导模型学习视觉语言相关信息。我们总结了典型的和有特色的预训练目标,分为完成、匹配、时间和特殊类型。
预训练数据集:数据对于VLP至关重要。我们简要介绍VLP的主流语料库及其具体规模。
下游任务:各种任务需要视觉和语言的合作知识。我们讨论这些任务的基本细节和目标。

下图是总结的下游任务概览。十分的清晰明白。

DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
