YI

Yi-VL-34B

多模态大模型

Yi-VL-34B

发布时间: 2024-01-22更新于: 2024-01-28 19:03:11.194507
模型参数
340亿
上下文长度
2K
中文支持
支持
推理能力

Yi-VL-34B 是由 零一万物 发布的 AI 模型,发布时间为 2024-01-22,定位为 多模态大模型,参数规模约为 340亿,上下文长度为 2K,模型文件大小约 68GB,采用 Yi Series Models License Agreement 许可。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Yi-VL-34B

模型基本信息

推理过程
不支持
思考模式
不支持思考模式
上下文长度
2K tokens
最大输出长度
暂无数据
模型类型
多模态大模型
输入/输出模态
暂无数据
发布时间
2024-01-22
模型文件大小
68GB
MoE架构
总参数 / 激活参数
340亿 / 不涉及
知识截止
暂无数据
Yi-VL-34B

开源和体验地址

预训练权重开源
在线体验
暂无在线体验地址
Yi-VL-34B

官方介绍与博客

官方论文
暂无官方论文
DataLearnerAI博客
暂无介绍博客
Yi-VL-34B

API接口信息

接口速度
暂无数据
暂无公开的 API 定价信息。
Yi-VL-34B

评测结果

当前尚无可展示的评测数据。

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

Yi-VL-34B

发布机构

Yi-VL-34B

模型解读

Yi-VL-34B全称是Yi Visual Language - 34B的简称,是一个多模态大模型,该模型是基于LLaVA架构完成的。该模型可以接受文本和图片的输入,但是可以返回文本结果。Yi-VL-34B应该是目前开源的最高参数规模的多模态大模型。


Yi-VL-34B模型的训练过程

Yi-VL-34B多模态大模型的语言模型用的是Yi-34B,然后外接ViT模型得到。训练过程有3个步骤:

  1. 基于 LAION-400M的1亿张244×244像素图片做预训练;
  2. 将ViT模型的解析力提高到448×448像素,这个极端使用2500万图像文本对数据;
  3. 把语言模型和图像模型结合进行训练完整的多模态大模型。


Yi-VL-34B模型的多模态推理的硬件资源

Yi-VL-34B最低需要4个4090显卡才能允许,或者一个A800(80G)显卡。而60亿参数版本的需要RTX3090单卡即可允许,参考: https://www.datalearner.com/ai-resources/pretrained-models/Yi-VL-6B 


Yi-VL-6B可以在如下单张显卡推理:RTX 3090, RTX 4090, A10, A30



Yi-VL-34B模型的多模态评测结果

这个模型使用128个A800(80G)的GPU进行预训练,总共训练10天(6B版本训练了3天)。模型允许商用,免费商用授权。它在多模态评测得分如下:


Yi-VL-34B支持中英文两种语言,可以做图片的理解和文本的识别。根据官方的描述,这个模型可以用来抽取、组织并总结图片中的信息。最高支持448×448像素的图片输入。在中文的多模态评测如下:



该模型实测:




除了60亿参数模型外,还有340亿参数的Yi-VL-34B,这个模型取得了目前多模态评测榜单第一。






DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码