De

DeepFloyd IF

基础大模型

DeepFloyd IF

发布时间: 2023-04-26

模型参数(Parameters)
43.0
最高上下文长度(Context Length)
2K
是否支持中文
不支持
推理能力(Reasoning)

模型基本信息

是否支持推理过程

不支持

最高上下文输入长度

2K tokens

最长输出结果
暂无数据
模型类型

基础大模型

发布时间

2023-04-26

模型预文件大小
暂无数据

开源和体验地址

代码开源状态
预训练权重开源
-
GitHub 源码
Hugging Face
暂无开源HuggingFace地址
在线体验
暂无在线体验地址

官方介绍与博客

官方论文
暂无官方论文
DataLearnerAI博客
暂无介绍博客

API接口信息

接口速度(满分5分)
暂无数据
接口价格
输入价格:
  • 文本: 暂无数据
  • 图片: 暂无数据
  • 音频: 暂无数据
  • 视频: 暂无数据
  • Embedding: 暂无数据
输出价格:
  • 文本: 暂无数据
  • 图片: 暂无数据
  • 音频: 暂无数据
  • 视频: 暂无数据
  • Embedding: 暂无数据

输入支持的模态

文本

输入不支持

图片

输入不支持

视频

输入不支持

音频

输入不支持

Embedding(向量)

输入不支持

输出支持的模态

文本

输出不支持

图片

输出不支持

视频

输出不支持

音频

输出不支持

Embedding(向量)

输出不支持

DeepFloyd IF模型在各大评测榜单的评分

发布机构

模型介绍

DeepFloyd IF简介

DeepFloyd IF是由DeepFloyd、StabilityAI和LAION三家协作开发的一个Text-to-Image模型。它使用的是与Google Imagen类似的架构完成的一个图片生成模型。


DeepFloyd IF模型原理

DeepFloyd IF是一个具有高度照片级别真实感和语言理解能力的新型最先进的开源文本到图像模型。DeepFloyd IF是一个模块化的组合,由一个冻结的文本编码器和三个级联的像素扩散模块组成:一个基础模型,基于文本提示生成64x64像素的图像,以及两个超分辨率模型,分别设计用于生成分辨率逐步增加的图像:256x256像素和1024x1024像素。


模型的所有阶段都利用基于T5 transformer的冻结文本编码器提取文本嵌入,然后将其馈送到一个带有交叉注意力和注意力池化的UNet架构中。这是一个高效的模型,胜过当前最先进的模型,在COCO数据集上实现了零-shot FID得分为6.66。



DeepFloyd IF开源结果

DeepFloyd IF模型完全开源,目前已知包括7个模型,其参数规模和迭代步骤等信息如下:


模型名称级联级别参数规模Batch大小迭代次数
IF-I-MI400M3072250万
IF-I-LI900M3200300万
IF-I-XL*I4.3B3072242万
IF-II-MII450M1536250万
IF-II-L*II1.2B1536250万
IF-III-L* (soon)III700M3072125万



DeepFloyd IF效果

从官方展示的结果来看,DeepFloyd IF效果十分经验。




关注DataLearnerAI公众号

关注DataLearnerAI微信公众号,接受最新大模型资讯

DataLearnerAI WeChat