Qwen-Image-2.1
别名:Qwen Image 2.1 / Qwen-Image 2.1
Qwen-Image-2.1 是阿里巴巴 Qwen 团队 2026 年 9 月 20 日开源的 7B 参数图像生成与编辑一体化模型,原生支持透明(RGBA)图像、最多 10 张参考图编辑与 2K 输出;官方称在 Qwen-Image-Bench 上位列开源第一(60.28),采用 Qwen Research License,商用需另行授权。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
发布机构
模型解读
模型简介
Qwen-Image-2.1 是阿里巴巴通义千问(Qwen)团队于 2026 年 9 月 20 日开源的图像生成与编辑一体化模型,视觉生成部分仅 7B 参数,在同一模型内统一了文生图、图像编辑和透明素材(RGBA)生成。模型权重已发布在 Hugging Face 与 ModelScope,代码仓库为 QwenLM/Qwen-Image-2.1。
核心能力
- 原生透明图像:使用 64 通道 RGBA VAE(16 倍空间压缩),可直接生成和编辑带透明通道的图像,适合设计素材、贴纸与产品图抠图场景。
- 统一生成与编辑:同一模型完成文生图与图像编辑,支持圈选、涂抹标注或蒙版进行局部编辑,并保持人物与商品的身份一致性。
- 多图参考:最多支持 10 张参考图的编辑与合成。
- 原生 2K 输出:支持 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等多种宽高比。
架构
视觉生成部分为 32 层 Single-Stream DiT(约 7B 参数),文本编码器为 Qwen3-VL 8B,采用块因果注意力(block-causal attention)、Flow Matching 与 Euler 离散调度,并支持前缀 KV 缓存复用以提升推理效率。官方推荐推理步数 40,可通过 CPU offload 降低显存占用;官方文档未给出具体显存需求。
评测表现
据官方发布及媒体报道,在 Qwen-Image-Bench 上 Qwen-Image-2.1 总分 60.28,高于 Nano Banana 2.0(59.82)和 GPT Image 1.5(59.65),位列开源模型第一。该成绩为厂商自报。
许可与使用
采用 Qwen Research License Agreement:允许研究、个人兴趣及内部评测使用,商用需另行申请授权。官方暂未在百炼(Model Studio)提供 Qwen-Image-2.1 托管 API,商业托管方案为 API 形态的 Qwen-Image-3.0。运行需要 PyTorch ≥ 2.4.0、Transformers ≥ 5.17。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
