Qwen-Image-3.0 是阿里巴巴 Qwen 团队于 2026 年 7 月 21 日发布的第三代图像生成基础模型,支持约 4.5K-token 长指令、10px 小字、12 种语言和 20+ 字体渲染,并覆盖复杂版面生成与图像编辑;公开 API 价格、参数规模和官方 benchmark 尚未公布。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
评测结果
和其他模型对比
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
发布机构
模型解读
模型概述
Qwen-Image-3.0 是阿里巴巴 Qwen 团队于 2026 年 7 月 21 日发布的第三代图像生成基础模型。官方发布文章将这一代的重点概括为丰富内容(Rich Content)、真实细节(Authentic Details)和深厚知识(Deep Knowledge),目标是让图像生成从视觉展示走向复杂版面、专业文档和多语言内容生产。
长指令与复杂内容生成
Qwen-Image-3.0 支持最长约 4.5K tokens 的输入指令,可以在一次生成中处理大量相互关联的视觉元素。官方案例包括 3×3 多主题知识图解、包含公式与逻辑推导的教学材料、报纸和学术论文版面、分镜、复杂 UI,以及多层嵌套的软件界面。更长的指令容量主要服务于精确描述布局、文字、对象关系和视觉层级,而不是传统语言模型式的长文本对话。
文字、细节与多语言能力
官方展示称模型可以渲染低至约 10px 的小字,并处理 LaTeX 公式、上下标、希腊字母、多行对齐和手写批注等密集文本。模型原生支持 12 种语言和 20 多种字体的图内文字渲染,同时强化了人物皮肤、毛孔、发丝、纸张、绘画笔触等细节表现。官方还展示了超过 100 种艺术风格、现实世界知识驱动的场景,以及面向教育、设计、电商和专业出版的内容生成案例。
生成与编辑
除文本生成图像外,官方案例还展示了图像编辑和修复能力,包括为传统绘画去除破损、保留原有笔触与墨色层次,以及对现有素材进行带文字指令的修改。因此本站将其归入图像生成、图生图和基于文本指令的图像编辑任务。
访问状态、价格与评测
发布时阿里云百炼开放 API 邀测,Qwen Studio 和千问 App 的体验入口处于逐步开放阶段。Qwen Cloud 公开图像模型目录当时仍只列出 Qwen-Image-2.0 系列,尚未给出 Qwen-Image-3.0 的稳定公开 API SKU、分辨率限制或正式价格;Qwen 团队也未公开模型权重、参数规模或可直接录入的官方 benchmark 分数。因此本站暂不填写 API 价格、参数量和评测成绩,待公开文档更新后再补充。
社区观察
X 用户 @Lentils80 分享了官方样例和早期观察,认为学术论文示例的文字与版面表现突出;这属于社区定性观察,不作为基准评测数据。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
