Flash 版和 Light 版有什么区别?
都在同一套 Hybrid-Attention MoE 架构和全模态能力之上,区别是规模与取舍点:Light 为边缘设备和资源受限环境做了更激进的规模压缩,Flash 则在延迟与能力之间取平衡,面向实时交互。两者的基础规格一致——256K 上下文、8K 最大输出、10 小时音频输入。需要能力上限则应看 Plus 版本。
阿里巴巴通义实验室于 2026 年 3 月 30 日发布的 Qwen3.5-Omni 系列 Flash 版本,定位在最轻量的 Light 与能力优先的 Plus 之间,面向对延迟敏感的实时交互场景。与系列其他版本共用 Hybrid-Attention MoE 架构,支持文本、图像、音频、视频全模态输入和文本/音频输出,具备音视频理解、实时语音交互、多语言识别与合成能力,保持 256K 长上下文、8K 最大输出和 10 小时音频输入的规格。许可为 Qwen License,可通过阿里云百炼平台以 API 形式调用。官方未公开该版本的参数规模与权重下载地址,本站相关字段留空。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
Qwen3.5-Omni-Flash 当前已收录的代表性评测结果包括 MMMU-Pro(156 / 229,得分 64.70)、Terminal Bench Hard(186 / 244,得分 8.30)。 本页还汇总了参数规模、上下文长度与 API 价格,便于结合评测结果与部署约束一起判断模型适配度。
Qwen3.5-Omni-Flash是阿里巴巴通义实验室于2026年3月30日发布的Qwen3.5-Omni系列的轻量级版本[citation:1][citation:4]。该版本在保持全模态理解与生成能力的基础上,针对推理效率和响应速度进行了优化,适合对延迟敏感的应用场景[citation:2][citation:4]。与Plus版本相比,Flash版本在部分基准测试中性能略有调整,但保留了256K长上下文、10小时音频输入等核心能力,API定价更为经济[citation:4]。
模型采用与Plus版本相同的Hybrid-Attention MoE架构和Thinker-Talker分工设计[citation:4]。在能力方面,同样支持文本、图像、音频、视频的全模态输入和文本/音频输出,具备音视频理解、Vibe Coding、实时语音交互、多语言识别与合成等功能[citation:1][citation:7]。多语言方面,支持113种语言及方言的语音识别和36种语言及方言的语音生成[citation:10]。
Qwen3.5-Omni-Flash适用于需要快速响应的实时交互场景,如智能客服、实时语音助手、直播互动等[citation:2]。开发者可通过阿里云百炼平台以API形式调用该模型[citation:1][citation:4]。
都在同一套 Hybrid-Attention MoE 架构和全模态能力之上,区别是规模与取舍点:Light 为边缘设备和资源受限环境做了更激进的规模压缩,Flash 则在延迟与能力之间取平衡,面向实时交互。两者的基础规格一致——256K 上下文、8K 最大输出、10 小时音频输入。需要能力上限则应看 Plus 版本。
输入支持文本、图像、音频和视频四种,输出为文本和音频。能力覆盖音视频理解、实时语音交互、多语言识别与合成。输出带音频意味着它可以直接完成语音对话闭环,而不只是把音频转成文字再回复文本。
通过阿里云百炼平台以 API 形式调用;官方也提供了 Hugging Face 上的在线体验 Space 可先试用效果。许可为 Qwen License。
官方未在公开资料中给出该版本的参数规模、激活参数和 API 价格,本站相关字段留空,不做推测填充。具体计费以阿里云百炼控制台的实际报价为准。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
