Qwen-Audio-3.0-TTS-Plus 是阿里巴巴于 2026 年 7 月发布的专业级高质量语音合成模型,支持流式生成、自然语言指令控制、细粒度标签和多语言语音输出。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
评测结果
和其他模型对比
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
发布机构
模型解读
Qwen-Audio-3.0-TTS-Plus 是阿里巴巴 Qwen Audio 与 Token Foundry 团队于 2026 年 7 月发布的 Qwen-Audio-TTS 系列专业级语音合成模型。阿里云将 Plus 版定位于高质量专业场景,可通过 DashScope / Model Studio 的 WebSocket 接口进行流式文本转语音。
架构与生成能力
Qwen-Audio-3.0-TTS 系统采用 12.5 Hz 低帧率监督式语音 tokenizer,以降低自回归解码成本并保留内容与说话人信息;训练流程包含语言模型与流匹配模型的独立预训练、联合训练、高质量数据退火、语言模型强化学习、鲁棒性训练与流匹配模型强化学习。官方尚未公开 Plus 版的参数规模、模型权重和上下文长度。
该系列支持自然语言指令控制,可描述角色、情绪、语速、音色、口音与表达风格;同时新增 86 种细粒度行内标签,用于短语或词级别的表达变化,以及笑声、呼吸、咳嗽和叹息等非语言事件。系统支持最长约 3 分钟的一次性长文本合成,并可通过声码器超分辨率输出 48 kHz 音频。
语言、方言与鲁棒性
官方技术页披露该系统覆盖 16 种语言和 20 个中文方言区域,其中新增阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和菲律宾语。具体可用语言仍取决于所选系统音色;阿里云文档列出的系统音色主要覆盖普通话与英语。模型针对噪声、混响、电话带宽或不清晰参考音频进行了鲁棒性优化,并支持跨语言合成、文本规范化和长文本朗读。
评测与适用范围
官方报告在 SEED-TTS-Eval、CV3-Eval、指令遵循、长文本和声学鲁棒性评测中取得多项领先或较强综合结果,并称 Qwen-Audio-3.0-TTS 在 Artificial Analysis Text-to-Speech Leaderboard 位列第一。由于技术页没有明确说明这些系统级结果分别对应 Plus 还是 Flash SKU,本条目不把相关成绩写成 Plus 版的结构化 benchmark 分数。
Plus 版适合专业播报、有声内容、客服和需要高质量预设音色与表达控制的场景。它支持自然语言指令控制,但阿里云当前产品文档未将 Plus 列为语音设计模型;是否支持特定自定义音色能力应以所用区域和接口文档为准。API 按输入文本字符计费,输出音频不另收费。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
