Qwen-Audio-3.0-TTS-Flash 是阿里巴巴于 2026 年 7 月发布的低延迟实时语音合成模型,首包延迟低于 200 ms,并支持语音克隆、指令控制与多语言语音生成。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
评测结果
和其他模型对比
暂时没有为该模型整理的相关对比页面。
想自定义其他组合?打开对比工具
发布机构
模型解读
Qwen-Audio-3.0-TTS-Flash 是阿里巴巴 Qwen Audio 与 Token Foundry 团队于 2026 年 7 月发布的低延迟实时语音合成模型。阿里云将 Flash 版定位于实时交互,官方公布的首包音频延迟低于 200 ms;模型通过 DashScope / Model Studio 的 WebSocket 接口提供流式文本转语音能力。
架构与生成能力
Qwen-Audio-3.0-TTS 系统采用 12.5 Hz 低帧率监督式语音 tokenizer,以降低自回归解码成本并保留内容与说话人信息;训练流程包含语言模型与流匹配模型的独立预训练、联合训练、高质量数据退火、语言模型强化学习、鲁棒性训练与流匹配模型强化学习。官方尚未公开 Flash 版的参数规模、模型权重和上下文长度。
该系列支持自然语言指令控制,可描述角色、情绪、语速、音色、口音与表达风格;同时新增 86 种细粒度行内标签,用于短语或词级别的表达变化,以及笑声、呼吸、咳嗽和叹息等非语言事件。系统支持最长约 3 分钟的一次性长文本合成,并可通过声码器超分辨率输出 48 kHz 音频。
语言、方言与语音克隆
官方技术页披露该系统覆盖 16 种语言和 20 个中文方言区域,其中新增阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和菲律宾语。具体可用语言取决于所选系统音色或克隆音色。Flash 版支持通过 voice-enrollment 服务注册参考音频并进行语音克隆,也支持通过指令控制方言、情绪和表达风格;它不是基于文字描述从零设计音色的 Voice Design 模型。
模型针对噪声、混响、电话带宽或不清晰参考音频进行了鲁棒性优化,并支持跨语言合成、文本规范化和长文本朗读。
评测与适用范围
官方报告在 SEED-TTS-Eval、CV3-Eval、指令遵循、长文本和声学鲁棒性评测中取得多项领先或较强综合结果,并称 Qwen-Audio-3.0-TTS 在 Artificial Analysis Text-to-Speech Leaderboard 位列第一。由于技术页没有明确说明这些系统级结果分别对应 Plus 还是 Flash SKU,本条目不把相关成绩写成 Flash 版的结构化 benchmark 分数。
Flash 版适合语音助手、实时客服、低延迟对话、个性化主播和需要克隆音色的交互场景。API 按输入文本字符计费,输出音频不另收费。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
