Flash 版和 Plus 版怎么选?
按场景选,不是按好坏选。Flash 定位实时交互,官方公布首包音频延迟低于 200 ms,价格为每百万字符 $0.15 / 1.0 元人民币;Plus 定位高质量专业场景(专业播报、有声内容、客服等),价格 $0.20 / 1.4 元。两者共用同一套 Qwen-Audio-3.0-TTS 系统架构和能力集,差别主要在延迟与音质的取舍以及可用系统音色。做语音助手、实时陪练用 Flash;做成品音频内容用 Plus。
Qwen-Audio-3.0-TTS-Flash
Qwen-Audio-3.0-TTS-Flash 是阿里巴巴于 2026 年 7 月发布的低延迟实时语音合成模型,首包延迟低于 200 ms,并支持语音克隆、指令控制与多语言语音生成。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
Qwen-Audio-3.0-TTS-Flash 是阿里巴巴 Qwen Audio 与 Token Foundry 团队于 2026 年 7 月发布的低延迟实时语音合成模型。阿里云将 Flash 版定位于实时交互,官方公布的首包音频延迟低于 200 ms;模型通过 DashScope / Model Studio 的 WebSocket 接口提供流式文本转语音能力。
Qwen-Audio-3.0-TTS 系统采用 12.5 Hz 低帧率监督式语音 tokenizer,以降低自回归解码成本并保留内容与说话人信息;训练流程包含语言模型与流匹配模型的独立预训练、联合训练、高质量数据退火、语言模型强化学习、鲁棒性训练与流匹配模型强化学习。官方尚未公开 Flash 版的参数规模、模型权重和上下文长度。
该系列支持自然语言指令控制,可描述角色、情绪、语速、音色、口音与表达风格;同时新增 86 种细粒度行内标签,用于短语或词级别的表达变化,以及笑声、呼吸、咳嗽和叹息等非语言事件。系统支持最长约 3 分钟的一次性长文本合成,并可通过声码器超分辨率输出 48 kHz 音频。
官方技术页披露该系统覆盖 16 种语言和 20 个中文方言区域,其中新增阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和菲律宾语。具体可用语言取决于所选系统音色或克隆音色。Flash 版支持通过 voice-enrollment 服务注册参考音频并进行语音克隆,也支持通过指令控制方言、情绪和表达风格;它不是基于文字描述从零设计音色的 Voice Design 模型。
模型针对噪声、混响、电话带宽或不清晰参考音频进行了鲁棒性优化,并支持跨语言合成、文本规范化和长文本朗读。
官方报告在 SEED-TTS-Eval、CV3-Eval、指令遵循、长文本和声学鲁棒性评测中取得多项领先或较强综合结果,并称 Qwen-Audio-3.0-TTS 在 Artificial Analysis Text-to-Speech Leaderboard 位列第一。由于技术页没有明确说明这些系统级结果分别对应 Plus 还是 Flash SKU,无法确认它们属于 Flash 版,故不作为该版本的评测成绩收录。
Flash 版适合语音助手、实时客服、低延迟对话、个性化主播和需要克隆音色的交互场景。API 按输入文本字符计费,输出音频不另收费。
按场景选,不是按好坏选。Flash 定位实时交互,官方公布首包音频延迟低于 200 ms,价格为每百万字符 $0.15 / 1.0 元人民币;Plus 定位高质量专业场景(专业播报、有声内容、客服等),价格 $0.20 / 1.4 元。两者共用同一套 Qwen-Audio-3.0-TTS 系统架构和能力集,差别主要在延迟与音质的取舍以及可用系统音色。做语音助手、实时陪练用 Flash;做成品音频内容用 Plus。
支持。可以通过 voice-enrollment 服务注册参考音频进行语音克隆,也支持用自然语言指令控制方言、情绪和表达风格。需要注意它不是 Voice Design 类模型——不能凭一段文字描述从零设计一个不存在的音色,必须有参考音频。模型针对噪声、混响、电话带宽或不清晰的参考音频做了鲁棒性优化。
官方技术页披露系统覆盖 16 种语言和 20 个中文方言区域,这一代新增了阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和菲律宾语。实际可用语言取决于所选的系统音色或克隆音色,不是每个音色都覆盖全部语种。
用于在短语或词级别控制表达变化的标记,包括笑声、呼吸、咳嗽、叹息等非语言事件。相比只能整段设定情绪的传统 TTS,它可以让一句话里某几个词带上特定的语气或副语言表现,是这一代在表现力上的主要升级点。
支持最长约 3 分钟的一次性长文本合成,并可通过声码器超分辨率输出 48 kHz 音频。系统采用 12.5 Hz 低帧率监督式语音 tokenizer,目的是降低自回归解码成本的同时保留内容与说话人信息——这是它能做到低延迟的技术基础。
参数规模、模型权重和上下文长度官方均未公开。官方报告称 Qwen-Audio-3.0-TTS 在 SEED-TTS-Eval、CV3-Eval、指令遵循、长文本和声学鲁棒性评测中取得多项领先结果,并在 Artificial Analysis Text-to-Speech Leaderboard 位列第一;但技术页没有说明这些系统级结果分别对应 Flash 还是 Plus,因此本站不把它们记为 Flash 版的结构化成绩。
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
