DataLearner 标志
QW

Qwen-Audio-3.0-TTS-Flash

语音大模型实时对话大模型Qwen

Qwen-Audio-3.0-TTS-Flash

发布时间: 2026-07-145
在线体验GitHubHugging FaceCompare
模型参数
未披露
上下文长度
暂无数据
中文支持
支持
推理能力

Qwen-Audio-3.0-TTS-Flash 是阿里巴巴于 2026 年 7 月发布的低延迟实时语音合成模型,首包延迟低于 200 ms,并支持语音克隆、指令控制与多语言语音生成。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

Qwen-Audio-3.0-TTS-Flash

模型基本信息

推理过程
不支持
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
语音大模型
输入/输出模态
文本 → 音频
发布时间
2026-07-14
模型文件大小
暂无数据
MoE架构
总参数 / 激活参数
暂无数据 / 不涉及
知识截止
暂无数据
Qwen-Audio-3.0-TTS-Flash

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无GitHub开源地址
Hugging Face
暂无开源HuggingFace地址
Qwen-Audio-3.0-TTS-Flash

官方介绍与博客

DataLearnerAI博客
暂无介绍博客
Qwen-Audio-3.0-TTS-Flash

API接口信息

接口速度
5/5
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
international
类型适用条件输入输出
文本-$0.150/ 10000-
mainland_china
类型适用条件输入输出
文本-¥1.00/ 10000-
Qwen-Audio-3.0-TTS-Flash

评测结果

当前尚无可展示的评测数据。

和其他模型对比

暂时没有为该模型整理的相关对比页面。

想自定义其他组合?打开对比工具

Qwen-Audio-3.0-TTS-Flash

发布机构

Qwen-Audio-3.0-TTS-Flash

模型解读

Qwen-Audio-3.0-TTS-Flash 是阿里巴巴 Qwen Audio 与 Token Foundry 团队于 2026 年 7 月发布的低延迟实时语音合成模型。阿里云将 Flash 版定位于实时交互,官方公布的首包音频延迟低于 200 ms;模型通过 DashScope / Model Studio 的 WebSocket 接口提供流式文本转语音能力。


架构与生成能力

Qwen-Audio-3.0-TTS 系统采用 12.5 Hz 低帧率监督式语音 tokenizer,以降低自回归解码成本并保留内容与说话人信息;训练流程包含语言模型与流匹配模型的独立预训练、联合训练、高质量数据退火、语言模型强化学习、鲁棒性训练与流匹配模型强化学习。官方尚未公开 Flash 版的参数规模、模型权重和上下文长度。

该系列支持自然语言指令控制,可描述角色、情绪、语速、音色、口音与表达风格;同时新增 86 种细粒度行内标签,用于短语或词级别的表达变化,以及笑声、呼吸、咳嗽和叹息等非语言事件。系统支持最长约 3 分钟的一次性长文本合成,并可通过声码器超分辨率输出 48 kHz 音频。


语言、方言与语音克隆

官方技术页披露该系统覆盖 16 种语言和 20 个中文方言区域,其中新增阿拉伯语、印度尼西亚语、葡萄牙语、泰语、越南语、马来语和菲律宾语。具体可用语言取决于所选系统音色或克隆音色。Flash 版支持通过 voice-enrollment 服务注册参考音频并进行语音克隆,也支持通过指令控制方言、情绪和表达风格;它不是基于文字描述从零设计音色的 Voice Design 模型。

模型针对噪声、混响、电话带宽或不清晰参考音频进行了鲁棒性优化,并支持跨语言合成、文本规范化和长文本朗读。


评测与适用范围

官方报告在 SEED-TTS-Eval、CV3-Eval、指令遵循、长文本和声学鲁棒性评测中取得多项领先或较强综合结果,并称 Qwen-Audio-3.0-TTS 在 Artificial Analysis Text-to-Speech Leaderboard 位列第一。由于技术页没有明确说明这些系统级结果分别对应 Plus 还是 Flash SKU,本条目不把相关成绩写成 Flash 版的结构化 benchmark 分数。

Flash 版适合语音助手、实时客服、低延迟对话、个性化主播和需要克隆音色的交互场景。API 按输入文本字符计费,输出音频不另收费。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码