DataLearner 标志
MA

MAI-Voice-2.1

预览版语音大模型

MAI-Voice-2.1

发布时间: 2026-10-01更新于: 2026-10-03浏览量: 0
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
23 种语言
推理能力
暂无数据

微软文字转语音模型,支持 23 种语言,每百万字符 22 美元。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

MAI-Voice-2.1

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
语音大模型
输入/输出模态
文本、音频 → 音频
发布时间
2026-10-01
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
MAI-Voice-2.1

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
MAI-Voice-2.1

官方介绍与博客

MAI-Voice-2.1

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
标准模式
类型适用条件输入输出
音频-—$22.00/ 1000000

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

MAI-Voice-2.1

发布机构

MAI-Voice-2.1

模型解读

MAI-Voice-2.1 是微软于 2026 年 10 月 1 日发布的文字转语音模型,支持 23 种语言,当前在 Azure Speech 中为公开预览。它以有声书、播客、教育内容和配音为主要场景,支持情绪与风格控制,以及经授权的短音频参考声音匹配。

标准版侧重长篇生成中的声音一致性

微软将标准版定位为高保真、富有表现力的语音生成模型,强调长篇内容中说话人特征与韵律的稳定性。模型参数量、架构和权重未公开,不能仅凭产品名称推断两版的内部结构。

官方延迟不是独立测得的整段生成时间

微软产品页列出的模型推理延迟约为 550 毫秒。Flash 发布说明另给出生成 45 秒音频时约 150 毫秒的端到端延迟;这些是不同指标。官方没有在该页给出完整硬件、文本长度、并发和测量方法,本次未找到可核对的独立语音质量评测原始数据,因此不把延迟数字或语音质量宣传写成第三方评测成绩。

每百万字符 22 美元,按字符而非 token 计费

发布时 MAI-Voice-2.1 为每百万字符 22 美元,Flash 为 15 美元。Flash 的公布价格比标准版低约 31.8%,这只是同系列公开单价的比较。本站按音频生成服务的字符计费记录价格,不将它折算为每百万文本 token,也不把文字转语音与语音转文字的每分钟价格混用。

声音匹配需要授权,预览状态仍需纳入选型

微软文档支持通过 SSML 控制情绪和风格,并说明即时声音克隆为受限功能,参考片段长度为 5 至 60 秒且必须获得声音授权。官方发布说明称支持 23 种语言、26 个 locale,但产品页枚举的地区变体与这一数量口径不完全一致;本站保留 23 种语言的明确声明,暂不填入未经统一核对的 locale 清单。Azure Speech 文档将两个模型标为公开预览,不提供服务等级协议。

来源:微软发布说明(2026-10-01);MAI-Voice 产品页;Azure Speech 官方文档。信息核对日期:2026-10-03。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码