MAI-Voice-2.1-Flash
预览版语音大模型实时对话大模型MAI-Voice-2.1-Flash
微软文字转语音模型,支持 23 种语言,每百万字符 15 美元。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 音频 | - | — | $15.00/ 1000000 |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
发布机构
模型解读
MAI-Voice-2.1-Flash 是微软于 2026 年 10 月 1 日发布的文字转语音模型,支持 23 种语言,当前在 Azure Speech 中为公开预览。它以低延迟语音助手、客服和 IVR为主要场景,支持情绪与风格控制,以及经授权的短音频参考声音匹配。
Flash 以响应速度和较低字符价格为重点
Flash 与标准版共享多语言和参考声音匹配能力,更适合需要及时回应的交互场景。模型参数量、架构和权重未公开,不能仅凭产品名称推断两版的内部结构。
官方延迟不是独立测得的整段生成时间
微软产品页列出的模型推理延迟约为 45 毫秒。Flash 发布说明另给出生成 45 秒音频时约 150 毫秒的端到端延迟;这些是不同指标。官方没有在该页给出完整硬件、文本长度、并发和测量方法,本次未找到可核对的独立语音质量评测原始数据,因此不把延迟数字或语音质量宣传写成第三方评测成绩。
每百万字符 15 美元,按字符而非 token 计费
发布时 MAI-Voice-2.1 为每百万字符 22 美元,Flash 为 15 美元。Flash 的公布价格比标准版低约 31.8%,这只是同系列公开单价的比较。本站按音频生成服务的字符计费记录价格,不将它折算为每百万文本 token,也不把文字转语音与语音转文字的每分钟价格混用。
声音匹配需要授权,预览状态仍需纳入选型
微软文档支持通过 SSML 控制情绪和风格,并说明即时声音克隆为受限功能,参考片段长度为 5 至 60 秒且必须获得声音授权。官方发布说明称支持 23 种语言、26 个 locale,但产品页枚举的地区变体与这一数量口径不完全一致;本站保留 23 种语言的明确声明,暂不填入未经统一核对的 locale 清单。Azure Speech 文档将两个模型标为公开预览,不提供服务等级协议。
来源:微软发布说明(2026-10-01);MAI-Voice 产品页;Azure Speech 官方文档。信息核对日期:2026-10-03。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
