MAI-Transcribe-2-Streaming
预览版语音大模型实时对话大模型MAI-Transcribe-2-Streaming
微软实时语音转文字模型,支持 60 种语言,介绍价为每音频小时 0.54 美元。
数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法
模型基本信息
开源和体验地址
官方介绍与博客
API接口信息
| 类型 | 适用条件 | 输入 | 输出 |
|---|---|---|---|
| 音频 | - | $0.0090/ 1 min | — |
表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。
发布机构
模型解读
MAI-Transcribe-2-Streaming 是微软于 2026 年 10 月 1 日发布的实时语音转文字模型,支持 60 种语言及自动语言检测。它接收连续音频,先返回可修订的中间文本,再确认最终文本,适合实时字幕、会议转写和语音助手。当前为公开预览,通过 Microsoft Foundry 和 Azure Speech 服务提供。
流式转写让文本在讲话过程中出现
模型输入为音频、输出为文字。微软称,接收音频后略超过 100 毫秒即可生成第一批中间结果;后续音频会修订这些结果。这个数字是厂商公布的首个假设延迟,并不等于整句话的最终转写时间。微软未公开参数规模、模型架构或权重,不能据此判断它与非流式 MAI-Transcribe-2 使用相同的技术路线。
独立评测支持准确率优势,但计时从语音结束开始
2026 年 10 月 3 日读取的 Artificial Analysis 原始榜单数据中,该模型的最终文本词错误率为 2.5136%,语音结束后的首个中间结果词错误率约 2.5163%,最终文本延迟约 0.128 秒。AA-WER Streaming 使用约 8 小时音频,按 AA-AgentTalk 50%、VoxPopuli 25%、Earnings22 25% 加权。延迟从检测到语音结束开始计时,因此不能把它与微软的音频接收至首个中间结果延迟直接比较。这些结果也不是全部 60 种语言的逐语种准确率证明。
介绍价按音频时长收费
微软发布价为每音频小时 0.54 美元,介绍价持续至 2026 年底。本站以每分钟 0.009 美元记录同一价格,不按文字 token 收费;官方尚未公布介绍期后的价格。
实时字幕适用,精细标注能力仍有限
开发者可通过 Realtime API 或 Azure Speech SDK 接入。微软文档说明,单个 Realtime 会话最长一小时;Speech SDK 结果不含识别语言、置信度或词级时间戳,只有最终结果包含片段级时间信息。需要说话人分离或词级时间戳时,应单独核对非流式 MAI-Transcribe-2 的能力。Microsoft Learn 将本服务标为公开预览,目前不提供服务等级协议。
来源:微软发布说明(2026-10-01);Realtime API 文档;Speech SDK 文档;Artificial Analysis 流式转写评测(读取于 2026-10-03)。
DataLearner 官方微信
欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送
