DataLearner 标志
MA

MAI-Transcribe-2-Streaming

预览版语音大模型实时对话大模型

MAI-Transcribe-2-Streaming

发布时间: 2026-10-01更新于: 2026-10-03浏览量: 0
在线体验GitHubHugging Face对比
模型参数
暂无数据
上下文长度
暂无数据
多语言支持
60 种语言
推理能力
暂无数据

微软实时语音转文字模型,支持 60 种语言,介绍价为每音频小时 0.54 美元。

数据优先来自官方发布(GitHub、Hugging Face、论文),其次为评测基准官方结果,最后为第三方评测机构数据。 了解数据收集方法

MAI-Transcribe-2-Streaming

模型基本信息

推理过程
暂无数据
思考模式
不支持思考模式
上下文长度
暂无数据
最大输出长度
暂无数据
模型类型
语音大模型
输入/输出模态
音频 → 文本
支持语种
南非荷兰语、阿拉伯语、阿萨姆语、阿塞拜疆语、保加利亚语、孟加拉语、波斯尼亚语、加泰罗尼亚语 (60 种语言)
发布时间
2026-10-01
模型文件大小
暂无数据
MoE架构
未公布
总参数 / 激活参数
未公布 / 未公布
知识截止
暂无数据
MAI-Transcribe-2-Streaming

开源和体验地址

代码开源状态
不开源
预训练权重开源
不开源
GitHub 源码
暂无
Hugging Face
暂无
MAI-Transcribe-2-Streaming

官方介绍与博客

MAI-Transcribe-2-Streaming

API接口信息

接口速度
暂无数据
💡默认单位:$/100万 tokens。若计费单位不同,则以供应商公开的原始标注为准。
实时模式
类型适用条件输入输出
音频-$0.0090/ 1 min—

表中「—」表示该模态在此方向不计费,或供应商未公开对应价格。

MAI-Transcribe-2-Streaming

发布机构

MAI-Transcribe-2-Streaming

模型解读

MAI-Transcribe-2-Streaming 是微软于 2026 年 10 月 1 日发布的实时语音转文字模型,支持 60 种语言及自动语言检测。它接收连续音频,先返回可修订的中间文本,再确认最终文本,适合实时字幕、会议转写和语音助手。当前为公开预览,通过 Microsoft Foundry 和 Azure Speech 服务提供。

流式转写让文本在讲话过程中出现

模型输入为音频、输出为文字。微软称,接收音频后略超过 100 毫秒即可生成第一批中间结果;后续音频会修订这些结果。这个数字是厂商公布的首个假设延迟,并不等于整句话的最终转写时间。微软未公开参数规模、模型架构或权重,不能据此判断它与非流式 MAI-Transcribe-2 使用相同的技术路线。

独立评测支持准确率优势,但计时从语音结束开始

2026 年 10 月 3 日读取的 Artificial Analysis 原始榜单数据中,该模型的最终文本词错误率为 2.5136%,语音结束后的首个中间结果词错误率约 2.5163%,最终文本延迟约 0.128 秒。AA-WER Streaming 使用约 8 小时音频,按 AA-AgentTalk 50%、VoxPopuli 25%、Earnings22 25% 加权。延迟从检测到语音结束开始计时,因此不能把它与微软的音频接收至首个中间结果延迟直接比较。这些结果也不是全部 60 种语言的逐语种准确率证明。

介绍价按音频时长收费

微软发布价为每音频小时 0.54 美元,介绍价持续至 2026 年底。本站以每分钟 0.009 美元记录同一价格,不按文字 token 收费;官方尚未公布介绍期后的价格。

实时字幕适用,精细标注能力仍有限

开发者可通过 Realtime API 或 Azure Speech SDK 接入。微软文档说明,单个 Realtime 会话最长一小时;Speech SDK 结果不含识别语言、置信度或词级时间戳,只有最终结果包含片段级时间信息。需要说话人分离或词级时间戳时,应单独核对非流式 MAI-Transcribe-2 的能力。Microsoft Learn 将本服务标为公开预览,目前不提供服务等级协议。

来源:微软发布说明(2026-10-01);Realtime API 文档;Speech SDK 文档;Artificial Analysis 流式转写评测(读取于 2026-10-03)。

DataLearner 官方微信

欢迎关注 DataLearner 官方微信,获得最新 AI 技术推送

DataLearner 官方微信二维码