DataLearner logo
Back to LLM blog list

Whisper大模型v3发布:提升语音识别与翻译性能

2023-11-26AI语音识别自然语言处理WhisperOpenAI

Whisper模型简介

Whisper是OpenAI提出的一种用于自动语音识别(ASR)和语音翻译的预训练模型。该模型在680k小时的标记数据上进行训练,展现出在多个数据集和领域的强大泛化能力,无需进行微调。

Whisper模型的架构与训练细节

Whisper是基于Transformer的编码器-解码器模型,也称为序列到序列模型。它在1百万小时的弱标签音频和4百万小时的伪标签音频上进行了训练,这些数据是使用Whisper large-v2收集的。

模型在仅英语数据或多语言数据上进行训练。仅英语模型用于语音识别任务。多语言模型则同时用于语音识别和语音翻译。对于语音识别,模型预测与音频相同语言的转录文本。对于语音翻译,模型预测将音频翻译成不同语言的转录文本。

Whisper的预训练检查点有五种不同大小的配置,最小的四个配置在仅英语或多语言数据上进行训练。最大的检查点仅为多语言。所有十个预训练检查点都可以在Hugging Face Hub上找到。以下表格总结了检查点的信息,并提供了Hub上模型的链接:

Size Parameters English-only Multilingual
tiny 39 M
base 74 M
small 244 M
medium 769 M
large 1550 M x
large-v2 1550 M x
large-v3 1550 M x

Whisper模型的性能、评估结果

Whisper large-v3模型在多种语言上的表现有所提升,与Whisper large-v2相比,错误率降低了10%到20%。研究表明,与许多现有的ASR系统相比,该模型在口音、背景噪音、专业术语的鲁棒性方面有所提高,同时在多种语言到英语的零样本翻译方面也显示出较好的性能;在语音识别和翻译的准确性上接近最先进水平。

然而,由于模型是在大规模嘈杂数据下以弱监督方式训练的,预测可能包含音频输入中实际未说出的文本(即幻觉)。我们假设这是因为模型在尝试预测音频中的下一个词时,也在尝试转录音频本身。

模型在不同语言上的表现不均,我们观察到在资源较少和/或发现性较低的语言上准确性较低,或者在我们拥有较少训练数据的语言上准确性较低。模型在特定语言的不同口音和方言上也表现出不同的性能,这可能包括不同性别、种族、年龄或其他人口统计标准的发言者之间的更高词错误率。完整的评估结果在随附的论文中呈现。

Whisper模型总结

Whisper模型v3的发布,标志着在自动语音识别和语音翻译领域的一个重要进步。尽管存在一些局限性,如在低资源语言上的性能和生成重复文本的倾向,但其在多语言环境下的强大泛化能力和近乎最先进的性能仍值得关注。有关模型的详细信息和评估结果,可以在原始论文和OpenAI的GitHub仓库中找到。

原文链接:Robust Speech Recognition via Large-Scale Weak Supervision
GitHub链接:Whisper Repository
Huggingface链接:Whisper on Hugging Face Hub