自动语音识别
我不知道
是否看懂了你的意思:如果看懂了,它就存在于
你声音的词语波纹上,
像溪流中的暮色一样朦胧。
——Thomas Lovell Beddoes,1851
理解口语,或者至少把口语中的词转写成文字,是计算机语言处理最早的目标之一。事实上,语音处理比计算机早了几十年!第一台能够识别语音的机器是 20 世纪 20 年代的一件玩具。“Radio Rex”(图右)是一只胶木狗;当 500 Hz 的声能释放弹簧时,它就会移动。500 Hz 大致是 “Rex” 中元音 [eh] 的第一个共振峰,因此 Rex 看起来就像是在听到呼唤时跑过来(David, Jr. and Selfridge, 1962)。

在现代,我们对自动系统的期待更高。自动语音识别(automatic speech recognition,ASR)的任务是把如下波形:

映射为恰当的词串:
It’s time for lunch!
让任何说话人在任何环境下的语音都能自动转写,仍然远未解决;但 ASR 技术已经成熟到足以支持许多实际任务。语音是与电器、数字助手或聊天机器人交流的自然界面,尤其是在手机上,因为手机键盘不那么方便。ASR 也适用于一般转写,例如自动为音频或视频文本生成字幕(转写电影、视频或实时讨论)。转写在法律等领域很重要,因为口述发挥着重要作用。最后,ASR 还是辅助交流的一部分:它帮助那些因残障而难以或无法打字、听声音的人与计算机互动。盲人 Milton 曾把《失乐园》口述给女儿,Henry James 则在患重复性劳损后口述了晚年的小说。
接下来的章节将介绍 ASR 任务的不同目标,描述声学特征如何提取,并介绍语音识别任务中通常用作初始层的卷积神经网络架构。
随后将介绍两类 ASR 方法。第一类是编码器—解码器范式,我们将介绍基于注意力的编码器—解码器基线算法,它有时在早期实现之后被称为 Listen Attend and Spell。还将介绍更先进的编码器—解码器系统:OpenAI 的 Whisper 系统(Radford et al., 2023),以及一个采用相同架构的开放系统 OWSM(Open Whisper-style Speech Model,开放 Whisper 风格语音模型)(Peng et al., 2023)。(这些模型还有包括翻译在内的其他能力,稍后会讨论。)第二类是使用自监督语音模型(有时称为 SSL,即 self-supervised learning),如 Wav2Vec2.0 或 HuBERT。这些编码器学习语音的抽象表示,并可以与 CTC 损失函数结合进行解码,从而用于 ASR。
最后,我们将介绍评估 ASR 的标准词错误率指标。