16.1 自动语音识别任务
在介绍 ASR 算法之前,先看看 ASR 任务本身有哪些变化。一个变化维度是词汇量。有些 ASR 任务早已可以以极高准确率解决,例如词汇量只有 2 个词(yes 与 no)的任务,或词汇量为 11 的数字识别任务(识别包含 zero 到 nine 以及 oh 的数字序列)。而准确转写视频或人类对话等开放式任务的词汇量可能达到 60,000 甚至更多,因此困难得多。
第二个变化维度是说话人正在与谁交流。人对机器说话(无论是口述还是与对话系统交谈)比人与人说话更容易识别。朗读语音也相对容易识别,例如人在有声书中朗读。两个人相互交谈的会话语音则最难识别,例如转写商务会议。似乎当人对机器说话,或在没有听众的情况下朗读时,他们会相当程度地简化语音,说得更慢、更清楚。
第三个变化维度是通道和噪声。如果语音在安静房间中用头戴式麦克风录制,就比用远距离麦克风在嘈杂街道上录制,或在车窗打开的汽车中录制,更容易识别。
最后一个变化维度是口音或说话人类别特征。如果说话人使用的方言或变体与系统训练所用的相同,语音就更容易识别。如果系统只在标准方言说话人或只在成年说话人的数据上训练,那么地区或族群方言说话人以及儿童的语音可能很难识别。
许多公开语料库包含人工创建的转写,人们使用它们构建 ASR 测试集和训练集,以研究上述变化。由于你会在文献中遇到这些语料库,这里介绍其中一些。LibriSpeech 是一个大型开源朗读语音数据集,采样率为 16 kHz,包含 LibriVox 项目超过 1,000 小时的有声书;LibriVox 志愿者朗读并录制版权已过期的书籍(Panayotov et al., 2015)。该语料库具有句子级对齐的转写,被划分为较容易的“clean”部分和较难的“other”部分;clean 部分录音质量更高,口音也更接近美式英语。语料库首次发布时,研究者使用一个在《华尔街日报》朗读语音上训练的语音识别器处理所有音频,根据金标准转写计算每个说话人的词错误率(WER,下面将正式定义),大致将说话人分成两半:低 WER 说话人的录音称为 “clean”,高 WER 说话人的录音称为 “other”。
Switchboard 语料库收集于 20 世纪 90 年代初,内容是陌生人之间由提示引导的电话对话;包含 2,430 段平均 6 分钟的对话,共 240 小时 8 kHz 语音和约 300 万个词(Godfrey et al., 1992)。Switchboard 的独特优势是拥有大量辅助性人工语言标注,包括句法分析、对话行为标签、语音和韵律标注,以及话语和信息结构标注。CALLHOME 语料库收集于 20 世纪 90 年代末,包含 120 段未经脚本安排、每段 30 分钟的电话对话;说话人是以英语为母语的人,通常是亲密朋友或家人(Canavan et al., 1997)。
许多语料库试图纳入更自然的输入。CHiME Challenge 是一系列处理 ASR 鲁棒性问题的困难共享任务及其语料库。例如,CHiME 6 任务是在真实家庭环境(具体是晚宴)中识别会话语音。该语料库包含真实住宅中 20 场不同晚宴的录音,每场有 4 位参与者,分布在 3 个位置(厨房、用餐区、客厅),并使用远距离麦克风录制。
AMI Meeting Corpus 包含 100 小时录制的群组会议(有些是自然会议,有些是专门组织的会议),带有人工转写和一些其他人工标签(Renals et al., 2007)。CORAAL 收集了 150 多次非裔美国人说话人的社会语言学访谈,目标是研究非裔美国英语(AAE)以及非裔美国社区和其他群体使用的多种语言变体(Kendall and Farrington, 2020)。访谈经过匿名化,并具有话语级对齐的转写。
其他语言也有各种语料库。例如,中文 HKUST 普通话电话语音语料库包含 1,206 段已转写的 10 分钟电话对话,参与者是中国各地的普通话说话人,包括朋友之间和陌生人之间的对话(Liu et al., 2006)。AISHELL-1 语料库包含 170 小时普通话朗读语音,句子来自不同领域,由主要来自中国北方的不同说话人朗读(Bu et al., 2017)。
最后,还有许多多语种语料库。Common Voice(Ardila et al., 2020)是一个免费提供的众包语料库,由转写的朗读语音组成,以 MPEG-3 格式存储,专为 ASR 设计。众包志愿者录制自己朗读脚本化语音的内容,这些脚本通常取自维基百科文章,录音随后由其他贡献者核验。截至本章写作时,Common Voice 包含 133 种语言、33,150 小时的语音。FLEURS(Conneau et al., 2023)是一个平行语音数据集,建立在 MT 基准 FLoRes-101(Goyal et al., 2022)之上;该基准包含从英文维基百科提取、再由人工翻译成另外 101 种语言的 3,001 个句子。在 102 种语言各自的 2,009 个句子子集上,FLEURS 录制了 3 位不同母语说话人朗读句子的语音,每种语言约 12 小时。
图 16.1 展示了截至本章写作时,一些任务上大致处于当时最先进水平的系统所达到的错误词百分比(词错误率 WER,定义见第 378 页)。注意,英语朗读语音(如 LibriSpeech clean 有声书语料库)的错误率约为 2%;英语朗读语音的转写非常准确。相比之下,人类之间对话的转写错误率更高:Switchboard、CALLHOME 或 AMI 会议语料库的错误率为 5.8%–11%。非裔美国英语等语言变体的错误率更高;4 人晚宴语音这类困难会话任务的错误率还会更高,最高可达 25.5%。普通话自然会话的字符错误率(CER)也高于普通话朗读语音。低资源语言的错误率甚至更高;这里列出了一些示例。
| 英语任务 | WER% |
| LibriSpeech 有声书 960 小时 clean | 1.4 |
| LibriSpeech 有声书 960 小时 other | 2.6 |
| Switchboard 陌生人电话对话 | 5.8 |
| CALLHOME 家庭成员电话对话 | 11 |
| AMI 会议 | 11 |
| CORAAL 社会语言学访谈(AAE) | 16.2 |
| CHiME6 远距离麦克风录制的晚宴 | 25.5 |
| 其他语言示例任务 | WER% |
| Common Voice 15 越南语 | 39.8 |
| Common Voice 15 斯瓦希里语 | 51.2 |
| FLEURS 孟加拉语 | 50 |
| 中文(普通话)任务 | CER% |
| AISHELL-1 普通话朗读语音语料库 | 3.9 |
| HKUST 普通话电话对话 | 18.5 |
图 16.1 截至 2023–2024 年左右,各类美式英语和其他语言识别任务上 ASR 的大致词错误率(WER = 误识别词占比),以及两个中文识别任务的字符错误率(CER)。