Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

16.7 小结

本章介绍了自动语音识别(ASR)的基本算法。

• 语音识别(或语音转文本)的任务是把声学波形映射为字素序列。

• 语音识别器的输入是一系列声波;这些声波经过采样、量化,并转换为对数 Mel 频谱等频谱表示。

• 语音识别的两种常见范式是带注意力的编码器—解码器模型,以及基于 CTC 损失函数的模型。基于注意力的模型准确率更高,但基于 CTC 的模型更容易适配流式识别:在线输出字素,而不是等待声学输入结束。

• ASR 使用词错误率进行评估;词错误率是假设转写与金标准转写之间的编辑距离。