语音学与语音特征提取
我们在本书中讨论的文本字符并不是随机符号。它们还是一项惊人的科学发明:一种对人类语音构成元素的理论模型。
我们已知最早的文字系统(苏美尔、中国、玛雅)主要是表意文字系统:一个符号表示一个完整的词。但从目前能够找到的最早阶段开始,一些符号也被用来表示构成词语的声音。右图中的楔形文字符号在苏美尔语中读作 ba,意为“配给”,但也可以纯粹作为声音 /ba/ 使用。我们拥有的最早汉字同样包含语音成分;这些汉字被刻在骨头上,用于占卜。

纯粹基于声音的文字系统,无论是音节文字(如日语平假名)、字母文字(如罗马字母),还是辅音文字(如闪米特文字系统),都可以追溯到这些早期的表意—音节文字系统,通常是在两种文化相遇之后发展而来。因此,阿拉伯、阿拉米、希伯来、希腊和罗马文字系统都源自一种西闪米特文字;一般认为,这种文字由西闪米特雇佣兵根据埃及象形文字的草写形式改造而来。日语音节文字则由汉字的草写形式改造而来;而汉字本身曾被用于以表音方式记录唐代传入中国的佛经梵文。
“口语由更小的语音单元组成”这一隐含思想,是语音识别(将波形转写为文本)和语音合成(将文本转换为波形)算法的基础。本章从计算角度介绍语音学:研究世界各语言所使用的语音、语音如何在人类声道中产生、如何以声学形式实现,以及如何将其数字化和处理。