Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

历史注记

正如本章开头所述,语音合成是语音和语言处理最早的领域之一。18 世纪出现了许多发音过程的物理模型,包括上文提到的 von Kempelen 模型,以及哥本哈根 Kratzenstein 于 1773 年利用管风琴管制作的元音模型。

20 世纪 50 年代初出现了三种早期波形合成范式:共振峰合成、发音合成和拼接合成。

共振峰合成器最初受到模仿人类语音、生成人工声谱图的尝试启发。Haskins Laboratories 的 Pattern Playback Machine 将声谱图模式绘制在移动的透明带上,并使用反射来滤波波形的谐波,从而生成声波(Cooper et al., 1951);其他非常早期的共振峰合成器包括 Lawrence(1953)和 Fant(1951)的系统。最著名的共振峰合成器可能是 Klatt 共振峰合成器及其后继系统,包括 MITalk 系统(Allen et al., 1987)和 Digital Equipment Corporation 的 DECtalk 中使用的 Klattalk 软件(Klatt, 1982)。详情见 Klatt(1975)。

第二种早期范式是拼接合成,似乎最早由 Bell Laboratories 的 Harris(1953)提出;他确实把对应音段的磁带片段拼接起来。不久之后,Peterson et al.(1958)提出了基于双音素的理论模型,包括一个数据库:每个双音素有多个副本,具有不同韵律,并标注了 F0、重音和时长等韵律特征;相邻单元之间的连接代价则基于 F0 和共振峰距离。但这种双音素合成模型直到几十年后才真正实现(Dixon and Maxey, 1968;Olive, 1977)。20 世纪 80 和 90 年代发明了单元选择合成,使用长度不规则的更大单元,并使用目标代价(Sagisaka, 1988;Sagisaka et al., 1992;Hunt and Black, 1996;Black and Taylor, 1994;Syrdal et al., 2000)。

第三种范式是发音合成器,试图把声道建模为一根开放管道,以模拟其物理过程来合成语音。代表性模型包括 Stevens et al.(1953)、Flanagan et al.(1975)和 Fant(1986)。更多细节见 Klatt(1975)和 Flanagan(1972)。

早期大多数 TTS 系统以音位作为输入;TTS 的文本分析组件稍后才发展起来,并借鉴了 NLP。事实上,第一个真正的文本到语音系统似乎是 Umeda and Teranishi 的系统(Umeda et al., 1968;Teranishi and Umeda, 1968;Umeda, 1976),其中包括一个能够分配韵律边界、重音和词重音的解析器。

编解码器的历史和神经 TTS 的现代历史:待定。