Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

历史说明

计算机诞生不久,MT 在 20 世纪 40 年代末便得到认真提议(Weaver, 1949/1955)。1954 年首次公开演示 MT 原型(Dostert, 1955),引起媒体轰动(Hutchins, 1997)。随后十年思想繁荣,预示了大多数后续发展;但实现受时代所限,例如磁盘问世前难以存储词典信息。

随着高质量 MT 迟迟无法实现(Bar-Hillel, 1960),人们逐渐认同新兴形式语言学与计算语言学需要更好的评估和基础研究。这一共识最终形成 1966 年著名的批判性 ALPAC 报告(Pierce et al., 1966),导致美国在 20 世纪 60 年代中期大幅削减 MT 经费。MT 研究失去学术声望后,机器翻译与计算语言学协会从名称中删除了“机器翻译”。不过,一些开发者继续坚持,产生了把天气预报从英语译成法语的 Météo(Chandioux, 1976)等早期系统,以及 Systran 等工业系统。

早期 MT 架构有三类。直接翻译逐词处理源文,用大型双语词典中负责翻译单词的小程序完成翻译。转换方法先分析输入,再用规则把源语言句法结构转换成目标语言句法结构,并生成目标句。中间语方法把源文分析成称为中间语的抽象意义表示,再据此生成目标语言。图 13.13 的 Vauquois 三角形展示了这三者:从直接方法经转换方法到中间语方法,分析与生成的深度增加,所需的特定转换知识却减少。编码器—解码器网络可视为中间语方法;注意力则整合了直接与转换方法,使解码器能直接访问词或其表示。

图 13.13 Vauquois(1968)三角形。

约 1990 年,统计方法开始应用。其基础先是加拿大议会英法双语会议记录 Hansard 等大型语料库,随后是互联网的发展。研究者证明,可用词语或句长等简单线索从双语语料中抽取对齐句对(Kay and Roscheisen 1988, 1993; Gale and Church 1991, 1993)。IBM 团队借鉴语音识别的噪声信道模型,提出两种统计 MT 范式:生成式的 IBM 模型 1~5(实现于 Candide),以及称为 MaxEnt(最大熵,逻辑回归的另一表述)的判别式方法;后者允许以判别方式组合大量特征(Brown et al. 1990, 1993; Berger et al., 1996; Och and Ney, 2002)。

世纪之交,学术 MT 大多采用生成式或判别式统计方法。基于短语对归纳翻译的短语翻译扩展了生成方法。BLEU(Papineni et al., 2002)出现后,判别式对数线性表述可用最小错误率训练(MERT)直接优化 BLEU 等指标;GIZA、Moses 等工具包得到广泛使用。同期还有基于句法结构(第 19 章)的转换语法/同步语法,以平行句法树表示不同语言句对,并通过树重排翻译;代表包括反转转换语法(Wu, 1996)和同步上下文无关文法(Chiang, 2005)。

神经网络曾多次用于 MT 的不同方面。现代神经编码器—解码器由 Kalchbrenner and Blunsom(2013)开创,他们使用 CNN 编码器和 RNN 解码器;Bahdanau et al.(2015)首先将其用于 MT;Vaswani et al.(2017)提出 Transformer 编码器—解码器(见第 7 章历史说明)。

MT 评估研究也起步很早。Miller and Beebe-Center(1956)借鉴心理语言学,提出用完形填空、香农任务衡量可理解性,并使用与人工译文的编辑距离——这是现代重叠型自动指标的基本直觉。ALPAC 报告中 John Carroll 的研究提出分别衡量忠实性与可理解性,并让评估者以 9 点量表主观评分。早期工作多聚焦 BLEU、NIST、TER、准确率与召回率、METEOR 等词语重叠指标;chrF 等字符 n 元重叠方法较晚出现。较新研究再次呼应 ALPAC,强调严谨统计方法和人工评估的重要性(Kocmi et al., 2021; Marie et al., 2021)。

MT 早期史见 Hutchins(1986, 1997);Nirenburg et al.(2002)收录了早期文献。语言类型学入门见 Croft(1990)或 Comrie(1989)。