Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

13.5 低资源场景下的翻译

某些语言,尤其是英语,拥有丰富的在线资源以及英语与许多语言之间的大型平行语料库。但世界上绝大多数语言没有大量平行训练文本。如何为低资源语言取得优质翻译,是持续研究的重要问题;即使是高资源语言,若要翻译到双语文本很少的特定体裁等低资源领域,也会面临资源问题。

这里简要介绍两种应对数据稀疏的常用方法:一般统计技术“数据增强”的特例——回译,以及多语言模型;同时讨论若干社会技术问题。

13.5.1 数据增强

数据增强(data augmentation)是处理训练数据不足的统计技术:利用当前自然数据生成新的合成数据并加入训练集。

机器翻译最常见的数据增强技术称为回译(backtranslation)。其依据是:特定语言或领域的平行语料可能有限,但通常能找到较大的(或至少更大的)单语语料库,将其加入现有较小平行语料。该算法利用目标语言单语语料创建合成双语文本。

给定源/目标语言的小型双语文本和目标语言单语数据,回译旨在改善源到目标的 MT。首先用双语文本训练反方向(目标到源)的 MT 系统,再用它把目标语言单语数据译成源语言。现在可将这一合成双语文本(自然目标句与 MT 生成源句的对齐)加入训练数据,并重新训练源到目标模型。例如,要从纳瓦霍语译成英语,但只有少量纳瓦霍语—英语双语文本,同时容易找到大量英语单语数据;可先构建英语到纳瓦霍语的 MT 引擎,把英语单语文本译成纳瓦霍语,再将合成的纳瓦霍语/英语双语文本加入训练数据。

回译有多种参数,包括如何生成回译数据:解码器可进行贪心推理、束搜索或第 7 章的温度采样;还可调整回译数据与自然双语文本的比例,或上采样双语文本(多次加入每个句子)。回译的效果通常出人意料地好:有估计认为,在回译文本上训练可获得使用等量自然双语文本所带来收益的约三分之二(Edunov et al., 2018)。

13.5.2 多语言模型

此前模型都是双语翻译:一种源语言对应一种目标语言。我们也可以构建多语言翻译器,以许多不同语言对的平行句训练系统。为告诉系统从哪种语言译到哪种语言,要在编码器中加入指定源语言的特殊词元 lsl_s,在解码器中加入指定目标语言的特殊词元 ltl_t,将式 13.9 更新为:

h=encoder(x,ls)(13.18)\mathbf {h} = \operatorname{encoder} (x, l _ {s})\tag{13.18}
yi+1=decoder(h,lt,y1,,yi)i[1,,m](13.19)y _ {i + 1} = \operatorname{decoder} (\mathbf {h}, l _ {t}, y _ {1}, \dots , y _ {i}) \quad \forall i \in [ 1, \dots , m ]\tag{13.19}

多语言模型的一个优点是,可以借助训练数据中资源更多的相似语言来改善低资源语言翻译。例如,我们可能不知道某个加利西亚语词的含义,但它也出现在相似且资源更丰富的西班牙语中。

13.5.3 社会技术问题

低资源语言面临的许多问题超出了纯技术范畴。对于低资源语言,特别是低收入国家的语言,母语者往往没有参与内容选择与整理,没有担任语言技术人员,也没有参与性能评估(Nekoto et al., 2020)。一项著名研究人工审计了大量平行语料库和主要多语言数据集,发现许多语料库中合格句子不足 50%;大量数据是带网页模板的重复句或错误译文,表明母语者可能未充分参与数据过程(Kreutzer et al., 2022)。

许多 MT 方法倾向聚焦语言对中有一种是英语的情况(Anastasopoulos and Neubig, 2020),这涉及资源分配。过去大多数大型多语言系统都用英语作为其中一种语言的双语文本训练;Fan et al.(2021)、Costa-jussà et al.(2022)等较新的大型企业系统和 Schwenk et al.(2021)等数据集,则尝试处理多达 200 种语言,并在更多语言对之间直接建立双语文本,而不只是通过英语中转。

在较小规模上,Nekoto et al.(2020)提出参与式设计流程,鼓励会说低资源语言的内容创作者、整理者和语言技术人员参与 MT 算法开发。他们提供在线小组、指导和基础设施,并报告了为非洲低资源语言开发 MT 算法的案例。其结论之一是通过译后编辑而非直接评分开展 MT 评估:让标注者修订 MT 输出,再测量输出与修订版的距离。这既更容易培训评估者,也更容易测量 MT 输出中的真实错误,而不会把语言变体差异误判为错误(Bentivogli et al., 2018)。