Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

9.6 总结

本章介绍了双向编码器和掩码语言模型。下面总结本章涉及的主要内容:

• 语言模型有三种主要架构:编码器(本章)、解码器和编码器—解码器。第 1 章和第 7 章介绍了解码器模型,第 13 章将介绍编码器—解码器。

• 双向编码器可以利用完整输入上下文,生成输入嵌入的上下文化表示。

• 基于双向编码器的预训练语言模型,可以使用掩码语言模型目标来学习;模型接受训练,根据输入猜测缺失信息。

• 在特定词元列中,每个 Transformer 块或组件的向量输出都是上下文嵌入,表示词元在上下文中意义的某个方面。

• 词义是一个词之意义某个方面的离散表示。上下文嵌入提供了一种连续的高维意义模型,它比完全离散的词义更加丰富。

• 上下文嵌入之间的余弦可以作为一种方式,对两个词在上下文中的相似度进行建模,不过首先需要对嵌入进行一些变换。

• 可以在预训练模型的输出顶端添加轻量级分类器层,从而针对特定应用微调预训练语言模型。

• 这些应用可以包括情感分析等序列分类任务、自然语言推理等序列对分类任务,以及命名实体识别等序列标注任务。