掩码语言模型
Larvatus prodeo[戴着面具,我前行]
Descartes
前两章介绍了 Transformer,并说明如何把 Transformer 语言模型预训练成因果语言模型或从左到右语言模型。本章将介绍预训练语言模型的第二种范式——双向变换器编码器(bidirectional transformer encoder),以及其中使用最广泛的 BERT 模型家族(Devlin et al., 2019)。这种模型通过 掩码语言建模(masked language modeling)进行训练:它不预测后面的词,而是遮住中间的一个词,要求模型根据两侧的词猜出被遮住的词。因此,该方法允许模型同时看到右侧和左侧上下文。
上一章还介绍了微调。本章将描述一种新的微调方式:取得这些预训练模型学到的 Transformer 网络,在网络最高层之后添加神经网络分类器,再使用额外的有标注数据训练它,以执行命名实体标注或自然语言推理等下游任务。其直觉仍与前文相同:预训练阶段学到的语言模型能够形成丰富的词义表示,使模型更容易学会(即“微调到”)下游语言理解任务的要求。预训练—微调范式的这一方面,是机器学习中所谓 迁移学习(transfer learning)的一个实例:先从一个任务或领域中获取知识,再把这些知识应用(迁移)于解决新任务。