7.9 总结
本章介绍了用于语言建模的 Transformer 及其组件,以及预训练和解码过程。下面总结本章涉及的主要内容:
• Transformer 是以注意力思想为基础的网络。
• 多头注意力计算接收输入向量 ,并把来自先前词元的向量加入其中;各向量的权重取决于它们对处理当前词语的相关程度,最终得到输出 。
• Transformer 块由残差流构成:上一层的输入会沿残差流传向下一层,各个组件的输出则被加到其中。这些组件包括多头注意力层及其后的前馈层,并且每一层之前都有层归一化。多个 Transformer 块可以堆叠起来,形成更深、更强大的网络。
• Transformer 的输入由嵌入(通过嵌入矩阵计算)与位置编码相加得到,位置编码表示词元在窗口中的序列位置。
• 可以通过堆叠 Transformer 块来构建语言模型,并在顶端加入语言模型头。语言模型头把反嵌入矩阵应用于最高层的输出 H 以生成 logits,再把 logits 传入 softmax 以生成词概率。
• 基于 Transformer 的语言模型拥有宽广的上下文窗口(从数十万到数百万词元),因而可以利用极其丰富的上下文预测后续词语。
• Transformer LLM 通过从所有可能下一词的分布中采样,选择要生成的词。
• 一种常见的采样方法是温度采样,它介于两个极端之间:一个极端是贪心解码,即始终生成概率最高的词;另一个极端是随机采样,即按照概率随机生成一个词。
• 温度采样会提高高概率词语的概率、降低低概率词语的概率,然后从这个新分布中采样。
• 大语言模型通过交叉熵损失进行预训练,学习预测通常从网络抓取的、包含数万亿词元的数据集中的词语。
• 语言模型的预测准确性可以用困惑度评估,而困惑度正是交叉熵损失的指数。