3.8 小结
本章通过经典的 n 元模型介绍语言建模;借助这一模型,我们引入了语言建模中的许多基本概念。
语言模型可以为句子或其他词/词元序列分配概率,并根据先前的词或词元预测后续词或词元。
n 元语法也许是最简单的语言模型。它是一种 Markov 模型,根据先前词语的固定窗口估计下一词。训练 n 元模型时,可以统计训练语料库中的计数并进行归一化,即使用最大似然估计。
可以使用困惑度在测试集上评估 n 元语言模型。
测试集相对于某个语言模型的困惑度,是测试集概率的函数:模型所分配之测试集概率的倒数,再按长度归一化。
从语言模型中采样,是按照模型定义的句子可能性选择并生成句子。
平滑算法可以估计训练时未见事件的概率。n 元语法常见的平滑方法包括加一平滑,或通过插值利用低阶 n 元计数。