Kneser–Ney 折扣(Kneser and Ney, 1995)在绝对折扣的基础上,以一种更精细的方式处理低阶一元语法分布。假设我们正在对二元语法模型和一元语法模型做插值,请考虑预测下面句子的下一个词:
I can’t see without my reading
这里接在后面的词显然更可能是 glasses,而不是 Kong,所以我们希望一元语法模型更偏好 glasses。但事实上,因为 Hong Kong 是一个非常常见的词组,Kong 的整体频率反而更高。标准一元语法模型会给 Kong 分配比 glasses 更高的概率。我们希望捕捉这样的直觉:尽管 Kong 很常见,它却主要只在 Hong Kong 这个短语中出现,也就是主要出现在 Hong 之后;而 glasses 的分布范围要广得多。
换言之,普通的 P(w) 回答“w 有多大可能出现?”;我们想建立一个可称为 PCONTINUATION 的一元语法模型,回答“w 作为一个新续接词出现的可能性有多大?”应当如何估计词 w 在一个此前未见的上下文中作为新续接出现的概率?Kneser–Ney 方法的直觉是:以 w 曾经出现过的不同上下文数量为依据,也就是以它所补全的二元语法类型数量来估计 PCONTINUATION。每一种二元语法类型第一次出现时,都是一次新续接。我们的假设是:过去曾在更多上下文中出现的词,将来也更有可能出现在某个新上下文中。词 w 作为新续接出现的次数可以表示为:
Chen, S. F. and J. Goodman. 1998. An empirical study of smoothing techniques for language modeling. Technical Report TR-10-98, Computer Science Group, Harvard University.
Church, K. W. and W. A. Gale. 1991. A comparison of the enhanced Good-Turing and deleted estimation methods for estimating probabilities of English bigrams. Computer Speech and Language, 5:19–54.
Heafield, K., I. Pouzyrevsky, J. H. Clark, and P. Koehn. 2013. Scalable modified Kneser-Ney language model estimation. ACL.
Kneser, R. and H. Ney. 1995. Improved backing-off for M gram language modeling. ICASSP, volume 1.
Ney, H., U. Essen, and R. Kneser. 1994. On structuring probabilistic dependencies in stochastic language modelling. Computer Speech and Language, 8:1–38.