B.6 把朴素贝叶斯看作语言模型
上一节已经看到,朴素贝叶斯分类器可以使用任何特征:词典、URL、电子邮件地址、网络特征、短语等。但如果像 B.3 节那样,只使用单词特征,并使用文本中的全部词(而不是子集),朴素贝叶斯就与语言模型有一个重要相似之处。具体来说,朴素贝叶斯模型可以看作一组类别专属的一元语言模型,每个类别都实例化一个一元语言模型。
朴素贝叶斯模型的似然特征为每个词分配概率 P(word∣c),因而模型也会为每个句子分配概率:
P(s∣c)=i∈positions∏P(wi∣c)(B.15) 考虑一个包含正面(+)和负面(−)两类、参数如下的朴素贝叶斯模型:
| w | P(w|+) | P(w|−) |
|---|
| I | 0.1 | 0.2 |
| love | 0.1 | 0.001 |
| this | 0.01 | 0.01 |
| fun | 0.05 | 0.005 |
| film | 0.1 | 0.1 |
| … | … | … |
上面的两列分别实例化一个语言模型,都可为句子“I love this fun film”赋予概率:
P(“I love this fun film”∣+)=0.1×0.1×0.01×0.05×0.1=5×10−7 P(“I love this fun film”∣−)=0.2×0.001×0.01×0.005×0.1=1.0×10−9 在这个例子中,正面模型为该句分配了更高的概率,即 P(s∣pos)>P(s∣neg)。注意,这只是朴素贝叶斯模型的似然部分;乘以先验之后,完整的朴素贝叶斯模型完全可能作出不同的分类决定。