4.13 解释模型
我们常常不只想知道观测的正确类别,还想知道分类器为何作出某个决定,即希望决策具有可解释性(interpretability)。可解释性很难严格定义,但核心思想是:作为人类,我们应当知道算法为何得出其结论。
逻辑回归的特征往往由人设计,因此理解分类器决策的一种方式,是考察每个特征在决策中的作用。逻辑回归可与统计检验(如似然比检验或 Wald 检验)结合;检查某个特征在这些检验中是否显著,或查看其权重 的大小,都有助于解释分类器为何作出某个判断。这对于构建透明模型极其重要。
除了作为分类器,逻辑回归在 NLP 及许多其他领域也被广泛用作分析工具,以检验各种解释变量(特征)的影响。例如,在文本分类中,我们可能想知道逻辑否定词(no、not、never)是否更容易与负面情感相关,或者电影的负面评论是否更常谈论摄影。但进行此类分析时,必须控制潜在的混杂因素(confounds),即其他可能影响情感的因素,如电影类型、制作年份或评论长度。
我们也可能研究由 NLP 提取的语言特征与非语言结果(如再次入院、政治结果或产品销量)之间的关系,同时需要控制病人年龄、投票所在县或产品品牌等混杂因素。在这些情形下,逻辑回归可以检验:排除其他特征的影响后,某一特征是否仍与某一结果相关。