Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

B.10 避免分类造成伤害

必须避免分类器可能造成的伤害。这些风险既存在于朴素贝叶斯分类器中,也存在于后续章节介绍的其他分类算法中。

一类伤害是表征性伤害(representational harms;Crawford, 2017;Blodgett et al., 2020),即系统贬损某个社会群体所造成的伤害,例如延续针对该群体的负面刻板印象。Kiritchenko and Mohammad(2018)考察了 200 个情感分析系统在成对句子上的表现。每对句子完全相同,唯一差别是一个包含常见非裔美国人名字(如 Shaniqua),另一个包含常见欧裔美国人名字(如 Stephanie);这些名字取自第 5 章讨论的 Caliskan et al.(2017)研究。他们发现,多数系统会给含非裔美国人名字的句子分配较低情感值和更多负面情绪,从而反映并延续了把非裔美国人与负面情绪联系起来的刻板印象(Popp et al., 2003)。

在其他任务中,分类器可能同时造成表征性伤害和其他伤害,例如噤声。一个重要的文本分类任务——毒性检测——要检测仇恨言论、辱骂、骚扰及其他有毒语言。虽然这类分类器的目标是减少社会伤害,但它们本身也可能造成伤害。研究者已经证明,一些广泛使用的毒性分类器会把本来无毒、只是提到 women(Park et al., 2018)、blind people(Hutchinson et al., 2020)或 gay people(Dixon et al., 2018;Dias Oliva et al., 2021)等身份的句子错误标为有毒;它们也可能仅仅因为句子使用了非裔美国人白话英语等变体的典型语言特征,就将其误判(Sap et al., 2019;Davidson et al., 2019)。这类假正例可能使这些群体所作或关于这些群体的讨论遭到压制。

这些模型问题可能由训练数据中的偏差或其他缺陷引起;总体而言,机器学习系统会复制甚至放大训练数据中的偏差。但问题也可能来自标签(例如人工标注者的偏差)、使用的资源(如词典或预训练嵌入等模型组件),甚至模型架构本身(如模型被训练去优化什么)。缓解这些偏差——例如仔细考虑训练数据来源——是一个重要研究领域,但目前还没有通用解决方案。因此,引入任何 NLP 模型时,都必须研究这些因素并明确披露。

一种做法是为模型的每个版本发布模型卡(model card;Mitchell et al., 2019)。模型卡用如下信息记录机器学习模型: