Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

4.12 避免分类造成伤害

避免分类器可能造成的伤害十分重要。其中一类是表征性伤害(representational harms;Crawford, 2017;Blodgett et al., 2020),即系统贬低某个社会群体、例如延续对该群体的负面刻板印象而造成的伤害。

例如,Kiritchenko and Mohammad(2018)考察了 200 个情感分析系统在成对句子上的表现。每对句子除名字外完全相同:一个包含常见的非裔美国人名字(如 Shaniqua),另一个包含常见的欧裔美国人名字(如 Stephanie);名字取自第 5 章将讨论的 Caliskan et al.(2017)。研究发现,多数系统给含非裔美国人名字的句子分配了更低的情感得分和更多负面情绪,反映并延续了把非裔美国人与负面情绪相联系的刻板印象(Popp et al., 2003)。

在其他任务中,分类器既可能造成表征性伤害,也可能造成压制言论等其他伤害。一个重要的文本分类任务是毒性检测(toxicity detection),用于识别仇恨言论、辱骂、骚扰及其他有毒语言。这类分类器旨在减少社会伤害,但自身也可能造成伤害。研究表明,一些广泛使用的毒性分类器会把本来无毒、只是提到女性(Park et al., 2018)、盲人(Hutchinson et al., 2020)或同性恋群体(Dixon et al., 2018;Dias Oliva et al., 2021)的句子误判为有毒;仅仅使用非裔美国人白话英语等语言变体的典型特征,也可能触发误判(Sap et al., 2019;Davidson et al., 2019)。这些假正例会压制相关群体自身或关于这些群体的讨论。

模型问题可能源于训练数据中的偏差或其他缺陷;机器学习系统通常会复制、甚至放大训练数据中的偏差。问题也可能来自标签(如人工标注者的偏差)、所用资源(如词典或预训练嵌入等模型组件),甚至模型架构(如模型被训练去优化的目标)。如何缓解这些偏差——例如谨慎考虑训练数据来源——是重要研究领域,但目前尚无通用解决方案。

因此,引入任何 NLP 模型时,都应研究并明确披露这些因素。一种做法是为模型的每个版本发布模型卡(model card;Mitchell et al., 2019),记录以下信息: