5.9 评估向量模型
向量模型最重要的评估方法是面向任务的外在评估(extrinsic evaluation):把向量用于某项 NLP 任务,观察它相对于其他模型是否改善性能。
不过,内在评估(intrinsic evaluation)也很有用。最常见方法是在相似度任务上测试:计算算法给出的词相似度分数与人工评分之间的相关性。WordSim-353(Finkelstein et al., 2002)包含 353 对名词的 0—10 分人工评分,例如 plane/car 的平均分为 5.77。SimLex-999(Hill et al., 2015)更复杂,专门量化相似关系(cup/mug)而非一般相关关系(cup/coffee),并包含具体和抽象的形容词、名词与动词词对。
TOEFL 数据集包含 80 道题,每题给一个目标词和 4 个选项,要求选择正确同义词。例如:Levied 最接近 imposed、believed、requested、correlated 中的哪一个?(Landauer and Dumais, 1997)。这些数据集都脱离语境呈现词语。
包含语境的内在相似度任务稍为真实。斯坦福上下文词相似度(Stanford Contextual Word Similarity, SCWS;Huang et al., 2012)和 WiC(Word-in-Context;Pilehvar and Camacho-Collados, 2019)提供了更丰富的评估情境。SCWS 包含 2,003 对置于句子语境中的词及人工判断;WiC 把目标词置于两个句子语境中,二者使用相同或不同词义,详见附录 I。语义文本相似度(semantic textual similarity)任务则评估句子级相似度算法,包含成对句子及其人工相似度分数(Agirre et al., 2012, 2015)。
另一个评估任务是第 143 页讨论的类比题。系统给定 、、,要解出 中的 (Turney and Littman, 2005)。相关数据集(Mikolov et al., 2013a, 2013c;Gladkova et al., 2016)覆盖形态关系(city:cities::child:children)、词典关系(leg:table::spout:teapot)和百科关系(Beijing:China::Dublin:Ireland);部分数据取自含 79 种关系的 SemEval-2012 Task 2(Jurgens et al., 2012)。
所有嵌入算法都有内在变异性。例如,由于随机初始化和随机负采样,即使用相同数据集,word2vec 也可能产生不同结果;语料集合中的单篇文档还可能强烈影响最终嵌入(Tian et al., 2016;Hellrich and Hahn, 2016;Antoniak and Mimno, 2018)。因此,使用嵌入研究特定语料中的词关联时,最佳实践是对文档进行自助采样,训练多组嵌入并对结果取平均(Antoniak and Mimno, 2018)。