I.7 词义归纳
构建大型语料库并为其中每个词标注词义既昂贵又困难。因此,词义消歧的无监督方法是一个重要方向,通常称为词义归纳(word sense induction,WSI)。无监督方法不使用人类定义的词义;相反,每个词的“义项”集合由训练集中该词的各个实例自动创建。
大多数词义归纳算法沿袭 Schütze 的早期研究(Schütze, 1992;Schütze, 1998),对词嵌入进行某种聚类。训练包含三个步骤:
对语料库中词 的每个词元 ,计算上下文向量 。
使用聚类算法,把这些词元上下文向量 聚成预先指定数量的组或簇。每个簇定义 的一个义项。
计算每个簇的向量质心。每个向量质心 都是表示 相应义项的义项向量。
因为这是无监督算法,我们没有这些 的“义项”的名称,只把它们称为 的第 个义项。
要对 的某个特定词元 进行消歧,同样分为三个步骤:
为 计算上下文向量 。
取回 的所有义项向量 。
把 分配给向量 所表示的义项,其中 是与 最接近的义项向量。
我们所需要的只是一种聚类算法和一种向量间的距离度量。聚类是一个已经得到充分研究的问题;对于由数值向量构成的输入,有大量标准算法可用(Duda and Hart, 1973)。语言应用中经常使用的一种技术称为凝聚式聚类(agglomerative clustering)。在这种技术中,最初把 个训练实例分别分配到各自的簇。然后采用自底向上的方式,不断合并最相似的两个簇以形成新簇。该过程持续进行,直至达到指定的簇数,或者簇的某种全局质量度量达到要求。当训练实例数量使这种方法代价过高时,可以对原始训练集进行随机抽样,以获得相近的结果。
怎样评估无监督词义消歧方法?和往常一样,最好的方式是在某个端到端系统中进行外在评估;SemEval 竞赛曾使用的一个例子,是改进搜索结果的聚类与多样化(Navigli and Vannella, 2013)。内在评估需要把自动得到的义项类别映射到人工标注的金标准集合,这样才能把人工标注测试集与无监督分类器标注的集合进行比较。研究者已经测试过多种此类指标,例如 SemEval 任务中所用的指标(Manandhar et al., 2010;Navigli and Vannella, 2013;Jurgens and Klapaftis, 2013),包括簇重合指标,以及把每个义项簇映射到预定义义项的方法——选择在某个训练集中与该簇重合最多的义项。不过,公平地说,这项任务至今还没有形成标准评估指标。