5.10 小结
在向量语义学中,词被建模为向量,即高维空间中的点,也称嵌入。本章聚焦静态嵌入,其中每个词映射到固定嵌入。
向量语义模型分为稀疏和稠密两类。稀疏模型的每个维度对应词表 中的一个词,单元格是共现计数的函数。词—语境矩阵(或词项—词项矩阵)为词表中每个目标词设一行,为每个语境词项设一列。
稠密向量模型通常有 50—1000 个维度。skip-gram 等 word2vec 算法是计算稠密嵌入的常用方法。skip-gram 训练逻辑回归分类器,计算两个词“是否可能在文本中邻近出现”的概率;该概率由两个词嵌入的点积计算。
skip-gram 使用随机梯度下降训练分类器,使嵌入与邻近词嵌入的点积较高,与噪声词嵌入的点积较低。
其他重要嵌入算法包括 GloVe,它以词共现概率之比为基础。
无论使用稀疏还是稠密向量,词和文档的相似度都由向量点积的某种函数计算;其中最常用的是两向量的余弦,即归一化点积。