Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

第三卷 标注语言结构

本书第二卷讨论检测语言结构的任务。在 NLP 的早期历史中,这些结构是更深层语言处理的中间步骤。在现代 NLP 中,我们通常不会在第一部分介绍的大型语言模型内部显式使用句法树或其他结构。

相反,语言结构承担了一些新的角色。其中一个重要角色是可解释性:为神经网络提供有用的解释视角。知道某一层或某个神经元可能正在计算与某类结构相关的内容,有助于我们打开“黑箱”,理解语言模型各组件正在做什么。

语言结构的第二个重要角色,是作为文本社会科学研究的实用工具:知道哪个形容词修饰哪个名词,或某个隐含隐喻是否正在使用,对于衡量群体或个人的态度可能很重要。详细的语义结构有助于在法律合同中寻找具有特定意义的条款。词义标签可以避免语料库研究测量错误词义的事实。关系结构则可用于帮助从文本构建知识库。

最后,计算语言结构还是回答语言本身问题的重要工具;这一研究领域称为计算语言学,有时会与自然语言处理区分开来。要回答语言如何随时间变化或如何在不同个体之间变化等语言学问题,我们需要能够自动解析不同时期的完整文档。要理解人类如何学习或处理某些语言结构,也必须能够为任意文本自动标注这些结构。

在研究语言结构时,我们从计算语言学最古老的任务之一开始:提取句法结构,并介绍两组解析算法,即提取包括成分句法和依存句法在内的句法结构。随后介绍与意义相关的多种结构,包括语义角色、词义、实体关系和事件。最后讨论往往与更长文本的话语和意义相关的语言结构,包括共指和话语连贯性。在每种情况下,我们都会给出自动标注相关结构的算法。