Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

E.4 PCFG 的问题

概率上下文无关文法是上下文无关文法的自然扩展,但作为概率估计器有两个主要问题:

由于这些问题,概率成分句法分析模型会使用某种增强版 PCFG,或以某种方式修改基于树库的语法。下面先更详细地讨论这些问题,再介绍若干扩充方法。

E.4.1 独立性假设遗漏规则依赖

先详细看这些问题。回忆 CFG 中一个非终结符的展开独立于上下文,也就是独立于分析树中附近的其他非终结符。同样,在 PCFG 中,某条具体规则(如 NPDet NNP\to Det\ N)的概率也独立于树的其余部分。根据定义,一组独立事件的概率等于各事件概率的乘积。这两点解释了为什么 PCFG 只需把每个非终结符展开的概率相乘,就能计算一棵树的概率。

遗憾的是,CFG 的这一独立性假设会导致不良的概率估计,因为在英语中,一个节点如何展开其实可能取决于它在分析树中的位置。例如,英语中作句法主语的 NP 更可能是代词,而作句法宾语的 NP 更可能是非代词形式(如专有名词或限定词—名词序列)。Switchboard 语料库中 NP 的统计如下(Francis et al., 1999):

代词非代词
主语91%9%
宾语34%66%

PCFG 的概率无法表示这种上下文差异。考虑 NP 展开为代词或限定词加名词的两条规则。应该怎样设置概率?如果按 Switchboard 中的总体概率设置,两条规则的概率大致相等:

NPDT NN.28NPPRP.25\begin{array}{ll} NP\to DT\ NN&.28\\ NP\to PRP&.25 \end{array}

PCFG 不允许规则概率以周围上下文为条件,所以只能得到这个相等概率;它无法捕捉如下事实:在主语位置,NPPRPNP\to PRP 的概率应升到 .91;在宾语位置,NPDT NNNP\to DT\ NN 的概率应升到 .66。

如果 NP 展开为代词(如 NPPRPNP\to PRP)还是词汇性 NP(如 NPDT NNNP\to DT\ NN)的概率,能以该 NP 是主语还是宾语为条件,就可以捕捉这些依赖。E.5 节将介绍用父节点标注加入这种条件的方法。

E.4.2 对词汇依赖不敏感

PCFG 的第二类问题,是对分析树中的词语不够敏感。词在 PCFG 中确实发挥作用,因为分析概率包含给定词性时某个词的概率,例如 VsleepV\to sleepNNbookNN\to book 等规则。

但词汇信息在语法的其他位置也很有用,例如解决介词短语(PP)附着歧义。英语介词短语既能修饰名词短语,也能修饰动词短语;分析器遇到介词短语时,必须决定把它附着到树中什么位置。考虑:

(E.18) Workers dumped sacks into a bin.

图 E.5 给出该句的两棵可能分析树,左边是正确分析。图 E.6 从另一角度展示介词附着问题:解决图 E.5 的歧义,等价于决定把介词短语附着到左侧局部分析树的 NP 节点还是 VP 节点。正确分析要求 VP 附着,错误分析意味着 NP 附着。

图 E.5 介词短语附着歧义的两棵可能分析树。左树合理,into a bin 描述麻袋最终所在的位置;在右侧错误分析中,要倾倒的麻袋是那些已经“into a bin”的麻袋,无论这可能是什么意思。

PCFG 为什么不能直接处理 PP 附着歧义?图 E.5 两棵树使用的规则几乎完全相同,唯一差别是左树含有规则:

VPVBD NP PPVP\to VBD\ NP\ PP

右树则含有:

VPVBD NPNPNP PP\begin{array}{l} VP\to VBD\ NP\\ NP\to NP\ PP \end{array}

根据这些概率的设置方式,PCFG 总会偏好 NP 附着或总会偏好 VP 附着。碰巧 NP 附着在英语中稍常见,因此若在语料库上训练规则概率,我们可能总是偏好 NP 附着,导致本句分析错误。

图 E.6 介词附着问题的另一种观察方式:右边的 PP 应当附着到左侧局部分析树的 VP 还是 NP 节点?

然而,若把概率设成让本句偏好 VP 附着,又会误析下面必须采用 NP 附着的句子:

(E.19) fishermen caught tons of herring

输入句子中的什么信息告诉我们,(E.19)需要 NP 附着,而(E.18)需要 VP 附着?这些偏好来自具体动词、名词和介词。动词 dumped 与介词 into 的亲和度高于名词 sacksinto 的亲和度,所以产生 VP 附着。另一方面,在(E.19)中,tonsof 的亲和度高于 caughtof 的亲和度,所以产生 NP 附着。为了正确分析这类例子,需要用某种模型扩充 PCFG 概率,使之处理不同动词和介词的词汇依赖统计。

协调歧义是另一种依靠词汇依赖选择正确分析的情况。图 E.7 给出 Collins(1999)的例子:短语 dogs in houses and cats 的两种分析。由于 dogs 在语义上比 houses 更适合与 cats 并列(而且多数狗无法装进猫里面),分析 [dogs in [houses and cats]] 直觉上很不自然,应受到抑制。然而,图 E.7 的两种分析使用完全相同的 PCFG 规则,PCFG 因而会为它们分配相同概率。

图 E.7 协调歧义实例。左侧结构直觉上正确,但 PCFG 会给两种结构分配完全相同的概率,因为它们使用完全相同的一组规则。改编自 Collins(1999)。

总之,本节和上一节表明,概率上下文无关文法无法对重要的结构依赖和词汇依赖建模。下面两节概述扩充 PCFG、处理这两类问题的现行方法。