E.4 PCFG 的问题
概率上下文无关文法是上下文无关文法的自然扩展,但作为概率估计器有两个主要问题:
不良的独立性假设:CFG 规则施加的独立性假设会使模型不能良好刻画分析树中跨节点的结构依赖。
缺少词汇条件化:CFG 规则不能对具体词语的句法事实建模,因而会在次范畴化歧义、介词附着和协调结构歧义上产生问题。
由于这些问题,概率成分句法分析模型会使用某种增强版 PCFG,或以某种方式修改基于树库的语法。下面先更详细地讨论这些问题,再介绍若干扩充方法。
E.4.1 独立性假设遗漏规则依赖¶
先详细看这些问题。回忆 CFG 中一个非终结符的展开独立于上下文,也就是独立于分析树中附近的其他非终结符。同样,在 PCFG 中,某条具体规则(如 )的概率也独立于树的其余部分。根据定义,一组独立事件的概率等于各事件概率的乘积。这两点解释了为什么 PCFG 只需把每个非终结符展开的概率相乘,就能计算一棵树的概率。
遗憾的是,CFG 的这一独立性假设会导致不良的概率估计,因为在英语中,一个节点如何展开其实可能取决于它在分析树中的位置。例如,英语中作句法主语的 NP 更可能是代词,而作句法宾语的 NP 更可能是非代词形式(如专有名词或限定词—名词序列)。Switchboard 语料库中 NP 的统计如下(Francis et al., 1999):
| 代词 | 非代词 | |
|---|---|---|
| 主语 | 91% | 9% |
| 宾语 | 34% | 66% |
PCFG 的概率无法表示这种上下文差异。考虑 NP 展开为代词或限定词加名词的两条规则。应该怎样设置概率?如果按 Switchboard 中的总体概率设置,两条规则的概率大致相等:
PCFG 不允许规则概率以周围上下文为条件,所以只能得到这个相等概率;它无法捕捉如下事实:在主语位置, 的概率应升到 .91;在宾语位置, 的概率应升到 .66。
如果 NP 展开为代词(如 )还是词汇性 NP(如 )的概率,能以该 NP 是主语还是宾语为条件,就可以捕捉这些依赖。E.5 节将介绍用父节点标注加入这种条件的方法。
E.4.2 对词汇依赖不敏感¶
PCFG 的第二类问题,是对分析树中的词语不够敏感。词在 PCFG 中确实发挥作用,因为分析概率包含给定词性时某个词的概率,例如 、 等规则。
但词汇信息在语法的其他位置也很有用,例如解决介词短语(PP)附着歧义。英语介词短语既能修饰名词短语,也能修饰动词短语;分析器遇到介词短语时,必须决定把它附着到树中什么位置。考虑:
(E.18) Workers dumped sacks into a bin.
图 E.5 给出该句的两棵可能分析树,左边是正确分析。图 E.6 从另一角度展示介词附着问题:解决图 E.5 的歧义,等价于决定把介词短语附着到左侧局部分析树的 NP 节点还是 VP 节点。正确分析要求 VP 附着,错误分析意味着 NP 附着。

图 E.5 介词短语附着歧义的两棵可能分析树。左树合理,into a bin 描述麻袋最终所在的位置;在右侧错误分析中,要倾倒的麻袋是那些已经“into a bin”的麻袋,无论这可能是什么意思。
PCFG 为什么不能直接处理 PP 附着歧义?图 E.5 两棵树使用的规则几乎完全相同,唯一差别是左树含有规则:
右树则含有:
根据这些概率的设置方式,PCFG 总会偏好 NP 附着或总会偏好 VP 附着。碰巧 NP 附着在英语中稍常见,因此若在语料库上训练规则概率,我们可能总是偏好 NP 附着,导致本句分析错误。

图 E.6 介词附着问题的另一种观察方式:右边的 PP 应当附着到左侧局部分析树的 VP 还是 NP 节点?
然而,若把概率设成让本句偏好 VP 附着,又会误析下面必须采用 NP 附着的句子:
(E.19) fishermen caught tons of herring
输入句子中的什么信息告诉我们,(E.19)需要 NP 附着,而(E.18)需要 VP 附着?这些偏好来自具体动词、名词和介词。动词 dumped 与介词 into 的亲和度高于名词 sacks 与 into 的亲和度,所以产生 VP 附着。另一方面,在(E.19)中,tons 与 of 的亲和度高于 caught 与 of 的亲和度,所以产生 NP 附着。为了正确分析这类例子,需要用某种模型扩充 PCFG 概率,使之处理不同动词和介词的词汇依赖统计。
协调歧义是另一种依靠词汇依赖选择正确分析的情况。图 E.7 给出 Collins(1999)的例子:短语 dogs in houses and cats 的两种分析。由于 dogs 在语义上比 houses 更适合与 cats 并列(而且多数狗无法装进猫里面),分析 [dogs in [houses and cats]] 直觉上很不自然,应受到抑制。然而,图 E.7 的两种分析使用完全相同的 PCFG 规则,PCFG 因而会为它们分配相同概率。

图 E.7 协调歧义实例。左侧结构直觉上正确,但 PCFG 会给两种结构分配完全相同的概率,因为它们使用完全相同的一组规则。改编自 Collins(1999)。
总之,本节和上一节表明,概率上下文无关文法无法对重要的结构依赖和词汇依赖建模。下面两节概述扩充 PCFG、处理这两类问题的现行方法。