历史说明
根据 Percival(1976)的考证,把句子分解为成分层级的思想,最早见于开创性心理学家 Wilhelm Wundt 的《民族心理学》(Völkerpsychologie;Wundt, 1900):
...den sprachlichen Ausdruck für die willkürliche Gliederung einer Gesamtvorstellung in ihre in logische Beziehung zueinander gesetzten Bestandteile
[把一个整体观念任意划分为各组成部分,并把这些部分置于彼此的逻辑关系中,这一过程的语言表达]
Leonard Bloomfield 在其早期著作 An Introduction to the Study of Language(Bloomfield, 1914)中,把 Wundt 的成分思想引入了语言学。到了他后来的著作 Language(Bloomfield, 1933)问世时,当时所谓的“直接成分分析”已经成为美国成熟的句法研究方法。相比之下,源自古典时期的欧洲传统语法定义的是词与词之间的关系,而不是成分;欧洲句法学家继续强调这种依存语法,它也是第 20 章的主题。
美国结构主义在寻找“发现程序”的过程中提出了多种直接成分的具体定义;所谓发现程序,是描述一种语言句法的方法论算法。这些定义总体上都试图刻画如下直觉:“直接成分的首要标准,是组合在多大程度上像简单单位一样行动”(Bazell, 1952/1966, p. 284)。其中最著名的具体定义,是 Harris 提出的与单个单位具有分布相似性的思想及其替换检验。这种方法实质上尝试用简单结构替换可能的成分,从而把一个结构分解成各个成分:如果简单形式(比如 man)能够在某结构中替换一个更复杂的集合(比如 intense young man),那么 intense young man 很可能就是一个成分。Harris 的检验开启了把成分视为某种等价类的思想。
对这种层级成分思想的首次形式化,是 Chomsky(1956)定义的短语结构语法;Chomsky(1957)和 Chomsky(1956/1975)又进一步扩展了它,同时也对它提出了批评。此后,大多数生成语言学理论至少有一部分以上下文无关语法或其推广为基础,例如中心词驱动短语结构语法(Pollard and Sag, 1994)、词汇功能语法(Bresnan, 1982)、最简方案(Chomsky, 1995)和构式语法(Kay and Fillmore, 1999)等。许多理论使用称为 X-bar 图式的示意性上下文无关模板,它同样依赖句法中心词的概念。
Chomsky 的开创性工作问世后不久,Backus(1959)以及独立开展研究的 Naur et al.(1960)在描述 ALGOL 编程语言时重新发明了上下文无关语法。Backus(1996)指出,自己受到了 Emil Post 产生式的影响,而 Naur 的工作则独立于他本人。早期工作之后,由于用于分析这些语法的高效算法很早就得到发展(见第 19 章),大量自然语言处理计算模型都建立在上下文无关语法之上。
CFG 有多类扩展,其中很多用于处理句法中的长距离依存。(另一些语法则不把具有长距离依存的成分视为句法相关,而视为语义相关;Kay and Fillmore, 1999;Culicover and Jackendoff, 2005。)
一种扩展形式体系是树邻接语法(Tree Adjoining Grammar,TAG;Joshi, 1985)。TAG 的基本数据结构是树,而不是规则。树分为初始树和辅助树两类。例如,初始树可以表示简单句子结构,辅助树则向一棵树中加入递归。树通过替换和附接两种操作组合;附接操作负责处理长距离依存。更多细节见 Joshi(1985)。树邻接语法属于轻度上下文有关语言家族。
第 15 页还提到另一种处理长距离依存的方法,它以空范畴和同标索引为基础。宾州树库使用了这一模型;它在各种树库语料中吸收了扩展标准理论和最简主义的思想(Radford, 1997)。
对英语语法感兴趣的读者,应当选读三部大型英语参考语法中的一部:Huddleston and Pullum(2002)、Biber et al.(1999)以及 Quirk et al.(1985)。
从不同视角介绍句法学的优秀入门教材很多。Sag et al.(2003)从生成视角介绍句法,重点讨论短语结构规则、合一以及中心词驱动短语结构语法中的类型层级;Van Valin, Jr. and La Polla(1997)则从功能视角入门,重点讨论跨语言数据以及句法结构的功能动因。