历史注记
神经网络源于 20 世纪 40 年代的 McCulloch–Pitts 神经元(McCulloch and Pitts, 1943),它把生物神经元简化为可用命题逻辑描述的计算元件。到 20 世纪 50 年代末和 60 年代初,包括康奈尔大学 Frank Rosenblatt 和斯坦福大学 Bernard Widrow 在内的多个实验室开展了神经网络研究。这一时期出现了感知机(Rosenblatt, 1958),还把阈值变换为偏置,形成沿用至今的记号(Widrow and Hoff, 1960)。
Minsky and Papert(1969)证明单个感知机甚至不能建模 XOR 这样简单的函数后,神经网络领域走向衰退。此后二十年虽仍有少量研究,但直到 20 世纪 80 年代,误差反向传播等构建深层网络的实用工具普及,该领域才迎来重大复兴(Rumelhart et al., 1986)。
20 世纪 80 年代出现了多种神经网络及相关架构,尤其用于心理学和认知科学(Rumelhart and McClelland, 1986a, 1986b;McClelland and Elman, 1986;Elman, 1990),常用术语包括联结主义(connectionism)和并行分布式处理(parallel distributed processing;Feldman and Ballard, 1982;Smolensky, 1988)。这一时期的许多原则和技术奠定了现代研究基础,包括分布式表示(Hinton, 1986)、循环网络(Elman, 1990)以及用张量表示组合性(Smolensky, 1990)。
到 20 世纪 90 年代,更大的神经网络开始用于手写识别(LeCun et al., 1989)、语音识别(Morgan and Bourlard, 1990)等实际语言处理任务。21 世纪初,计算硬件改善以及优化、训练技术进步,使更大、更深的网络可以训练,并催生了现代术语“深度学习”(Hinton et al., 2006;Bengio et al., 2007)。第 14 章和第 16 章还会介绍更多相关历史。
神经网络领域的优秀教材包括 Goodfellow et al.(2016)和 Nielsen(2015)。