Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

神经网络

原始 PDF

“当单元数量很大时,这类机器可以表现得非常复杂。”——Alan Turing(1948),《Intelligent Machines》,第 6 页

神经网络(neural networks)是语言处理的一项基础计算工具,而且历史悠久。之所以称为“神经”,是因为它源于 McCulloch–Pitts 神经元(McCulloch and Pitts, 1943):把生物神经元简化为可用命题逻辑描述的计算元件。不过,现代语言处理中的神经网络已不再依赖这些早期生物学灵感。

现代神经网络是由许多小型计算单元组成的网络,每个单元接收一个输入值向量并产生一个输出值。本章介绍用于分类的神经网络。所用架构称为前馈网络(feedforward network),因为计算从一层单元依次流向下一层。现代神经网络的使用常称为深度学习(deep learning),因为现代网络通常很“深”,即包含许多层。

神经网络与逻辑回归共享许多数学基础,但它是比逻辑回归更强大的分类器。事实上,可以证明,最小的神经网络——技术上说只有一个“隐藏层”的网络——能够学习任意函数。

神经网络分类器与逻辑回归还有另一项区别。使用逻辑回归时,我们根据领域知识开发丰富的特征模板,将分类器用于不同任务;使用神经网络时,更常见的做法是避免大部分复杂的人工特征,而让网络直接接收原始词元,在学习分类的同时自动归纳特征。第 5 章的嵌入已经展示了这种表示学习,研究深层 Transformer 网络时还会看到更多例子。很深的网络尤其擅长表示学习,因此对于数据足以支持自动学习特征的任务,深度神经网络是合适的工具。

本章先使用人工特征,再使用第 5 章的嵌入,把前馈网络作为分类器加以介绍。后续章节将讨论许多其他神经模型,最重要的是 Transformer 与注意力(第 7 章),以及循环神经网络(第 14 章)和卷积神经网络(第 16 章)。下一章还将介绍神经大语言模型范式。