Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

引言

原始 PDF

“语言的疆域向四面八方延展开去。” 荷马, 《伊利亚特》 20.330. Emily Wilson 翻译.

奇幻文学中充满了被魔法赋予言语能力的无生命物体。从奥维德笔下皮格马利翁与他所爱雕像的神话,到玛丽·雪莱关于弗兰肯斯坦的哥特小说,我们不断重新讲述这样的故事:创造出某种事物,然后与它交谈。传说米开朗基罗完成雕塑《摩西》(下图)后,觉得它栩栩如生,于是敲了敲它的膝盖,命令它开口说话。

米开朗基罗的雕塑《摩西》(1515)

我们的这种迷恋或许并不令人意外。语言是人性与感知能力的标志;甚至在计算机出现以前,人们就已经产生了制造能够处理人类语言的人造物的想法。

本卷讨论的正是这一激动人心的构想如何在大语言模型(large language model,LLM)中得到实现,以及它所带来的影响。我们将介绍语言模型本身,也会介绍研究语言模型、充满活力的跨学科领域,其目标是让计算机通过执行涉及人类语言的实用任务来帮助人类。

这一领域有许多名称,分别对应它的不同侧面,包括自然语言处理(natural language processing,NLP)、计算语言学(computational linguistics)、口语语言处理(spoken language processing)、语音识别(speech recognition),以及最近常用的简称——语言建模(language modeling)。该领域已成为现代人工智能(artificial intelligence,AI)的新核心,并且长期以来一直与语言学、心理学、哲学、认知科学等学科保持着丰富的联系。

语言模型和其他 NLP 工具有望为人类带来明确的益处。例如,LLM 可以提高许多任务的基础生产力,并且已经彻底改变了编程等任务(Collante et al., 2025; Mohamed et al., 2026)。LLM 能够提高人类的写作效率;研究表明,它们可以帮助大量英语非母语者写得更好、更有影响力(Prakash et al., 2025; McCreery and Naser, 2026)。LLM 智能体(agent)还有望帮助人们处理法律、金融、企业或政府领域的文书工作与官僚程序。

LLM 以及机器翻译所使用的专用算法,可以打破不使用共同语言的人们之间的语言障碍。它们能够提供实用而流畅的文本翻译,有时其表现可以达到甚至超过专业人工译者。[1]研究表明,机器翻译工具能够促进在线平台上的国际贸易(Brynjolfsson et al., 2019),也能帮助公众开展危机沟通(Abdallah et al., 2025)。

LLM 处理语音的能力已经显著提升。基于 LLM 及相关模型的自动语音识别(automatic speech recognition,ASR)算法,可以减轻医生的职业倦怠与行政负担(Olson et al., 2025),改善外语学习者的学习表现(Xiao, 2025),并帮助没有书面文字的语言社群更便利地获取信息(Reitmaier et al., 2024)。

LLM 在信息与教育获取方面也有明确的应用。LLM 可以提供个性化辅导,以适合每位学生的方式帮助他们学习复杂主题。无论是通过与 LLM 对话,还是使用第 11 章将介绍的搜索引擎等专用工具,用于检索信息和回答问题的计算工具已经使海量知识变得更容易获得和检索,并且还将继续发挥这一作用。LLM 还能加速科学与医学研究,为文献综述与综合、假设生成以及研究工具提供帮助(Swanson et al., 2025)。

除了思考语言模型可能带来的益处,我们也必须考虑它们可能造成的危害。作为 NLP 和大语言模型的从业者,我们应当始终追问:“我为谁设计这个系统,或为谁提出这个研究问题?”“我们应该研究这项任务,还是另一项任务?”以及“怎样才能使这个系统更加符合人类价值观?”早在 60 年前的计算语言学系统 ELIZA 中,这些影响中的许多就已清楚显现(Weizenbaum, 1966)。ELIZA 是一个简单系统,它使用正则表达式替换来模拟一位罗杰斯学派心理治疗师与用户交谈。人们会在情感上深深投入 ELIZA,并与它进行非常私密的对话,甚至会在打字时要求 Weizenbaum 离开房间。情感投入与隐私问题意味着,我们必须审慎考虑如何部署语言模型,以及模型会给与之交互的人带来什么影响。这组主题通常被称为安全(safety)或对齐(alignment),我们将在第 1.10 节讨论。

路线图 本书面向涵盖语言模型、自然语言处理、语音处理与计算语言学的一系列本科课程。本书假定读者具备概率论和线性代数的基础知识(向量与矩阵、线性无关、矩阵的秩),并掌握 Python 编程。第一卷介绍(解码器)语言模型,可以独立作为一门课程使用。第二卷增加高级语言模型架构与应用,第三卷则介绍语言结构的计算处理。

第一卷首先介绍文本词元化(tokenization),随后用 4 章建立语言建模所需的其他理论工具。第 3 章在直观的 n 元语言模型环境中介绍 n 元语言模型、词预测、采样和困惑度,学生可以手工完成其中的算术运算。第 4 章介绍逻辑回归分类——它是所有 Transformer 及其他神经网络层的组成部分——并涵盖梯度下降与交叉熵损失。第 5 章介绍嵌入(embedding),即内部意义表示的基本单位;第 6 章介绍前馈神经网络。第 7 章将这些内容整合起来,定义现代语言模型的核心架构 Transformer,并介绍它在语言建模中的应用及其预训练算法。最后,第 8 章介绍后训练(post-training)的各个部分,包括指令微调、偏好对齐以及用于推理的强化学习。

第二卷介绍 LLM 应用(RAG、一般意义上的智能体、机器翻译、语音识别与语音合成)和架构(BERT 等仅编码器模型以及编码器—解码器模型)。第三卷介绍涉及语言结构标注的任务:句法分析、词义、共指与连贯性;这些内容既有助于解释 LLM,也可用于社会科学与认知科学任务。

Footnotes
  1. 这本书的翻译也使用了大语言模型。——译者注。