1.9 评估大语言模型
无论是一种新的 LLM 架构,还是不同的训练数据或训练方法,我们如何确定某个新的 NLP 思想确实有效?又该如何比较两个系统,判断哪一个更好?为了回答这些问题,我们需要一种评估每个系统的方法,衡量它在预定任务上的表现。但首先,我们必须确定“运行得好”究竟意味着什么!
1.9.1 衡量准确度¶
最常衡量的是系统的准确度(accuracy)或正确性。如果要求一个系统判断“I loved this movie”这句话的情感,我们会认为回答“positive”表现良好,回答“negative”表现不佳。又比如,当语言模型被要求计算 457 加 3,或说出《Frankenstein》的作者时,它是否分别回答“460”和“Mary Shelley”?
我们可以创建由问题、其他任务或句子组成的测试集(test set),用这种方式衡量准确度。测试集是用于评估系统的一组数据。我们可以选择一组句子、问题或其他待测内容,让人类为测试集中的每条数据标注正确答案;然后在每条数据上运行所提出的算法,直接计算正确回答所占的百分比。我们需要确保这个句子测试集是未见的(unseen),也就是说,算法开发者此前没有用这些句子训练该算法。第 3 章和第 4 章将进一步讨论如何选择并标注未见测试集。
大语言模型有许多大型评估工具集或基准(benchmark)。其中很多要求系统回答事实性问题(多项选择题或自由作答题),题目往往取自教育或职业环境中的人类考试。问答准确度可以作为模型事实知识或推理能力的有用替代指标。图 1.18 展示了若干常见评估中的样题,例如 MMLU(Massive Multitask Language Understanding,大规模多任务语言理解):这是一个常用数据集,包含医学、数学、计算机科学、法律等 57 个领域的 15,908 道知识与推理问题。

图 1.18 用于评估 LLM 的问题基准样例。
使用这类公开基准评估 LLM,可能受到数据污染(data contamination)问题的影响。数据污染是指测试数据集进入了训练集。大语言模型使用网络数据训练,而许多测试也发布在网络上,因此模型很可能把部分 MMLU 问题纳入训练。如果再用这些问题进行评估,指标就会夸大语言模型的性能。缓解数据污染的一种方法,是公开训练模型所使用的确切数据(或者至少报告训练数据与特定测试集的重叠情况(Zhang et al., 2025))。完整报告确切训练数据的全开放 LLM 模型,在这方面具有优势。
1.9.2 词预测准确度:概率与困惑度¶
评估语言模型的另一种方法,是衡量它预测未见文本的能力。更好的语言模型应当能更准确地预测后续词元。假设测试句子是“So long and thanks for all the fish”,我们向语言模型提供前 7 个词元“So long and thanks for all the”,并要求它预测最后一个词;模型为正确词“fish”分配的概率越高,我们就可以给它越高的分数。
回想图 1.2 中上下文为“So long and thanks for”的情形。图中的语言模型预测,最可能的下一个词是“all”(概率为 .44),其次是“the”(概率为 .33)。如果正确的下一个词是 all,语言模型获得的分数应与它分配给 all 的概率成比例;如果正确词是 the,模型获得的分数则应与它分配给 the 的概率成比例。因此,如果想知道两个语言模型中哪一个更善于对某段文本建模,我们可以检查哪个模型为文本中的每个词分配了更高概率。完美的语言模型会正确猜出每个词,为其分配概率 1,并为所有其他词元分配概率 0。实践中,我们通常不直接使用原始概率,而使用一个称为困惑度(perplexity)的特定概率函数;它具有按文本长度归一化的优点。第 3 章将介绍全部细节。
1.9.3 主观任务:由人类或 LLM 担任评判者¶
对于数学题、事实型问题,甚至文本中的词预测,准确度都非常适用,因为这些问题有唯一且明确的正确答案。然而,许多有用的问题可能存在多个正确答案。
也许我们想知道,在与人交谈时,一个聊天机器人总体上是否优于另一个。显然,不存在唯一“正确的对话”。又或者,我们要评估从中文到英文的机器翻译算法;一句话显然不只有一种“正确译文”。判断一段对话或一篇译文有多好,属于主观任务。再假设我们要衡量语言模型的谄媚程度,可能会测量它认可用户行为的频率(Cheng et al., 2026);然而,判断一个响应有多“认同”同样是主观决定。
在这些主观情形中,我们所能采取的最佳方法是询问人们的看法。以中译英为例,如果有一个候选译文测试集,我们可以请同时掌握中英文的双语者为每个句子的译文评分。我们可能需要给评分者一套评分准则或说明,例如要求他们从忠实度(是否传达了与中文原文相同的意义)和流畅度(英文表达是否自然规范)两个方面评价译文。对于翻译等任务,我们希望人类评分者是相关语言的专家。对于其他任务,例如判断一段对话是否有帮助,或者语言模型是否说了侮辱性或有毒内容,我们可能希望评分者具有多种不同背景。
实践中,不断让人衡量算法或系统的输出既昂贵、不便,也会令参与者疲惫。我们又必须经常开展这种评估,例如比较同一系统许多略有差异的版本。因此,如今更常见的做法是使用 LLM 而不是人类来评估 LLM,这一范式称为 LLM 评判(LLM-as-a-judge)。对于标记侮辱或有毒内容等任务,这还有一个额外好处:可以避免此类内容对人类造成情感伤害。我们必须仔细编写 LLM 评判者所使用的提示,并经常在一小部分数据上把 LLM 与人类专家进行比较,以确保 LLM 对该任务的判断与人类基准相符。
无论由人类还是 LLM 担任评判者,都可以进行单项评估或成对评估。单项评估接收一段文本或一个输出并给它评分;成对评估接收两个输出并判断哪一个更好。
1.9.4 替代指标¶
在 LLM 出现以前,对于机器翻译或摘要等没有唯一正确答案的任务,我们会设计替代指标(proxy metric),即容易自动计算的形式化指标。它不如使用人类评判者,但方便得多。
机器翻译(例如中译英)常用的一种替代指标是词元重叠。我们先请人把测试集中的中文句子翻译成英文;之后每次测试算法时,都让算法在中文测试集上生成一批英文译文,再计算每个机器译文与人工译文之间有多少词元重叠。词元重叠并不是完美指标:一篇译文即使完全没有使用人工译文中的词元,也仍然可能非常出色。但替代指标以便利性弥补了不够完美的缺点。
虽然 LLM 评判部分降低了对这些替代指标的需求,但替代指标只需极少计算,因而可以频繁运行,所以仍然很实用。对于机器翻译和摘要,我们使用 chrF、BLEU 和 ROUGE 等字符串重叠指标(第 13 章);对于语音识别,我们使用词错误率(word error rate,第 16 章)。使用所有这类指标时,都必须遵循最佳实践,例如检验差异是否具有统计显著性。我们将从第 4 章开始介绍统计检验。
替代度量确实存在一个问题,称为古德哈特定律(Goodhart’s Law):
“当一项度量成为目标时,它便不再是一项好的度量。”
其含义是,当开发者开始针对 chrF 或词错误率等指标调整算法时,他们优化的可能是一些偶然属性(例如词语重叠),而不是真正的目标(优美的译文),因而这些指标会变成更差的替代物。
1.9.5 评估语言模型的其他因素¶
准确度并不是评估模型时唯一关心的事项(Dodge et al., 2019; Ethayarajh and Jurafsky, 2020, inter alia)。我们经常还关心模型有多大,以及训练或推理需要多长时间。我们通常只有有限时间或有限的 GPU 内存。我们也更喜欢耗能较少的模型,以降低成本和环境影响(下一节将进一步讨论)。处理这些问题时,可以衡量在给定计算或内存预算下归一化的性能,也可以直接以千瓦时或排放的 CO2 千克数测量模型的能源使用量(Strubell et al., 2019; Henderson et al., 2020; Liang et al., 2023)。
语言模型评估还可以衡量安全性和偏见,例如模型是否会生成有毒语言或刻板印象。下一节将进一步讨论;这里仅指出,目前已有 StereoSet(Nadeem et al., 2021)、RealToxicityPrompts(Gehman et al., 2020)和 BBQ(Parrish et al., 2022)等语言模型评估基准,用于衡量此类偏见的强度。
我们还希望语言模型对不同群体都能表现得同样公平。例如,我们可以选择符合罗尔斯式公平观的评估方法,通过最大化处境最不利群体的福祉来实现公平(Rawls, 2001; Hashimoto et al., 2018; Sagawa et al., 2020)。