Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

11.5 数据集

有数十个数据集以问题形式包含信息需求,并标注了答案。这些数据集既可用于指令微调,也可用于评估语言模型的问答能力。

这些数据集可以沿许多维度加以区分,Rogers et al.(2023)对此作了很好的总结。其中一个维度是数据中问题的原始目的:它们是自然产生的信息寻求型问题,还是为了探查——即评估或测试系统或人类——而设计的问题。

自然问题方面,有 Natural Questions(Kwiatkowski et al., 2019)等数据集,它由提交给 Google 搜索引擎的匿名英文查询及其答案组成。标注者根据维基百科信息创建答案,其中包括段落长度的长答案和跨度较短的短答案。例如,问题“啤酒酿造过程中何时加入啤酒花?”的短答案是“煮沸过程”,长答案则是维基百科“酿造”页面中的一个完整段落。

类似的自然问题集还有 MS MARCO(Microsoft Machine Reading Comprehension,微软机器阅读理解)系列数据集,其中包含来自 Microsoft Bing 查询日志的 100 万个真实匿名英文问题、人工生成的答案,以及 900 万个篇章(Bajaj et al., 2016);它既可用于测试检索排序,也可用于测试问答。

尽管许多数据集专注于英语,其他语言也有自然的信息寻求型问题数据集。DuReader 是基于搜索引擎查询与社区问答构建的中文问答资源(He et al., 2018)。TyDi QA 数据集包含来自 11 种类型学差异显著语言的 20.4 万个问答对,其中包括阿拉伯语、孟加拉语、斯瓦希里语、俄语和泰语(Clark et al., 2020a)。在 TYDI QA 任务中,系统会收到一个问题和一篇维基百科文章中的若干篇章,并且必须:(a)选择包含答案的篇章(若没有篇章包含答案,则选择 NULL);(b)标出最小答案跨度(或 NULL)。

探查型数据集包括 MMLU(Massive Multitask Language Understanding,大规模多任务语言理解)。这个常用数据集包含 15,908 个知识与推理问题,涵盖医学、数学、计算机科学、法律等 57 个领域。MMLU 的问题取自各种面向人类的考试,如美国研究生入学考试、医师执照考试和大学先修课程考试。因此,这些问题并不代表人们的实际信息需求,而是为测试人类的学术或执业知识而设计。图 11.14 给出了一些例子,其中正确答案以粗体显示。

前述一些问题数据集会为每个问题附加一个或多个可以抽取答案的篇章。这些数据集最初主要为一种较早的问答任务——阅读理解(reading comprehension)——而创建:模型会收到一个问题与一篇文档,并须从给定文档中抽取答案。给定一篇或多篇文档(例如通过 RAG)进行问答的任务,有时称为开卷问答(open-book QA);完全不含检索组件、直接由语言模型回答的任务则称为闭卷问答(closed-book QA)。[5] 因此,如果求解器使用每个问题所附的文档,Natural Questions 等数据集可视为开卷;不使用文档时则是闭卷;MMLU 等数据集则纯属闭卷。

另一个变化维度是答案格式:选择题或自由形式。提示方式当然也有所不同,例如只向模型提供问题(零样本),还是同时给出类似问题的答案示例(少样本)。MMLU 同时提供零样本和少样本提示选项。

图 11.14 MMLU 中的示例问题。

Footnotes
  1. 这里借用了考试中的说法:考试时允许学生“翻书”,或不允许学生翻书。