Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

8.5 总结

本章探讨了大语言模型的后训练。下面是本章涉及的若干要点:

• 后训练包含三个阶段:指令微调(监督微调,即 SFT)、偏好对齐和 RLVR。

• 在指令微调中,使用由指令及其正确回答组成的数据集对模型进行微调,训练目标仍采用预测下一词的语言模型目标。创建指令微调数据集时,经常会让 LLM 编写问题,并把问答、机器翻译等 NLP 任务的数据集改作此用。

• 由于微调大型模型的全部参数成本过高,我们通常使用 LoRA 等参数高效微调方法(PEFT)。

• 在偏好对齐中,我们使用 PPO 和 DPO 等基于强化学习的方法,使语言模型与人类(或机器)对回答表达的二元偏好对齐。