RLHF:让大模型对齐人类偏好

预训练大模型知识丰富,但未必「听话」:可能敷衍、有毒或答非所问。RLHF(基于人类反馈的强化学习)用人类偏好把模型校准到「好用」的方向,ChatGPT 之所以好用,核心就是这一步。

为什么需要对齐

  • 预训练目标是「预测下一个词」,不是「满足用户」。
  • 模型可能输出事实错误、不合规或与用户意图不符的内容。
  • 对齐(Alignment)就是把「人类觉得好」变成可优化的目标。

经典三步流程

  • 第一步 有监督微调(SFT):用人工写好的优质问答,先把模型调成「会好好说话」。
  • 第二步 训练奖励模型(RM):让标注员对多个回答排序,训练一个打分模型预测「人类偏好」。
  • 第三步 强化学习(PPO):把策略模型与奖励模型接起来,让模型学习「高奖励的说话方式」,同时加 KL 惩罚防止跑偏。

常见变体

  • DPO:跳过显式奖励模型,直接用偏好对做简单目标优化,训练更稳更省(已核验,DPO 论文 NeurIPS 2023)。
  • RLAIF:用 AI 代替人类打标签,降低标注成本。
  • KTO、IPO 等:进一步简化偏好目标,各有取舍。

数据与质量

  • RLHF 的效果高度依赖偏好数据质量与多样性。
  • 标注员之间的分歧、排序噪音都会传导到最终模型。
  • 奖励模型「被刷」会诱使策略模型说漂亮话而不办实事,需要持续监控。

小结

RLHF 是「预训练会知识、对齐会做人」的关键一环。经典三步(SFT + RM + PPO)被 DPO 等更简单的变体挑战,但思路一致:用人类偏好把模型导向更有用、更安全的方向。

参考与延伸阅读

  • Training language models to follow instructions with human feedback,OpenAI 2022(已核验)
  • Direct Preference Optimization,NeurIPS 2023(已核验)
  • 本站「偏好对齐」与「微调」教程
本文累计阅读