RLHF:让大模型对齐人类偏好
预训练大模型知识丰富,但未必「听话」:可能敷衍、有毒或答非所问。RLHF(基于人类反馈的强化学习)用人类偏好把模型校准到「好用」的方向,ChatGPT 之所以好用,核心就是这一步。
为什么需要对齐
- 预训练目标是「预测下一个词」,不是「满足用户」。
- 模型可能输出事实错误、不合规或与用户意图不符的内容。
- 对齐(Alignment)就是把「人类觉得好」变成可优化的目标。
经典三步流程
- 第一步 有监督微调(SFT):用人工写好的优质问答,先把模型调成「会好好说话」。
- 第二步 训练奖励模型(RM):让标注员对多个回答排序,训练一个打分模型预测「人类偏好」。
- 第三步 强化学习(PPO):把策略模型与奖励模型接起来,让模型学习「高奖励的说话方式」,同时加 KL 惩罚防止跑偏。
常见变体
- DPO:跳过显式奖励模型,直接用偏好对做简单目标优化,训练更稳更省(已核验,DPO 论文 NeurIPS 2023)。
- RLAIF:用 AI 代替人类打标签,降低标注成本。
- KTO、IPO 等:进一步简化偏好目标,各有取舍。
数据与质量
- RLHF 的效果高度依赖偏好数据质量与多样性。
- 标注员之间的分歧、排序噪音都会传导到最终模型。
- 奖励模型「被刷」会诱使策略模型说漂亮话而不办实事,需要持续监控。
小结
RLHF 是「预训练会知识、对齐会做人」的关键一环。经典三步(SFT + RM + PPO)被 DPO 等更简单的变体挑战,但思路一致:用人类偏好把模型导向更有用、更安全的方向。
参考与延伸阅读
- Training language models to follow instructions with human feedback,OpenAI 2022(已核验)
- Direct Preference Optimization,NeurIPS 2023(已核验)
- 本站「偏好对齐」与「微调」教程
本文累计阅读 — 次