对齐技术深入:RLHF、DPO 与 Constitutional AI
大语言模型在预训练阶段从海量文本中学会了语法、事实与推理能力,却并不天然懂得「用户真正想要什么」。一个只会续写文本的模型可能会输出不准确、有毒、危险或单纯无用的内容。让模型的行为符合人类意图与价值,就是所谓「对齐」(alignment)。本教程系统讲解三类主流对齐技术:基于人类反馈的强化学习(RLHF)、直接偏好优化(DPO)以及宪法式人工智能(Constitutional AI)与基于 AI 反馈的强化学习(RLAIF),并对比它们的流程、成本与取舍。
什么是对齐与偏好学习
对齐的核心目标是让模型的输出在「有用、诚实、无害」等维度上贴近人类期望。实现这一目标最常用的一类范式是偏好学习(preference learning):我们不直接告诉模型「正确答案是什么」,而是提供「哪个回答更好」的相对判断。
典型的偏好数据形式为三元组:
(提示 prompt, 较优回答 chosen, 较劣回答 rejected)
例如面对「如何配制清洁剂」这一危险提问,人类标注者或更安全的模型会判定「说明风险并拒绝提供危险配方」优于「直接给出配方」。偏好学习就是把这种相对优劣信号转化为模型参数的更新方向。
从方法论演进看,对齐技术大致经历三个阶段:
阶段一:监督微调(SFT)— 模仿人类示范回答
阶段二:偏好建模 — 学习一个能打分「好坏」的奖励模型
阶段三:策略优化 — 让模型生成更高分的回答
RLHF、DPO 与 Constitutional AI 的区别,主要集中在第二、三阶段如何完成,以及偏好信号来自人类还是 AI。
RLHF:基于人类反馈的强化学习
RLHF 是当前主流商业模型广泛采用的对齐范式,代表工作是 OpenAI 的 InstructGPT。其完整流程分为三步。
第一步:监督微调(SFT)
先用人类标注者撰写的高质量示范回答对预训练模型做有监督微调,得到一个「会按指令作答」的初始模型。这一步解决的是基本格式与风格问题。
第二步:训练奖励模型(Reward Model, RM)
收集同一提示下模型生成的多个回答,由人类标注者排序或两两比较,标注出偏好。奖励模型的目标是拟合人类偏好,给较优回答打高分、较劣回答打低分。其损失函数通常采用 Bradley-Terry 排序模型:
import torch
import torch.nn.functional as F
def rm_loss(chosen_logps, rejected_logps, beta=1.0):
# chosen_logps: 较优回答的对数概率
# rejected_logps: 较劣回答的对数概率
# 希望 chosen 分数高于 rejected
return -F.logsigmoid(beta * (chosen_logps - rejected_logps)).mean()
这里的对数概率由策略模型(policy)在给定回答上计算得出,奖励模型通过最大化「较优减较劣」的边际来学习人类偏好。
第三步:用 PPO 做强化学习优化
以奖励模型的打分为奖励信号,使用近端策略优化(PPO)算法微调策略模型,使其在生成更高奖励回答的同时,不偏离 SFT 模型太远(通过 KL 散度约束防止「奖励黑客」)。训练循环示意如下:
for batch in dataloader:
prompts = batch["prompt"]
responses = policy.generate(prompts)
rewards = reward_model(responses)
kl = compute_kl(policy, reference_model, responses)
objective = rewards - beta_kl * kl
ppo_update(policy, objective)
InstructGPT 的实验表明,仅 13 亿参数的 InstructGPT 在人类评测中优于参数量大一百倍的原始 GPT-3,且在真实性与毒性控制上明显更好。这证明对齐比单纯扩大模型规模更能提升「可用性」。
DPO:直接偏好优化,免奖励模型
RLHF 流程复杂、训练不稳定,且需要同时维护策略模型、奖励模型、参考模型与价值模型多套权重。DPO(Direct Preference Optimization)的核心洞见是:RLHF 中奖励模型与最优策略之间存在闭式对应关系,因此可以直接在偏好数据上用简单的分类损失优化策略,而不必显式训练奖励模型,也不必做在线强化学习采样。
DPO 的损失函数如下:
def dpo_loss(pi_logps_chosen, pi_logps_rejected,
ref_logps_chosen, ref_logps_rejected, beta=0.1):
# pi: 当前策略模型;ref: 冻结的参考(SFT)模型
pi_diff = pi_logps_chosen - pi_logps_rejected
ref_diff = ref_logps_chosen - ref_logps_rejected
logits = beta * (pi_diff - ref_diff)
return -F.logsigmoid(logits).mean()
直观地说,DPO 同时用策略模型与参考模型的偏好概率之差来构造目标:它鼓励策略在较优回答上相对较劣回答拉大优势,但又要受到参考模型的约束以免偏航。由于无需奖励模型、无需在线采样、无需 PPO 的价值网络,DPO 显著更稳定、轻量且易于实现,实验显示在情感控制、摘要与单轮对话等任务上可与甚至超过 PPO 版 RLHF。
Constitutional AI 与 RLAIF:自我批判与 AI 反馈
Constitutional AI 由 Anthropic 提出,目标是用极少量人类标注训练「无害」的 AI 助手。其关键创新在于:人类不再逐条标注「哪些输出有害」,而只提供一份原则清单(即「宪法」),模型据此自我批判、自我修订。
宪法式人工智能同样分监督与强化两个阶段:
监督阶段:
1. 从初始模型采样回答
2. 模型依据宪法原则自我批判并指出问题
3. 模型生成修订版回答
4. 用修订数据微调原模型
强化阶段(RLAIF):
1. 从微调模型采样两个回答
2. 用一个模型依据宪法评判哪个更好
3. 由 AI 偏好训练偏好模型
4. 以该偏好模型为奖励信号做 RL
与 RLHF 的区别在于,强化阶段的偏好标签来自 AI 而非人类,因此称为「基于 AI 反馈的强化学习」(RLAIF)。Constitutional AI 既能训练出无害且「不回避」的助手(面对有害询问时解释拒绝理由,而非简单拒答),又大幅减少了对人类标注的依赖。
Google 团队的 RLAIF 研究进一步对比了 RLAIF 与 RLHF:在摘要、有用对话与无害对话任务上,RLAIF 取得了与 RLHF 相当的表现;且当 AI 标注器与策略规模相近、甚至就是同一检查点时,RLAIF 仍可胜过监督微调基线。该研究还提出直接 RLAIF(d-RLAIF),在强化学习阶段直接让现成大模型给出奖励、跳过奖励模型训练,表现优于标准 RLAIF。
各方法对比:数据成本、稳定性与效果
下表汇总三类方法在关键维度上的差异。
维度 RLHF DPO Constitutional AI / RLAIF
偏好来源 人类标注 人类标注 人类提供原则 + AI 自评
奖励模型 需要 不需要 需要(由 AI 偏好训练)
在线采样 需要(PPO) 不需要 需要(RL 阶段)
训练稳定性 较低,易不稳定 高 中(RL 阶段仍依赖 RL)
实现复杂度 高 低 中
人类标注成本 高 高但只需偏好 低(仅原则,无需逐条标注)
总体取舍可以概括为:RLHF 效果成熟、生态完善,但工程复杂且标注昂贵;DPO 用更低成本与更高稳定性逼近甚至超越 RLHF,已成为许多开源项目的默认选择;Constitutional AI 与 RLAIF 则把「人类介入」压缩到原则层面,适合无害性对齐与标注稀缺场景,但 RL 阶段仍可能引入 AI 反馈自身的偏差。
局限与风险
对齐技术并非终点,仍存在若干尚未解决的问题。
第一,奖励黑客与分布偏移。优化奖励模型时,策略可能找到「钻空子」的回答来骗取高分,而非真正变好。DPO 虽免去奖励模型,但仍依赖固定的偏好数据分布。
第二,人类偏好的主观与分歧。人类标注者对「好」的定义并不统一,标注质量、群体偏差都会影响对齐方向;用 AI 反馈(RLAIF)则可能把模型自身的价值固化进产物。
第三,可对齐性与「谄媚」。过度优化有用性可能让模型迎合用户错误前提,或为了「无害」而过度拒答,反而降低可用性。
第四,评估困难。对齐效果依赖主观评测,缺乏统一、可复现的客观指标,难以横向公平比较不同方法。
小结
对齐是让大语言模型从「能说」走向「说得好、说得安全」的关键一步。RLHF 通过「奖励模型加 PPO」把人类偏好注入模型,是被充分验证的成熟路线;DPO 用巧妙的参数化把偏好学习简化为一个分类损失,免去奖励模型与在线采样,更稳定轻量;Constitutional AI 与 RLAIF 则把人类标注压缩为一份原则清单,由模型自我批判并用 AI 反馈完成强化,显著降低标注成本。三者并非互斥,实践中常组合使用:例如以 SFT 打底,用 DPO 或 RLHF 做偏好优化,再辅以宪法式方法强化无害性。理解它们的流程与取舍,有助于在不同资源与合规约束下选择合适的对齐方案。
参考与延伸阅读
- Long Ouyang 等,Training language models to follow instructions with human feedback(InstructGPT),arXiv:2203.02155,2022。
- Rafael Rafailov 等,Direct Preference Optimization: Your Language Model is Secretly a Reward Model(DPO),arXiv:2305.18290,2023。
- Yuntao Bai 等,Constitutional AI: Harmlessness from AI Feedback,arXiv:2212.08073,2022。
- Harrison Lee 等,RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,arXiv:2309.00267,2023(ICML 2024)。