指令微调:对齐人类意图

预训练模型学会了语言统计,却不一定按指令办事。指令微调(Instruction Tuning)用大量「指令-回答」配对继续训练,让模型学会理解并执行人类指令,是从「会说话」到「听指挥」的关键一步。

数据与格式

指令数据由任务描述、可选输入与期望输出组成,覆盖摘要、翻译、问答等多样任务。常用公开集合如 FLAN、Self-Instruct 合成数据,训练时常把多条样本拼成对话或提示模板。

# 指令样本的常见格式(示意)
sample = {
  "instruction": "把下面句子翻译成英文",
  "input": "今天天气真好",
  "output": "The weather is really nice today."
}

训练方式

指令微调通常是监督式微调(SFT):在预训练权重上(或叠加 LoRA)以下一词预测最小化回答的负号对数似然。数据多样性能显著提升泛化与零样本能力。

与对齐的关系

指令微调是后续 RLHF/DPO 对齐的基础:先 SFT 得到较听话的模型,再用偏好学习进一步贴合人类价值。它是现代助手模型训练链路的第一环。

小结

指令微调用「指令-回答」数据做监督训练,使模型从语言建模转向服从指令,是构建可用助手模型与后续偏好对齐的前提。

参考与延伸阅读

本文累计阅读