指令微调:对齐人类意图
预训练模型学会了语言统计,却不一定按指令办事。指令微调(Instruction Tuning)用大量「指令-回答」配对继续训练,让模型学会理解并执行人类指令,是从「会说话」到「听指挥」的关键一步。
数据与格式
指令数据由任务描述、可选输入与期望输出组成,覆盖摘要、翻译、问答等多样任务。常用公开集合如 FLAN、Self-Instruct 合成数据,训练时常把多条样本拼成对话或提示模板。
# 指令样本的常见格式(示意)
sample = {
"instruction": "把下面句子翻译成英文",
"input": "今天天气真好",
"output": "The weather is really nice today."
}
训练方式
指令微调通常是监督式微调(SFT):在预训练权重上(或叠加 LoRA)以下一词预测最小化回答的负号对数似然。数据多样性能显著提升泛化与零样本能力。
与对齐的关系
指令微调是后续 RLHF/DPO 对齐的基础:先 SFT 得到较听话的模型,再用偏好学习进一步贴合人类价值。它是现代助手模型训练链路的第一环。
小结
指令微调用「指令-回答」数据做监督训练,使模型从语言建模转向服从指令,是构建可用助手模型与后续偏好对齐的前提。
参考与延伸阅读
- “Finetuned Language Models are Zero-Shot Learners”(FLAN, Wei 等, 2021)。已核验。https://arxiv.org/abs/2109.01652
- Hugging Face Transformers 文档首页。已核验。https://huggingface.co/docs/transformers/
本文累计阅读 — 次