前沿:推理定向蒸馏(面向 Chain-of-Thought)
本文定位与前置知识
本文属于「前沿方向」组,关注一个近期热点:如何把”会逐步推理”的能力从小模型/强模型迁移到更小的学生。前置:建议先读经典 KD(Hinton et al. 2015, arXiv:1503.02531)与上一篇 GKD(Agarwal et al. 2024, arXiv:2306.13649, ICLR 2024)——本篇是它们的”推理特化”延伸。
什么是推理定向蒸馏
普通 KD 通常让学生匹配教师对最终答案 token 的分布;而推理定向蒸馏(reasoning/CoT distillation)要求学生不仅答对,还要复现教师中间的思维链(Chain-of-Thought, CoT):逐步拆解、验证、回溯的过程。目标从”结果对齐”升级为”过程对齐”——学生学到的是一套可泛化的推理程序,而非单纯记忆答案。
与 DeepSeek-R1 蒸馏的关联(事实库条目 14)
事实库条目 14 给出:DeepSeek-AI 2025《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL》(arXiv:2501.12948) 发布了蒸馏系列模型,包括:
- DeepSeek-R1-Distill-Qwen:1.5B / 7B / 14B / 32B
- DeepSeek-R1-Distill-Llama:8B / 70B
这些是”把强推理教师(R1)直接蒸馏到更小的开源基座”的公开实例:学生继承教师生成的推理轨迹,从而在远小得多的体量上获得可观的推理表现。它示范了一条清晰的工程路径——用强推理模型产出高质量 CoT 数据/软信号,再蒸馏到小模型,使小模型也能具备逐步推理能力。
与 GKD(on-policy)的结合(事实库条目 10)
上一篇已说明:GKD 让学生在”自己生成的样本”上与教师对齐,以缓解分布偏移。推理蒸馏天然需要这套机制——因为推理链长、分布偏移严重:
- 若用 off-policy(教师采样 CoT)训练,学生在自回归生成自己的长链时,极易在某一中间步偏离教师分布,从此进入未见区域、误差滚雪球。
- 用 on-policy(GKD 式)让学生生成自己的推理链,再在该链上向教师对齐,能把”训练分布”与”推理分布”对齐,使学到的推理过程更稳、更可迁移。
因此,推理定向蒸馏 + on-policy(GKD) 是当前前沿的常见组合:教师提供”理想推理信号”,学生在自己写出的链上对照学习。
关键挑战
- 长序列代价:CoT 显著拉长序列,教师前向、软标签存储、KL 对齐的计算与显存都随长度上升(显存/算力估算参见本系列硬件篇)。
- 分布与暴露偏差:如上所述,长链下 off-policy 偏移更致命,需要 on-policy 或拒绝采样等缓解手段。
- 噪声推理链:教师并非总是正确;把错误/冗余的推理链蒸馏进去会污染学生。需要质量过滤或仅对齐高置信步骤。
- 容量鸿沟:极小学生(如 1.5B)未必装得下教师的全部推理模式,存在”学不全”的天花板(具体上限待核实,因任务而异)。
实践要点(基于已核验事实的推断)
- 教师侧:用 R1 类强推理模型生成 CoT 监督/软标签(参考条目 14 的蒸馏系列思路)。
- 学生侧:在自身生成的推理链上对齐(参考条目 10 的 on-policy 思路),而非死记教师链。
- 资源侧:按推理序列长度重估显存与算力(见本系列硬件篇)。
说明:除条目 14、10 明确给出的事实外,本文对”如何组合”的讨论属于方法论层面的合理推断,未引入事实库外的具体性能数字;凡涉及具体 benchmark 数值均待核实。
延伸阅读 / 参考文献
本文引用的已核验事实库条目:
- DeepSeek-AI 2025, 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL》, arXiv:2501.12948(蒸馏系列:R1-Distill-Qwen-1.5B/7B/14B/32B 与 Llama-8B/70B)。
- Agarwal et al. 2024, 《On-Policy Distillation of Language Models…》, arXiv:2306.13649, ICLR 2024(GKD:on-policy,缓解分布偏移)。
相关前置:
- Hinton, Vinyals, Dean 2015, arXiv:1503.02531(经典软标签蒸馏)。