定位与前置知识
本文是前沿方向系列的第三篇,聚焦一个把「知识蒸馏」从论文推向工程可用的标志性案例:DeepSeek-R1 蒸馏系列。
前置建议:
- 理解经典 KD(Hinton et al. 2015)的软标签蒸馏范式;
- 了解 LLM 蒸馏前沿(MiniLLM / GKD / DistiLLM)在目标函数与采样策略上的改进。
本文只陈述已核验事实:DeepSeek-AI (2025)《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL》(arXiv:2501.12948) 用强化学习激励推理能力,并发布蒸馏系列 DeepSeek-R1-Distill-Qwen-1.5B/7B/14B/32B 与 Llama-8B/70B。具体蒸馏配方与评测数字以官方论文 / 仓库为准(凡未核验处标注「待核实」)。
DeepSeek-R1 是什么
DeepSeek-R1 的核心思想是:用强化学习(RL)激励大模型的推理能力,得到一个具备强链式推理(reasoning)能力的教师模型。与单纯用更多数据做 SFT 不同,R1 的训练强调通过 RL 让模型「学会思考」——自发产生长链条、可验证的推理过程。
这一点对蒸馏的意义在于:教师不再只是「知识更全」,而是「推理行为更优」。学生要学的,除了答案,还有教师的推理路径与风格。
蒸馏系列:从 R1 到小模型
DeepSeek-R1 发布了开源的蒸馏系列,把推理能力迁移到多个规模的学生骨架(backbone)上:
- 基于 Qwen 的蒸馏版:DeepSeek-R1-Distill-Qwen-1.5B / 7B / 14B / 32B
- 基于 Llama 的蒸馏版:DeepSeek-R1-Distill-Llama-8B / 70B
规模覆盖 1.5B 到 70B,意味着:
- 1.5B / 7B / 8B 级别可在消费级或单卡环境部署;
- 14B / 32B / 70B 级别可在中高端显卡上获得接近教师的推理表现(具体以官方评测为准)。
上述模型名称与规模区间均来自已核验事实库。蒸馏所使用的具体监督信号配方(例如是否用 R1 生成的推理链作为训练数据、是否结合温度软化等),以官方论文与仓库说明为准(待核实)。
为什么「蒸馏」能带来推理能力
把 R1 的推理能力下放到小模型,本质上是一次面向推理行为的蒸馏:
- 教师(R1)在给定问题上展现出稳定的长链推理;
- 学生通过模仿教师的输出分布 / 推理轨迹,习得类似的「思考方式」,而不只是记忆答案;
- 相比从零训练同规模模型,蒸馏能显著缩短达到可用推理水平所需的数据与算力。
需注意:蒸馏得到的小模型推理上限仍受限于其参数规模,不可能在所有任务上追平 671B 级别的教师。它的价值在于「在可控规模内获得尽量好的推理能力」,而非「完全替代教师」。
开源可用性与实战意义
DeepSeek-R1 蒸馏系列的开源可用,带来了几类实际价值:
- 本地 / 边缘部署:1.5B~8B 级别可在笔记本、单卡甚至部分终端侧跑起来,适合隐私敏感或离线场景。
- 低成本推理:相比调用超大规模 API,本地小模型的长链推理成本大幅下降。
- 二次研究基座:开源权重可作为后续微调、量化、再蒸馏的起点。
- 教学与可复现:完整的模型家族让研究者能直接对比「同蒸馏方法在不同骨架上的表现」。
具体到每个尺寸的实测精度、推理速度、显存占用,本文不引未核验数字,请以官方仓库的评测表与社区实测为准(待核实)。
在 LLM 蒸馏谱系中的位置
把 R1 蒸馏系列放回本系列的方法地图:
- 它属于用强教师(RL 训练的推理模型)蒸馏小模型的「模型蒸馏」路线;
- 在目标函数上,可视为经典软标签蒸馏 / 前沿 logit 蒸馏在工程上的大规模落地(具体损失以官方为准);
- 与「数据集蒸馏(DC/MTT/DM)」不同,它蒸馏的是模型权重,不是训练数据。
实战建议(工程视角)
- 选尺寸:先把任务延迟 / 显存预算定下来,再在 1.5B~70B 中选取可用的最小尺寸。
- 配量化:小模型常配合 INT8 / INT4 量化进一步降本,量化策略以部署框架为准(待核实)。
- 验任务:推理类任务(数学、代码、逻辑)收益通常更明显;纯检索 / 格式化任务未必需要 R1 级教师。
- 看官方:所有评测与配方以 DeepSeek 官方论文(arXiv:2501.12948)与模型仓库为准。
R1 蒸馏 vs 常规 SFT 蒸馏
理解 R1 蒸馏系列的关键,是把它和「普通小模型 SFT」区分开:
- 普通 SFT 小模型:用人工 / 网络指令数据训练,模型学到的是「回答问题」,不一定具备长链推理;
- R1 蒸馏小模型:教师 R1 本身由 RL 激励出推理行为,学生模仿的是「带推理路径的输出」,因此更易继承链式思考。
换句话说,蒸馏的增值不只来自「数据变多」,更来自「教师的行为范式更高级」。这也是为什么同尺寸下,R1 蒸馏版常被认为推理味更浓(具体对比以官方评测为准)。
尺寸 → 场景 选型对照(定性)
| 蒸馏尺寸 | 典型部署场景 | 备注 |
|---|---|---|
| 1.5B / 7B / 8B | 笔记本、单卡、边缘 / 离线 | 延迟与显存最友好 |
| 14B / 32B | 单张中高端显卡 | 推理质量与成本的折中 |
| 70B | 多卡服务器 | 最接近教师,资源占用最高 |
上表为定性部署建议,非性能承诺;具体显存与速度以硬件与推理框架实测为准(待核实)。需要说明:本文所有模型名称与规模均来自已核验事实库,不引未核验的精度数字。
小结
- DeepSeek-R1 通过 RL 激励推理能力,得到强推理教师。
- 开源蒸馏系列覆盖 Qwen 1.5B/7B/14B/32B 与 Llama 8B/70B,把推理能力下放到可部署规模。
- 其价值在「可控规模内的高质量推理」,具体配方与指标以官方为准。
延伸阅读 / 参考文献
- DeepSeek-AI (2025), DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via RL, arXiv:2501.12948.