定位与前置知识
本文是前沿方向系列的第六篇,也是本系列的「收口」篇。前面五篇分别讲了 LLM 蒸馏(MiniLLM / DistiLLM / DeepSeek-R1)、数据集蒸馏(DC/MTT/DM)、多模态蒸馏(LLaVA-KD)。本文用一篇权威综述作为「学习地图」,把这些点连成面。
前置:建议已读(或计划读)本系列前 5 篇,以及经典 KD 基础。
本文只引用已核验事实库第 16 条:Mansourian et al. (2025)《A Comprehensive Survey on Knowledge Distillation》, arXiv:2503.12067, TMLR。综述的具体 taxonomy 细节以原文为准(凡未逐项核验处标注「待核实」)。
综述定位
《A Comprehensive Survey on Knowledge Distillation》(Mansourian et al., 2025, TMLR) 是一篇综合性综述,目标是对知识蒸馏领域做系统梳理与分类。它通常从「知识类型」「迁移方式」「师生架构关系」「训练机制」等维度组织整个领域,是初学者与研究者都适用的导航。
综述内部的具体分类树、各分支的论文清单,以原文为准(待核实)。本文只借其「综合性综述」的定位,作为本教程的地图框架。
用综述的 taxonomy 重新组织本系列
知识蒸馏常见按「知识从哪来」分类。我们把已核验事实库中的方法归入以下三类(归类基于各论文已核验的核心思想,非逐字引用综述):
A. 基于响应 / 输出(Response-based / Logits-based)
学生模仿教师的最终输出(logits 或软化后的分布):
- Hinton et al. 2015(温度软化 soft targets,KD 奠基);
- Ba & Caruana 2014(浅层网络模仿深层网络 logits);
- MiniLLM(逆向 KL,off-policy,ICLR 2024);
- DistiLLM(modulated reverse KL + AILD,ICML 2024);
- GKD(on-policy 自生成样本对齐,ICLR 2024);
- DeepSeek-R1 蒸馏系列(用 RL 训练的推理教师蒸馏到 Qwen/Llama 1.5B~70B)。
B. 基于特征 / 中间表征(Feature-based / Hint-based)
学生模仿教师的中间隐层:
- FitNets(Romero et al. 2015,hint + regressor 对齐特征图);
- Attention Transfer(Zagoruyko & Komodakis 2017,以注意力图为知识)。
C. 基于关系 / 结构(Relation-based)
学生模仿样本之间的关系或结构:
- RKD(Park et al. 2019,样本间关系 / 结构作为知识);
- LLaVA-KD 的 RDist(视觉 token 自相关关系,ICCV 2025)。
D. 在线 / 互学习(Online / Mutual)
师生角色不是固定的「大教小」,而是学生间互相教学:
- Born Again Neural Networks(Furlanello et al. 2018,自蒸馏,同构可超教师);
- Deep Mutual Learning(Zhang et al. 2018,一组学生在线互学习)。
E. 数据维度(Dataset-level)
蒸馏对象从「模型」换为「数据」:
- DC(Zhao et al. 2021,梯度匹配);
- MTT(Cazenavette et al. 2022,轨迹匹配);
- DM(Zhao & Bilen 2021/2023,数据浓缩)。
F. 工程工具与资源
- DistilBERT(Sanh et al. 2019,体积减 40%、推理快 60%、保留约 97% BERT 性能);
- EasyDistill(Wang et al. 阿里巴巴, 2025, arXiv:2505.20888, EMNLP 2025 Demo 归属待官方确认, 代码 github.com/modelscope/easydistill);
- NVIDIA NeMo Framework 官方蒸馏文档(docs.nvidia.com/nemo-framework);
- TensorRT Model Optimizer(支持训练时蒸馏 / 量化感知)。
本教程系列已覆盖 vs 未覆盖
已覆盖(本系列 6 篇 + 基础):经典 KD、FitNets、Attention Transfer、Born-Again、DML、RKD、DistilBERT、MiniLLM、DistiLLM、GKD、DeepSeek-R1 蒸馏、DC/MTT/DM、LLaVA-KD、综述导航。
本系列尚未展开的方向(标注「待核实」,因事实库未给细节,建议以综述原文为准):
- 无数据 / 生成式蒸馏(data-free KD):具体代表工作与结论待核实;
- 量化与蒸馏的协同(QAT + KD):本系列仅在工具层提及 TensorRT,未展开方法;
- 异构架构蒸馏(CNN↔Transformer 等):代表方法与局限待核实;
- 面向特定任务的蒸馏(如目标检测、语音、推荐):待核实;
- 理论分析(KD 为何有效的泛化界 / 信息论解释):待核实;
- 安全与对齐相关的蒸馏风险(蒸馏是否传递教师偏见):待核实。
作为学习地图的使用建议
- 入门:先读 Hinton 2015 + DistilBERT,建立「软标签 + 加权和损失」直觉;
- 打基础:FitNets(特征)、Attention Transfer(注意力)、RKD(关系)补全「知识类型」三支柱;
- 进前沿:MiniLLM / DistiLLM / GKD 看 LLM 蒸馏的目标函数与采样革新;
- 看广度:DC/MTT/DM(数据蒸馏)、LLaVA-KD(多模态)拓展蒸馏的边界;
- 查全貌:用 Mansourian et al. 2025 综述回看 taxonomy,定位自己关心的子方向。
如何用本教程配合综述阅读
推荐「由点到面」的读法:
- 先用本教程前 5 篇拿到具体方法直觉(MiniLLM / DistiLLM / DeepSeek-R1 / DC-MTT-DM / LLaVA-KD);
- 再读 Mansourian et al. 2025 综述,把这些方法「挂」到综述的 taxonomy 节点上;
- 回到本篇的「未覆盖方向」清单,挑选综述中你关心、但本系列未展开的支线深入。
这样既能避免「一上来读综述被海量术语劝退」,也能避免「只学单篇而不知全局」。
taxonomy 速查卡(基于已核验方法归纳)
| 大类 | 关键词 | 本系列代表 |
|---|---|---|
| 响应 / logits | 软标签、KL、逆向 KL、on/off-policy | Hinton, MiniLLM, DistiLLM, GKD, R1 |
| 特征 / hint | 中间层、注意力图、regressor | FitNets, Attention Transfer |
| 关系 / 结构 | 样本间关系、自相关 | RKD, LLaVA-KD(RDist) |
| 在线 / 互学习 | 同构、互相教学 | Born-Again, DML |
| 数据维度 | 梯度匹配、轨迹匹配、浓缩 | DC, MTT, DM |
| 工具 / 资源 | 框架、量化、代码库 | DistilBERT, EasyDistill, NeMo |
该归类是对已核验方法的归纳,综述官方的分类树可能更细,以原文为准(待核实)。
给研究者的下一步
- 想做理论:从「为何逆向 KL 缓解暴露偏差」出发,结合 GKD 的 on-policy 视角,可能有统一框架(待核实);
- 想做应用:VLM 蒸馏(LLaVA-KD)与数据集蒸馏(DC/MTT/DM)都还很新,交叉方向(用数据蒸馏给 VLM 造合成集)值得关注(待核实);
- 想做工程:EasyDistill、NeMo、TensorRT Model Optimizer 提供现成管线,是先跑通再改进的捷径。
术语小抄
- KD:Knowledge Distillation,知识蒸馏总称;
- soft target:温度软化后的教师输出分布;
- mode-covering / mode-seeking:前向 KL / 逆向 KL 的两种行为特征;
- on-policy / off-policy:蒸馏样本来自学生自生成 / 固定教师侧;
- MDist / RDist:LLaVA-KD 的多模态蒸馏 / 关系蒸馏;
- DC / MTT / DM:数据集蒸馏的三条主干(梯度匹配 / 轨迹匹配 / 浓缩)。
本小抄覆盖本系列出现的核心术语,便于回查。
如何核验本文所述事实
本系列所有具体结论(arXiv 编号、会议、方法名)均来自已核验事实库;凡事实库未给且无法确认者,已标注「待核实」。建议读者:
- 用文中的 arXiv 编号直达原论文,核对标题与会议;
- 对标注「待核实」的方向,直接查阅 Mansourian et al. 2025 综述原文;
- 不把本教程的定性定位当作性能承诺。
这种「以源论文为准」的习惯,本身就是做严谨 KD 研究的第一课。
小结
- 本系列用一篇 TMLR 2025 综述作地图,把已核验方法归入「响应 / 特征 / 关系 / 在线 / 数据 / 工具」六类;
- 综述本身提供比本教程更完整的 taxonomy,落地研究请以原文为准;
- 未覆盖方向均标注「待核实」,避免编造结论。
延伸阅读 / 参考文献
- Mansourian et al. (2025), A Comprehensive Survey on Knowledge Distillation, arXiv:2503.12067, TMLR.