定位与前置知识

本文是前沿方向系列的第六篇,也是本系列的「收口」篇。前面五篇分别讲了 LLM 蒸馏(MiniLLM / DistiLLM / DeepSeek-R1)、数据集蒸馏(DC/MTT/DM)、多模态蒸馏(LLaVA-KD)。本文用一篇权威综述作为「学习地图」,把这些点连成面。

前置:建议已读(或计划读)本系列前 5 篇,以及经典 KD 基础。

本文只引用已核验事实库第 16 条:Mansourian et al. (2025)《A Comprehensive Survey on Knowledge Distillation》, arXiv:2503.12067, TMLR。综述的具体 taxonomy 细节以原文为准(凡未逐项核验处标注「待核实」)。

综述定位

《A Comprehensive Survey on Knowledge Distillation》(Mansourian et al., 2025, TMLR) 是一篇综合性综述,目标是对知识蒸馏领域做系统梳理与分类。它通常从「知识类型」「迁移方式」「师生架构关系」「训练机制」等维度组织整个领域,是初学者与研究者都适用的导航。

综述内部的具体分类树、各分支的论文清单,以原文为准(待核实)。本文只借其「综合性综述」的定位,作为本教程的地图框架。

用综述的 taxonomy 重新组织本系列

知识蒸馏常见按「知识从哪来」分类。我们把已核验事实库中的方法归入以下三类(归类基于各论文已核验的核心思想,非逐字引用综述):

A. 基于响应 / 输出(Response-based / Logits-based)

学生模仿教师的最终输出(logits 或软化后的分布):

  • Hinton et al. 2015(温度软化 soft targets,KD 奠基);
  • Ba & Caruana 2014(浅层网络模仿深层网络 logits);
  • MiniLLM(逆向 KL,off-policy,ICLR 2024);
  • DistiLLM(modulated reverse KL + AILD,ICML 2024);
  • GKD(on-policy 自生成样本对齐,ICLR 2024);
  • DeepSeek-R1 蒸馏系列(用 RL 训练的推理教师蒸馏到 Qwen/Llama 1.5B~70B)。

B. 基于特征 / 中间表征(Feature-based / Hint-based)

学生模仿教师的中间隐层

  • FitNets(Romero et al. 2015,hint + regressor 对齐特征图);
  • Attention Transfer(Zagoruyko & Komodakis 2017,以注意力图为知识)。

C. 基于关系 / 结构(Relation-based)

学生模仿样本之间的关系或结构:

  • RKD(Park et al. 2019,样本间关系 / 结构作为知识);
  • LLaVA-KD 的 RDist(视觉 token 自相关关系,ICCV 2025)。

D. 在线 / 互学习(Online / Mutual)

师生角色不是固定的「大教小」,而是学生间互相教学:

  • Born Again Neural Networks(Furlanello et al. 2018,自蒸馏,同构可超教师);
  • Deep Mutual Learning(Zhang et al. 2018,一组学生在线互学习)。

E. 数据维度(Dataset-level)

蒸馏对象从「模型」换为「数据」:

  • DC(Zhao et al. 2021,梯度匹配);
  • MTT(Cazenavette et al. 2022,轨迹匹配);
  • DM(Zhao & Bilen 2021/2023,数据浓缩)。

F. 工程工具与资源

  • DistilBERT(Sanh et al. 2019,体积减 40%、推理快 60%、保留约 97% BERT 性能);
  • EasyDistill(Wang et al. 阿里巴巴, 2025, arXiv:2505.20888, EMNLP 2025 Demo 归属待官方确认, 代码 github.com/modelscope/easydistill);
  • NVIDIA NeMo Framework 官方蒸馏文档(docs.nvidia.com/nemo-framework);
  • TensorRT Model Optimizer(支持训练时蒸馏 / 量化感知)。

本教程系列已覆盖 vs 未覆盖

已覆盖(本系列 6 篇 + 基础):经典 KD、FitNets、Attention Transfer、Born-Again、DML、RKD、DistilBERT、MiniLLM、DistiLLM、GKD、DeepSeek-R1 蒸馏、DC/MTT/DM、LLaVA-KD、综述导航。

本系列尚未展开的方向(标注「待核实」,因事实库未给细节,建议以综述原文为准)

  • 无数据 / 生成式蒸馏(data-free KD):具体代表工作与结论待核实;
  • 量化与蒸馏的协同(QAT + KD):本系列仅在工具层提及 TensorRT,未展开方法;
  • 异构架构蒸馏(CNN↔Transformer 等):代表方法与局限待核实;
  • 面向特定任务的蒸馏(如目标检测、语音、推荐):待核实;
  • 理论分析(KD 为何有效的泛化界 / 信息论解释):待核实;
  • 安全与对齐相关的蒸馏风险(蒸馏是否传递教师偏见):待核实。

作为学习地图的使用建议

  1. 入门:先读 Hinton 2015 + DistilBERT,建立「软标签 + 加权和损失」直觉;
  2. 打基础:FitNets(特征)、Attention Transfer(注意力)、RKD(关系)补全「知识类型」三支柱;
  3. 进前沿:MiniLLM / DistiLLM / GKD 看 LLM 蒸馏的目标函数与采样革新;
  4. 看广度:DC/MTT/DM(数据蒸馏)、LLaVA-KD(多模态)拓展蒸馏的边界;
  5. 查全貌:用 Mansourian et al. 2025 综述回看 taxonomy,定位自己关心的子方向。

如何用本教程配合综述阅读

推荐「由点到面」的读法:

  1. 先用本教程前 5 篇拿到具体方法直觉(MiniLLM / DistiLLM / DeepSeek-R1 / DC-MTT-DM / LLaVA-KD);
  2. 再读 Mansourian et al. 2025 综述,把这些方法「挂」到综述的 taxonomy 节点上;
  3. 回到本篇的「未覆盖方向」清单,挑选综述中你关心、但本系列未展开的支线深入。

这样既能避免「一上来读综述被海量术语劝退」,也能避免「只学单篇而不知全局」。

taxonomy 速查卡(基于已核验方法归纳)

大类关键词本系列代表
响应 / logits软标签、KL、逆向 KL、on/off-policyHinton, MiniLLM, DistiLLM, GKD, R1
特征 / hint中间层、注意力图、regressorFitNets, Attention Transfer
关系 / 结构样本间关系、自相关RKD, LLaVA-KD(RDist)
在线 / 互学习同构、互相教学Born-Again, DML
数据维度梯度匹配、轨迹匹配、浓缩DC, MTT, DM
工具 / 资源框架、量化、代码库DistilBERT, EasyDistill, NeMo

该归类是对已核验方法的归纳,综述官方的分类树可能更细,以原文为准(待核实)。

给研究者的下一步

  • 想做理论:从「为何逆向 KL 缓解暴露偏差」出发,结合 GKD 的 on-policy 视角,可能有统一框架(待核实);
  • 想做应用:VLM 蒸馏(LLaVA-KD)与数据集蒸馏(DC/MTT/DM)都还很新,交叉方向(用数据蒸馏给 VLM 造合成集)值得关注(待核实);
  • 想做工程:EasyDistill、NeMo、TensorRT Model Optimizer 提供现成管线,是先跑通再改进的捷径。

术语小抄

  • KD:Knowledge Distillation,知识蒸馏总称;
  • soft target:温度软化后的教师输出分布;
  • mode-covering / mode-seeking:前向 KL / 逆向 KL 的两种行为特征;
  • on-policy / off-policy:蒸馏样本来自学生自生成 / 固定教师侧;
  • MDist / RDist:LLaVA-KD 的多模态蒸馏 / 关系蒸馏;
  • DC / MTT / DM:数据集蒸馏的三条主干(梯度匹配 / 轨迹匹配 / 浓缩)。

本小抄覆盖本系列出现的核心术语,便于回查。

如何核验本文所述事实

本系列所有具体结论(arXiv 编号、会议、方法名)均来自已核验事实库;凡事实库未给且无法确认者,已标注「待核实」。建议读者:

  1. 用文中的 arXiv 编号直达原论文,核对标题与会议;
  2. 对标注「待核实」的方向,直接查阅 Mansourian et al. 2025 综述原文;
  3. 不把本教程的定性定位当作性能承诺。

这种「以源论文为准」的习惯,本身就是做严谨 KD 研究的第一课。

小结

  • 本系列用一篇 TMLR 2025 综述作地图,把已核验方法归入「响应 / 特征 / 关系 / 在线 / 数据 / 工具」六类;
  • 综述本身提供比本教程更完整的 taxonomy,落地研究请以原文为准;
  • 未覆盖方向均标注「待核实」,避免编造结论。

延伸阅读 / 参考文献

  • Mansourian et al. (2025), A Comprehensive Survey on Knowledge Distillation, arXiv:2503.12067, TMLR.
本文累计阅读