📦知识蒸馏
从 Hinton 2015 软标签到 LLM 与多模态蒸馏的系统学习路径:理论基础、主流方法、工程化流程与前沿方向。
共 41 篇教程 · 6 个主题
入门总览
5 篇 知识蒸馏是什么:从"老师教学生"到模型压缩的核心思想 用"教师-学生"范式讲清知识蒸馏的定义、暗知识为何可被小模型学会,以及它和直接训练小模型的根本区别。 知识蒸馏发展简史:从 2006 模型压缩到 2015 Hinton 沿 2006 模型压缩、2014 浅层模仿深层、2015 Hinton 软标签三条主线,梳理知识蒸馏的早期关键里程碑与每阶段贡献。 知识蒸馏三大范式:离线/在线/自蒸馏 区分离线蒸馏(经典 Hinton)、在线蒸馏(如 DML 互学习)与自蒸馏(如 BAN),并对比各自适用场景。 知识蒸馏能解决什么:落地场景与收益 从边缘部署、推理加速、降本三类诉求出发,结合 DistilBERT、CV 与多模态案例说明蒸馏的真实收益。 蒸馏 vs 剪枝 vs 量化:模型压缩三件套的定位 厘清蒸馏、剪枝、量化三种模型压缩手段的作用对象与差异,说明它们可组合,并点明蒸馏的独特价值。
理论基础
5 篇 温度参数 Temperature 的数学原理与作用 从 softmax 出发推导温度 T 如何软化概率分布,解释 T→∞ 趋近均匀、T=1 即原始,以及 T 如何暴露暗知识。 软标签与硬标签:信息量的差距 对比 one-hot 硬标签与温度软化后的软标签,说明软标签蕴含类间相似性等更丰富监督信息,并区分于标签平滑。 KL 散度与交叉熵:蒸馏损失的信息论基础 从信息论角度解释 KL 散度与交叉熵的关系,说明蒸馏为何用 KL 匹配教师的软标签分布。 Dark Knowledge:模型从"错误概率"里学到了什么 解释 Hinton 提出的 dark knowledge 概念:非目标类的相对概率蕴含类间结构信息,是软标签价值的核心来源。 蒸馏损失函数与权重设计:软损失+硬损失的平衡 给出 Hinton 蒸馏损失 L=α·T²·KL(软)+(1-α)·CE(硬) 的形式,解释 T² 系数来源与 α 的调参直觉。
主流方法体系
7 篇 响应基蒸馏(Logits 蒸馏):最经典的一类 介绍基于最后一层 logits 的响应基蒸馏,对应 Hinton 2015 软标签法与 Ba & Caruana 2014 的 logits 模仿,并给出实现要点与伪代码。 特征基蒸馏:FitNets 的 hint learning 介绍特征基蒸馏与 FitNets(Romero 2015):通过匹配教师中间隐层(hint)并引入 regressor 对齐特征图,弥补响应基只用输出层的不足。 关系基蒸馏:样本间结构即知识 以样本对之间的距离、角度等「关系结构」作为迁移知识,代表方法为 RKD(Park et al. 2019)。 注意力迁移 Attention Transfer 以网络的注意力图(attention map)作为迁移知识,让学生复现教师的空间/通道激活分布。 自蒸馏与 Born-Again Networks 学生与教师同构的自蒸馏范式(BAN),可迭代训练并可能超越原教师。 在线互学习 Deep Mutual Learning 一组学生网络在训练过程中互相教学,无需预训练教师。 多教师蒸馏:集百家之长 用多个教师的集成或平均软标签训练单个学生,融合多家知识。
工程化流程
11 篇 知识蒸馏工程化六阶段总览 以六阶段框架(选型→数据→调参→训练→评估→部署)串联知识蒸馏从实验到落地的全流程。 阶段一:教师模型选型与能力评估 知识蒸馏工程化流程的第一阶段:如何评估并选择教师模型,在能力上限与训练成本之间取得平衡。 阶段二:数据准备与增强策略 知识蒸馏工程化流程的第二阶段:围绕教师可用性组织无标签/弱标签数据,并设计分布匹配与增强策略。 阶段三:温度 T 与损失权重调参 知识蒸馏工程化流程的第三阶段:掌握温度 T 对软标签的软化作用,以及软/硬损失权重 α 的平衡方法。 阶段四:训练策略(学习率/批次/早停) 知识蒸馏工程化流程的第四阶段:学生优化器、学习率策略、批次设置与早停准则,并以 DistilBERT 为实证案例。 阶段五:学生模型评估与对齐 蒸馏得到学生模型后,如何从精度、速度、体积、能耗四个维度系统评估,并量化其与教师模型的对齐度。 阶段六:量化/剪枝/部署落地 蒸馏学生通过评估后,如何叠加量化与剪枝进一步压缩,并经由 ONNX / TensorRT 等推理引擎完成服务端或端侧部署。 工具框架(一):Hugging Face Transformers 蒸馏 讲解如何用 Hugging Face Transformers 的 Trainer 子类与 no_trainer 脚本落地知识蒸馏,并以 DistilBERT 的三重损失为范例。 工具框架(二):NVIDIA NeMo / TensorRT Model Optimizer 介绍 NVIDIA NeMo Framework 的蒸馏训练能力与 TensorRT Model Optimizer 的训练时蒸馏/量化感知,覆盖 logits 蒸馏流程、YAML 配置与局限。 工具框架(三):Arcee DistillKit 与阿里 EasyDistill 梳理 Arcee DistillKit 与阿里 EasyDistill 两套 LLM 蒸馏工具链的定位、能力与适用场景。 硬件配置:GPU 选型与显存/算力估算 蒸馏需同时运行教师与学生,算力与显存需求高于单纯训练小模型;给出显存估算方法与硬件选型建议。
经典论文精读
5 篇 论文精读:Hinton 2015《Distilling the Knowledge in a Neural Network》 精读知识蒸馏奠基论文 Hinton 2015:从集成模型部署痛点出发,用温度软化 softmax 提取暗知识,构建软/硬损失加权的蒸馏框架。 论文精读:Bucilă 2006《Model Compression》 精读知识蒸馏的工程先驱 Bucilă 2006《Model Compression》:用无标签数据 + 集成伪标签训练单个小模型,比 Hinton 早九年。 论文精读:Ba & Caruana 2014《Do Deep Nets Need to be Deep?》 精读 Ba & Caruana 2014,剖析其用浅层宽网络回归教师 logits 的模仿学习范式,以及"深度非表示必需、而是优化辅助"的核心结论。 论文精读:FitNets 2015(Romero et al.) 精读 FitNets 2015,解析其用 hint 层与 regressor 对齐中间特征、两阶段训练瘦深学生的方案,以及"基于特征的蒸馏"范式的开端。 论文精读:DistilBERT 2019 (Sanh et al.) 精读 DistilBERT:用 triple loss 蒸馏 BERT,得到体积减 40%、提速 60%、保留约 97% 性能的小模型。
前沿方向
8 篇 前沿:GKD / On-Policy Distillation (ICLR 2024) GKD 让学生在自身生成的样本上与教师对齐,缓解分布偏移,是面向可扩展推理的 on-policy 蒸馏范式。 前沿:推理定向蒸馏(面向 Chain-of-Thought) 把推理链/思维链蒸馏给学生,结合 R1 蒸馏实践与 on-policy(GKD)思想,并讨论长序列与分布挑战。 前沿:MiniLLM 与逆向 KL 散度 (ICLR 2024) MiniLLM 用逆向 KL 散度替代传统前向 KL,在 off-policy 设定下缓解 LLM 蒸馏中的 mode-covering 与暴露偏差问题,并与 on-policy 的 GKD 形成对照。 前沿:DistiLLM (ICML 2024) DistiLLM 以「调制逆向 KL(modulated reverse KL)」加「进阶 logit 蒸馏(AILD)」构成面向 LLM 的精简(streamlined)蒸馏方案,与 MiniLLM / GKD 形成方法谱系上的承接。 前沿:DeepSeek-R1 蒸馏系列实战解读 DeepSeek-R1 通过强化学习得到强推理教师,并开源蒸馏出 Qwen / Llama 1.5B~70B 系列小模型,把「推理能力」下放到可本地部署的规模。 前沿:数据集蒸馏 DC/MTT/DM 数据集蒸馏与模型蒸馏相对:它压缩的是「训练数据」而非「模型」,代表性方法 DC(梯度匹配)、MTT(轨迹匹配)、DM(数据浓缩)让少量合成样本即可训练出逼近全量集的模型。 前沿:多模态/视觉语言模型蒸馏 (LLaVA-KD, ICCV 2025) 多模态大模型(VLM)蒸馏需同时迁移视觉与语言知识;LLaVA-KD (ICCV 2025, arXiv:2410.16236) 以多模态蒸馏(MDist)+关系蒸馏(RDist)与三阶段训练,将大模型知识高效迁移到小模型。 前沿综述与资源导航:A Comprehensive Survey on KD (TMLR 2025) 以 Mansourian et al. 2025 (TMLR, arXiv:2503.12067) 综述为学习地图,梳理知识蒸馏的方法 taxonomy,并把本教程系列覆盖的已核验工作归入其中,同时列出本系列尚未展开的方向。
没有匹配的教程,换个关键词、难度或主题试试。