知识蒸馏能解决什么:落地场景与收益
前置知识:本文是系列第 4 篇(L1 入门总览)。建议先读《知识蒸馏是什么》《三大范式》。本文回答一个非常实际的问题:蒸馏到底能帮我解决什么?
一、蒸馏要解决的三个核心诉求
无论 NLP、CV 还是多模态,落地时几乎都卡在同一组矛盾:模型越大越好用,但越大越跑不动、越贵。
| 诉求 | 说明 | 蒸馏如何帮忙 |
|---|---|---|
| 边缘部署 | 手机/嵌入式/IoT 算力、内存有限 | 把大模型压成小模型,装得下、跑得动 |
| 推理加速 | 在线服务对延迟敏感 | 小模型前向更快,吞吐更高 |
| 降本 | 大模型推理成本高(算力/电费) | 小模型单位请求成本大幅下降 |
Hinton 等人 2015 提出软标签与暗知识(arXiv:1503.02531),正是为了让”小模型逼近大模型”成为可行路径,而不只是理论构想。
二、NLP 案例:DistilBERT
最常被引用的工业级成功案例是 DistilBERT(Sanh et al. 2019, DistilBERT, a distilled version of BERT, arXiv:1910.01108,NeurIPS 2019 Workshop on Energy Efficient ML)。
作者报告的关键收益(以下为论文原始披露数字,可直接引用):
- 模型体积减小约 40%;
- 推理速度提升约 60%;
- 保留约 97% 的 BERT 语言理解性能。
这组数字之所以经典,是因为它量化了”压缩-速度-精度”三角:用不到三分之二的体积、快一半以上的速度,几乎不掉点。它也是”绿色 AI / 能效友好”方向的代表——小模型天然更省电。
注:凡事实库未给出的 BERT 具体参数量、FLOPs 等,本文不臆造;如需引用请以原始论文为准。
三、CV 案例:从中间特征到关系结构
蒸馏在计算机视觉同样成熟,几条主线都已在事实库中核验:
- 基于中间特征的蒸馏:Romero et al. (2015), FitNets: Hints for Thin Deep Nets(arXiv:1412.6550,ICLR 2015)。不只对齐最终输出,而是让”瘦而深”的学生去匹配教师中间隐层,并引入 regressor 对齐特征图尺寸。适合”学生更深更瘦”的场景。
- 基于注意力的蒸馏:Zagoruyko & Komodakis (2017), Paying More Attention to Attention(arXiv:1612.03928,ICLR 2017)。把教师的**注意力图(attention map)**作为知识迁移,学生模仿教师”看哪里”。
- 基于关系的蒸馏:Park et al. (2019), Relational Knowledge Distillation(arXiv:1904.05068,CVPR 2019)。迁移的不是单个样本表示,而是样本之间的关系/结构。在强调”样本间相对结构”的任务上更有优势。
这些方法的共同卖点:在保持学生轻量的前提下,用更丰富的监督信号(特征、注意力、关系)缩小与重教师的差距。
四、多模态 / VLM 案例:LLaVA-KD
多模态大语言模型(MLLM)规模膨胀同样限制了端侧部署。LLaVA-KD(Cai et al. 2025, LLaVA-KD: A Framework of Distilling Multimodal Large Language Models, arXiv:2410.16236,ICCV 2025)提出把大模型(l-MLLM)的知识迁移到小模型(s-MLLM):
- 多模态蒸馏(MDist):跨视觉与语言模态对齐教师鲁棒表示;
- 关系蒸馏(RDist):迁移教师捕捉视觉 token 间关系的能力;
- 三阶段训练:蒸馏预训练 → 监督微调 → 蒸馏微调,不改变模型架构即显著提升小模型性能。
它印证了本文主旨:蒸馏的价值不限于 NLP/CV 单模态,在”视觉-语言统一理解”场景下同样成立(综述见 2025 年《A Comprehensive Survey on Knowledge Distillation for Multimodal Foundation Models》,在投)。
五、收益怎么衡量
把三类收益落到可沟通的指标:
- 速度:推理延迟(ms)、吞吐(QPS)。DistilBERT 给出的是 +60% 的相对提速。
- 体积:参数量、模型文件大小(MB/GB)。DistilBERT 为 -40%。
- 能耗:单次推理能耗、单位算力成本。小模型天然更友好——这也是 DistilBERT 选择 Energy Efficient ML Workshop 的原因。
- 精度保留率:在小多少的前提下保住百分之几的性能。DistilBERT 为 ~97%。
提醒:除 DistilBERT 的 40%/60%/97% 来自事实库可直接引用外,其他具体数值(如某 CV 模型的 mAP 提升、某 VLM 的准确率)若未在本事实库给出,需以对应原论文为准,本文不编造。
六、落地前的小结清单
动手前先问自己四个问题:
- 卡在哪一维?装不下(体积)、跑不快(延迟)、还是太贵(成本)?决定用不用蒸馏。
- 有没有教师?有现成大模型直接离线蒸馏;没有则考虑在线/自蒸馏。
- 能否接受再训练?蒸馏要训学生;只想快速瘦身优先剪枝+量化。
- 怎么量化收益?固定口径:体积%、速度%、能耗、精度保留率,用同一测试集说话。
牢记:除 DistilBERT 的 40%/60%/97% 来自事实库可直接引用外,具体任务的提升数字需以你自己的评测或原论文为准,勿凭印象填数。
七、小结
- 蒸馏主要解决边缘部署、推理加速、降本三大诉求。
- NLP:DistilBERT 用 -40% 体积、+60% 速度、~97% 性能守住精度。
- CV:FitNets(特征)、Attention Transfer(注意力)、RKD(关系)提供多种知识形态。
- 多模态:LLaVA-KD 把蒸馏推进到 VLM,且保架构。
- 衡量收益看”体积/速度/能耗/精度保留率”四维。
延伸阅读 / 参考文献
- Sanh, V., et al. (2019). DistilBERT, a distilled version of BERT. arXiv:1910.01108(NeurIPS 2019 Workshop on Energy Efficient ML).
- Hinton, G., Vinyals, O., Dean, J. (2015). Distilling the Knowledge in a Neural Network. arXiv:1503.02531.
- Cai, Y., et al. (2025). LLaVA-KD: A Framework of Distilling Multimodal Large Language Models. arXiv:2410.16236(ICCV 2025).
- Romero, A., et al. (2015). FitNets: Hints for Thin Deep Nets. arXiv:1412.6550(ICLR 2015).
- Zagoruyko, S., & Komodakis, N. (2017). Paying More Attention to Attention. arXiv:1612.03928(ICLR 2017).
- Park, W., et al. (2019). Relational Knowledge Distillation. arXiv:1904.05068(CVPR 2019).