知识蒸馏能解决什么:落地场景与收益

前置知识:本文是系列第 4 篇(L1 入门总览)。建议先读《知识蒸馏是什么》《三大范式》。本文回答一个非常实际的问题:蒸馏到底能帮我解决什么?

一、蒸馏要解决的三个核心诉求

无论 NLP、CV 还是多模态,落地时几乎都卡在同一组矛盾:模型越大越好用,但越大越跑不动、越贵

诉求说明蒸馏如何帮忙
边缘部署手机/嵌入式/IoT 算力、内存有限把大模型压成小模型,装得下、跑得动
推理加速在线服务对延迟敏感小模型前向更快,吞吐更高
降本大模型推理成本高(算力/电费)小模型单位请求成本大幅下降

Hinton 等人 2015 提出软标签与暗知识(arXiv:1503.02531),正是为了让”小模型逼近大模型”成为可行路径,而不只是理论构想。

二、NLP 案例:DistilBERT

最常被引用的工业级成功案例是 DistilBERT(Sanh et al. 2019, DistilBERT, a distilled version of BERT, arXiv:1910.01108,NeurIPS 2019 Workshop on Energy Efficient ML)。

作者报告的关键收益(以下为论文原始披露数字,可直接引用):

  • 模型体积减小约 40%
  • 推理速度提升约 60%
  • 保留约 97% 的 BERT 语言理解性能

这组数字之所以经典,是因为它量化了”压缩-速度-精度”三角:用不到三分之二的体积、快一半以上的速度,几乎不掉点。它也是”绿色 AI / 能效友好”方向的代表——小模型天然更省电。

注:凡事实库未给出的 BERT 具体参数量、FLOPs 等,本文不臆造;如需引用请以原始论文为准。

三、CV 案例:从中间特征到关系结构

蒸馏在计算机视觉同样成熟,几条主线都已在事实库中核验:

  • 基于中间特征的蒸馏:Romero et al. (2015), FitNets: Hints for Thin Deep Nets(arXiv:1412.6550,ICLR 2015)。不只对齐最终输出,而是让”瘦而深”的学生去匹配教师中间隐层,并引入 regressor 对齐特征图尺寸。适合”学生更深更瘦”的场景。
  • 基于注意力的蒸馏:Zagoruyko & Komodakis (2017), Paying More Attention to Attention(arXiv:1612.03928,ICLR 2017)。把教师的**注意力图(attention map)**作为知识迁移,学生模仿教师”看哪里”。
  • 基于关系的蒸馏:Park et al. (2019), Relational Knowledge Distillation(arXiv:1904.05068,CVPR 2019)。迁移的不是单个样本表示,而是样本之间的关系/结构。在强调”样本间相对结构”的任务上更有优势。

这些方法的共同卖点:在保持学生轻量的前提下,用更丰富的监督信号(特征、注意力、关系)缩小与重教师的差距。

四、多模态 / VLM 案例:LLaVA-KD

多模态大语言模型(MLLM)规模膨胀同样限制了端侧部署。LLaVA-KD(Cai et al. 2025, LLaVA-KD: A Framework of Distilling Multimodal Large Language Models, arXiv:2410.16236,ICCV 2025)提出把大模型(l-MLLM)的知识迁移到小模型(s-MLLM):

  • 多模态蒸馏(MDist):跨视觉与语言模态对齐教师鲁棒表示;
  • 关系蒸馏(RDist):迁移教师捕捉视觉 token 间关系的能力;
  • 三阶段训练:蒸馏预训练 → 监督微调 → 蒸馏微调,不改变模型架构即显著提升小模型性能。

它印证了本文主旨:蒸馏的价值不限于 NLP/CV 单模态,在”视觉-语言统一理解”场景下同样成立(综述见 2025 年《A Comprehensive Survey on Knowledge Distillation for Multimodal Foundation Models》,在投)。

五、收益怎么衡量

把三类收益落到可沟通的指标:

  1. 速度:推理延迟(ms)、吞吐(QPS)。DistilBERT 给出的是 +60% 的相对提速。
  2. 体积:参数量、模型文件大小(MB/GB)。DistilBERT 为 -40%。
  3. 能耗:单次推理能耗、单位算力成本。小模型天然更友好——这也是 DistilBERT 选择 Energy Efficient ML Workshop 的原因。
  4. 精度保留率:在小多少的前提下保住百分之几的性能。DistilBERT 为 ~97%。

提醒:除 DistilBERT 的 40%/60%/97% 来自事实库可直接引用外,其他具体数值(如某 CV 模型的 mAP 提升、某 VLM 的准确率)若未在本事实库给出,需以对应原论文为准,本文不编造。

六、落地前的小结清单

动手前先问自己四个问题:

  1. 卡在哪一维?装不下(体积)、跑不快(延迟)、还是太贵(成本)?决定用不用蒸馏。
  2. 有没有教师?有现成大模型直接离线蒸馏;没有则考虑在线/自蒸馏。
  3. 能否接受再训练?蒸馏要训学生;只想快速瘦身优先剪枝+量化。
  4. 怎么量化收益?固定口径:体积%、速度%、能耗、精度保留率,用同一测试集说话。

牢记:除 DistilBERT 的 40%/60%/97% 来自事实库可直接引用外,具体任务的提升数字需以你自己的评测或原论文为准,勿凭印象填数。

七、小结

  • 蒸馏主要解决边缘部署、推理加速、降本三大诉求。
  • NLP:DistilBERT 用 -40% 体积、+60% 速度、~97% 性能守住精度。
  • CV:FitNets(特征)、Attention Transfer(注意力)、RKD(关系)提供多种知识形态。
  • 多模态:LLaVA-KD 把蒸馏推进到 VLM,且保架构。
  • 衡量收益看”体积/速度/能耗/精度保留率”四维。

延伸阅读 / 参考文献

  • Sanh, V., et al. (2019). DistilBERT, a distilled version of BERT. arXiv:1910.01108(NeurIPS 2019 Workshop on Energy Efficient ML).
  • Hinton, G., Vinyals, O., Dean, J. (2015). Distilling the Knowledge in a Neural Network. arXiv:1503.02531.
  • Cai, Y., et al. (2025). LLaVA-KD: A Framework of Distilling Multimodal Large Language Models. arXiv:2410.16236(ICCV 2025).
  • Romero, A., et al. (2015). FitNets: Hints for Thin Deep Nets. arXiv:1412.6550(ICLR 2015).
  • Zagoruyko, S., & Komodakis, N. (2017). Paying More Attention to Attention. arXiv:1612.03928(ICLR 2017).
  • Park, W., et al. (2019). Relational Knowledge Distillation. arXiv:1904.05068(CVPR 2019).
本文累计阅读