定位与前置知识
本文是前沿方向系列的第五篇,进入多模态 / 视觉语言模型(VLM / MLLM)蒸馏。
前置建议:
- 经典 KD(Hinton 2015)与基于响应 / 特征的蒸馏思路;
- 了解 VLM 的近似结构:视觉编码器(Visual Encoder)+ 投影器(Projector)+ 语言模型(LLM)。
本文中 LLaVA-KD 的标题、作者、会议与核心方法已通过 WebSearch 核验(arXiv:2410.16236,ICCV 2025);2025 年综述信息来自已核验事实库第 18 条。凡未逐项核验的实现细节,标注「待核实」。
VLM 蒸馏的独特挑战
VLM 同时处理视觉与语言两种模态,蒸馏难度高于纯文本 LLM:
- 文本蒸馏不够:仅对齐响应 token 的分布,会忽略视觉编码器与投影器所承载的视觉表征,而视觉理解恰恰是 VLM 的核心;
- 架构含多组件:视觉编码器、投影器、LLM 三者耦合,知识分布在「视觉 token 表征」与「语言 token 分布」两处;
- 小模型性能塌缩:直接用大模型的两阶段(预训练→SFT)范式训练小 VLM,性能往往显著下降(具体降幅数字以各论文为准,待核实)。
因此,VLM 蒸馏需要跨模态地迁移知识,而不只是做文本侧的对数对齐。
2025 年综述定位
事实库第 18 条提到:2025 年有一篇《A Comprehensive Survey on Knowledge Distillation for Multimodal Foundation Models》(多模态基础模型知识蒸馏综述,under review)。该综述系统梳理了面向多模态基础模型的蒸馏方法,可作为本方向的「学习地图」。
该综述的具体 taxonomy 与覆盖清单以原文为准(待核实)。本文只引用其存在与主题定位(已核验)。
LLaVA-KD:方法框架
LLaVA-KD(Cai et al., arXiv:2410.16236, ICCV 2025)提出一个把大规模 VLM(l-MLLM,教师)知识迁移到小规模 VLM(s-MLLM,学生)的框架。经核验,其关键设计如下:
1. 多模态蒸馏(MDist, Multimodal Distillation)
MDist 同时在响应 token 与视觉 token 两个维度做 KL 散度蒸馏:
- 响应蒸馏:对齐教师与学生「在响应 token 上的输出分布」,这相当于文本 LLM 蒸馏的常规做法;
- 视觉蒸馏:显式对齐教师与学生在视觉 token 上的输出分布,把视觉模态纳入蒸馏范围。
与仅蒸馏响应 token 的传统 LLM 蒸馏不同,MDist 让视觉-语言表征被全面迁移。
2. 关系蒸馏(RDist, Relation Distillation)
RDist 通过构建视觉 token 的自相关矩阵,迁移教师「捕捉视觉 token 之间关系」的能力。具体做法(经核验概述):
- 分别计算教师、学生视觉 token 的自相关矩阵 $R_v = y_v \otimes y_v$;
- 通过最大化两者余弦相似度来对齐:$L_{rel} = 1 - \mathrm{Cos}(R_v^s, R_v^t)$。
这编码了视觉 token 之间的空间与语义依赖(如物体位置、交互关系),对复杂视觉场景理解至关重要。
3. 三阶段训练范式
LLaVA-KD 设计三阶段以释放蒸馏潜力:
- 蒸馏预训练(DPT):强化学生中视觉-语言表征的对齐;
- 监督微调(SFT):赋予学生多模态理解能力;
- 蒸馏微调(DFT):精调学生的知识表征。
该框架在保持模型架构不变的前提下提升小模型性能(具体提升幅度以原论文评测为准,待核实)。
在本文系列中的位置
| 维度 | 纯文本 LLM 蒸馏 | VLM 蒸馏(LLaVA-KD) |
|---|---|---|
| 蒸馏对象 | 文本 token 分布 / logits | 文本分布 + 视觉 token 分布 + 视觉关系 |
| 代表方法 | MiniLLM / GKD / DistiLLM | LLaVA-KD(MDist + RDist) |
| 额外挑战 | 暴露偏差、长度偏差 | 跨模态对齐、视觉关系迁移 |
可见,VLM 蒸馏是「响应级蒸馏」向「多模态表征 + 关系级蒸馏」的自然扩展。
MDist 与 RDist 为什么互补
两者作用于不同层面,缺一不可:
- MDist 保证「每个 token 上的输出分布」对齐——这是生成正确回答的基础;
- RDist 保证「视觉 token 之间的关系结构」对齐——这决定模型是否真正「看懂」了图里的空间 / 语义布局。
若只做 MDist,学生可能输出流畅但视觉依据错误的答案;若只做 RDist,分布层面未对齐,回答可能跑偏。二者叠加,才构成 LLaVA-KD 宣称的「在不改架构前提下提升小模型性能」的基础(具体提升以原文评测为准,待核实)。
三阶段训练为何必要
LLaVA-KD 的三阶段不是简单堆叠,而是按「表征 → 能力 → 精调」递进:
- DPT(蒸馏预训练):先冻结主干、只训投影器,把视觉-语言对齐打好底,避免一开始就扰动 LLM;
- SFT(监督微调):赋予学生基础多模态理解能力;
- DFT(蒸馏微调):在前两步基础上,用蒸馏进一步精调知识表征。
这种「先对齐、再理解、后精调」的顺序,是针对小 VLM 直接两阶段训练会性能塌缩这一痛点设计的(具体塌缩幅度以各论文为准,待核实)。
与其它 VLM 蒸馏工作的关系(待核实)
事实库第 18 条提到 2025 年多模态基础模型 KD 综述(under review),其中应涵盖除 LLaVA-KD 外的更多 VLM 蒸馏方法(如异构蒸馏、跨架构蒸馏等)。本文因仅核验了 LLaVA-KD 的标题 / 方法,不对其它具体工作展开,相关清单以该综述原文为准(待核实)。
关键直觉(非实现细节)
- MDist 的视觉蒸馏:本质是把「教师在看每个视觉 token 时给出的语言侧分布」教给学生,让学生「用和教师一样的眼光看图」;
- RDist 的自相关:本质是让学生保留「图里哪些区域彼此相关」的结构感知,而不只是逐 token 独立对齐。
两者都不要求改模型结构——这正是 LLaVA-KD 强调「保持架构不变」的底气来源(具体效果以原文评测为准,待核实)。
小结
- VLM 蒸馏必须跨模态迁移知识,纯文本蒸馏不足;
- LLaVA-KD(arXiv:2410.16236, ICCV 2025)以 MDist(多模态蒸馏)+ RDist(关系蒸馏)+ 三阶段训练(DPT→SFT→DFT) 实现高效迁移;
- 2025 年综述为该方向提供系统地图(under review)。
延伸阅读 / 参考文献
- Cai et al., LLaVA-KD: A Framework of Distilling Multimodal Large Language Models, arXiv:2410.16236, ICCV 2025(已 WebSearch 核验).
- A Comprehensive Survey on Knowledge Distillation for Multimodal Foundation Models, 2025(under review,事实库第 18 条).