定位与前置知识

本文是前沿方向系列的第五篇,进入多模态 / 视觉语言模型(VLM / MLLM)蒸馏

前置建议:

  1. 经典 KD(Hinton 2015)与基于响应 / 特征的蒸馏思路;
  2. 了解 VLM 的近似结构:视觉编码器(Visual Encoder)+ 投影器(Projector)+ 语言模型(LLM)。

本文中 LLaVA-KD 的标题、作者、会议与核心方法已通过 WebSearch 核验(arXiv:2410.16236,ICCV 2025);2025 年综述信息来自已核验事实库第 18 条。凡未逐项核验的实现细节,标注「待核实」。

VLM 蒸馏的独特挑战

VLM 同时处理视觉语言两种模态,蒸馏难度高于纯文本 LLM:

  • 文本蒸馏不够:仅对齐响应 token 的分布,会忽略视觉编码器与投影器所承载的视觉表征,而视觉理解恰恰是 VLM 的核心;
  • 架构含多组件:视觉编码器、投影器、LLM 三者耦合,知识分布在「视觉 token 表征」与「语言 token 分布」两处;
  • 小模型性能塌缩:直接用大模型的两阶段(预训练→SFT)范式训练小 VLM,性能往往显著下降(具体降幅数字以各论文为准,待核实)。

因此,VLM 蒸馏需要跨模态地迁移知识,而不只是做文本侧的对数对齐。

2025 年综述定位

事实库第 18 条提到:2025 年有一篇《A Comprehensive Survey on Knowledge Distillation for Multimodal Foundation Models》(多模态基础模型知识蒸馏综述,under review)。该综述系统梳理了面向多模态基础模型的蒸馏方法,可作为本方向的「学习地图」。

该综述的具体 taxonomy 与覆盖清单以原文为准(待核实)。本文只引用其存在与主题定位(已核验)。

LLaVA-KD:方法框架

LLaVA-KD(Cai et al., arXiv:2410.16236, ICCV 2025)提出一个把大规模 VLM(l-MLLM,教师)知识迁移到小规模 VLM(s-MLLM,学生)的框架。经核验,其关键设计如下:

1. 多模态蒸馏(MDist, Multimodal Distillation)

MDist 同时在响应 token视觉 token 两个维度做 KL 散度蒸馏:

  • 响应蒸馏:对齐教师与学生「在响应 token 上的输出分布」,这相当于文本 LLM 蒸馏的常规做法;
  • 视觉蒸馏:显式对齐教师与学生在视觉 token 上的输出分布,把视觉模态纳入蒸馏范围。

与仅蒸馏响应 token 的传统 LLM 蒸馏不同,MDist 让视觉-语言表征被全面迁移。

2. 关系蒸馏(RDist, Relation Distillation)

RDist 通过构建视觉 token 的自相关矩阵,迁移教师「捕捉视觉 token 之间关系」的能力。具体做法(经核验概述):

  • 分别计算教师、学生视觉 token 的自相关矩阵 $R_v = y_v \otimes y_v$;
  • 通过最大化两者余弦相似度来对齐:$L_{rel} = 1 - \mathrm{Cos}(R_v^s, R_v^t)$。

这编码了视觉 token 之间的空间与语义依赖(如物体位置、交互关系),对复杂视觉场景理解至关重要。

3. 三阶段训练范式

LLaVA-KD 设计三阶段以释放蒸馏潜力:

  1. 蒸馏预训练(DPT):强化学生中视觉-语言表征的对齐;
  2. 监督微调(SFT):赋予学生多模态理解能力;
  3. 蒸馏微调(DFT):精调学生的知识表征。

该框架在保持模型架构不变的前提下提升小模型性能(具体提升幅度以原论文评测为准,待核实)。

在本文系列中的位置

维度纯文本 LLM 蒸馏VLM 蒸馏(LLaVA-KD)
蒸馏对象文本 token 分布 / logits文本分布 + 视觉 token 分布 + 视觉关系
代表方法MiniLLM / GKD / DistiLLMLLaVA-KD(MDist + RDist)
额外挑战暴露偏差、长度偏差跨模态对齐、视觉关系迁移

可见,VLM 蒸馏是「响应级蒸馏」向「多模态表征 + 关系级蒸馏」的自然扩展。

MDist 与 RDist 为什么互补

两者作用于不同层面,缺一不可:

  • MDist 保证「每个 token 上的输出分布」对齐——这是生成正确回答的基础;
  • RDist 保证「视觉 token 之间的关系结构」对齐——这决定模型是否真正「看懂」了图里的空间 / 语义布局。

若只做 MDist,学生可能输出流畅但视觉依据错误的答案;若只做 RDist,分布层面未对齐,回答可能跑偏。二者叠加,才构成 LLaVA-KD 宣称的「在不改架构前提下提升小模型性能」的基础(具体提升以原文评测为准,待核实)。

三阶段训练为何必要

LLaVA-KD 的三阶段不是简单堆叠,而是按「表征 → 能力 → 精调」递进:

  1. DPT(蒸馏预训练):先冻结主干、只训投影器,把视觉-语言对齐打好底,避免一开始就扰动 LLM;
  2. SFT(监督微调):赋予学生基础多模态理解能力;
  3. DFT(蒸馏微调):在前两步基础上,用蒸馏进一步精调知识表征。

这种「先对齐、再理解、后精调」的顺序,是针对小 VLM 直接两阶段训练会性能塌缩这一痛点设计的(具体塌缩幅度以各论文为准,待核实)。

与其它 VLM 蒸馏工作的关系(待核实)

事实库第 18 条提到 2025 年多模态基础模型 KD 综述(under review),其中应涵盖除 LLaVA-KD 外的更多 VLM 蒸馏方法(如异构蒸馏、跨架构蒸馏等)。本文因仅核验了 LLaVA-KD 的标题 / 方法,不对其它具体工作展开,相关清单以该综述原文为准(待核实)。

关键直觉(非实现细节)

  • MDist 的视觉蒸馏:本质是把「教师在看每个视觉 token 时给出的语言侧分布」教给学生,让学生「用和教师一样的眼光看图」;
  • RDist 的自相关:本质是让学生保留「图里哪些区域彼此相关」的结构感知,而不只是逐 token 独立对齐。

两者都不要求改模型结构——这正是 LLaVA-KD 强调「保持架构不变」的底气来源(具体效果以原文评测为准,待核实)。

小结

  • VLM 蒸馏必须跨模态迁移知识,纯文本蒸馏不足;
  • LLaVA-KD(arXiv:2410.16236, ICCV 2025)以 MDist(多模态蒸馏)+ RDist(关系蒸馏)+ 三阶段训练(DPT→SFT→DFT) 实现高效迁移;
  • 2025 年综述为该方向提供系统地图(under review)。

延伸阅读 / 参考文献

  • Cai et al., LLaVA-KD: A Framework of Distilling Multimodal Large Language Models, arXiv:2410.16236, ICCV 2025(已 WebSearch 核验).
  • A Comprehensive Survey on Knowledge Distillation for Multimodal Foundation Models, 2025(under review,事实库第 18 条).
本文累计阅读