软标签与硬标签:信息量的差距

本文定位:本文属于「理论基础(L2)」层,帮助你在动手实现蒸馏前,先理解”教师模型到底把什么信息传给了学生”。 前置知识:建议先熟悉 softmax 与交叉熵损失,以及”温度参数 T 会软化输出分布”这一基本事实(核心来源 Hinton et al. 2015)。

1. 硬标签:标准监督信号

在常规分类任务中,训练样本的目标是一个 one-hot(独热)向量

  • 假设有 $K$ 个类别,“猫”对应的标签是 $y=[1,0,0,\dots,0]$。
  • 训练时,模型用普通 softmax 输出概率 $p$,并以交叉熵 $\mathrm{CE}(y,p)$ 作为损失。
  • one-hot 标签只回答一个问题:“这个样本属于哪一类?”

硬标签的缺陷在于:它把所有”非目标类”一视同仁地压成 0,丢弃了类别之间可能存在的任何结构关系。

2. 软标签:教师给出的软化分布

知识蒸馏(Hinton, Vinyals & Dean, 2015, arXiv:1503.02531)的核心做法,是让一个训练好的教师模型对样本产生”软化”后的输出分布,作为监督学生的软标签(soft targets)

软化通过引入温度 $T$ 实现,softmax 改写为:

$$ q_i = \frac{\exp(z_i / T)}{\sum_j \exp(z_j / T)} $$

其中 $z_i$ 是教师第 $i$ 类的 logit。

  • 当 $T=1$ 时,就是普通 softmax;
  • 当 $T>1$ 时,分布被”摊平”,各类概率差距缩小,非目标类也获得非零、且彼此不等的概率质量。

软标签本身仍是一个合法的类别概率分布,但它携带了远超 one-hot 的信息。

3. 信息量差距:类间相似性被保留

硬标签只能告诉学生”这是马”;而软标签还能告诉学生”它像驴的程度高于像汽车的程度”。

具体而言:

  • 教师对一张”马”的图片,可能给出:$P(\text{马})=0.85,;P(\text{驴})=0.10,;P(\text{汽车})=0.002,\dots$
  • 这种”非目标类之间的相对大小”,正是数据中学到的类间语义结构
  • 学生若直接模仿这一分布,就间接获得了”马与驴更接近、与汽车更远”的监督,而不必等模型自己从标注里慢慢悟出来。

Hinton 等人将这种”藏在非目标类相对概率里的信息”称为 dark knowledge(暗知识)——这一点在本文姐妹篇《Dark Knowledge》中会专门展开。

4. 为什么软标签更好:两个直觉

  1. 信息熵更高:one-hot 的信息熵为 0,而软标签是一个有熵的分布,单条样本提供的监督信号更丰富。
  2. 梯度更柔和:硬标签强迫模型把目标类推向 1、其余推向 0,容易过自信(over-confident);软标签允许”合理错误”存在,学生学到的决策边界往往更平滑、泛化更好。

5. 软标签 ≠ 标签平滑(重要区分)

为避免混淆,必须区分两种”软化”:

维度软标签(KD)标签平滑(Label Smoothing)
来源教师模型对数据的预测人工对 one-hot 的规则化修改
非目标类概率由教师按数据/任务结构决定,非均匀均匀分到所有非目标类
是否依赖任务是(任务相关)否(与任务无关,均匀先验)
能否反映”马更像驴”不能(驴和汽车得到相同小概率)

标签平滑由 Szegedy et al. (2016, Rethinking the Inception Architecture for Computer Vision, arXiv:1512.00567) 提出,其目标分布为:

$$ q’(k|x) = (1-\varepsilon),\delta_{k,y} + \frac{\varepsilon}{K} $$

即在正确类保留 $1-\varepsilon$,将其余 $\varepsilon$ 平均分配给全部 $K$ 个类。它确实能抑制模型过度自信,但所有非目标类获得相同概率,本质上是一个与任务无关的均匀正则项。

而蒸馏的软标签,其”错误类”概率来自教师对真实数据的建模,能刻画”马—驴—汽车”这类任务相关的相似度。二者的动机与信息结构都不同:标签平滑是人工、均匀、任务无关的正则;软标签是数据驱动、非均匀、任务相关的监督。

注:正因如此,软标签可看作比标签平滑”信息更密集”的监督信号;二者也可叠加使用,但不应混为一谈。

6. 如何获取并使用软标签

软标签并非凭空出现,它由教师模型对训练数据的前向推理产生。实践中有两种常见获取方式:

  • 离线生成:先用教师跑一遍训练集,把每个样本的软化分布存成新的监督文件,学生训练时直接读取。优点是学生训练不依赖教师在线推理,算力更省、流程更稳定。
  • 在线生成:每个 batch 实时用教师产出软标签。更灵活,也是后来 LLM 蒸馏中 on-policy 方法的起点(如 GKD,Agarwal et al. 2024, arXiv:2306.13649)。

使用时,学生把软标签当作”目标分布”,并在温度 $T$ 下与自己的软化输出对齐;部署阶段则回到普通 softmax($T=1$)。需要提醒两点:

  1. 软标签的质量上限等于教师——若教师在某类上系统性出错,学生也会继承这部分偏差,因此教师本身需经过充分训练与校验。
  2. 这也是为什么在工程上常把”教师质量”视为蒸馏效果的第一决定因素,而非单纯调参可得。

还需指出,软标签的信息增益主要来自”类间结构”,因此它对细粒度分类、长尾分布、类别高度相似的任务收益最大;对类别彼此正交、结构微弱的任务,软标签相对硬标签的优势会收窄。这也是实践中应先评估任务结构、再决定是否上蒸馏的原因。

7. 小结

  • 硬标签(one-hot)信息量低,且丢失类间结构。
  • 软标签(温度软化后的教师输出)保留了非目标类之间的相对概率,蕴含更丰富的监督。
  • 软标签不是标签平滑:前者任务相关、非均匀;后者人工、均匀、任务无关。

延伸阅读 / 参考文献

  • Hinton G., Vinyals O., Dean J. (2015). Distilling the Knowledge in a Neural Network. arXiv:1503.02531.(提出软化 softmax 得到软标签与 dark knowledge 概念)
  • Szegedy C. et al. (2016). Rethinking the Inception Architecture for Computer Vision. arXiv:1512.00567.(标签平滑/LSR 原始定义,用于本文对比)
本文累计阅读