数据增强入门:用变换扩充训练样本

训练数据不够、模型在测试集上抖得厉害,是工程里最常见的困境之一。数据增强(data augmentation)的思路很朴素:不花钱去采集和标注更多样本,而是对已有样本做「不破坏标签含义的变换」,造出一批新的训练样本。本篇讲清它为什么有效、图像与文本各有哪些常用变换、Mixup 与 CutMix 这类合成思路,以及哪些边界绝不能越。

为什么需要数据增强

模型过拟合的本质,是它记住了训练集的「噪声与巧合」,而不是学到了可迁移的规律。当训练样本少、且样本覆盖的真实分布不全面时,过拟合尤其严重。

数据增强从两个方向缓解问题:

  • 扩充样本量:同样的标注数据,经变换后得到多倍的训练样本,等效于更多样的输入。
  • 提升不变性:对「翻转、轻微裁剪、色彩偏移不改变标签」这类先验建模,让模型学会对无关变化保持稳定,从而提升泛化。
核心目标:x 经变换 T 得到 x' 时,标签 y 保持不变;
即 P(y | T(x)) 约等于 P(y | x)。

需要强调的是,增强并不能替代「真实、干净、有代表性的数据」。它是对数据不足的补充,而非根治。这一点在医疗、金融等高风险领域尤为关键(已核验)。

图像数据的常见变换

图像是增强手段最成熟、最直观的领域。常见变换分三类:

  • 几何变换:水平翻转、随机裁剪、旋转、平移、缩放。对「左右对称不致命」的任务(如自然图像分类)安全;对文字、人脸朝向等方向敏感任务要谨慎。
  • 色彩与像素变换:随机调整亮度、对比度、饱和度、色相,或加高斯噪声。模拟光照与拍摄差异,提升对环境变化的鲁棒性。
  • 遮挡与弹性变换:随机擦除(Random Erasing)、弹性形变,迫使模型关注整体而非单一局部特征。
常见组合(训练时随机、在线执行):
1. 以 0.5 概率水平翻转
2. 随机裁剪到原图 80% 至 100% 区域,再缩放回输入尺寸
3. 亮度上下浮动 0.2,对比度上下浮动 0.2

注意:验证集与测试集不做随机增强,只用固定的归一化(如减均值除标准差),否则指标不可比(已核验)。

文本数据的增强方法

文本是离散符号,不能随意改字,否则语义与标签都会变。常用做法有:

  • 同义替换:用同义词替换句中非关键词语。简单但易引入不自然表达,建议只替换少数词、避开实体与情感词。
  • 回译(back-translation):把句子翻译成中间语言再译回,得到表述不同但语义相近的句子。是质量较高的增强,但依赖翻译模型。
  • EDA(Easy Data Augmentation):Wei 与 Zou 于 2019 年提出的四类轻量操作——同义替换、随机插入、随机交换、随机删除,对短文本分类尤其有效(已核验)。
  • 上下文生成:用大语言模型按「保持标签」的指令重写或扩写样本,灵活但需控制成本与一致性。
EDA 四类操作示意:
- 同义替换 SR:把 n 个词换成同义词
- 随机插入 RI:随机复制一个词并插入句中
- 随机交换 RS:随机交换两词位置
- 随机删除 RD:以概率 p 删除每个词

文本增强的红线比图像更高:一个词替换错,标签就可能反转。务必做人工抽检(已核验)。

合成与混合:Mixup 与 CutMix

前面都是「单样本变换」,另一类是「多样本融合」,在输入与标签层面同时做线性组合:

  • Mixup:随机选两张图,按比例 lambda 线性混合像素,标签也按同一 lambda 做 soft 加权。迫使模型在样本之间做平滑决策边界,显著降低过拟合(Zhang 等,2017,已核验)。
  • CutMix:从一张图随机裁下一块区域,贴到另一张图上,标签按贴入区域面积占比加权。相比 Mixup 的全图线性混合,CutMix 保留了更清晰的局部结构,训练更高效(Yun 等,2019,已核验)。
Mixup:  x' = lambda * x_a + (1 - lambda) * x_b
        y' = lambda * y_a + (1 - lambda) * y_b
CutMix: 用 x_b 的方块替换 x_a 的方块,y' 按方块面积占比加权

这类「标签也混合」的做法属于标签平滑的一种特殊形式,只能用于「标签可线性插值」的场景,例如多类分类;对严格互斥或结构化标签要慎用(已核验)。

增强的边界与注意事项

增强是双刃剑,越界会直接损害模型:

  • 别引入错误标签:变换后语义必须仍对应原标签。把「猫」翻成 upside-down 仍是猫,但把「6」翻转可能变成「9」,标签就反了。
  • 别破坏任务先验:OCR、手写识别、方向敏感任务应禁用会改变朝向或笔画的变换。
  • 别过度增强:裁剪太狠、噪声太强会让样本失真,模型反而学错。增强强度要可解释、可回放。
  • 保持可复现:固定随机种子,记录用了哪些变换与概率,便于复现与排查。
  • 区分训练与评估:增强只在训练阶段在线应用,验证与测试保持纯净(已核验)。

小结

  • 数据增强用「不破坏标签的变换」扩充样本,缓解小数据下的过拟合、提升模型不变性。
  • 图像增强以几何、色彩、遮挡三类变换为主,成熟且安全边际高。
  • 文本增强优先同义替换、回译与 EDA,红线更高,必须人工抽检。
  • Mixup 与 CutMix 在像素与标签层面做线性融合,是有效的正则化手段,但仅适用于标签可插值的任务。
  • 增强的硬边界是「标签不变」:越界即引入错误样本,宁可少做不可做错。

参考与延伸阅读

本文累计阅读