数据增强进阶:图像与文本增广实战
数据增强(data augmentation)指在不改变样本标签的前提下,对原始训练数据施加可控的变换,制造出更多「看起来不同、本质一致」的训练样本。深度模型通常需要大量数据,而标注昂贵,增广因此成为工业级训练流水线的标配。
图像增广的常见操作
图像领域增广手段最成熟。几何类变换包括随机裁剪、水平翻转、旋转、缩放与平移;像素类变换包括亮度与对比度抖动、色彩通道扰动、加性高斯噪声。更进阶的做法是使用混合样本策略:Mixup 把两张图按权重线性叠加并混合标签,CutMix 则用一张图的局部区域替换另一张图对应区域,二者都能显著提升鲁棒性,相关结论在「mixup: Beyond Empirical Risk Minimization」与「CutMix」原文中给出。
文本增广的难点与做法
文本是离散序列,不能直接做像素扰动。同义替换(用同义词或词向量近邻替换词)、随机删除与插入、回译(先翻译到外语再译回,制造句式重组)是常见手段。近年的 EDA(Easy Data Augmentation)论文系统评估了这四种操作对文本分类小样本的提升。需要注意:文本增广容易引入语义漂移,对情感、事实类任务要控制扰动强度。
自动化与策略搜索
固定增广策略未必最优。AutoAugment 用强化学习在搜索空间中寻找针对特定数据集的最佳增广子策略;后续 RandAugment 简化了搜索,仅用随机采样的增广幅度与层数就达到相近效果,降低计算开销。对资源有限的团队,RandAugment 是更务实的选择。
使用边界与风险
增广不是越多越好。过度几何变换可能让标签失效(例如把「6」翻转成「9」),强噪声可能淹没有效信号。增广应在验证集上观测泛化收益,而非凭直觉堆叠。对于分布敏感任务(如医疗影像),增广假设「变换不改变诊断结论」必须经由领域专家确认。
小结
数据增强以低成本扩充训练多样性,是缓解过拟合的实用手段。图像端有几何、像素与混合样本三类技法,文本端依赖同义替换、回译与 EDA;AutoAugment 与 RandAugment 提供自动化策略。落地时要以验证集收益为准,守住标签一致性边界。
参考与延伸阅读
- mixup 与 CutMix 原始论文(已核验):https://arxiv.org/abs/1710.09412 与 https://arxiv.org/abs/1905.04899
- EDA 文本增广论文(已核验):https://arxiv.org/abs/1901.11196
- AutoAugment 与 RandAugment(已核验):https://arxiv.org/abs/1805.09501 与 https://arxiv.org/abs/1909.13719