机器遗忘(Machine Unlearning):让模型忘记特定数据
模型一旦用某批数据训成,相关数据就「嵌」进了参数里。当用户要求删除其个人数据、或某批训练数据需下线时,仅删除原始文件并不能从模型中抹去影响。机器遗忘研究如何在尽量不重训的前提下,让模型表现得「好像从未见过」那些数据。本文面向工程与合规读者,梳理动机、方法、评估与落地难点。
一、为什么模型需要「遗忘」:从被遗忘权到数据下线
监管与业务都提出了明确的「删除」诉求。
- 法规被遗忘权:欧盟《通用数据保护条例》(GDPR)第 17 条规定了「删除权」(right to erasure),该条例于 2018 年 5 月生效【已核验,来源:Wikipedia Right to be forgotten】。数据主体有权要求控制者删除与其相关的个人数据并停止传播。
- 数据与版权下线:训练语料混入受版权保护内容、被撤回许可或含敏感信息的样本时,权利人可要求将其从模型中移除。
- 错误与有害数据:训练集中存在标注错误、偏见或投毒样本时,需要定点清除其影响,而非整体重训。
朴素做法是「删除数据后从头重训」,但大模型一次训练成本高昂,难以逐条请求即时响应,于是催生了专用遗忘技术。
二、精确遗忘与近似遗忘
按是否严格等价于「从未训练过」,遗忘分为两类。
- 精确遗忘(Exact Unlearning):处理后模型与「剔除目标数据后从头训练」的模型在统计上不可区分。优点是可合规论证,代价是需特定训练结构支持。
- 近似遗忘(Approximate Unlearning):不追求严格等价,只把目标数据的影响削弱到难以恢复。实现灵活、成本低,但需评估佐证遗忘有效。
判定维度
精确遗忘:分布一致,可证明,常依赖分片/切片结构
近似遗忘:分布接近,效率高,依赖评估验证遗忘充分性
三、主流方法:梯度上升、影响函数与切片重训
**梯度上升(Gradient Ascent)**属于近似遗忘,对「遗忘集」执行损失最大化方向的微调,直接削弱模型在该数据上的表现。
参数更新(遗忘目标数据 D_f):
theta <- theta + eta * grad_theta L(D_f; theta)
其中 L 为损失函数,eta 为学习率。
目标:增大遗忘集损失,降低模型对 D_f 的记忆。
**影响函数(Influence Functions)**利用二阶导数的逆(海森矩阵)近似单条训练样本对参数的影响,据此做一次性权重修正,无需迭代优化。
样本 z 对测试损失的影响近似:
I(z) = - grad_theta L_test(z_test)^T * H_theta^{-1} * grad_theta L_train(z)
削弱:沿影响方向反向调整参数,降低 z 的贡献。
**切片重训(SISA)**是精确遗忘的代表性训练结构,由 Bourtoule 等人 2021 年论文「Machine Unlearning」提出【已核验,来源:Wikipedia Machine unlearning】。它将训练集分为多个分片,每片独立训练并在切片边界保存检查点;收到遗忘请求时,只回滚到目标数据进入前的检查点并重训受影响切片,再聚合各分片输出。
SISA 四步
Sharded 分片:训练集划分为不相交子集,各训一个子模型
Isolated 隔离:分片独立训练,互不污染
Sliced 切片:分片内再切片并保存检查点,便于回滚
Aggregated 聚合:推理时组合各子模型输出(如投票/平均)
四、如何评估遗忘:遗忘效果与效用保留
遗忘不能「忘掉该忘的,却丢掉该留的」,评估需同时看两端。
- 遗忘效果(Forget Quality):目标数据在遗忘后是否不可恢复。常用成员推断攻击,若攻击方无法区分目标样本是否参与过训练,说明遗忘较充分。
- 效用保留(Utility Preservation):模型在保留集与测试集上的准确率、损失应与「从头重训的黄金模型」接近,不能显著退化。
- 近似度指标:以模型参数距离或输出分布 KL 散度衡量与黄金模型的接近程度。
评估对照表(示意)
指标 目标
成员推断准确率 接近 50%(无法区分)
保留集准确率 与黄金模型差距小
输出分布 KL 尽量低
五、落地挑战
- 计算与存储成本:SISA 需保存多分片、多检查点,存储与推理聚合成本上升,且分片可能轻微损伤整体精度。
- 验证困难:近似遗忘缺乏严格证明,遗忘是否「足够」依赖评估手段,而成员推断只是必要条件而非充分证明。
- 大模型适配:十亿级参数模型的遗忘在成本与稳定性上仍不成熟,梯度上升易引发灾难性遗忘或效用崩塌。
- 边界与范围:当目标数据影响已扩散到表征的多个层,难以精准定位并隔离其影响【待核实,具体机理仍为活跃研究课题】。
小结
机器遗忘把「删除权」从原始数据延伸到已训练模型,核心是让模型表现得「从未见过」目标数据。工程上分精确遗忘(如 SISA 切片重训,可证明但结构受限)与近似遗忘(如梯度上升、影响函数,灵活但需评估佐证)。落地的关键是同时满足遗忘效果与效用保留,并在成本、验证与大模型适配之间权衡。
参考与延伸阅读
Bourtoule 等,Machine Unlearning(NeurIPS 2021,arXiv:1912.03817)提出 SISA 训练框架,是精确遗忘的奠基性工作。Cao 与 Yang 早年的「towards making systems forget」研究奠定了遗忘的概念基础。关于影响函数可参考 Koh 与 Liang 的「Understanding Black-box Predictions via Influence Functions」。GDPR 第 17 条「删除权」条款原文见欧盟官方公报与各国数据保护机构解读。动手实验可检索机器遗忘公开基准(如 ForgetCV、TOFU)以对比不同方法的遗忘质量与效用保留。