隐私保护:差分与联邦
隐私保护关注模型在训练与推理中是否会泄漏个人数据。差分隐私(Differential Privacy)与联邦学习(Federated Learning)是两类被广泛研究的技术,前者在数学上限制单条数据的影响,后者让数据留在本地。
两者解决的侧重点不同:差分隐私回答「单个人是否会被反推出来」,联邦学习回答「原始数据是否离开过设备」。在实务中它们常结合使用,因为仅做联邦学习仍可能从上传的更新中推断信息,而仅做差分隐私又需集中数据。把二者叠加,才能在效用、隐私与合规之间取得更稳的折中。
差分隐私是什么
差分隐私通过向统计结果注入可控噪声,使得「某个人是否在数据集中」难以被反推。经典训练算法 DP-SGD(Abadi 等, 2016)在梯度上加噪声并裁剪,提供可量化的隐私预算(epsilon)。预算越小越隐私,但可能降低精度。
联邦学习是什么
联邦学习让多个终端在本地训练,只上传模型更新而非原始数据,由中心方聚合。它降低了数据集中存储带来的泄露面,适用于手机输入法等敏感场景。但聚合后的更新仍可能泄漏信息,需配合差分隐私。
怎么做:结合使用
常见部署方式:
- 本地训练后上传梯度更新,中心方做安全聚合。
- 聚合时叠加差分隐私噪声,限制成员推断。
- 用隐私预算约束总训练轮数。
# DP-SGD 思路(示意)
for grad in gradients:
grad = clip(grad, norm_bound) # 裁剪
grad += gaussian_noise(sigma) # 加噪
注意点
差分隐私的隐私预算需事前设定并公开。联邦学习不是万能,需防范模型更新被逆向。两类技术都会牺牲一定效用,应在风险等级下取舍。
实践建议
在设计隐私方案时,先从数据最小化做起:只收集必要字段,并尽量在本地处理。对必须集中训练的场景,用差分隐私提供可证明边界,并把隐私预算写入文档向公众说明。联邦学习适合敏感数据分散的场景,但聚合更新仍可能泄漏,应叠加差分隐私与安全的聚合协议。上线后要监控效用下降是否在可接受范围,并定期审计第三方是否合规使用数据,避免「声称隐私保护」却无实际约束。
小结
差分隐私以噪声约束单条数据影响,联邦学习让数据不出本地,二者结合可在训练期降低隐私泄露。它们以效用换取可证明的安全边界。把隐私预算与训练轮数写入公开文档,是对外证明保护力度的硬承诺,也便于用户与审计方核验其是否名副其实,而非停留在宣传话术。
参考与延伸阅读
- DP-SGD 原始论文(Abadi 等, 2016, arXiv)。已核验。https://arxiv.org/abs/1607.00133
- NIST 人工智能风险管理框架(隐私维度)。已核验。https://www.nist.gov/itl/ai-risk-management-framework
- Google 安全人工智能框架 SAIF。已核验。https://saf.dev/