联邦学习入门:数据不动,模型动
传统机器学习要把数据集中到一处训练,但数据常分散在手机、医院、银行,还涉及隐私合规。联邦学习(Federated Learning)的思路是:模型在各处本地训练,只上传更新,数据不出本地。
基本流程
- 中央服务器把初始模型分发给各参与方(客户端)。
- 每个客户端用本地数据训练几轮,得到模型更新。
- 客户端把更新(而不是数据)回传。
- 服务器聚合所有更新(如取平均),改进全局模型。
- 重复多轮,直到收敛。
为什么需要
- 隐私合规:数据不出域,满足医疗、金融的监管要求。
- 数据孤岛:多家机构各自持数据,难以集中,联邦让协作成为可能。
- 实时性:终端数据持续产生,本地更新比集中收集更及时。
主要挑战
- 通信成本:多轮往返传模型,带宽与延迟是瓶颈。
- 数据异构:各客户端数据分布不一致,影响收敛与公平。
- 客户端异构:设备算力、电量、在线状态差异大。
- 安全风险:模型更新仍可能泄露信息,需要差分隐私等加固(标已核验/待核实)。
典型应用
- 手机输入法:根据本地输入习惯优化,不上传原文。
- 医疗协作:多家医院联合训练影像模型,数据不出院。
- 智能风控:多机构共享欺诈模式而不共享客户明细。
小结
联邦学习用「数据不动、模型动」的方式解决了集中训练与数据隔离的矛盾,但换来了通信与异构的代价。它适合数据分散且隐私敏感的协作场景,落地时要把聚合策略与隐私加固一起设计。
参考与延伸阅读
- Communication-Efficient Learning of Deep Networks from Decentralized Data,McMahan et al.(已核验,联邦学习奠基论文)
- 本站「差分隐私」「AI 监管」相关教程
本文累计阅读 — 次