联邦学习入门:数据不动,模型动

传统机器学习要把数据集中到一处训练,但数据常分散在手机、医院、银行,还涉及隐私合规。联邦学习(Federated Learning)的思路是:模型在各处本地训练,只上传更新,数据不出本地。

基本流程

  • 中央服务器把初始模型分发给各参与方(客户端)。
  • 每个客户端用本地数据训练几轮,得到模型更新。
  • 客户端把更新(而不是数据)回传。
  • 服务器聚合所有更新(如取平均),改进全局模型。
  • 重复多轮,直到收敛。

为什么需要

  • 隐私合规:数据不出域,满足医疗、金融的监管要求。
  • 数据孤岛:多家机构各自持数据,难以集中,联邦让协作成为可能。
  • 实时性:终端数据持续产生,本地更新比集中收集更及时。

主要挑战

  • 通信成本:多轮往返传模型,带宽与延迟是瓶颈。
  • 数据异构:各客户端数据分布不一致,影响收敛与公平。
  • 客户端异构:设备算力、电量、在线状态差异大。
  • 安全风险:模型更新仍可能泄露信息,需要差分隐私等加固(标已核验/待核实)。

典型应用

  • 手机输入法:根据本地输入习惯优化,不上传原文。
  • 医疗协作:多家医院联合训练影像模型,数据不出院。
  • 智能风控:多机构共享欺诈模式而不共享客户明细。

小结

联邦学习用「数据不动、模型动」的方式解决了集中训练与数据隔离的矛盾,但换来了通信与异构的代价。它适合数据分散且隐私敏感的协作场景,落地时要把聚合策略与隐私加固一起设计。

参考与延伸阅读

  • Communication-Efficient Learning of Deep Networks from Decentralized Data,McMahan et al.(已核验,联邦学习奠基论文)
  • 本站「差分隐私」「AI 监管」相关教程
本文累计阅读