数据留在手机上训练,省的是通信不是隐私
厂商介绍里写“模型在用户手机上联合训练,原始数据不出设备”,背后多半是这篇论文的做法:设备本地训练多轮,服务器只平均模型参数。
长期信息
厂商介绍里写“模型在用户手机上联合训练,原始数据不出设备”,背后多半是这篇论文的做法:设备本地训练多轮,服务器只平均模型参数。通信轮数比每步同步梯度少十到百倍,各家数据多少不均也能训。
再看到“数据不出门”的训练宣传,先分清它省下的是什么:是通信成本,不是隐私保障。跨设备训练从传不动变得可行,靠的是本地多训几轮、少传几次这个取舍。
如果证据只来自模拟环境和代理数据集,就别用它推断真实手机上的表现。如果关心的是隐私攻击或恶意更新,论文没处理,别拿它的结论背书。机房里数据集中同分布的场景,本来就用不上它。
《Communication-Efficient Learning of Deep Networks from Decentralized Data》(2016)|下次复查 2027-09-20