FedPS框架发布:基于聚合统计的联邦学习数据预处理方案

牛津大学等研究者提出FedPS框架,利用数据草图技术在不共享原始数据的前提下完成特征缩放、编码、离散化与缺失值填充。该论文已接收于TMLR 2026。

AI解读:联邦学习允许多方在不共享原始数据的情况下共同训练模型,但训练之前的数据预处理——如处理缺失值、统一格式、缩放特征——长期被忽视。FedPS的核心思路是让每个参与方用数据草图技术对本地数据生成精简统计摘要,再基于这些摘要设计联邦化的预处理算法,从而在不集中原始数据、兼顾通信效率的前提下完成特征缩放、编码、离散化和缺失值填补。对实际部署联邦学习的企业或机构而言,这意味着数据准备阶段不再被迫回到中心化处理,能更好地保护数据隐私。不过,目前公开材料仅限于论文摘要和方法概述,尚未提供与现有预处理方法的对比实验结果或通信开销的具体数字,实际效果仍需阅读全文或复现验证。

arXiv发表的一篇新论文提出了FedPS框架,用于在联邦学习环境中进行数据预处理。论文作者为Xuefeng Xu和Graham Cormode。来源为arXiv摘要,论文已接收于TMLR 2026(预计2026年发表),共27页,含8张图和7张表。

联邦学习允许多方在不共享原始数据的情况下协作训练机器学习模型。但研究者指出,训练前的数据预处理(如处理缺失值、纠正不一致格式、消除特征量纲差异)对模型性能至关重要,却长期被联邦学习研究忽视。在隐私约束下无法集中原始数据,通信效率又给分布式预处理带来额外挑战。

FedPS方法论与支持范围

FedPS框架基于聚合统计进行联邦数据预处理。据论文摘要,它利用数据草图技术高效汇总本地数据集,同时保留关键统计信息。

在此摘要基础上,研究者设计了联邦化的特征缩放、编码、离散化和缺失值填充算法,还将贝叶斯线性回归等预处理相关模型扩展到横向与纵向联邦学习两种设置(horizontal and vertical FL)。

论文摘要称,FedPS为实际联邦学习部署提供了灵活、通信高效且一致的预处理流程。

论文网址为https://arxiv.org/abs/2602.10870,arXiv编号2602.10870。摘要显示该论文于2026年2月11日首次提交,2026年9月3日更新。

信息来源