国内刊号:31-1289/TP
国际刊号:1000-3428
发布日期:
作者:顾永跟, 高凌轩, 吴小红, 陶杰
单位:湖州师范学院信息工程学院, 浙江 湖州 313000
关键词:联邦半监督学习,联邦学习,数据非独立同分布,鲁棒性,聚合算法,数据分享
基金:浙江省现代农业资源智慧管理与应用研究重点实验室项目(2020E10017)。
联邦学习作为一种保护本地数据隐私安全的分布式机器学习方法,联合分散的设备共同训练共享模型。通常联邦学习在数据均有标签情况下进行训练,然而现实中无法保证标签数据完全存在,提出联邦半监督学习。在联邦半监督学习中,如何利用无标签数据提升系统性能和如何缓解数据异质性带来的负面影响是两大挑战。针对标签数据仅在服务器场景,基于分享的思想,设计一种可应用在联邦半监督学习系统上的方法Share&Mark,该方法将客户端的分享数据由专家标记后参与联邦训练。同时,为充分利用分享的数据,根据各客户端模型在服务器数据集上的损失值动态调整各客户端模型在联邦聚合时的占比,即ServerLoss聚合算法。综合考虑隐私牺牲、通信开销以及人工标注成本3个方面的因素,对不同分享率下的实验结果进行分析,结果表明,约3%的数据分享比例能平衡各方面因素。此时,采用Share&Mark方法的联邦半监督学习系统FedMatch在CIFAR-10和Fashion-MNIST数据集上训练的模型准确率均可提升8%以上,并具有较优的鲁棒性。
来源:2024年第6期
《计算机工程》期刊编辑部