FGLGuard:用联邦图学习为LLM多智能体系统做隐私保护安全防护,不加池化数据便超集中式上限
跨机构共享提示词和工具输出会触隐私红线。FGLGuard让各运营商只共享模型更新,并在三项基准上超过域内集中式防护的AUROC上限。
AI解读:多智能体系统(多个大模型协作完成任务)在跨公司部署时,安全防护一直两难:想精准识别哪个智能体被攻击,就得集中所有人的对话和工具调用日志来训练检测器,但这会泄露提示词、业务数据等私密信息。FGLGuard用联邦图学习绕开这个矛盾——每家运营商在自己的数据上训练一个图注意力检测器,只把模型参数更新上传,不共享原始数据。结果是(依据论文摘要),在Agent-SafetyBench、R-Judge、AgentDojo三个基准上,联邦训练超过了此前域内集中式训练的上限,而且把AgentDojo的真实攻击成功率降低了 43%,API成本近乎为零。这意味着,想部署多智能体安全防护的金融机构、医疗系统等跨组织团队,现在有了一个能适应各自私有数据分布、又不用交出敏感信息的选项。不过这套方法依赖各家能自己给数据做标注(用评判模型标记攻击样本),没有标注能力的小团队可能用不上;目前也还没有公开的真实行业客户部署数据,43% 的降幅是论文报告的基准测试结果。
arXiv论文(编号 2609.02967,2026 年 9 月 2 日提交)提出FGLGuard,一种针对基于LLM的多智能体系统(MAS)的隐私保护联邦图学习安全防护机制。
FGLGuard的核心是:不聚合各运营商的原始数据,而是让每家在自己的评判标注片段图上独立训练一个带边特征的图注意力检测器,仅共享模型更新。
论文摘要指出,在Agent-SafetyBench、R-Judge和AgentDojo三项基准上,联邦FGLGuard在不池化任何数据的情况下,超过了域内集中式防护的性能上限,而现有无监督异常检测防护和仅本地训练的方法在三项基准上均告失败。
论文报告,对四个不同领域运营商的联邦防护,其AUROC值与多域集中式防护相差 0.03 以内,而任何单域防护在其他领域上都会失效。
为什么需要联邦:集中式假设在跨组织场景失效
论文称,现有的拓扑引导式防护(在智能体通信图上训练GNN来定位风险智能体并干预拓扑)假设单一运营商可以集中管理所有标注轨迹。但跨组织时该假设不成立:片段包含私有提示词、工具输出和专有工作流,且单方无法看到全局攻击分布。
摘要强调联邦不是可选项:现成模型(off-the-shelf transfer)在分布偏移下失效,AUROC仅达 0.51,经域内重训练后才到 0.70,因此部署的防护必须适应各站点的私有数据痕迹。
- FGLGuard结合了多个技术组件:非IID客户端的近端局部目标、域平衡聚合、过度拒答约束的阈值校准、佐证上游评分,以及针对被拦截回答的安全改写(guarded rewrite)。
- 实验评估使用Agent-SafetyBench、R-Judge和AgentDojo三个基准。
实时性能:攻击成功率下降 43%,API成本为零
论文摘要报告,实时版FGLGuard在AgentDojo上,将基线攻击成功率降低了 43%,同时保持近乎无防护状态的效用,API成本为零,能力损失可忽略。
论文将分类归入密码学与安全(cs.CR)、人工智能(cs.AI)、机器学习(cs.LG)和多智能体系统(cs.MA)。