新防御框架GEO Defender将生成式搜索的恶意GEO攻击成功率从50.32%降至6.20%
arXiv论文提出无需微调目标大语言模型的两阶段防御方案,经七个GEO攻击场景测试,平均攻击成功率降至6.20%,良性证据使用保留94.12%。
AI解读:GEO Defender要解决的问题是:攻击者通过改写网页内容,让生成式搜索引擎更爱引用这些页面,从而操纵AI给出的答案。这类改写往往与原文事实一致,传统的事实核查和困惑度过滤对它们无效。防御框架由盾牌重排器和无需训练的盾牌生成两部分组成——前者在冻结的基础重排器之上学习偏好式防御残差,把被GEO改写的文档排名下调但不伤害正常的相关性判断;后者把防御结果蒸馏成自然语言经验库,在推理时引导目标LLM选择来源。测试显示,在两个闭源和三个开源LLM上面对七种GEO攻击,平均攻击成功率从50.32%降至6.20%,良性证据使用保留94.12%。对搜索引擎和内容运营者而言,这意味着需要检查自身是否暴露在GEO改写攻击之下,以及现有重排器和提示策略能否兼容这种零微调防御;对普通用户说,目前无需操作,该研究仍是预印本且实验条件有限,实际部署效果尚待检验。
arXiv预印本论文(arXiv:2609.02964)提出GEO Defender,一种针对生成式搜索引擎的恶意GEO(Generative Engine Optimization)攻击的两阶段防御框架。实验表明,该方法在七种GEO攻击场景下将平均攻击成功率从 50.32% 降至 6.20%。