研究:AI Agent框架盲目信任生命周期钩子更新,可被供应链攻击植入恶意命令

arXiv论文提出HookPry攻击框架,在 1000 次端到端测试中成功攻破全部 7 个主流Agent harness,成功率最高达 92.5%,现有防御手段效果不佳。

AI解读:AI Agent的所谓“生命周期钩子”是指当会话开始、工具被调用或文件被编辑等事件发生时,框架会自动去执行一些预先绑定好的shell命令。这些命令以主机权限运行,但大模型本身往往看不到它们何时被触发。这篇论文发现,很多框架在更新这些钩子配置时完全不加验证,导致只要攻击者能控制插件元数据或钩子配置文件,就能通过一次看似普通的更新,把恶意命令悄悄绑到正常事件上,实现权限提升等破坏。研究者据此开发了名为HookPry的开源自动化攻击框架,在 25 种框架与后端组合、1000 次端到端测试中,成功攻破了全部 7 个被评估的harness,成功率最高达 92.5%;而微软Defender的检出率为 0%,三种静态防御联合也漏掉 47.5% 的恶意样本。这意味着当前Agent生态对这类供应链攻击几乎是敞开的,尚未大规模爆发只是因为恶意插件还不多。对开发者来说,眼下需要检查所用框架的插件更新机制是否校验了钩子来源或完整性;普通用户则不必恐慌,但应避免安装来源不明的插件,尤其要警惕那些需要生命周期钩子权限的更新。

一篇arXiv预印本论文指出,现代AI Agent harness暴露的“生命周期钩子”(lifecycle hooks)更新路径存在设计级漏洞:框架盲目信任钩子配置更新,使攻击者能在仅控制插件元数据和钩子配置的供应链攻击场景下,将良性插件木马化并执行恶意主机命令。

研究者提出一个名为HookPry的开源全自动攻击框架,在 1000 次端到端运行中,针对 25 种harness与后端组合,成功攻破全部 7 个被评估的harness,单个harness成功率最高达 92.5%。

论文称现有防御不足:微软Defender的召回率为 0%,三种静态防御联合仍漏掉 47.5% 的恶意构件。

攻击面:被盲目信任的钩子更新

论文指出,现代AI Agent harness将shell命令与运行时事件(如会话开始、工具调用、文件编辑)绑定为生命周期钩子。这些命令以主机权限运行,却作为钩子配置随插件分发,且可能在LLM从未观察到的时间点触发。

研究者将“生命周期钩子更新路径”识别为新的攻击面,因为harness对此路径盲目信任。在攻击者仅控制插件元数据和钩子配置的供应链威胁模型下,良性版本化插件可通过一次静默更新被植入攻击者选择的命令,并绑定到良性事件上,导致提权等恶意主机行为。

HookPry攻击效果

HookPry可自动化实现 10 种攻击目标。论文称,在 25 种harness与后端组合、1000 次端到端运行中,它攻破了全部 7 个被评估的harness,每个harness的成功率最高可达 92.5%。

论文未列出实际受影响harness的名称,也未点明具体后端的细节,只称覆盖异构harness。

现有防御失效

论文对代表性防御做了评估:微软Defender对恶意构件的召回率为 0%,即完全无法检出;三种静态防御的联合检出仍漏掉 47.5% 的恶意构件。研究据此认为当前检测手段不足以应对此类攻击。

该论文为预印本,未经同行评审。作者来自多所机构,包括Pengxun Li、Litian Zhang、Jianwei Hou、Shujiang Wu、Song Li、Zifeng Kang、Xi Zhang。论文共 18 页、8 张图,提交于 2026 年 9 月 3 日。

信息来源