新攻击TAS可从已“遗忘”大模型中提取被删提示词,实体恢复准确率 100%
研究称,仅凭保留数据和黑盒访问即可重建被目标遗忘的提示词,查询量比朴素探测减少最多 99.7%。
AI解读:这篇论文揭示了一个新的安全漏洞:所谓“机器遗忘”并不彻底。此前攻击者大多假设被遗忘的提示词已知,只能恢复答案;但TAS方法只需利用模型保留的数据和黑盒访问,就能先构造模板和实体池,用最少查询找出被遗忘的实体(准确率 100%),再重建最多 95% 的遗忘提示词,且查询量比朴素探测少 99.7%。这意味着,即便模型开发者用NPO、DPO、LUNAR等方法移除特定数据,攻击者仍可能通过少量探测还原出这些数据内容。对依赖机器遗忘来满足隐私删除或合规要求(如“被遗忘权”)的机构而言,这直接削弱了它们的合规依据——它们需要意识到“删除”并不等于绝对不可恢复,并可能被迫引入更强的防御机制或重新评估流程。普通用户目前无需立即行动,因为该攻击仍需要一定的模型访问权限和保留数据作辅助。
一项针对机器遗忘模型的新型攻击可在黑盒访问下重建被删除的提示词,研究显示,通过构造模板和实体,TAS能以 100% 准确率识别被遗忘实体,并恢复多达 95% 的遗忘提示词,同时比朴素探测节省最多 99.7% 的查询量。
该论文《Extracting Forgotten Prompts from Targeted Unlearned Models》由Ashley Hoi-Ting Au、Meghdad Kurmanji、William F. Shen、Nicholas D. Lane、Ligang He撰写,发布于arXiv(编号 2609.03662),摘要指出此类攻击利用了遗忘方法(如NPO、DPO、LUNAR)的拒绝对齐机制留下的痕迹。