政策美国NIST·2026年9月5日

NIST数学证明:AI无法用有限护栏实现绝对安全,需持续监控更新

美国国家标准与技术研究院(NIST)高级科学家Apostol Vassilev在《IEEE Security & Privacy》发表数学证明,基于哥德尔不完备定理,指出任何有限规则集都无法让AI完全抵御对抗性提示攻击。

AI解读:NIST科学家用数学证明了AI安全的根本局限:像哥德尔1931年证明数学系统不完备一样,任何一组有限的AI护栏规则都必然存在能绕过它们的提示词。这意味着企业花大力气做的内容限制——无论设计多周密——总有被"越狱"的漏洞,攻击者只要找到对的问法就能让AI生成恶意软件或虚假信息。既然堵不完漏洞,现实的出路就变成动态攻防:红队持续找新漏洞、系统不断打补丁、出事时能快速恢复。对开发AI的公司来说,安全预算不再是上线前的一锤子买卖,而是需要长期投入的持续成本——Vassilev的计算是让攻击者找漏洞的成本高过收益,但这并非免费午餐,组织必须接受"部分安全"的代价。对普通用户没有直接影响,但可以理解为什么AI产品的安全补丁会不断更新。

6月2日,美国国家标准与技术研究院(NIST)高级科学家Apostol Vassilev在同行评审期刊《IEEE Security and Privacy》上发表数学证明,指出基于有限规则集的AI护栏永远无法完全抵御对抗性提示攻击。该证明借鉴了1931年数学家库尔特·哥德尔(Kurt Gödel)提出的不完备定理。

Vassilev称,证明表明"不存在一组普遍能抵御对抗性提示的有限护栏",但同时也为防御者留下空间——可以让AI系统"不那么容易被利用"。相关论文题为《Robust AI Security and Alignment: A Sisyphean Endeavor?》(鲁棒AI安全与对齐:一项西西弗斯式的努力?),2026年5月发表于《IEEE Security & Privacy》,DOI: 10.1109/MSEC.2026.3678214。

NIST新闻稿指出,开发AI的公司通常设置护栏,旨在阻止AI生成深度伪造、恶意软件、生物武器或非法药物制造说明等被禁止的内容。然而攻击者可通过精心构造提示词,使AI无意中绕过自身的拒绝机制,造成网络攻击、数据泄露和高度个性化的钓鱼信息等现实风险。

信息来源

美国NIST原始来源