产品The Decoder AI·原文 2026年9月5日

OpenAI GPT-6 Astra:幻觉减少,但间接提示注入攻击仍有8.5%成功率

OpenAI新模型在直接攻击防御上接近完美,但面对隐藏在文档中的提示注入,第三方测试中12个场景约1次被攻破;Claude Opus 5表现更优。

AI解读:OpenAI发布的GPT-6 Astra在减少幻觉和防御直接提示注入方面进步明显,但它的安全短板依然存在:当攻击指令被隐藏在AI读取的文档中时,第三方安全公司Gray Swan测试发现,15次尝试内约有8.5%的场景会被攻破一次,而Anthropic的Claude Opus 5同期成绩为4.8%。这个数字对正在部署自主AI代理的企业是个提醒——代理经常要读文档、操作工具,如果输入不可信,攻击者仍有机会通过间接注入劫持其行为。OpenAI自己的测试环境与生产版本有所不同,实际产品还带有多层安全过滤器,因此真实风险可能低于裸模型测试,但对处理敏感数据或高风险操作的团队来说,最好假定文档来源并非完全可信,并保留人工监督或权限最小化等防护。普通用户日常使用聊天机器人不必为此改变习惯。

OpenAI发布新模型GPT-6 Astra,据其系统卡数据,该模型在用户标记为错误答案的ChatGPT对话测试中,重复这些错误的比例大幅低于前代GPT-5.6 Sol,尤其在低延迟和低推理设置下改善最明显。幻觉减少程度因延迟设置不同而异。

直接提示注入与越狱防御

对于用户通过自身提示发起的直接提示注入攻击,OpenAI称Astra实现了99.99%的防御成功率,归功于训练中使用的GPT-Red方法——一种自动化攻击者模型。

针对生物、暴力和网络安全等领域的已知越狱攻击数据集,Astra在91.5%至98.3%的案例中拒绝提供有害回答。但当攻击者在多轮对话中调整策略时,Astra的防御率降至约67%,意味着持久对手约每三次尝试就能诱出至少一个有问题回答。前代模型在同一测试中得分略低于50%。

OpenAI指出,这些测试在未加生产安全层的裸模型上运行,实际产品还配备了分类器等额外防护。

间接提示注入的第三方测试

间接提示注入是指攻击指令被隐藏在AI读取的文档中。安全公司Gray Swan使用其IPI Arena的1,810个精选攻击,在每场景15次尝试条件下测试发现:GPT-6 Astra至少被攻破一次的比例为8.5%,GPT-5.6 Sol为27%,Claude Opus 5为4.8%。

Gray Swan的Q1和Q2合并测试结果高于早期数字。此前Anthropic仅基于较简单的Q1测试报告过2%的攻击成功率,GPT-5.6 Sol在Q1测试中也只得20%。Anthropic还让所有模型启用扩展推理模式,这可能与测试范围扩大共同解释了成绩差异。

Gray Swan测试模拟的是自主AI代理场景,即模型自行编写代码、操作工具、控制计算机,并全天候规模化运行,处理文档是其核心任务之一。

查看原图 · 2048 × 809

信息来源

The Decoder AI原始来源