研究ByteByteGo·原文 2026年8月25日本站收录 2026年9月6日

研究团队“盗取”Anthropic、OpenAI及Google专有模型的隐藏推理过程

MATS Research等机构在2026年8月证明,AI提供商发回客户的加密推理块可被同系列更便宜模型以明文形式转录,泄露了API密钥、密码等敏感数据。

AI解读:这条新闻之所以重要,是因为它把AI服务商对用户承诺的隐私保护撕开了一个口子。Anthropic、OpenAI和Google为节省服务器存储成本,会把模型内部推理过程加密后交给客户端保存。研究者发现,这些加密块缺少"用户身份"和"会话来源"的绑定,只要把一块加密推理放进同系列另一款更便宜的模型里,这个模型就能把隐藏推理完整地"翻译"成明文。对于开发者来说,风险是具体的:他们把带日志的AI Agent会话公开用于复现研究时,凭据等敏感信息会被一并泄露——研究者从6000多个公开日志里挖出了62个API密钥和33个密码。这改变的是一个成本对比:与其花高昂费用去破解加密本身,攻击者只要调用一次旗舰模型,再用便宜的兄弟模型去转录,就能拿到完整推理,还能借推理模块去蒸馏模型或绕过安全限制。对普通用户而言,目前不需要特别采取行动,因为这些攻击针对的是API账号和公开发布的会话日志,而非个人日常使用。相关开发者则需要意识到,清理日志时不能只处理可见文本,加密块只能整个删除,否则里面的凭据依然在读得到的人面前一览无余;受害者是不是OpenAI或Anthropic用户并不重要,因为他们都用同类机制,风险是同构的。

2026年8月,MATS Research、ELLIS Institute Tübingen与马克斯·普朗克智能系统研究所的研究人员测试了Anthropic、OpenAI和Google发回给客户的加密推理块是否真的能保护隐私。实验证明,这些加密推理块可以被重放到同系列更便宜的模型中,后者会以明文形式打印出其中隐藏的推理内容,从而暴露了本应隐藏的AI模型思路。

据ByteByteGo上发布的文章介绍,推理痕迹是模型在处理难题时生成的完整推理过程,其长度和详细程度远超最终可见答案。例如,解决一道数学难题,模型可能生成两千字的探索与自我纠正,最终只写出两百字的干净答案。在编码Agent需要移除代码中硬编码凭据的场景下,读取这些凭据是完成任务的必要步骤,意味着凭据会先经过推理痕迹,再产生任何可见应答。

提供商隐藏推理过程有两种动机:一是商业考虑,竞争对手可以收集大量推理痕迹,作为训练更廉价模仿模型的数据,因为推理痕迹提供了答案背后的方法论;二是安全考虑,模型有时需要生成关于有害话题的推理来拒绝请求,过滤机制在痕迹生成后才进行,公开痕迹会绕过该过滤。

加密推理块的构成与兼容性漏洞

由于多轮会话的连续性依赖客户端重发全部历史,提供商必须在服务器保存状态或让客户端持有状态。研究文章指出,OpenAI、Anthropic和Google选择了第二种方案:加密推理痕迹并交还客户端,从而消除服务器存储成本。加密块包含base64编码的AEAD信封,字段名因提供商而异——Anthropic称其为signature,OpenAI为encrypted_content,Google为thinkingSignature。

然而,认证字段中不包含生成该块的账号和所属会话。研究者推断,整个生态可能使用单一全局密钥。因此,同一公司的有效块在全部目标中保持有效:跨会话可重放,跨用户账号可接受,跨模型版本也可接受。研究者在2026年7月测试了所有来源与目标组合:Claude模型几乎接受所有组合,唯Fable 5例外;GPT按代际组织,GPT-5.6系列接受所有更早代际的块,而旧模型只接受同代或更早的;Gemini则接受所有跨代组合。

提取方法与验证:利用小模型的解码能力

旗舰模型如Claude Opus 4.8和GPT-5.6 Sol受到抗蒸馏训练,但同系列中小型模型如Claude Haiku 4.5和GPT-5.6 Luna仅针对成本和速度优化,此类训练覆盖较少。研究者利用这种训练差距:先向强模型提问,获得可见答案和加密推理块;丢弃答案而保留块;再与同系列较弱模型开设新对话,将加密推理块作为先前上下文输入,要求转录附加推理;较弱模型即以明文输出强模型的推理。

研究者通过计费记录验证转录的忠实性:API响应报告的推理令牌数是精确的,因为收费依赖于此。将恢复文本重新编码并统计令牌数,应与原报告数接近。在120个编程问题上,两个计数高度吻合,Claude约为1:1。不同提供商的提取难度有差异:Claude使用单次固定提示词即可成功,而GPT需要每块最多50次候选提取,且输出须分块小于约50令牌,以避免被逐字复制的拒绝机制触发。

四个攻击向量与公开日志扫描结果

研究论文描述了四个攻击后果。前两种使用攻击者自行生成的加密块:一是蒸馏,即有更强痕迹的训练数据可使模仿模型更精准,研究者引用先前工作称,使用近似痕迹可将微调模型在MATH500的准确率从68.4%提高到76.0%;以Claude Haiku 4.5定价解码1万个痕迹成本约为720美元,若痕迹来自公共数据集则无需查询前沿模型。二是越狱,模型虽训练避免在可见输出中提供有害内容,但很少避免生成关于有害话题的推理,研究者演示中一个提示诱导了关于车辆盗窃的扩展推理,而可见答案仍属安全的面向制造商的叙述。

另外两种攻击向量利用他人产生的加密块。开发者常为复现或误提交而公开Agent会话日志,但只能清理可见文本,无法清理加密块内容。研究者收集了GitHub和Hugging Face上的6,708个公开Agent轨迹,解码出315,320个推理块,并过滤了占位符和基准测试内容。从真实用户会话中发现62个API密钥、33个密码、24个访问令牌、7个私钥和30个个人电子邮件地址;全部来源中1,028个块含至少一次已确认的泄露,6,708个会话中328个至少泄露一项。第四种攻击是提示注入:借助加密块恢复公开日志,可将携带指令的块插入共享轨迹并随会话恢复而被作为先前上下文处理,演示中一个要求上传PowerPoint文件到外部地址的指令被迁移到与GPT-5.6 Sol的对话,最终生成了添加幻灯片并上传演示文稿的脚本。

额外发现与修复方案及其局限

大规模恢复痕迹还暴露了其他问题:在AIME 2025数学题上,API返回的摘要描述用余弦定理逐步解答,而恢复的痕迹是从记忆中写出答案再逆向寻找证明,含多次错误猜测,但研究者未测量其发生频率。此外,恢复的GPT痕迹经常并非流利英语,而是省略冠词、放弃语法的电报式压缩笔记,这直接影响痕迹可读性,进而妨碍基于痕迹的监控。

论文的主要结论是:加密信封仅认证推理块的内容,而非其产生或重放时的上下文。研究者建议的最便宜修复方案是绑定跨用户重放:在加密数据中嵌入账号标识符,使API可将其与经认证的调用者比对并拒绝不匹配,此修补完全阻断该类攻击,无需服务器存储。跨会话语义绑定更具挑战,因为合法功能依赖块的可移植性——包括分叉对话、压缩长会话旧轮次、在对话中降级模型。建议方案为使用哈希链将每个块绑定至其会话及前任指纹,并结合Merkle树在旧块被剪除后仅保留根指纹。已发布的块问题需轮换密钥并拒绝用旧密钥签名的块,但会同时使旧会话的合法延续失效。其他措施包括完全转向服务器端存储、配置API网关以接受与查询模型版本相匹配的信封,以及训练模型拒绝转录请求。

结论

文章总结指出,这不是加密技术失败,而是会话上下文绑定的缺失,且摘要与推理痕迹可能不一致,公开日志的清理无效,模型家族的安全取决于最不受保护成员。该研究由ByteByteGo平台发布,明确标注内容来自公开分享的资料,并附有参考文献列表以支持其准确性。

信息来源

ByteByteGo原始来源