被盗的LLM推理:为什么OpenAI、Anthrophic、Google会有相同的漏洞?
摘要
讨论了一篇安全论文,该论文展示了顶级模型(Opus、Sol)的加密推理可以被替换到较弱模型(Haiku)中,从而绕过安全护栏,原因是模型和会话之间共享一个全局加密密钥。这引发了关于OpenAI、Anthropic和Google为何独立地收敛到相同脆弱设计的问题。
如果你还没看过这篇论文:https://arxiv.org/abs/2608.09867 TLDR:作者展示了,你可以把最大模型(如Opus、Sol)的“加密”推理提取出来,放进防护较弱的模型(如Haiku)中,并让它逐字重复这段推理思路。他们提到,这种方法之所以有效,主要原因是系统中使用了同一个“全局”加密密钥来进行加密,同时这个思维签名(也就是加密后的推理)可以在不同用户、会话和模型之间互换。这个设计决策相当特殊,读完后我觉得有点离谱。我最想知道的是,实现这套系统的Google、OpenAI、Anthropic,它们肯定是各自独立开发的(不是吗?),但为什么它们都会受到完全相同的漏洞影响?它们是不是只是用LLM凭感觉写了这个方案?如果是的话,那是否意味着所有不同的前沿模型最终都会收敛到同一个解决方案?
相似文章
从专有LLM API窃取推理痕迹
一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。
从专有LLM API中窃取推理痕迹
本文演示了一种从专有LLM API(Anthropic、OpenAI、Google)提取隐藏推理痕迹的方法,方法是将加密的思维链块重放入较弱的、已越狱的同族模型,从而在不直接攻击较强模型的情况下逐字恢复其原始推理过程。
窃取AI推理痕迹 (2分钟阅读)
研究揭露了LLM API加密推理痕迹中的漏洞,使攻击者能够提取专有模型推理、个人数据,并实现恶意提示注入。
窃取专有LLM API中的推理痕迹
一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。
一个根本缺陷使LLM极易受到攻击
研究人员在ICML上发表论文,认为LLM识别指令方式的根本缺陷使其无法完全防御攻击,并成功演示了对OpenAI、Anthropic、阿里巴巴和DeepSeek模型的攻击。