Claude与GPT的隐藏推理被解码,这很有趣

Reddit r/LocalLLaMA 论文

摘要

最近的一篇论文展示了一种从Claude和GPT等专有LLM API中检索隐藏推理轨迹的技术,这对开源模型的比较、基准测试的完整性和蒸馏工作都有影响。

昨天一篇论文展示了一个漏洞,可以从所有Claude和GPT模型中获取100%的推理token:Stealing Reasoning Traces from Proprietary LLM APIs。你可以去看看,他们发布了大量推理示例。这对开源非常相关,原因如下:这里有基准测试的提示;给定AIME基准测试中的一个问题,Claude的推理显示它熟记这道题并知道答案;所以,我们看到它们性能超越开源模型的图表——可能被夸大了。- 当你使用开源模型时,你看到你的模型推理很奇怪;比如一些没有意义的奇怪词汇或过度思考。事实证明这非常正常,即使是前沿模型也几乎总是如此。- 现在人们在谈论,中国一直在利用这个漏洞来蒸馏前沿模型,而现在这个漏洞被堵住了,蒸馏将会放缓。走着瞧吧。所以,是的,我相信开源并不像从推理token中看起来那样落后,没有什么秘密配方,只是数据、计算和工程。
查看原文

相似文章

从专有LLM API中窃取推理痕迹

Hacker News Top

本文演示了一种从专有LLM API(Anthropic、OpenAI、Google)提取隐藏推理痕迹的方法,方法是将加密的思维链块重放入较弱的、已越狱的同族模型,从而在不直接攻击较强模型的情况下逐字恢复其原始推理过程。

从专有LLM API窃取推理痕迹

Hugging Face Daily Papers

一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。

窃取AI推理痕迹 (2分钟阅读)

TLDR AI

研究揭露了LLM API加密推理痕迹中的漏洞,使攻击者能够提取专有模型推理、个人数据,并实现恶意提示注入。

窃取专有LLM API中的推理痕迹

Simon Willison's Blog

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。