Anthropic 发现 Claude 在静默中推理(J-space)——我们对开源的 Qwen3-8B 使用了同一方法
摘要
Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。
Anthropic 对 Claude 的研究发现了一个他们称为 J-space 的静默内部工作空间——一种从不以可见文本形式出现的隐藏推理。经典示例:模型回答 49,但在 J-space 内部,他们捕捉到了 21 → 42 → 49。重要区分:思维链(Chain-of-thought)= 可读文本;J-space = 激活中的静默概念(“模型在想什么”)。我们将开源的雅可比透镜(J-lens)适配到 Qwen3-8B,在本地运行,并利用它捕捉工具调用前的散文偏移(模型倾向于输出“To, You, Do…”之类的内容,而非 JSON)。然后我们将这整合到代理防护中:停止/取消/保留有用空间,并将恢复过程提炼为 LoRA 数据。制作了一个 8 分钟的讲解演示:https://www.youtube.com/watch?v=5UMN6hDONJk 欢迎就探测设置或防护循环提出问题。
相似文章
Anthropic发现了一个隐藏空间,Claude在其中思考概念
Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。
@rohanpaul_ai: 又一项来自Anthropic的重大研究。新的“J-lens”揭示了Claude的安静工作空间,与一种主要意识理论相匹配……
Anthropic的新研究引入了'J-lens',一种在输出前读取Claude内部激活的方法,揭示了一个在功能上类似于人类全局工作空间理论的安静工作空间。这允许检测隐藏的推理、目标以及提示注入等潜在安全问题。
@SwissCognitive: Claude的J-space揭示了内部处理过程的线索,但它并非推理的可读转录,这是一个重要的限制…
Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。
Qwen 的 J-Space - Anthropic 对内部模型全局工作空间的发现
Anthropic 发表了关于内部模型推理的研究,发布了 J-Space 透镜代码以及在 Qwen 3.6 27B 上的演示。
Anthropic最新AI发现的启示与局限
Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。