Anthropic 发现 Claude 在静默中推理(J-space)——我们对开源的 Qwen3-8B 使用了同一方法
摘要
Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。
Anthropic 对 Claude 的研究发现了一个他们称为 J-space 的静默内部工作空间——一种从不以可见文本形式出现的隐藏推理。经典示例:模型回答 49,但在 J-space 内部,他们捕捉到了 21 → 42 → 49。重要区分:思维链(Chain-of-thought)= 可读文本;J-space = 激活中的静默概念(“模型在想什么”)。我们将开源的雅可比透镜(J-lens)适配到 Qwen3-8B,在本地运行,并利用它捕捉工具调用前的散文偏移(模型倾向于输出“To, You, Do…”之类的内容,而非 JSON)。然后我们将这整合到代理防护中:停止/取消/保留有用空间,并将恢复过程提炼为 LoRA 数据。制作了一个 8 分钟的讲解演示:https://www.youtube.com/watch?v=5UMN6hDONJk 欢迎就探测设置或防护循环提出问题。
相似文章
Anthropic发现了一个隐藏空间,Claude在其中思考概念
Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。
@rohanpaul_ai: 又一项来自Anthropic的重大研究。新的“J-lens”揭示了Claude的安静工作空间,与一种主要意识理论相匹配……
Anthropic的新研究引入了'J-lens',一种在输出前读取Claude内部激活的方法,揭示了一个在功能上类似于人类全局工作空间理论的安静工作空间。这允许检测隐藏的推理、目标以及提示注入等潜在安全问题。
Anthropic最新AI发现的启示与局限
Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。
Anthropic 研究 - 语言模型中的全局工作空间
Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。
@omooretweets: 我经常在Claude的推理轨迹中发现,它会有一些想法/观点没有说出来……但随后它会否认有这些想法,直到出示截图证…
Anthropic发布了关于语言模型中全局工作空间的研究,起因是观察到Claude在推理轨迹中存在未说出的想法。