Anthropic 发现 Claude 在静默中推理(J-space)——我们对开源的 Qwen3-8B 使用了同一方法

Reddit r/LocalLLaMA 工具

摘要

Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。

Anthropic 对 Claude 的研究发现了一个他们称为 J-space 的静默内部工作空间——一种从不以可见文本形式出现的隐藏推理。经典示例:模型回答 49,但在 J-space 内部,他们捕捉到了 21 → 42 → 49。重要区分:思维链(Chain-of-thought)= 可读文本;J-space = 激活中的静默概念(“模型在想什么”)。我们将开源的雅可比透镜(J-lens)适配到 Qwen3-8B,在本地运行,并利用它捕捉工具调用前的散文偏移(模型倾向于输出“To, You, Do…”之类的内容,而非 JSON)。然后我们将这整合到代理防护中:停止/取消/保留有用空间,并将恢复过程提炼为 LoRA 数据。制作了一个 8 分钟的讲解演示:https://www.youtube.com/watch?v=5UMN6hDONJk 欢迎就探测设置或防护循环提出问题。
查看原文

相似文章

Anthropic发现了一个隐藏空间,Claude在其中思考概念

MIT Technology Review

Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。

Anthropic最新AI发现的启示与局限

MIT Technology Review

Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。