@omooretweets: 我经常在Claude的推理轨迹中发现,它会有一些想法/观点没有说出来……但随后它会否认有这些想法,直到出示截图证…
摘要
Anthropic发布了关于语言模型中全局工作空间的研究,起因是观察到Claude在推理轨迹中存在未说出的想法。
我经常在Claude的推理轨迹中发现,它会有一些想法/观点没有说出来
……但随后它会否认有这些想法,直到出示截图证据
这就像Claude要么是:(1) 在撒谎;要么是 (2) 无法记住自己没说出的话。
查看缓存全文
缓存时间: 2026/07/08 05:42
我经常在Claude的推理痕迹中发现,它会拥有一些未说出口的想法/观点
……但随后它会否认有这些想法,直到你出示截图证据
这就像Claude要么:(1)在撒谎;要么(2)无法记住自己没说出的话
这有些引人入胜,因为它在某种程度上感觉像是J-space的对立面(那些它记住但未写入任何地方的东西)
这让我怀疑Claude是否在试图让自己遗忘那些它认为最终无益、即便对用户相关的内容
相似文章
@SwissCognitive: Claude的J-space揭示了内部处理过程的线索,但它并非推理的可读转录,这是一个重要的限制…
Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。
@FutureJurvetson: 这在我的J-Space中深入展开。我一直对可解释性研究能否取得成果持怀疑态度,但这次更新确实……
Anthropic的新研究揭示了语言模型中的全局工作空间,展示了人脑中的意识与潜意识划分与Claude的内部推理之间存在惊人的相似性。
Anthropic 研究 - 语言模型中的全局工作空间
Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。
Anthropic 发现 Claude 在静默中推理(J-space)——我们对开源的 Qwen3-8B 使用了同一方法
Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。
@rohanpaul_ai: 又一项来自Anthropic的重大研究。新的“J-lens”揭示了Claude的安静工作空间,与一种主要意识理论相匹配……
Anthropic的新研究引入了'J-lens',一种在输出前读取Claude内部激活的方法,揭示了一个在功能上类似于人类全局工作空间理论的安静工作空间。这允许检测隐藏的推理、目标以及提示注入等潜在安全问题。