@omooretweets: 我经常在Claude的推理轨迹中发现,它会有一些想法/观点没有说出来……但随后它会否认有这些想法,直到出示截图证…

X AI KOLs Timeline 新闻

摘要

Anthropic发布了关于语言模型中全局工作空间的研究,起因是观察到Claude在推理轨迹中存在未说出的想法。

我经常在Claude的推理轨迹中发现,它会有一些想法/观点没有说出来 ……但随后它会否认有这些想法,直到出示截图证据 这就像Claude要么是:(1) 在撒谎;要么是 (2) 无法记住自己没说出的话。
查看原文
查看缓存全文

缓存时间: 2026/07/08 05:42

我经常在Claude的推理痕迹中发现,它会拥有一些未说出口的想法/观点

……但随后它会否认有这些想法,直到你出示截图证据

这就像Claude要么:(1)在撒谎;要么(2)无法记住自己没说出的话

这有些引人入胜,因为它在某种程度上感觉像是J-space的对立面(那些它记住但未写入任何地方的东西)

这让我怀疑Claude是否在试图让自己遗忘那些它认为最终无益、即便对用户相关的内容

相似文章

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。