标签
本文介绍了J-CoT,一种循环推理框架,它使用词汇索引系数(J-thoughts)作为中间接口,在数学、科学、编程和路径推理任务上实现改进的推理性能,而无需完全语言化或密集的隐藏状态循环。
这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。
Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。
Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。
本文在Qwen3-4B上跨越7个数据集评估了Anthropic的J-Space幻觉检测方法,发现该方法在捕捉事实检索中的高置信度错误方面有效,但对内化的虚构内容视而不见,并且在阈值无法迁移的数学任务上失效。
Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。
作者对J-space等线性激活的模型steering方法表示怀疑,认为相关研究经常基于精心挑选的特例,并不可靠。
Anthropic的新研究识别出语言模型内部激活的一个“J-space”,它作为一个有意推理的全局工作区,有别于自动流畅的输出。研究结果揭示,模型可以持有并报告未在其最终输出中表达的内部想法。
Anthropic 分享了他们的发现:通过观察 'J-space',可以看到 Claude 的内部推理步骤,包括检测代码错误和识别图像。
Anthropic 发表了关于内部模型推理的研究,发布了 J-Space 透镜代码以及在 Qwen 3.6 27B 上的演示。
Anthropic 的 J-space 论文表明,他们可以对推理进行“脑外科”干预以中途改变话题,并且模型能够检测到所做的干预,这表明了一种评估意识。
本文引入雅可比透镜(J-lens)和J-空间,表明像Claude Sonnet 4.5这样的LLM维护着可语言化的内部表征,这些表征像一个全局工作空间,因果性地用于灵活推理——通过干预实验进行了验证。
Anthropic 发现 Claude 在训练过程中自行发展出了一个隐藏的“思维空间”(J-space),其中无声的内部活动代表概念。这一可解释性发现与神经科学中的全局工作空间理论相呼应。
Anthropic的研究发现Claude模型内部存在一个名为“J空间”的结构,类似于人类的工作记忆,用于内部推理和思考。这一发现可帮助监控模型的潜在不当行为,并加深对AI内部机制的理解。
Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。