J-space论文悄然平息了关于“LLM是否真的在思考”的争论的大部分。我构建了一个实时查看器,让你可以亲眼观察,而不是争论。
摘要
Anthropic的研究论文揭示了LLM中存在一个涌现的内部工作空间,推理在输出之前发生,一位开发者构建了一个实时查看工具(Subtext)来观察这一过程,从而平息了关于LLM是否真的在思考的争论。
相似文章
Anthropic刚刚报告,大语言模型拥有隐藏的想法而不说出来。一个内部的“J-Space”
Anthropic的新研究识别出语言模型内部激活的一个“J-space”,它作为一个有意推理的全局工作区,有别于自动流畅的输出。研究结果揭示,模型可以持有并报告未在其最终输出中表达的内部想法。
独一无二的J-Space(54分钟阅读)
一篇讨论一种名为Jacobian Lens的新型可解释性技术的文章,以及J-space的发现,J-space是LLMs中的一个区域,其中可语言化的表征形成了一个全局工作空间,标志着理解LLM推理的重大进展。
LLMs 并非你所认为的黑箱
一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.