J-space论文悄然平息了关于“LLM是否真的在思考”的争论的大部分。我构建了一个实时查看器,让你可以亲眼观察,而不是争论。

Reddit r/ArtificialInteligence 新闻

摘要

Anthropic的研究论文揭示了LLM中存在一个涌现的内部工作空间,推理在输出之前发生,一位开发者构建了一个实时查看工具(Subtext)来观察这一过程,从而平息了关于LLM是否真的在思考的争论。

如果你还没读过:https://www.anthropic.com/research/global-workspace。语言模型有一个涌现的内部工作空间,由沉默的词组成,它们可以报告、引导和推理。让我印象深刻的是:要求模型检查“12 + 5 = 1”时,错误信号在内部饱和,而它还在阅读问题;片刻之后它打出“不,那不对”,这不过是对已经发生的决策的叙述。争论现在可有可无了。你只需要观察。仓库:https://github.com/ninjahawk/Subtext 这个子论坛多年来一直在争论“它只是自动补全”与“它真的在推理”,而诚实的答案其实是:两者兼有,而且现在可以测量了。该仪器显示模型的大部分流畅输出(语法、语气、常识事实)完全绕过了工作空间(不涉及“思考”),而多步骤问题则明显地经过它。两个阵营都只说对了一半。这就是有趣的地方。Anthropic开源了透镜,Neuronpedia发布了针对Qwen预拟合的版本,所以我把它集成到了一个聊天界面中。每个令牌有9层读出,实时渲染,包括在模型读取你的消息时(此时还没有任何输出)。仓库中有演示视频:关于12+5=1的判定在阅读过程中形成,然后模型在说出任何一个词之前就已经在脑海中保存了模运算和按位运算(它正在规划模运算的注意事项。你可以观察它的规划。)如果你没有GPU,可以在浏览器中回放:https://ninjahawk.github.io/Subtext/ 是的,功能上的可用性不等于意识,在有人开始争论之前——论文对此很谨慎,我也一样。但有趣之处在于:没有人设计这个工作空间。它就是在你训练transformer时出现的,在随机开源的4B模型上和Claude上一样。¯\_(ツ)_/¯
查看原文

相似文章

独一无二的J-Space(54分钟阅读)

TLDR AI

一篇讨论一种名为Jacobian Lens的新型可解释性技术的文章,以及J-space的发现,J-space是LLMs中的一个区域,其中可语言化的表征形成了一个全局工作空间,标志着理解LLM推理的重大进展。

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。