Anthropic最新AI发现的启示与局限

MIT Technology Review 新闻

摘要

Anthropic在Claude等大语言模型中发现了一个隐藏的内部空间(J-space),其中包含影响推理的词汇,推进了对AI模型内部机制的理解。

<p><em>本文最初发表于我们的AI周报《The Algorithm》。如果您希望第一时间在收件箱中收到此类文章,请</em><a href="https://forms.technologyreview.com/newsletters/ai-demystified-the-algorithm/"><em>在此处订阅</em></a><em>。</em></p> <p>Anthropic——目前全球最具价值的AI公司,估值近1万亿美元——以发表奇特而前沿的研究而闻名。例如,它正在研究AI模型<a href="https://www.anthropic.com/research/exploring-model-welfare">是否能感知疼痛</a>,有时如果怀疑用户“滥用”模型,还会<a href="https://www.anthropic.com/research/end-subset-conversations">中断</a>聊天机器人对话。</p> <p>Anthropic比其他AI公司投入更多时间和金钱的一个细分领域是机制可解释性,即观察AI模型内部的复杂数学运算,以了解它为何产生某个特定输出而非其他。这是一项复杂的工作:可能影响任何结果的数据点多达数百万,梳理这些数据往往更像一团乱麻而非有用信息。该方法也颇具争议。用心理学和神经科学术语描述AI模型,可能会使其行为看起来比我们通常认为的更加复杂。</p> <p>因此,当Anthropic<a href="https://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-space-where-claude-puzzles-over-concepts/">上周宣布</a>在其模型推理答案时发现了通往其“内部思维”的新窗口时,我不得不与一位同事谈谈。高级编辑Will Douglas Heaven除了拥有计算机科学博士学位外,还<a href="https://www.technologyreview.com/2026/01/12/1129782/ai-large-language-models-biology-alien-autopsy/">花了很多时间</a>深入研究我们如何看待AI模型的工作原理。我与他就我们应该从Anthropic这项新颖(且果然奇特)的研究中获得什么进行了交谈。</p> <p><strong>Anthropic究竟从中了解到什么?</strong></p> <p>Anthropic几年来一直在试图理解大语言模型(LLM)的工作原理。并非只有Anthropic在研究这个问题,但我认为该公司将这一点作为其核心使命之一,比其他大多数公司更为重视。Anthropic的CEO Dario Amodei曾表示,除非我们更多地了解LLM的工作方式,否则无法完全控制它们。</p> <p>因此,这项新研究正是在此背景下进行的。它比以往任何时候都更深入地探究了LLM内部的奇特机制。Anthropic发现,LLM内部有一个空间——Anthropic称之为J-space——其中充满了不出现在输出中但似乎影响模型推理求索的词汇。这一切在此之前都是隐藏的,直到Anthropic开发出一种新技术来探测其模型Claude,因此这是一项真正的发现。</p> <p>有时这些词会记录LLM在特定任务中进展到哪一步,有时它们看起来更像是识别闪现(例如,当只给LLM一个蛋白质序列的字母时,可能会跳出“蛋白质”一词),有时它们代表模型决策过程中的一种内部注释。在我最喜欢的例子中,当“恐慌”一词出现时,Claude决定在编程测试中作弊。</p> <p>Anthropic还发现,LLM能够描述和操作这个空间中的词汇。因此,它们似乎在一定程度上利用了它。</p> <p><strong>让我们退一步。我并不是认为大语言模型简单,但它们也不是魔法。它们是通过数学学习词语之间关系的,对吧?那么为什么“窥探”LLM内部以了解发生了什么如此困难?</strong></p> <p>是的,它们不是魔法!我认为我们未能完全理解它们这一点本身就助长了神话的制造。值得注意的是,Anthropic在这里所倾向的整个叙事——他们构建了这项非常神秘的技术,但别担心,因为也是他们来解决这个问题——非常符合公司的风格。[参见Anthropic此前警告其新模型在编程方面太出色以至于构成全球网络安全风险,结果美国政府在不久后<a href="https://www.technologyreview.com/2026/06/22/1139424/three-things-to-watch-amid-anthropics-latest-feud-with-the-government/">叫停了它们</a>。]</p> <p>所以是的:LLM只是数学。然而,这是极其复杂的数学。如今的LLM不仅由数千亿个数字组成,而且运行它们会触发数百万次计算级联。我去年写过,如果把一个中等规模的LLM打印在纸上,它会<a href="https://www.technologyreview.com/2026/01/12/1129782/ai-large-language-models-biology-alien-autopsy/">覆盖旧金山那么大的城市</a>。</p> <p>如果没有专门的工具在特定时间突出显示LLM的特定部分,就不可能理解这些数学中的任何内容。你需要知道看什么以及怎么看。而构建这些工具本身就需要首先对复杂数学有一定理解。</p> <p><strong>你在其他地方写过关于像研究生物大脑一样研究LLM的概念。使用“类似大脑”的术语来描述LLM的工作方式是否公平?</strong></p> <p>我不喜欢使用这类术语。LLM不是大脑。这样的说法具有误导性,因为它可能让人觉得LLM能够做出比实际更接近人类的事情,或者让人做出不该做的行为假设。整个人格化现象还与一系列关于这项技术是什么以及它将变成什么样的<a href="https://www.technologyreview.com/2025/10/30/1127057/agi-conspiracy-theory-artifcial-general-intelligence/">强烈意识形态立场</a>紧密相连。</p> <p>但同时,我们缺乏一套好的替代词汇来描述这些模型在做什么。我能理解为什么人们会使用“思考”、“理解”和“类脑”这样的词——它们是方便的速记。</p> <p>Anthropic将它在LLM内部发现的这个新空间比作一些神经科学家认为我们大脑用于跟踪意识思维的空间。我问公司我们应该如何认真对待这种比较,它在一份声明中表示:“绘制这些类比对我们设计实验很有帮助,因为它们使我们能够对J-space做出许多非显而易见的实验预测,而这些预测后来都被证明为真。同时,需要注意的是,J-space(以及一般的语言模型)与人脑之间存在一些重要差异,因此我们无意声称存在完美的对应关系。”</p> <p><strong>J-space这个新概念可能用来解决AI中的什么问题?</strong></p> <p>Anthropic表示,监控J-space可能是一种捕捉模型做不应该做的事情的方法。因为在这个空间中出现的词汇不会出现在模型输出中,它们可以告诉你关于其行为的你可能没有注意到的事情——例如当它给出有偏见的回应时,或者当它在权衡作弊的利弊时。</p> <p>至少理论上如此。我认为最好将这一结果视为理解这项技术整体道路上的又一步,而不是本身就有用的东西。</p> <p><a href="https://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-space-where-claude-puzzles-over-concepts/"><em>在Will关于这项新研究的完整报道中阅读更多内容</em></a><em>。</em></p>
查看原文
查看缓存全文

缓存时间: 2026/07/13 19:51

# Anthropic 最新 AI 发现:能做什么,不能做什么 来源:https://www.technologyreview.com/2026/07/13/1140343/what-anthropics-latest-ai-discovery-does-and-doesnt-show *本文最初发表于我们的 AI 周报《算法》。若想第一时间在收件箱收到此类故事,**请在此订阅**(https://forms.technologyreview.com/newsletters/ai-demystified-the-algorithm/)。* Anthropic——目前全球估值最高的 AI 公司,估值近 1 万亿美元——以发布奇特且高深的研究而闻名。例如,它在研究 AI 模型是否能感受痛苦(https://www.anthropic.com/research/exploring-model-welfare),有时也会在怀疑用户“虐待”模型时切断聊天对话(https://www.anthropic.com/research/end-subset-conversations)。 Anthropic 比其他 AI 公司投入更多时间和金钱的一个细分领域叫作“机制可解释性”(mechanistic interpretability),即通过分析 AI 模型内部复杂的数学机制,来理解它为何产生某个特定输出而非其他输出。这很复杂:每个结果可能由数百万个数据点共同促成,而梳理这些数据往往看起来更像一团毫无意义的词汇堆砌,而非有用的信息。这一方法也有争议。用心理学和神经科学的术语来描述 AI 模型,可能会让它们的行为看起来比实际更复杂。 正因如此,当 Anthropic 上周宣布(https://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-space-where-claude-puzzles-over-concepts/)它找到了一个观察模型“内部思考”的新窗口(模型在推理过程中会经历这些思考),我必须和一位同事聊聊。资深编辑 Will Douglas Heaven 除了拥有计算机科学博士学位外,还花了大量时间(https://www.technologyreview.com/2026/01/12/1129782/ai-large-language-models-biology-alien-autopsy/)深入探讨我们如何看待 AI 模型的工作原理。我与他交流了应当如何理解 Anthropic 这项新奇(一如往常)的研究。 **Anthropic 到底发现了什么?** Anthropic 几年来一直在尝试理解大型语言模型(LLMs)的工作原理。并非只有他们在研究这个问题,但我认为这家公司比大多数同行更将其视为核心使命。Anthropic 的 CEO Dario Amodei 曾表示,除非我们更深入地了解 LLMs 的工作方式,否则无法完全控制它们。 因此,这项新研究正是在这样的背景下展开的。它比以往任何时候都更深入地揭示了 LLMs 内部的奇特机制。Anthropic 发现,LLMs 内部存在一个空间(他们称之为 J-space),其中充满了不出现在模型输出中、但似乎会影响模型推理过程的词语。这一切此前都是隐藏的,直到 Anthropic 开发出一种新方法来探测其模型 Claude,因此这算是一项真正的发现。 有时这些词语会记录 LLM 在特定任务中进展到哪一步;有时它们更像是识别闪念(例如,当只给 LLM 一个蛋白质序列的字母时,“protein”这个词可能会浮现);有时则代表了模型对自身决策的一种内部注释。我最喜欢的例子是,当“panic”这个词出现时,Claude 决定在编程测试中作弊。 Anthropic 还发现,LLMs 能够描述并操控这个空间中的词语。因此,它们似乎以某种方式利用了这个空间。 **让我们退一步思考。我明白大型语言模型并不简单,但它们也不是魔法。它们本质上是一堆学习词语之间关系的数学公式,对吧?那为什么“窥视”LLM 内部并了解其运作会如此困难?** 没错,它们不是魔法!我认为我们对它们缺乏完全理解,这恰恰助长了各种神话。而且值得注意的是,Anthropic 在这里强调的整个叙事——他们构建了一项极其神秘的技术,但别担心,因为他们也正是能够破解它的人——非常符合这家公司的风格。(参见 Anthropic 如何警告其新模型编程能力极强,足以构成全球网络安全风险,随后美国政府便将其封杀——https://www.technologyreview.com/2026/06/22/1139424/three-things-to-watch-amid-anthropics-latest-feud-with-the-government/。) 所以是的:LLMs 只是数学。然而,这是极其复杂的数学。如今的 LLMs 不仅由数千亿个数字组成,运行它们还会触发数以百万甚至亿计的计算级联。我去年曾写道,即使把中等规模的 LLM 打印在纸上,也会覆盖旧金山那么大一座城市(https://www.technologyreview.com/2026/01/12/1129782/ai-large-language-models-biology-alien-autopsy/)。 如果没有专门的工具在特定时刻突出显示 LLM 的特定部分,就不可能理解其中的任何数学原理。你需要知道在哪里看以及如何看。而构建这些工具本身就需要首先对复杂数学有所理解。 **你在其他地方写过,研究 LLM 就像研究生物的大脑一样。用“类脑”术语来描述 LLM 的工作方式是否合适?** 我不喜欢使用这类术语。LLMs 不是大脑。这样说具有误导性,因为它可能暗示 LLMs 具备比实际更接近人类的能力,或者让人对其行为做出不应有的假设。这种拟人化的倾向还与一系列关于这项技术是什么以及它将变成什么样的强烈意识形态立场紧密相关(https://www.technologyreview.com/2025/10/30/1127057/agi-conspiracy-theory-artifcial-general-intelligence/)。 但与此同时,我们缺乏一套良好的替代词汇来描述这些模型在做什么。我能理解为什么人们会使用“思考”“理解”和“类脑”这样的词——它们是方便的简写。 Anthropic 将他们在 LLMs 内部发现的这个新空间,与一些神经科学家认为人类大脑用来跟踪意识思维的空间进行比较。我问公司这种类比应如何看待,他们在一份声明中表示:“绘制这些类比有助于我们设计实验,因为它让我们能够对 J-space 做出许多非显而易见的实验预测,而这些预测后来被证明是正确的。同时,重要的是要指出,J-space(以及一般语言模型)与人脑之间存在一些重要差异,因此我们并不声称两者完全对应。” **AI 领域中,这个 J-space 的新概念可能用来解决什么问题?** Anthropic 表示,监控 J-space 可能是捕捉模型做不该做之事的一种方法。因为在这个空间出现的词语并不出现在模型输出中,它们可以揭示模型行为中你可能未曾注意到的信息——例如模型何时给出带有偏见的回答,或者何时在权衡作弊的利弊。 至少理论上是这样。我认为最好将这项结果视为理解这项技术整体道路上又迈进了一步,而非某种本身就有直接用途的工具。 *更多内容请阅读 Will 关于这项新研究的完整报道(https://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-space-where-claude-puzzles-over-concepts/)。*

相似文章

Anthropic发现了一个隐藏空间,Claude在其中思考概念

MIT Technology Review

Anthropic开发了雅可比透镜(J-lens),揭示了Claude Opus 4.6内部隐藏的'J空间',为在输出tokens之前洞察LLM内部推理过程提供了前所未有的视角。该技术通过呈现模型即将生成的词汇,实现了对模型行为的监控和控制。

What’s at the center of Claude’s mind?

Reddit r/singularity

Anthropic的研究发现Claude模型内部存在一个名为“J空间”的结构,类似于人类的工作记忆,用于内部推理和思考。这一发现可帮助监控模型的潜在不当行为,并加深对AI内部机制的理解。

J-Space 与人工智能

Reddit r/ArtificialInteligence

Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。

Anthropic 研究 - 语言模型中的全局工作空间

Reddit r/singularity

Anthropic的新论文提供了证据,表明像Claude这样的现代语言模型已经发展出一种可报告、可控制且用于灵活推理的‘全局工作空间’(J空间),这与自动处理不同。