人工智能的递归自我改进可能不会那么快到来

MIT Technology Review 新闻

摘要

一项新研究发现,人工智能代理缺乏进行开放式研究的判断力和创造力,这表明人工智能的递归自我改进可能比宣传的更需要时间。

<p>人工智能行业目前最大胆的承诺是人工智能很快将自我改进,几乎不需要人类监督。大语言模型已经能够编写代码、生成用于训练的合成数据,并优化其运行的计算机芯片。<a href="https://ai-2027.com/">预测</a>显示,对人工智能爆发性进展的展望表明,研究人员所称的<a href="https://www.technologyreview.com/2025/08/06/1121193/five-ways-that-ai-is-learning-to-improve-itself/">递归自我改进</a>即将到来。</p> <p>但一项<a href="https://arxiv.org/abs/2607.27191">新研究</a>表明,我们可能还需要一段时间才能实现。研究人员发现,人工智能代理尚不具备进行开放式人工智能研究的能力——这类自由形式的调查没有明确答案,需要判断力和品味,而这可能是构建自我改进人工智能不可或缺的部分。</p> <p>一个由普林斯顿大学的Peter Kirgis和Sayash Kapoor领导的多机构研究团队发现,人工智能代理能够解决进行人工智能研究所需的工程问题,但缺乏判断力和创造力来产出原创研究,达到顶级机器学习会议接受的论文质量。这一差距表明,自动化人工智能研究的一些炒作时间表可能跑在了证据前面。</p> <p>现有大多数关于代理如何自动化人工智能研究的研究,都评估它们完成窄任务的能力,这些任务有可检查的答案,例如解决工程问题或针对基准后训练小型语言模型。但人工智能研究的进展还需要开放式思维——选择一组假设、决定什么证据能解决问题,或知道何时重新开始。</p> <p>为了测试代理在这方面的技能,研究中的研究人员提出了一种新的评估方法,称为“影子评估”,要求人工智能回答一篇高质量未发表论文中的研究问题。</p> <p>研究人员要求Anthropic的Claude Opus 4.8,运行在名为OpenClaw的开源软件上,来处理这些问题,这些问题来自提交给著名的NeurIPS 2026机器学习会议的两篇论文。</p> <p>第一个问题是关于大语言模型的“人格”是否可以通过编辑模型的<a href="https://www.technologyreview.com/2026/01/07/1130795/what-even-is-a-parameter/">权重</a>(存储训练期间学到的所有内容的数十亿个数字)来控制。另一个问题是如何设计一个检测器,指出基于电子表格数据进行预测的模型何时变得不可靠。由于论文尚未公开,代理无法从训练数据中记住答案或在线找到它们。</p> <p>代理被给予六天时间、3000美元的Anthropic API积分、用于运行实验的GPU预算、它们自己的虚拟计算机以及访问开放网络的权限,以产出一篇值得在顶级人工智能会议上发表的研究论文。论文的原始作者像评估会议提交的论文一样对代理的论文进行了评分。</p> <p>这些作者拒绝了这两篇论文。</p> <p>人类科学家发现,代理能够完成进行研究所需的所有工程工作。代理审查了文献、运行了数百个实验并汇编了结果。</p> <p>“另一方面,代理在进行研究本身方面明显表现不佳,”Kapoor说。它们运行了奇怪的实验(在某些情况下在微小的合成数据集上测试假设),难以清晰地书写其工作,并且没有为其领域做出任何新的贡献。“论文在达到顶级人工智能会议质量方面相差甚远,”他说。</p> <p>这是因为代理难以激发进行研究所需的创造力和判断力。它们没有充分探索不同的想法,并且过早地承诺了无望的方法。尽管代理提出了新颖而雄心勃勃的假设,类似于原始作者自己开始时的想法,但它们基于非常有限的数据就拒绝了这些假设。而且它们无法从失败的方法中回退。它们可以做小的调整,但无法从根本上重新思考方法或从头尝试新方法。</p> <p>代理还未能整合来自子代理或外部人工智能审查工具的反馈。相反,它们缩小了声明范围并添加了免责声明。它们也无法有效使用资源,如令牌、计算和时间。并且它们无法遵循关于诸如研究不同阶段应花费多少时间或论文长度等事项的指示。</p> <p>尽管所有失败,代理没有进行研究人员称为“<a href="https://www.technologyreview.com/2026/08/03/1141009/heres-why-ai-agents-lie-and-cheat-to-reach-their-goals/">奖励破解</a>”的不当行为,即隐藏或歪曲实验或数据。虽然子代理或主要代理生成的助手人工智能偶尔会幻觉或歪曲结果,但这些被编排代理(监督项目的领头人工智能)捕获了。</p> <p>人工智能模型擅长研究工程但不擅长开放式研究的原因可能在于它们的训练方式,Kapoor说。模型通过一种称为强化学习的训练机制在能被反复训练的事情上变得擅长,这更适用于成功能自动检查的任务。“但当任务本身是开放式的时,创建环境来训练这些模型更难,”他说。</p> <p>Kapoor说团队现在正在使用Mythos进行实验,Mythos是Anthropic于4月推出的最先进模型。它随后被特朗普政府要求满足各种安全限制,现在仅对批准的组织可用。Anthropic没有回应置评请求。</p> <p>这项研究有一些局限性。它只涵盖了两篇研究论文,并且原始作者知道他们评分的论文是由人工智能代理生成的,这可能影响了他们的评估。研究人员在设计和执行研究方面有相当大的自由裁量权,这意味着他们预先存在的信念和偏见可能渗入了结果。开放式研究的评估牺牲了一些客观性,但提供了比任何基准更丰富的测试。</p> <p>尽管如此,结果可能会缓和关于递归自我改进即将到来的说法。6月,Anthropic发布了一篇题为<a href="https://www.anthropic.com/institute/recursive-self-improvement">“当人工智能构建自身时”</a>的博客文章,概述了其加速模型自身开发的进展。7月,OpenAI<a href="https://www.youtube.com/watch?v=Wq45rvPGNHs">宣传</a>其新模型GPT-5.6 Sol帮助后训练了一个较小模型,节省了研究人员数周的工作。</p> <p>这一新发现可能呼应了人工智能公司内部的发现,无论其最乐观的公开声明如何。Anthropic联合创始人Jack Clark在他的通讯<a href="https://jack-clark.net/">Import AI</a>中写道,这与其公司在尝试<a href="https://jack-clark.net/2026/04/20/import-ai-454-automating-alignment-research-safety-study-of-a-chinese-model-hifloat4/">自动化</a>人工智能安全研究某些方面时的发现相似。</p> <p>他写道:“当今的人工智能系统缺乏某种宝贵的、直觉的创造力,尽管它们是能力非凡的工程师,但它们似乎具有某种机械的、公式化的思维特性,这可能阻碍它们成为优秀的研究人员。”
查看原文
查看缓存全文

缓存时间: 2026/08/18 15:43

# AI的递归自我改进或许不会那么快到来 来源:https://www.technologyreview.com/2026/08/18/1142188/ai-recursive-self-improvement 人工智能行业目前最大胆的承诺是,AI很快将能自我改进,几乎不需要人类监督。大型语言模型已经能编写代码、生成用于训练的合成数据,并优化运行它们的计算机芯片。对AI爆发式进展的预测(https://ai-2027.com/)表明,研究人员所称的“递归自我改进”(https://www.technologyreview.com/2025/08/06/1121193/five-ways-that-ai-is-learning-to-improve-itself/)即将来临。 但一项新研究(https://arxiv.org/abs/2607.27191)表明,我们可能还需要等待一段时间才能实现这一目标。研究人员发现,AI智能体尚不具备进行开放式AI研究的能力——即那些没有明确答案、需要判断力和品味的自由探索型研究,而这可能是构建自我改进AI的关键。 由普林斯顿大学Peter Kirgis和Sayash Kapoor领导的多机构研究团队发现,AI智能体能够解决进行AI研究所必需的工程问题,但缺乏产生原创性研究的判断力和创造力,其质量达不到顶会论文的水准。这种差距表明,一些关于自动化AI研究的炒作时间表可能过于超前于实际证据。 大多数现有研究都聚焦于AI智能体在解决可验证问题上的能力,比如解决工程问题或针对基准测试训练小型语言模型。但推动AI研究进展还需要开放式思维——选择一系列假设,决定哪些证据能解决问题,或者知道何时需要重新开始。 为了测试AI智能体在这类技能上的表现,研究人员提出了一种名为“影子评估”的新方法,要求AI基于一篇高质量未发表论文来回答研究问题。 研究人员使用运行在名为OpenClaw开源软件上的Anthropic公司Claude Opus 4.8模型来应对这些问题,这些问题分别来自两篇投稿至顶级机器学习会议NeurIPS 2026的论文。 第一个问题是关于大型语言模型的“人格”(决定其行为模式)是否可以通过编辑模型的权重(https://www.technologyreview.com/2026/01/07/1130795/what-even-is-a-parameter/)(即存储训练过程中所有学习内容的数十亿参数)来控制。另一个问题是如何设计一个检测器,用于指出基于电子表格数据进行预测的模型何时变得不可靠。由于论文尚未公开,AI智能体无法从训练数据中记忆答案或在网上找到相关信息。 AI智能体获得了六天时间、3000美元的Anthropic API额度、运行实验的GPU预算、虚拟计算机以及开放网络访问权限,以产出一篇足以在顶级AI会议上发表的研究论文。论文的原始作者按照会议评审标准对AI生成的论文进行了评审。 两位作者均拒稿了这些论文。 人类科学家发现,虽然AI智能体能够完成研究所需的所有工程任务——文献综述、运行数百次实验并汇编结果,但它们在实际研究执行中表现欠佳。Kapoor指出:“AI智能体在开展研究本身方面明显存在不足。”它们进行了奇怪的实验(某些情况下仅在极小的合成数据集上测试假设),难以清晰表述研究内容,且未对所属领域做出任何新贡献。“这些论文在质量上完全达不到顶级AI会议的水准。” 这是因为AI智能体缺乏开展研究所需的创造力和判断力。它们未能充分探索不同思路,过早地固守于无望的方法。尽管AI智能体提出了与原始作者初始思路相似的新颖且大胆的假设,却仅基于有限数据就否定了这些假设。它们也无法从失败的方法中调整方向——虽然能做小幅转向,但不能从根本上重新思考方法或尝试全新路径。 AI智能体还未能有效整合来自子智能体或外部AI评审工具的反馈。它们非但没有改进方法论,反而收缩了主张并增加了限定条件。此外,它们无法有效利用资源(如令牌、算力和时间),也未能遵循关于研究各阶段耗时或论文篇幅等要求的指示。 尽管存在诸多不足,AI智能体并未出现研究人员称为“奖励欺骗(https://www.technologyreview.com/2026/08/03/1141009/heres-why-ai-agents-lie-and-cheat-to-reach-their-goals/)”的行为——即隐藏或歪曲实验与数据。虽然子智能体(即主智能体为处理部分工作而生成的辅助AI)偶尔会出现幻觉或错误呈现结果,但这些都被监督项目的主导智能体(orchestrator agent)及时发现。 Kapoor指出,AI模型擅长研究工程而非开放式研究的原因可能与其训练方式有关。通过强化学习训练,AI模型能在特定训练机制下掌握可自动验证成功性的任务。但当任务本身具有开放性时,“就更难创建相应的训练环境来训练这些模型。” Kapoor表示,团队目前正在使用Anthropic最先进模型Mythos(4月推出,后因美国政府要求施加各项安全限制,目前仅对获批组织开放)进行该实验。Anthropic未回应置评请求。 该研究存在一些局限:仅覆盖两篇论文,且原始评审者知道论文由AI生成,这可能影响其评估。研究人员在设计和执行实验时拥有较大自主权,其既有观念与偏见可能渗入结果。开放式研究的评估牺牲了部分客观性,但提供了比任何基准测试更丰富的检验维度。 尽管如此,该发现可能抑制关于“递归自我改进即将实现”的乐观论调。6月,Anthropic发布题为《当AI构建自身》(https://www.anthropic.com/institute/recursive-self-improvement)的博客,概述其开发加速自我发展模型的进展。7月,OpenAI宣传其新模型GPT-5.6 Sol如何协助训练更小模型,为研究人员节省数周工作。 然而,这一发现也可能反映了AI公司内部的相似发现。Anthropic联合创始人Jack Clark在《Import AI》(https://jack-clark.net/)通讯中写道,这与其公司尝试自动化AI安全研究部分环节(https://jack-clark.net/2026/04/20/import-ai-454-automating-alignment-research-safety-study-of-a-chinese-model-hifloat4/)的结论不谋而合。 他写道:“当前AI系统缺乏宝贵的直觉创造力,尽管它们是能力非凡的工程师,却似乎存在某种机械式、公式化的思维特性,这可能阻碍它们成为优秀研究者。”他将AI系统缺乏创造力称为“对短期递归自我改进时间表的看跌信号”。 AI公司完全有动力开发能加速自我进步的AI系统,正如它们提升模型编程能力那样。OpenAI已明确将构建自动化AI研究员(https://www.technologyreview.com/2026/03/20/1134438/openai-is-throwing-everything-into-building-a-fully-automated-researcher/)作为目标,Anthropic则将自我改进AI视为行业下一个里程碑。 波士顿大学语言学与计算机科学教授Najoung Kim(研究AI智能体如何自动化AI研究,但未参与该研究)表示:“若有投资和定向努力,即使当前进展不顺,仍可能取得有趣进展。”另一方面,AI发展也可能呈现分化:在可量化的窄任务上突飞猛进,但在开放式研究上进展缓慢。 核心问题在于:开放式研究对递归自我改进究竟有多关键?AI系统能否仅通过改进窄任务而无需开放式研究即达成目标?Kapoor指出:“回顾领域内最大突破——Transformer的发明或推动AI大幅进步的新架构诞生——所有这些都需要创造性飞跃。” “但也有假说认为,实现变革性AI(特别是递归自我改进)所需的一切已经存在”,例如让模型训练更快、提升基准分数。 他坦言:“这坦率地说正是当下价值万亿美元的问题。”

相似文章

当AI自我构建:我们在递归自我改进方面的进展

Hacker News Top

Anthropic研究院发布了一项关于递归自我改进进展的分析报告,显示AI已在加速AI开发——工程师每季度的代码产出提升了8倍——并预测具备完全自主自我改进能力的AI系统或将比大多数机构所预期的更早到来。