@dair_ai:MIT和Sakana AI的重磅论文。他们展示了自我改进的编码代理是有效的。最棒的是他们的方法…

X AI KOLs Timeline 论文

摘要

该论文提出Self-Improvement via Fast Tree-search (SIFT)框架,利用LLM作为裁判高效评估编码代理中的自我修改,以更少的CPU时间和API成本实现更好的基准性能。

MIT和Sakana AI的重磅论文。 他们展示了自我改进的编码代理是有效的。 最棒的是,他们的方法Self-Improvement via Fast Tree-search (SIFT)的运行时间仅为DGM的十分之一。 他们在30次扩展后使用o3-mini在Polyglot上达到35.1%。DGM在80个节点的树搜索后达到30.7%。 SIFT在不到50个CPU小时内完成,实际时间不到5小时。Qwen3-30B配置以224个CPU小时和34美元的API费用运行完整搜索,是DGM基线的十分之一。 成本节约源于资金投入的关键点。 基准评估是运行时的瓶颈,因此LLM裁判首先对候选自我修改进行排名,只有有前景的候选才会被评估。 裁判质量决定了运行结果。 在TerminalBench上,gpt-5.4-high作为成对裁判找到了36.7%的代理,而起始点为29.2%。gpt-5找到了34.5%,但其排名最高的候选并不是搜索产生的最佳代理。 论文:https://academy.dair.ai/papers/self-improvement-via-fast-tree-search-2609.19526…
查看原文
查看缓存全文

缓存时间: 2026/09/19 23:06

MIT与Sakana AI的重磅论文。 他们证明了自我改进型编程智能体是可行的。 最精妙的是,其采用的“快速树搜索自我改进“(SIFT)方法,CPU消耗仅为DGM方案的十分之一。 该方案使用o3-mini模型在30次扩展后达到Polyglot基准35.1%的准确率,而DGM在80节点树搜索后仅达30.7%。 SIFT在不到50个CPU小时内完成,壁钟时间不足5小时。Qwen3-30B配置的完整搜索仅消耗224个CPU小时和34美元API费用,仅为DGM基线的十分之一。 节省源于资源分配策略。 基准评估是运行时瓶颈,因此方案让大语言模型评审先对自我修改候选方案进行排序,仅对最具潜力的方案进行完整评估。 评审质量决定最终表现。 在TerminalBench测试中,gpt-5.4-high作为配对评审可将智能体性能从29.2%基线提升至36.7%;gpt-5提升至34.5%,但其最高排名的候选方案并非搜索过程中产生的最优智能体。 论文链接:https://academy.dair.ai/papers/self-improvement-via-fast-tree-search-2609.19526…


通过快速树搜索实现自我改进

来源:https://academy.dair.ai/papers/self-improvement-via-fast-tree-search-2609.19526 与论文对话 (https://academy.dair.ai/dashboard/paper-chat/self-improvement-via-fast-tree-search-2609.19526)

首页

通过快速树搜索实现自我改进

策展人观点

邢宏·傅、阿拉文斯·库兰塔维鲁与山田勇太提出SIFT方法,该方法将候选方案评估识别为递归自我改进的运行时瓶颈,并用评审锦标赛机制替代了大部分评估过程。

与本文对话

关于本文的提问 核心要点01

配对评审驱动探索。大语言模型评审对候选补丁进行两两比较,其胜负记录通过正则化Bradley-Terry模型聚合,所得强度评分驱动轻量化分离式树搜索中的基于排名的父节点采样。

02

昂贵评估仅保留给潜力节点。仅最具潜力的候选方案会进行实际下游任务评估,确保搜索过程不受缓慢评估的制约。

03

该方法在Polyglot基准上超越了现有树搜索自进化方案。以显著更少的CPU小时数、壁钟时间和API成本完成,这正是论文自身设定的约束条件。

04

瓶颈理论具有普适价值。现有自我改进循环通过重新运行基准测试子集来评估修改效果;识别这一成本核心,为所有类似优化指明了改进方向。

摘要编程智能体可递归修改自身实现,形成自我改进循环。虽然先前研究表明这能提升编码基准表现,但现有方法成本高昂且计算密集。本文提出一种简单高效的自我改进框架,在严格预算限制下显著提升编程性能。我们将候选自我修改的评估识别为主要运行时瓶颈,因为先前方案需用修改后的智能体重新运行基准测试子集来评估效果,耗时巨大。我们引入快速树搜索递归自我改进(SIFT),通过大语言模型评审信号增强下游任务评估——评审对候选补丁进行两两比较,其胜负记录经正则化Bradley-Terry模型聚合,所得强度评分驱动轻量化分离式树搜索中的基于排名的父节点采样。昂贵的下游任务评估仅保留给最具潜力的节点。借助完全分离的树搜索流水线,评审评分提供中间信号以指导对潜力候选补丁的探索,避免因缓慢评估导致的瓶颈。SIFT在完整Polyglot基准测试中超越现有基于树搜索的自进化框架,且CPU消耗、壁钟时间及API成本均显著降低。

相似文章

基于快速树搜索的自我改进

arXiv cs.AI

本文介绍了一种名为递归自我改进快速树搜索(SIFT)的样本高效框架。该框架利用轻量级树搜索,由LLM-as-a-judge评估指导,以在预算约束下提升编码代理的性能,其资源成本低于现有方法。

AI研究智能体的递归自我改进

Hugging Face Daily Papers

本文介绍了AIDE^2,这是一个系统,它使AI研究智能体能够通过递归自我改进自主提升其代码,从而在多种AI研究任务中获得性能提升。