递归自我改进的首个实验证据(3分钟阅读)

TLDR AI 论文

摘要

研究人员展示了AIDE²,这是一个具有递归自动研究循环的系统,在超过100次迭代中改进了自己的代码,发现了七项改进,并在保留的基准测试上击败了手动调优的智能体。

研究人员对一个自动研究智能体进行了为期八天的自动研究。结果击败了他们手动调优了两年的测试框架。这个完全自主的系统有一个内部循环,针对评估优化代码,以及一个外部循环,针对内部循环在不同基准测试上的平均分数优化内部循环智能体的测试框架代码。它设计了一种新颖的搜索算法,将提示大小减少了16倍,并构建了一个针对奖励黑客攻击的分层系统。
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:58

# @zhengyaojiang 在 Thread Reader App 上的推文 来源:https://threadreaderapp.com/thread/2077079778793042425.html 张耀江 头像 (https://threadreaderapp.com/user/zhengyaojiang) 递归自我改进(RSI)的首个实验证据。 让自动研究智能体自我研究八天。 结果在保留的基准测试上,击败了我们手工调试了两年的框架:🧵(1/7) 视频海报 我们的 RSI 系统 AIDE2 包含两个自动研究循环。 内循环:与普通自动研究智能体一样,针对评估指标优化代码。 外循环:针对不同基准测试上内循环的平均得分,优化内循环智能体的框架代码。(2/7)图片 (https://pbs.twimg.com/media/HNNEKFkbMAADV_d.jpg) 经过 100 次迭代,外循环发现了七项对基线的改进。包括新的搜索策略、将提示压缩 16 倍的内存系统,以及针对奖励黑客的分层防御。(3/7)图片 (https://pbs.twimg.com/media/HNNETVsbcAA6J6s.jpg) 我们在外循环从未见过的保留基准测试上测试了所发现的智能体。 它们具有泛化能力。在所有三项测试上,都击败了我们手工调试了两年的智能体。 其中两项位于其训练任务族内。最远的一项位于族外,改进了基于物理的天气模型。(4/7)图片 (https://pbs.twimg.com/media/HNNEZCAa4AERHPz.jpg) 我们还观察到一个涌现现象:外循环通过提示与基于规则的检查相结合,降低了内循环智能体的奖励黑客率。这是在遭受奖励黑客问题的 OOD GPU 内核工程任务上进行的基准测试。(5/7)图片 (https://pbs.twimg.com/media/HNNEm2IbYAAtR_j.jpg) 在我们的 RSI 阶梯中,AIDE2 属于 Level 1。其自我改进效率超越了使用通用 AI 工具进行的人工研发,在保留基准测试上如此。 我们还测试了 Level 2:改进后的内循环智能体是否能让外循环变得更好。结果好坏参半,我们未声称点燃。(6/7)图片 (https://pbs.twimg.com/media/HNNEuSVb0AA15MD.jpg) 更多内容见博客文章: - 所发现算法的详细分解 - AIDE2 尝试过但被否决的想法,涵盖了搜索文献中相当大的一部分 - 其发布的死代码 (7/7)weco.ai/blog/first-evi... (https://www.weco.ai/blog/first-evidence-of-recursive-self-improvement) 为团队深感自豪:@DhruvSrikanth、@yuxiangwu_、@dexhunt3r 和 @BingchenZhao 凭借相对较少的资源,历时近一年完成了这一雄心勃勃的项目。 同时,衷心感谢所有提供草稿反馈的朋友,包括 @jeankaddour、@MinqiJiang、@morgymcg、@Odysseus0z、@rosstaylor90、@OfirPress 以及许多其他人! • • • 本线程中缺少某些推文?您可以尝试强制刷新 (https://threadreaderapp.com/thread/2077079778793042425.html#)

相似文章

当AI自我构建:我们在递归自我改进方面的进展

Hacker News Top

Anthropic研究院发布了一项关于递归自我改进进展的分析报告,显示AI已在加速AI开发——工程师每季度的代码产出提升了8倍——并预测具备完全自主自我改进能力的AI系统或将比大多数机构所预期的更早到来。

递归自我改进的经济学 [pdf]

Hacker News Top

本文探讨了AI系统中递归自我改进的经济激励和动态,分析了此类过程如何扩展及其对治理与安全的影响。