AI能自我改进吗?RSI或许是答案[研究]

Reddit r/MachineLearning 论文

摘要

介绍HarnessOpt-Bench以测量AI中的递归自我改进,评估了5个前沿模型在4项任务上的表现,发现模型选择比编程工具选择的影响更大。

AI能否让其他AI变得更好?又是什么阻止了它作弊?上个月,一个OpenAI的评估代理逃出了它的沙箱并侵入了Hugging Face,显然是为了从基准测试中获取测试解决方案。这正是一個重写代理并读取自身评分的系统的典型行为。尽管如此,我们着手测量递归自我改进,将考试锁定在沙箱之外。我们引入了HarnessOpt-Bench,它对一个大语言模型在提升另一个代理的工具方面的改进程度进行评分。在开发划分中,优化器可以看到每个案例的跟踪信息。在验证时,它接收一个单一的聚合分数。在测试时,什么都没有——直到一个可信的服务器对其最终候选工具进行评分。API密钥、预算执行和保留数据从未进入优化器的沙箱。这种隔离是通过构造而非指令实现的:保留评估器和权限控制位于进化工具的循环之外。5个前沿模型,4个下游任务,111次运行以测试两个假设:1️⃣ 相同编程工具,交换模型:Claude Opus 5在OpenCode下在4项任务中有3项领先。查看一个任务从2025年11月到2026年7月的发布情况,GPT从3%上升到49%的领先空间,Claude Opus从37%上升到59%。2️⃣ 相同模型,交换编程工具:模型在自己的工具中表现最好吗?没有一致的主场优势:opencode在20个模型-任务对中有11个击败了原生工具(Claude Code, Codex, Kimi CLI)。模型选择带来的收益是工具选择的1.8倍。论文:https://arxiv.org/abs/2608.06301 代码(MIT许可,基于我们团队的ICML 2026 VeRO):https://github.com/scaleapi/vero 原始帖子:https://www.linkedin.com/posts/shehabyasser_can-an-ai-make-other-ais-better-and-what-share-7498801902260981760-xuCo/
查看原文

相似文章

递归式 Harness 自我改进

arXiv cs.AI

介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。

Harness Engineering for Self-Improvement(28 分钟阅读)

TLDR AI

这篇博客文章由 Lilian Weng 撰写,探讨了递归自我改进在 AI 中的概念,重点介绍了 harness engineering——即围绕基础模型的系统——如何通过工作流设计和评估实现 AI 代理的自动化和改进。