递归式 Harness 自我改进
摘要
介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。
arXiv:2607.15524v1 Announce Type: cross
摘要:在模型与 Harness 协同进化下,Harness 不仅仅是推理时的支架,更是数据生成组件,其执行轨迹可以塑造未来的基础模型。这激发了 Harness-in-the-loop 学习:优化 Harness 以同时提升当前智能体的性能以及用于未来模型训练的执行轨迹质量。然而,持续更新提供者构建的支架成本高昂且劳动密集。因此,我们研究是否以任务特定方式优化用户构建的 Harness 能够提高执行轨迹质量,同时保持计算轻量级并且仅需少量更新迭代。为此,我们引入了递归式 Harness 自我改进(RHI),该方法将 Harness 表示为智能体循环的提示级别规范,并通过对其自身修订历史的成对反馈进行迭代优化。在涵盖定量金融、机器人和制药的 30 个合成机器学习研究任务中,少数几次 RHI 迭代足以显著提高低推理努力智能体的性能上限,超过相应的最大推理努力设置,同时将推理成本降低高达 60%。我们表明,这些收益主要来自于通过更有效的智能体间信息流实现的改进的任务特定上下文管理,而非更长的推理轨迹。最后,我们将这种行为形式化为 RHI 隐式优化目标的信息论假设,表明 RHI 是模型与 Harness 协同进化范式下持续学习的实用算法。
查看缓存全文
缓存时间: 2026/07/20 09:26
# 递归式工具自我改进 来源:https://arxiv.org/abs/2607.15524 查看 PDF (https://arxiv.org/pdf/2607.15524) > **摘要**:在模型-工具协同演化中,工具不仅是在推理时使用的脚手架,更是数据生成组件——其执行轨迹可塑造未来的基础模型。这催生了工具在环学习:优化工具既要提升即时智能体性能,也要改善用于后续模型训练的执行轨迹质量。然而,持续更新供应商构建的工具成本高昂且劳动密集。因此,我们研究是否可以通过任务特定的方式优化用户构建的工具,在仅需少量更新迭代且计算轻量的前提下,提升执行轨迹质量。为此,我们提出递归式工具自我改进(RHI),该方案将工具表示为智能体循环的提示级规范,并利用自身修订历史中的成对反馈进行迭代优化。在涵盖量化金融、机器人学和药学在内的30个合成机器学习研究任务中,仅需几次RHI迭代即可显著提升低推理难度智能体的性能天花板,超越对应的最高推理难度设置,同时将推理成本降低高达60%。我们证明,这些提升主要源于通过更有效的智能体间信息流所实现的改进的任务特定上下文管理,而非更长的推理轨迹。最后,我们将这一行为形式化为RHI隐含优化目标的信息论假设,表明RHI可作为模型-工具协同演化范式中持续学习的实用算法。 ## 提交历史 来自:Hyunin Lee [查看电子邮件 (https://arxiv.org/show-email/97dc9d73/2607.15524)] **[v1]** 2026年7月17日,星期五,00:21:19 UTC(2,357 KB)
相似文章
RRSI: 智能体框架的正则化递归自我改进
本文介绍了针对AI智能体框架的正则化递归自我改进(RRSI),该方法在递归进化过程中应用正则化以防止过拟合,在多个基准测试中展示了性能提升。
Harness Engineering for Self-Improvement(28 分钟阅读)
这篇博客文章由 Lilian Weng 撰写,探讨了递归自我改进在 AI 中的概念,重点介绍了 harness engineering——即围绕基础模型的系统——如何通过工作流设计和评估实现 AI 代理的自动化和改进。
ModularRSI:模块化与可泛化的递归式智能体框架自我改进
ModularRSI 提出了一种模块化、可泛化的递归式自我改进框架,用于智能体框架。该框架利用跨任务的对比学习独立演进模块,提升在未见任务上的性能。
AI能自我改进吗?RSI或许是答案[研究]
介绍HarnessOpt-Bench以测量AI中的递归自我改进,评估了5个前沿模型在4项任务上的表现,发现模型选择比编程工具选择的影响更大。
@SakanaAILabs:从“Harness工程”到RSI 递归自我改进(RSI)——即AI自我构建与提升——将如何实现…
Lilian Weng的博客文章认为,AI中的递归自我改进(RSI)将通过完善“harness”(模型周围系统)的设计与优化来实现,并重点介绍了Sakana AI的研究案例。