递归式 Harness 自我改进

arXiv cs.AI 论文

摘要

介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。

arXiv:2607.15524v1 Announce Type: cross 摘要:在模型与 Harness 协同进化下,Harness 不仅仅是推理时的支架,更是数据生成组件,其执行轨迹可以塑造未来的基础模型。这激发了 Harness-in-the-loop 学习:优化 Harness 以同时提升当前智能体的性能以及用于未来模型训练的执行轨迹质量。然而,持续更新提供者构建的支架成本高昂且劳动密集。因此,我们研究是否以任务特定方式优化用户构建的 Harness 能够提高执行轨迹质量,同时保持计算轻量级并且仅需少量更新迭代。为此,我们引入了递归式 Harness 自我改进(RHI),该方法将 Harness 表示为智能体循环的提示级别规范,并通过对其自身修订历史的成对反馈进行迭代优化。在涵盖定量金融、机器人和制药的 30 个合成机器学习研究任务中,少数几次 RHI 迭代足以显著提高低推理努力智能体的性能上限,超过相应的最大推理努力设置,同时将推理成本降低高达 60%。我们表明,这些收益主要来自于通过更有效的智能体间信息流实现的改进的任务特定上下文管理,而非更长的推理轨迹。最后,我们将这种行为形式化为 RHI 隐式优化目标的信息论假设,表明 RHI 是模型与 Harness 协同进化范式下持续学习的实用算法。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:26

# 递归式工具自我改进  
来源:https://arxiv.org/abs/2607.15524  
查看 PDF (https://arxiv.org/pdf/2607.15524)  

> **摘要**:在模型-工具协同演化中,工具不仅是在推理时使用的脚手架,更是数据生成组件——其执行轨迹可塑造未来的基础模型。这催生了工具在环学习:优化工具既要提升即时智能体性能,也要改善用于后续模型训练的执行轨迹质量。然而,持续更新供应商构建的工具成本高昂且劳动密集。因此,我们研究是否可以通过任务特定的方式优化用户构建的工具,在仅需少量更新迭代且计算轻量的前提下,提升执行轨迹质量。为此,我们提出递归式工具自我改进(RHI),该方案将工具表示为智能体循环的提示级规范,并利用自身修订历史中的成对反馈进行迭代优化。在涵盖量化金融、机器人学和药学在内的30个合成机器学习研究任务中,仅需几次RHI迭代即可显著提升低推理难度智能体的性能天花板,超越对应的最高推理难度设置,同时将推理成本降低高达60%。我们证明,这些提升主要源于通过更有效的智能体间信息流所实现的改进的任务特定上下文管理,而非更长的推理轨迹。最后,我们将这一行为形式化为RHI隐含优化目标的信息论假设,表明RHI可作为模型-工具协同演化范式中持续学习的实用算法。

## 提交历史  

来自:Hyunin Lee [查看电子邮件 (https://arxiv.org/show-email/97dc9d73/2607.15524)]  
**[v1]** 2026年7月17日,星期五,00:21:19 UTC(2,357 KB)

相似文章

Harness Engineering for Self-Improvement(28 分钟阅读)

TLDR AI

这篇博客文章由 Lilian Weng 撰写,探讨了递归自我改进在 AI 中的概念,重点介绍了 harness engineering——即围绕基础模型的系统——如何通过工作流设计和评估实现 AI 代理的自动化和改进。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。