回溯式工具链优化:通过轨迹回滚上的自我偏好改进LLM智能体
摘要
回溯式工具链优化(RHO)是一种自监督方法,仅利用历史轨迹即可提升LLM智能体性能,在SWE-Bench Pro上实现78%的通过率,无需外部评分。
查看缓存全文
缓存时间: 2026/06/10 05:44
论文页面 - 回顾式工具集优化:通过轨迹展开的自偏好提升LLM智能体性能
来源:https://huggingface.co/papers/2606.05922
摘要
回顾式工具集优化(RHO)是一种自监督方法,通过多样化的任务选择、并行重解和自验证技术,仅利用过往轨迹来优化智能体工具集,从而提升AI智能体性能。
AI智能体依赖技能、工具和工作流程组成的工具集来解决复杂问题。持续改进这一工具集对于适应新任务至关重要。然而,现有的优化方法通常需要基于真值验证集,但在实际部署场景中获取此类标注数据十分困难。为解决这一问题,我们提出了回顾式工具集优化(RHO),这是一种自监督方法,仅利用过往轨迹来优化智能体工具集。具体而言,RHO从过往轨迹中选取一个多样化的核心任务子集,并并行重解这些任务。智能体通过自验证和自一致性分析这些展开结果,然后生成候选工具集更新,并通过自身的成对自偏好机制选择最有效的更新。我们在软件工程、技术工作和知识工作三个不同领域对RHO进行了评估。值得注意的是,仅一轮优化就将SWE-Bench Pro上的通过率从59%提升至78%,且无需任何外部评分。此外,我们的分析表明,RHO有效针对了先前的失败模式。因此,优化后的工具集改变了智能体的行为模式,并在长周期会话中保持了更高的准确率。
查看arXiv页面 (https://arxiv.org/abs/2606.05922)查看PDF (https://arxiv.org/pdf/2606.05922)项目页面 (https://paper-rho.wenbo.io/)GitHub (https://github.com/wbopan/retro-harness)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05922)
在你的智能体中获取这篇论文:
hf papers read 2606.05922
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型README.md中引用arxiv.org/abs/2606.05922即可从此页面链接。
引用此论文的数据集0
无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2606.05922即可从此页面链接。
引用此论文的Spaces0
无Space关联此论文
在Space README.md中引用arxiv.org/abs/2606.05922即可从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加至收藏集 (https://huggingface.co/new-collection)即可从此页面链接。
相似文章
面向LLM智能体训练的回顾性进度感知自我精炼
本文介绍了RePro,一个通过“先执行再反思”的展开范式训练LLM智能体自我生成进度信号的框架,在WebShop、ALFWorld和Sokoban基准测试上实现了高达12%的绝对成功率提升。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
递归式 Harness 自我改进
介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。
EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。