EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
摘要
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
arXiv:2608.05446v1 公告类型:新
摘要:长时程LLM智能体越来越依赖外部执行支持来维护状态、跟踪进度、调用工具、验证结果,并在交互中复用经验。然而,有效的框架使用带来了两个相互关联的挑战:从嘈杂的交互轨迹中形成状态,以及对外部状态访问的运行时控制。现有智能体通常通过提示、启发式规则或特定领域的约定来处理这两个挑战,使外部工作空间及其使用策略成为手动工程产物。为了解决这一问题,我们研究了框架策略学习问题,即智能体离线学习框架策略,并在运行时任务执行过程中在线部署这些策略来构建和更新外部框架状态。我们引入了EvoHarness-RL,它将信念(Belief)、进度(Progress)和经验(Experience)(BPE)作为面向策略的框架状态暴露出来。监督式框架微调教会基础智能体框架动作空间以及如何构建有用的外部状态,而成本感知的GRPO则探索协调策略,以在长时程交互过程中选择性地读取、更新和整合该状态。在ALFWorld上使用Qwen3-8B LLM进行实例化,EvoHarness-RL达到了96.9%的成功率,并揭示了两个关键动态:框架退火(harness annealing),即训练将重复出现的框架使用模式内化到模型策略中,使智能体从频繁调用框架转向选择性地访问外部状态;以及框架进化(harness evolution),即进度更新和经验整合将框架精炼为紧凑、任务自适应的状态基板。这些结果表明,长时程智能体受益于可训练的策略来构建和协调外部框架工作空间,而不仅仅是添加更强大的工具或更大的记忆。
查看缓存全文
缓存时间: 2026/08/07 07:50
# EvoHarness-RL:学习自演化的长程 LLM 智能体运行时 Harness 来源:https://arxiv.org/html/2608.05446 1\]伊利诺伊大学厄巴纳-香槟分校 2\]Meta AI Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He ## 摘要 长程(Long-Horizon)LLM 智能体越来越依赖外部执行支持来维护状态、跟踪进度、调用工具、验证结果,并在多次交互中复用经验。然而,高效使用 harness 带来两个相互耦合的挑战:从嘈杂的交互轨迹中形成状态,以及对外部状态访问的运行时控制。现有智能体通常通过提示、启发式规则或领域特定约定来处理这两个问题,导致外部工作空间及其使用策略仍需人工设计。为解决这一问题,我们研究 *harness 策略学习*问题,即智能体离线学习 harness 策略,并在运行时任务执行期间在线构建和更新外部 harness 状态。我们提出 EvoHarness-RL,将信念(Belief)、进度(Progress)和经验(Experience)暴露为面向策略的 harness 状态。监督式 harness 微调教会基础智能体 harness 动作空间以及如何构建有用的外部状态,而成本感知的 GRPO 探索协调策略,在长程交互中选择性读取、更新和整合这些状态。在 ALFWorld 上使用 Qwen3-8B LLM 实例化后,EvoHarness-RL 达到 96.9% 的成功率,并揭示了两个关键动态:*harness 退火(annealing)*,即训练将反复出现的 harness 使用模式内化到模型策略中,使智能体从频繁的 harness 调用转向选择性的外部状态访问;以及 *harness 演化(evolution)*,即进度更新和经验整合将 harness 细化为紧凑、自适应任务的状态基板。这些结果表明,长程智能体受益于可训练的策略来构建外部 harness 工作空间并与之协调,而不仅仅是添加更强的工具或更大的记忆。 ## 1 引言 LLM 智能体越来越多地被部署在长程交互场景中,它们需要超越单步问题求解,在长时间交互中实现可靠的任务执行。在具身交互、网页导航、软件工程和工作流自动化等任务中(Shridhar 等,[2021](https://arxiv.org/html/2608.05446#bib.bib14);Hong 等,[2026](https://arxiv.org/html/2608.05446#bib.bib3);Yang 等,[2024](https://arxiv.org/html/2608.05446#bib.bib22);Zhou 等,[2024](https://arxiv.org/html/2608.05446#bib.bib27)),智能体需要维护对环境的信念、跟踪已完成和待完成的子目标、从失败动作中恢复,并复用先前经验中的
相似文章
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
EvoTrainer:面向自主智能体强化学习的LLM策略与训练框架协同进化
EvoTrainer提出了一种自主训练框架,通过经验反馈协同进化LLM策略与训练框架,在数学推理、代码生成以及长期软件工程任务上超越了人工设计的强化学习基线。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。