@gm8xx8: Harness-R1 保持目标模型冻结,并学习从失败轨迹编辑其周围运行时,mo…
摘要
Harness-R1 提出了一种方法,从失败轨迹中学习为 LLM 智能体编辑可执行的运行时 harness,使用一个独立的 9B 工程师模型通过在线 GRPO 优化,同时保持目标模型冻结。它在 WebShop、ALFWorld 和 DBBench 上提高了成功率。
查看缓存全文
缓存时间: 2026/08/05 04:19
Harness-R1 保持目标模型冻结,而是学习从失败轨迹中编辑其周围的运行时,修改上下文构建、动作中介、恢复和执行逻辑。一个专门的 harness 工程师首先通过监督微调初始化,然后通过在线 GRPO 进行优化,其中仅当重新运行相同任务能改善结果时,运行时补丁才会获得奖励。Harness 成为与模型并列的可训练组件。论文:https://arxiv.org/abs/2608.02276
Harness-R1:学习从智能体失败轨迹中编辑可执行运行时 Harness
来源:https://arxiv.org/html/2608.02276
1]上海交通大学 2]小红书股份有限公司 3]东南大学 \contribution[*]在小红书股份有限公司实习期间完成的工作。 \contribution[‡]同等贡献。 \contribution[]通讯作者。 \metadata[Contact][email protected], [email protected], [email protected] \metadata[Code]https://github.com/DeepExperience/Harness-R1 \metadata[Models]https://huggingface.co/ShaoShuai0605/Harness-R1
Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang
[[
摘要
围绕大型语言模型构建的智能体在部署过程中会不断积累交互轨迹,但它们的行为通常保持不变。除了更新模型权重,这些轨迹还可以改进智能体 harness——即负责构建上下文、中介工具、验证动作和恢复执行的组件。我们引入了 Harness-R1,据我们所知,这是第一种将“基于失败条件的、全生命周期范围的现有可执行运行时编辑”作为一种可学习能力的方法。它通过在线强化学习对专门的 harness 工程师进行后训练,使其编辑针对实际实现的任务成功率进行优化,而不是由固定的编辑器来提出。一个独立的 9B 工程师将批量目标智能体失败转换为经过验证的可执行补丁;对冻结的目标智能体在同一批次中进行重新运行,提供结果奖励,因此训练只更新工程师。冷启动监督微调用于初始化这一编辑策略,随后通过组相对策略优化(GRPO)进行在线训练。在 WebShop、ALFWorld 和 DBBench 上,Harness-R1 将 vanilla Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%(+9.3 个百分点)。在对目标智能体进行直接微调后,针对特定目标的工程师将平均成功率进一步从 59.2% 提升至 64.2%(+5.0 个百分点);由于这些增益在目标微调前后都能保持,Harness-R1 指向了 harness 工程师与目标智能体共同进化的方向。
1 引言
大型语言模型作为工具使用型智能体的决策核心,使它们能够解释任务、维护状态,并通过与外部环境的多轮交互来追求复杂目标(Yao et al., 2023b; Liang et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib38); Li et al., 2026a (https://arxiv.org/html/2608.02276#bib.bib39); Zhang et al., 2025 (https://arxiv.org/html/2608.02276#bib.bib40))。与单次模型调用不同,部署中的智能体会持续产生包含观察、动作、环境反馈和任务结果的轨迹。这些轨迹记录了成功经验,但也暴露了系统性失败,例如工具误用、状态丢失、协议违反、重复尝试和恢复失败。这引出了一个自然的问题:智能体能否利用其交互经验持续改进,而不是在部署后保持固定?这种从经验到改进的循环是自我进化智能体的核心关注点(Gao and others, 2026 (https://arxiv.org/html/2608.02276#bib.bib41); Wu et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib42); Yu et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib43))。
智能体系统可以在两个互补的位置进行改进。一条路线通过监督微调、强化学习或在线学习更新模型参数,直接改进做出任务决策的智能体(Xia et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib16); Lu et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib17); Shi et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib18))。另一条路线保持模型固定,并优化其周围的智能体 harness。上下文构建、记忆与技能、工具中介、动作验证、控制与恢复逻辑都是 harness 的组成部分(Shinn et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib13); Zhao et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib15); Karten et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib9))。它们共同决定了模型能观察到什么、能执行哪些动作、如何解释环境反馈,以及在偏离后如何恢复执行。因此,即使模型权重完全相同,在不同的 harness 下也可能产生截然不同的智能体能力。Harness 优化为模型训练提供了一条互补路径:它改进模型与环境之间的运行时机制,而不改变模型本身。
参照标题
图 1:三个基准上匹配基线的奖励变化;菱形表示等权平均值。
直接修改 harness 并非总是可靠的。图 1 (https://arxiv.org/html/2608.02276#S1.F1) 比较了三个基准上平均环境奖励相对于匹配基线的变化。固定的 Self-Refine 规则(Madaan et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib14))在三个基准上都降低了奖励,而前沿 harness 编辑器的增益要么不稳定,要么有限,有些甚至降低了 WebShop 的奖励。因此,提示强大但固定的模型来编辑 harness 并不可靠。除了这种提示式编辑,近期系统构建了专门的 harness 优化流水线。Meta-Harness、Agentic Harness Engineering 和 AutoHarness 使用智能体式的提议者,根据 harness 状态、执行轨迹和任务反馈,共同编辑提示、工具、记忆、中间件或控制逻辑;Life-Harness 和 HarnessX 将可编辑表面扩展到生命周期干预和类型化组件(Lee et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib6); Lin et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib5); Lou et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib7); Xu et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib8); Chen et al., 2026b (https://arxiv.org/html/2608.02276#bib.bib10))。然而,harness 提议者通常保持固定:结果用于选择或迭代改进补丁,而不直接更新提议者参数;HarnessX 使用跨 harness 的 GRPO 来训练任务模型,而 AEGIS 保留符号化的 harness 编辑。补充性的工作优化提示、示范、记忆、技能或任务求解程序(Yang et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib19); Khattab et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib20); Shinn et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib13); Zhao et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib15); Xia et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib16); Lu et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib17); Shi et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib18)),但通常只隔离单一工件,或构建一个新的求解程序。工作流可能是 harness 的一部分,但生成一个工作流不同于学习将基于失败条件的可执行干预安装到现有的多阶段运行时中。后者必须根据实际的目标智能体失败来决定何时干预,并协调上下文、状态、动作执行和恢复。这留下了一个较少研究的问题:我们能否通过在线强化学习对专门的 harness 工程师进行后训练,使从观察到的失败中改进现有可执行运行时成为一种学习能力?
直接训练 harness 工程师面临两个挑战。首先,可编辑的运行时跨越相互依赖的执行阶段,因此不受限制的代码编辑可能破坏现有接口、产生不可执行的行为,或引入与任务成功无关的变化。其次,文本形式和静态规则无法确定补丁质量;只有应用补丁后目标智能体的行为才能做到这一点。因此,训练需要一条从目标智能体失败出发、经过受约束的可执行编辑、再到更新工程师的性能增益的扎根反馈路径。
我们引入了 Harness-R1,一种训练范式,它在保持目标智能体冻结的同时,通过在线强化学习对专门的 harness 工程师进行后训练。在目标智能体失败批次的条件约束下,工程师生成经过验证的可执行运行时补丁;打过补丁的目标智能体重新运行相同的任务,实际实现的性能变化只奖励工程师。冷启动监督微调在在线 GRPO 之前初始化策略。在 WebShop、ALFWorld 和 DBBench 上,Harness-R1 将 vanilla 目标的平均成功率从 44.3% 提升至 53.6%(+9.3 个百分点),并在对目标智能体直接微调后,从 59.2% 提升至 64.2%(+5.0 个百分点)。
主要贡献总结如下:
- • 我们将基于失败条件的、全生命周期范围的 harness 编辑形式化为一个专门的工程师的在线强化学习问题,同时保持目标智能体冻结。
- • 我们开发了 Harness-R1,将冷启动监督微调与基于可执行运行时补丁实际效用的组相对策略优化相结合,在三个交互式基准上将 vanilla 目标提升了 9.3 个百分点。
- • 我们展示了 harness 工程师与目标智能体可以共同进化:在对目标智能体进行直接微调后,一个针对特定目标的 Harness-R1 工程师额外增加了 5.0 个百分点。
参照标题
图 2:Harness-R1 概览。挖掘出的目标失败成为证据包(左);harness 工程师编写一个可执行补丁,编辑冻结目标周围运行时中的四个生命周期点(右);打过补丁的目标重新运行相同任务,由此产生的同批次奖励仅通过冷启动 SFT 和后续 GRPO 训练工程师(底部循环)。有关循环、动作空间和生命周期钩子,请参阅方法部分。
2 相关工作
基于 LLM 的 Harness 演化。
近期工作将智能体 harness 视为一个可执行的、多组件的优化对象。一条路线从执行轨迹、评估分数和奖励中搜索或合成完整的 harness:Meta-Harness 使用编码智能体在先前候选中进行搜索,AutoHarness 根据环境有效性反馈迭代合成代码 harness,AHE 则共同演化提示、工具、中间件、技能、子智能体和记忆(Lee et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib6); Lou et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib7); Lin et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib5))。第二条路线将重复出现的交互失败转化为跨多个执行阶段的、经过回归检查的修复,结合了基于轨迹的诊断和回归感知验证(Xu et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib8); Chen et al., 2026a (https://arxiv.org/html/2608.02276#bib.bib11); Zhang et al., 2026a (https://arxiv.org/html/2608.02276#bib.bib12))。作为一个密切相关的并行方向,HarnessX 组合类型化处理器,使用 AEGIS 进行符号化的轨迹驱动适配,并对任务模型应用跨 harness 的 GRPO(Chen et al., 2026b (https://arxiv.org/html/2608.02276#bib.bib10))。在这些系统中,提议者可能是更强的外部模型,也可能是目标模型本身,但没有任何系统根据 harness 编辑结果对提议者或编辑器权重进行后训练;反馈只是引导程序搜索、候选选择、回归测试或工件提升。Harness-R1 则将学习目标从最终的 harness 转移到编辑策略本身:在线强化学习利用补丁在冻结目标智能体上的实际效用,对专门的 harness 工程师进行后训练。
Harness 组件的算法优化。
更广泛的一条路线在预设的编辑空间和搜索过程中优化提示和其他模型外部工件。有些方法让 LLM 针对分数提出并搜索指令候选,如 APE 和 OPRO(Zhou et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib24); Yang et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib19))。另一些方法构建自然语言“梯度”或文本反馈,并将其传播以编辑提示或代码,如 ProTeGi 和 TextGrad(Pryzant et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib25); Yuksekgonul et al., 2025 (https://arxiv.org/html/2608.02276#bib.bib21))。基于种群的方法,如 EvoPrompt、Promptbreeder 和 GEPA,通过适应度对提示进行变异和选择(Guo et al., 2025 (https://arxiv.org/html/2608.02276#bib.bib26); Fernando et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib27); Agrawal et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib23)),而流水线编译器(如 DSPy 和 MIPRO)将程序结构与模块参数分离,并搜索指令和引导式示范(Khattab et al., 2023 (https://arxiv.org/html/2608.02276#bib.bib20); Opsahl-Ong et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib22))。这些方法可以调用强大的语言模型并维护历史、种群或学习到的代理模型,但它们通常不会根据编辑结果对提议者、反思者或反向引擎进行后训练;即使某些方法对任务模块进行了微调,其产物也是任务特定的工件或参数,而不是一个由编辑结果训练出来的专门 harness 编辑器策略。Harness-R1 则根据其补丁的实际执行效果来训练编辑器,并修改现有目标智能体运行时的多个阶段。
学习型 Harness 编辑器。
更直接相关的工作会对编辑或控制模型外部结构的策略进行后训练,但每一种要么限制了编辑空间,要么将编辑与任务求解耦合在一起。一些方法根据下游结果训练专门的编辑器,但目标范围很窄,例如独立的上下文字段或可修订的技能库(Chen et al., 2026c (https://arxiv.org/html/2608.02276#bib.bib28); Vish et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib29); Li et al., 2026b (https://arxiv.org/html/2608.02276#bib.bib30)),或者学习生成由冻结执行器运行的任务求解工作流(Li et al., 2024 (https://arxiv.org/html/2608.02276#bib.bib31); Nie et al., 2025 (https://arxiv.org/html/2608.02276#bib.bib32); Zhang et al., 2026b (https://arxiv.org/html/2608.02276#bib.bib33))。更接近运行时 harness 的工作包括:在没有强化学习或持久代码补丁的情况下对观察和动作投影进行指令微调,在离线 RL 下在少数预定义的结构动作中进行选择,或将 harness 编辑折叠到单个任务智能体的动作空间中(Wang et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib34); Yi and Song, 2026 (https://arxiv.org/html/2608.02276#bib.bib35); Luo et al., 2026 (https://arxiv.org/html/2608.02276#bib.bib36))。相比之下,Harness-R1 将 harness 编辑作为一个独立的学习问题,将基于失败条件的、全生命周期范围的编辑设定为专门的工程师的独立在线强化学习任务,该工程师根据其可执行补丁的实际任务结果进行训练,而目标智能体保持冻结。
3 方法
在本节中,我们介绍 Harness-R1,一个在线、基于结果反馈的框架,它对专门的工程师进行后训练,以改进冻结目标智能体周围的可执行运行时。我们首先将
相似文章
EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
@omarsar0: // 适配接口,而非模型 // 我对我的廉价模型加优质harness构建的结果感到着迷…
提出了Life-Harness,一种通过适配运行时接口而非模型权重来改进冻结的LLM智能体的方法,在126个设置和18个backbones中实现了平均88.5%的相对改进。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
面向执行轨迹的推理时对齐框架
本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。