HarnessBandit: 联合可学习性-可迁移性调度的多环境代理强化学习
摘要
本文介绍了 HarnessBandit,这是一种在线调度器,用于在多个环境中训练语言模型代理,通过联合优化可学习性和可迁移性信号,提升在 PinchBench 和 ClawEval 等基准测试上的性能。
arXiv:2609.13739v1 公告类型:新
摘要:语言模型代理越来越多地通过多样化的环境进行部署,这些环境在系统提示、工具模式、控制循环和轨迹格式上有所不同。同一个模型在这些接口上的性能可能参差不齐,因此对环境变化的鲁棒性成为一个重要的目标。一种自然的方法是通过多个环境训练一个共享策略,但这引入了一个调度问题:每个训练步骤应该优先选择当前提供有用学习信号的环境,同时产生的更新也能使其他环境受益。我们开发了 HarnessBandit,这是一种在线调度器,在每个优化器步骤中选择一个环境。在组相对策略优化(GRPO)更新后,它观察可学习性——批次上的平均绝对优势——和可迁移性——当前环境的低维梯度草图与剩余环境指数移动平均之间的余弦相似度。这两个信号在池化滑动窗口最小-最大归一化后融合,并通过依赖访问的奖励和显式探索下限进行采样。我们在 ClawGym 上使用六个环境训练了 Qwen3.5-2B,并在 PinchBench(保留任务,分布内 OpenClaw)和 ClawEval(保留任务和环境)上进行评估。HarnessBandit 在两个基准测试上都优于混合批次多环境训练,而训练诊断表明,可学习性和可迁移性提供了不同且不断演化的信号。
查看缓存全文
缓存时间: 2026/09/15 08:51
# 多接口智能体强化学习的联合可学习性-可迁移性调度
来源:https://arxiv.org/html/2609.13739
## HarnessBandit:面向多接口智能体强化学习的联合可学习性-可迁移性调度
魏鸿亮* 哈尔滨工业大学* 阿里云
王颖贵* 阿里云
刘正熙* 阿里云
薛荣坤* 阿里云
任金辉* 阿里云
张贤涛* 阿里云
赵德斌 哈尔滨工业大学
范晓鹏 哈尔滨工业大学
*同等贡献 †通讯作者
###### 摘要
语言模型智能体正通过多样化的*接口*进行部署,这些接口在系统提示、工具模式、控制循环和轨迹格式上存在差异。相同模型在这些不同接口下的表现可能参差不齐,因此对接口变化的鲁棒性成为一个重要的优化目标。一种自然的方法是通过多个接口训练共享策略,但这引入了调度问题:每个训练步骤都应优先选择当前能提供有效学习信号的接口,同时确保其更新能惠及其他接口。我们开发了HarnessBandit,一种在线调度器,每个优化步骤选择一个接口。在完成分组相对策略优化(GRPO)更新后,它会观察*可学习性*——批次上的平均绝对优势值,以及*可迁移性*——当前接口的低维梯度草图与其他接口指数移动平均的余弦相似度。这两个信号经过合并滑窗最大最小归一化后融合,并采用依赖访问次数的奖励和显式探索下限进行采样。我们在ClawGym上跨六个接口训练了Qwen3.5-2B模型,并在PinchBench(留出任务,分布内OpenClaw接口)和ClawEval(留出任务及接口)上进行评估。HarnessBandit在两个基准测试上均优于混合批次多接口训练方案,训练诊断表明可学习性与可迁移性提供了不同且动态演化的信号。
## 1 引言
语言模型智能体通过*接口*与工具交互:这种接口结合了系统提示、工具模式、规划器或循环策略以及会话记录,将用户查询转化为包含补全和工具调用的轨迹(Yao et al., 2023;Yang et al., 2024;Wang et al., 2025)。即使底层任务和奖励函数保持不变,不同接口也会引发不同的轨迹分布。因此,仅通过单一接口训练的策略可能无法迁移到其他接口。使用多个接口进行训练可以降低这种敏感性,但需要决定如何在优化步骤内和跨步骤分配其数据。
这一决策不同于标准的多任务混合问题。同一个ClawGym任务可以在OpenClaw、Codex、Gemini CLI或其他脚手架下执行;*任务*身份是共享的,而*执行通道*会变化。我们考虑该通道的两个特性:首先,只有当批次能产生非退化的学习信号时,它才有用。在分组相对策略优化(Shao et al., 2024; DeepSeek-AI, 2025)中,若一个提示组中采样的轨迹获得相同奖励,则优势值接近零,几乎不产生策略梯度。我们将此称为*可学习性*。其次,基于某一接口计算的更新可能与其他接口所需的方向一致,也可能过拟合于某一特定脚手架。我们将前者称为*跨接口可迁移性*。静态的训练步骤分配无法响应这两个变量。
我们将多接口训练形式化为一个非平稳多臂老虎机问题,其中每个接口是一个臂,其在线效用综合反映可学习性与跨接口可迁移性。我们引入了HarnessBandit,作为GRPO之上的调度层(而非新的策略目标)。在每个步骤,它选择一个接口进行纯采样批次生成,衡量该批次提供多少学习信号以及其更新与其他接口的契合程度,并将这些观测结合起来自适应地调整后续采样分布,同时保持探索性。
我们使用Dr.GRPO(Liu et al., 2025)在2,000个ClawGym任务(RUC-AIBOX, 2025)上训练Qwen3.5-2B策略(Qwen Team, 2026),任务与六个接口交叉组合(共12,000个提示行),并在PinchBench(留出任务,使用分布内OpenClaw接口)和ClawEval(留出任务,使用ClawEval原生循环的分布外接口)上进行评估。HarnessBandit在PinchBench上获得0.506的平均分,而双接口OpenClaw-Codex混合方案为0.493,六接口混合方案为0.331(未调优基线为0.330)。在ClawEval(161个任务,N=3)上,它达到41.6%的pass@3和0.556的平均分,相比之下混合方案分别为38.5%/0.510和29.8%/0.490;Pass3为26.7%,与基础模型持平且高于两种混合方案。
图1:HarnessBandit原理示意图。共享策略通过六个接口观察相同任务;每个优化步骤仅激活一个接口。可学习性是组内奖励分布情况(可用的平均|A|)。可迁移性是当前更新是否与闲置接口的草图方向对齐。两个分数融合后用于选择下一个接口。图符为示意性质。#### 贡献
1. 我们将多接口训练形式化为针对*执行接口*的非平稳老虎机问题,而非固定的任务或领域混合。
2. 我们提出两个互补的训练器原生信号——局部可学习性与跨接口可迁移性——并将它们结合,使调度器优先选择既信息量丰富又与其他接口对齐的更新。
3. 我们在PinchBench(留出任务,分布内OpenClaw)和ClawEval(留出任务及接口)上进行实验,结果表明在匹配的GRPO预算下,HarnessBandit相比静态接口混合方案有所提升,且未坍缩至单一臂。
## 2 相关工作
#### 智能体强化学习与工具使用
工具使用语言智能体将推理与环境动作交织进行(Yao et al., 2023; Schick et al., 2023; Qin et al., 2024)。后续研究将*智能体-计算机接口*本身视为核心设计对象:SWE-agent展示了脚手架选择会改变软件工程任务的成功率(Yang et al., 2024),OpenHands和SWE-Gym提供了用于训练和评估此类智能体的开放栈(Wang et al., 2025; Pan et al., 2024),而网络和个人助手基准测试则强调长周期工具使用(Zhou et al., 2024; Yao and others, 2024; Liu et al., 2024)。强化学习已被应用于推理轨迹(Ouyang et al., 2022; Shao et al., 2024; DeepSeek-AI, 2025; Yu et al., 2025),最近也应用于具有程序化奖励的智能体轨迹。Polar(Xu et al., 2026)将多个接口作为共享训练器后可互换的采样后端暴露出来。我们使用该接口。我们的研究问题与策略梯度的选择正交:给定多个接口,哪一个应生成下一个在策略批次?
#### 多任务学习与更新冲突
当共享模型在多个来源上训练时,梯度可能相互干扰(Caruana, 1997; Ruder, 2017; Sener and Koltun, 2018; Yu et al., 2020)。多任务RL方法蒸馏共享技能或正则化策略以趋向共同中心(Parisotto et al., 2016; Teh et al., 2017; Barreto et al., 2017)。这些方法通常假设任务上的固定采样分布。在我们的设置中,“任务”是封装*相同*底层ClawGym实例的接口;干扰源于接口不匹配,而非目标不相交。HarnessBandit不投影或外科手术式修改梯度。它选择哪个接口进行采样,以使观测到的更新既信息量丰富又与其他接口对齐。
#### 课程学习与数据混合
课程学习按难度或进展安排训练材料(Bengio et al., 2009; Graves et al., 2017; Narvekar et al., 2020; Portelas et al., 2020)。在语言模型预训练中,领域的混合权重通常离线调整或通过代理模型调整(Xie et al., 2023; Albalak et al., 2024)。大多数此类方法不观察在策略来源当前是否产生非零优势,或其梯度是否与其他来源对齐。一个相关的双信号老虎机已用于调度推理领域(Yang et al., 2026)。相反,我们是在封装相同任务集合的执行接口间分配训练步骤。
#### 老虎机分配
经典老虎机在不确定性下分配拉取次数(Auer et al., 2002; Lattimore and Szepesvári, 2020)。我们使用指数加权价值、访问次数依赖奖励、Boltzmann采样和均匀下限;c/n_{h}+1是实现选择而非新的遗憾结果。贡献在于执行接口实例化及其系统集成。
#### 梯度相似性与草图
余弦相似性及相关核对齐是探测两个更新或表示是否指向同一方向的标准方法(Yosinski et al., 2014; Kornblith et al., 2019)。存储每个接口的完整梯度在即使2B规模下也不切实际。线性草图(包括坐标子采样和Rademacher投影)以Johnson-Lindenstrauss引理的意义保持内积(Johnson and Lindenstrauss, 1984; Achlioptas, 2003; Charikar et al., 2004)。HarnessBandit使用最后四个Transformer块的固定、按层比例子采样,使余弦比较在不同步骤间保持明确定义,而无需实例化190M维的缓冲区。
## 3 问题形式化
#### 任务与接口
设$\mathcal{X}$为智能体任务集合。每个任务$x\in\mathcal{X}$指定用户查询、初始工作空间及会话结束后由程序检查器计算的标量奖励$r\in[0,1]$。*接口*$h\in\mathcal{H}$是执行接口:它用系统提示、工具模式和控制循环封装$x$,并诱导策略$\pi_\theta$的轨迹分布$\tau\sim\pi_\theta(\cdot\mid x,h)$。应用于相同$x$的两个接口可能产生不同的分词、不同的工具调用语法和不同的奖励实现。
训练使用有限积集$\mathcal{D}_{\mathrm{train}}=\{(x,h):x\in\mathcal{X}_{\mathrm{train}},h\in\mathcal{H}_{\mathrm{train}}\}$。评估使用从未在优化中见到的互斥任务集$\mathcal{X}_{\mathrm{eval}}$(PinchBench和ClawEval)。PinchBench在属于$\mathcal{H}_{\mathrm{train}}$的OpenClaw下执行;ClawEval使用不属于该集合的原生评估循环。因此预期的泛化是跨留出任务,且对于ClawEval,也跨接口。
#### 在策略更新
我们使用分组相对策略优化训练(Shao et al., 2024)。对于提示$(x,h)$,采样栈抽取$G$条轨迹,评分并形成优势$A_{i,t}$,方法是减去留一基线。遵循Dr.GRPO(Liu et al., 2025),我们不除以组标准差,以避免在组内奖励方差接近零时更新爆炸。步骤$t$的策略损失为常用的裁剪代理加向冻结参考的KL惩罚:
$$\mathcal{L}_{t}(\theta)=\mathbb{E}\!\left[-\min\!\bigl(\rho_{i,t}A_{i,t},\;\mathrm{clip}(\rho_{i,t},1-\epsilon,1+\epsilon)\,A_{i,t}\bigr)\right]+\beta_{\mathrm{KL}}\,\mathrm{KL}\!\bigl(\pi_{\theta}\,\|\,\pi_{\mathrm{ref}}\bigr),$$
其中$\rho_{i,t}$是重要性比率。HarnessBandit不依赖于此特定代理;任何产生每标记优势和批次梯度的在策略方法均可提供以下两个观测。
#### 调度目标
在老虎机抽象中,臂为$\mathcal{H}_{\mathrm{train}}$,每个优化步骤选择一个臂。由于共享策略在每次更新后改变,臂的效用随$\theta_t$演化,而非遵循固定奖励分布。调度器是一个(可能随机化)规则$\sigma$,给定历史$\mathcal{F}_{t-1}$,选择$h_t\in\mathcal{H}_{\mathrm{train}}$。采样随后仅使用$h_t$处理批次中的每个提示。我们希望$\sigma$权衡$h$的两个即时特性:
$$L_h(\theta)=\mathbb{E}\!\left[\,|A|\;\middle\|\;h,\,\theta\,\right],$$
$$T_h(\theta)=\mathbb{E}\!\left[\frac{1}{|\mathcal{H}_{\mathrm{train}}\setminus\{h\}|}\sum_{j\neq h}\cos\!\bigl(\nabla_{\theta}\mathcal{L}(h),\,\bar{g}_{j}\bigr)\;\middle\|\;h,\,\theta\right],$$
其中$\bar{g}_{j}$是与接口$j$关联的梯度方向的运行估计。$L_h$大时,组内包含既有相似文章
HarnessBridge: LLM智能体的可学习双向控制器
介绍了HarnessBridge,一种可学习的双向控制器,它将智能体-环境接口参数化,用于LLM智能体。在Terminal-Bench和SWE-bench上,它以更少的计算开销达到了与专用框架相当的性能。
面向执行轨迹的推理时对齐框架
本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
ClawGym II:基于代理工具的黑箱强化学习探索
本文提出了一种统一的黑箱强化学习框架,通过沙箱执行与轨迹重建,实现了代理在复杂工具链中稳定、可扩展的优化,并在ClawGym-Bench等基准测试中取得了性能提升。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
介绍了LongHorizon-Harness,一种面向长时程LLM智能体的任务状态管理方法,采用Manage-Execute-Audit循环,在WeaveBench和OSWorld等多个模型和基准上展示了一致的改进。