@dair_ai: Salesforce 发表的一篇令人印象深刻的论文。它讨论了良好验证器对强化学习环境的重要性。只有 35.8% 的 …

X AI KOLs Timeline 论文

摘要

来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。

来自 Salesforce 的一篇令人印象深刻的论文。 它讨论了良好验证器对强化学习环境的重要性。 在最干净的公共终端智能体强化学习环境中,只有 35.8% 通过了 Salesforce AI Research 的审计。 更多细节如下: 在预算控制在 3.5K 个环境的情况下,River-8B 在四个终端基准测试中平均得分为 19.4,而从同一集合中随机抽取的 3.5K 个环境上的强化学习平均得分为 17.7。 审计发现了双向的奖励错误。一些环境在复制泄露答案或通过弱验证器而未完成任务时给予奖励 1。其他环境在给出正确解决方案时给予奖励 0,因为参考答案或预言机是错误的。另外两个公共集合分别只有 10.1% 和 3.3% 是干净的。 作者认为,强化学习主要塑造行为,例如在行动前检查、在结束前验证以及放弃一直失败的方法。 这些行为重用了模型在预训练和 SFT 中已经学到的技能。他们的方案 RIVER 过滤有缺陷的环境,并惩罚那些重复早期命令且输出几乎相同的轮次。 River-8B 是他们在所有四个基准测试中评估的开放强化学习训练的 8B 模型中最好的。在 2B 到 27B 的模型中,使用不到 TMax 环境的 30%,RIVER 在 Terminal-Bench-Lite 上将强化学习增益提高了 106%,在 Terminal-Bench v2.1 上提高了 30%。 论文:https://academy.dair.ai/papers/learning-generalizable-behaviors-for-terminal-agents-2608.22631…
查看原文
查看缓存全文

缓存时间: 2026/09/25 06:36

Salesforce的这篇论文令人印象深刻。

它讨论了良好的验证器对强化学习环境的重要性。

在面向终端智能体的最干净公开强化学习环境集中,仅有35.8%的环境通过了Salesforce AI Research的审核。

更多细节如下:

在环境数量控制在3500个的条件下,River-8B在四个终端基准测试中平均得分19.4,而从同一环境集中随机抽样3500个环境进行强化学习的模型平均得分为17.7。

审核发现奖励错误呈现双向分布:有些环境对直接复制泄露答案或通过弱验证器但未完成任务的操作给予奖励1;有些环境则因参考答案或神谕答案错误,对正确的解决方案给予奖励0。另外两个公开环境集的“洁净度“仅为10.1%和3.3%。

作者认为,强化学习主要塑造的是行为模式,例如“行动前检查“、“完成前验证“以及“放弃持续失败的方法”。

这些行为复用了模型在预训练和监督微调阶段已掌握的技能。他们提出的RIVER方案能过滤有缺陷的环境,并对与早期指令高度重复但输出几乎相同的交互轮次进行惩罚。

River-8B是所有被评估的开源强化学习训练的8B参数模型中,在全部四个基准测试上表现最佳的。在2B到27B参数的不同模型中,使用少于TMax环境集30%的数量时,RIVER方案使RL在Terminal-Bench-Lite上的增益提升106%,在Terminal-Bench v2.1上提升30%。

论文:https://academy.dair.ai/papers/learning-generalizable-behaviors-for-terminal-agents-2608.22631…


学习终端智能体的可泛化行为

来源:https://academy.dair.ai/papers/learning-generalizable-behaviors-for-terminal-agents-2608.22631 AgentsChat与论文讨论 (https://academy.dair.ai/dashboard/paper-chat/learning-generalizable-behaviors-for-terminal-agents-2608.22631)

首页

学习终端智能体的可泛化行为

策展人观点

Yihang Yao、Bo Pang、Semih Yavuz及Salesforce AI Research的同事们,与卡内基梅隆大学的Ding Zhao一起,研究了强化学习实际上改变了终端智能体的哪些方面,并提出了RIVER训练方案。该方案通过过滤有缺陷的环境和惩罚重复循环来提升奖励质量。

请教这篇论文

关于本文的问题 要点

01 行为优于技能。根据他们的“智能体组合泛化“假设,强化学习主要塑造的是多轮决策行为,例如在行动前检查、在宣布完成前验证、以及放弃失败的方法。这些行为组合并调度了模型在预训练和监督微调阶段已获得的底层技能。“完成前验证“和“重复率“是预测任务成功的两个最佳行为特征。

02 公开环境审核。在审核过的最干净公开环境池(TMax)中,仅有35.8%的环境是“干净“的,40.4%的环境验证器过于宽松;TermiGen的“洁净度“为10.1%,TerminalTraj-5k为3.3%。缺陷会双向破坏奖励:既对复制泄露答案给予奖励1,也对正确的解决方案给予奖励0。

03 RIVER方案。环境通过评分标准和pass@2神谕检查进行筛选,得到RIVER-TMax-3.5K集合;同时应用轮次级惩罚:当某一轮次的指令和观察结果与之前某轮次的Jaccard相似度均高于0.8时。

04 结果。River-8B在Terminal-Bench-Lite、Terminal-Bench v2.1、Terminal-Bench-Pro和Terminal-World-Verified四个基准测试中平均得分19.4,是所有被评估的开源强化学习训练的8B参数模型中表现最好的。相比之下,OpenThinker-8B-RL得分为17.8,而使用3500个随机抽样的TMax环境进行强化学习的模型得分为17.7。

05 扩展性。使用少于TMax环境集30%的数量,RIVER方案使2B到27B参数模型的RL增益平均提升,在Terminal-Bench-Lite上提升106%,在Terminal-Bench v2.1上提升30%,并且该方案能跨模型系列、智能体运行框架和强化学习目标进行迁移。

摘要 终端智能体是大语言模型(LLMs)一个引人注目的应用,有望深度融入用户的日常工作流程。强化学习(RL)是提升其能力的关键技术,使得可扩展的训练环境成为一个核心挑战。由于公开的真实用户交互数据稀缺,合成环境提供了一种实用的替代方案,但通常存在领域差异和保真度有限的问题,导致泛化能力不佳。现有工作主要扩展合成环境的数量和多样性,而奖励信号质量及控制泛化的机制仍未得到充分探索。我们研究了强化学习如何改进终端智能体,并提出“智能体组合泛化“假设:强化学习并非从头教授新的特定领域技能,主要是塑造高层决策行为,这些行为组合并调度了在预训练和监督微调(SFT)期间获得的底层技能。该解释与我们的实验结果一致,并表明决定哪些行为被强化的验证器质量,比单纯增加环境数量或多样性更为重要。基于此洞见,我们提出River,一个简单的训练方案,通过过滤低质量环境和使用过程级行为正则化来增强结果奖励,从而提升奖励质量。使用此方案,我们经强化学习训练的智能体在四个终端智能体基准测试中,取得了被评估的开源RL训练8B模型中的最佳性能。River还能跨模型系列、规模、智能体运行框架和RL目标进行泛化。使用少于TMax训练环境30%的数量,River在Terminal-Bench-Lite和Terminal-Bench-v2.1上,使2B到27B参数模型的RL增益平均分别提升了106%和30%。

相似文章

AgentV-RL:用智能体验证器扩展奖励建模

arXiv cs.CL

AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。