@dair_ai: Salesforce 发表的一篇令人印象深刻的论文。它讨论了良好验证器对强化学习环境的重要性。只有 35.8% 的 …
摘要
来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。
查看缓存全文
缓存时间: 2026/09/25 06:36
Salesforce的这篇论文令人印象深刻。
它讨论了良好的验证器对强化学习环境的重要性。
在面向终端智能体的最干净公开强化学习环境集中,仅有35.8%的环境通过了Salesforce AI Research的审核。
更多细节如下:
在环境数量控制在3500个的条件下,River-8B在四个终端基准测试中平均得分19.4,而从同一环境集中随机抽样3500个环境进行强化学习的模型平均得分为17.7。
审核发现奖励错误呈现双向分布:有些环境对直接复制泄露答案或通过弱验证器但未完成任务的操作给予奖励1;有些环境则因参考答案或神谕答案错误,对正确的解决方案给予奖励0。另外两个公开环境集的“洁净度“仅为10.1%和3.3%。
作者认为,强化学习主要塑造的是行为模式,例如“行动前检查“、“完成前验证“以及“放弃持续失败的方法”。
这些行为复用了模型在预训练和监督微调阶段已掌握的技能。他们提出的RIVER方案能过滤有缺陷的环境,并对与早期指令高度重复但输出几乎相同的交互轮次进行惩罚。
River-8B是所有被评估的开源强化学习训练的8B参数模型中,在全部四个基准测试上表现最佳的。在2B到27B参数的不同模型中,使用少于TMax环境集30%的数量时,RIVER方案使RL在Terminal-Bench-Lite上的增益提升106%,在Terminal-Bench v2.1上提升30%。
论文:https://academy.dair.ai/papers/learning-generalizable-behaviors-for-terminal-agents-2608.22631…
学习终端智能体的可泛化行为
来源:https://academy.dair.ai/papers/learning-generalizable-behaviors-for-terminal-agents-2608.22631 AgentsChat与论文讨论 (https://academy.dair.ai/dashboard/paper-chat/learning-generalizable-behaviors-for-terminal-agents-2608.22631)
首页
学习终端智能体的可泛化行为
策展人观点
Yihang Yao、Bo Pang、Semih Yavuz及Salesforce AI Research的同事们,与卡内基梅隆大学的Ding Zhao一起,研究了强化学习实际上改变了终端智能体的哪些方面,并提出了RIVER训练方案。该方案通过过滤有缺陷的环境和惩罚重复循环来提升奖励质量。
请教这篇论文
关于本文的问题 要点
01 行为优于技能。根据他们的“智能体组合泛化“假设,强化学习主要塑造的是多轮决策行为,例如在行动前检查、在宣布完成前验证、以及放弃失败的方法。这些行为组合并调度了模型在预训练和监督微调阶段已获得的底层技能。“完成前验证“和“重复率“是预测任务成功的两个最佳行为特征。
02 公开环境审核。在审核过的最干净公开环境池(TMax)中,仅有35.8%的环境是“干净“的,40.4%的环境验证器过于宽松;TermiGen的“洁净度“为10.1%,TerminalTraj-5k为3.3%。缺陷会双向破坏奖励:既对复制泄露答案给予奖励1,也对正确的解决方案给予奖励0。
03 RIVER方案。环境通过评分标准和pass@2神谕检查进行筛选,得到RIVER-TMax-3.5K集合;同时应用轮次级惩罚:当某一轮次的指令和观察结果与之前某轮次的Jaccard相似度均高于0.8时。
04 结果。River-8B在Terminal-Bench-Lite、Terminal-Bench v2.1、Terminal-Bench-Pro和Terminal-World-Verified四个基准测试中平均得分19.4,是所有被评估的开源强化学习训练的8B参数模型中表现最好的。相比之下,OpenThinker-8B-RL得分为17.8,而使用3500个随机抽样的TMax环境进行强化学习的模型得分为17.7。
05 扩展性。使用少于TMax环境集30%的数量,RIVER方案使2B到27B参数模型的RL增益平均提升,在Terminal-Bench-Lite上提升106%,在Terminal-Bench v2.1上提升30%,并且该方案能跨模型系列、智能体运行框架和强化学习目标进行迁移。
摘要 终端智能体是大语言模型(LLMs)一个引人注目的应用,有望深度融入用户的日常工作流程。强化学习(RL)是提升其能力的关键技术,使得可扩展的训练环境成为一个核心挑战。由于公开的真实用户交互数据稀缺,合成环境提供了一种实用的替代方案,但通常存在领域差异和保真度有限的问题,导致泛化能力不佳。现有工作主要扩展合成环境的数量和多样性,而奖励信号质量及控制泛化的机制仍未得到充分探索。我们研究了强化学习如何改进终端智能体,并提出“智能体组合泛化“假设:强化学习并非从头教授新的特定领域技能,主要是塑造高层决策行为,这些行为组合并调度了在预训练和监督微调(SFT)期间获得的底层技能。该解释与我们的实验结果一致,并表明决定哪些行为被强化的验证器质量,比单纯增加环境数量或多样性更为重要。基于此洞见,我们提出River,一个简单的训练方案,通过过滤低质量环境和使用过程级行为正则化来增强结果奖励,从而提升奖励质量。使用此方案,我们经强化学习训练的智能体在四个终端智能体基准测试中,取得了被评估的开源RL训练8B模型中的最佳性能。River还能跨模型系列、规模、智能体运行框架和RL目标进行泛化。使用少于TMax训练环境30%的数量,River在Terminal-Bench-Lite和Terminal-Bench-v2.1上,使2B到27B参数模型的RL增益平均分别提升了106%和30%。
相似文章
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
@dair_ai: https://x.com/dair_ai/status/2073814128888549810
本周三篇值得关注的人工智能论文精选:自我改进框架(Red Queen Gödel Machine)、MCP 服务器的设计模式,以及关于编码智能体的强化学习奖励验证研究。
@rohanpaul_ai: 关于自我进化智能体的优秀论文。企业智能体无法真正改进,直到其混乱的日常工作成为安全的学…
一篇论文提出了一种机制,通过安全地将混乱的日常工作转化为学习数据来改进企业智能体,采用数据代理和控制层,AREAL2.0 展示了从真实交互轨迹进行在线强化学习。
强化学习数据的良好质量控制(18分钟阅读)
本文讨论了强化学习数据质量控制的重要性,概述了当前数据供应商的不足之处以及前沿AI实验室用于评估RL数据的标准。
AgentV-RL:用智能体验证器扩展奖励建模
AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。