REVERSAL-BENCH:用于测量无重置RL悬崖的可逆性轴和重置预言机
摘要
REVERSAL-BENCH 引入了一个基准,用于测量无重置强化学习中的可逆性,揭示了一个'可逆性悬崖',其中智能体在不可恢复的状态中失败。该基准包括一个连续的可逆性参数和一个重置预言机,用于在多个环境中测试状态可恢复性。
arXiv:2609.17745v1 公告类型:新
摘要:自主强化学习的一个核心目标是在没有外部重置的情况下进行连续的策略训练。然而,现有范式在很大程度上依赖于环境固有的可逆性,这一属性在现实世界的操作中是缺失的,例如将物体推下桌子或洒出颗粒物质等事件无法撤销。我们引入了 REVERSAL-BENCH,一个通过连续参数 $\rho \in [0, 1]$ 控制可逆性的基准,并提供了一个重置预言机,一个用于在五个物理引擎中的八个操作设置中测试状态可恢复性的基准事实验证机制。评估广泛的策略架构,包括标准的 actor-critic 算法、安全 RL 和专门的无重置框架,揭示了一个尖锐的可逆性悬崖:随着 $\rho$ 的增加,无重置智能体一致地陷入不可恢复的状态,而情节式智能体保持稳定的学习。我们在自主无重置基线和约束 RL 中看到了这种失败模式。因为无重置智能体缺乏外部重置,任何向不可恢复状态的转移都会导致永久吸收,使智能体被困住,进一步学习停止。我们表明,这种吸收现象在学习的操作策略下的完整物理模拟中持续存在。通过与几何上相同的可逆对应物进行评估,我们确认这种崩溃是由不可逆性而非障碍复杂性因果驱动的。我们发布了基准套件,一个标注有可恢复性和重置预言机的大型多模拟器数据集。我们还评估了一个在发生不可逆故障之前干预的安全护盾,表明虽然可恢复性可以准确预测,但主动恢复主要只有在智能体能够物理上避开陷阱时才成功。
查看缓存全文
缓存时间: 2026/09/17 08:50
# REVERSAL-BENCH:用于测量无重置强化学习性能悬崖的可逆性轴与重置预言机
**来源:** https://arxiv.org/html/2609.17745
###### 摘要
自主强化学习的一个核心目标是在无需外部重置的情况下持续训练策略。然而,现有范式在很大程度上依赖于环境的可逆性,而这一特性在现实世界的操控任务中并不存在,例如将物体推下桌子或洒出颗粒状物质等事件是不可逆的。我们推出了 REVERSAL-BENCH,这是一个通过连续参数 ρ∈[0,1] 来控制可逆性的基准测试,并提供了一个重置预言机——一个用于验证八个操控场景(横跨五个物理引擎)中状态可恢复性的真值验证机制。对包括标准 Actor-Critic 算法、安全强化学习和专门的无重置框架在内的广泛策略架构进行评估,揭示了一个明显的“可逆性悬崖”:随着 ρ 的增加,无重置智能体持续陷入不可恢复的状态,而基于回合制的智能体则能保持稳定的学习。这一失效模式在自主无重置基线和约束强化学习中均能观察到。由于无重置智能体缺乏外部重置,任何进入不可恢复状态的转换都会导致永久性吸收,使智能体陷入困境,进一步学习停止。我们表明,在全物理仿真中,通过学习操控策略,这种吸收现象依然存在。通过与几何上完全相同的可逆对应物进行比较评估,我们确认这种崩溃是由不可逆性而非障碍复杂性驱动的。我们发布了该基准测试套件、一个大规模多仿真器数据集(标注了可恢复性和重置预言机)。我们还评估了一个在不可逆失败发生前介入的安全防护盾,结果表明,虽然可以准确预测可恢复性,但主动恢复主要仅在智能体能够物理上避开陷阱时才能成功。
## I 引言
自主强化学习旨在无需人工重置的情况下持续训练智能体。无重置强化学习方法,如 Leave No Trace [1]、MEDAL [2]、R3L [3]、VaPRL [4] 和 EARL [5],旨在让智能体无限期地学习。然而,在物理环境中的自主智能体不可避免地会遇到不可逆状态,从而无法返回任务分布。现有的框架大多绕过了这种失效模式,要么通过形式化地将分析限制在可逆马尔可夫决策过程上 [4],要么承认其发生但未提供测量或减轻其影响的工具 [2, 3]。这一空白持续存在的原因是,当前的基准测试套件未将可逆性作为实验变量进行处理。环境被设计为在每个回合结束时重置,或设定固定的预算上限。因此,现有框架无法回答一个基本问题:随着环境可恢复性逐渐降低,自主策略会如何退化?解决此问题需要两项能力:(i)一个独立参数,用于扫描环境可逆性,同时保持任务动力学和目标难度恒定;以及(ii)状态可恢复性的真值。REVERSAL-BENCH 的设计正是为了提供这两点。
总而言之,我们的贡献包括:
- • **可逆性轴(ρ)**:一个连续的控制参数 ρ∈[0,1],直接在八个操控领域中缩放不可逆状态的严重程度和范围,在五个物理引擎中实现。
- • **重置预言机**:一个基于仿真器的验证机制,通过严格测试状态是否能够返回初始任务分布来提供真值的可恢复性标签。
- • **可逆性悬崖**:一项全面的实证评估,展示了随着 ρ 的增加,无重置强化学习出现严重的性能崩溃(永久性吸收)。我们使用几何上完全相同的可逆对应物,在无模型和基于模型的方法中,将不可逆性与任务难度因果性地分离开来。
- • **大规模多引擎数据集**:一个包含 4490 万条转换的大型数据集,涵盖五个物理模拟器中的 11 个任务类别,完全标注了真值可恢复性。
- • **可逆性防护盾**:一个安全框架,展示了在不可逆环境中主动恢复何时以及为何成功或失败。
## II 相关工作
**无重置与自主强化学习**:自主强化学习旨在通过交替执行任务与自主重置行为来消除人工干预 [1-5]。这些方法的一个关键弱点在于它们对环境可逆性的依赖。一些方法明确将其假设限制在可逆环境上 [4],而另一些则承认智能体会陷入不可恢复的状态,但未正式测量这种失效 [2, 3]。最近的切换策略,如 RISC [6],尝试使用学习到的置信度分数来管理任务-重置转换。然而,现有的基准测试将可逆性固定,使得评估这些算法在恢复变得逐渐困难时如何退化变得困难。
**不可逆性与安全性**:安全强化学习的相关研究侧重于在失败发生之前检测和避免危险状态。例如,Recovery RL [7] 在安全评论家标记高风险时部署一个二级恢复策略,而自监督分类器 [8] 则从轨迹方向性推断可逆性。然而,学习到的估计器无法可靠地区分真正冻结的吸收状态和无害的静止状态。如果没有权威的真值预言机,学习到的安全机制无法在变化的物理条件下得到严格评估。
**基于模型和基于特征的无重置强化学习**:最近的进展探索了基于模型的规划和学习到的表示以减轻无重置失败。MoReFree [9] 利用世界模型来优先考虑与任务相关的探索,而 RSA [10] 使用学习到的后继特征在二进制域中检测不可逆转换。然而,任务相关性并不能确保状态在物理上是可逆的,学习到的检测器在变化的失效严重程度下缺乏真值校准。REVERSAL-BENCH 提供了连续的可逆性谱(ρ)和精确的重置预言机,建立了首个标准化基准测试,以衡量无模型和基于模型方法在不可逆物理动力学下何时以及如何退化。
**图注 图 1:在点质量域中解耦可逆性与任务难度。** (左三)随着可逆性参数 ρ 从 0 缩放到 1.0,向内的力源(F_d > F_max)在导航通道中扩展,使得脱困变得越来越困难,同时沿最优路径保持目标可访问。 (最右)配对的可逆对应物保持了相同的障碍几何和起始到目标路径,但将向内力设置在控制限制以下(F_d ≤ F_max),形成动态陷阱。虽然高动量轨迹可以穿越该区域,但动量不足的状态会被永久捕获,因为向内力超过了机器人的控制能力。在操控任务中,ρ 类似地缩放物理参数,如桌边安全裕度、电机热极限、多臂设置中的工作空间重叠或颗粒溢出中的材料内聚力。重要的是,ρ 作为每个领域内的内部坐标,而非跨领域度量:ρ=0.5 在物体操控中对应于边缘阈值,而在多机器人操控中则参数化共享的工作空间死区。在所有领域中,其功能严格保持不变,选择性地控制错误恢复而不改变任务难度。
### III-B 重置预言机
确定任意状态是否可恢复需要独立于任何学习策略的真值。由于物理引擎允许精确的状态序列化,仿真器本身可以充当验证器。对于任何查询的状态 s,预言机通过三阶段过程评估系统是否能够物理地返回任务相关的初始分布 S_init:
1. **状态检查点**:仿真器在 s 处的完整状态(包括广义坐标、速度和接触缓存)在内存中被序列化。
2. **恢复搜索**:从这个检查点开始,预言机执行针对领域的恢复例程:在导航中,它在最大控制限制下搜索逃逸轨迹;在操控中,它测试对掉落物体的工作空间可达性;在可变形任务中,它测量永久的材料应变。
3. **状态恢复**:仿真器状态被精确恢复到 s,确保评估轨迹完全不受影响。
此机制产生的可恢复性标签是保守的。状态仅在系统性恢复试验未能找到任何返回轨迹时才被指定为不可逆,这为不可逆性提供了一个严格的下界。
### III-C 任务套件:不可逆性的类别
现实世界中的机器人任务具有超越几何边界的多样化失效模式。为了捕捉这些不同的失效动力学,REVERSAL-BENCH 模拟了五种不同的不可逆性类别:
- • **物体状态(桌上跌落)**:将物体移出桌面边界会导致其掉落到可触及范围之外。参数 ρ 控制接近桌面边缘的程度。
- • **结构(执行器故障)**:超过关节扭矩或速度限制会导致永久性硬件烧毁,限制剩余的运动学可达范围。参数 ρ 设置疲劳阈值。
- • **关系(多智能体死锁)**:在双臂协作操控中,将物品掉入非共享的工作空间间隙会导致两臂都无法取回。参数 ρ 缩放此死区的宽度。
- • **材料(颗粒介质)**:分散松散颗粒超过临界扩散阈值会导致不可逆的扩散。参数 ρ 控制颗粒内聚力。
- • **语义(因果约束)**:顺序错误的操作违反了顺序依赖关系(例如,在装入所需物品之前用胶带封住容器),其中 ρ 从容易剥离缩放到严格不可逆的胶带持久性。
### III-D 因果隔离:可逆对应物
如果一个障碍物变得更大,任务可能仅仅因为导航困难而变难。我们必须确保性能下降是由不可逆性引起的,而非障碍物难度。为了将可逆性与几何和控制复杂性因果性地分离开来,我们将每个不可逆任务与一个几何上完全相同的可逆对应物配对。这些配对环境保持相同任务几何、障碍物尺寸、奖励公式和惩罚结构,仅改变失效状态的物理可逆性。例如,在点质量域(图 1,最右),可逆对应物保持相同的排水几何和位置,但将向内力场缩放至 F_d = 0.80ε_t ≥ ε > 0),该生存乘积严格消失:lim_{t→∞} P(s_t ∈ S_irr) = 1。相反,每 T 步重置的回合制智能体将该失效概率限制在有限窗口内:P_episodic(s_T ∈ S_irr) ≤ 1 - (1 - ε_max)^T < 1。这突显了一个根本区别:虽然回合制训练限制了复合失效风险,但只要在任务执行过程中无法完全避免不可逆危险,无重置智能体最终必然崩溃进入永久性吸收状态。
### III-E 时序顺序可逆性检测器的局限性
一种常见的自监督可逆性方法通过训练分类器预测轨迹方向性 P( forward | s_t, s_{t+1} ) [8] 来推断可恢复的转换。然而,这种公式在静态失效状态下失效。考虑一个已经掉到机器人工作空间外地板上的物体:一旦静止,连续状态形成相同的自循环 (s*, s*)。因为连续相同的状态 (s_t, s_t) 在时间反转下看起来相同,时序分类器无法区分良性的静止与永久的陷入。这种失效模式证明了基于仿真的预言机的必要性,它评估真实的可达性而非被动的统计启发式方法。
### III-F REVERSAL-BENCH 数据集
由于真值可恢复性无法从被动的时序启发式方法中推断,且需要密集的反事实验证,我们发布了一个大规模的离线轨迹数据集,由我们的重置预言机直接标注。该数据集包含跨十一个任务领域和五个物理模拟器(ManiSkill3 (PhysX)、MuJoCo-MJX、Brax、Genesis (物质点方法) 和 Isaac Sim (基于位置的布料动力学))的 4490 万条转换。总体而言,28.3% 的记录转换代表了由我们的重置预言机验证的不可逆失败状态。数据集中的每个转换都标注了三个真值恢复信号:
- • **状态不可逆性**:一个二元真值标签,证明该状态是否仍能返回任务相关的初始分布。
- • **恢复视界**:恢复策略返回到初始状态分布所需的最小步数(对于不可逆状态则未定义)。
- • **陷阱检测**:一个标签,表明智能体已进入物理上无法逃脱的状态。
除了低维度的本体感受状态外,操控领域还包括同步的视觉 RGB 观测,为训练和评估基于视觉的故障检测器和多模态基础模型提供了标准化的基准测试。
## IV 实验与结果
我们评估了具有递增策略复杂度的智能体性能:脚本化启发式方法、软 Actor-Critic (SAC) [11]、无重置算法以及在复杂机器人操控任务上的分布式 PPO。
**评估指标**:我们的主要指标是*吸收率*,定义为终止状态位于预言机标记的吸收集 S_irr 中的保留评估试验的比例。因为高 ρ 的环境即使对安全策略也可能自然阻碍任务进展,正常的任务成功率会将几何难度与不可逆性混淆。吸收率提供了一个直接、无混淆的相似文章
Reversal Q-Learning
本文提出了Reversal Q-Learning(RQL),一种离线强化学习算法,它利用扩展马尔可夫决策过程框架和技术训练流策略,无需随时间反向传播即可实现离策略强化学习。该算法在具有挑战性的模拟机器人任务上达到了最先进的性能。
LabyrinthBench:一个本地优先、无需裁判的LLM基准测试,用于衡量多步骤智能体任务中干扰下的上下文记忆。
LabyrinthBench是一个本地化、无需裁判的LLM基准测试,能够确定性地衡量多步骤智能体任务中干扰下的上下文记忆。初步实验表明,清空上下文并重新注入门控答案对9个模型中的7个有帮助,但对2个适得其反,凸显了上下文管理策略的复杂性。
当RLVR缩小推理边界:诊断Pass@k反转
本文诊断了可验证奖励强化学习(RLVR)中的“pass@k反转”现象:训练提高了单次准确率,但在重复采样下降低了性能,尤其是在正确轨迹稀少的边界提示上。提出了一种基于每个问题的基础锚定(PBA)方法来缓解这一问题。
叛逆的学生:通过自蒸馏 RLVR 反转教师信号以进行推理探索
本文介绍了 RLRT,这是一种在自蒸馏过程中反转教师信号的方法,旨在强化学生模型成功的偏离行为,从而增强大语言模型的推理探索能力。
RestoreBench: AI代理能否恢复潮流收敛?
本文介绍了RestoreBench,这是一个基准测试,用于评估LLM代理在诊断和解决电力系统中非收敛潮流案例的能力,涵盖多种架构和测试案例。