完成与最优性:长期累积损伤问题中的策略梯度
摘要
本文识别了长期累积损伤问题中策略梯度方法的两种失败模式——完成与最优性——并提出了一种分别处理它们的分解方法,并在两个校准环境中进行了验证。
arXiv:2605.26657v1 公告类型:新
摘要:具有累积损伤的长期决策问题将局部有吸引力的行动与全局不利结果联系起来。我们识别了策略梯度方法在此类问题上的两种正交失败模式,并提出了一种将它们分离的分解方法:\emph{完成}(到达终结视界,而非通过隐式终结约束退出)和\emph{最优性}(在完成情况下匹配动态规划参考)。在具有线性软惩罚的PPO下,仅授予视界访问会降低完成率:惩罚的均衡将主导活动份额推至零,而动作空间限制与视界访问相结合则实现了完成,但留下了最优性差距($\Delta M_{\text{final}} = 0.271$),我们将其追溯到损伤源处的第一阶段贪婪承诺。我们推导了四个可检验的预测,并在两个单独校准的环境中进行了评估,这些环境共享相同的抽象结构,但在领域、视界、活动集和校准数据上有所不同:一个49步的砖匠职业生涯和一个20赛季的NBA大前锋职业生涯。所有四个预测在定性上都得到复现。视界不变性预测在四个测试视界中的三个上得到满足,例外在$H = 15$处与$H^*$边界一致(在NBA参数下$H^* \in [6, 14]$)。
查看缓存全文
缓存时间: 2026/05/27 09:07
# 长时域累积损伤问题中的策略梯度 来源:https://arxiv.org/html/2605.26657 ## 完成性 vs 最优性:长时域累积损伤问题中的策略梯度 Wolfgang Maass 萨尔大学 & 德国人工智能研究中心 \(DFKI\) wolfgang\.maass@iss\.uni\-saarland\.de&Sabine Janzen 德国人工智能研究中心 \(DFKI\) sabine\.janzen@dfki\.de ###### 摘要 具有累积损伤的长时域决策问题将局部吸引人的行动与全局不利的结果耦合在一起。我们识别出策略梯度方法在此类问题上的两种正交失败模式,并提出一种分解方法将它们分开:*完成性*(到达终端时域而非通过隐式终端约束退出)和*最优性*(在完成的前提下匹配动态规划参考值)。在带有线性软惩罚的 PPO 下,单独提供时域访问会降低完成率:惩罚的平衡将主导活动份额推向零,而动作空间限制结合时域访问能够实现完成,但存在最优性差距(\( \Delta M_{\text{final}} = 0.271 \)),我们将其归因于损伤源处的第一阶段贪婪承诺。我们推导出四个可检验的预测,并在两个独立校准的环境中对其进行评估,这两个环境共享相同的抽象结构,但在领域、时域、活动集和校准数据上有所不同:一个 49 步的砌砖工职业生涯和一个 20 赛季的 NBA 大前锋职业生涯。所有四个预测在定性上均得到复现。时域不变性预测在四个测试时域中的三个上得到满足,\( H=15 \) 时的例外与 \( H^* \) 边界一致(在 NBA 参数下 \( H^* \in [6,14] \))。 ## 1 引言 许多序列决策问题在长时域上累积状态,从而将局部吸引人的行动与全局不利的结果耦合在一起。一名临床医生给药慢性病药物、一名工程师安排磨损部件的重负荷使用、一名工人在长达数十年的职业生涯中分配体力——他们都面临相同的结构性挑战:最大化即时奖励的行动会增加累积状态,而该状态的最终水平会终止回合。策略梯度智能体 (Schulman 等人, 2017 (https://arxiv.org/html/2605.26657#bib.bib1)) 能否在此类问题中学习到审慎的策略,这是一个关于信用分配的问题,其时域超过了任何基于轨迹展开的学习者的经验。最近关于长时域信用分配的工作 (Arjona\-Medina 等人, 2019 (https://arxiv.org/html/2605.26657#bib.bib16); Harutyunyan 等人, 2019 (https://arxiv.org/html/2605.26657#bib.bib17)) 已识别出结构上的困难,但未指出当损伤信号隐含在终止条件中时,贪婪信用分配所引发的具体失败模式。 #### 诊断空白。 在长时域累积损伤问题上回报较低的策略可能因两个无关的原因之一而失败。过早通过隐式终端约束终止的策略由于从未到达后期时域状态而回报较低。到达终端时域但承诺于局部贪婪行动的策略由于未能保护累积状态而回报较低。每种失败模式需要不同的干预:时域访问解决前者,而信用分配针对后者。然而,基于回报的评估将两者合并为一个标量,迫使我们在诊断策略*为何*过早退出和诊断策略在回合完成的情况下*有多差*之间做出选择,即使两种失败同时存在且需要不同的补救措施。 #### 本文。 我们在两个独立轴上评估策略。*完成性*是指策略是否到达终端时域。*最优性*是指策略在完成的前提下是否匹配固定份额的动态规划参考值 (Puterman, 1994 (https://arxiv.org/html/2605.26657#bib.bib2))。当约束是终止条件中的*隐式*约束时,没有每步代价可用,这与标准 CMDP (Altman, 1999 (https://arxiv.org/html/2605.26657#bib.bib5); Achiam 等人, 2017 (https://arxiv.org/html/2605.26657#bib.bib6); Chow 等人, 2018 (https://arxiv.org/html/2605.26657#bib.bib7); García and Fernández, 2015 (https://arxiv.org/html/2605.26657#bib.bib9); Ray 等人, 2019 (https://arxiv.org/html/2605.26657#bib.bib8)) 不同,标准分解不适用。原则性的评估需要使两种失败模式分别可见。对于最优性轴,我们提供分析性说明:在附录 B (https://arxiv.org/html/2605.26657#A2) 中,我们在一个最小累积损伤 MDP 上推导出一个充分条件,在该条件下损伤源处*期望*的第一个策略梯度更新指向贪婪行动 (命题 1 (https://arxiv.org/html/2605.26657#Thmproposition1))。该命题支配一个二元动作骨架。它与多活动测试平台的联系是结构类比和动机背景,而非形式推导。我们在两个环境中进行评估(一个 49 步的砌砖工职业生涯和一个 20 赛季的 NBA 大前锋职业生涯),它们共享 §3 (https://arxiv.org/html/2605.26657#S3) 的抽象结构,但在活动集、时域、负荷模型和校准数据上有所不同。在两个环境中,真实环境上的 PPO 都未能完成。具有时域访问和受限动作空间的 Dyna (Sutton, 1990 (https://arxiv.org/html/2605.26657#bib.bib33)) 变体实现了完成但未能达到最优;后向归纳则两者都实现。 #### 贡献。 - •形式化定义了时域不匹配累积损伤问题类 (§3 (https://arxiv.org/html/2605.26657#S3)),涵盖潜在损伤状态、延迟代理信号、主导活动结构以及隐式角色可行性约束,以及完成性-最优性分解 (§3\.2 (https://arxiv.org/html/2605.26657#S3.SS2))。 - •一个经验性三方比较 (PPO\-real, 固定份额 Dyna, 固定份额动态规划),分别量化了两个环境中的完成性和最优性差距 (砌砖工 \( \Delta M_{\text{final}} = 0.271 \),NBA \( 0.150 \); 95% 自助法 CI [0.148, 0.151])。 - •因果分析表明,在带有线性软惩罚的 PPO 下,单独提供时域访问是有害的(平均退出年龄 24.7 对 27.8, p = 0.028),而动作空间限制是实现完成的干预措施 (§5 (https://arxiv.org/html/2605.26657#S5))。 - •吸引盆分析识别出第一阶段贪婪承诺是最优性失败机制,无论时域长度如何,盆进入发生在训练的前 1% (§6 (https://arxiv.org/html/2605.26657#S6))。 ## 2 相关工作 #### 约束 MDP 与安全强化学习。 约束 MDP 公式 (Altman, 1999 (https://arxiv.org/html/2605.26657#bib.bib5)) 及其变体 (Achiam 等人, 2017 (https://arxiv.org/html/2605.26657#bib.bib6); Chow 等人, 2018 (https://arxiv.org/html/2605.26657#bib.bib7)) 将约束视为显式的、每步可观测的量。安全探索方法 (García and Fernández, 2015 (https://arxiv.org/html/2605.26657#bib.bib9); Ray 等人, 2019 (https://arxiv.org/html/2605.26657#bib.bib8)) 将安全违规视为整个轨迹展开中的连续代价。我们的设置在结构上不同:终止条件充当约束,从轨迹展开中发现而非作为运行代价给出,因此标准 CMDP 方法无法诊断我们识别的完成失败。 #### 策略梯度收敛。 近期的理论方向 (Mei 等人, 2020 (https://arxiv.org/html/2605.26657#bib.bib12); Agarwal 等人, 2021 (https://arxiv.org/html/2605.26657#bib.bib13); Bhandari and Russo, 2024 (https://arxiv.org/html/2605.26657#bib.bib14)) 刻画了策略空间中的非凸盆。我们的第 0 步盆进入实例化损伤状态源处的这种机制,其中即时奖励主导了延续值的 Lipschitz 尾部。命题 1 (https://arxiv.org/html/2605.26657#Thmproposition1) 是在一个最小二元动作 MDP 上根据第一原理推导的。它与一般收敛文献的联系是结构类比,而非形式推导。该文献讨论了我们的最优性轴,但对完成性保持沉默,通常假设固定时域。 #### 长时域信用分配、奖励塑造与离线方法。 将信用重新绑定到早期动作的方法 (Harutyunyan 等人, 2019 (https://arxiv.org/html/2605.26657#bib.bib17); Arjona\-Medina 等人, 2019 (https://arxiv.org/html/2605.26657#bib.bib16)) 针对的是可以绑定任一个轴的机制。我们的分解隔离了*哪个*轴是绑定约束。基于势能的奖励塑造 (Ng 等人, 1999 (https://arxiv.org/html/2605.26657#bib.bib4)) 可以改变初始化附近的梯度景观。返回条件方法如 Decision Transformer (Chen 等人, 2021 (https://arxiv.org/html/2605.26657#bib.bib18)) 可能选择避免早期终止的轨迹,但需要演示并在稀疏的后期时域机制中继承分布偏移问题。这两种方法均未在此评估。 #### 传入信号设计。 测试平台中使用的代理信号 \( S_t \) 是一个固定的敏化函数,校准于流行病学数据。此处未探讨的一个替代方案是端到端地学习或演化传入信号,而不是固定它。代理信号无关性发现 (§5 (https://arxiv.org/html/2605.26657#S5)) 是对固定传入信号无法提供什么的诊断,而自适应传入架构是否能在没有动作空间限制的情况下弥合这一差距是一个开放问题。 ## 3 问题分类、分解与算法分析 ### 3\.1 问题分类 我们研究具有累积损伤的有限时域 MDP,由 \( ( \mathcal{S}, \mathcal{A}, T, r, H, \mathcal{E} ) \) 指定,其中 \( \mathcal{S} \) 包含一个*累积损伤变量* \( D_t \in [0,1] \) (\( D_{t+1} = D_t + f(s_t, a_t) \), \( f \ge 0 \)) 和一个*二级保存变量* \( M_t \in [0,1] \), \( M_0 = 1 \); 奖励局部最大化的动作具有 \( f(s_t, a_t) > 0 \); 并且 \( \mathcal{E} \) 是一组终止条件,当累积损伤超过状态依赖阈值或违反角色可行性时退出回合。与标准 CMDP (Guin and Bhatnagar, 2022 (https://arxiv.org/html/2605.26657#bib.bib10); Wachi and others, 2024 (https://arxiv.org/html/2605.26657#bib.bib11)) 的关键区别在于,\( \mathcal{E} \) 中的约束*从未作为运行代价被观测*:学习者只有通过到达它才能发现终止边界。我们称此类问题为*时域不匹配*,当贪婪策略的有效回合长度严格小于 \( H \) 时。 ###### 假设 1 (累积损伤结构)。 一个累积损伤 MDP \( \mathcal{M} \) 满足: (i) 单调损伤:对所有 \( (s,a) \) 有 \( f(s,a) \ge 0 \),因此 \( D_t \) 沿任何轨迹非递减。 (ii) 贪婪-损伤对齐:奖励最大化动作满足 \( f(s, \arg \max_a r(s,a)) > 0 \)。 (iii) 隐式终端边界:\( \mathcal{E} \) 非空,并且只有不总是选择贪婪动作的策略才能以正概率*避免*它。 除假设 1 (https://arxiv.org/html/2605.26657#Thmassumption1) 之外,我们研究的实例共享五个结构特征。前两个涉及智能体的观察及其动作空间的结构: (a) 潜在损伤状态:\( D_t \) 和二级保存变量 \( M_t \) 未被观测;智能体仅接收代理信号 \( S_t = g(D_t) \),该信号在贪婪策略访问的低损伤水平下无信息量,因此在隐式边界之前没有基于观测的警告到达智能体。我们使用一个固定敏化函数作为诊断基线,该函数校准于流行病学数据。 (b) 主导活动结构:一个活动同时是唯一的奖励最大化和唯一的损伤最大化者,有 \( k-1 \) 个低奖励、低损伤的替代选项,形成一种替代结构,其无约束最优解与角色可行性约束冲突 (c)。剩余三个特征决定了环境如何执行和惩罚损伤: (c) 角色可行性约束:如果滑动窗口内主导活动份额低于 \( \alpha \),则回合终止,作用于动作空间的份额维度; (d) 容量-损伤反馈:每步奖励被 \( h(D_t, S_t) \) 抑制,在 \( D_{\text{clin}} \) 以下静默,超过后渐进; (e) 自放大二级通道:\( M_t \) 在低于 \( M_{\text{amp}} = 0.6 \) 时以加速速率退化,使得早期的最大努力轨迹不可逆地比主动的低努力轨迹更差。没有 (e) 最优性差距消失:DP 和贪婪策略在匹配的职业长度下产生相似的 \( M_{\text{final}} \); 两个测试平台都使用 \( M_{\text{amp}} = 0.6 \)。 ### 3\.2 完成性 vs 最优性分解 ###### 定义 1 (完成性)。 策略 \( \pi \) 实现了*完成性*,如果在步骤 \( H \) 之前到达 \( \mathcal{E} \) 中任何元素的概率为零:期望回合长度等于 \( H \)。 ###### 定义 2 (最优性)。 在完成的前提下,策略 \( \pi \) 实现了*最优性*,如果 \( V^\pi(s_0) = V^{\pi^*}(s_0) \),其中 \( \pi^* \) 是在与 \( \pi \) 相同的动作子空间上优化的后向归纳参考值。最优性对于未能完成的策略未定义。 这些定义导出一个三结果序数尺度 (表 1 (https://arxiv.org/html/2605.26657#S3.T1))。*最优性差距*是 \( \Delta M_{\text{final}} = M^{\text{DP}}_{\text{final}} - M^{\pi}_{\text{final}} \)。定义 2 (https://arxiv.org/html/2605.26657#Thmdefinition2) 以 \( V^\pi \) 表述。\( \Delta M_{\text{final}} \) 作为值差距的领域特定替代,由特征 (e) 证明合理:在自放大二级通道和固定份额约束下,给定完成时 \( M_{\text{final}} \) 是 \( V^\pi \) 的单调函数,因此 \( \Delta M_{\text{final}} > 0 \) 对应于单元 B。 表 1:由定义 1 (https://arxiv.org/html/2605.26657#Thmdefinition1) 和 2 (https://arxiv.org/html/2605.26657#Thmdefinition2) 导出的三结果尺度。尺度为严格排序 单元 A \( \prec \) 单元 B \( \prec \) 单元 C。最优性仅在完成已实现时才有意义;单元 A 与单元 B/C 在 \( M_{\text{final}} \) 上的比较混淆了截断与次优性,本文中不进行此类比较。| 单元 | 方法 | 环境 | 观测 | 份额头 | 努力头 | 角色可行性门 | 结果 |
|---|---|---|---|---|---|---|---|---|
| (A) | PPO\-real | 环境潜在 \( D_t, M_t \) | 观测代理 \( S_t = g(D_t) \) | 份额头通过 PG 学习 | 努力头通过 PG 学习 | 活跃:提前终止 | 单元 A 未能完成 (27.8 年) |
| (B) | 固定份额 Dyna | 环境潜在 \( D_t, M_t \) | 观测代理 \( S_t \) | 份额头固定\_份额:DP\-钳制 | 努力头通过 PG 学习 | 无\_退出:绕过 | 单元 B 完成; \( \Delta M_{\text{final}} = 0.271 \) |
| (C) | DP\-最优 | 环境全状态 \( (D,M,t) \) | 直接访问 \( (D,M,t) \) 网格 | 份额分配后向归纳 | 努力策略后向归纳 | 后向传递全长 \( H \) | 单元 C 完成 \( + \) 最优性 |
| | | | | | | | 可训练 (PG) / 冻结 (钳制) / 环境 (固定) |
图 1:三方方法比较架构。列共享管线 状态 \( \to \) 观测 \( \to \) 份额/努力头 \( \to \) 角色可行性门相似文章
有限时域马尔可夫决策过程中自然策略梯度的有限时间分析
本文首次为有限时域马尔可夫决策过程中的自然策略梯度算法提供了有限时间收敛保证,证明了在不同步长策略下的次线性和线性收敛速度。
当梯度碰撞:LLM裁判的多目标提示优化的失败模式
本文识别了在使用文本梯度进行LLM裁判的多目标提示优化中的两种失败模式:优化过程中的梯度稀释和推理过程中的指令干扰,表明联合梯度处理会丢失特定于标准的信息。
超越模式崩溃:面向多样化推理的分布匹配
本文识别了同策略强化学习方法(如GRPO)中的模式崩溃问题,并提出了DMPO,该方法通过近似前向KL散度最小化来保持解的多样性。在NP难组合优化和数学推理任务上取得了显著改进。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。
从结果到行动:利用事后视角进行长周期语言智能体训练
介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。