神经伴随状态策略:在循环强化学习中构建隐藏状态

arXiv cs.LG 论文

摘要

本文提出了神经伴随状态策略,建立了循环强化学习隐藏状态与庞特里亚金极小值原理之间的正式联系,以增强可解释性和鲁棒性。

arXiv:2605.05373v1 公告类型:新文章 摘要:智能体的一个关键能力是在部分可观测环境下运行:尽管状态观测缺失或不完整,仍能进行有效的推理和决策。虽然通过强化学习获得的循环(基于记忆的)策略通过将历史编码为潜在状态表示来解决这一问题,但其内部动态仍然是不可解释的黑盒。本文建立了这些隐藏状态与最优控制中的庞特里亚金极小值原理(PMP)之间的正式联系。我们证明,对于标准的循环架构,潜在表示直接映射到 PMP 伴随状态,这使得读出层可以被解释为执行哈密顿量极小化。由于标准的奖励最大化无法自然地发现这种对齐,我们引入了源自 PMP 的伴随状态损失函数,以显式地构建内部动态。实证研究表明,该方法在部分可观测的 DMControl 任务上性能持平或更优,并且对零样本分布外传感器掩码具有鲁棒性。通过将循环网络框定为受极小值原理支配的动态过程,我们为设计鲁棒的连续控制策略提供了一种有原则的方法。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:10

# 在循环强化学习中结构化隐藏状态
来源: https://arxiv.org/html/2605.05373

## 神经伴随状态策略:在循环强化学习中结构化隐藏状态

David Leeftink, Max Hinne, Marcel van Gerven
Radboud 大学机器学习与神经计算系
[email protected], {max.hinne, marcel.vangerven}@donders.ru.nl

###### 摘要

智能智能体的一个关键能力是在部分可观测性下运作:尽管存在缺失或不完整的状态观测,仍能进行有效的推理和行动。虽然通过强化学习学到的循环(基于记忆的)策略通过将历史编码到潜在状态表示中来解决这一问题,但其内部动力学仍然是不可解释的黑箱。本文建立了这些隐藏状态与最优控制中的庞特里亚金极小值原理(PMP)之间的形式化联系。我们证明,对于标准的循环架构,潜在表示直接映射到 PMP 伴随状态,这使得读出层可以被解释为执行哈密顿量最小化。由于标准的奖励最大化并不能自然地发现这种对齐,我们引入了一种源自 PMP 的伴随状态损失,以明确地结构化内部动力学。在经验上,这种方法在部分可观测的 DMControl 任务上表现持平或更优,并且对零样本分布外传感器屏蔽具有鲁棒性。通过将循环网络框架化为受极小值原理支配的动态过程,我们为设计鲁棒的连续控制策略提供了一种合理的方法。

## 1 引言

智能智能体面临的一个根本挑战是在部分可观测性下有效运作。现实世界的物理任务本质上是模糊的,通常以噪声传感器、测量延迟或缺失数据为特征。因此,在连续控制任务中,生物系统和人工系统很少能完全访问环境的真实状态。由于单个瞬时观测通常不足以确定系统的底层状态,智能体必须学习整合过去事件的历史,以推断无法直接看到的内容 (Kaelbling et al., 1998)。

在深度强化学习(RL)中,循环策略通过维持一个不断积累信息的隐藏状态来解决部分可观测性问题。虽然纯粹为了奖励优化这些网络会产生强劲的性能,但其内部动力学仍然是一个不可解释的黑箱 (Wierstra et al., 2010; Hausknecht and Stone, 2015)。在没有显式结构约束的情况下,循环策略倾向于记忆脆弱的启发式方法,而不是学习对控制任务的有根据的表示,这使得它们在不熟悉的条件下容易完全失效。

为了对这些内部动力学进行结构化,本文建立了循环策略与庞特里亚金极小值原理(PMP)(Pontryagin, 1987) 之间的形式化联系。PMP 指出,最优连续控制由哈密顿系统支配,其中伴随状态变量与环境共同演化,以编码最优性条件。如图 1 所示,我们通过引入神经伴随状态策略(NCP)来形式化这种关系;这是一个明确将神经记忆更新与伴随状态动力学对齐的框架。我们证明,连续时间循环神经网络(CT-RNNs)(Beer, 1995) 和门控循环单元(GRUs)(Chung et al., 2014) 等标准架构天生具有这种精确的数学结构。通过将它们的潜在记忆直接映射到最优伴随状态,网络的最终读出层可以被严格地解释为执行哈密顿量最小化。

虽然循环策略具备最优哈密顿动力学的潜力,但标准的奖励最大化并不会自然地收敛到这种对齐。为了弥补这一差距,我们引入了一种源自哈密顿-雅可比-贝尔曼(HJB)方程 (Bellman, 1966) 的辅助伴随状态损失。由于 HJB 理论将理论伴随状态建立为价值函数的梯度 (Vinter, 1986),这些目标可以直接从标准演员-评论家架构中学习到的评论家中动态提取。使用这些目标监督演员,可以明确地结构化网络的隐藏状态,以跟踪环境潜在的优性条件。

我们在 DeepMind Control Suite (DMControl; Tassa et al. (2018)) 的部分可观测连续控制任务上评估了我们的方法。经验上,将伴随状态损失应用于 CT-RNN 和 GRU 架构,在性能上与近端策略优化(PPO)基线训练的循环策略持平或更优 (Schulman et al., 2017)。此外,我们还表明,所学到的结构化内部动力学对增加的分布外传感器丢弃表现出鲁棒性。最终,这项工作通过将以前黑盒式的隐藏状态锚定在极小值原理的数学结构中, bridged 了经典最优控制和深度 RL 之间的关键差距。通过将循环架构框架化为受此原理支配的动态过程,我们为设计鲁棒的连续控制策略提供了理论上对齐的基础。

## 2 背景:循环策略优化

[公式渲染占位符 - 对应原文中的 LaTeX 公式块]

> 图 5:不同成本函数下的哈密顿策略:能量最优(1)、时间最优(2)和燃料最优(3)。这可以产生平滑的最优控制函数或不连续的 bang-bang 控制。它们都利用相同的伴随状态,因此可以作为“演员”,等同于利用潜在神经伴随状态的那个。

在标准深度 RL 架构的演员中,将最终隐藏状态映射到动作的读出层(或策略头)通常是启发式选择的。然而,由于 NCP 类明确旨在将隐藏状态与理论庞特里亚金伴随状态对齐 ($h \approx \lambda^{\star}$),最优读出层不再是任意的,而是必须针对环境的具体运行成本函数最小化控制哈密顿函数。通过将最优切换函数定义为 $\sigma(t) = -g(x,t)^{\top}\lambda(t)$ 并假设对称执行器限制 $U \in [-u_{\max}, u_{\max}]$ 以保持符号清晰,我们可以结构化地设计策略头以匹配不同类别的最优控制问题(如图 5 所示):

1.  **二次控制(平滑动作)**:如正文所述,具有控制努力二次惩罚的环境,$L(x,u)=q(x)+u^{\top}Ru$,以及控制仿射系统动力学 $\dot{x}=f(x)+g(x)u$,产生的哈密顿量相对于 $u$ 是凸的。将梯度设为零得到最优控制律:$u^{\star}=R^{-1}\sigma$。在我们的框架中,这对应于没有边界激活函数的标准线性读出层。
2.  **时间最优和仅状态成本(Bang-Bang 控制)**:对于许多机器人任务(例如,最小时间导航),成本仅由状态相关项组成,意味着不惩罚控制努力:$L(x,u)=q(x)$。由于哈密顿量相对于 $u$ 是线性的,并且物理执行器具有严格的限制 $[u_{\min}, u_{\max}]$,极小值原理规定最优解仅存在于边界上。这导致了 bang-bang 控制,其中智能体根据切换函数的符号在最大和最小努力之间瞬时切换:
    $$
    u^{\star}=\begin{cases} \text{sign}(\sigma)u_{\max} & \text{if } |\sigma|>0 \\ 0 & \text{if } \sigma=0 \end{cases}
    $$
    在 NCP 框架中,可以通过在策略头上应用 $\text{sign}(\cdot)$ 激活函数来强制执行 bang-bang 最优控制器。
3.  **燃料最优成本(Bang-Off-Bang 控制)**:如果环境惩罚控制努力的绝对幅度(例如,在航空航天应用中节省燃料),则引入 $L_1$ 惩罚:$L(x,u)=q(x)+\|u\|$。最优控制律发展出一个死区,当敏感度低时,滑行(不施加控制努力)是最优的:
    $$
    u^{\star}=\begin{cases} \text{sign}(\sigma)u_{\max} & \text{if } |\sigma|>1 \\ 0 & \text{if } |\sigma|<1 . \end{cases}
    $$

虽然本工作中的经验评估侧重于连续二次情况,但将循环隐藏状态解释为庞特里亚金伴随状态允许人们设计特定于环境成本或奖励函数属性的读出层,同时保持底层循环伴随状态动力学不变。

## 附录 D 认知不确定性与平均哈密顿量最小化

试图在探索和利用之间做出智能权衡的智能体必须将其探索集中在**认知不确定性**上,这与智能体尚未知道的事物相关。与代表内在且不可约的随机性的偶然不确定性不同,认知不确定性可以通过收集更多数据来减少。在最优化控制中,认知不确定性通常被建模为参数不确定性,通过贝叶斯推断环境的动力学获得。我们可以通过考虑一种旨在最小化合理动态模型后验分布上预期成本的策略来公式化这一点:

$$
\pi^{\star} := \operatorname*{argmin}_{\pi \in \Pi} \mathbb{E}_{\zeta \sim p(\zeta \mid \mathcal{D})} [ J(\pi_{\theta}(x_{\zeta}(t)) ) ] \quad \text{(D.1)}
$$

$$
\text{s.t.} \quad \dot{x}_{\zeta}(t) = f_{\zeta}\bigl(x_{\zeta}(t), u(t), t \bigr), \quad \text{for } t \in [t_{0}, t_{f}]
$$

$$
x_{\zeta}(t_{0}) = x_{0}.
$$

其中 $J(\theta)$ 表示在由 $\zeta$ 参数化的动力学下评估的确定性成本泛函,$p(\zeta \mid \mathcal{D})$ 是给定过去交互数据 $\mathcal{D}$ 的后验分布。

为了解决这个概率鲁棒优化问题,我们可以抽取有限的一组 $m$ 个样本 $\zeta_{i} \sim p(\zeta \mid \mathcal{D})$。这些样本形成一个由共享控制输入 $u(t)$ 驱动的确定性动力系统系综:

$$
\dot{x}_{\zeta_{i}}(t) = f_{\zeta_{i}}\bigl(x_{\zeta_{i}}(t), u(t), t \bigr), \quad \text{(D.2)}
$$

$$
\dot{\lambda}_{\zeta_{i}}(t) = -\nabla_{x}\mathcal{H}\bigl(x_{\zeta_{i}}(t), \lambda_{\zeta_{i}}(t), u(t), t \bigr), \quad \text{(D.3)}
$$

$$
\text{s.t.} \quad \lambda_{\zeta_{i}}(t_{f}) = \nabla_{x}\Phi\bigl(x_{\zeta_{i}}(t_{f}) \bigr). \quad \text{(D.4)}
$$

如果 $u^{\star}(t)$ 是该系综的最优控制序列,它必须满足平均哈密顿量最小化原理 (Leeftink et al., 2025):

$$
u^{\star}(t) = \operatorname*{argmin}_{u \in \mathcal{U}} \mathbb{E}_{\zeta \sim p(\zeta \mid \mathcal{D})} \left[ \mathcal{H}\left(x_{\zeta}(t), \lambda_{\zeta}(t), u, t \right) \right], \quad \text{(D.5)}
$$

**对神经伴随状态策略的影响。** 虽然本工作中介绍的 NCP 框架涉及优化确定性点估计,但公式 (D.5) 为**贝叶斯** NCP 提供了理论基础。因为理论伴随状态与价值函数梯度相关,$\lambda^{\star} = \nabla_{x}V^{\star}$,这种不确定性可以通过一组 $m$ 个评论家来捕捉。通过在这些评论家之间保持并行隐藏状态 $h_{\zeta_{i}}(t)$,每个代表一个独特的伴随状态假设,演员可以通过最小化系综哈密顿量的平均值来采取探索性动作:

$$
u^{\star}(t) \approx \operatorname*{argmin}_{u \in \mathcal{U}} \frac{1}{m} \sum_{i=1}^{m} \left\{ c(u) + u^{\top}G_{\theta}(y)h_{\zeta_{i}}(t) \right\}. \quad \text{(D.6)}
$$

我们将这种贝叶斯系综方法的经验验证留给未来的工作。

## 附录 E 实现和训练细节

这里我们概述了实现中使用的算法组件、架构选择和超参数,以确保可重复性。我们的系统和默认超参数配置遵循标准的连续控制设置,大量借鉴了 Brax 环境 (Freeman et al., 2021)。完整实现使用 JAX (Bradbury et al., 2018) 编写,利用 `jax.vmap` 进行矢量化环境 rollout 和 `jax.lax.scan` 进行高效的 BPTT。

### E.1 网络架构

NC-GRU 和 NC-CTRNN 共享一个通用的演员-评论家蓝图。为了确保稳定的学习,演员和评论家使用共享编码器。它们仅在循环核心方面有所不同:

-   **观测编码器**:在每个时间步,原始观测 $y_{t}$ 进行动态归一化(参见附录 E.2 ...)

相似文章

推理微调诱导持续潜在策略状态

arXiv cs.CL

本文将链式思维推理建模为切换动态系统,表明推理微调全局性地重新组织潜在策略状态,从而改善了多步推理。提出的框架结合了时间感知对比学习与离散状态发现,实验表明,微调后的模型展现出更丰富的潜在策略组织,并具有功能特化。

流经状态:用于强化学习的神经ODE正则化

arXiv cs.LG

本文提出了一种基于神经ODE的正则化方法,该方法强制强化学习智能体中的潜在嵌入遵循一致的ODE流,使表示学习与环境动态对齐,并在Atari和网格世界基准上取得了性能提升。