使用控制障碍函数层的高维安全最优反馈控制的端到端学习

arXiv cs.LG 论文

摘要

本文提出了一种可扩展的方法,用于在高维系统中端到端学习安全反馈控制器,通过将基于控制障碍函数的安全滤波器嵌入为优化层,并利用算子分裂和无雅可比反向传播来克服计算瓶颈。

arXiv:2607.20674v1 公告类型: new 摘要:我们考虑在控制障碍函数(CBFs)强加的安全约束下学习高维半全局反馈控制器的问题。将CBFs纳入端到端策略训练需要嵌入一个基于二次规划的安全滤波器作为优化层,但计算和微分瓶颈在很大程度上限制了先前的方法只能应用于低维系统,通常最多16个状态维度。我们通过结合算子分裂和近期开发的无雅可比反向传播(JFB)方法来解决这一限制,从而实现可扩展的端到端训练,同时通过CBF安全滤波器保持硬安全保证。我们使用非光滑分析技术在理论上证明了这种训练方法的合理性,并在状态和控制维度分别高达1200和400的高维多智能体非线性控制问题上展示了其有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:13

# 基于控制屏障函数层的高维安全最优反馈控制的端到端学习
来源:https://arxiv.org/html/2607.20674
Xingjian Li1\equalcontrib, Kelvin Kan2\equalcontrib, Deepanshu Verma3\equalcontrib, Krishna Kumar1, Stanley Osher2, Samy Wu Fung4

###### 摘要
我们考虑在控制屏障函数(CBFs)强制执行硬安全约束的条件下,学习高维半全局反馈控制器的问题。将CBFs融入端到端策略训练需要嵌入一个基于二次规划的安全滤波器作为优化层,但计算和微分瓶颈导致先前的方法大多局限于低维系统,通常最多只有16个状态维度。我们通过将算子分裂与近期提出的无雅可比反向传播(JFB)方法相结合,来解决这一局限性,从而在通过CBF安全滤波器保持硬安全保证的同时,实现可扩展的端到端训练。我们使用非光滑分析技术从理论上证明这种训练方法的合理性,并在状态和控制维度分别高达1200和400的高维多智能体非线性控制问题上展示了其有效性。

## 引言
我们考虑高维非线性控制系统安全反馈控制器的端到端学习问题。具体来说,我们考虑如下形式的系统:
\[
\min_{u\in U} \quad \int_0^T L(t, z_x, u) \, dt + \omega G(z_x(T)),
\tag{1a}
\]
\[
\text{s.t.} \quad \dot{z}_x = f(t, z_x) + g(t, z_x) u(t),
\tag{1b}
\]
\[
h(z_x(t)) \ge 0, \quad z_x(0) = x,
\tag{1c}
\]
其中 \(z_x \in \mathbb{R}^n\) 表示初始状态为 \(x\) 的状态变量,\(u(t) \in U \subset \mathbb{R}^m\) 是控制量,\(L\) 是运行代价,\(G\) 是由 \(\omega > 0\) 加权的终端代价。函数 \(h(z_x(t)): \mathbb{R}^n \to \mathbb{R}\) 通过其超水平集定义安全集,约束 \(h(z_x(t)) \ge 0\) 要求轨迹始终保持安全。我们的目标是学习 \(u^\star(t, z)\),该函数对所有 \(x \sim \rho\) 近似求解 (1),从而产生一个无需在线重训练即可适用于广泛 \((t, z)\) 的半全局控制器 (Onken et al. 2022; Ruthotto et al. 2020)。

参见标题 参见标题
图 1:高维控制示例:由训练好的*半全局反馈*控制器生成的50个单积分器(左)和100架四旋翼无人机(右)的轨迹。

一种广泛用于强制执行安全约束的框架是控制屏障函数 (CBFs) (Ames et al. 2016, 2019; Xiao and Belta 2021)。CBFs 通过对控制输入施加逐点不等式来保证安全集的前向不变性。在实际应用中,通常通过在每个时间步求解一个二次规划 (QP) 来强制执行该条件,该 QP 以最小程度修改标称控制输入以确保安全。对于神经反馈策略,这自然会导致一种基于 QP 的安全滤波器被嵌入到训练循环中作为优化层。这种端到端的形式化方法很有吸引力,因为*学习到的控制器可以在训练过程中考虑到下游的安全滤波器,而不是仅仅将安全视为后处理步骤*。然而,通过 QP 层进行微分会引入大量的计算开销,现有的端到端方法大多局限于低维系统,通常只有几十个状态变量。因此,将此类方法扩展到高维非线性控制问题仍然是主要的计算挑战。

在这项工作中,我们通过开发一种可扩展的端到端训练框架来应对这一挑战,该框架用于带有 CBF-QP 滤波器的半全局神经反馈控制器。通过将算子分裂与无雅可比反向传播 (JFB) 相结合,我们的方法避免了在通过高维 QP 层训练时出现的微分瓶颈。这使得我们能够在远超先前工作的规模上进行安全关键非线性系统的端到端学习控制,同时保留嵌入的 CBF 滤波器提供的硬安全保证(见图 1)。

### 我们的贡献
多个研究路线解决了学习控制问题中的约束问题。用于最优控制的可微编程方法,包括可微 MPC (Amos et al. 2018)、Pontryagin 可微编程 (Jin et al. 2020) 及其扩展 (Oshin et al. 2023; Jin et al. 2021),能够实现通过轨迹优化的端到端微分,但它们本质上是局部轨迹求解器,而非学习反馈策略的方法。诸如 (Onken et al. 2021; Drgoňa et al. 2022; Cortez et al. 2022; Yoo et al. 2022; Mowlavi and Nabi 2023; Drgoňa et al. 2024) 的工作通过软惩罚包含安全约束,这简化了优化但无法保证约束满足。更相关的是基于可微优化层(如 OptNet (Amos and Kolter 2017) 和 CVXPY Layers (Agrawal et al. 2019a))的投影安全层。虽然这些方法能够实现带有硬安全保证的端到端训练 (Chen et al. 2021; Xiao et al. 2023; Min and Azizan 2024),但由于与通过优化层微分相关的计算成本和优化挑战,它们大多局限于小规模问题。由于篇幅限制,我们将相关工作综述推迟到附录中。

我们提出了一种新的端到端学习安全半全局反馈控制器的框架,克服了先前方法的计算和理论局限性。我们的主要贡献如下。

1. **算子分裂和无雅可比反向传播用于可扩展的端到端训练。** 我们通过将三算子分裂与无雅可比反向传播相结合,开发了一种用于带有嵌入式基于 CBF 安全层的神经反馈控制器的可扩展端到端训练框架。算子分裂形式化将 CBF 诱导的 QP 分解为简单的子问题,使得高维扩展成为可能,而 JFB 能够通过得到的固定点迭代进行高效微分,而无需求解大型线性系统。这些要素共同使得通过高维安全滤波器的端到端训练在计算上变得可行,因为它避免了构建完整的 KKT 系统,并且与隐式微分方法相比,显著降低了反向传播的成本。

2. **非光滑安全层下的收敛保证。** 利用 Clarke 广义雅可比理论,我们为所提出的训练过程在梯度流下建立了收敛保证,尽管 CBF 层引入了非光滑性。该分析为使用 JFB 训练受安全约束的隐式网络提供了严格的基础,即使在主动约束导致梯度不连续的情况下也是如此。

3. **跨动力学、约束和规模的数值验证。** 我们在一系列具有嵌入式 CBF 安全层的高维非线性多智能体控制问题上展示了所提出框架的有效性。实验涵盖了不同的动力学、安全约束和问题规模,包括状态维度超过 1000 且控制维度超过 100 的设置。这些结果表明,所提出的方法在维度上远超先前端到端安全控制学习方法所考虑的规模。

总之,这些结果表明,在以前被认为计算上不可行的机制中,可以端到端地学习高维安全关键反馈控制。

## 背景
### 控制屏障函数
考虑控制仿射系统 (1b),其中 \(f\) 和 \(g\) 是局部 Lipschitz 的。为简化表述,我们省略 \(z_x\) 的下标。设安全集定义为:
\[
\mathcal{C} := \{ z \in \mathbb{R}^n : h(z) \ge 0 \},
\tag{2}
\]
其中 \(h: \mathbb{R}^n \to \mathbb{R}\) 是连续可微的。控制屏障函数 (CBFs) 通过对控制输入施加逐点约束来强制执行 \(\mathcal{C}\) 的前向不变性。对于控制仿射系统,\(h\) 沿轨迹的时间导数为:
\[
\dot{h}(z) = \nabla h(z)^\top f(t, z) + \nabla h(z)^\top g(t, z) u.
\tag{3}
\]
标准的 CBF 条件要求存在一个扩展类 \(\mathcal{K}\) 的函数 \(\alpha\),即连续严格递增且满足 \(\alpha(0) = 0\) 的函数,使得:
\[
\dot{h}(z) + \alpha(h(z)) \ge 0,
\tag{4}
\]
重要的是,(4) 对于控制作用 \(u\) 是仿射的。

###### 定理 1 (CBF 约束下的前向不变性 (Ames et al. 2019))。设函数 \(h\) 连续可微,\(\mathcal{C}\) 如上定义。假设 \(u(t)\) 是局部 Lipschitz 的,\(z(0) \in \mathcal{C}\),且 (4) 对所有 \(t \ge 0\) 成立。则 \(\mathcal{C}\) 在 \(u(t)\) 作用下是前向不变的。特别地,对所有 \(t \ge 0\) 有 \(z(t) \in \mathcal{C}\),从而安全条件 \(h(z(t)) \ge 0\) 得以维持。

换句话说,CBF 条件通过要求安全函数在 \(\mathcal{C}\) 边界附近的导数足够非负,来确保轨迹无法离开安全集。因此,可以通过将控制输入限制在由 (4) 诱导的控制仿射不等式组成的约束集来强制执行安全性:
\[
C(z) := \left\{ u \in \mathbb{R}^m : A(z) u \le b(z) \right\}.
\tag{5}
\]
在训练过程中,安全滤波器将标称的神经反馈控制 \(u_\theta(t, z)\) 映射到其在该可行集上的投影:
\[
u_\theta^\star(t, z) = P_{C(z)}(u_\theta(t, z)) = \operatorname*{arg\,min}_{u \in C(z)} \frac{1}{2} \left\| u - u_\theta(t, z) \right\|_2^2.
\tag{6}
\]
因此,\(u_\theta^\star(t, z)\) 通过在每个时间步和为每条轨迹求解一个基于 CBF 的二次规划 (CBF-QP) 获得,以确保满足 (4)。在这项工作中,我们还使用了高阶控制屏障函数 (HOCBFs),其细节包含在附录中。

### 戴维斯-尹分裂与无雅可比反向传播
(6) 中的 CBF-QP 安全滤波器必须在训练过程中的每个采样轨迹的每个时间步进行评估和微分。虽然每次投影通常在每个步骤中开销不大,但随时间堆叠它们会显著增加计算量,更重要的是,通过 QP 反向微分在高维问题中可能成为主要的计算瓶颈。

#### 戴维斯-尹分裂
为了使这一步可扩展,我们遵循 (McKenzie et al. 2024) 并使用戴维斯-尹分裂 (DYS) (Davis and Yin 2017) 求解 CBF-QP,该方法将投影表示为分裂算子的不动点。然后,我们使用无雅可比反向传播 (JFB) (Fung et al. 2022; Yin et al. 2022; Knutson et al. 2026) 通过该不动点表示进行微分,而无需反向传播所有求解器迭代或求解经典隐式微分所需的线性系统 (Bai et al. 2019; Lorraine et al. 2020; El Ghaoui et al. 2021; Fung and Berkels 2026)。这使得 CBF-QP 层能够高效地嵌入到端到端反馈控制训练中。

特别地,我们首先为 \(c\) 个不等式约束引入松弛变量 \(s \in \mathbb{R}^c\),并令 \(y = (u, s) \in \mathbb{R}^{m+c}\)。则不等式 (5) 可以写为:
\[
A(z) u + s = b(z), \qquad s \ge 0.
\tag{7}
\]
这给出了提升的可行集:
\[
\widetilde{C}(z) := C_1 \cap C_2(z),
\tag{8}
\]
其中
\[
C_1 := \{ (u, s) : s \ge 0 \},
\tag{9}
\]
\[
C_2(z) := \{ (u, s) : A(z) u + s = b(z) \}.
\]
两个投影都很简单:\(P_{C_1}\) 通过对松弛变量进行阈值化获得,而 \(P_{C_2(z)}\) 是到仿射子空间上的投影。设
\[
Q_u = [I, 0] \in \mathbb{R}^{m \times (m+c)}
\tag{10}
\]
表示从 \(y = (u, s)\) 中提取控制分量的矩阵。投影问题 (6) 等价地用提升变量写为:
\[
y_\theta^\star = \operatorname*{arg\,min}_{y \in C_1 \cap C_2(z)} \frac{1}{2} \left\| Q_u y - u_\theta(t, z) \right\|_2^2, \qquad u_\theta^\star(t, z) = Q_u y_\theta^\star.
\tag{11}
\]
对于步长 \(\zeta > 0\),DYS 定义了不动点算子:
\[
T_\theta(y; z) = y - P_{C_1}(y) + P_{C_2(z)}\left( 2P_{C_1}(y) - y - \zeta Q_u^\top \big( Q_u P_{C_1}(y) - u_\theta(t, z) \big) \right)
\tag{12}
\]
其中 \(u_\theta(t, z)\) 是标称控制。安全滤波后的控制量从不动点
\[
y^\star = T_\theta(y^\star; z)
\tag{13}
\]
通过应用最终的 \(C_1\) 投影恢复:
\[
u_\theta^\star(t, z) = Q_u P_{C_1}(y^\star) = Q_u y^\star.
\tag{14}
\]
最后一个等式成立是因为

相似文章

面向目标无关的偏微分方程联合嵌入预测控制

arXiv cs.LG

本文提出了一种面向偏微分方程的目标无关控制框架,采用联合嵌入预测架构(JEPA),并配备轻量级2D ViT编码器和动作条件潜在动力学。研究表明,使用学到的物理可观测探针在控制任务中优于原始潜在距离。