机制切换扩散模型中线性二次Stackelberg微分博弈的熵正则化强化学习方法

arXiv cs.LG 论文

摘要

本文提出了一种熵正则化强化学习方法,用于解决机制切换扩散模型中的线性二次Stackelberg微分博弈,通过集成神经网络来近似价值函数并逃离次优均衡。

arXiv:2606.28671v1 公告类型:新 摘要:Stackelberg微分博弈(SDGs)为随机连续时间环境中的层次化决策提供了强大框架,但由于传统动态规划及Hamilton-Jacobi-Bellman-Isaacs (HJBI)方法的复杂性,其求解在计算上仍具挑战,特别是在高维系统中。本文提出了一种熵正则化强化学习(ERRL)方法,用于马尔可夫机制切换控制的连续时间扩散框架中的线性二次Stackelberg微分博弈(LQ-SDGs)。关键创新在于推导了带有熵正则化的探索性弱耦合HJBI方程,该方程促进随机策略主动避开次优均衡——这是经典SDG方法的一个局限。集成神经网络以近似依赖于机制的价值函数并高效求解高维偏微分方程(PDEs),同时一种新颖的采样技术增强了计算可行性。数值结果表明,与常规方法相比,该框架在通过探索性策略逃离次优陷阱方面尤为有效。研究强调了熵正则化和神经网络近似在突发环境变化下实现层次化决策问题鲁棒解的关键作用。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:29

# 基于熵正则化的强化学习在体制切换扩散模型中的线性二次型Stackelberg微分博弈
来源:https://arxiv.org/html/2606.28671
Congde Hu本研究由国家重点研发计划(2022YFA1007900)、安徽省自然科学基金(2408085MA019)、国家自然科学基金(12271171)、上海市哲学社会科学规划办公室项目(2022ZJB005)以及中央高校基本科研业务费专项资金(2024QKT008)资助。(通讯作者:Lin Xu。)Congde Hu 与安徽师范大学数学与统计学院,安徽芜湖 241002,中国(电子邮件:[email protected])。
Danping Li Danping Li 与华东师范大学统计学院、统计与数据科学前沿理论及应用教育部重点实验室、经济与管理学部,上海,中国(电子邮件:[email protected])。
Lin Xu Lin Xu 与安徽师范大学数学与统计学院,安徽芜湖 241002,中国(电子邮件:[email protected])。
Wenying Xu Wenying Xu 与东南大学数学学院,江苏南京 211189,中国(电子邮件:[email protected])。

###### 摘要

Stackelberg 微分博弈(SDGs)为随机连续时间环境下的分层决策提供了强大框架,然而,由于传统动态规划和 Hamilton-Jacobi-Bellman-Isaacs(HJBI)方法的复杂性,尤其是在高维系统中,其求解在计算上仍然具有挑战性。本文针对由马尔可夫体制切换驱动的连续时间扩散框架下的线性二次型 SDGs(LQ-SDGs),提出了一种基于熵正则化的强化学习(ERRL)方法。关键创新在于推导了带熵正则化的探索性弱耦合 HJBI 方程,该方程促进了随机策略,从而主动避免次优均衡——这是经典 SDG 方法的一个局限性。本文集成了神经网络以近似依赖体制的值函数并高效求解高维偏微分方程(PDEs),同时采用一种新颖的采样技术以增强计算可行性。数值结果证明了该框架相较于传统方法的有效性,特别是在通过探索性策略逃离次优陷阱方面。本研究凸显了熵正则化和神经网络近似在应对环境突变下的分层决策问题中实现鲁棒解的关键作用。

†
†
publicationid: pubid: 0000–0000/00$00.00 © 2025 IEEE

## I 引言

### I-A 背景与动机

Stackelberg 微分博弈(SDGs)是博弈论领域的基石,为建模分层决策过程提供了强大框架。Stackelberg 博弈的概念最初由[23 (https://arxiv.org/html/2606.28671#bib.bib1)]提出,旨在描述一个玩家(领导者)对另一个玩家(跟随者)具有主导地位的经济场景。这种分层结构此后被扩展到连续时间和随机设定,从而产生了 SDGs,其在包括经济学[1 (https://arxiv.org/html/2606.28671#bib.bib2)]、工程学[32 (https://arxiv.org/html/2606.28671#bib.bib3)]、机器人学[28 (https://arxiv.org/html/2606.28671#bib.bib7)]、供应链优化[18 (https://arxiv.org/html/2606.28671#bib.bib8)]、自动驾驶[8 (https://arxiv.org/html/2606.28671#bib.bib4)]、金融市场[19 (https://arxiv.org/html/2606.28671#bib.bib6)]等多个学科中得到了广泛应用。

尽管具有多样性,但由于在连续时间和随机环境中推导最优策略的复杂性,求解 SDGs 仍然是一项具有挑战性的任务。传统方法通常依赖于动态规划原理(DPP)和 Hamilton-Jacobi-Bellman-Isaacs(HJBI)方程[29 (https://arxiv.org/html/2606.28671#bib.bib9)]。然而,这些方法在高维或非线性系统中可能变得计算上难以处理,限制了它们在现实问题中的适用性。

强化学习(RL)已成为解决复杂决策问题的强大范式,特别是在传统方法不足的场景中。与经典优化技术不同,RL 利用数据驱动的方法通过与环境的交互来学习最优策略。这使得 RL 特别适用于涉及不确定性、不完全信息和动态环境的问题[21 (https://arxiv.org/html/2606.28671#bib.bib11),6 (https://arxiv.org/html/2606.28671#bib.bib19)]。熵正则化强化学习(ERRL)——一种在目标函数中加入熵项的 RL 变体,近年来引起了广泛关注。熵项通过促进策略的随机性来鼓励探索,从而*防止过早收敛到次优解*。这种方法已被证明能提高学习算法的鲁棒性和稳定性,使其在高维和连续动作空间中特别有效[14 (https://arxiv.org/html/2606.28671#bib.bib18)]。将熵正则化整合到 RL 中导致了多个最先进算法的开发,例如软 actor-critic(SAC)[5 (https://arxiv.org/html/2606.28671#bib.bib12)]和最大熵深度 RL[33 (https://arxiv.org/html/2606.28671#bib.bib31)]。这些算法已在包括机器人学、博弈论和控制系统在内的广泛应用中展现出优越性能。例如,[15 (https://arxiv.org/html/2606.28671#bib.bib30)] 证明了 ERRL 在多智能体系统中的有效性,其中策略的随机性促进了智能体之间更好的协调。

在 SDGs 的背景下,ERRL 提供了若干优势。首先,熵正则化策略的随机性很好地契合了 SDGs 的分层结构,使领导者和跟随者能够动态调整其策略。其次,熵正则化的探索促进特性增强了学习算法的鲁棒性,特别是在随机环境中。最后,熵正则化策略的概率性解释有助于推导平滑且可解释的策略,这对于现实应用至关重要[33 (https://arxiv.org/html/2606.28671#bib.bib31)]。

尽管有这些进展,但将熵正则化整合到用于 SDGs 的 RL 中仍未得到充分探索,特别是在连续时间扩散模型的背景下。扩散模型为在连续时间中建模随机动态提供了一个自然框架,并且由于能够有效处理不确定性和噪声,近来在 RL 中引起了关注[24 (https://arxiv.org/html/2606.28671#bib.bib37),22 (https://arxiv.org/html/2606.28671#bib.bib38)]。此外,许多现实系统不仅受连续随机波动的影响,还会因宏观经济变化、环境变化或组件故障而经历结构性突变。马尔可夫体制切换模型提供了一个强大的数学工具来捕捉这种突然转变。将体制切换整合到用于 SDGs 的 ERRL 框架中因此具有重要的实际意义,但在数学上要求很高,因为它引入了弱耦合的方程系统。

### I-B 本文的主要贡献

本文通过提出一个新颖框架来解决上述挑战,该框架利用基于熵正则化的强化学习(ERRL)在具有马尔可夫体制切换的连续时间扩散模型中求解线性二次型 SDGs(LQ-SDGs)。LQ-SDGs 自其诞生以来不断发展,桥接了确定性和随机框架,并在经济学、工程学和金融学中具有应用。早期工作[30 (https://arxiv.org/html/2606.28671#bib.bib49)] 建立了确定性 LQ-SDGs,而随机扩展则引入了布朗运动,在适应策略下产生了基于 Riccati 的解。近期进展涉及跳跃扩散系统,其中[13 (https://arxiv.org/html/2606.28671#bib.bib27)] 研究了平均场切换扩散的 LQ-SDGs,[20 (https://arxiv.org/html/2606.28671#bib.bib28)] 研究了零和 LQ-SDGs,[16 (https://arxiv.org/html/2606.28671#bib.bib26)] 通过带 Lévy 过程的耦合 Riccati 方程推导了均衡策略,将结果推广到非高斯噪声,[12 (https://arxiv.org/html/2606.28671#bib.bib29)] 提供了平均场 LQ-SDGs 的闭环可解性。当代研究聚焦于平均场 LQ-SDGs[31 (https://arxiv.org/html/2606.28671#bib.bib17),2 (https://arxiv.org/html/2606.28671#bib.bib33)] 和时间不一致问题[25 (https://arxiv.org/html/2606.28671#bib.bib34)],利用倒向随机微分方程(BSDEs)和领导者-跟随者不对称性。

与本文所讨论问题密切相关的工作是[10 (https://arxiv.org/html/2606.28671#bib.bib35)],该工作建立了两种耦合形式的 HJBI 方程,并证明了这些 HJBI 方程的解不仅能够稳定系统,而且还构成了 Stackelberg 均衡策略。由于求解 HJBI 方程的困难,他们还开发了一种迭代算法并进行了仿真示例,详见[10 (https://arxiv.org/html/2606.28671#bib.bib35)]。然而,一方面,其中的受控系统没有考虑连续随机扰动和突发环境变化(即体制切换)的影响。另一方面,寻找最优策略常常导致所谓的“最优性诅咒”。正如[35 (https://arxiv.org/html/2606.28671#bib.bib36)] 所指出的,我们努力寻求最优性,但常常陷入糟糕的“最优”解,这些解要么是局部优化器,要么过于僵化而无法为错误留出余地,要么基于错误的模型。打破这种“最优性诅咒”的一种方法是通过随机化进行探索。在本文中,我们将呈现一个考虑额外布朗运动和马尔可夫体制切换的动态系统方程,并具有探索机制,以及鼓励探索的性能函数。

本文的主要贡献总结如下:

- • 通过应用 DPP,推导了用于具有马尔可夫体制切换的 SDGs 的探索性弱耦合 HJBI 方程系统。这一推导为所提出的方法奠定了严格的理论基础,同时引入了一个熵正则化项,确保所得策略在不同系统体制下保持随机性并促进探索。
- • 推导了领导者和跟随者两者的耦合分布最优策略,确保在经历结构性跳跃的随机环境中的鲁棒性和适应性。设计了一种部分模型无关的策略改进算法(PIA),用于在 ERRL 框架内近似依赖体制的值函数,增强探索和收敛。
- • 该算法整合了一种新颖的采样技术,该技术利用了扩散模型的结构,从而提高了计算效率。为了在多个离散体制间快速近似值函数,在程序设计中融入了用于高维偏微分方程(PDEs)的神经网络近似架构。

本文的其余部分组织如下。第二节 (https://arxiv.org/html/2606.28671#S2) 介绍了学习框架,包括体制切换动态,并形式化了问题。第三节 (https://arxiv.org/html/2606.28671#S3) 推导了用于 ERRL LQ-SDGs 的耦合 HJBI 方程并刻画了均衡策略。第四节 (https://arxiv.org/html/2606.28671#S4) 开发了一种 PIA 来近似值函数并计算这些策略。最后,第五节 (https://arxiv.org/html/2606.28671#S5) 提供了数值示例以展示算法收敛性、温度参数的影响,以及该框架如何避免“局部最优陷阱”。

## 符号说明

Rn\\mathbb{R}^{n} 和 Sn\\mathbb{S}^{n} 分别表示 n 维向量和对称矩阵。对于矩阵 AA,其转置、逆和迹分别为 ATA^{T}、A−1A^{-1} 和 tr(A)tr(A)。A>0A>0(A≥0A\geq 0)表示 AA 是正定(半正定)的,其平方根为 A1/2=UD1/2UTA^{1/2}=UD^{1/2}U^{T}。|⋅||\cdot| 和 ‖B‖\|B\| 分别表示绝对值和欧几里得范数。δ\delta 是变分算子,Ex,i[⋅]\mathbb{E}_{x,i}[\cdot] 是在给定状态 xx 和体制 ii 下的条件期望。对于函数 f(x)f(x),∇f(x)\nabla f(x) 和 Δf(x)\Delta f(x) 分别是其梯度和海森矩阵。最后,a∧ba\land b 是 aa 和 bb 的最小值,N(μ,Σ)\mathcal{N}(\mu,\Sigma) 表示高斯分布。

## II 问题阐述与建模

本节旨在构建具有学习的双人 LQ-SDGs 问题。为阐明目标,我们首先介绍经典的双人 Stackelberg 博弈问题。第 II-A 节 (https://arxiv.org/html/2606.28671#S2.SS1) 的内容主要来自[10 (https://arxiv.org/html/2606.28671#bib.bib35)]。为便于叙述,[10 (https://arxiv.org/html/2606.28671#bib.bib35)] 所研究的问题被称为经典双人 Stackelberg 博弈问题。

### II-A 经典双人 Stackelberg 博弈问题

考虑一个包含两个玩家的线性动态系统

dxs=(Axs+B1us+B2vs)ds,s>0dx_{s}=\left(Ax_{s}+B_{1}u_{s}+B_{2}v_{s}\right)ds,\quad s>0 (2.1)

其中 x={xs,s>0}∈Rnx=\{x_{s},s>0\}\in\mathbb{R}^{n} 是可测的系统状态,u={us,s>0}u=\{u_{s},s>0\}(分别地,v={vs,s>0}v=\{v_{s},s>0\})∈Rp\in\mathbb{R}^{p} 是玩家 I(分别地,玩家 II)的策略,B1B_{1} 和 B2B_{2} 是维度兼容的矩阵。玩家 I 是领导者,占据主导地位,使其能够预期玩家 II 的响应并首先做出决策 uu。接下来,玩家 II(跟随者)观察 uu 并以动作 vv 响应。给定此决策结构,每个玩家的性能函数定义为

Jkcl(x,u,v)=∫0∞rk(xs,us,vs)ds,k=1,2,J^{cl}_{k}(x,u,v)=\int_{0}^{\infty}r_{k}(x_{s},u_{s},v_{s})\,ds,\quad k=1,2, (2.2)

其中

r1(x,u,v)=xTQ1x+(u+θ1v)TR1(u+θ1v),r_{1}(x,u,v)=x^{T}Q_{1}x+(u+\theta_{1}v)^{T}R_{1}(u+\theta_{1}v),r2(x,u,v)=xTQ2x+(v+θ2u)TR2(v+θ2u),r_{2}(x,u,v)=x^{T}Q_{2}x+(v+\theta_{2}u)^{T}R_{2}(v+\theta_{2}u),

且 Qk≥0,Rk>0Q_{k}\geq 0,R_{k}>0,以及 θk∈(0,1)\theta_{k}\in(0,1),k=1,2k=1,2。

分别用 Ucl\mathcal{U}_{cl} 和 Vcl\mathcal{V}_{cl} 表示两个玩家的可允许策略集,满足

1. (i) ∫0t‖us‖2ds<∞\int_{0}^{t}\|u_{s}\|^{2}ds<\infty,∫0t‖vs‖2ds<∞\int_{0}^{t}\|v_{s}\|^{2}ds<\infty,∀t≥0\forall t\geq 0;
2. (ii) 对于由 (2.1) 确定的 {xs,s≥0}\{x_{s},s\geq 0\},∫0∞|rk(xs,us,vs)|ds<∞\int_{0}^{\infty}|r_{k}(x_{s},u_{s},v_{s})|ds<\infty,k=1,2k=1,2。

###### 定义 1

玩家 II 和玩家 I 的经典值函数分别定义为

V2cl(x;u)=minv∈Vcl⁡J2cl(x,u,v)V^{cl}_{2}(x;u)=\min_{v\in\mathcal{V}_{cl}} J^{cl}_{2}(x,u,v)

相似文章

重新思考LLM强化学习中的散度正则化

Hugging Face Daily Papers

本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。

Big 2中不完美信息下的自我对弈强化学习

arXiv cs.LG

本文提出了一个针对四人制不完美信息纸牌游戏Big 2的自我对弈强化学习框架,比较了策略梯度和基于价值的方法,并发现带有熵正则化的PPO优于其他方法。