熵正则化强化学习在机制切换跳扩散过程中的零和随机微分博弈

arXiv cs.LG 论文

摘要

本文针对机制切换跳扩散过程中的零和随机微分博弈,提出了一种熵正则化强化学习框架,推导了HJBI方程和演员-评论家算法,并将其应用于投资博弈。

arXiv:2606.28669v1 公告类型:新 摘要:为应对传统随机微分博弈(SDG)框架中的参数错误设定和环境突然结构性变化,本文引入了一种分布控制方法,将最优策略表征为作用于连续状态、离散机制状态和参数上的概率分布。这构成了机制切换跳扩散过程中熵正则化零和随机微分博弈(ERRL-ZSSDGs)的强化学习框架。利用动态规划原理(DPP),我们推导了相关的耦合哈密尔顿-雅可比-贝尔曼-伊萨克斯(HJBI)方程组,从中通过价值函数的梯度表达均衡策略。对于线性二次型问题,通过求解常微分方程组(ODEs)可获得价值函数和均衡策略的半解析解。在更一般的情况下,开发了一种演员-评论家策略改进算法,以近似不同机制下的价值函数和均衡策略。该方法应用于投资博弈,数值示例说明了温度参数和机制转换对最优策略和价值的影响。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:28

# 熵正则化强化学习用于状态切换跳扩散过程中的零和随机微分博弈  
来源:https://arxiv.org/html/2606.28669  

\[1\]\\fnm林\\sur徐 \[1\]\\orgdiv数学与统计学院,\\orgname安徽师范大学,\\orgaddress\\city芜湖,\\postcode241002,\\state安徽,\\country中国  
\[2\]\\orgdiv精算学与商业分析系,\\orgname麦考瑞大学,\\orgaddress\\city悉尼,\\postcode2109,\\state新南威尔士州,\\country澳大利亚  
\[3\]\\orgdiv统计学院,KLATASDS-MOE,中国包容性老龄化金融研究中心,\\orgname华东师范大学,\\orgaddress\\city上海,\\postcode200062,\\state上海,\\country中国  

###### 摘要  
为了解决传统随机微分博弈(SDG)框架中的参数误设定和突发结构性环境变化,本文引入了一种分布式控制方法,将最优策略刻画为基于连续状态、离散状态和参数的动作概率分布。这构成了一个用于状态切换跳扩散过程中熵正则化零和随机微分博弈(ERRL-ZSSDGs)的强化学习框架。利用动态规划原理(DPP),我们推导了相应的耦合Hamilton-Jacobi-Bellman-Isaacs(HJBI)方程组,从中通过值函数的梯度得到均衡策略。对于线性二次问题,通过求解一组耦合常微分方程(ODEs),得到了值函数和均衡策略的半解析解。在更一般的设定下,开发了一种Actor-Critic策略改进算法,用于近似不同状态下的值函数和均衡策略。该方法应用于一个投资博弈,数值算例展示了温度参数和状态转换对最优策略和值的影响。  

###### 关键词: 随机微分博弈,强化学习,状态切换,跳扩散,熵正则化。  

## 1 引言  
随机微分博弈(SDGs)为在受随机性和结构性变化影响的动态环境中建模涉及多个智能体的决策过程提供了数学框架。这些博弈通常通过随机微分方程(SDEs)来刻画,该方程描述了系统状态在确定性和随机力共同作用下随时间演化的过程。SDGs常用于智能体具有冲突或合作目标且环境引入不确定性的场景。过去几十年,SDGs的研究文献迅速增长,涉及模型构建与理论分析(\[moon2018Risk\],\[lv2023linear\])、数值方法(\[Kushner2004numerical\],\[song2008numerical\])以及在工业(\[yeung2008cooperative\],\[song2023decision\])、保险(\[jin2013optimal\],\[wang2021stochastic\])、经济与管理(\[dockner2000differential\],\[savku2022stochastic\])中的应用。  

零和随机微分博弈(ZSSDGs)是SDGs的一个特例,其中所有参与者的总收益为零,即一个参与者的收益完全被另一个参与者的等额损失所平衡。该框架代表了参与者利益严格对抗且总收益或损失保持不变的场景。近年来,多篇论文聚焦于ZSSDGs的理论研究。例如,\[li2012saddle\]建立了时间依赖离散马尔可夫零和博弈中鞍点存在的充分条件,直至指定的停时。\[lv2020two\]证明了ZSSDG的值函数与相应Hamilton-Jacobi-Bellman-Isaacs(HJBI)方程的粘性解之间的等价性。\[lv2024solving\]研究了状态切换模型中的一类零和停时博弈。除了这些理论进展,鉴于ZSSDGs在各领域的广泛应用,其研究一直非常活跃且成果丰硕。例如,在风险管理中,\[patil2023risk\]通过路径积分控制考虑了风险最小化的ZSSDG;\[guan2016stochastic\]应用ZSSDG框架分析两个固定缴费(DC)养老金计划之间的相互作用。  

迄今为止,大多数研究假设受控系统的参数是常数或系统的确定性函数。在反馈控制框架内,最优策略依赖于模型参数、当前系统状态和反馈控制函数。然而,在实际应用中,这些系统参数必须进行估计。由于数据不准确、方法错误或宏观经济结构的突然变化(状态转换),这些参数的有效性可能受损。这引入了诸如估计误差、无法适应新环境状态或在寻找最优策略过程中将局部优化器识别为全局优化器等风险。为了应对这些挑战,我们开发了一个利用强化学习(RL)确定SDG中最优策略的新框架。RL本质上平衡了探索与利用,从而规避局部最优并适应动态环境。这种平衡允许在探索新动作和利用现有信息最大化回报之间进行权衡。通过持续尝试多样化策略,算法避免了陷入局部最优。然而,RL智能体数值设计中的一个重大挑战是它们倾向于不充分地探索不同状态,这可能阻碍发现更优策略。为了克服这一点,我们旨在将策略网络的输出概率分布到多种动作上,赋予非零概率以增强探索。熵量化了这种概率分布的分散程度:低熵表示集中,高熵表示更大的随机性。决策者寻求高熵策略以实现更快的探索。这种探索范式已广泛应用于各个领域。\[wang2020reinforcement\]率先将该方法应用于连续时间和空间中的随机控制问题。此外,\[wang2020continuous\]和\[dai2023learning\]在强化学习框架下考虑了均值-方差问题。\[firoozi2022exploratory\]和\[guo2022entropy\]讨论了平均场博弈的熵正则化。\[hao2022entropy\],\[sun2023reinforcement\]将熵正则化RL框架引入SDG研究,而Huang2025convergence分析了熵正则化控制问题策略迭代的收敛性。然而,先前讨论的最优控制问题主要由纯布朗运动驱动,并已通过RL的视角进行了广泛研究。最近,\[gao2024reinforcement\]研究了具有跳扩散过程的RL模型,为线性二次调节器(LQR)问题提供了最优探索解。  

本文整合了RL的最新进展,并在状态切换跳扩散模型下的RL框架内构建了一个ZSSDG。通过将连续时间马尔可夫链与跳扩散过程相结合,我们的模型同时捕捉了离散尾部事件(跳跃)和持续性宏观经济或环境结构性变化(状态)。事实上,本文主要有三大贡献。第一,本文通过将RL融入状态切换跳扩散框架,推进了ZSSDG的理论和数值理解。不同于假设常数或仅依赖于状态的参数的传统方法,我们的工作通过引入一种新颖的分布式控制机制,解决了固有的不确定性、估计误差和结构变化。该机制确保双方参与者的最优策略由依赖于连续状态、当前离散状态和系统参数的概率分布刻画,而非确定性函数。第二,我们为双方参与者建立了一个探索性状态切换ZSSDG框架,并将其应用于两个问题。该框架不仅增强了RL中的探索-利用权衡,还降低了在不同市场状态下收敛到局部最优的风险。第三,尽管状态切换效应已越来越多地被纳入各种控制和博弈论设定中\[song2008numerical,Kushner2004numerical,gruen2012probabilistic,Huang2025convergence,feng2021optimal,Nguyen2021general,chen2022stochastic,gutierrez2024markovian\],但依赖状态的结构性变化在现实经济、金融和工程动力系统中普遍存在\[jin2013optimal,lv2024solving\]。状态切换导致系统的漂移、扩散和跳跃强度根据外部环境或内部状态发生离散转换,本质上是引入了额外的随机结构和模态依赖特性。在跳扩散和探索性RL框架内,状态切换进一步使模型复杂化:一方面,切换机制本身是随机且时变的,使其与传统的参数估计和策略优化方法不相容;另一方面,三种不确定性,即状态切换、跳跃行为和随机化探索,相互耦合,打破了经典扩散模型中矩平均和策略探索构建的逻辑,并直接使原始的探索动力学建模方法失效。  

本文的结构如下。第2节(https://arxiv.org/html/2606.28669#S2)构建了在包含学习过程的状态切换跳扩散模型下ZSSDG的理论框架。第4节(https://arxiv.org/html/2606.28669#S4)将所提框架应用于状态切换线性二次ZSSDG问题。第3节(https://arxiv.org/html/2606.28669#S3)设计了一种Actor-Critic RL算法以求解一般情况下的ZSSDG问题。第5节(https://arxiv.org/html/2606.28669#S5)将该算法应用于一个状态切换投资博弈。最后,第6节(https://arxiv.org/html/2606.28669#S6)总结全文。  

**记号**:R\+\\mathbb\{R\}^\{\+\}表示正实数,RKd:=\{x∈Rd:\|x\|≤K\}\\mathbb\{R\}\_\{K\}^\{d\}:=\\\{x\\in\\mathbb\{R\}^\{d\}:\\lvert x\\rvert\\leq K\\\}。设Rk×l\\mathbb\{R\}^\{k\\times\\ell\}为实k×lk\\times\\ell矩阵空间。对于矩阵AA,A⊤A^\{\\top\}为其转置,\|A\|\\lvert A\\rvert为其Frobenius范数,A2=AA⊤A^\{2\}=AA^\{\\top\},A∘B=tr\(AB⊤\)A\\circ B=\\mathrm\{tr\}\(AB^\{\\top\}\),A1/2A^\{1/2\}为半正定矩阵的平方根。对于函数ff,fxf\_\{x\}和fxxf\_\{xx\}分别表示一阶和二阶偏导数。符号Et,x,i\[⋅\]\\mathbb\{E\}\_\{t,x,i\}\[\\cdot\]表示给定Xt=xX\_\{t\}=x,θt=i\\theta\_\{t\}=i时的条件期望。对于a,b∈Ra,b\\in\\mathbb\{R\},a∧b=min⁡\{a,b\}a\\wedge b=\\min\\\{a,b\\\}。符号δ\\delta表示变分算子。最后,U\(B\)U\(B\)表示BB上的均匀分布,N\(μ,Σ\)\\mathcal\{N\}\(\\mu,\\Sigma\)表示高斯分布,Φ\\Phi表示N\(0,1\)\\mathcal\{N\}\(0,1\)的累积分布函数。  

## 2 问题构建与公式化  
本节为包含学习的状态切换跳扩散模型下的ZSSDG开发数学框架。为便于比较有学习与无学习的情况,我们采用\[biswas2012zero\]引入的跳扩散ZSSDG作为基准,该基准在2.1小节(https://arxiv.org/html/2606.28669#S2.SS1)中概述。然后,2.2小节(https://arxiv.org/html/2606.28669#S2.SS2)介绍纯扩散受控系统的ERRL框架构建,讨论将其扩展到具有跳跃和状态切换的系统时所面临的挑战,并提出应对这些挑战的方法。最后,2.3小节(https://arxiv.org/html/2606.28669#S2.SS3)给出带有ERRL的ZSSDG的集成模型。  

### 2.1 状态切换跳扩散模型中的经典ZSSDG  
对于固定的正常数TT和t∈\[0,T\]t\\in\[0,T\],设\(Ωt,Ft,\{Ft,s\}t≤s≤T,Pt\)\\left\(\\Omega\_\{t\},\\mathcal\{F\}\_\{t\},\\\{\\mathcal\{F\}\_\{t,s\}\\\}\_\{t\\leq s\\leq T\},\\mathbb\{P\}\_\{t\}\\right\)为一个满足通常条件的带滤概率空间。设θ=\{θs,t≤s≤T\}\\theta=\\\{\\theta\_\{s\},t\\leq s\\leq T\\\}为该概率空间上的一个连续时间马尔可夫链,取值于有限状态空间S=\{1,2,...,m\}\\mathcal\{S\}=\\\{1,2,\\ldots,m\\\},代表状态。该马尔可夫链的生成元矩阵定义为Q=\(qij\)m×mQ=\(q\_\{ij\}\)\_\{m\\times m\},其中qij≥0q\_\{ij\}\\geq 0(i≠ji\\neq j)表示从状态ii到状态jj的转移速率,满足qii=−∑j=1,j≠imqijq\_\{ii\}=\-\\sum\_\{j=1,j\\neq i\}^\{m\}q\_\{ij\}。ZSSDG定义在\(Ωt,Ft,\{Ft,s\}t≤s≤T,Pt\)\\left\(\\Omega\_\{t\},\\mathcal\{F\}\_\{t\},\\\{\\mathcal\{F\}\_\{t,s\}\\\}\_\{t\\leq s\\leq T\},\\mathbb\{P\}\_\{t\}\\right\)上,包含以下受控SDE:  

\{dXs=b\(s,Xs,θs;ys,zs\)ds\+σ\(s,Xs,θs;ys,zs\)dWs\+∫Eη\(s,Xs−,θs−;ys,zs;w\)N~\(ds,dw\),s∈\(t,T\],Xt=x,θt=i,\\left\\\{\\begin\{array\}\[\]\{ll\}dX\_\{s\}=b\(s,X\_\{s\},\\theta\_\{s\};y\_\{s\},z\_\{s\}\)ds\+\\sigma\(s,X\_\{s\},\\theta\_\{s\};y\_\{s\},z\_\{s\}\)dW\_\{s\}\\\\ \\qquad\\quad\+\\displaystyle\\int\_\{E\}\\eta\(s,X\_\{s\{\-\}\},\\theta\_\{s\{\-\}\};y\_\{s\},z\_\{s\};w\)\\tilde\{N\}\(ds,dw\),\\,s\\in\(t,T\],\\\\ X\_\{t\}=x,\\quad\\theta\_\{t\}=i,\\end\{array\}\\right\.\(1\)  

以及支付函数:  

Jcl\(t,x,i;y,z\)=Et,x,i\[∫tTr\(s,Xs,θs;ys,zs\)ds\+g\(XT,θT\)\],J^\{cl\}\(t,x,i;y,z\)=\\mathbb\{E\}\_\{t,x,i\}\\left\[\\int\_\{t\}^\{T\}r\(s,X\_\{s\},\\theta\_\{s\};y\_\{s\},z\_\{s\}\)ds\+g\(X\_\{T\},\\theta\_\{T\}\)\\right\],\(2\)  

其中  
b:\\displaystyle b:\[0,T\]×Rd×S×Y×Z→Rd,E:=Rl∖\{0\},\\displaystyle\[0,T\]\\times\\mathbb\{R\}^\{d\}\\times\\mathcal\{S\}\\times\\mathcal\{Y\}\\times\\mathcal\{Z\}\\rightarrow\\mathbb\{R\}^\{d\},\\quad E=\\mathbb\{R\}^\{\\ell\}\\setminus\\\{0\\\},  
σ:\\displaystyle\\sigma:\[0,T\]×Rd×S×Y×Z→Rd×k,\\displaystyle\[0,T\]\\times\\mathbb\{R\}^\{d\}\\times\\mathcal\{S\}\\times\\mathcal\{Y\}\\times\\mathcal\{Z\}\\rightarrow\\mathbb\{R\}^\{d\\times k\},  
η:\\displaystyle\\eta:\[0,T\]×Rd×S×Y×Z×Rl→Rd×l,\\displaystyle\[0,T\]\\times\\mathbb\{R\}^\{d\}\\times\\mathcal\{S\}\\times\\mathcal\{Y\}\\times\\mathcal\{Z\}\\times\\mathbb\{R\}^\{\\ell\}\\rightarrow\\mathbb\{R\}^\{d\\times\\ell\},  
r:\\displaystyle r:\[0,T\]×Rd×S×Y×Z→R,g:Rd×S→R,\\displaystyle\[0,T\]\\times\\mathbb\{R\}^\{d\}\\times\\mathcal\{S\}\\times\\mathcal\{Y\}\\times\\mathcal\{Z\}\\rightarrow\\mathbb\{R\},\\quad g:\\mathbb\{R\}^\{d\}\\times\\mathcal\{S\}\\rightarrow\\mathbb\{R\},  
yy和zz是两个可预测控制过程,分别取值于紧度量空间Y⊆Rn1\\mathcal\{Y\}\\subseteq\\mathbb\{R\}^\{n1\}和Z⊆Rn2\\mathcal\{Z\}\\subseteq\\mathbb\{R\}^\{n2\}。WsW\_\{s\}是\(Ωt,Ft,\{Ft,s\}t≤s≤T,Pt\)\\left\(\\Omega\_\{t\},\\mathcal\{F\}\_\{t\},\\\{\\mathcal\{F\}\_\{t,s\}\\\}\_\{t\\leq s\\leq T\},\\mathbb\{P\}\_\{t\}\\right\)上的kk维布朗运动。此外,N\(ds,dw\):=\(N1\(ds,dw1\),⋯,Nl\(ds,dwl\)\)⊤N\(ds,dw\):=\(N\_\{1\}\(ds,dw\_\{1\}\),\\cdots,N\_\{\\ell\}\(ds,dw\_\{\\ell\}\)\)^\{\\top\}是\[0,T\]×E\[0,T\]\\times E上的泊松随机测度,其强度测度为ν

相似文章

熵正则化演员-评论家方法的精细分析

arXiv cs.LG

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。

从离散到连续:连续环境中神经强化学习的动力学

arXiv cs.LG

本文提出了一个用于连续环境中深度强化学习的理论框架,利用随机控制理论将其建模为连续时间随机过程。作者刻画了在两层网络无限宽极限下的演员-评论家算法的动力学,并推导了一个在极小的学习率下状态分布无穷小变化的方程。