对抗不确定性下的态势与维持优化
摘要
本文提出了一种面向军事资产分配的场景加权对抗鲁棒态势优化引擎,提出了CEV和RobustCEV优化器,在对抗性威胁不确定性下优于贪婪基线方法。
arXiv:2608.05256v1 公告类型:新
摘要:预先承诺态势(Pre-commitment posture),即在冲突情景明朗之前将军事资产分配到战区位置,是联合作战规划中一个关键且尚未形式化解决的问题。当前实践依赖贪婪启发式方法,这些方法最大化价值而忽视地理覆盖,并且在结构上容易受到以高战略价值地点为目标的对手的攻击。本文提出了一种面向态势与维持分配(PSA)问题的场景加权对抗鲁棒态势优化引擎,该问题被建模为关于资产、战区位置和时间步长的有限时域马尔可夫决策过程。我们引入了复合期望值(CEV)优化器,它通过在威胁情景分布上最大化场景加权的预期态势效率来配置资产,以及RobustCEV扩展,它与一个贝叶斯对手进行迭代,该对手根据观测到的部署更新其目标分布。在印度洋-太平洋基地环境中进行的三个实验中,涉及20个资产和5个战区位置,我们证明:(1)贪婪基线因地理覆盖不足而遭受永久性的25.1%态势效率损失,并在价值相关的对抗性威胁下出现57.3%的场景加权战备崩溃;(2)当威胁分布带有地理信号时,CEV优化器相对于贪婪方法最多可恢复19.8%的效率,且精心挑选的5至20个情景足以捕获大部分收益;(3)当自适应对手采用欺骗性威胁先验时,RobustCEV扩展相对于朴素优化器最多可恢复158%的效率。所有发现均通过配对t检验(Bonferroni校正)和两层方差分解进行验证,证实所报告的性能差距是部署策略的结构性属性,而非抽样伪影。
查看缓存全文
缓存时间: 2026/08/07 07:46
# 对抗不确定性下的态势部署与持续保障优化
来源:https://arxiv.org/html/2608.05256
###### 摘要
预先承诺态势部署,即在冲突场景明朗之前将军事资产分配到战区位置,是联合作战规划中一个关键但尚未正式解决的问题。当前实践依赖于最大化价值而忽视地理覆盖的贪婪启发式方法,且这类方法在结构上容易受到针对高战略价值地点进行打击的对手的攻击。本文提出了一种面向态势与持续保障分配(PSA)问题的场景加权对抗鲁棒态势优化引擎,该问题被建模为覆盖资产、战区位置和时间步的有限时域马尔可夫决策过程。我们引入了复合期望值(CEV)优化器,通过最大化威胁场景分布上的场景加权期望态势效率来部署资产;以及RobustCEV扩展,它通过与一个根据观察到的部署情况更新其打击目标的贝叶斯对手进行迭代对抗。在包含20个资产和5个战区位置的印太基地环境中进行的三项实验中,我们证明:(1)贪婪基线因地理覆盖不足而遭受永久性的25.1%态势效率损失,并在价值相关对抗威胁下出现57.3%的场景加权战备度崩溃;(2)当威胁分布携带地理信号时,CEV优化器相比贪婪方法最多可恢复19.8%的效率,且精选的5到20个场景足以捕获该收益的大部分;(3)当自适应对手采用欺骗性威胁先验时,RobustCEV扩展相比朴素优化器最多可恢复158%的效率。所有发现均通过配对t检验(Bonferroni校正)和两级方差分解进行验证,确认所报告的性能差距是部署策略的结构性属性,而非采样伪影。
###### 目录
1. [1引言](#S1) 2. [2问题建模](#S2)1. [2.1 MDP定义](#S2.SS1) 2. [2.2与相关决策问题的区别](#S2.SS2) 3. [3相关工作](#S3) 4. [4技术方法](#S4)1. [4.1场景引擎](#S4.SS1) 2. [4.2核心优化器](#S4.SS2) 3. [4.3警报等级与配置模式表示](#S4.SS3) 4. [4.4人机协同接口](#S4.SS4) 5. [5实验1:贪婪基线特征分析](#S5)1. [5.1动机](#S5.SS1) 2. [5.2实验设置](#S5.SS2) 3. [5.3贪婪部署算法](#S5.SS3) 4. [5.4性能指标](#S5.SS4) 5. [5.5结果](#S5.SS5)1. [5.5.1逐步指标](#S5.SS5.SSS1) 2. [5.5.2与随机部署的比较](#S5.SS5.SSS2) 3. [5.5.3威胁环境敏感性](#S5.SS5.SSS3) 6. [5.6讨论](#S5.SS6) 6. [6实验2:场景加权优化器 vs. 贪婪基线](#S6)1. [6.1动机](#S6.SS1) 2. [6.2实验设置](#S6.SS2) 3. [6.3 CEV优化器](#S6.SS3) 4. [6.4结果](#S6.SS4) 5. [6.5讨论](#S6.SS5) 7. [7实验3:对抗鲁棒性与贝叶斯反制模型](#S7)1. [7.1动机](#S7.SS1) 2. [7.2对抗模型](#S7.SS2) 3. [7.3实验设置](#S7.SS3) 4. [7.4结果](#S7.SS4)1. [7.4.1欺骗性先验:核心鲁棒性结果](#S7.SS4.SSS1) 2. [7.4.2均匀和偏斜先验下的零结果](#S7.SS4.SSS2) 3. [7.4.3对抗性先验:部分收敛失败](#S7.SS4.SSS3) 5. [7.5讨论](#S7.SS5) 8. [8实验4:计算可行性与鲁棒性-成本帕累托前沿](#S8)1. [8.1动机](#S8.SS1) 2. [8.2 A部分:计算可扩展性](#S8.SS2)1. [8.2.1设置](#S8.SS2.SSS1) 2. [8.2.2结果](#S8.SS2.SSS2) 3. [8.3 B部分:鲁棒性-成本帕累托前沿](#S8.SS3)1. [8.3.1设置](#S8.SS3.SSS1) 2. [8.3.2结果](#S8.SS3.SSS2) 4. [8.4讨论](#S8.SS4) 9. [9实验5:双战区案例研究与敏感性分析](#S9)1. [9.1动机](#S9.SS1) 2. [9.2实验设置](#S9.SS2) 3. [9.3 A部分:跨战区基线比较](#S9.SS3) 4. [9.4 B部分:敏感性分析](#S9.SS4)1. [9.4.1 Wasserstein半径扫描](#S9.SS4.SSS1) 2. [9.4.2场景权重扰动下的部署稳定性](#S9.SS4.SSS2) 5. [9.5 C部分:A2/AD对抗区域半径扫描](#S9.SS5) 6. [9.6讨论](#S9.SS6) 10. [10统计分析](#S10) 11. [11讨论](#S11)1. [11.1反对贪婪规划的渐进式论据](#S11.SS1) 2. [11.2将实验结果与OE公理联系起来](#S11.SS2) 3. [11.3对场景库设计的实践启示](#S11.SS3) 4. [11.4鲁棒性结果的范围与局限](#S11.SS4) 5. [11.5与先前工作的关系](#S11.SS5) 6. [11.6未来方向](#S11.SS6) 12. [参考文献](#bib)
## 1引言
现代联合作战要求在威胁显现*之前*就部署好资产。预先承诺态势部署:在潜在冲突发生前数天或数周将飞机、弹药、后勤和支援资产分配到战区位置,决定了指挥官在局势演变时拥有哪些选项。然而,当前规划实践主要依赖基于规则的、价值最大化的启发式方法:将最多的资产放置在最高优先级的基地。这种方法在计算上易于处理且可解释,但在战略上很脆弱。观察到可预测集中的对手可以针对它进行打击;忽视威胁异质性的规划者会被突如其来的威胁打个措手不及。态势与持续保障分配(PSA)问题在作战层面尚未得到正式解决。现代作战环境(OE)的五条公理共同使得静态和贪婪方法变得不足:(1)*威胁非平稳性*:对手的打击目标分布会随着可观察的防御方态势变化而转移;(2)*多域耦合*:一个域的态势会在其他域制造脆弱性或机会;(3)*部署不可逆性*:初始分配所承诺的资产在火力下重新定位代价高昂且耗时;(4)*信息不对称*:防御方对对手的能力和意图了解不完整;(5)*持续保障时间紧迫性*:战备度会持续下降,且无法瞬时恢复。每一条公理单独都会降低贪婪或静态计划的质量;综合起来,它们需要一个具有场景意识、对抗鲁棒性,并显式建模退化-修复循环的决策支持引擎。本文提出了一个用于PSA问题的场景加权、对抗鲁棒的态势优化引擎,并通过三项实验证明了其相对于贪婪基线的优越性。我们的贡献是:
1. 1. PSA问题在M个资产、N个战区位置和T个时间步上的正式MDP模型,并采用一个复合态势效率指标,同时奖励战备度、地理覆盖和成本效率(第2节)。
2. 2. 一个复合期望值(CEV)优化器,在威胁场景分布上部署资产,当威胁分布携带地理信号时,相比贪婪基线最多可实现19.8%的效率提升(实验2)。
3. 3. 一个贝叶斯反制模型,其中自适应对手根据观察到的部署情况更新其打击目标分布,以及一个能收敛到稳定均衡的RobustCEV扩展,在欺骗性威胁先验下相比朴素优化器最多可恢复158%的效率(实验3)。
4. 4. 通过配对t检验(Bonferroni校正)和两级方差分解对所有发现进行统计验证,确认所报告的性能差距是结构性的而非采样伪影(第10节)。
PSA模块在任务分配调度(SBC)和传感器融合任务分配(ISU)的上游运行:它决定资产在任务分配之前所处的位置,建立了下游规划者运作所依赖的能力包络。
## 2问题建模
### 2.1 MDP定义
我们将PSA建模为一个有限时域马尔可夫决策过程M=(S,U,P,R,T)\mathcal{M}=(\mathcal{S},\mathcal{U},P,R,T),涉及|A0||\mathcal{A}_{0}|个资产、|L||\mathcal{L}|个战区位置和TT个离散时间步。
##### 状态空间。每个资产a∈A0a\in\mathcal{A}_{0}由一个元组(ra,la,ma,da,qa)(r_{a},\,\ell_{a},\,m_{a},\,d_{a},\,q_{a})描述,其中ra∈[0,1]r_{a}\in[0,1]是战备率,la∈L\ell_{a}\in\mathcal{L}是当前位置分配,ma∈{Dormant,Active}m_{a}\in\{\textsc{Dormant},\textsc{Active}\}是配置模式,da∈Z≥0d_{a}\in\mathbb{Z}_{\geq 0}是维护计时器(距离下次计划维护的天数),qa∈Z>0q_{a}\in\mathbb{Z}_{>0}是资产数量。联合状态为st={(rat,lat,mat,dat,qat)}a∈A0∈Ss_{t}=\{(r_{a}^{t},\,\ell_{a}^{t},\,m_{a}^{t},\,d_{a}^{t},\,q_{a}^{t})\}_{a\in\mathcal{A}_{0}}\in\mathcal{S}。
##### 动作空间。在每个时间步,规划者为每个资产从U={Reposition,Resupply,Maintain,Hold}\mathcal{U}=\{\textsc{Reposition},\,\textsc{Resupply},\,\textsc{Maintain},\,\textsc{Hold}\}中选择一个持续保障动作。Reposition以成本κ=10
\kappa=10将资产移动到新位置;Resupply以成本κ=5
\kappa=5使数量qa←qa+2q_{a}\leftarrow q_{a}+2;Maintain以成本κ=2
\kappa=2将战备度恢复为ra←min(1,ra+0.20)r_{a}\leftarrow\min(1,\,r_{a}+0.20);Hold以零成本保持资产不变。初始部署(所有aa的分配la0\ell_{a}^{0})是独立的第一阶段决策,如第4节所讨论。
##### 转移动态。在每个步骤中,资产战备度随机退化:rat+1=max(0,rat−δat),δat∼U(0,δmax),r_{a}^{t+1}=\max\left(0,\;r_{a}^{t}-\delta_{a}^{t}\right),\qquad\delta_{a}^{t}\sim\mathcal{U}(0,\,\delta_{\max}),(1)其中δmax=0.10
\delta_{\max}=0.10,除非另有说明。维护计时器每步递减一,并在执行Maintain动作时重置为U(30,90)\mathcal{U}(30,90)。
##### 奖励。每步奖励是*态势效率*:R(st,ut)=Et=Rt⋅Ctlog(Kt+2),R(s_{t},u_{t})\;=\;E_{t}\;=\;\frac{R_{t}\cdot C_{t}}{\log(K_{t}+2)},(2)其中RtR_{t}、CtC_{t}和KtK_{t}分别是公式(7)–(9)中定义的战备度得分、覆盖得分和持续保障成本。对数分母以递减的边际敏感性惩罚持续保障支出,反映了额外维护资源边际回报递减的特性[9]。
### 2.2与相关决策问题的区别
PSA在时间尺度和抽象层级上不同于两个相邻的规划模块。*调度器*(SBC)在数小时到数天的滚动时域内将已部署的资产分配到特定任务,并将固定态势作为输入。*ISU*传感器融合模块从多INT数据源近实时更新威胁估计,且不具备资产部署权限。PSA决定了SBC和ISU所继承的态势,因此必须考虑它们将面临的完整场景分布。糟糕的预先承诺态势无法被下游规划者以反应式方式纠正,除非付出高昂的重新定位成本[11]。
## 3相关工作
##### JADC2条令与AI能力差距。Lingel等人[7]提供了关于人工智能在联合全域指挥控制(JADC2)周密规划中适用位置的权威RAND框架。该报告为空军撰写,建立了JADC2中AI应用的分类体系,并将任务前规划阶段——具体而言,在多域、多梯队部队结构下进行不确定性资产分配——确定为AI决策支持的最高杠杆点。这正是PSA的运行机制:规划者必须在场景明朗之前、在压缩人类认知带宽的时间线上将资产承诺到战区位置。在此引用JADC2条令并非装饰;它将PSA定位为公认的能力差距,而非人造基准问题。
##### 持续保障的含义及其为何必须是动态的。国防分析研究所将持续保障定义为“后勤生态系统各部分协同工作,确保每个平台准备就绪以执行其任务”,涵盖训练、测试、升级和备件采购[5]。这一定义范围直接支撑了我们MDP中的四种动作类型(Reposition、Resupply、Maintain、Hold):每种都对应国防条令中公认的不同持续保障功能。一种军事资产和资源规划的决策支持方法[3]形式化了任何充分持续保障模型必须捕获的反馈循环:资源决策驱动持续保障行动,进而驱动战备结果,再反过来约束可用的部队选项。其因果循环图框架精确解释了贪婪基线为何失败——它们优化的是时间点上的战略价值,而没有建模决定资产在若干时间步后是否仍保持作战可用性的延迟退化效应。我们的状态空间(战备率、维护计时器、资产数量)正是围绕这一因果链设计的。
##### 部署节奏与随相似文章
立场论文:决策引擎中的求解后鲁棒性:扰动下的可行区域与平滑性
立场论文:主张为MILP决策引擎增加一个求解后鲁棒性层,形式化扰动下的可行邻域和解的平滑性,并呼吁采用经过认证的内部近似和对抗鲁棒性裕度。
鲁棒峰值成本约束强化学习
本文研究了鲁棒峰值成本约束强化学习,通过控制轨迹上的最大成本并考虑动态不确定性来解决标准CMDP的局限性。作者表明零对偶间隙可能不成立,并提出了一种基于鲁棒值估计的替代优化框架。
鲁棒性遇上不确定性:面向鲁棒选择性分类的证据对抗训练
本文介绍了一种名为证据对抗训练(EV-AT)的方法,通过结合基于证据的损失与鲁棒证据对齐,改善了分类器的鲁棒性-不确定性权衡,在选择性分类基准上取得了最先进的结果。
效用约束策略优化
本文介绍了一种简单而强大的方法,用于效用约束马尔可夫决策过程(UCMDPs),该方法无需预先固定约束界限即可实现风险敏感约束,在Safety Gymnasium基准测试中优于基线方法。
Smart predict-then-robustly-optimize
本文提出了一种鲁棒化的智能预测-然后-优化变体,该变体考虑了特征扰动的影响,提供了一个具有理论保证的凸替代函数,并展示了相较于标准方法的优越性能。