针对可学习观察者的重复欺骗路径规划

arXiv cs.AI 论文

摘要

本文提出了重复欺骗路径规划(RDPP)以及一种名为欺骗元规划(DeMP)的新框架,使智能体能够在面对会随时间学习并适应的观察者的情况下维持欺骗能力。

arXiv:2605.07174v1 公告类型:新论文 摘要:我们研究了欺骗性路径规划(DPP)问题,其中智能体的目标是向外部观察者隐瞒其真实目的地。尽管现有工作假设观察者是静态且不可学习的,但现实世界中的对手——如在关键货物运输或军事行动中——能够通过从历史轨迹中学习来适应。为了填补这一空白,我们引入了重复欺骗性路径规划(RDPP),这是一种明确建模可学习观察者的新公式化方法。我们表明,在此设定下,现有的DPP方法会失效,因为它们无法适应不断变化的对抗性预测。虽然将观察者的先前预测纳入更新能够实现一定的适应性,但这种增量式更新会导致累积延迟,从而降低欺骗效果。为此,我们提出了欺骗元规划(DeMP),这是一种双层优化框架,结合了回合级适应(通过短期策略调整来应对更新后的观察者)和元级更新(利用跨回合反馈来捕捉观察者如何更新其模型,并加速未来回合中的适应)。通过这种方式,DeMP减轻了适应延迟的累积,使得在面对可学习观察者时能够持续进行欺骗。在不同环境下的实验表明,DeMP在RDPP任务中显著优于现有方法,同时保持了具有竞争力的路径成本。我们的研究结果强调了在与可学习的对手进行重复互动时建模的重要性,为多智能体系统中的欺骗与隐私问题提供了新的见解。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:14

# 针对可学习观察者的重复欺骗路径规划

来源: https://arxiv.org/html/2605.07174
\setcopyright

ifaamas\@printcopyrighttrue\acmConference\[AAMAS ’26\]Proc\. of the 25th International Conference on Autonomous Agents and Multiagent Systems \(AAMAS 2026\)May 25 – 29, 2026 Paphos, CyprusC\. Amato, L\. Dennis, V\. Mascardi, J\. Thangarajah \(eds\.\)\copyrightyear2026\acmYear2026\acmPrice\acmISBN\acmSubmissionID¡¡144??\affiliation\institution1中国人工智能学院,中国科学院大学\city北京\country中国\affiliation\institution2复杂系统认知与决策智能全国重点实验室,中国科学院自动化研究所\city北京\country中国

曹诗越1,2, 徐沛2, 杨力坤1,2, 崔磊1,2, 于世兆1,2, 张世宇2, 任永建1,2, 陈肖堂2, 黄开奇1,2caoshiyue2021, pei\.xu, yanglikun2021, cuilei2024, yushizhao2022, shiyu\.zhang, renyongjian2022@ia\.ac\.cn (https://arxiv.org/html/2605.07174v1/mailto:caoshiyue2021,%20pei.xu,%20yanglikun2021,%20cuilei2024,%20yushizhao2022,%20shiyu.zhang,%[email protected])xtchen, kaiqi\.huang@nlpr\.ia\.ac\.cn (https://arxiv.org/html/2605.07174v1/mailto:xtchen,%[email protected])

###### 摘要\.

我们研究了欺骗性路径规划(Deceptive Path Planning, DPP)问题,其中智能体旨在向外部观察者隐藏其真实目的地。虽然现有工作假设观察者是静态且不可学习的,但现实世界中的对手(如在关键货物运输或军事行动中)可以通过从历史轨迹中学习来适应。为了弥补这一差距,我们引入了重复欺骗性路径规划(Repeated Deceptive Path Planning, RDPP),这是一个明确建模可学习观察者的新公式化方法。我们表明,现有的DPP方法在此设置下会失败,因为它们无法适应不断演变的对手预测。虽然将观察者之前的预测纳入更新可以实现一定的适应性,但这种增量更新会导致累积延迟,从而降低欺骗效果。为此,我们提出了欺骗性元规划(Deceptive Meta Planning, DeMP),这是一个两层优化框架,结合了 episode 级别的适应性(使策略能够针对更新后的观察者进行短期调整)和元级别的更新(利用跨 episode 反馈来捕捉观察者如何更新其模型,并加速未来 episode 中的适应)。通过这种方式,DeMP 减轻了适应延迟的累积,实现了对可学习观察者的持续欺骗。在不同环境中的实验表明,DeMP 在 RDPP 中显著优于现有方法,同时保持了具有竞争力的路径成本。我们的结果强调了建模与可学习对手之间的重复互动的重要性,为多智能体系统中的欺骗和隐私提供了新的见解。

###### 关键词和短语:

欺骗性路径规划,目标识别,强化学习

## 1\. 引言

参考标题图 1\. 重复欺骗性路径规划(RDPP)的图示。与单次 DPP 不同,RDPP 引入了一个可学习的观察者。在每个 episode 后,观察者接收智能体的完整轨迹以更新其识别模型,而智能体则获取观察者的预测目标。这突出了 RDPP 的核心挑战:智能体必须调整其策略以在多次互动中实现持续欺骗。在对抗性场景中,规划中的隐私保护是一个关键问题,智能体必须实现其目标,同时防止外部观察者推断其真实意图。这一挑战出现在许多现实世界的应用中Bell2003TowardAT;xu2022path;luo2019opponent。例如,当运钞车在城市环境中运输现金时,其路线可能会被潜在威胁观察到,因此需要设计能隐藏实际目的地的路径。

参考标题图 2\. DeMP 在 RDPP 中的轨迹演化。左上方面板显示了基线方法 AM 的静态轨迹。其余面板是状态访问热力图,说明了 DeMP 在重复互动中的路径分布,其中较亮的颜色表示更频繁的访问,虚线表示最终路径。与 AM 不同,DeMP 展示了持续的路径演化和多样化的路径适应,成功防止了可学习观察者根据单一移动模式推断出真实目标。欺骗性路径规划(DPP)masters\_deceptive\_2017通过生成能向对抗性观察者掩盖智能体真实目标的轨迹来解决这一问题。现有方法涵盖了路径规划masters\_deceptive\_2017;savas\_deceptive\_2022、基于控制的方法wagner2011acting;dragan2014analysis;ornik2018deception、目标优化gutierrez2025agent和强化学习liu\_deceptive\_2021;lewis\_deceptive\_2023;fatemi\_deceptive\_2024。然而,大多数这些方法关注单次互动,并假设观察者是静态且不可学习的。在实践中,对手通常会在重复互动中监控智能体——例如在军事行动中,对手可以在很长一段时间内分析部队调动——并通过利用历史轨迹不断完善其推断策略。在这种重复设置下,现有 DPP 方法的有效性迅速下降ornik2018deception,突显了一次性欺骗规划的根本局限性。

基于 DPP,我们引入了重复欺骗性路径规划(RDPP),将欺骗性规划扩展到与可学习观察者的重复互动。如图 1 所示 (https://arxiv.org/html/2605.07174#S1.F1),在每个 episode 中,智能体执行一条通往其真实目标的轨迹,同时试图误导观察者,观察者基于部分轨迹前缀预测目标。在 episode 结束后,观察者使用完整轨迹和真实目标更新其识别模型,而智能体获得观察者的预测作为未来互动的反馈。这种公式化捕捉了单次 DPP 中不存在的一个基本挑战:必须对识别能力随时间提高的观察者进行持续欺骗。

对于 RDPP 的一种自然方法是将观察者的预测纳入奖励函数,并在每个 episode 后更新智能体的策略。然而,这种反应式策略存在结构性局限。因为智能体仅在观察到观察者的改进后才进行适应,其策略更新始终滞后于观察者的学习进度。在重复互动中,这种不匹配导致适应延迟的累积,使得以前有效的欺骗行为变得可预测并最终失效。

为了解决这个问题,我们提出了欺骗性元规划(DeMP),这是一个两层优化框架,结合了 episode 级别的适应和跨 episode 的元级别更新。在 episode 级别,智能体在每个互动 episode 后调整其策略以应对观察者更新的识别模型。关键的是,在元级别,DeMP 利用高阶梯度信息整合长期反馈。该机制不仅仅是反应过去的更新,而是数学上预期观察者的学习动态。这实现了主动适应,允许智能体识别对观察者未来决策边界变化具有鲁棒性的策略初始化。通过这样做,DeMP 理论上减轻了顺序对抗互动中固有的适应延迟累积,实现了持续欺骗。

我们在带有自适应观察者的网格世界环境中评估了 RDPP 和 DeMP。实验结果表明,现有的 DPP 方法在重复互动中遭受显著的性能下降,而 DeMP 在保持具有竞争力的路径成本的同时维持了高欺骗性能。这些发现突出了我们方法的有效性,并强调了在重复欺骗性路径规划场景中考虑可学习对手的重要性。

总体而言,我们在欺骗性规划方面做出了三个主要贡献:

- •我们形式化了重复欺骗性路径规划(RDPP),将标准 DPP 扩展到与可学习观察者的重复互动。
- •我们提出了欺骗性元规划(DeMP),这是一个两层框架,得到了理论分析的支持,证明了其代理目标的一致性,并验证了其针对演变观察者的主动适应能力。
- •我们通过实证表明,DeMP 在重复互动中维持了高欺骗性能,同时保持了具有竞争力的路径效率。

参考标题图 3\. DeMP 的两层优化框架。该过程结构分为两个层次:(1)Episode 级别的适应涉及 MM 个 episode,其中智能体调整其策略参数θ\(k\)\\theta^\{\(k\)\}以对抗观察者更新的预测。观察者在每个 episode 后更新其识别模型。(2)元级别更新(虚线框)在 MM 个 episode 后发生。它利用累积的跨 episode 反馈来计算元梯度,以更新智能体的策略初始化θ\(0\)\\theta^\{\(0\)\}。通过优化θ\(0\)\\theta^\{\(0\)\},DeMP 预期观察者的学习轨迹,从而减轻 RDPP 中的适应延迟。

## 2\. 相关工作

### 2\.1\. 欺骗性规划

欺骗是对抗性场景中的一个基本概念,与隐私、安全和混淆密切相关。欺骗的一般理论Whaley1982TowardAG;Bell2003TowardAT将模拟和掩饰定义为两种基本策略。在此基础上,欺骗已被应用于路径规划。在欺骗性路径规划(DPP)中,如果真实目标不主导其他目标的概率,则该动作被认为是欺骗性的masters\_deceptive\_2017,欺骗作为一种最优规划目标出现huang2021dynamic;karabag2019optimal。

最近的研究为 DPP 引入了强化学习(RL)框架,生成动作序列,使智能体的真实目标在备选方案中保持模糊,例如模糊模型(Ambiguity Model, AM)liu\_deceptive\_2021和欺骗性探索模糊模型(Deceptive Exploration Ambiguity Model, DEAM)lewis\_deceptive\_2023。这些方法假设观察者模型对智能体是已知的,然后智能体规划跨越多个目标的模糊路径。用于战略欺骗的扩展目标识别框架masters\_extended\_2021进一步研究了感知和记忆等因素如何影响对欺骗的易感性。此外,运动欺骗游戏rostobaya2023eater考察了误导对手的推断,资源分配下的欺骗性规划chen2024deceptive解决了平衡欺骗和成本效率的问题,而具有心智理论(Theory of Mind, ToM)的多智能体欺骗建模sarkadi2019modelling强调了模拟观察者的心理状态以实现有效欺骗。

除了经典的基于模糊性的方法外,还提出了一些对欺骗性路径规划(DPP)的扩展。一些工作开发了新的方法论框架,例如使用图神经网络的强化学习来训练通用 DPP 策略fatemi\_deceptive\_2024,用于随机不确定性下欺骗的最大熵公式savas\_deceptive\_2022,以及用于单目标设置中基于幅度的欺骗的混合整数规划xu\_single\_2020。其他工作通过纳入复杂环境中的地形成本来解决实际挑战lenhard\_deceptive\_2023,基于地标、质心和最小覆盖状态设计独立于域的策略price\_domain\_2023,以及通过欺骗性强化学习处理对抗性成本信号操纵huang2019deceptive。

虽然这些研究扩大了 DPP 的建模和适用性,但它们仍局限于单次设置,未解决与自适应观察者的重复互动问题。虽然这些研究提供了多样的欺骗性路径规划方法,但它们都关注单次互动。没有任何工作解决与可学习观察者的重复欺骗性路径规划的挑战,而这正是本工作的重点。

### 2\.2\. 目标识别

目标识别(Goal Recognition, GR)问题与欺骗性规划直接相关,因为 DPP 中的观察者本质上是一个目标识别器:GR 方法指定观察者如何将观察到的行为映射到候选目标上的概率分布。经典的 GR 方法通常基于成本masters\_cost-based\_2019;Ramrez2009PlanRA;ramirez2010probabilistic;sohrabi2016plan: 通过假设近最优行为,成本分歧或贝叶斯计划识别技术计算目标的后验概率,从而作为某些欺骗性规划工作的自然观察者模型liu\_deceptive\_2021;masters\_deceptive\_2017。

然而,这些经典方法依赖于最优性假设,通常是为单 episode 推断制定的。放宽最优性的扩展提高了对次优行为的鲁棒性masters\_goal\_2019-1;zhi2020online,一些研究纳入学习或混合模型以提高可扩展性和鲁棒性:神经符号和深度学习方法处理噪声和缺失观察,并为大型候选集提供快速推理amado2018goal;amado\_robust\_2023;chiari\_goal\_2022;chiari\_fast\_2024。

这些方法关注推理准确性、效率或对观察噪声的鲁棒性,但它们不考虑识别器需要在重复对抗互动中适应的场景。

出于这些原因,我们构建了一个基于神经网络的可学习目标识别器作为实验中的观察者,而不是依赖现成的 GR 算法。该识别器遵循标准的 GR 设置并设计为在线更新,使其成为研究 RDPP 和验证方法的合适组件。

## 3\. 预备知识

马尔可夫决策过程(Markov Decision Process, MDP)puterman2014markov。MDP 由元组M=\(S,A,P,r,γ\)M=\(\mathcal\{S\},\mathcal\{A\},\mathcal\{P\},r,\gamma\)定义,其中S\\mathcal\{S\}是状态空间,A\\mathcal\{A\}是动作空间,P\(st,at,st+1\)\\mathcal\{P\}\(s_{t},a_{t},s_{t+1}\)是转移函数,定义在给定动作at\(a_{t}\)下从状态st\(s_{t}\)移动到st+1\(s_{t+1}\)的概率,r\(st,at,st+1\)r\(s_{t},a_{t},s_{t+1}\)是在状态st\(s_{t}\)执行动作at\(a_{t}\)并转移到st+1\(s_{t+1}\)时获得的奖励,γ∈\(0,1\)\\gamma\in\(0,1\)是折扣因子。目标是学习一个决策策略π:S→A\\pi:\mathcal\{S\}\rightarrow\mathcal\{A\},以最大化价值函数:Vπ\(s\)=E\[∑t∈Tγtr\(st,at,st+1\)\],V_{\pi}(s)=\mathbb\{E\}\left[\sum_{t\in T}\gamma^{t}r(s_{t},a_{t},s_{t+1})\right],其中T=\{0,1,...,H−1\}T=\{0,1,\dots,H-1\}表示有限视界H\(H\)的 episode 内离散时间步长的集合,

欺骗性 MDPornik2018deception。欺骗性 MDP 定义为

MDPP=\(S,A,P,R,r,B,L,γ\),M_{DPP}=\(\mathcal\{S\},\mathcal\{A\},\mathcal\{P\},\mathcal\{R\},r,\mathcal\{B\},\mathcal\{L\},\gamma\),其中S,A,P,r\\mathcal\{S\},\mathcal\{A\},\mathcal\{P\},r, 和γ\\gamma与常规 MDP 相同,R\\mathcal\{R\}是一组候选奖励函数,包括真实奖励函数rrr和至少一个欺骗性奖励函数,B\\mathcal\{B\}是观察者的信念集合,L\(st,at,st+1,bt\)\\mathcal\{L\}\(s_{t},a_{t},s_{t+1},b_{t}\)是信念诱导的奖励函数,定义在状态st\(s_{t}\)执行动作at\(a_{t}\)并转移到st+1\(s_{t+1}\)时的奖励,同时纳入观察者对智能体真实奖励函数的信念bt\(b_{t}\)的影响。

欺骗性 MDP 的目标是最大化信念

相似文章

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。