隐藏拜占庭攻击下的多智能体系统在线安全学习

arXiv cs.LG 论文

摘要

本文研究隐藏拜占庭攻击下多智能体系统的在线协同控制,建立了信息论极限,并提出了一种具有可证明遗憾界的稳健估计到决策学习器。

arXiv:2608.06520v1 公告类型:新 摘要:我们研究拜占庭攻击下多智能体系统的在线协同控制。具体而言,一个未知的固定智能体子集是拜占庭受损的,并且可以在观察到团队计划联合动作后,隐蔽地覆盖其自身在该计划中的坐标。学习器观察到计划动作、公共奖励和公共状态,但既观察不到覆盖行为,也观察不到实际执行的联合动作。我们的目标是安全性:针对最坏情况的覆盖优化团队性能,并达到最优安全值。我们首先证明攻击者的信息决定了几何结构。观察到计划动作的攻击者会诱导出一个精确的 $(s,a)$-矩形稳健马尔可夫决策过程(MDP),其行是覆盖诱导的公共结果分布的凸包,而盲目攻击者则诱导出一个 $s$-矩形模型。接着,我们确定了安全学习的信息论极限,证明安全遗憾精确分解为针对生成数据的响应的回报遗憾与累积响应差距 $D_K$。两个不可区分的地平线一实例迫使 $Ω(K)$ 的期望安全遗憾,而回报遗憾为零,这表明对 $D_K$ 的依赖是不可避免的。最后,我们开发了一种阶段绑定的稳健估计到决策学习器,并证明了遗憾界为 $\widetilde{\mathcal O}\!\left(H^2S\sqrt{AK}\right)+\mathbb E[D_K]$。因此,我们的研究为拜占庭攻击下可靠多智能体系统提供了全面的理论和算法基础。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:01

# 隐蔽拜占庭攻击下多智能体系统的在线安全学习
来源:https://arxiv.org/abs/2608.06520
查看 PDF(https://arxiv.org/pdf/2608.06520)

> 摘要:我们研究了拜占庭攻击下多智能体系统的在线协同控制问题。具体而言,未知的固定子集中的智能体受拜占庭破坏,能够在观察到团队规划的联合动作后,隐蔽地覆写其自身在该联合动作中的坐标。学习者观察到规划动作、公共奖励和公共状态,但既观察不到覆写操作,也观察不到实际执行的联合动作。我们的目标是安全性:针对最坏情况下的覆写优化团队性能,并达到最优安全值。我们首先证明攻击者的信息决定了问题的几何结构。观察到规划动作的攻击者会诱导出一个精确的 \( (s,a) \)-矩形鲁棒马尔可夫决策过程(MDP),其行是覆写诱导的公共结果分布的凸包,而盲目攻击者则诱导出一个 \( s \)-矩形模型。然后,我们确定了安全学习的信息论极限,证明安全遗憾恰好分解为针对生成数据响应的回报遗憾与累积响应差距 \( D_K \) 之和。两个不可区分的单周期实例迫使期望安全遗憾为 \( \Omega(K) \),而回报遗憾为零,这表明对 \( D_K \) 的依赖是不可避免的。最后,我们开发了一个阶段绑定的鲁棒估计到决策学习器,并证明了遗憾界为 \( \widetilde{\mathcal O}\!\left(H^2S\sqrt{AK}\right)+\mathbb E[D_K] \)。因此,我们的研究为拜占庭攻击下可靠多智能体系统提供了全面的理论和算法基础。

## 提交历史

来自:Yue Wang \[查看电子邮件 (https://arxiv.org/show-email/7e6991f5/2608.06520)\] **\[v1\]** 2026年8月6日星期四 19:03:49 UTC(306 KB)

相似文章

Coordinating the Unknown Lipschitz Constant in Multiplayer Bandits

arXiv cs.LG

This paper studies cooperative multi-player bandits in continuous Lipschitz action spaces when the Lipschitz constant is unknown, proposing a meta-algorithm (mECAB) that estimates the constant and coordinates discretization across players under different information structures, with regret guarantees.