隐藏拜占庭攻击下的多智能体系统在线安全学习
摘要
本文研究隐藏拜占庭攻击下多智能体系统的在线协同控制,建立了信息论极限,并提出了一种具有可证明遗憾界的稳健估计到决策学习器。
查看缓存全文
缓存时间: 2026/08/10 08:01
# 隐蔽拜占庭攻击下多智能体系统的在线安全学习
来源:https://arxiv.org/abs/2608.06520
查看 PDF(https://arxiv.org/pdf/2608.06520)
> 摘要:我们研究了拜占庭攻击下多智能体系统的在线协同控制问题。具体而言,未知的固定子集中的智能体受拜占庭破坏,能够在观察到团队规划的联合动作后,隐蔽地覆写其自身在该联合动作中的坐标。学习者观察到规划动作、公共奖励和公共状态,但既观察不到覆写操作,也观察不到实际执行的联合动作。我们的目标是安全性:针对最坏情况下的覆写优化团队性能,并达到最优安全值。我们首先证明攻击者的信息决定了问题的几何结构。观察到规划动作的攻击者会诱导出一个精确的 \( (s,a) \)-矩形鲁棒马尔可夫决策过程(MDP),其行是覆写诱导的公共结果分布的凸包,而盲目攻击者则诱导出一个 \( s \)-矩形模型。然后,我们确定了安全学习的信息论极限,证明安全遗憾恰好分解为针对生成数据响应的回报遗憾与累积响应差距 \( D_K \) 之和。两个不可区分的单周期实例迫使期望安全遗憾为 \( \Omega(K) \),而回报遗憾为零,这表明对 \( D_K \) 的依赖是不可避免的。最后,我们开发了一个阶段绑定的鲁棒估计到决策学习器,并证明了遗憾界为 \( \widetilde{\mathcal O}\!\left(H^2S\sqrt{AK}\right)+\mathbb E[D_K] \)。因此,我们的研究为拜占庭攻击下可靠多智能体系统提供了全面的理论和算法基础。
## 提交历史
来自:Yue Wang \[查看电子邮件 (https://arxiv.org/show-email/7e6991f5/2608.06520)\] **\[v1\]** 2026年8月6日星期四 19:03:49 UTC(306 KB)相似文章
Coordinating the Unknown Lipschitz Constant in Multiplayer Bandits
This paper studies cooperative multi-player bandits in continuous Lipschitz action spaces when the Lipschitz constant is unknown, proposing a meta-algorithm (mECAB) that estimates the constant and coordinates discretization across players under different information structures, with regret guarantees.
具有重尾奖励和信息不对称的鲁棒多智能体多臂老虎机
本文研究了三种信息不对称机制下具有重尾奖励的多智能体多臂老虎机问题,提出了鲁棒的分布式算法,其遗憾保证几乎匹配集中式算法的速率,并在帕累托分布奖励环境中进行了验证。
通过算法等价实现隐凸损失的在线学习:最优遗憾、几何障碍与赌博机反馈
本文证明,在海森兼容性条件下,在线梯度下降方法能够针对隐凸损失实现最优的√T遗憾值,解决了对抗性在线学习中的开放问题。同时,还将结果扩展至单点赌博机反馈,给出了T^{3/4}的期望遗憾界。
Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry
This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.
辅助博弈中可证明最优的学习算法
本文介绍了辅助博弈的在线变体,并为人类和辅助智能体提供了首个可证明高效的学习算法,实现了近乎最优的遗憾界。