自适应对手重复博弈中的遗憾最小化
摘要
本文介绍了重复策略遗憾(RP-Regret),一种用于自适应对手重复博弈中遗憾最小化的博弈论度量,并提出了三种算法来最小化它,表明这样做可以导致如猎鹿博弈中的合作均衡。
查看缓存全文
缓存时间: 2026/06/05 22:10
论文页面 - 重复博弈中自适应对手的遗憾最小化
来源:https://huggingface.co/papers/2606.06486
摘要
重复策略遗憾为分析重复博弈中的自适应对手提供了一个博弈论框架,通过新颖的非凸优化算法,比传统的外部遗憾提供了更强的均衡保证。
本文研究在重复博弈中面对自适应对手(即能根据历史对局做出响应的对手)的遗憾最小化。在线学习中外部遗憾的标准度量已知无法捕获这种自适应性。为了纳入玩家的反事实推理,我们引入了{{\tt Repeated Policy Regret (RP-Regret)}}(重复策略遗憾),这是一种博弈论度量,衡量当所有玩家都能对历史对局做出响应时,实际累积效用与事后最优效用之间的差异。与现有该设定下的遗憾概念相比,我们的概念更贴合重复博弈的本质,允许更强的比较器和更少约束的对手,同时保持所有玩家最小化该遗憾时找到更优均衡的可能性。我们首先确定了获得时间亚线性{{\tt RP-Regret}}的必要条件,涉及玩家在遗憾定义中比较器策略的变动,以及比较器和对手策略的记忆。接着,我们研究了额外条件以及可证明的算法来最小化{{\tt RP-Regret}}(该定义在策略空间上本质是非凸的)。为应对这一挑战,我们提出了三种算法:(i) 基于优化预言机(如一些先前在线非凸学习工作所假设的);(ii) 每次迭代最小化{{\tt RP-Regret}}的凸线性化近似;(iii) 当对手策略缓慢变化时直接最小化{{\tt RP-Regret}}。此外,当所有玩家都能运行最小化{{\tt RP-Regret}}(或其线性化变体)的算法时,可以学习到重复博弈的某些子博弈完美均衡。我们还提供了实验,表明最小化我们的遗憾概念能够在诸如“猎鹿博弈”等游戏中导向更具合作性的解并获得更高效用。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06486)查看 PDF (https://arxiv.org/pdf/2606.06486)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06486)
在你的 agent 中获取此论文:
hf papers read 2606.06486
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06486 即可从此页面链接。
引用此论文的数据集0
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06486 即可从此页面链接。
引用此论文的 Spaces0
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06486 即可从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
A3M: 自适应、对抗性与多目标学习用于重复拍卖中的战略投标
介绍了A3M,一个结合自适应深度强化学习、对抗性推理和多目标奖励设计的框架,用于重复拍卖中的战略投标,实现了30-40%的遗憾降低。
辅助博弈中可证明最优的学习算法
本文介绍了辅助博弈的在线变体,并为人类和辅助智能体提供了首个可证明高效的学习算法,实现了近乎最优的遗憾界。
面向无知对手下多臂老虎机的最优切换遗憾
本文解决了一个开放问题,表明一个单一算法在无知对手下的多臂老虎机中,针对每个S值都能实现最优切换遗憾。
基于重试的策略梯度强化学习中探索的涌现
本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。
通过误指定缩减实现非平稳线性赌博机的动态遗憾
本文提出了一种统一的误指定缩减视角,用于具有回合特定可行决策集的非平稳线性赌博机,在无需限制性正交结构假设的情况下实现了最优动态遗憾。