随机奖励丰富经典博弈论竞赛
摘要
研究人员使用数学模型表明,在奖励中引入随机变化丰富了经典博弈论的见解,使得在像囚徒困境这样的游戏中合作与背叛得以共存。
<p>游戏可能是去除了生活中所有困难部分的模拟,但它们提供了一种研究人们为何做出特定选择的方式。传统游戏通常在静态背景下进行:每个结果的奖励是恒定的。这限制了它们与行为的相关性,因为在现实生活中,战略选择的奖励和后果是不断变化的。现在,研究人员使用数学模型研究了一系列包括演化策略和<a href="https://doi.org/10.1103/3yby-qq2n">随机变化回报</a>的游戏。</p>
<h2>一点历史</h2>
<p>或许最著名的博弈论竞赛是囚徒困境。在囚徒困境中,一对窃贼被捕并被警方分别审讯。如果两人都保持沉默,他们将因较轻的罪行受到惩罚。如果一名囚犯达成交易(背叛),那么该囚犯将被释放,而另一名则会受到更重的刑罚。如果两人都达成交易,他们都会受到中等程度的惩罚。</p>
<p>游戏运行者可以以不同的合作和背叛奖励开始游戏,以探索最优策略如何随奖励和风险而变化,玩家可以通过在多轮中改变策略来找出这些变化。根据保持沉默(合作)的奖励和背叛之间的平衡,游戏会稳定在每个人背叛每个人的状态。在这种简单情况下,所有人都会输。</p><p><a href="https://arstechnica.com/science/2026/09/random-rewards-enrich-classic-game-theory-contests/">阅读全文</a></p>
<p><a href="https://arstechnica.com/science/2026/09/random-rewards-enrich-classic-game-theory-contests/#comments">评论</a></p>
查看缓存全文
缓存时间: 2026/09/11 23:23
# 随机奖励丰富经典博弈论见解
来源:https://arstechnica.com/science/2026/09/random-rewards-enrich-classic-game-theory-contests/
跳至内容 (https://arstechnica.com/science/2026/09/random-rewards-enrich-classic-game-theory-contests/#main)
面对噪声,简单博弈也能衍生出丰富的策略。
博弈或许剔除了生活中所有艰难的元素,但它们提供了一种研究人们为何做出特定选择的途径。传统博弈通常在静态背景下进行:每种结果的奖励是恒定的。这限制了它们对行为研究的适用性,因为现实生活中,战略选择的奖励与后果总在变化。如今,研究人员利用数学模型研究了一系列包含动态策略和随机变动收益的博弈。(https://doi.org/10.1103/3yby-qq2n)
## 简要历史
或许最著名的博弈论竞赛是囚徒困境。在囚徒困境中,两名窃贼被捕并被警方分开审讯。若两人都保持沉默,将因较轻罪行受罚。若其中一人认罪(背叛),则该囚犯可获释,另一人将面临更重刑罚。若两人都认罪,则均获中等处罚。
游戏设计者可通过调整合作与背叛的初始奖励来探索最优策略如何随奖励与风险变化,玩家则通过多轮尝试不同策略来摸索规律。取决于保持沉默(合作)与背叛的奖励平衡,游戏最终可能稳定于人人相互背叛的状态。在这种简单情境下,所有人皆输。
类似动态也存在于“懦夫博弈”、石头剪刀布等游戏中。策略的演化可能导致稳定种群、双稳态种群(种群在两种稳定策略间切换)或极限周期——种群在多策略间持续轮转。
博弈过程中改变规则也有着丰富的历史。通常这些属于局内变化,例如设置可用奖励上限,使策略随轮次增加而适应资源逐渐受限的情况。换言之,大部分早期研究探讨的是玩家当前轮次行为如何影响下一轮可用资源或奖励。
## 你的影响力有限
然而现实中,我们常受不可控外部因素驱使。兔子无法控制淹没洞穴的降雨,也无法控制杀死其食物的干旱。每轮博弈都会变化,因为每种策略的风险与奖励随时间而变。研究者意识到,将这些动态纳入数学模型可能揭示新行为——事实证明确实如此。
上述囚徒困境仅有唯一稳定点(所有人皆输)。模型很快收敛至该点,所有玩家在几轮内采取相同策略。但新研究发现,若奖励随时间变化(即使幅度很小),模型将出现第二个稳定点,使合作者与背叛者得以共存。当变异增大时,背叛者点将失稳,意味着仅存在合作者。
在懦夫博弈中,模型结果更令人警醒:若奖励无变化,稳定点是人人转向避让,全体存活。仅加入少量变异,就会出现不避让种群。增加更多噪声,则会产生存活与撞毁间的双稳态切换。(考虑到懦夫博弈本质是冷战策略,我更加惊叹人类竟能幸存至今面对下一次生存挑战。)
对于石头剪刀布,会出现更复杂的动态。就稳定与不稳定点而言,常规石头剪刀布不存在稳定点——策略永远不会固定于所有人选择石头,而是持续在三种选项间轮转。但若奖励每轮随机变化,则会产生新的稳定点与不稳定点。视情况不同,这可能导致博弈更快演化为轮转策略,或形成极限周期。若奖励分布不均(如石头胜剪刀的收益高于纸胜石头),则会产生极限周期。此时种群持续循环,选择石头、纸或剪刀的概率会随时间推移而稳定可预测地演化。
所有这些博弈论推演的结论是:尽管玩家行为倾向可能影响博弈,但动态变化的游戏环境对最优策略有着巨大影响。
## 简单规则揭示生活本质
若将囚徒困境视为经典博弈工具,它会得出令人沮丧的结论:合作是败方策略。然而即便在囚徒困境设定下,我们仍观察到合作行为。为何?因为奖励存在外部影响——认罪获释的囚犯很可能在其他情况下遭到报复。因此更复杂的策略组合更可能涌现。
但相对微小的奖励结构变动竟能导致行为如此剧烈变化,仍令人惊讶。
博弈论模型也常被用于理解经济行为。我向来对这类博弈得出的见解持怀疑态度(或许过于怀疑),本文明确揭示了我不信任这些模型的原因。但研究结果也指明了方向:我们可以通过仍相当简单的博弈,复现现实生活中观察到的更丰富动态。
《物理评论快报》2026年,DOI:10.1103/3yby-qq2n (https://doi.org/10.1103/3yby-qq2n)
Chris Lee 照片 (https://arstechnica.com/author/laserboy/)
Chris 为Ars Technica科学版面撰稿。白天是物理学家,夜间化身科学作家,专攻量子物理与光学领域。现居荷兰埃因霍温工作生活。
4条评论 (https://arstechnica.com/science/2026/09/random-rewards-enrich-classic-game-theory-contests/#comments)
1. 最多阅读首篇报道配图:物理学家用数学解析《星际迷航》"皮卡德机动" (https://arstechnica.com/science/2026/09/physicist-does-the-math-on-star-treks-picard-maneuver/)
相似文章
有时需要随机性来实现协调
本文介绍了 Diamond Attention,这是一种用于多智能体强化学习的方法,通过引入结构化随机性来打破对称性,从而实现同质智能体之间的角色区分,在 XOR 游戏等对称任务中实现了完美的协调。
野外中的错误奖励函数
OpenAI 讨论了强化学习中错误奖励函数的问题,其中智能体会利用奖励规范中的漏洞,而不是实现预期目标。本文通过赛车游戏示例探索了这一问题,并提出了包括从演示学习、人类反馈和迁移学习等研究方向,以减轻此类问题。
网络拓扑和对手信息在塑造多智能体强化学习系统合作中的作用
本文探讨了网络拓扑和对手信息对多智能体强化学习系统中合作涌现的影响,特别是在重复囚徒困境(IPD)中,发现图结构和信息可用性对合作策略有显著影响。
奖励作为具身世界模型的智能体
本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。
程序之间的博弈:竞争的Ruliology
对重复双人博弈中所有可能策略的系统性探索,使用计算方法分析累积收益和获胜策略,并通过Ruliology进行研究。