标签
一份来自arXiv的585页开放获取的博弈论PDF教材,包含165道已解答的习题。
一篇博客文章,探讨了带有无限序数的Nim游戏如何总是终止,使用了良基性和epsilon-zero序数的概念。
文章讨论了一家咨询公司的论点:模型崩塌、人类认知债务(技能退化)和竞争压力在人工智能中形成了一个自我强化的反馈循环,并质疑组织能否抵制自动化的竞赛。
本文研究了结构化推理干预如何影响大型语言模型的战略经济推理,以霍特林线性城市模型为工具,发现干预效果取决于模型架构(GPT-4.1-mini 对比 GPT-5-mini),并存在统计显著的交叉交互作用。
本文提出了一类用于合作博弈的非线性公理归因方法,以克服线性Shapley值因零空间过大而导致的局限性。实验结果表明,与Shapley值变体相比,这些方法在包含AUC指标方面具有潜在的有效性。
本文提出了一种基于博弈论交互的统一方法,用于解释大型语言模型中的知识蒸馏,发现蒸馏会稀疏化交互,并引入了一种损失函数CIP来提升性能。
本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。
介绍了G-Frame,这是一个由博弈论驱动的多智能体框架,通过内化领域约束减少了轻量级LLM中的幻觉,在化学基准测试中实现了79.46%的幻觉减少,并与GPT-4o mini的性能相当。
Elias Bareinboim 宣布他团队的多个 ICML 2025 论文关于因果 AI,涵盖关系世界模型、鲁棒离线强化学习、反事实识别和因果博弈论,强调 AI 推理中因果知识的必要性。
本文研究了在双人零和不完美信息博弈中学习有用的策略表示(嵌入)的方法,介绍了创建策略数据集、学习嵌入以及使用Kuhn和Leduc扑克在下游任务中评估这些方法的技术。
本文介绍了一种用于AI智能体运行时人工监督的、具有双边信息不对称的Contextual-Bandit团队博弈,刻画了团队最优策略与短视人工监督策略之间的差距。
加州大学戴维斯分校教授Giacomo Bonanno的四本免费开放获取教科书推荐,涵盖博弈论、决策制定、不确定性风险和信息、不确定性与保险经济学,配有视频和练习题。
本文构建了收购竞标作为信息不完全的拍卖博弈模型,并利用博弈论求解器和强化学习研究最优尽职调查策略,发现PPO和PPG在大规模博弈中表现有效,同时给出了尽职调查边际收益为零的可计算阈值。
本文使用演化博弈论对社区中一个最小化危害的AI代理与一个寻求认可的(RLHF)代理之间的竞争进行建模,分析采纳条件和福利结果。结果表明,尽管自我审计的代理可以占据主导,但这并不足以防止社区危害,且对齐和时间框架至关重要。
本文针对机制切换跳扩散过程中的零和随机微分博弈,提出了一种熵正则化强化学习框架,推导了HJBI方程和演员-评论家算法,并将其应用于投资博弈。
介绍了SidConArena,一个用于评估LLM智能体在开放式正和谈判游戏中的基准框架,结合了谈判、生产和拍卖,以评估混合动机互动和经济规划。
EMAgnet针对大型两人零和游戏中的策略梯度自我博弈引入了参数空间指数移动平均正则化,与均匀正则化目标相比,实现了更低的可利用性。
一篇来自Google DeepMind的58页论文,关于构建专精于博弈论的智能体,重点介绍了研究中的关键见解。
本文研究了去中心化联盟形成作为一个由单方面退出与加入决策驱动的动态过程,采用Aumann-Dreze值进行局部收益评估。它建立了均衡刻画、Lyapunov和势函数表示,并分析了切换/接受成本对稳定性的影响。
一篇博客文章,讨论了系统中增加粒度(例如金融市场的最小变动单位和预订运动场地的时间段)如何引入策略性博弈和低效,认为更细化的选择并不总是有益的。