标签
This paper studies how LLM agents negotiate in a dynamic supply chain bargaining problem, benchmarking nine models from OpenAI, Google, and Alibaba against a Bayesian equilibrium and finding that capability, provider identity, and prompt design shape surplus creation and division.
This paper introduces Mixed-Strategy Decision Tree (MDT), a method that uses solver output to teach large language models equilibrium strategies in imperfect-information games, reducing distance to equilibrium by 52.6% across LLM configurations on No-Limit Texas Hold'em.
本文介绍了IFlowNets,将对抗流网络扩展到不完全信息博弈,证明了先前的约束条件无效,并在初步实验中显示出与现有方法相当或更好的性能。
一本免费的开放获取博弈论教材,共585页,包含165道习题解答,被推荐为经济学、人工智能、计算机科学等领域的资源。
本文提出了一种用于联邦学习的平均场隐私博弈框架,能够对任意数量且具有异构隐私偏好的客户端进行可处理的纳什均衡分析,并实现个性化隐私保证。
一份来自arXiv的585页开放获取的博弈论PDF教材,包含165道已解答的习题。
一篇博客文章,探讨了带有无限序数的Nim游戏如何总是终止,使用了良基性和epsilon-zero序数的概念。
文章讨论了一家咨询公司的论点:模型崩塌、人类认知债务(技能退化)和竞争压力在人工智能中形成了一个自我强化的反馈循环,并质疑组织能否抵制自动化的竞赛。
本文研究了结构化推理干预如何影响大型语言模型的战略经济推理,以霍特林线性城市模型为工具,发现干预效果取决于模型架构(GPT-4.1-mini 对比 GPT-5-mini),并存在统计显著的交叉交互作用。
本文提出了一类用于合作博弈的非线性公理归因方法,以克服线性Shapley值因零空间过大而导致的局限性。实验结果表明,与Shapley值变体相比,这些方法在包含AUC指标方面具有潜在的有效性。
本文提出了一种基于博弈论交互的统一方法,用于解释大型语言模型中的知识蒸馏,发现蒸馏会稀疏化交互,并引入了一种损失函数CIP来提升性能。
本文研究了诸如调解等正式机制,以在模拟市场中维持自利的大型语言模型代理(DeepSeek-V3)之间的市场稳定性,发现即使在持续对抗攻击下,调解也能使市场恢复。
介绍了G-Frame,这是一个由博弈论驱动的多智能体框架,通过内化领域约束减少了轻量级LLM中的幻觉,在化学基准测试中实现了79.46%的幻觉减少,并与GPT-4o mini的性能相当。
Elias Bareinboim 宣布他团队的多个 ICML 2025 论文关于因果 AI,涵盖关系世界模型、鲁棒离线强化学习、反事实识别和因果博弈论,强调 AI 推理中因果知识的必要性。
本文研究了在双人零和不完美信息博弈中学习有用的策略表示(嵌入)的方法,介绍了创建策略数据集、学习嵌入以及使用Kuhn和Leduc扑克在下游任务中评估这些方法的技术。
本文介绍了一种用于AI智能体运行时人工监督的、具有双边信息不对称的Contextual-Bandit团队博弈,刻画了团队最优策略与短视人工监督策略之间的差距。
加州大学戴维斯分校教授Giacomo Bonanno的四本免费开放获取教科书推荐,涵盖博弈论、决策制定、不确定性风险和信息、不确定性与保险经济学,配有视频和练习题。
本文构建了收购竞标作为信息不完全的拍卖博弈模型,并利用博弈论求解器和强化学习研究最优尽职调查策略,发现PPO和PPG在大规模博弈中表现有效,同时给出了尽职调查边际收益为零的可计算阈值。
本文使用演化博弈论对社区中一个最小化危害的AI代理与一个寻求认可的(RLHF)代理之间的竞争进行建模,分析采纳条件和福利结果。结果表明,尽管自我审计的代理可以占据主导,但这并不足以防止社区危害,且对齐和时间框架至关重要。