SidConArena:评估智能体在开放式正和博弈环境中的框架

arXiv cs.AI 论文

摘要

介绍了SidConArena,一个用于评估LLM智能体在开放式正和谈判游戏中的基准框架,结合了谈判、生产和拍卖,以评估混合动机互动和经济规划。

arXiv:2606.27397v1 Announce Type: cross Abstract: 评估LLM智能体需要超越静态推理和零和博弈的动态环境。现实世界的经济互动通常是开放式且混合动机的:智能体必须进行谈判、创造正和剩余、竞争稀缺资产,并在延迟回报下进行规划。我们引入了SidConArena,一个新的用于评估LLM智能体在开放式正和谈判中的基准框架。SidConArena将多方经济形式化为一个有限视野的部分可观测随机博弈,包含三个耦合阶段:具有约束交易的自然语言谈判、基于确定性转换器的生产,以及针对长期资产的密封投标拍卖。该框架结合了结构化观测、阶段感知智能体调度、神经符号动作接口和异步执行,在保持基于规则评估的同时实现自由形式互动。在同质和异质锦标赛中,更强的前沿模型取得了更高的经济结果,但智能体仍然错误估值资源、被动谈判,并在长期投资规划方面能力有限。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:28

# SidConArena:一个在开放式、正和博弈中评估智能体的环境

来源:https://arxiv.org/html/2606.27397

叶琦峰¹,陈宇欣¹†,何天行¹††  
¹清华大学交叉信息研究院  
\{fengyq25, chenyuxin25\}@mails\.tsinghua\.edu\.cn  
hetianxing@mail\.tsinghua\.edu\.cn

###### 摘要

评估LLM智能体需要动态环境,这些环境超越静态推理和零和博弈。现实世界中的经济互动往往是开放性和混合动机的:智能体必须进行谈判以创造正和盈余,争夺稀缺资产,并在延迟回报下进行规划。我们引入**SidConArena**,这是一个新的基准框架,用于在开放式、正和博弈中评估LLM智能体。SidConArena将多智能体经济形式化为一个有限时间视界部分可观察随机博弈,包含三个耦合阶段:基于自然语言的具有约束力的谈判、基于确定性转换器的生产,以及对长期资产进行密封投标拍卖。该框架结合了结构化观测、阶段感知智能体调度、神经符号动作接口和异步执行,在保留基于规则评估的同时,支持自由形式交互。在同质和异质性锦标赛中,更强的前沿模型获得了更高的经济成果,但智能体仍然存在资源估值错误、谈判被动以及长期投资规划能力有限等问题。

# SidConArena:一个在开放式、正和博弈中评估智能体的环境

## 1 引言

大语言模型(LLMs)正越来越多地被用作自主智能体,与环境和其它智能体进行交互。这一转变要求基准测试超越静态推理或孤立的指令遵循能力。虽然现有的评估衡量了重要能力,但许多仍然是静态的,并且可能面临污染风险(Hao et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib5); Perlitz et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib7); Sainz et al., 2023 (https://arxiv.org/html/2606.27397#bib.bib6))。因此,它们对智能体在动态、部分可观察和社交互动环境中的行为提供的洞察有限。

策略游戏为评估规划和互动提供了一个自然的测试平台。然而,许多现有的基于游戏的基准强调竞争性、零和或对抗性设置(Paquette et al., 2019 (https://arxiv.org/html/2606.27397#bib.bib3); Xu et al., 2023 (https://arxiv.org/html/2606.27397#bib.bib4))。相比之下,许多现实世界的经济互动是混合动机的:智能体必须合作以创造盈余,同时竞争稀缺资源。强大的表现不仅需要遵循规则,还需要局部估值、谈判、资源配置和长期投资规划。

为弥补这一空白,我们引入了**SidConArena**,一个用于开放式、正和博弈的新多智能体基准框架。基于Sidereal Confluence的经济结构,SidConArena将非对称智能体置于一个多智能体经济体中,他们在此进行有约束力的谈判交易、激活生产转换器,并在长期资产的密封投标拍卖中竞争。该框架结合了结构化观测、阶段感知智能体调度、神经符号动作接口和异步执行,在保留基于规则评估的同时,支持自然语言谈判。通过同质自博弈和异质性锦标赛,我们展示了SidConArena能够区分模型能力,并揭示在估值、谈判和长期经济规划方面的持续局限性。

## 2 相关工作

#### 策略游戏基准。

近年来的研究越来越多地利用策略游戏作为复杂环境来评估大语言模型的推理和交互能力。Cipolina-Kun et al. (2025 (https://arxiv.org/html/2606.27397#bib.bib2)) 开发了一个通用框架**Board Game Arena**,用于在各种策略游戏中测试LLM。其他基于游戏的基准也在交互设置中评估策略推理,例如**GameBench** (Costarelli et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib25)) 和**AvalonBench** (Light et al., 2023 (https://arxiv.org/html/2606.27397#bib.bib26))。一些工作专注于**Diplomacy**,其中模型旨在协调、谈判或消灭其他玩家(Paquette et al., 2019 (https://arxiv.org/html/2606.27397#bib.bib3); (FAIR)† et al., 2022 (https://arxiv.org/html/2606.27397#bib.bib27); Xu et al., 2025 (https://arxiv.org/html/2606.27397#bib.bib20))。相关研究还调查了社交推理游戏,如**Werewolf** (Xu et al., 2023 (https://arxiv.org/html/2606.27397#bib.bib4))。还有工作利用实时策略游戏如**StarCraft II**作为基准(Ma et al., 2024b (https://arxiv.org/html/2606.27397#bib.bib24))。

#### 多智能体基准。

也存在一些基准,专注于评估多智能体系统的能力或观察它们的交互。**LLM-DELIBERATION**特别关注谈判(Abdelnabi et al., (https://arxiv.org/html/2606.27397#bib.bib1))。**NegotiationArena**进一步在可评分谈判场景中评估LLM(Bianchi et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib28))。更全面的测试平台,如**SmartPlay** (Wu et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib21))、**AgentVerse** (Chen et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib22)) 和 **MultiAgentBench** (Zhu et al., 2025 (https://arxiv.org/html/2606.27397#bib.bib23)),提供了不同类型的交互任务。通用智能体基准,如**AgentBench** (Liu et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib29)) 和 **AgentBoard** (Ma et al., 2024a (https://arxiv.org/html/2606.27397#bib.bib30)),也在多轮决策环境中评估LLM智能体。

#### 社会模拟。

社会模拟框架通常包含智能体、它们交互的环境以及协调它们交互的接口(Gao et al., 2024a (https://arxiv.org/html/2606.27397#bib.bib9))。现有工作大致可以分为两类。第一类包括通用社会模拟框架,如Park et al. (2023 (https://arxiv.org/html/2606.27397#bib.bib10))、Tian et al. (2026 (https://arxiv.org/html/2606.27397#bib.bib11))、Tang et al. (2025 (https://arxiv.org/html/2606.27397#bib.bib12)) 和 Huang et al. (2024 (https://arxiv.org/html/2606.27397#bib.bib14)),它们旨在建模一般社会模式。近期的环境如**SOTOPIA** (Zhou et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib31)) 和 **Concordia** (Vezhnevets et al., 2023 (https://arxiv.org/html/2606.27397#bib.bib32)) 也研究语言智能体的社交互动和基于智能体的模拟。第二类研究特定的社会现象,如公共管理危机(Xiao et al., 2023 (https://arxiv.org/html/2606.27397#bib.bib15))、健康政策(Hou et al., 2025 (https://arxiv.org/html/2606.27397#bib.bib16))、政治操纵(Touzel et al., 2024 (https://arxiv.org/html/2606.27397#bib.bib17))和金融市场(Gao et al., 2024b (https://arxiv.org/html/2606.27397#bib.bib18))。

参见图注

图 1:SidConArena 框架概述。SidConArena 将每个智能体的回合分解为四个阶段。首先,环境从私有状态、公共棋盘信息、市场背景和交互历史中组装一个结构化观测。其次,一个阶段感知的智能体大脑将任务路由到专门的调用器,用于回合规划、交易、生产、投标和物品选择。第三,通过神经符号动作接口将路由后的上下文传递给LLM智能体,其中自由形式的推理被转换为经过验证的函数调用动作。最后,执行引擎通过谈判账本、生产引擎、拍卖机制和状态更新模块应用提交的动作,将游戏推进到下一个回合。

## 3 问题形式化

我们将 **SidConArena** 形式化为一个有限时间视界部分可观察随机博弈(POSG),由元组 G = ⟨N, S, A, P, H, V_terminal, O, Z⟩ 定义。N = {1, ..., n} 是非对称智能体的集合。H 代表有限时间视界。S 是全局状态空间。A 是联合动作空间。反映游戏的不同阶段,智能体 i 的动作空间是组合的:A_i = A_neg ∪ A_bid ∪ A_prod。我们在接下来的小节中详细说明这些阶段特定的动作。转移动态 P 是混合的:**生产**是一个确定性优化过程,而**拍卖**阶段引入随机性和不完美信息(隐藏的投标)。与具有密集奖励的标准 RL 设置不同,智能体旨在在步骤 H 时最大化一个终端价值函数 V_terminal。O_i 表示第 i 个智能体的观测,Z: S → O 是观测函数。虽然从规则来看,智能体……

游戏以交替阶段进行:一个合作谈判游戏,一个确定性局部优化,以及一个竞争性拍卖游戏。

### 3.1 阶段 1:谈判(非结构化合作博弈)

智能体每回合开始都有一个**内在缺陷**:他们的内部生产能力不足以充分利用他们的转换器。为了弥补这一点,智能体进入一个非结构化的谈判阶段来交换资源 r_{t,i} ∈ N^d。智能体选择谈判动作 a_neg ∈ A_neg,包括自然语言消息和有约束力的交易向量 τ_{i↔j} = (Δr_{i→j}, Δr_{j→i})。这个阶段被建模为一个合作子博弈,其中当交易对双方的启发式效用 U 都有提升时,交易才会发生:U_i(s_i + τ) > U_i(s_i) ∧ U_j(s_j - τ) > U_j(s_j)。 (1)

这里,U(s) 是一个启发式估值函数(在 3.4 节中定义 (https://arxiv.org/html/2606.27397#S3.SS4)),用于在终端步骤之前估计资源的隐含价值。

### 3.2 阶段 2:生产(确定性优化)

谈判之后,智能体执行一个局部生产计划。状态组件包括一组转换器 F_{t,i},其中每个 f ∈ F_{t,i} 是一个将输入资源映射到输出的函数。智能体选择一个激活向量 x_i ∈ {0,1}^{|F_{t,i}|} ⊂ A_prod。转移是确定性的:
r_{t+1,i} = r_{t,i} - ∑_f x_f r_current(f) + ∑_f x_f r_out(f)。 (2)
这个阶段实际上是一个类似背包的组合优化问题,受限于谈判期间积累的库存 r_{t,i}。

### 3.3 阶段 3:融合(竞争性不完美信息博弈)

对永久资产(殖民地与技术)的分配被建模为一个**同步多轨道优先级拍卖**。这是不完美信息的主要来源,因为智能体使用一种流动性货币——飞船——提交密封投标。令 B_i 为智能体 i 的飞船预算。智能体提交一个投标元组 a_bid = (b_{i,C}, b_{i,R}) ∈ A_bid,受限于预算约束 ∑b ≤ B_i。分配遵循**选择权**机制:

1.  排名:智能体按 b_{i,track} 降序排序。平局打破基于资产持有的随机性。
2.  选择:按排名顺序,智能体 i 从可用资产 M_track 中选择一个物品 m,前提是 b_{i,track} ≥ p_min(m),其中 p_min 是物品的保留价格。
3.  支付:智能体支付全额投标 b_{i,track}。多付的部分 b_{i,track} - p_min(m) 代表为优先权支付的溢价。

### 3.4 目标与估值函数

最终目标 J 是在终端步骤 H 时最大化智能体持有的总价值。令 w ∈ R^d 是一个真实值估值向量,为所有资源分配权重(包括“分数”代币,通常具有最高权重 w_score)。目标为:
J(π_i) = E[ V_terminal(s_{H,i}) ] = E[ w · r_{H,i} ]。 (3)

注意,终端目标没有时间折扣。然而,为了在中间回合(t < H)做出理性决策,智能体必须使用他们自己的改进的估值函数 v_i: S → R,在终端效用之外。该估值函数(在 4.1 节 (https://arxiv.org/html/2606.27397#S4.SS1) 和附录 A.2 (https://arxiv.org/html/2606.27397#S3.SS4) 中进一步解释)是自适应的,并受可用转换器和对未来机会的信念的影响。

## 4 框架设计

### 4.1 智能体大脑:预定义调用器

智能体需要一个结构化的决策流程。我们提供一个预定义的智能体大脑,将不同游戏阶段路由到专门的调用器。每个调用器通过一个系统提示和一组工具实现,专注于特定的能力。以下是我们实现中使用的七个调用器:

| 调用器 | 触发阶段 | 功能 |
|----------|---------------|-----------------|
| TurnPlanner | 所有阶段 | 设定长期和短期目标,同时考虑过去的交互和当前状态。 |
| EconomyCaller | 生产阶段(阶段 2) | 优化转换器激活序列以最大化资源产量。 |
| BidCaller | 拍卖阶段(阶段 3) | 基于公开状态估计对手预算和估值,输出投标向量。 |
| PickCaller | 选择阶段(阶段 3,中标后) | 从中标轨道中选择最佳可用资产(殖民地或技术)。 |
| DiscardColonyCaller | 生产阶段前(殖民地超额时) | 确定要清算的资产,基于成本效益分析。 |
| TradeCaller | 谈判阶段(阶段 1) | 处理传入交易请求并形成出价。 |
| AcceptTradeCaller | 谈判阶段(阶段 1,交易确认时) | 验证提议交易的可接受性并确认。 |

**TurnPlanner 调用器功能:战略规划。** **触发:** 在每次回合开始前。**角色:** 这是一个高级意识。它的输出是整个回合的上下文和指导原则。它接收结构化观测 O_t \ O_t ∈ O 并输出:
- 全局目标:基于对手立场和游戏进度设定的具体目标。
- 支持性上下文:相关的谈判历史、公共事件以及达成目标的机会或风险。
- 每个调用器的行动指令:设定每个后续调用器必须遵循的参数。

*例子:假设一个智能体不擅长生产*分数*代币,而对手 i 有多个分数转换器。TurnPlanner 可以指示 BidCaller “竞标任何新的分数殖民地”,并告诉 TradeCaller “用化学制品换取分数”。*

**TradeCaller 调用器功能:资源缺乏讨价还价。** **触发:** 在谈判阶段。**角色:** 管理双重流程:出价和回应。**对于出价:** 识别状态 r_{t,i} 和 e_{t,i} 以实现生产目标。它提出交换向量,旨在纠正交易伙伴双方的可验证资源缺乏。**对于回应:** 评估传入交易对各自生产目标的贡献,优化影响,并根据价值或战略原因接受或拒绝。

验证是严格的:交易必须在两个方向上改善生产能力。因此,TradeCaller 最终输出一个交易向量 τ_{i↔j},只有当 ΔV > 0 时才执行。

**EconomyCaller 调用器功能:资源优化。** **触发:** 在生产阶段。**角色:** 解决转换器激活的组合挑战。它确定*运行*(资源转换)的最佳序列,以最大化所需资源的积累,严格遵守转移函数的算术约束。

**BidCaller 调用器功能:贝叶斯估值。** **触发:** 在拍卖/投标阶段。**角色:** 分析公共棋盘状态以估计对手的预算和估值。它为殖民地和科技轨道输出一个投标向量 b_i,平衡获胜概率与多付风险。

**PickCaller 调用器功能:资产选择。** **触发:** 在选择阶段(如果投标成功)。**角色:** 执行“选择权”。给定轨道上剩余物品和智能体的排名,它选择对当前库存边际效用最大的特定殖民地或技术卡牌。

**DiscardColonyCaller 调用器功能:约束管理。** **触发:** 当智能体在生产阶段前超过殖民地拥有限制时。**角色:** 进行成本效益分析以确定清算哪个资产。它识别最无效的殖民地(例如,输入输出比率差或生产类型不相关的),以最大限度地减少未来生产能力的损失。

### B.3 三阶段环境

在本节中,我们详细说明 SidConArena 环境中三个游戏阶段的实现逻辑。

**第一阶段:谈判账本(A_neg)。** 对应于合作子博弈,环境提供一个非结构化通信信道。它充当可信第三方以确保原子交易执行。当智能体发出有约束力的交易向量 τ_{i↔j} ∈ A_neg 时,环境验证资源所有权,并仅在相互确认时执行交易,严格执行等式 (1) 中的合作约束 (https://arxiv.org/html/2606.27397#S3.E1)。

**第二阶段:生产引擎(A_prod)。** 该模块实现确定性优化逻辑。它接收来自每个智能体的二进制激活向量 x_i ∈ A_prod。引擎验证约束(确保输入资源存在于 r_{t,i} 中),并应用等式 (2) 中的转移函数 (https://arxiv.org/html/2606.27397#S3.E2),将输入转换为输出,并更新智能体的库存以供后续拍卖使用。

**第三阶段:拍卖机制(A_bid)。** 为了实例化不完美信息博弈

相似文章

Agent Bazaar:在多智能体市场中实现经济对齐

Hugging Face Daily Papers

介绍Agent Bazaar,一个用于评估LLMs经济对齐的多智能体模拟框架,识别出算法不稳定性和Sybil欺骗等失败模式,并通过针对性强化学习训练出一个超越前沿模型的9B模型。

发现合作管道:面向序列社会困境的自动研究

Hugging Face Daily Papers

本文提出了一种双层自动研究框架,其中外环AI代理自主优化内环LLM策略合成管道,用于多智能体序列社会困境,实现了优越的性能,并发现了在最大最小福利目标下的公平等具体目标机制。

Agentick:用于通用序贯决策智能体的统一基准

arXiv cs.AI

本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。