LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究

arXiv cs.CL 论文

摘要

本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。

arXiv:2607.06157v1 公告类型:新 摘要:协商在协作中起着至关重要的作用;当人类共同合作时,他们会自然而然地通过沟通来对齐信息并达成一致。在本文中,我们研究了在部分可观测的联合决策任务中具有协商能力的大语言模型(LLM)智能体。我们将协商协作形式化为一个具有部分和不完全观测信息的合作联合决策问题,并引入了一个可扩展基准,该基准在多个任务设置和领域中实例化这一问题,其中智能体必须通过协商交换信息,以达成具有共享奖励的联合决策。接着,我们实例化了一个用于协商智能体的参考框架和评估协议,并对一系列具有代表性的LLM进行了系统评估。结果显示,复杂的协商协作任务仍然对最先进的语言模型构成挑战。即使借助外部数学工具,语言模型可能在用于对齐信息的协商过程中或在做出决策的复杂推理过程中失败。另一方面,诊断分析表明,协商过程也可能提供反思和错误纠正的机会,有时比集中式基线表现更好。总之,我们的工作为评估和改进在协商协作中的LLM智能体奠定了基础,并提供了对当前基于LLM的多智能体系统的优势、局限性和特性的见解。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:42

# 部分可观察性下联合决策研究 来源:https://arxiv.org/html/2607.06157

## 用于审慎协作的LLM智能体:部分可观察性下联合决策研究

Chenxu Wang\*,1, Yongkun Yang\*,1, Boyuan Du\*,2, Shiwei Lin1, Huaping Liu1
1清华大学计算机科学与技术系
2福州大学
jimwangcx@gmail\.com (https://arxiv.org/html/2607.06157v1/mailto:[email protected]),hpliu@tsinghua\.edu\.cn (https://arxiv.org/html/2607.06157v1/mailto:[email protected])

###### 摘要

审慎在协作中起着关键作用;人类合作时,会自然地进行交流以对齐信息并达成一致。本文研究了在部分可观察的联合决策任务中,大型语言模型(LLM)智能体的审慎协作能力。我们将审慎协作形式化为一个具有部分和不对称观察的协作性联合决策问题,并引入一个可扩展的基准,该基准在多个任务设置和领域中实例化此问题,在这些设置和领域中,智能体必须通过审慎交流信息,以达成具有共享奖励的联合决策。随后,我们实例化了一个针对审慎智能体的参考框架和评估协议,并对一系列代表性LLM进行了系统评估。结果表明,复杂的审慎协作任务仍然对最先进的语言模型构成挑战。即使借助外部数学工具,语言模型也可能在用于对齐信息的审慎过程或用于制定决策的复杂推理过程中失败。另一方面,诊断分析表明,审慎过程也可能提供反思和纠错的机会,有时会优于集中式基线。总体而言,我们的工作为评估和改进审慎协作中的LLM智能体奠定了基础,并提供了对当前基于LLM的多智能体系统的优势、局限性和特性的见解。代码可在此存储库 (https://github.com/wcx21/deliberative-collaboration-agents) 中获取。

## 1 引言

大型语言模型(LLM)和语言智能体的最新进展在多个领域取得了显著进展,包括社会智能 Zhou et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib48)); Mou et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib26)); Wang et al. (2024a (https://arxiv.org/html/2607.06157#bib.bib34))、多智能体协作 Yan et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib41)); Chen et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib4)); Guo et al. (2024 (https://arxiv.org/html/2607.06157#bib.bib10)); Liu et al. (2024a (https://arxiv.org/html/2607.06157#bib.bib21))、谈判或审慎 Zhu et al. (2025b (https://arxiv.org/html/2607.06157#bib.bib51)); Choi et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib5)); Hu et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib13)); Bianchi et al. (2024 (https://arxiv.org/html/2607.06157#bib.bib2)); Karanam et al. (2024 (https://arxiv.org/html/2607.06157#bib.bib15)) 以及决策制定 Dolant and Kumar (2025 (https://arxiv.org/html/2607.06157#bib.bib6)); Eo et al. (2025 (https://arxiv.org/html/2607.06157#bib.bib8))。然而,一个悬而未决的问题是:当每个LLM智能体仅拥有部分、不对称的信息时,它们能否通过审慎进行良好的协作?我们在图1 (https://arxiv.org/html/2607.06157#S1.F1) 中展示了一个审慎协作的代表性示例。在审慎协作场景中,智能体必须沟通、交换知识并共同推理,以达成共享决策。与纯粹的审慎或协作相比,这种设置本质上更复杂、更全面,因为它需要与任务相关的沟通和联合决策。

![参考图注](图1:部分可观察性下审慎协作的说明性示例。在此菜单设计场景中,多个AI智能体(例如,AI管家和烹饪机器人)观察环境的不同方面,例如食材可用性和客人偏好,并且必须通过审慎交换信息以达成单一的联合决策。这种结构可以推广到其他协作性联合决策问题。)

本文研究审慎协作场景中的LLM智能体。我们将审慎协作形式化为一个部分可观察的联合决策问题,其中多个智能体各自拥有环境的部分观察,智能体应就最终决策达成共识作为输出,并共享相同奖励。与竞争性或对抗性设置不同,此类场景中的挑战在于在部分可观察性下进行有效的信息交换、信念对齐和协调决策。我们构建了一个可扩展的基准,该基准跨多个相关的任务设置(包括协作菜单设计和任务分配领域)实例化此问题。这些设置在观察结构、智能体角色和决策机制上有所不同,但共享相同的基础审慎协作结构。底层决策问题被形式化为一个具有有限决策空间的组合优化问题,从而能够实现基于规则的数值奖励。该基准能够全面评估LLM智能体在审慎协作方面的能力,包括通过对话进行信息交换、数值计算和逻辑推理。尽管实例化在具体领域,但底层问题结构(即具有不完整和不对称信息的协作性联合决策)是许多实际应用所共有的。

我们使用多个最先进的LLM,在180个任务上进行了实验,涵盖了多种任务设置和评估条件。特别是,我们考察了去中心化审慎过程、外部工具和模型容量对协作决策的影响。结果表明,当前模型在信息交换与聚合、推理以及数学问题解决方面可能仍然存在不足。然而,尽管审慎过程对LLM的多种能力提出了挑战,但它也为智能体提供了反思和纠错的机会,并可能在某些情况下提高性能。

我们的主要贡献总结如下:
- • 我们将审慎协作形式化为一个部分观察下的协作性联合决策问题,为研究不完整和不对称信息下的协作性LLM智能体提供了一个统一的抽象。
- • 我们引入了一个可扩展的基准,该基准在多个紧密相关的任务设置(包括菜单设计和任务分配)中实例化此问题,从而能够在各种观察和决策结构下,使用求解器可计算的目标进行受控评估。
- • 我们对多个LLM和任务设置进行了系统评估,为当前审慎智能体系统建立了基线结果和诊断观察。

## 2 问题设置

这项工作的动机来自一类现实世界的协作场景,其中多个智能体合作解决一个任务。这些智能体可能具有不同的观察和动作空间,但共享相同的奖励;因此,为了实现更高的共同奖励,审慎成为一种自然需求。我们对一组代表性的审慎协作场景进行了研究,这些场景可以形式化为部分可观察性下的决策问题。

### 2.1 问题形式化

我们将部分可观察的多智能体联合决策问题定义为一个元组:\(s, O_1, \cdots, O_n, \mathcal{D}, R\),其中 \(s\) 是问题中的真实状态,智能体无法观察;\(O_1, \cdots, O_n\) 是智能体的部分观察,\(n\) 是智能体数量;\(\mathcal{D}\) 是决策空间;\(R: \mathcal{S} \times \mathcal{D} \mapsto \mathbb{R}\) 是奖励函数,其中 \(\mathcal{S}\) 是状态空间。智能体的目标是选择一个决策 \(d \in \mathcal{D}\),以最大化关于未观察的真实状态 \(s\) 的奖励 \(R(s, d)\)。为了使智能体能够达成联合决策,我们将问题关联一个审慎过程,如算法1中的伪代码所描述的编程友好方式,其中智能体以一般方式定义,`decision_made` 是一个可自定义的函数,用于确定智能体是否达成协议。该协议有意保持抽象以支持自定义特性;例如,角色不对称可以通过限制 `decision_made(·)` 函数考虑哪些智能体来实例化。请注意,尽管审慎过程会展开多轮,但话语仅用于交换信息,环境状态是固定的,因此底层任务是一个具有终端奖励的单阶段联合决策问题。虽然此设置可以用Dec-POMDP方式形式化,但我们的形式化强调了该任务作为一次性集体决策问题的本质,并更多关注作为认知协调的审慎过程,而不是作为状态转换的对话。

**算法1** 审慎过程

**输入**: 观察 \(O_1, \cdots, O_n\),语言智能体 \(\pi_1, \cdots, \pi_n\),决策空间 \(\mathcal{D}\),轮次限制 \(t_m\)

for \(i \in \{1, \cdots, n\}\) do
    \(\pi_i.\text{init}(O_i)\)
end for
\(t \leftarrow 0\)
\(dialog \leftarrow \emptyset\)
while \(t \leq t_m\) do
    for \(i \in \{1, \cdots, n\}\) do
        \(\pi_i.\text{listen}(dialog)\)
        utterance, current_proposal \(\leftarrow \pi_i.\text{talk}()\)
        \(dialog \leftarrow dialog.\text{append}(utterance)\)
        if decision_made(\(\cdot\)) then
            返回 current_proposal
        end if
    end for
    \(t \leftarrow t + 1\)
end while
返回 None

### 2.2 基准设计

我们在多个任务设置中实例化部分可观察的联合决策问题,这些设置在观察结构、决策权限和评估协议上有所不同。在所有设置中,智能体必须基于部分观察通过审慎达成一个单一的联合决策,同时共享一个共同的终端奖励。关键差异在于观察的形式、决策空间的结构以及评估协议,总结在表1 (https://arxiv.org/html/2607.06157#S2.T1) 中。

#### 2.2.1 基于分区数值观测的菜单设计

我们从两个智能体的菜单设计场景开始,该设置在一个完全结构化的环境中实例化联合决策问题,具有数值状态表示和分区观察。真实状态由食材状态和用户偏好组成,两者都可以用向量形式表示;智能体观察此状态的不相交子集,并且保证它们的观察共同覆盖完整信息。决策空间是一组有限的候选菜单。给定一个菜品列表,智能体决定是否将每道菜纳入菜单,奖励根据可行性和用户偏好得分确定性地计算。如果能够访问完整状态,最优决策可以通过求解相应的整数规划问题得到,这作为上界。因此,该设置主要评估智能体通过审慎交换必要信息以及一旦足够信息对齐后执行准确规划的能力。更多细节在附录A.1 (https://arxiv.org/html/2607.06157#A1.SS1) 中阐述。

**表1**: 基准中实例化的任务设置比较。混合观察包括数值信息和自然语言描述。

#### 2.2.2 基于部分语义观测的菜单设计

考虑到现实世界的观察可能是文本和语义的而非数值的,我们放宽了观察纯粹是数值且不相交的假设。在此设置中,智能体接收用户偏好的部分自然语言描述,这些自然语言描述从真实状态中采样,可能不完整、重叠或相关,因此不同智能体可能从不同的角度描述相同的潜在事实。决策空间和奖励函数与结构化菜单设计设置相同,但智能体现在必须在由语言介导的观察所引发的不确定性下进行推理;因此,即使是能够访问所有自然语言观察的Oracle基线也可能无法获得全部奖励。该设置强调自然语言层面的推理和沟通、对模糊信息的解释以及部分可观察性下的审慎,同时保留一个定义良好的评估目标。

#### 2.2.3 具有非对称角色和资源的任务分配

我们将联合决策框架扩展到多智能体任务分配场景,其特征是非对称角色和异构资源约束。与菜单设计领域相比,该领域的资源分为私有资源(仅限单个智能体使用)和公共资源(团队共享),同时还具有智能体特定任务效率。部分可观察性也与这一特性相关,每个智能体只能观察自己的私有资源和部分公共资源,需要通过审慎沟通来重建全局可行性约束。决策空间包括在混合私有和公共资源约束下将任务分配给智能体,每个任务最多可以分配给一个智能体。在资源约束内,奖励根据每个任务的基础价值和智能体执行任务的效率计算。与菜单设计领域类似,如果知道真实状态,任务分配问题也可以公式化为组合优化问题,并且可以通过求解器计算奖励的上界。与菜单设计中的对称对等交互相比,此设置引入了显式的角色不对称。一个智能体被指定为领导智能体,其他为工人智能体。所有智能体可以沟通以交换信息并提出建议,但只有领导智能体可以做出最终决定并终止审慎。此设置在决策结构和权力分配上与菜单设计根本不同,用于评估智能体在部分可观察性下执行分层协调的能力。

#### 2.2.4 指标

我们基准中的所有领域都关联着一个定义明确的结构化决策空间和目标奖励,因此我们可以使用归一化奖励(NR = \(\frac{\text{reward}}{\text{maximum reward}} \times 100\))来评估智能体,定义为获得的奖励除以真实状态下的最大可能奖励。违反可行性约束的无效决策在NR中获得零奖励。因此,我们还报告了有效比例(VR),定义为有效决策的比例,即满足所有可行性约束的决策。为了提供更细粒度的评估

相似文章

法律中多智能体协商研究

arXiv cs.AI

本文研究了使用LLM进行法律推理任务的多智能体协商方法,引入了两种受法庭程序启发的新框架。实验表明,多智能体系统在整体性能上与单一LLM相当,但能产生截然不同的答案,并能解决基线模型无法处理的案例,突显了多智能体方法在法律AI中的潜力。

多智能体LLM商议中的隐藏锚点

arXiv cs.AI

本文把多智能体LLM商议建模成一个闭环动力系统,其中每个智能体都拥有隐藏的内部信念(锚点),该锚点持续牵引其观点。文章展示了如何仅从商议数据中恢复这个锚点,并解释了诸如观点逃逸初始信念凸包等现象。

多元证据,更优预测:信息不对称下的多智能体协商

arXiv cs.AI

本文介绍了InfoDelphi框架,该框架利用信息不对称(将证据划分为共享的公共子集和不相交的私有子集)来改进多智能体LLM的协商与预测。在PolyGym基准测试上,它在Brier得分上比单智能体和多智能体基线提升12-18%,在准确率上提升4-8个百分点,证明了多样化证据是有效多智能体推理的关键。