基于语义合作博弈的LLM多智能体系统贡献分配方法

arXiv cs.AI 论文

摘要

针对LLM多智能体系统中的贡献分配问题,提出语义合作博弈(SCG)和语义Shapley值(SSV)方法,并引入单轨迹算法SLIC,在保持与蒙特卡洛Shapley基线一致性的前提下,将计算成本降低93.3%。

arXiv:2607.18255v1 公告类型: 新论文 摘要:贡献分配已成为基于LLM的多智能体系统的核心问题,这类系统的最终输出由多个智能体、消息交互及有序工作流依赖共同产生。现有分配方法通常依赖反事实估值,例如移除智能体或比较不同智能体子集的分数变化。在语言介导的工作流中,这些方法需要重复调用模型,引入高方差,且未能显式捕捉智能体生成、保留和转换任务相关信息的中间语义状态。我们提出语义合作博弈(SCG)框架,将实际语言流表示为语义生成超图,并在此结构上诱导出面向智能体的语义价值函数。我们定义语义Shapley值(SSV)以基于语义支持逻辑分配贡献,并引入SLIC算法——一种单轨迹算法,用于构建语义超图、恢复最小语义支持、应用布尔吸收,并在无需重新运行智能体子集的情况下计算SSV。我们证明,在标准基于集合、完全可观测且无顺序依赖的条件下,SSV可退化为经典Shapley值。在满足这些条件的医学基准测试中,SLIC将计算成本降低93.3%,同时与蒙特卡洛Shapley基线保持高度一致性。在更一般的多角色工作流中,SSV与扰动导致的分数下降曲线一致,并揭示了语义贡献与故障影响可能不一致的情况。总体而言,SLIC为复杂的基于LLM的多智能体系统提供了一种快速、无反事实且可解释的贡献分配方法。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:20

# 基于语义合作博弈的LLM多智能体系统贡献分配 来源:https://arxiv.org/html/2607.18255

彭毅江 纽约大学 pj2366@nyu\.edu & 朱晓光¹ 加州大学戴维斯分校 xgzhu@ucdavis\.edu & 屈安岩 纽约大学 qz494@nyu\.edu

###### 摘要

贡献分配已成为基于LLM的多智能体系统中的核心问题,因为最终输出是由多个智能体、消息交换和有序工作流依赖共同产生的。现有分配方法通常依赖反事实估值,例如移除智能体或比较改变后的智能体子集得分变化。在语言中介的工作流中,这些方法需要重复调用模型,引入高方差,且未能显式捕捉智能体在产生、保留和转换任务相关信息时所经历的中间语义状态。我们提出语义合作博弈(SCG),该框架将已实现的语言流表示为语义生成超图,并在此结构上诱导出智能体级别的语义价值函数。我们定义语义沙普利值(SSV)在语义支持逻辑上进行贡献分配,并引入SLIC——一种单轨迹算法,该算法构建语义超图、恢复最小语义支持、应用布尔吸收、计算SSV而无需重新运行智能体子集。我们证明,在标准基于集合、完全可观测且无顺序依赖的条件下,SSV退化为经典沙普利值。在满足这些条件的医学基准上,SLIC将计算成本降低93.3%,同时与蒙特卡罗沙普利基线保持高度一致。在更一般的多角色工作流中,SSV与扰动引起的分数下降曲线对齐,并揭示了语义贡献与故障影响可能分歧的情况。总体而言,SLIC为复杂的基于LLM的多智能体系统提供了一种快速、免反事实且可解释的分配方法。代码可在以下地址获取:SCG\_SENSITIVITY (https://github.com/PengYiJiang-john/SCG_SENSITIVITY)

## 1 引言

基于大语言模型(LLM)的多智能体系统通过将计算分布在具有专门角色、通信协议和显式工作流结构的交互智能体之间,日益成功地解决复杂任务。CAMEL(李等人,2023a (https://arxiv.org/html/2607.18255#bib.bib14))、AutoGen(吴等人,2023 (https://arxiv.org/html/2607.18255#bib.bib15))、MetaGPT(洪等人,2024 (https://arxiv.org/html/2607.18255#bib.bib16))和MedAgents(唐等人,2024 (https://arxiv.org/html/2607.18255#bib.bib17))等框架展示了这种组织形式在任务分解、审慎推理和领域特定协作方面的价值。然而,系统行为不再由单一模型响应决定。它源于智能体动作序列、消息依赖和中间语义变换。这使得确定哪些智能体塑造了最终输出以及故障源自何处变得困难。这激发了*贡献分配问题*(CAP):给定一个已实现的工作流轨迹、一个价值读取接口和一组参与的智能体,为每个智能体分配一个贡献分数,以解释其在产生观察到的输出中的作用。这种分配支持故障诊断(张等人,2025b (https://arxiv.org/html/2607.18255#bib.bib1))、工作流比较(杨等人,2025 (https://arxiv.org/html/2607.18255#bib.bib2))、智能体剪枝(张等人,2025a (https://arxiv.org/html/2607.18255#bib.bib3))和鲁棒性分析(陈等人,2024 (https://arxiv.org/html/2607.18255#bib.bib4))。CAP也是更广泛信用分配问题的一个具体实例,包括强化学习中的时间信用分配(Sutton,1984 (https://arxiv.org/html/2607.18255#bib.bib10))和多智能体系统中的结构信用分配(Agogino和Tumer,2004 (https://arxiv.org/html/2607.18255#bib.bib11))。

一大类分配方法可被描述为*反事实估值*路线。这些方法不是从已实现的工作流本身识别贡献,而是估计系统价值在假设性修改下如何变化。它们通过移除、替换或屏蔽智能体、消息、特征、动作或工作流组件来构建扰动执行(Ribeiro等人,2016 (https://arxiv.org/html/2607.18255#bib.bib23);Zeiler和Fergus,2014 (https://arxiv.org/html/2607.18255#bib.bib25);Lundberg和Lee,2017 (https://arxiv.org/html/2607.18255#bib.bib24))。然后对扰动系统进行采样或重新运行,并从产生的价值差异计算分配:Δ系统→采样/重新运行价值估计→价值差异分配。这里,价值估计表示从修改后的执行(而非原始轨迹)获得的价值估计。这种反事实估值路线涵盖了多智能体强化学习、合作博弈论和LLM智能体工作流分配。COMA使用集中式评论家估计智能体特定的反事实动作价值(Foerster等人,2018 (https://arxiv.org/html/2607.18255#bib.bib12)),差值奖励方法将全局奖励与通过移除或固定某个智能体贡献获得的反事实奖励进行比较(Wolpert和Tumer,2001 (https://arxiv.org/html/2607.18255#bib.bib26);Nguyen等人,2018 (https://arxiv.org/html/2607.18255#bib.bib27))。在基于LLM的协作中,C3通过固定延续重放和留一干预估计消息级因果影响(陈等人,2026 (https://arxiv.org/html/2607.18255#bib.bib13)),而ShapleyFlow评估备选的智能体工作流配置(杨等人,2025 (https://arxiv.org/html/2607.18255#bib.bib2))。更一般地,合作博弈论方法通过联盟或工作流组件上的边际比较来分配贡献(Shapley,1953 (https://arxiv.org/html/2607.18255#bib.bib5);Aumann和Shapley,1974 (https://arxiv.org/html/2607.18255#bib.bib6);Young,1985 (https://arxiv.org/html/2607.18255#bib.bib7))。

尽管干预目标和聚合规则不同,这些方法共享一个共同依赖:分配由分配给假设配置的标量值中介。这种依赖在语言中介的工作流中产生了两个障碍,如图1 (https://arxiv.org/html/2607.18255#S1.F1)所示。

问题1:贡献依赖于工作流。LLM工作流在智能体动作和消息上诱导出一个偏序依赖结构。因此,基于集合的反事实(例如保留或移除智能体或组件的子集)并不能完全定义分配目标。同一子集在不同执行顺序、路由规则或下游依赖下可能产生不同效果。智能体的贡献不仅取决于它生成的内容,还取决于该内容出现的位置以及下游如何使用它。

问题2:基于重新运行的估值成本高且不稳定。当通过重新运行、重放或回滚获得价值时,每次干预都可能重写下游上下文并触发不同的模型响应。这增加了模型调用、随机方差以及对解码、提示和编排细节的敏感性。即使使用替代评估器,分配仍然与评估器的稳定性相关。这些困难随着智能体、消息、组件和干预的数量增加而迅速增长。

这些障碍表明,CAP不仅应被视为一个价值比较问题,还应被视为一个工作流结构问题。在基于LLM的多智能体系统中,贡献通过已实现的轨迹表达,其中智能体产生中间内容、向下游传递信息、重用先前消息并转换语义状态。由于黑盒LLM内部难以检查,我们使用语言轨迹作为此信息流的可观测层。先前关于智能体级别监控和过程评估的工作(陈等人,2024 (https://arxiv.org/html/2607.18255#bib.bib4);Gritta等人,2026 (https://arxiv.org/html/2607.18255#bib.bib18))表明,此类轨迹包含有用的过程信号。对于CAP,相关信号是语义的:智能体引入、保留、重写或组合任务相关的内容,下游智能体可能在推理中重用这些内容。这促使从工作流结构转向*语言流*,后者揭示了产生任务价值的语义状态和变换。

为了使这种语义依赖结构可分析,我们提出**语义合作博弈**(SCG)。如图1 (https://arxiv.org/html/2607.18255#S1.F1)所示,SCG将已实现的语言流转换为语义生成超图。该图包含语义节点、支持链接、从链接到智能体的归属映射以及由评分标准读取的加权输出节点。给定玩家集合NN和图GG,SCG定义了一个语义博弈表示(N,G)(N,G)。然后,该图诱导出智能体级别的语义价值函数,使工作流依赖成为分配对象的一部分。在这个诱导的价值函数上,我们定义**语义沙普利值**(SSV)。支持层使用布尔逻辑来表示充分的语义支持,遵循布尔博弈和合作布尔博弈(Harrenstein等人,2001 (https://arxiv.org/html/2607.18255#bib.bib8);Dunne等人,2008 (https://arxiv.org/html/2607.18255#bib.bib9))。分配层遵循沙普利风格的公理化分配(Shapley,1953 (https://arxiv.org/html/2607.18255#bib.bib5);Young,1985 (https://arxiv.org/html/2607.18255#bib.bib7))。因此,SSV将经典沙普利值从无序联盟扩展到语义支持结构。在标准基于集合、完全可观测且无顺序依赖的条件下,它与经典沙普利值一致。为了从单个轨迹计算SSV,我们提出**SLIC**(语义逻辑逆推贡献)。SLIC读取承载价值的输出节点及其评分标准权重,递归地追溯语言流中的语义前驱,并构建GG。然后,它提取最小链接级支持,通过归属将链接映射到智能体,应用布尔吸收,并聚合多重线性系数以获得SSV。这避免了重新运行智能体子集。在满足归约条件的医学基准上,SLIC匹配蒙特卡罗基线,同时将计算成本降低93.3%。在更一般的多角色工作流中,SSV跟踪扰动下智能体级别的分数下降,并揭示了有限语义贡献仍可能产生巨大故障影响的情况。

参见说明图1: 贡献分配的反事实路线与语义路线对比。*左下角:*传统反事实路线通过屏蔽组件并重新运行工作流来测量价值变化,需要大量模型调用和高计算成本。*右下角:*语义路线通过追溯智能体间的语言/语义流分析单个已执行的任务。贡献直接从此依赖结构通过语义沙普利值计算,无需重新运行。

我们的贡献如下:
- • 提出SCG,一个语义合作博弈框架,将已实现的语言流表示为语义生成超图,并从工作流依赖的语义支持中诱导出智能体级别的价值函数。
- • 定义语义沙普利值(SSV),并引入一种无需反事实重新运行的单轨迹算法来计算SSV。我们证明在标准联盟博弈条件下SSV与经典沙普利值一致。
- • 在归约一致性和结构诊断基准上验证SCG/SLIC,表明SLIC在保持沙普利一致性的同时降低了计算成本,并且SSV在复杂的多角色工作流中提供了可解释的分配。

## 2 语义合作博弈

为了为LLM工作流定义一个沙普利风格的分配博弈,我们首先指定价值将从中被诱导的语义对象。智能体通过其语言动作被观察:它产生、携带或转换语义内容。因此,我们将每个智能体动作建模为语义变换,并通过其双重语言流分析工作流。形式上,设T=(L,H)T=(\mathcal{L},H),其中L⊆X\mathcal{L}\subseteq X中的每个状态是在某一步产生的语义状态,H={hu}H=\{h_u\}是智能体动作的集合。为了将此轨迹连接到价值,我们使用评分标准或价值读取接口。在基于评分标准的评估中,最终标量分数分解为若干承载分数的输出语义。设O={o1,...,oK}O=\{o_1,...,o_K\}表示这些输出语义,ω\omega分配它们的权重。本节的目标是从语言流中提取价值相关的语义节点,并用它们构建语义生成超图。

##### 假设1(语义可分性与源可识别性)。对于任何执行位置uu,每个与本论文相关的语义节点s⊆yus\subseteq y_u是三种类型之一:原生语义、派生语义或持久语义。如果ss是派生或持久的,则其在输入状态xux_u中的先前语义源可以被识别。

在假设1下,每个智能体动作huh_u为其产生的每个语义节点提供直接前驱集合:
srchu(s)={∅,若s是原生,{s~},若s是持久,P,P⊆xu,若s是派生,
其中srchu(s)是语义节点ss在动作huh_u下的直接前驱集合。对于每个语义节点,令h(s)h(s)为产生它的动作。为了恢复博弈的特征空间,我们递归地将每个输出节点ok∈Ook∈O追溯回其前驱。这产生了价值相关的语义节点集合SS。我们将初始语义节点定义为I:={s∈S:srch(s)(s)=∅}I:=\{s\in S:\mathrm{src}_{h(s)}(s)=\emptyset\}。对于每个s∈S∖Is∈S\setminus I,有向超边es:srch(s)(s)→ses:\mathrm{src}_{h(s)}(s)\rightarrow s。这给出了语义生成超图G=(S,L,N;α,ω,O,I)G=(S,L,N;\alpha,\omega,O,I),其中NN是当前轨迹中的智能体集合,L:={es:s∈S∖I}L:=\{e_s:s\in S\setminus I\},α:L→N\alpha:L\to N记录每个链接属于哪个智能体,O⊆SO\subseteq S表示评估任务价值的输出语义节点,ω:O→R\omega:O\to\mathbb{R}分配它们的价值权重。我们以这种逆向方式构建GG,因为分配应集中在通过任务相关语义表达的系统行为上。从OO开始将构建锚定在价值接口读取的语义特征上,而追溯前驱则识别了系统如何产生、重用或转换这些特征。因此,生成的图是已实现行为的紧凑描述,从中可以诱导出智能体级别的支持逻辑和价值。额外的形式化细节和示例推迟到附录G.1 (https://arxiv.org/html/2607.18255#A7.SS1)中给出。

因此,我们引入语义合作博弈的定义如下。

###### 定义1(语义合作博弈)。给定一个语言流及其诱导的语义生成超图G=(S,L,N;α,ω,O,I)

相似文章

合作博弈的非线性公理归因方法

arXiv cs.LG

本文提出了一类用于合作博弈的非线性公理归因方法,以克服线性Shapley值因零空间过大而导致的局限性。实验结果表明,与Shapley值变体相比,这些方法在包含AUC指标方面具有潜在的有效性。

Σ-Mem:面向基于LLM的多智能体系统的在线可靠性记忆

Hugging Face Daily Papers

本文介绍了Σ-Mem,一种用于基于LLM的多智能体系统的在线可靠性记忆,它跟踪同伴的历史能力表现及同伴之间的关系,通过谱界实现稳定自适应,并通过残差引导、路由和加权投票来改善协调性。