协作税:大型语言模型多智能体系统协调的成本有多高
摘要
本文在大型语言模型多智能体系统中提出了协作税的概念,通过跨任务和模型的测量,揭示了可预测的机制和实际干预措施。
arXiv:2608.22152v1 公告类型:新
摘要:由大型语言模型构建的多智能体系统已广泛部署,但当两个大型语言模型必须协调而非单独行动时,性能损失的程度仍不清楚。我们提出协作税的概念,将其定义为具有私有信息的双玩家合作博弈中的团队去中心化损失,并通过两个命题刻画其符号及其与最大超可加性违反的等价性。我们在32个按接地摩擦源分组的可单独处理任务上操作化此定义,并在来自7个提供商的11个模型上进行测量。该税沿着两个无例外的维度结构化:所有模型中的类别排序以及随能力的单调下降。近因机制并非推理缺陷,而是四阶段对话级联,其中智能体提出无根据的声明、未能查询伙伴、跳过整合双方观点并在不重新推导的情况下接受答案。该税可从对话特征机械地预测,并且部分可处理:针对所有四个阶段的提示干预关闭了相当大部分的差距,且主导瓶颈因类别而异。在异质配对中,该税被拉向更强的伙伴而非加性中点,从而经验性地实现了我们框架所预测的最大超可加性违反。总之,这些结果将大型语言模型系统中的协作重新定义为可测量、可预测且部分可处理的成本。
查看缓存全文
缓存时间: 2026/08/25 04:27
# 协作税:LLM多智能体系统为协调付出的代价 来源:https://arxiv.org/abs/2608.22152 查看PDF (https://arxiv.org/pdf/2608.22152) > 摘要:基于大型语言模型构建的多智能体系统已广泛应用,但当两个LLM必须协调而非独立行动时,性能损失程度仍不明确。我们将协作税形式化为具有私有信息的双人合作博弈的团队去中心化损失,并通过两个命题刻画其符号特征及其与最大超加性违背的等价性。我们在32个基于接地摩擦来源分组的单智能体可处理任务中实现了该定义,并对来自7个提供商的11个模型进行了测量。该税呈现两个无例外的结构性特征:跨所有模型的类别排序,以及随能力提升的单调递减。其直接机制并非推理缺陷,而是一个四阶段对话级联:智能体做出无根据的声明、未能查询合作伙伴、跳过双方观点整合、未经重新推导即接受答案。该税可通过对话特征机械预测,并部分可解:针对四个阶段的提示干预能弥合相当部分的差距,且主导瓶颈因类别而异。在异构配对中,税值被拉向更强伙伴而非加性中点,这在实证层面实现了我们理论框架预测的最大超加性违背。综合而言,这些发现将LLM系统的协作重新定义为一个可量化、可预测且部分可解的成本。 ## 投稿历史 来自:Weixiang Sun \[查看邮件 (https://arxiv.org/show-email/63d508bd/2608.22152)\] **\[v1\]**Sun, 2026年8月23日 00:47:00 UTC \(5,367 KB\)
相似文章
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。
交接税:在LLM智能体中延续非原生轨迹
本文研究了在低成本和高成本LLM模型之间交接任务时的成本质量权衡,引入了'交接税'概念,即在升级时进行全轨迹传递会导致质量恢复不佳并伴随成本溢价。
超越个体智能:基于LLM的多智能体系统中的协作、故障归因与自我进化综述
本综述论文对基于LLM的多智能体系统进行了统一回顾,聚焦于协作、故障归因和自我进化,通过LIFE框架识别开放挑战,并提出跨阶段的研究议程。
LLM代理是否理性谈判?一个基于A2A/MCP的可验证多代理交互机制设计框架
本文提出了一种机制设计框架,用于验证使用A2A/MCP协议的LLM代理中的谈判和分配任务。它评估了多个模型的理性行为,发现机制级的激励兼容性并不会自动转移到LLM代理上。
多智能体LLM团队中个性组合何时重要?
本文系统研究了在多智能体LLM团队中操纵个性特质如何影响编码、研究协作和谈判任务的性能,发现影响关键取决于任务结构。