AgentWorld:多智能体LLM长期协作基准测试

Hugging Face Daily Papers 论文

摘要

AgentWorld引入了一个基准测试,用于评估多智能体LLM系统中的长期协作,包含100个任务和一个新的因果协作有效性指标。实验表明,即使顶级模型也仅实现52%的任务成功率,突出了诸如通信故障等失败模式。

现有的多智能体基准测试主要在竞争性环境、少于20步的短期交互中进行测试,或仅仅聚合个人表现,未能孤立并突出基于LLM代理的真实协作能力。我们引入AgentWorld,这是一个包含100个人工标注任务(以及100个增强变体)的基准测试,用于评估长期、多智能体协作。任务在丰富的MMORPG沙盒中跨越50多轮交互,需要3-20个具有非对称角色和能力的代理通过通信、联合规划和资源共享进行协调,在黑盒设置下,每个代理独立行动,无法访问其他代理的内部状态。除了传统的二元任务成功外,为了量化协作有效性,我们提出了因果协作有效性(CCE),这是一个基于图的指标,追踪代理动作之间的因果依赖关系,并测量团队努力中实际贡献于结果的比例。使用Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini和DeepSeek R1-70B的实验表明,即使最好的模型也仅实现52.0%的任务成功率,存在系统性失败模式,包括通信故障、角色混淆以及跨轮次无法维持共享计划。AgentWorld完全开源。
查看原文
查看缓存全文

缓存时间: 2026/09/28 04:02

论文页面 - AgentWorld:多智能体LLM的长期协作基准测试

来源:https://huggingface.co/papers/2609.31590

摘要

现有大多数多智能体基准测试主要在竞争性场景下进行,仅测试20步以内的短期交互,或简单地将个体表现相加,未能有效识别并凸显基于LLM的智能体之间真正的协作能力。我们推出AgentWorld,一个包含100个人工标注任务(及其100个增强变体)的基准,旨在评估长期的多智能体协作。这些任务需要在一个丰富的MMORPG沙盒中进行超过50轮的交互,要求3至20个具有非对称角色和能力的智能体,在黑箱设置下通过通信、联合规划和资源共享进行协调,每个智能体独立行动,无法访问其他智能体的内部状态。除了传统的二元任务成功标准外,为了量化协作效果,我们提出了因果协作效果(CCE)这一基于图的度量指标。该指标追踪智能体行动之间的因果依赖关系,并衡量团队中有多少比例的努力真正对最终结果做出了贡献。对Gemini3Flash、Claude Haiku4.5、GPT-5Mini和DeepSeekR1-70B的实验表明,即使是表现最好的模型,任务成功率也仅达到52.0%,并且存在系统性的失败模式,包括通信中断、角色混乱以及无法在多个轮次中维持共同计划。AgentWorld完全开源。

查看arXiv页面 (https://arxiv.org/abs/2609.31590) 查看PDF (https://arxiv.org/pdf/2609.31590) 项目页面 (https://agentworld.io/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.31590)

在您的智能体中获取此论文:

hf papers read 2609\.31590

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型README.md中引用arxiv.org/abs/2609.31590,即可从本页面链接到它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2609.31590,即可从本页面链接到它。

引用此论文的Spaces0

没有Space链接到此论文

在Space README.md中引用arxiv.org/abs/2609.31590,即可从本页面链接到它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到它。

相似文章

AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者

arXiv cs.CL

本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。

重新思考多智能体协作:多即是少

arXiv cs.AI

本文阐述了基于大语言模型系统中多智能体协作的能力边界,表明仅在特定任务结构中有益,例如具有稀疏依赖关系的长期任务,并提出了SAIGE,一种基于动态图的高效协作机制。