AgentWorld:多智能体LLM长期协作基准测试
摘要
AgentWorld引入了一个基准测试,用于评估多智能体LLM系统中的长期协作,包含100个任务和一个新的因果协作有效性指标。实验表明,即使顶级模型也仅实现52%的任务成功率,突出了诸如通信故障等失败模式。
查看缓存全文
缓存时间: 2026/09/28 04:02
论文页面 - AgentWorld:多智能体LLM的长期协作基准测试
来源:https://huggingface.co/papers/2609.31590
摘要
现有大多数多智能体基准测试主要在竞争性场景下进行,仅测试20步以内的短期交互,或简单地将个体表现相加,未能有效识别并凸显基于LLM的智能体之间真正的协作能力。我们推出AgentWorld,一个包含100个人工标注任务(及其100个增强变体)的基准,旨在评估长期的多智能体协作。这些任务需要在一个丰富的MMORPG沙盒中进行超过50轮的交互,要求3至20个具有非对称角色和能力的智能体,在黑箱设置下通过通信、联合规划和资源共享进行协调,每个智能体独立行动,无法访问其他智能体的内部状态。除了传统的二元任务成功标准外,为了量化协作效果,我们提出了因果协作效果(CCE)这一基于图的度量指标。该指标追踪智能体行动之间的因果依赖关系,并衡量团队中有多少比例的努力真正对最终结果做出了贡献。对Gemini3Flash、Claude Haiku4.5、GPT-5Mini和DeepSeekR1-70B的实验表明,即使是表现最好的模型,任务成功率也仅达到52.0%,并且存在系统性的失败模式,包括通信中断、角色混乱以及无法在多个轮次中维持共同计划。AgentWorld完全开源。
查看arXiv页面 (https://arxiv.org/abs/2609.31590) 查看PDF (https://arxiv.org/pdf/2609.31590) 项目页面 (https://agentworld.io/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.31590)
在您的智能体中获取此论文:
hf papers read 2609\.31590
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型README.md中引用arxiv.org/abs/2609.31590,即可从本页面链接到它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集README.md中引用arxiv.org/abs/2609.31590,即可从本页面链接到它。
引用此论文的Spaces0
没有Space链接到此论文
在Space README.md中引用arxiv.org/abs/2609.31590,即可从本页面链接到它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到它。
相似文章
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者
本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。
重新思考多智能体协作:多即是少
本文阐述了基于大语言模型系统中多智能体协作的能力边界,表明仅在特定任务结构中有益,例如具有稀疏依赖关系的长期任务,并提出了SAIGE,一种基于动态图的高效协作机制。
论文:10个前沿大语言模型在94%的配对代理运行中串通
一篇研究论文报告称,10个前沿大语言模型在94%的配对代理运行中表现出串通行为,在保持任务准确性的同时跳过验证步骤,这对长期交互中的AI安全有影响。
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。