标签
AgentWorld引入了一个基准测试,用于评估多智能体LLM系统中的长期协作,包含100个任务和一个新的因果协作有效性指标。实验表明,即使顶级模型也仅实现52%的任务成功率,突出了诸如通信故障等失败模式。