标签
介绍了ClawArena-Team,这是一个基准测试,用于衡量单个语言模型作为领导者,通过动态工作流创建、委托和编排子代理的管理能力。实验表明,权限授予是一个瓶颈,成本与管理质量脱钩,大多数模型在性能上聚集,而编排行为则差异很大。