SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展
摘要
SMAC-Talk 是一个新的基准测试,在星际争霸多智能体挑战的基础上进行扩展,旨在评估基于 LLM 的智能体在具有自然语言通信的协作多智能体环境中的表现。该基准包含带有欺骗性通信者的场景,并使用 Qwen3.5 系列模型对智能体进行基准测试,以研究推理能力、记忆机制和模型规模对协调效果的影响。
arXiv:2606.04202v1 公告类型:新论文
摘要:随着 LLM 的部署日益广泛,它们越来越多地被期望与其他 AI 智能体协同工作,而非孤立运行。在此类场景中实现有效协调,要求智能体能够在不确定条件下进行通信、共享信息并做出决策。我们提出 SMAC-Talk,这是星际争霸多智能体挑战的自然语言扩展版本,用于评估基于 LLM 的智能体在协作多智能体环境中的表现。该环境具有若干关键特性,包括去中心化控制、部分可观测性以及长时域决策制定。SMAC-Talk 引入了一个自然语言通信频道,用于探究智能体间的协调与信任机制。我们利用该通信频道构建了多种评估场景,其中包括嵌入欺骗性通信者的设定——该通信者仅通过通信手段试图干扰并误导队友。我们基于 Qwen3.5 系列的 4 个模型提供了三种智能体用于基准测试,并研究推理结构、记忆机制和模型规模如何影响智能体间的协调效果。我们将 SMAC-Talk 作为开放基准发布,以支持研究社区在协作多智能体场景中开发和评估 LLM 智能体。
查看缓存全文
缓存时间: 2026/06/05 02:05
# SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展 来源:https://arxiv.org/abs/2606.04202 查看 PDF (https://arxiv.org/pdf/2606.04202) HTML(实验性)(https://arxiv.org/html/2606.04202v1) > 摘要:随着 LLM 的部署日益广泛,人们越来越期望它们能与其他 AI 智能体协同工作,而非孤立运行。在此类场景中实现有效协作,要求智能体具备相互通信、共享信息以及在不确定性下做出决策的能力。我们提出 SMAC-Talk——StarCraft Multi-Agent Challenge 的自然语言扩展版本,用于评估基于 LLM 的智能体在合作式多智能体环境中的表现。该环境具备若干关键特性,包括去中心化控制、部分可观测性以及长时域决策。SMAC-Talk 引入了一个自然语言通信频道,用于探究智能体间的协作与信任机制。我们利用该通信频道构建了多种评估场景,包括嵌入欺骗性通信者的设定——该通信者仅通过通信手段试图扰乱并欺骗盟友。我们提供三种智能体,使用 Qwen3.5 系列的 4 个模型进行基准测试,并研究推理结构、记忆机制与模型规模如何影响智能体间的协作效果。我们将 SMAC-Talk 作为开放基准发布,以支持研究社区在合作式多智能体场景中开发和评估 LLM 智能体。 ## 提交历史 来自:Joel Sol \[查看邮箱 (https://arxiv.org/show-email/d54f9fd3/2606.04202)\] **\[v1\]** 2026 年 6 月 2 日(周二)20:40:04 UTC(866 KB)
相似文章
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
TMAS:通过多智能体协同扩展测试时计算
TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。
具有共享上下文的去中心化多智能体系统
本文介绍了一种名为DeLM(去中心化语言模型)的框架,这是一种用于多智能体系统的架构,它利用并行智能体和共享已验证上下文来改进测试时扩展并降低成本,在SWE-bench Verified和LongBench-v2上取得了最先进的结果。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
(AI)群体的智慧:探究大型语言模型中的人工群体智能
本文探究了大型语言模型是否能够通过模型内和模型间的聚合来近似群体智能效应,发现在八项估计任务中,平均绝对百分比误差(MAPE)显著降低高达37个百分点。