SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展

arXiv cs.AI 论文

摘要

SMAC-Talk 是一个新的基准测试,在星际争霸多智能体挑战的基础上进行扩展,旨在评估基于 LLM 的智能体在具有自然语言通信的协作多智能体环境中的表现。该基准包含带有欺骗性通信者的场景,并使用 Qwen3.5 系列模型对智能体进行基准测试,以研究推理能力、记忆机制和模型规模对协调效果的影响。

arXiv:2606.04202v1 公告类型:新论文 摘要:随着 LLM 的部署日益广泛,它们越来越多地被期望与其他 AI 智能体协同工作,而非孤立运行。在此类场景中实现有效协调,要求智能体能够在不确定条件下进行通信、共享信息并做出决策。我们提出 SMAC-Talk,这是星际争霸多智能体挑战的自然语言扩展版本,用于评估基于 LLM 的智能体在协作多智能体环境中的表现。该环境具有若干关键特性,包括去中心化控制、部分可观测性以及长时域决策制定。SMAC-Talk 引入了一个自然语言通信频道,用于探究智能体间的协调与信任机制。我们利用该通信频道构建了多种评估场景,其中包括嵌入欺骗性通信者的设定——该通信者仅通过通信手段试图干扰并误导队友。我们基于 Qwen3.5 系列的 4 个模型提供了三种智能体用于基准测试,并研究推理结构、记忆机制和模型规模如何影响智能体间的协调效果。我们将 SMAC-Talk 作为开放基准发布,以支持研究社区在协作多智能体场景中开发和评估 LLM 智能体。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:05

# SMAC-Talk:面向大语言模型的星际争霸多智能体挑战自然语言扩展

来源:https://arxiv.org/abs/2606.04202
查看 PDF (https://arxiv.org/pdf/2606.04202) HTML(实验性)(https://arxiv.org/html/2606.04202v1)

> 摘要:随着 LLM 的部署日益广泛,人们越来越期望它们能与其他 AI 智能体协同工作,而非孤立运行。在此类场景中实现有效协作,要求智能体具备相互通信、共享信息以及在不确定性下做出决策的能力。我们提出 SMAC-Talk——StarCraft Multi-Agent Challenge 的自然语言扩展版本,用于评估基于 LLM 的智能体在合作式多智能体环境中的表现。该环境具备若干关键特性,包括去中心化控制、部分可观测性以及长时域决策。SMAC-Talk 引入了一个自然语言通信频道,用于探究智能体间的协作与信任机制。我们利用该通信频道构建了多种评估场景,包括嵌入欺骗性通信者的设定——该通信者仅通过通信手段试图扰乱并欺骗盟友。我们提供三种智能体,使用 Qwen3.5 系列的 4 个模型进行基准测试,并研究推理结构、记忆机制与模型规模如何影响智能体间的协作效果。我们将 SMAC-Talk 作为开放基准发布,以支持研究社区在合作式多智能体场景中开发和评估 LLM 智能体。

## 提交历史

来自:Joel Sol \[查看邮箱 (https://arxiv.org/show-email/d54f9fd3/2606.04202)\] **\[v1\]** 2026 年 6 月 2 日(周二)20:40:04 UTC(866 KB)

相似文章

TMAS:通过多智能体协同扩展测试时计算

Hugging Face Daily Papers

TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。

具有共享上下文的去中心化多智能体系统

Hugging Face Daily Papers

本文介绍了一种名为DeLM(去中心化语言模型)的框架,这是一种用于多智能体系统的架构,它利用并行智能体和共享已验证上下文来改进测试时扩展并降低成本,在SWE-bench Verified和LongBench-v2上取得了最先进的结果。