AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者

arXiv cs.CL 论文

摘要

本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。

arXiv:2605.08647v1 公告类型:新论文 摘要:多智能体系统通过同伴协作取得了最先进的成果。然而,当流水线中的某个智能体静默地丢弃某个约束时,即使推理链已悄然损坏,系统的最终输出可能看起来仍然正确,而现有的基于结果的评价体系对此类多跳过程故障视而不见。为了在部署前使这些漏洞变得可测量,我们引入了 AgentCollabBench,这是一个包含 900 项人工验证任务的诊断性基准,涵盖软件工程、DevOps 和数据工程领域。每项任务都孤立地评估四种行为风险之一:指令衰减(约束能否经受住同伴压力?)、虚假信念传播(谬误是否通过共识扩散?)、上下文泄漏(信息是否在任务间泄露?)以及追踪器耐久性(标记数据是否能到达最终智能体?)。通过对四种现代大语言模型(GPT 4.1 mini、Gemini 2.5 Flash Lite、Qwen-3.5-35B-A3B 和 Llama 3.1 8B Instruct)进行评估,我们揭示了仅基于结果的评价无法发现的模型特定脆弱性特征;例如,Qwen-3.5-35B-A3B 在追踪器耐久性和指令稳定性方面领先,而 GPT 4.1 mini 在泄漏控制和抗虚假信念方面表现最佳。除了模型间的差异外,通信拓扑结构被确定为解释多跳信息存活率 7%-40% 差异的主要风险因素。这种效应源于汇聚型 DAG(有向无环图)节点特有的综合瓶颈:在权衡竞争性父节点输入时,智能体会丢弃由少数分支携带的约束,这种瓶颈在线性链中在结构上是不存在的。AgentCollabBench 证明,次优的拓扑结构可以静默地消除高能力模型的保障措施,这表明多智能体的可靠性本质上是一个结构问题,仅靠扩展模型智能无法替代架构设计。
查看原文
查看缓存全文

缓存时间: 2026/05/12 06:56

# AgentCollabBench:诊断优秀智能体何时成为糟糕的协作者

来源:https://arxiv.org/html/2605.08647

Aritra Mazumder<sup>1</sup> Shubhashis Roy Dipta<sup>2</sup> Nusrat Jahan Lia<sup>3</sup> Tanzila Khan<sup>3</sup> Kainat Raisa Hossain<sup>3</sup> Nehaa Shri<sup>4</sup> Shubhrangshu Debsarkar<sup>5</sup> Humayra Tasnim<sup>6</sup> Gour Gupal Talukder Shawon<sup>7</sup>, Debjoty Mitra<sup>8</sup>, Sumaiya Ahmed Rani<sup>9</sup>, Al Jami Islam Anik<sup>8</sup>, Al Nafeu Khan<sup>10</sup>

<sup>1</sup>犹他大学 <sup>2</sup>马里兰大学巴尔的摩分校 <sup>3</sup>达卡大学 <sup>4</sup>维洛尔理工学院 <sup>5</sup>弗吉尼亚大学 <sup>6</sup>拉杰沙希工程与技术大学 <sup>7</sup>沙赫贾拉尔科学技术大学 <sup>8</sup>BRAC大学 <sup>9</sup>伊斯兰科技大学 <sup>10</sup>吉大港大学

<sup>1</sup>[email protected] <sup>2</sup>[email protected] <sup>3</sup>[email protected]

###### 摘要

多智能体系统通过同伴协作实现了最先进的成果。然而,当流水线中的某个智能体 silently(悄然)丢弃某个约束时,即使推理链已被悄悄破坏,系统的最终输出仍可能看似正确,而现有的基于结果的评估对此类多跳过程故障视而不见。为了在部署前使这些漏洞可量化,我们引入了 **AgentCollabBench**,这是一个包含 900 个人工验证任务的诊断基准,涵盖软件工程、DevOps 和数据工程领域。每个任务隔离四种行为风险之一:指令衰减(约束能否抵御同伴压力?)、错误信念传染(虚假信息是否通过共识传播?)、上下文泄露(信息是否在任务间渗漏?)以及追踪器耐久性(标记数据能否到达最终智能体?)。通过对四种现代 LLM(GPT 4.1 mini、Gemini 2.5 Flash Lite、Qwen-3.5-35B-A3B 和 Llama 3.1 8B Instruct)进行评估,我们揭示了仅靠结果评估无法察觉的特定模型脆弱性画像;例如,Qwen-3.5-35B-A3B 在追踪器耐久性和指令稳定性方面领先,而 GPT 4.1 mini 在泄露控制和错误信念抵抗方面领先。除了模型间的差异外,通信拓扑作为一个主要风险因素浮现出来,它解释了多跳信息存活率方差的 7%-40%。这种效应源于汇聚型有向无环图(converging-DAG)节点特有的综合瓶颈:权衡竞争父节点输入的智能体会丢弃由少数分支携带的约束,这种瓶颈在线性链中在结构上是不存在的。AgentCollabBench 表明,次优拓扑可能会悄无声息地抹去高能力模型的安全保障,论证多智能体可靠性从根本上是一个结构性问题,仅扩展模型智能无法替代架构设计。

<sup>1</sup>评估框架:https://github.com/aritra741/AgentCollabBench

## 1 引言

考虑一个三智能体 DevOps 流水线:配置管理员、安全审计员和部署工程师将他们的输入综合成最终的 Kubernetes 清单。配置管理员传达了一个关键约束:经过验证的容器镜像。安全审计员基于不同的上下文指定了另一个镜像。部署工程师生成了一个完整、有效、准备部署的清单。它通过了每一项结果检查。但是,经过验证的镜像并未出现在输出中。

这不仅仅是一个边缘案例:在 900 个受控任务中评估的四种现代 LLM 显示,通信拓扑本身就能解释此类约束是否在多跳转发中存活的方差的 7%-40%。这种效应的量级与骨干模型的选择相当。经过验证的镜像在汇聚节点被具有同等语法权威性的冲突输入所取代。那些仅询问是否达成正确任务完成的结果基准无法检测到这一点。结果准确率虽然是单智能体系统的自然起点,但一旦系统部署,它忽略了最重要的失败。

最近的多智能体工作开始超越结果准确率:GEMMAS[19] 引入了基于图的指标,MultiAgentBench[49] 提出了基于里程碑的关键绩效指标(KPI),AgentsNet[13] 评估了不同拓扑下的协调情况。然而,没有任何一项提供定量、可控的工具来衡量智能体在同伴阻力下是否保持硬约束、关键信息是否在多跳转发中存活、错误信念是否通过团队共识传播,或者私有上下文是否在任务边界间泄露(注重隐私的基准[45, 48] 仅在单智能体或单会话设置中处理此问题)。一个多智能体系统可以在所有现有基准上得分良好,但在这四个部署关键维度上全部失败。

在我们的实验中,Llama 3.1 8B Instruct 有 10.1% 的时间违反注入的约束,并且最经常发生跨任务上下文泄露(4.9%);Qwen-3.5-35B-A3B 保持了接近上限的追踪器(RTD 94%),但仍然有 20.7% 的时间传播注入的错误信念;GPT 4.1 mini 和 Gemini 2.5 Flash Lite 表现出不同的中间画像,而这些是结果评估无法检测到的。在所有情况下,团队都产生了语法完整且与任务相关的响应。

案例研究中提到的汇聚型 DAG 模式也具有普适性:在所有四种评估模型中,汇聚拓扑与比线性链高得多的约束丢失相关联。两条流水线可以产生无法区分的输出,但根据它们的智能体如何连接,可能携带截然相反的行为风险画像。

**AgentCollabBench** 是一个旨在部署前使这些漏洞可量化的诊断基准。就像无需崩溃即可标记不安全代码模式的静态分析器一样,其价值在于在生产前表面具体、可审计的风险信号。我们的实验涵盖三个企业领域(软件工程、DevOps 和数据工程)、五种通信拓扑(线性链、分支树、汇聚型 DAG、全连接图和自定义图)、三个复杂度层级、四项指标以及所有人工验证的任务。基准所暴露的行为画像不能由通用能力解释。在标准能力基准上表现强劲的智能体,在我们的行为指标中并不一致地表现良好(表 2)。

<sup>2</sup>代表性故障模式和汇聚型 DAG 追踪审计见附录 C 和 H。

**AgentCollabBench** 做出了三项贡献:

1.  **一个平衡的 900 任务基准**:涵盖软件工程、DevOps 和数据工程;简单、中等和困难的结构复杂度层级;以及五种通信拓扑(线性链、分支树、汇聚型 DAG、全连接图和自定义图)。拓扑维度并非装饰性的:拓扑对 RTD 的影响量级与骨干模型选择相当,在平衡的任务切片中复制的 $\eta^2 = 0.07$–0.40。
2.  **四项诊断指标**:用于同伴压力下约束衰减的指令衰减率(IDR)、用于多跳间信息丢失的放射性追踪器耐久性(RTD)、用于错误信念传播的共识污染率(CPR)以及用于任务边界间私有上下文泄露的跨任务泄露控制(CLC)。
3.  **一个可重用的评估框架**:用于诊断*任何*多智能体 LLM 系统中的行为故障,打包了四项指标、受控工件注入、扰动阶梯构念验证以及评判者-骨干分离协议。所有任务定义、注入工件、评判提示和评分代码均已发布,以便实践者在部署前针对相同的诊断轴对其自己的流水线进行评分。

## 2 相关工作

### 2.1 任务准确率基准

智能体评估已从单智能体结果基准(AgentBench[24]、GAIA[28] 和 SWE-bench[18])向协作设置发展。MultiAgentBench[49] 通过基于里程碑的 KPI 将评估扩展到协作设置,尽管其协调信号仍然是定性的。MAST 分类法[2] 通过对七个框架下 1,642 个执行轨迹的系统性人工分析,提供了细粒度的故障分类,并确定了 14 种故障模式。尽管分析深度十足,但 MAST 使用 LLM-as-a-Judge[4] 范式扩展注释,虽然实现了强大的人工一致性,但产生的是任务完成后分配的定性标签。**AgentCollabBench** 解决了这种缺乏定量、时间接地信号的问题,这些信号对于追踪故障如何在交互期间出现和演变是必需的。

### 2.2 过程级指标和故障动态

评估策略已开始从单纯的任务完成转向内部动态。GEMMAS[19] 从智能体通信结构中推导基于图的指标;Collab-Overcooked[42] 将轨迹效率测量为每智能体步骤的成功完成次数。两者都将轨迹视为给定条件,都没有探究系统在暴露特定故障模式的条件下是否正确行为。互补证据表明,智能体经常因同伴影响而从正确答案转变为错误答案[44],并且多智能体审议因阿谀奉承而恶化[34]:智能体放弃正确的推理以模仿同伴,而不是批判性地评估有缺陷的论点。因为此类交互仍以达成一致告终,所以在掩盖此类失败的粗略指标下,它们看起来是高效的。**AgentCollabBench** 将这一差距操作化为受控同伴压力条件下的连续、每轮指标。

表 1:**AgentCollabBench** 与先前多智能体基准的比较。✓ 支持,✗ 不支持,⚫ 部分支持。属性列:*拓扑轴* = 拓扑作为实验变量变化;*受控注入* = 故意注入刺激以探测故障;*定量行为* = 连续指标与通过/失败或事后标签相对;*扰动* = 分级强度阶梯;*人工 IAA* = Cohen's $\kappa$ 或可比指标。故障模式列 IDR / RTD / CPR / CLC 在第 4 节中定义。† 观察轨迹计数;SWE/DO/DE = 软件工程 / DevOps / 数据工程,HC = 医疗保健。包括单智能体基准的完整表格见表 26。

| 评估属性 | 故障模式覆盖 | 基准 | 任务数 | 领域 | 多智能体, 协作/过程指标 | 拓扑轴 | 受控注入 | 定量行为 | 扰动 | 人工 IAA | IDR | RTD | CPR | CLC |
| :--- | :---: | :--- | :---: | :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: |
| | | Collab-Overcooked[42] | 30 | 游戏 | ✓ | ✗ | ⚫ | ✓ | ⚫ | ⚫ | ✗ | ✗ | ✗ | ✗ |
| | | GEMMAS[19] | 2,482 | 数学 | ✓ | ✗ | ⚫ | ✓ | ⚫ | ✗ | ✗ | ✗ | ⚫ | ✗ |
| | | MultiAgentBench[49] | 550 | 混合 | ✓ | ✓ | ✗ | ✓ | ⚫ | ⚫ | ✗ | ✗ | ✗ | ✗ |
| 多智能体, 故障聚焦 | | MAST[2] | 1,642† | SWE/数学 | ✓ | ✗ | ✗ | ✗ | ✗ | ✓ | ⚫ | ⚫ | ✗ | ⚫ |
| | | AgentsNet[13] | 135 | 图 | ✓ | ✓ | ✗ | ⚫ | ✗ | ✗ | ⚫ | ⚫ | ⚫ | ✗ |
| | | AgentLeak[45] | 1,000 | HC/金融/法律 | ✓ | ⚫ | ✓ | ✓ | ⚫ | ✓ | ✗ | ✗ | ⚫ | ✗ |
| | | **AgentCollabBench** | **900** | **SWE/DO/DE** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** |

### 2.3 故障分类法和智能体间不对齐

Cemri 等人[2] 识别信息保留和推理-行动不匹配作为关键不对齐模式,并表明当智能体缺乏对同伴信息需求的准确模型时,通信协议修复往往不足。Hammond 等人[14] 将协调失误、冲突和共谋描述为主要风险,并突出了信息不对称和网络效应,通过这些效应,局部故障在拓扑中级联。两者都是分类法驱动的而非指标驱动的:它们命名了故障模式,但缺乏定量仪器来测量错误信念在多快渗透到网络中,或者约束在被遗忘前传播了多远。Lin 等人[21] 区分了指令遵循偏差(未能提取关键约束)与长程上下文误用(过度依赖近期上下文),并表明此类错误很少孤立发生,而是传播 across 多步交互链。这为跟踪多智能体交互链中的语义衰减和约束侵蚀提供了结构性指标的动机,而 **AgentCollabBench** 正是实现了这一点。

先前的智能体基准仅覆盖行为鲁棒性的狭窄切片(表 1):协作基准[19, 42, 49] 缺乏受控工件注入;故障聚焦工作[2, 13] 依赖事后标签;隐私基准[45, 48] 将评估限制在固定拓扑上的单一轴上。**AgentCollabBench** 是唯一一个在所有四种故障模式(IDR:约束衰减,RTD:信息丢失,CPR:信念传染,CLC:上下文泄露)上联合提供拓扑变化、受控工件注入、连续行为指标和扰动阶梯验证的基准。

关于多智能体评估框架、协调拓扑、记忆泄露、协调故障和以过程为中心的评估的扩展相关工作见附录 J。

## 3 数据集设计

数据集设计由三项原则指导。**受控探测**:每个任务包含一个精确指定的注入工件,该工件仅激活一个故障机制。这实现了明确的指标归因。**平衡覆盖**:任务网格在所有感兴趣的因素(领域、拓扑和难度)上进行分层,以便模型比较和消融实验不受分布不平衡的混淆。**生态效度**:任务反映多智能体 LLM 系统商业部署中的现实工作流,确保识别的风险对应于现实生活中的故障案例,而非人为构造的边缘情况。

Together, these principles ensure that observed metric differences reflect genuine behavioral properties of the systems under evaluation, not artifacts of task construction.

### 3.1 任务结构和领域

每个 **AgentCollabBench** 条目由任务定义、记录的智能体对话、指标注释和注入工件组成(完整模式见附录 A.2)。三个领域——软件工程、DevOps 和数据工程——反映了多智能体 LLM 系统的常见商业部署上下文,并自然地支持现实主义的注入工件:合规和预算约束在 DevOps 和数据工程流水线中自然产生;虚假的技术声明在软件工作流中普遍存在;跨任务上下文泄露在所有三个领域中都是合理的。

每个任务记录五种通信拓扑之一(线性链、分支树、汇聚型 DAG、全连接图、自定义图)和三个结构复杂度层级之一(详细标准见附录 A.3...

相似文章

Minecraft中面向时间敏感互补协作的多智能体框架

arXiv cs.AI

论文提出了TickingCollabBench,这是一个基于Minecraft的多智能体基准测试,用于动态环境中的时间敏感互补协作任务,并展示了与全局知识预言机相比,大语言模型在此类条件下经常失败。