ProACT:面向多用户协作中故障感知的主动型智能体

arXiv cs.CL 论文

摘要

ProACT 提出了一个面向多用户协作的故障感知智能体框架,该智能体能够主动检测协作故障并决定是否介入。本文还首次提出了用于评估此类主动型智能体的多用户协作基准。

arXiv:2607.03730v1 公告类型: 新提交 摘要:对话式智能体越来越多地嵌入人类协作工作中,但它们本质上仍然是被动和反应式的:它们响应用户的明确请求,而不是像人类协作者通常所做的那样,主动识别团队需要及时干预的时刻。这种反应式设计极大地限制了智能体作为多用户协作中的积极参与者的作用,而在多用户协作中,分歧、模糊的目标、被遗忘的约束、不充分的计划、讨论循环和参与失衡可能会逐渐破坏团队进展。为了让智能体从被动的助手转变为多用户协作中的积极参与者,我们提出了 ProACT,这是一个基于共同基础、协作规划和协调工作理论的故障感知智能体框架。ProACT 观察带说话者归属的对话历史,判断当前轮次是否包含需要干预的协作故障,决定智能体应该保持沉默还是发言,并且在需要发言时,将案例路由到相应的协作技能。我们进一步首次提出了一个多用户协作基准,用于评估跨项目规划、产品设计、研究协作、物流、教育和资源受限决策等场景中的主动型智能体。在 3244 个轮次级别的样本和五个大语言模型(LLM)骨干网络上,ProACT 在协作适当性、非干扰性、简洁性和人工评判的干预质量方面始终优于直接对话。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:38

# 面向多用户协作中的故障感知主动代理
来源:https://arxiv.org/html/2607.03730
舒阳¹,徐迪飞¹,裴佳欣²,王迪¹† ¹阿卜杜拉国王科技大学PRADA实验室 ²斯坦福大学

###### 摘要

对话代理正越来越多地嵌入到人类协作工作中,但它们本质上仍然是**被动的**和**反应性的**:它们响应用户的显式请求,而不是像人类协作者那样主动识别团队需要及时干预的时刻。这种反应式设计极大地限制了代理作为多用户协作中积极参与者的能力。在多用户协作中,分歧、模糊的目标、被遗忘的约束、不明确的计划、讨论循环以及参与不均等问题会逐渐削弱团队进展。为了让代理从被动的助手转变为多用户协作中的主动参与者,我们提出了ProACT——一个基于共同基础、协作规划和协调工作理论的故障感知代理框架。ProACT观察带有发言者的对话历史,判断当前轮次是否包含需要干预的协作故障,决定代理应该保持沉默还是发言,并且在需要发言时,将案例路由到目标协作技能。我们进一步引入了首个用于评估多用户协作中主动代理的基准测试,涵盖项目规划、产品设计、研究合作、物流、教育和资源受限决策等场景。在3244个轮次级别的示例和五个LLM主干网络上,ProACT在协作适当性、非干扰性、简洁性和干预质量评判方面均优于直接聊天。

ProACT: 面向多用户协作中的故障感知主动代理

††脚注:通讯作者

## 1 引言

基于大型语言模型(LLM)的代理正越来越多地嵌入到我们的协作工作流程中:它们可以帮助总结会议(Kirstein 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib35))、起草计划(Wei 等人,2025 (https://arxiv.org/html/2607.03730#bib.bib29))、编写代码(Jimenez 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib36))以及进行审议(Abdelnabi 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib38);Zhu 等人,2025 (https://arxiv.org/html/2607.03730#bib.bib40))。尽管角色日益增长,现有的部署代理本质上仍然是**被动的**和**反应性的**。它们等待用户显式地提出问题、发出指令或提供预定义的计划并提示它们执行。这种设计错过了许多代理可以积极参与协作而不仅仅是按需辅助的时刻。

参见图注
图1:将代理从多用户协作中的被动辅助转变为主动参与的示意图。

具体而言,在多用户场景中,当参与者在共同理解、承诺、责任或活跃约束上失去一致性时,协作故障常常出现(Clark 和 Brennan, 1991 (https://arxiv.org/html/2607.03730#bib.bib2); Grosz 和 Kraus, 1996 (https://arxiv.org/html/2607.03730#bib.bib5))。这些失败很少是突然发生的;它们通过微小的协调差距逐渐累积。例如,一个参与者可能追求速度,而另一个追求质量,从而产生任务或优先级冲突(Jehn, 1995 (https://arxiv.org/html/2607.03730#bib.bib4));一个团队可能反复讨论同一个未解决的决策,却没有意识到讨论已经陷入了循环。

在这种情况下,将代理从多用户协作中的被动辅助转变为主动参与可能会非常有帮助,如图1 (https://arxiv.org/html/2607.03730#S1.F1) 所示。为了实现这一目标,我们提出了ProACT——一个面向代理的故障感知主动框架,它持续观察多方对话并维护一个结构化的协作状态。与先前的工作(如 Lu 等人,2025 (https://arxiv.org/html/2607.03730#bib.bib37))不同,后者侧重于从单用户输入预测用户意图,我们认为协作中的主动代理需要与单用户主动辅助不同的公式。协作中的主动代理不仅要问“如何帮助单个用户”,还必须问:“在用户可能具有不同、不确定或冲突意图的群体互动中,我何时应该干预?”这引入了单用户互动中基本不存在的社交和规范挑战。因此,ProACT持续主动检测正在出现的故障,例如冲突、不确定性、不明确的计划、被遗忘的约束和讨论循环。当某个故障需要干预时,ProACT选择目标协作技能,并且仅在简洁、中立的干预可能改善协调而不打断富有成效的讨论时才发言。

为了验证ProACT,我们引入了一个用于评估多用户协作中主动代理的基准测试。每个示例呈现一个多方对话历史,并询问代理是保持沉默还是生成一个简洁的面向群体的干预。该基准测试涵盖研究合作、GitHub问题讨论、项目协调、产品设计、物流、教育、资源受限决策以及其他协作场景,共生成3244个轮次级别的示例。我们从四个方面评估代理:干预是否针对有证据基础的故障、是否避免打断富有成效的协作、是否保持简洁,以及整体干预质量。在五个LLM主干网络上,ProACT在协作适当性、非干扰性、简洁性和干预质量评判方面均优于基线,表明故障感知的技能路由有助于代理决定何时发言以及如何干预。

## 2 相关工作

#### 多用户协作

多用户协作的核心是共同的社会活动,参与者在此活动中维护共同基础、协商共同承诺,并协调相互依赖的行动,以实现共享或演变中的目标(Bratman, 1992 (https://arxiv.org/html/2607.03730#bib.bib6); Clark 和 Brennan, 1991 (https://arxiv.org/html/2607.03730#bib.bib2); Grosz 和 Kraus, 1996 (https://arxiv.org/html/2607.03730#bib.bib5); Malone 和 Crowston, 1994 (https://arxiv.org/html/2607.03730#bib.bib3))。在这种情境下,进展取决于参与者是否在对已理解的内容、已决定的事项、谁负责、哪些约束仍然有效以及谁的观点缺失等方面保持一致。先前的研究表明,任务和过程冲突(Jehn, 1995 (https://arxiv.org/html/2607.03730#bib.bib4))、基础建立和会话修复的失败(Schegloff 等人,1977 (https://arxiv.org/html/2607.03730#bib.bib14); Clark 和 Brennan, 1991 (https://arxiv.org/html/2607.03730#bib.bib2))、未管理的依赖和衔接工作(Malone 和 Crowston, 1994 (https://arxiv.org/html/2607.03730#bib.bib3); Schmidt 和 Bannon, 1992 (https://arxiv.org/html/2607.03730#bib.bib17))、低效的群体决策过程(DeSanctis 和 Gallupe, 1987 (https://arxiv.org/html/2607.03730#bib.bib18); Briggs 等人,2003 (https://arxiv.org/html/2607.03730#bib.bib19)),以及集体解决问题中的参与不均或信息缺失(Stasser 和 Titus, 1985 (https://arxiv.org/html/2607.03730#bib.bib1); Woolley 等人,2010 (https://arxiv.org/html/2607.03730#bib.bib21)),都会削弱协作。这些研究表明,有效的协作需要持续关注共同理解、责任、约束、决策进展和参与平衡。这激发了主动代理的研发,使其能够识别正在出现的协调问题,并且仅在简洁、中立的贡献可能帮助群体前进时进行干预。

#### 用于协调的LLM代理

关于LLM代理的最新工作表明,语言模型可以被组织为通过显式交互协议进行推理、行动、交流和协调的代理。早期的代理框架将推理与工具使用紧密结合,在规划步骤和外部行动(例如,调用API或使用搜索)之间交替(Yao 等人,2023 (https://arxiv.org/html/2607.03730#bib.bib26)),而多代理系统(如AutoGen、CAMEL和MetaGPT)通过对话、角色分配、工作流分解或动态代理分组来协调多个LLM代理(Wu 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib27); Li 等人,2023a (https://arxiv.org/html/2607.03730#bib.bib28); Hong 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib30))。最近的系统(如Magentic-One)采用了编排器式的架构,其中主代理进行规划、跟踪进展并将子任务委托给专门的代理(Fourney 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib33))。其他工作评估了LLM代理在实践中的协调能力,包括协调博弈、心智理论信念追踪以及以社会心理学为导向的共识与辩论分析(Agashe 等人,2025 (https://arxiv.org/html/2607.03730#bib.bib34); Li 等人,2023b (https://arxiv.org/html/2607.03730#bib.bib41); Zhang 等人,2024 (https://arxiv.org/html/2607.03730#bib.bib42))。尽管取得了这些进展,但这些设置主要关注单用户任务辅助或*代理之间的*协调,通常是在指定任务或工作流下进行的,而非代理参与持续的*人类*多用户协作。我们的研究将LLM代理嵌入到多方人类讨论中,关键挑战在于决定*何时*主动干预以及*如何*在不打断团队的情况下提供帮助。

## 3 定义

### 3.1 多用户协作环境

多用户协作环境是一个共享的交流空间,一组参与者 U = {u₁, ..., uₙ} 在其中为一项或多项任务而工作,目标、约束、角色和承诺是不断演变的。在时间步 t,观察到的交互前缀被表示为带有发言者的消息序列:H_t = (x_i)_{i=1}^t。对于每个轮次 i ∈ {1, ..., t},消息定义为 x_i = (s_i, c_i),其中 s_i ∈ U 表示发言者,c_i 表示消息内容。与单用户辅助相比,这种环境涉及多个参与者,他们在目标、偏好、知识、责任和权威方面可能存在差异,如 Yang 等人(2026 (https://arxiv.org/html/2607.03730#bib.bib44))所述。代理观察共享的交互历史,并决定是保持沉默还是向同一交流渠道做出贡献。这种设置使主动协作成为一个时机和协调问题:代理必须决定其贡献何时有助于群体前进,以及何时保持沉默以避免打断富有成效的讨论。

### 3.2 协作故障

根据第2节 (https://arxiv.org/html/2607.03730#S2.SS0.SSS0.Px1) 中关于人类协作的先前工作,我们将**协作故障**定义为一个有证据基础的状态,如果未能及时修复,群体可能会失去进展、共同理解、协调质量或公平参与。分歧、不确定性或延迟,当它通过模糊意图、隐藏权衡、违反约束、不明确计划、重复未解决问题或排除相关视角而阻碍协作时,就成为故障。

表1 (https://arxiv.org/html/2607.03730#S3.T1) 总结了本工作中使用的故障类别。该分类法操作化了人类协作中研究的常见失败模式:任务和过程冲突(Jehn, 1995 (https://arxiv.org/html/2607.03730#bib.bib4))、基础建立和会话修复(Schegloff 等人,1977 (https://arxiv.org/html/2607.03730#bib.bib14); Clark 和 Brennan, 1991 (https://arxiv.org/html/2607.03730#bib.bib2))、协调和衔接工作(Schmidt 和 Bannon, 1992 (https://arxiv.org/html/2607.03730#bib.bib17); Malone 和 Crowston, 1994 (https://arxiv.org/html/2607.03730#bib.bib3))、群体决策过程(DeSanctis 和 Gallupe, 1987 (https://arxiv.org/html/2607.03730#bib.bib18); Briggs 等人,2003 (https://arxiv.org/html/2607.03730#bib.bib19)),以及集体解决问题中的参与不均或视角缺失(Stasser 和 Titus, 1985 (https://arxiv.org/html/2607.03730#bib.bib1); Woolley 等人,2010 (https://arxiv.org/html/2607.03730#bib.bib21))。我们使用这些类别来判断当前轮次是否包含值得干预的协作问题,详细定义见表1 (https://arxiv.org/html/2607.03730#S3.T1)。

表1:多用户互动中观察到的协作故障。

### 3.3 主动协作

主动协作指代理在多用户对话的每一轮中,在未被显式请求之前,决定是保持沉默还是提供面向群体的干预的能力。目标是当贡献能够修复正在出现的协作故障时支持群体过程,同时在参与者已经取得进展时避免不必要的打断。给定对话历史 H_t,主动代理选择一个动作 a_t ∈ {∅, u_t},其中 ∅ 表示沉默,u_t 表示可见的面向群体的干预。只有当对话中包含值得干预的故障证据、所选干预与协作问题匹配,并且回应可能在不打断富有成效讨论的情况下帮助群体前进时,非沉默动作才是合适的。

该定义直接关联到我们在第5.2节 (https://arxiv.org/html/2607.03730#S5.SS2) 中的评估标准。一项干预应该*适当*,即它针对一个有证据基础的协作问题;*非干扰性*,即当群体已经在进展或自我修复时代理保持沉默;以及*简洁*,即回应支持协作而不主导对话。

## 4 ProACT: 面向多用户协作中的故障感知主动代理

参见图注
图2:ProACT轨迹示例。代理监控多用户对话,检测正在出现的协作故障(如讨论循环或冲突),并应用目标技能(如打破循环或调解冲突)。该图展示了ProACT如何识别循环讨论,并以简洁、有证据基础的建议进行干预,引导群体走向解决方案。

ProACT是一个基于技能的框架,用于基于LLM的多用户协作中的主动参与。基于第3节 (https://arxiv.org/html/2607.03730#S3) 中的定义,ProACT观察不断演变的带有发言者的对话历史,并决定代理应该保持**沉默**还是生成一个目标**干预**。该框架首先诊断当前轮次是否包含值得干预的协作故障,然后将干预案例路由到相关的协作技能。每个技能被指定为一个轻量级的操作程序,包含触发条件、诊断线索、推理步骤、社交约束和输出契约。这种结构将主动参与转化为一个基于证据的决策过程,干预仅在适当、非干扰且简洁时发生。第4.1节 (https://arxiv.org/html/2607.03730#S4.SS1) 详细说明了决策流水线,第4.2节 (https://arxiv.org/html/2607.03730#S4.SS2) 呈现了

相似文章

预见与学习:在主动式智能体中释放空闲时间计算能力

Hugging Face Daily Papers

ProAct 是一种主动式智能体架构,利用空闲时间计算来预见用户需求,提升任务完成的效率与准确性。它引入了 ProActEval 基准测试,涵盖 40 个领域的 200 个场景,相比被动式基线取得了显著提升:所需交互轮次减少 14.8%,用户努力降低 11.7%,幻觉率下降 28.1%。

AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者

arXiv cs.CL

本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。

AgentCo-op: 基于检索的可互操作多智能体工作流合成框架

arXiv cs.AI

AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。