探索共享工作空间中的人机协同

arXiv cs.AI 论文

摘要

本文研究了共享工作空间中的人机团队协调,使用Collaborative Gym和DiscoveryBench任务,发现如果没有适当的结构,增加协作者可能会降低性能。通过共享组记忆和人在回路门控进行支撑,可以提升性能,尤其是在三人团队中。

arXiv:2606.18413v1 Announce Type: new 摘要:自动化AI代理越来越强大,但许多科学和专业任务仍然需要人类的判断和情境专长。我们研究共享工作空间中的人机团队,其中AI代理和人类协作者必须在提交最终答案之前协调责任。使用Collaborative Gym环境和DiscoveryBench任务,我们考察了何时添加模拟人类协作者能提升性能,以及何时过程损失将额外的协作者转变为协调开销。在1,482个会话中,当团队缺乏协调贡献的结构时,添加相关协作者可能会降低性能。然后我们评估了结合共享组记忆与模拟人在回路(HITL)门控的支撑结构,其中选定的操作需要得到指定模拟参与者的批准。这种支撑结构产生了更高的平均性能,在三人团队中最为明显,具有更清晰的责任信号和更强的专业知识路由到团队行动。总体而言,人机团队如何协调和整合专业知识与其可用的能力同样重要。
查看原文
查看缓存全文

缓存时间: 2026/06/18 05:40

# 1 引言 来源:https://arxiv.org/html/2606.18413 marginparsep 已被更改。topmargin 已被更改。marginparpush 已被更改。页面布局违反了 ICML 样式。请不要更改页面布局,或包含 geometry、savetrees 或 fullpage 等会为您更改布局的包。我们无法可靠地撤销对样式的任意更改。请移除有问题的包或布局更改命令,然后重试。 探索共享工作空间中人类-AI 协作的协同效应 Nachiket Kotalwar¹ Rohini Das¹ Carolyn Rosé¹ ††footnotetext:¹ 卡内基梅隆大学。通讯作者:Nachiket Kotalwar 。ICML’26 人类-AI 共同创造力研讨会,韩国首尔。版权所有 2026 作者。

###### 摘要 自动化 AI 代理的能力日益增强,但许多科学和专业任务仍然需要人类判断和情境专业知识。我们研究共享工作空间的人类-AI 团队,其中 AI 代理和人类协作者必须在提交最终答案前协调职责。利用带有 DiscoveryBench 任务的 Collaborative Gym 环境,我们研究了何时添加模拟人类协作者能提升性能,以及何时过程损耗会将额外的协作者转变为协调开销。在 1482 个会话中,当团队缺乏协调其贡献的结构时,添加相关协作者可能会降低性能。接着,我们评估了一种支架,该支架结合了共享组记忆和模拟人在环中 (HITL) 门控,其中选定的行为需要指定的模拟参与者的批准。这种支架产生了更高的平均性能,在三人团队中最为明显,具有更清晰的职责信号和更强的专业知识向团队行为的路由能力。总体而言,人类-AI 团队如何协调和整合专业知识,与它们可用的能力同样重要。 大多数对 AI 代理的评估问的是自主代理能否完成任务。人类-AI 协作提出了一个不同的问题:一个团队能否将互补的专业知识转化为更好的联合成果?这种区别很重要,因为协作引入了团队失败的新方式。例如,在数据分析任务中,具有领域专业知识的协作者可能识别出相关变量或注意到薄弱证据,但要让这些专业知识发挥作用,团队必须在正确的时间将其浮现出来,路由到正确的决策,并将其带入最终成果。如果这种协调失效,添加具有相关专业知识的协作者可能会增加交互,但不会改善结果。

考古学数据分析任务
数据集
time_series_data.csv
capital.csv
pollen_...csv
...
查询:自数据开始以来,房屋大小和匕首何时第二次同时显著下降?
提交:一个包含正确世纪、标准、变量和证据的假设。
默认团队:无结构协作
AI 代理
数据专家
研究员
加载数据
标准建议
+ 应用标准
编辑假设
提交
支架化团队:结构化协作
AI 代理
数据专家
研究员
加载数据
映射证据
+ 计算
检查标准
编辑假设
提交
图 1:协作结构如何改变提交路径。任务需要提交一个包含相关变量、时间标准和支撑证据的假设。数据专家和研究员通道表示模拟人类协作者配置文件。在默认轨迹中,协作者的输入没有跟进代理的编辑,因此标准建议被错误应用并带入一个无支撑的假设编辑中。在支架化轨迹中,共享组记忆和模拟 HITL 门控在计算和编辑之前路由相关检查。面板总结了完整轨迹中的事件。

经典群体过程研究将这种现象称为过程损耗:当协调无效时,团队无法将成员资源转化为生产力 (Steiner, 1972 (https://arxiv.org/html/2606.18413#bib.bib5))。协调理论将协作视为管理活动之间的依赖性 (Malone and Crowston, 1994 (https://arxiv.org/html/2606.18413#bib.bib6)),而协调忽视描述了团队如何低估相互依赖的贡献所需的整合工作 (Heath and Staudenmayer, 2000 (https://arxiv.org/html/2606.18413#bib.bib7))。人类-AI 团队显示出类似的模式:平均而言,添加 AI 或人类专业知识并不总是有益的 (Vaccaro et al., 2024 (https://arxiv.org/html/2606.18413#bib.bib1)),人们可能过度依赖或误读 AI 的建议,尽管有解释 (Bansal and others, 2021 (https://arxiv.org/html/2606.18413#bib.bib2)),并且当人类和 AI 未能有效结合他们的信号时,专业 AI 辅助的平均收益可能有限 (Agarwal et al., 2023 (https://arxiv.org/html/2606.18413#bib.bib3); Yu et al., 2024 (https://arxiv.org/html/2606.18413#bib.bib4))。因此,我们使用群体过程研究作为共享工作空间人类-AI 团队的设计视角。我们评估了两种协作结构:共享组记忆,它外化了谁知道什么、已经建立了什么证据以及还有哪些检查需要完成;以及模拟 HITL 门控,它要求选定的行动需要指定参与者的批准。这些结构测试了明确化专业知识、职责和证据检查是否能够减少协作代理轨迹中的过程损耗。由于此类失败可能在最终答案出现之前就出现在交互中,因此我们同时评估了提交的假设和过程轨迹。我们专注于共享工作空间协作,其中参与者共享工具、消息和工件,并在任务过程中决定谁做什么 (Shao et al., 2024 (https://arxiv.org/html/2606.18413#bib.bib10))。在这个框架内,我们使用 DiscoveryBench (Majumder and others, 2025 (https://arxiv.org/html/2606.18413#bib.bib17)) 中的考古学任务来研究协作数据分析,这是一个多步骤发现基准,任务需要领域解释、变量映射和证据构建 (图 1 (https://arxiv.org/html/2606.18413#S1.F1))。关键的实证模式是反直觉的:当团队缺乏协调贡献的结构时,添加配置文件化的模拟协作者可能会降低性能。轨迹诊断指出问题在于未分配的职责和薄弱的证据交接,而不仅仅是缺少能力。随后,我们评估了一种支架化设置,该设置结合了共享组记忆和模拟 HITL 门控;有了这种支架,团队表现出更分散的主动性、更清晰的职责信号和更高的平均性能,在三人设置中最为明显。我们的贡献是:
1. 1. 我们扩展了 Collaborative Gym,用于在 DiscoveryBench 上进行受控的人类-AI 团队研究,从而能够系统地改变团队组成和协作结构。
2. 2. 我们表明添加配置文件化的模拟协作者可能会降低性能,并使用轨迹级诊断来检查协调失败如何阻止有用的中间工作到达提交的假设。
3. 3. 我们评估了具有共享组记忆和模拟 HITL 门控的支架化协作,显示出更高的平均性能,在三人设置中最为明显,同时还有职责分配、路由检查和更强证据基础的轨迹级证据。

## 2 相关工作

#### 协作代理基准。
最近的交互式代理环境研究超越孤立答案生成的协作。一些强调社会模拟和可信的角色扮演交互 (Park et al., 2023 (https://arxiv.org/html/2606.18413#bib.bib22); Zhou and others, 2024 (https://arxiv.org/html/2606.18413#bib.bib23));另一些通过主动用户模拟测试主动协助 (Nathani and others, 2026 (https://arxiv.org/html/2606.18413#bib.bib12)),或者在耦合性、异步性、时间约束和时间效率目标下的工作流编排 (Masters and others, 2025 (https://arxiv.org/html/2606.18413#bib.bib16); Sun and others, 2025 (https://arxiv.org/html/2606.18413#bib.bib11); Gonzalez-Pumariega et al., 2025 (https://arxiv.org/html/2606.18413#bib.bib13); Lin et al., 2024 (https://arxiv.org/html/2606.18413#bib.bib14); Zhang and others, 2025 (https://arxiv.org/html/2606.18413#bib.bib15))。这些主要研究基于轮次或任务编排的设置,而不是开放的共享工作空间协调。Collaborative Gym 则支持共享工作空间的人类-AI 协作,包括通信、工具使用、工件编辑以及灵活的非轮次交互 (Shao et al., 2024 (https://arxiv.org/html/2606.18413#bib.bib10)),这与关于协作者如何在联合工作中了解彼此行动的工作空间感知研究相关 (Gutwin and Greenberg, 2002 (https://arxiv.org/html/2606.18413#bib.bib9))。我们基于 Collaborative Gym 和 DiscoveryBench (Majumder and others, 2025 (https://arxiv.org/html/2606.18413#bib.bib17)),通过改变团队规模并为模拟协作者提供不同的私有指导,然后测试团队是否将分布式的证据转化为有支持的科学校准假设。

#### 组记忆和共享理解。
我们的组记忆支架通过使分布式知识更容易定位和使用来针对过程损耗 (Steiner, 1972 (https://arxiv.org/html/2606.18413#bib.bib5))。这一动机也与关于有偏信息采样的经典发现相匹配:群体倾向于更容易地讨论共享信息而非非共享信息,从而限制了分布式专业知识价值 (Stasser and Titus, 1985 (https://arxiv.org/html/2606.18413#bib.bib8))。它借鉴了交互记忆系统,该系统描述了团队如何通过共享对谁知道什么以及如何在工作中检索该知识的意识来协调分布式知识 (Wegner, 1987 (https://arxiv.org/html/2606.18413#bib.bib24); Moreland, 1999 (https://arxiv.org/html/2606.18413#bib.bib28); Lewis, 2003 (https://arxiv.org/html/2606.18413#bib.bib25); Lewis and Herndon, 2011 (https://arxiv.org/html/2606.18413#bib.bib27); Argote and Ren, 2012 (https://arxiv.org/html/2606.18413#bib.bib26))。共享心智模型类似地将团队效能与关于任务、队友和工作流程的共同期望联系起来,包括在人类-AI 团队中 (Mathieu et al., 2000 (https://arxiv.org/html/2606.18413#bib.bib29); Andrews et al., 2023 (https://arxiv.org/html/2606.18413#bib.bib30))。

#### 模拟 HITL 门控和协作控制。
模拟 HITL 门控借鉴了协作脚本,这些脚本使用外部结构通过职责、活动序列和交互动作来指导参与联合工作 (Kollar et al., 2006 (https://arxiv.org/html/2606.18413#bib.bib32); Fischer et al., 2013 (https://arxiv.org/html/2606.18413#bib.bib31))。它们也与关于自动化系统何时应行动、推迟或征求人类输入的混合主动性和自动化控制工作相关 (Horvitz, 1999 (https://arxiv.org/html/2606.18413#bib.bib33); Parasuraman et al., 2000 (https://arxiv.org/html/2606.18413#bib.bib34); Amershi and others, 2019 (https://arxiv.org/html/2606.18413#bib.bib35))。最近的代理评估使用了 HITL 风格抽象,无需实时人类参与者参与评估循环,包括自主研究系统中的定向门控和用于选择性升级的 `ask_human()` 工具 (Liu and others, 2026 (https://arxiv.org/html/2606.18413#bib.bib38); Elfeki and others, 2026 (https://arxiv.org/html/2606.18413#bib.bib39))。在 AutoResearchClaw HITL 消融实验中,定向干预优于密集的逐步监督 (Liu and others, 2026 (https://arxiv.org/html/2606.18413#bib.bib38)),这与人类输入的路径规划(而不仅仅是频率)很重要的观点一致。我们调整了这种门控模式,使得团队自身决定哪些行动需要批准以及由谁批准。

## 3 问题设置

我们遵循 Collaborative Gym 中的表格分析设置 (Shao et al., 2024 (https://arxiv.org/html/2606.18413#bib.bib10))。每个任务实例是一个元组 x = (D, q, y*),其中 D 是一组 CSV 文件,q 是一个自然语言查询,y* 是基准参考假设。一个团队检查数据,在共享工作空间中通信,可以运行分析代码,并通过结果编辑器提交一个假设。我们将这个提交的假设记为 ŷ;它应该识别相关的任务上下文,将查询映射到正确的变量,陈述目标关系,并用来自数据的证据证明该声明。一个会话有参与者 U 并产生一个有序的交互轨迹 τ = ((u_t, a_t, o_t)), t=1 到 T,其中 u_t ∈ U 是在事件 t 时行动的参与者,a_t 是行动,o_t 是产生的观察。每个参与者 u 具有固定的私有指导 π_u,它定义了其协作者配置文件,例如数据分析或研究员指导。当行动的参与者是 u=u_t 时,其行动是 a_t = f_u(x, o_{t-1}, M

相似文章

超越伙伴多样性:基于影响的团队引导框架用于零样本人机协作

arXiv cs.AI

本文提出了基于影响的团队引导(IBTS)框架,用于零样本人机协作。该框架通过影响力塑造发现多样化的交互模式,并将轨迹引导至更强的协调方向。在包含两个智能体与三个智能体的Overcooked-AI实验(包括一项30名受试者的人类研究)中,IBTS在团队表现上优于基线方法。