CoWeaver:面向人与智能体混合科学协作的双向、可学习且可解释的匹配引擎

arXiv cs.AI 论文

摘要

CoWeaver是一种双向、可学习且可解释的匹配引擎,旨在通过填补能力差距、两阶段排序和不确定性感知探索,在科学网络中促成人类与基于LLM的智能体之间的强大协作。

arXiv:2607.15545v1 公告类型:交叉 摘要:基于LLM的智能体在撰写文章、编码和信息检索方面表现出色。然而,由于问题的双向性、动态性以及对决策可解释性的高要求,它们未能与科学社区形成强有力的协作。我们提出了COWEAVER,一种双向、可学习且可解释的算法,用于匹配科学家并在人-智能体网络中形成强有力的协作。COWEAVER通过填补能力差距来匹配候选人和请求者,并通过两阶段排序步骤筛选候选人。最后,该模型通过维护具有不确定性感知的能力估计,并通过请求者的反馈进行更新,来探索新加入者。我们表明,COWEAVER将探索(UCB)和贪婪相结合的选择机制,在20个任务中的6个任务上超过了纯贪婪机制(分析最优解),并在选择最佳候选者方面与纯贪婪机制表现相当。我们比较了COWEAVER在匹配质量和效率方面的基线。COWEAVER在所有指标上均优于基线。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:26

# CoWeaver:面向人机混合科学协作的双向可学习可解释匹配引擎

**来源:** https://arxiv.org/html/2607.15545

Jiayao Gu¹,²,\* Kexin Chu³,\* Peidong Liu⁴ Yue Yang⁵ Lynn Ai⁶ Qi Zhang⁷ Ling Yang⁸ Tianyu Shi¹

###### 摘要

基于 LLM 的智能体在撰写文章、编码和信息检索方面表现出色。然而,由于问题的双向性、动态性以及对决策可解释性的高要求,它们在科学社区内难以形成强有力的协作。我们提出了 **CoWeaver**,一种双向、可学习且可解释的算法,用于匹配研究人员并在人机网络中形成强大的协作关系。CoWeaver 通过填补能力缺口来匹配候选者和请求者,并通过两阶段排序步骤过滤候选者。最后,该模型通过维护不确定性感知的能力估计,并根据请求者的反馈更新这些估计,来探索新加入者。我们展示了 CoWeaver 结合探索(UCB)和贪婪选择的机制在 20 个任务中的 6 个上优于仅贪婪机制(分析上的最佳解决方案),并且在选择最佳候选者方面与仅贪婪机制表现相当。我们在匹配质量和效率方面比较了 CoWeaver 的基线方法。CoWeaver 在所有指标上均优于基线方法。

†\* 代码和数据:https://anonymous.4open.science/r/CoWeaver-8B0B。

---

# CoWeaver:面向人机混合科学协作的双向可学习可解释匹配引擎

Jiayao Gu¹,²,\* Kexin Chu³,\* Peidong Liu⁴ Yue Yang⁵ Lynn Ai⁶ Qi Zhang⁷ Ling Yang⁸ Tianyu Shi¹ †

¹麦吉尔大学。²米拉 – 魁北克人工智能研究所。³康涅狄格大学。⁴四川大学。⁵斯坦福大学。⁶Gradient。⁷独立研究者。⁸普林斯顿大学。

\* 这些作者对本文贡献相等。

通信邮箱:[email protected]

## 1 引言

基于大型语言模型(LLM)开发的智能体在回答问题、编写代码和检索信息方面变得越来越有能力。然而,这些系统在需要持续协调、激励对齐和可行性检查的社会和科学环境中的协作形成任务上仍然存在困难。最近对 LLM 协作智能体的评估表明,尽管前景光明,但这些系统在现实的协调压力下往往不稳定,并且可能无法形成持久、高价值的人机伙伴关系(Huang 等人,2025(https://arxiv.org/html/2607.15545#bib.bib13);Sun 等人,2025(https://arxiv.org/html/2607.15545#bib.bib16);Zhang 等人,2024(https://arxiv.org/html/2607.15545#bib.bib19);Jhamtani 等人,2025b(https://arxiv.org/html/2607.15545#bib.bib14))。本文研究混合人机网络中的**协作匹配**,并以科学协作为激励场景。

这类匹配的需求在早期职业研究人员中尤为明显,他们通常先知道研究瓶颈,然后才了解合适的合作者。在一项 HuMAS 学术协作智能体调查中,44% 的受访者表示,当遇到瓶颈时,他们会首先向导师或领域专家寻求帮助;81% 的受访者描述他们最重要的合作者在专业知识上是部分或高度互补的。这些回答反映了以下技术要求:协作匹配应识别互补能力,推理对双方的价值,并筛选可行性,而不是对全局相似的档案进行排名。更多动机证据见附录 C(https://arxiv.org/html/2607.15545#A3)。

科学研究很少是单一智能体的问题。一个项目可能需要领域专业知识、实验基础设施、数据访问、写作经验和持续执行,而任何单个研究人员或智能体只能覆盖这部分空间的一部分。现有系统仅部分解决了这一挑战。推荐系统和多利益相关者推荐建模偏好、曝光度、冷启动和平台端目标(Adomavicius and Tuzhilin, 2005(https://arxiv.org/html/2607.15545#bib.bib2);Bobadilla 等人, 2013(https://arxiv.org/html/2607.15545#bib.bib3);Abdollahpouri 等人, 2020(https://arxiv.org/html/2607.15545#bib.bib9);Burke 等人, 2025(https://arxiv.org/html/2607.15545#bib.bib10));专家团队形成强调技能覆盖和协作文构(Lappas 等人, 2009(https://arxiv.org/html/2607.15545#bib.bib7);Saeedi 等人, 2025(https://arxiv.org/html/2607.15545#bib.bib11));稳定和学习的匹配市场在稳定性或不确定性假设下推理双边偏好(Gale and Shapley, 1962(https://arxiv.org/html/2607.15545#bib.bib6);Li 等人, 2025(https://arxiv.org/html/2607.15545#bib.bib12));最近的 LLM 智能体系统研究智能体协调和人机合作(Huang 等人, 2025(https://arxiv.org/html/2607.15545#bib.bib13);Jhamtani 等人, 2025b(https://arxiv.org/html/2607.15545#bib.bib14);Wang 等人, 2025(https://arxiv.org/html/2607.15545#bib.bib15);Sun 等人, 2025(https://arxiv.org/html/2607.15545#bib.bib16))。

总的来说,这些工作仅部分覆盖了实际协作形成的要求:现有方法通常专精于能力覆盖、双方价值、硬可行性约束或冷启动处理中的一个或两个维度。缺少的是一个集成模型,能够同时处理所有这四个维度,用于混合人机匹配:填补具体的能力缺口,建模匹配对双方的价值,强制执行不可协商的可行性约束,并支持观察不足的参与者。这激发了对专用匹配模型的需求。

核心难点在于协作形成不仅仅是排序问题。合适的候选者必须能够填补请求者缺失的能力,但任务也必须为候选者提供足够的价值。此外,请求者与候选者之间的匹配会改变许多因素的未来状态——沟通成本、协调摩擦、完成任务的可能性、合作者之间的信任、后续反馈等等。这使得问题具有双向性、动态性和不可预测性。这也使得模型的可解释性成为一个重要因素——除非系统能够说明填补了什么缺口、满足了什么激励、检查了哪些约束,否则用户不太可能接受协作建议。

我们的设计基于一个简单原则:一种能够主动为特定任务在潜在合作者之间建立强联系的方法。在科学社区内,这意味着需要联合考虑人类研究人员、代表用户目标的代理智能体、提供专业能力的服务智能体,以及可在工作中调用的可复用技能。因此,匹配引擎应该更像一个协调层,而不是一个静态推荐器:它观察网络,识别互补机会,过滤不安全或不可行的链接,并从协作结果中学习。

我们引入了 **CoWeaver**,一种双向、可学习且可解释的算法,用于匹配请求者和候选者,以在混合科学家-智能体网络中形成强大的科学协作。该系统在共享的语义状态空间中表示人类和智能体,每个参与者由一个紧凑的能力、任务意图、约束和协作历史向量表示,通过 MapScore 估计双向匹配值,并通过显式的门控变量将硬约束与效用排序分开。然后,它使用一个两阶段流水线:分析粗排阶段通过能力互补性和动机匹配高效地对候选者进行排序,而基于模拟的重排阶段则根据包括但不限于时区差异、日程差异、协作风格在内的软特质进一步过滤候选者。最后,模型维护不确定性感知的能力估计,并根据反馈更新这些估计,从而允许探索冷启动候选者,同时逐渐收敛到可靠的匹配。

我们的主要贡献如下:

- • 我们提出了一种针对混合人机网络的双向协作匹配机制,其中能力缺口、参与者动机、不确定性和硬可行性约束被联合建模。
- • 我们设计了 MapScore 和一个两阶段规划流水线,结合了可解释的分析匹配与基于模拟的协作评估,旨在平衡可扩展性和过程级别的真实感。
- • 我们实现了 CoWeaver,一个用于科学协作中人机混合网络的端到端匹配引擎。

## 2 方法

参见图注 图 1:CoWeaver 作为用于混合人机科学协作的双向、可学习且可解释的匹配引擎概览。

### 2.1 概述

给定一个请求者 uu,一个任务 TT,以及一个候选池 C\mathcal{C},CoWeaver 返回一个排序的协作者列表或一个小型团队提案。我们将每个可选的人类、代理智能体、服务智能体或可复用技能称为一个*候选者*。与一次性推荐不同,该系统组织为一个闭环匹配流水线:它表示异构候选者,估计双向协作价值,将分数分解为可解释因素,规划候选者连接,通过 LLM Dreaming 精炼有希望的匹配,并根据反馈更新其估计。图 1 (https://arxiv.org/html/2607.15545#S2.F1) 提供了设计概览。我们随后将在 §2.2 到 2.5 中介绍我们设计的每一层。关键思想是将快速的分析匹配与较慢的过程级推理分开。MapScore 作为分析匹配分数,用于估计候选者对请求者是否有用以及任务对候选者是否有价值。闭式归因层公开了哪些请求者侧需求和候选者侧需求驱动了分数。规划利用这个分数构建候选名单或团队提案,而 LLM Dreaming 则保留给候选者,在这些候选者中沟通风险、角色冲突和优先级错配更为关键。反馈循环随后更新能力估计、不确定性和评分权重。

### 2.2 表示层

每个用户 vv 由能力、需求和约束表示:
sv=(Capv,Needv)。\mathbf{s}_{v}=(\mathbf{Cap}_{v},\mathbf{Need}_{v})。

能力集是开放式的:
Capv={(eiv,piv,σiv)}i=1nv,
\mathbf{Cap}_{v}=\{(\mathbf{e}_{i}^{v},p_{i}^{v},\sigma_{i}^{v})\}_{i=1}^{n_{v}},
其中 eiv\mathbf{e}_{i}^{v} 是语义嵌入,piv∈[0,1]p_{i}^{v}\in[0,1] 是估计的熟练度,σiv\sigma_{i}^{v} 是不确定性。需求记录了用户 vv 在领域 kk 中需要帮助的程度:
Needv={nvk}k=1k=K∈[0,1]K。
\mathbf{Need}_{v}=\{n_{v}^{k}\}_{k=1}^{k=K}\in[0,1]^{K}。

这种共享表示允许人类、代理智能体、服务智能体和可复用技能进入相同的匹配空间,同时保留特定于类型的约束。

一个任务表示为 T=(GT,QT,OT,LT,XT),T=(G_{T},\mathbf{Q}_{T},\mathbf{O}_{T},\mathbf{L}_{T},\mathbf{X}_{T}),
其中 GTG_{T} 是目标,QT\mathbf{Q}_{T} 包含能力需求,OT\mathbf{O}_{T} 包含提供或激励,LT\mathbf{L}_{T} 包含硬约束,XT\mathbf{X}_{T} 提供上下文。需求与提供之间的区别至关重要:需求支持请求者侧的空缺估计,而提供支持候选者侧的参与价值。额外的表示细节见附录 B.1 (https://arxiv.org/html/2607.15545#A2.SS1)。

### 2.3 MapScore:双向匹配

MapScore 是核心的分析匹配分数。它首先强制执行非补偿性的可行性,然后按双向协作价值对可行配对进行排序。它不是相似度分数;它通过结合两个不对称问题来估计任务条件下的协作价值:候选者是否覆盖了请求者的 Needu\mathbf{Need}_{u},以及任务 TT 是否满足了候选者的 Needv\mathbf{Need}_{v}。形式上,
M(u,v,T)=\displaystyle M(u,v,T)=σ(u,v,T)[λScap(u,v,T)\displaystyle\ \sigma(u,v,T)\Big[\lambda S_{\mathrm{cap}}(u,v,T)+(1−λ)Sneed(v,T)],\displaystyle\quad+(1-\lambda)S_{\mathrm{need}}(v,T)\Big],
其中 ScapS_{\mathrm{cap}} 衡量能力缺口覆盖,SneedS_{\mathrm{need}} 衡量参与价值匹配,λ∈(0,1)\lambda\in(0,1) 从反馈中学习,σ(u,v,T)\sigma(u,v,T) 是硬可行性门控。

对于任务需求 jj,我们首先通过语义匹配估计请求者的当前覆盖度 p~uj\tilde{p}_{u}^{j},并将残差缺口定义为
Gapj(u,T)=max(0,qj−p~uj)。
\mathrm{Gap}_{j}(u,T)=\max(0,q_{j}-\tilde{p}_{u}^{j})。

能力项 ScapS_{\mathrm{cap}} 随后汇总候选者 vv 能覆盖这个残差缺口的程度。参与项 SneedS_{\mathrm{need}} 将任务提供与候选者需求进行匹配,防止系统将候选者视为被动资源。两个项的完整基于注意力的计算见附录 B.1 (https://arxiv.org/html/2607.15545#A2.SS1)。由于这两个软效用项都汇总了明确的需求和需求因素,MapScore 也支持闭式归因,进一步描述见附录 B.2 (https://arxiv.org/html/2607.15545#A2.SS2)。

### 2.4 规划与 LLM Dreaming

对于一对一匹配,规划器为每个候选者计算 MapScore,过滤不可行的配对,并按分数对剩余候选者进行排序。对于一对 NN 匹配,规划器维护一个残差能力缺口 R\mathbf{R},并贪婪地添加具有最大边际价值的可行候选者:
Δ(v∣S)=\displaystyle\Delta(v\mid\mathcal{S})=σ(u,v,T)[ρ∑jmin(Rj,cvj)∑jRj+ε\displaystyle\ \sigma(u,v,T)\Bigg[\rho\frac{\sum_{j}\min(R_{j},c_{v}^{j})}{\sum_{j}R_{j}+\epsilon}+(1−ρ)Sneed(v,T)],
\displaystyle\quad+(1-\rho)S_{\mathrm{need}}(v,T)\Bigg],
其中 ρ\rho 平衡残差能力覆盖和候选者侧价值(算法 1 (https://arxiv.org/html/2607.15545#alg1))。

**算法 1** 残差缺口团队构建

1: S←∅\mathcal{S}\leftarrow\varnothing;R←Gap(u,T)\mathbf{R}\leftarrow\mathbf{Gap}(u,T)
2: **while** ‖R‖1>ε\|\mathbf{R}\|_{1}>\varepsilon **do**
3:    v∗←argmaxv∈C∖SΔ(v∣S)v^{*}\leftarrow\arg\max_{v\in\mathcal{C}\setminus\mathcal{S}}\Delta(v\mid\mathcal{S})
4:    **if** Δ(v∗∣S)≤0\Delta(v^{*}\mid\mathcal{S})\leq 0 **then**
5:        **break**
6:    **end if**
7:    S←S∪{v∗}\mathcal{S}\leftarrow\mathcal{S}\cup\{v^{*}\}
8:    Rj←max(0,Rj−cv∗j)R_{j}\leftarrow\max(0,R_{j}-c_{v^{*}}^{j}) **for all** jj
9: **end while**
10: **return** S\mathcal{S}

这种残差缺口策略提供了对基于覆盖的团队形成的可扩展近似(Lappas 等人, 2009(https://arxiv.org/html/2607.15545#bib.bib7))。

分析分数是高效的,但由于软过程级因素,协作仍可能失败。因此我们应用 **LLM Dreaming**。对于每个请求者-候选者对,我们使用他们的结构化档案实例化两个角色条件化智能体:能力、需求、可用性、时区、截止日期压力、协作风格、沟通偏好、个性备注和排序后的优先级。智能体就目标任务进行简短的模拟谈判,包括在 100 点努力预算上的具体工作分配权衡,以便模型能够暴露

相似文章

AgentCo-op: 基于检索的可互操作多智能体工作流合成框架

arXiv cs.AI

AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。

弱链优化:多智能体推理与协作框架

arXiv cs.CL

本论文提出WORC框架,这是一个针对多智能体LLM系统的弱链优化框架,通过基于元学习的权重预测和不确定性驱动的资源分配来识别并强化表现不佳的智能体,在推理基准上达到82.2%的准确率,同时提升了系统稳定性。

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。