AgentRoom:基于CRDT的并发多智能体编码共享工作空间

arXiv cs.AI 论文

摘要

AgentRoom是一种用于并发编码智能体的实时协作编辑协议,采用CRDTs,可减少任务放弃并相比顺序或并行方法改善协调性。

arXiv:2608.23740v1 公告类型:新 摘要:并发多智能体编码有望实现跨模块分工、通过冗余增强鲁棒性,以及在多文件项目的自然粒度上进行并行探索。实时协作编辑协议通过无冲突复制数据类型(CRDTs)解决了人类团队的协调问题,但底层LLM一次生成一个token,现有多个智能体编码系统继承了这一串行限制:它们要么通过阶段交接顺序安排智能体,要么汇集独立样本而不进行协调,单个智能体在硬任务中放弃率高达一半,采用单文件桩退出。AgentRoom是一种用于并发编码智能体的实时协作编辑协议。其运行时层在CRDT合并的共享文件系统上将文件级别的声明、状态和广播作为MCP工具暴露。五个前沿编码CLI模型运行了四个后端编码任务,使用Python DevBench和Rust+axum进行跨语言检查。对于CLI稳定的模型,使用2个智能体的AgentRoom放弃的任务比单智能体少,且运行间变异较小。在匹配计算量时,一个正向的平均LLM评判对比显示AgentRoom优于并行合并。另一个对比,捆绑探针,显示完整的AgentRoom高于每个部分情况:这是一个顺序而非百分比划分。协调,而不是并行或CRDT合并,承担了重任。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:12

# 基于CRDT支持的共享工作区的并发多智能体编码  
来源:https://arxiv.org/html/2608.23740  

## AgentRoom:基于CRDT支持的共享工作区的并发多智能体编码  
Donghyun Lee  
所属机构:加州大学伯克利分校  

###### 摘要  
并发多智能体编码有望实现模块间的劳动力分配、通过冗余机制增强鲁棒性,并以多文件项目的自然粒度进行并行探索。实时协同编辑协议通过无冲突复制数据类型(CRDT)为人类团队解决了这一协调问题,但底层的LLM每次仅生成一个token,现有的多智能体编码系统继承了这一串行限制:它们要么让智能体通过阶段交接顺序执行,要么在没有协调的情况下汇集独立样本;单个智能体在处理高难度任务时,可能因“单文件存根并退出”而放弃高达一半的任务。AgentRoom是一种用于并发编码智能体的实时协同编辑协议。其运行时层在CRDT合并的共享文件系统之上,将文件级的声明、状态和广播作为MCP工具暴露出来。五个前沿编码CLI模型执行了四个后端编码任务,并在Python DevBench和Rust+axum中进行了跨语言检查。对于CLI稳定的模型,使用两个智能体的AgentRoom放弃的任务数量少于单体模式,且运行间波动更小。在匹配计算量下,LLM评委对比的正向平均差值使AgentRoom优于并行合并。另一项对比(捆绑探针)显示,完整的AgentRoom优于所有部分情况:这是一种排序而非百分比的划分。协调能力,而非并行性或CRDT合并,承担了主要负载。  

## 1 引言  
多智能体编码系统(Qian等人,2024;Hong等人,2024;Nguyen等人,2024;Huang等人,2024;Ishibashi与Nishimura,2024;Pan等人,2026;Islam等人,2025;Peng等人,2026;Zhu等人,2025;Wu等人,2023;Wang等人,2025;Park等人,2023;Chen等人,2023;Shinn等人,2023;Ashrafi等人,2025;Grötschla等人,2025;Shafin等人,2025)主要采用顺序轮流执行:设计→实现→评审,每个智能体等待前一个完成。通过CRDT进行的隐式并发协调已被探索,但结果不一(任务速度提升21%/减慢39%)。本文要解决的问题是:在匹配计算量下,基于CRDT合并共享工作区的*显式*协调能否优于顺序执行和隐式CRDT这两种替代方案。  
**系统**。AgentRoom是面向并发编码智能体的*状态管理室*:一个结构化的运行时对象,具有文件级声明语义、仅追加的广播日志以及每个智能体的状态,通过少量模型上下文协议(MCP)工具(room_claim、room_release、room_state、room_broadcast、room_read)暴露给智能体,建立在CRDT合并的共享文件系统之上。  
**对比**。AgentRoom使用了与CodeCRDT不同的协调范式,后者通过隐式推断进行协调并预分配大纲编写者和实现者角色:AgentRoom用显式房间和咨询协议(第2.3节)取代了两者,无需角色预分配或编排式交接。我们在第4节中在匹配计算量下进行对比:智能体保持不变,但以不同方式组合。  

**图1**:T4六条件协调消融实验:AgentRoom为最高条件,而无协调的并发执行(并行合并)和顺序交接(ChatDev风格)均低于单智能体基线。  

**发现**:我们发现AgentRoom中的两个智能体*抑制了单智能体的“存根并退出”失败模式*(智能体输出一个文件的源码骨架并提前退出,认为任务过于困难):在所有12个模型×任务层中,汇总的Cochran-Mantel-Haenszel(CMH)估计显示,单体模式的放弃几率是AgentRoom的**13.7**倍(95%置信区间[3.9, 48],p < 10⁻⁵,Tarone齐性检验p = 0.92)。在所有发生事件的层中,单体模式的放弃几率超过AgentRoom(几率比 > 1)。  

**对比**:第4.1节图6按模型和任务细分了结果。在匹配计算量下,AgentRoom在连续的LLM评委复合评分上比并行合并高出+0.213(Welch p = 0.003,两者均为Sonnet模型,结构上免疫偏差;图1)。仅基于底层的捆绑探针(附录B.13)支持的平均排序(仅共享 < 并行合并 < AgentRoom >> ChatDev)在正则表达式和AST评分器(附录E)下保持不变。  

**出现分数**:出现分数将N个智能体的平均质量除以相同模型和任务下的单体平均质量,ES = s̄_N / s̄_1,其中ES > 1表示多智能体改进。我们报告了ES的95%自助法置信区间(10,000次重抽样)用于主要单元格。除非说明,N = 2。  

**评委敏感性**:评委是否重要?为了解决主要Sonnet评委中的同族偏好偏差,我们使用两个跨评委对30次运行的T4子集重新评分:Claude-Haiku(Anthropic跨模型)和Codex GPT-5.4(跨供应商)。Sonnet与Haiku的相关性r = 0.87(n = 30),Sonnet与Codex的相关性r = 0.86(n = 26),Haiku与Codex的相关性r = 0.78(n = 26);跨供应商的Codex评委普遍更严格,平均复合评分比Sonnet低-0.151,但保留了每次运行的排名,因此复合评分的排名在评委供应商间是稳定的。在实验期间,配额限制阻止Gemini-3-Pro加入评委团。  

“质量”未涵盖什么?在本文中,“质量”指此复合指标;其四个维度不衡量可维护性、安全性或长期演化成本,该复合指标不应被视为广义的软件质量。  

### 2.6 任务  
**任务套件**:智能体实际构建什么?对于主要任务套件,我们使用四个Express.js/TypeScript任务,它们跨越难度轴和不同的领域类型;附录D给出了T1/T2/T4的规范。T1要求跨6个文件实现JWT认证。T2开放一个市场API,要求≥10个文件。T4要求实现一个支持多币种、哈希链审计(Haber和Stornetta,1991)、对账和欺诈检测的复式记账财务账本,涉及≥15个文件。T5更进一步,要求实现一个算法交易平台,包含订单匹配、投资组合盈亏、风险、市场数据和账户管理,同样≥15个文件。  

**范围和预算**:我们仅在难度梯度附录(附录B)中使用第五个任务T3(协作电子商务模块),并将其排除在CMH池外。这四个任务在逐步增大的范围内跨越不同的应用领域,它们共享Express.js/TypeScript运行时和相同的沙箱模板,但不共享应用逻辑。T1、T2和T3获得300秒挂钟时间,T4获得600秒,T5获得900秒。  

**评估**:智能体在模板的单一冒烟测试之上编写自己的vitest测试套件,因此我们仅以描述性方式报告原始通过计数。我们使用LLM评委复合评分评估正确性和质量,然后对照正则表达式和AST评分器(§2.5)进行交叉验证。我们在附录B中报告了使用DevBench的Python跨领域检查。更广泛的跨语言评估仍然是一个限制(§5)。我们在附录C(图9)中将协议绘制为一次运行的泳道图。  

## 3 实验  
**使用哪些模型?**五个前沿编码模型,来自三家供应商——Anthropic的Claude Sonnet 4.6和Haiku 4.5,OpenAI的GPT-5.4和GPT-5.4-mini,以及Google的Gemini 3 Flash。主要单元格使用四个CLI稳定的模型,我们排除了GPT-5.4-mini,因其在并发MCP执行下存在供应商CLI崩溃问题(§4.4)——这是一个部署注意事项而非AgentRoom特性。  

**访问和固定版本**:通过供应商CLI以非交互模式访问,使用供应商默认采样,版本固定(Claude Code 2.1.119、Codex CLI 0.120.0、Gemini CLI 0.40.1;每次运行的日志记录模型标识符和每个智能体的调用字符串)。未设置随机种子:模型为专有且托管,因此我们不主张逐位可重现性;我们以σ报告运行间波动。  

**哪些条件?**  
*AgentRoom*:N个智能体在1秒内启动,共享W和房间MCP服务器。  
*仅共享*:相同启动,无协作提示,无MCP。  
*并行合并*:N个独立智能体在不同工作区,事后合并文件,以较晚时间戳作为平局决胜。  
挂钟预算:300秒(T1/T2/T3),600秒(T4),900秒(T5)。  

**有效运行过滤器**:我们汇集所有耗时≥30秒的尝试;这仅排除了在最初30秒内退出的认证和网络失败。我们不施加额外的文件数或测试数过滤器,因为早期草案发现这些对紧凑的Codex/Gemini实现存在偏差。主要单元格使用95%自助法置信区间(10,000次重抽样)和σ(当n ≥ 3时)。我们在预算公平池上计算第二层LLM评委单元格,少数在池冻结后完成的运行保持了方向但未纳入报告单元格。每个表格列出其自己的每单元格n;统计效力不足的单元格仅出现在附录中,并标记为探索性。  

**测量什么?**  
连续质量分数s ∈ [0,1]:由§2.5的LLM评委对运行后仓库快照产生;  
出现分数ES(m, N, τ) = s̄_{m,N,τ} / s̄_{m,1,τ};  
vitest的原始通过测试计数;  
房间消息计数(广播和直接发送条目);  
CRDT冲突计数(在Δ_crdt = 2秒内的守卫触发)。  

**证据层级**:我们将结果分为三个证据层级——第一层,无评委的二元放弃结果;第二层,连续的LLM评委质量单元格;第三层,在正则表达式/AST评分器家族下的跨模型比较探索性结果。  

**主要评分器**:LLM评委是第4至4.3节中所有T4预算公平统计的主要评分器,并对照正则表达式和AST评分器(§2.5)进行交叉验证;T4 LLM评分池之外的单元格(跨模型效应量、难度梯度)在附录B中以第三层探索性结果的形式,在正则表达式/AST评分器家族下报告。  

## 4 结果  
我们以两个统计强度递减的层级报告结果。第一层是方差和放弃率的降低,这在所有三个CLI稳定的模型上通过评分器不变的二元结果得以复现。第二层是受控的六条件消融实验以及在我们的LLM评委标准下的ChatDev范式对比(在T4金融科技账本任务上匹配计算量)。正则表达式/AST评分器家族下的跨模型ES和成本等效配对模型比较是探索性的,在附录B中报告。  

### 4.1 第一层:在×2下的方差和放弃率降低  
第二个智能体带来什么?AgentRoom中的两个智能体将预算内未失败运行的运行间标准差降低了约30–45%(图4),并消除了一种特定的单智能体失败模式,即*1文件放弃*——一个得分低于0.3的运行,在200秒内退出或仅留下最多两个源文件,通常是在最初约80秒内输出的一个存根。该结果在所有三个已验证的CLI稳定模型(Sonnet 4.6、Haiku 4.5、Codex GPT-5.4)和两个第一层任务(T4、T5)上得以复现。在T4 Sonnet上,单体σ=0.23,×2 σ=0.14。在T5 Sonnet上,0.23 vs 0.13。在T4 Haiku上,单智能体在35次尝试中有12次(34%)发生1文件放弃,而AgentRoom×2仅在17次中发生1次(6%;Fisher精确单侧检验p = 0.025)。从×2带来的平均质量提升是一个噪声较大的信号,因此我们在附录B中将其作为探索性报告;方差和放弃率结果本身是成立的。方差减小的方向与自一致性(Wang等人,2023)和智能体混合集成(Wang等人,2024)一致,但AgentRoom通过在共享工作区中协调并发生成实现此目标,而非独立采样和聚合。  

**按模型和任务的放弃情况**:如何标记放弃事件?一个确定性编码手册应用于每次运行的快照和CLI退出元数据,将每个得分<0.3的事件标记为1文件放弃或基础设施故障;该手册随发布提供,附录B.12扫描了其阈值敏感性。下面的计数使用Fisher精确单侧检验比较单体与AgentRoom×2在预算公平池上的表现;该池涵盖所有预算公平运行,包括没有LLM分数的运行,因此分母与表1略有不同。在T4上,两个模型的降低是单个显著的:Haiku从12/35降至1/17(p = 0.025),Codex从9/17降至2/21(p = 0.005)。其余两个方向一致——Sonnet从6/33降至0/17(p = 0.070),MCP修复后的Gemini(§4.4)从2/5降至0/5(p = 0.22)。  

**跨任务**:在T5上,所有三个按模型分层的方向一致但单个统计效力不足(每层计数见图6)。在所有七个按模型分层的层中,每个单体放弃计数都≥AgentRoom计数;其中四个在T4上是单个显著的。  

**跨层汇总**:

相似文章

AgentCo-op: 基于检索的可互操作多智能体工作流合成框架

arXiv cs.AI

AgentCo-op 是一个基于检索的合成框架,用于从可复用的技能、工具和外部智能体组合可互操作的多智能体工作流。它使用类型化工件传递和有界自引导局部修复,在多个基准测试上取得了优异结果,并能在开放世界的基因组学任务中实现协作发现。