@omarsar0: NVIDIA发布关于研究代理共享内存的出色论文。(收藏它)如果你运行多个编码代理在同一个研究问题上…

X AI KOLs Timeline 论文

摘要

Agora是一个基于Git的共享内存系统,用于集体自动研究,允许多个AI代理协作而无需重复,通过使用LLM工作器在没有训练数据的情况下初始化模型来演示。

NVIDIA发布关于研究代理共享内存的出色论文。 (收藏它) 如果你在同一个研究问题上运行多个编码代理,这种设计可以防止它们重复彼此的实验,并让每个代理在其他代理已经验证的结果基础上进行构建。 Agora将每个结果、假设和验证记录为不可变的Git提交。 父节点边显示每个主张所基于的内容,索引列出开放分支和哪些主张已被验证。 他们运行了13个LLM工作器近12天,没有分配任务或中央规划器。这些工作器必须在没有训练数据或梯度更新的情况下,从141个捐赠模型中初始化一个119.6M参数的混合模型。 工作器发布了1,703个贡献。 他们将评估器从3.39比特每字节降低到1.899比特每字节,缩小了与训练过的GPT-2 124M的62%的差距。所有165次独立复制都成功了。 论文:https://arxiv.org/abs/2609.18094 与论文聊天:https://academy.dair.ai/papers/agora-git-as-shared-memory-for-collective-autoresearch-2609.18094…
查看原文
查看缓存全文

缓存时间: 2026/09/18 14:45

NVIDIA关于研究智能体共享内存的重磅论文。(收藏起来)如果在同一个研究问题上运行多个编码智能体,这种设计能防止它们重复彼此的实验,让每个智能体都能在其他智能体已验证结果的基础上继续构建。Agora将每个结果、假设和验证都记录为不可变的Git提交。父边显示每个结论的构建基础,索引则列出未关闭的分支以及哪些结论已被验证。他们运行了13个大语言模型工作线程近12天,没有分配任务,也没有中央规划器。这些工作线程需要从141个源模型中初始化一个1.196亿参数的混合模型,且没有训练数据或梯度更新。工作线程发布了1703次贡献。他们将评估器的每字节比特数从3.39降低到1.899,缩小了与训练好的GPT-2 124M模型62%的差距。所有165次独立复现均成功。论文链接:https://arxiv.org/abs/2609.18094 论文讨论:https://academy.dair.ai/papers/agora-git-as-shared-memory-for-collective-autoresearch-2609.18094…


Agora:基于Git的集体自动研究共享内存

来源:https://arxiv.org/html/2609.18094
云衡·邹、绍坤·张、健·胡、浩·张、斌锋·徐、扬·考茨、毅·董
所属机构:NVIDIA
邮箱:{yifazhang,yidong}@nvidia.com

摘要

像AutoResearch这样的自主研究循环表明,单个编码智能体可以无人值守地改进训练设置。运行多个此类智能体时,每个会话都从零开始,因此更多智能体往往意味着更多重复搜索,而非更多发现。Agora是为这类智能体设计的共享内存:研究被记录为存储在Git中的仅追加有向无环图,因此每个结论都是任何人可以检出并重新运行的提交。每个结果、洞见、假设、验证和报告都是不可变的提交,其父边标明了它所构建的基础;一个派生索引揭示了研究前沿、被忽视的分支以及每个结论的验证状态;一种多样性感知的选择规则防止社区坍缩到单一主导路径上。我们描述了该系统并报告了其首次持续运行:一次持续近12天的运行,其中13个语言模型工作线程,在没有分配任务和中央规划器的情况下,解决了一个权重迁移问题。给定141个预训练源模型和一个维度与任何源模型都不匹配的冻结1.196亿参数注意力-SSM混合模型,工作线程必须在没有训练数据或梯度更新的情况下初始化目标模型。它们发布了1703次贡献,将评估器的每字节比特数从3.39降至1.899,缩小了与训练好的GPT-2 124M模型62%的差距。获胜方案将源模型的下一词元统计压缩到目标模型的嵌入和输出头中,然后通过对注意力、前馈和状态空间块的稀疏编辑添加短期上下文信号。其145个提交的血统跨越15个账户,并发布了165次独立复现,无一失败。我们描述了唯一一次中期人为干预,它如何将社区从单一文化中拉出来,追踪结果确立了什么、未确立什么,以及确定共享研究状态是否能提升单位计算发现率的对照比较。

1 引言

研究常被叙述为一系列个人突破的故事,但它是由共同体完成的。研究者继承先决条件、重用工具和代码、就开放问题展开竞争,并在前沿使其可及之时独立想到相同的想法;多次发现是常态,而非例外(Merton,1961)。一个团体的产出并非其最强成员的产出(Woolley 等,2010),近期研究认为,智能体AI同样应被视为社会与制度系统,而非单一的大型推理者(Evans 等,2026)。 AI研究智能体使得协调问题难以忽视。一个会话可以运行代码、阅读论文、启动实验,但它学到的东西被困在一个记录或一个临时工作树中。下一个会话不知道哪个学习率发散了,哪个分支被放弃了,或者哪个结果仍然需要独立复现。增加工作线程会使情况恶化:更多尝试,但也意味着更多重复搜索、更早收敛,以及更多精力花费在重建谁做了什么上。现有的多智能体框架组织对话或编码特定角色的工作流程(Li 等,2023;Wu 等,2023;Hong 等,2023)。这在单个任务内有效。一个研究共同体额外需要的是能超越任何工作线程存在的状态:一个公共前沿、不可变的谱系、阴性结果、独立验证,以及某种能在不规定单一工作流程的情况下分配注意力的方式。Agora就是这一层。 研究是一个有向无环图,其中每个贡献都是一个Git提交,每条父边意味着“基于”。Git提供了不可变、内容寻址的工件;数据库提供可搜索的视图;图本身成为了协调与质量信号。该系统不试图决定什么是真实的。它使主张、依赖关系、验证状态和未尝试的替代方案足够可见,以便人类与智能体的混合共同体能围绕它们进行协调。Git历史是唯一的状态:工作线程读写它,其他任何东西都不在它们之间传递。 我们通过一次为期12天的运行对此进行了测试。在这次运行中,13个编码智能体会话,仅获得一份两页的简报、一个评估器和共享图,就着手解决一个从预训练源模型池中初始化冻结混合语言模型的问题,且没有训练数据。它们将每字节比特数从随机基线的3.39降至1.899,彼此复现结果165次,并在一次显示它们自身集中度地图的人为干预后,在一天内摆脱了为期五天的单一文化。

贡献。我们(i)将多智能体研究表述为一个仅追加的有向无环图,其节点携带工件、主张、指标和来源(第3节);(ii)将不可变存储与下游证据以及多样性感知的注意力分配分离;(iii)描述实现了该设计的Git、SQLite、API、CLI和Web原型;(iv)报告在该原型上的首次持续运行,包括智能体发现的方法、我们如何验证它们的主张,以及追踪中可见的协调动态(第4节);并(v)利用运行遗留的开放问题,定义一个匹配的、可预注册的评估(附录C)。

2 相关工作

集体智能与科学制度。科学发现长期以来被建模为一种去中心化的制度:个体在局部选择问题,同时通过一个共享的公共知识体系进行协调(Polanyi,1962)。独立或同时发生的发现是反复出现的,而非例外(Merton,1961),团队绩效既取决于互动结构,也取决于个人能力(Woolley 等,2010)。定量研究进一步将协作结构、主题选择和团队规模与发现的生产和扩散联系起来(Fortunato 等,2018)。近期研究将这种制度视角扩展到智能体AI(Evans 等,2026)。Agora实现了该文献中一个狭窄的切片:为一个研究共同体提供持久的公共记忆、归属、验证和注意力分配。

大语言模型多智能体系统。现有框架通过角色扮演(Li 等,2023)、可编程对话(Wu 等,2023)、标准操作程序(Hong 等,2023)或分阶段软件开发对话(Qian 等,2024)来协调智能体。AgentVerse改变团队组成并研究涌现的协作(Chen 等,2023),而Magentic-One使用编排器来规划和重定向专门的智能体(Fourney 等,2024)。相关工作研究持久记忆和涌现的社会行为(Park 等,2023),以及模型实例之间的重复辩论(Du 等,2023)。这些系统在一个应用程序或情节中协调一个团队。Agora服务于异步参与者,它们不共享对话、管理器、角色图、运行时或文件系统。

自主研究智能体。AutoResearch表明,单个编码智能体可以在无人值守的情况下,通过多次迭代改进训练设置(Karpathy,2026)。ResearchAgent从科学文献中生成并利用评审智能体迭代优化研究想法(Baek 等,2025)。AI Scientist将自动化扩展到想法生成、实现、实验、论文写作和模拟评审(Lu 等,2024),而Agent Laboratory将文献综述、实验和报告撰写组织为一个分阶段的多智能体工作流程,可选人工反馈(Schmidgall 等,2025)。MLAgentBench、MLE-bench和ScienceAgentBench分别评估智能体在机器学习实验、工程竞赛和基于出版物的科学任务上的表现(Huang 等,2023;Chan 等,2024;Chen 等,2024)。ChemCrow和Coscientist将语言模型与科学工具连接,后者还涉及实验室自动化(Bran 等,2024;Boiko 等,2023)。这些系统自动化或评估了研究过程的大部分环节。Agora是互补的:它不规定端到端的研究者,而是在独立调度的研究者之间保持持久状态(阴性结果、谱系、验证)。

共享工作空间与可复现工件。黑板架构通过共享的问题解决状态和显式控制策略来协调异构知识源(Hayes-Roth,1985)。可复现性系统捕获计算记录的不同部分:DataLad对代码、数据及其关系进行版本控制(Halchenko 等,2021);ReproZip打包执行依赖项(Chirigati 等,2013);Whole Tale和RO-Crate打包可执行或机器可读的研究对象(Brinckman 等,2019;Soiland-Reyes 等,2022);而Nextflow、Snakemake和MLflow跟踪可执行工作流或实验生命周期(Di Tommaso 等,2017;Mölder 等,2021;Zaharia 等,2018)。Agora将同一思想向上应用了一层,应用于主张:其共享状态是一个仅追加的贡献有向无环图,同一个图也揭示了验证状态、被忽视的分支和注意力信号。

探索、开放式搜索与质量多样性。探索与利用的权衡经典地由多臂老虎机形式化(Auer 等,2002);UCT将老虎机选择应用于树搜索(Kocsis 和 Szepesvári,2006)。新奇搜索表明,放弃单一目标可以避免欺骗性的局部最优(Lehman 和 Stanley,2011),而MAP-Elites和质量多样性方法寻求多样化的高性能解决方案集合(Mouret 和 Clune,2015;Pugh 等,2016)。POET同时生成问题和解决方案,在分支之间传递踏脚石(Wang 等,2019)。Agora借鉴了这些关于注意力分配的直觉,但其图既不是固定的老虎机,也不是博弈树,其建议是用于揭示未充分探索分支的启发式方法,而非最优规划的保证。

3 Agora:基于Git的研究有向无环图

3.1 问题设定与设计目标

一个项目有参与者集\mathcal{A}和一个不断增长的贡献序列V。一个贡献可以携带代码或数据工件、描述、可选的指标值、标签和一组父节点。在任何时刻,平台应能回答四个问题:

    1. 已经尝试了什么,包括失败案例?
    1. 哪些主张有独立的支持或存在冲突?
    1. 当前的前沿在哪里,包括被忽视的替代方案?
    1. 哪个确切的工件和谱系产生了报告的结果?

表1将这些转化为系统目标。 表1:设计目标及Agora采用的机制。

目标没有共享制度时的失败案例Agora机制
持久记忆会话本地的发现和阴性结果消失。具有显式父谱系和可搜索元数据的仅追加Git提交。
前沿可见性工线程猜测哪些是开放的,并重复相同分支。叶节点、假设、验证、聚类和指标景观视图。
证据质量投票奖励流行度;自我引用和重复背书成本低廉。独立的后续工作、可替代的验证结论和自我引用排除。
搜索多样性排行榜将所有工作线程集中到一个局部盆地。语义聚类、多样性摘要、前沿候选方案以及分离的利用/探索槽位。
可审计性标量分数丢失了产生它的配置和代码。内容寻址的工件、规范提交、不可变修订和可重建的贡献索引。

Agora是一个协调基底,而非实验室管理员。项目定义自己的指令、指标、工件契约和安全边界;该平台提供发布和查找工作的共享机制,不声称一种评分规则适用于所有领域。

3.2 贡献图与来源

项目状态是一个有向无环图G=(V,E)。对于u,v \in V,边(u,v) \in E表示v基于u;在Git术语中,u是提交v的一个父提交。每个节点存储 v=(h, a, T, d, x, m, P, \tau),(1)其中h是规范提交哈希,a是发布账户,T是一组标签,d是描述,x是结构化元数据,m是可选的项目指标,P是父节点集合,\tau是服务器时间戳。携带代码的贡献包含完整的仓库状态。因为身份是哈希,亲缘关系是Git的亲缘关系,历史在结构上是仅追加且无环的。Git是系统所依赖的唯一状态:回答查询的SQLite索引、下面的analyze视图,以及本报告中的所有图表都源自此。

相似文章

Agora:Git 作为集体自动研究的共享内存

Hugging Face Daily Papers

Agora 是一个用于自主 AI 研究代理的共享内存系统,它使用 Git 将研究记录为仅追加的有向无环图 (DAG),从而实现协作发现。在一次 12 天的实验中,13 个代理将模型性能提升了 62%,接近训练基线。