开放世界多智能体环境中的自主数学发现
摘要
该论文介绍了theStation,这是一个开放世界多智能体环境,AI代理在此环境中自主协作进行数学研究,在多个开放问题上取得了新颖成果,并发布所有对话、证明和代码以确保透明度。
arXiv:2608.23691v1 公告类型:新
摘要:我们研究theStation中的自主数学发现,这是一个开放世界多智能体环境,其中来自不同模型系列的AI代理在没有中央协调器或脚本化流程的情况下,共同追求研究目标。代理选择自己的研究方向,进行实验,合作,并构建共享的科学文献。在AlphaEvolve目录中的12个构造问题和两个额外案例研究中,theStation在五个问题上获得了相对于先前文献的新结果:一个新的有限域Kakeya集无限族,维度11中新的精确604点接吻构型,离散化Kakeya针和符号不确定性问题的新记录,以及Erd\H{o}s's最小重叠问题的显著改进下界。代理还发现了Book Ramsey数的新无限族。重要的是,代理不仅产生了数值构造,还产生了定理和分析,解释了这些构造如何工作,使结果更易于解释,并方便数学家进一步构建。我们发布了所有原始代理对话、证明和验证代码,提供了这些发现如何产生的透明记录。
查看缓存全文
缓存时间: 2026/08/26 09:12
# 开放世界多智能体环境中的自主数学发现
来源:https://arxiv.org/html/2608.23691
杜文宇 致谢:DualverseAI;香港大学
威廉·J·韦斯利 致谢:加州大学圣地亚哥分校
###### 摘要
我们研究了在 **Station** 这一开放世界多智能体环境中的自主数学发现,其中来自不同模型家族的AI智能体在没有中央协调器或预设流程的情况下,共同追求一个共享的研究目标。智能体自主选择研究方向、进行实验、相互协作,并共同构建科学文献。在AlphaEvolve目录中的12个构造问题以及两个额外案例研究的基础上,Station在五个问题上取得了相对于现有文献的新成果:一个新的有限域Kakeya集的无限族、维度11中新的精确604点接触构型、离散化Kakeya针和符号不确定性问题的新纪录,以及Erdős最小重叠问题的一个显著改进的下界。智能体还为Book拉姆齐数发现了新的无限族。重要的是,智能体不仅产出了数值构造,还提供了定理和分析来解释这些构造的工作原理,使结果更易于理解,并便于数学家在此基础上进一步研究。我们发布了所有原始的智能体对话、证明和验证代码,为这些发现的产生过程提供了透明的记录。
## 1 引言
人工智能正开始直接推动数学研究的前沿。近期的工作范围广泛,从AlphaEvolve的大规模数学探索到AI辅助的长期未解决问题的进展,包括雅可比猜想的反例、Crouzeix和Sendov猜想的证明,以及OpenAI最近报告的十项数学结果[58 (https://arxiv.org/html/2608.23691#bib.bib4),62 (https://arxiv.org/html/2608.23691#bib.bib6),1 (https://arxiv.org/html/2608.23691#bib.bib76),49 (https://arxiv.org/html/2608.23691#bib.bib7),54 (https://arxiv.org/html/2608.23691#bib.bib8)]。随着这些能力的增强,一个自然而然的问题不仅是AI能解决什么问题,还有什么样的环境最适合它进行研究。鉴于AI日益增强的能力,我们提出:我们能否构建一个自由的多智能体环境,在其中智能体仅被赋予一个研究目标,而没有中央协调器?当环境将AI智能体视为独立的研究者,而非复杂流程中的固定工具时,会发生什么?这种自由性能否允许智能体自主选择有前景的方向,发展自己的科学研究文化和文献,并共同推进给定目标?
为了研究这个问题,我们使用了 **Station**,一个用于自主科学发现的开放世界多智能体环境[16 (https://arxiv.org/html/2608.23691#bib.bib1)]。Station模拟了一个科学生态系统,其中来自不同模型家族的智能体自主选择研究方向、进行实验、与同行交流,并阅读和发表科学论文。这些论文积累成一个共享的知识库,后来的智能体可以阅读、引用并在此基础上扩展。Station仅指定研究目标;没有中央系统告诉智能体应该追求哪个研究方向或下一步该做什么。
我们将Station应用于来自AlphaEvolve研究的12个问题和两个额外的数学案例研究。其中12个AlphaEvolve问题中有五个产生了相对于现有文献的新结果。Station发现了一个新的有限域Kakeya集的无限族,在维度11中构造了三个精确的604点接触构型,并为离散化Kakeya针、符号不确定性和Erdős最小重叠问题建立了新的界。在Book拉姆齐数的一个单独案例研究中,智能体发现并证明了新的无限族,这催生了一篇后续论文。Station还在一天内、无需网络访问的情况下找到了雅可比猜想的一个有效反例,证明了它能够处理仅具有二元成功标准而非分级优化信号的问题。这种高度的自由允许智能体追求广泛的数学贡献,而不仅仅是优化某个固定指标。
例如,AlphaEvolve在有限多个素数上评估了有限域Kakeya构造;有前景的数值模式随后需要一个特定任务的、研究人员辅助的流程才能成为无限族。由于Station的智能体可以直接追求更广泛的数学目标,他们独立地恢复并证明了该族,然后发现了一个覆盖额外一类素数的新扩展。同样的自由也允许智能体探索超出既定目标的内容。例如,尽管我们要求智能体为Erdős最小重叠问题寻找一个改进的上界,但他们却发展出了一个新的下界证明。
在本研究中,我们只考虑数学构造任务,而非一般性数学问题(如证明猜想)。定理级结果是在智能体试图解释和推广他们发现的构造时出现的。例如,Station推导出了该配置的显式代数构造,而不是只返回一个晦涩的604点接触构型,这使得数学家更容易理解该结果。在一个证明丰富的时代,当交流、理解和整合新结果成为主要瓶颈时[79 (https://arxiv.org/html/2608.23691#bib.bib86),44 (https://arxiv.org/html/2608.23691#bib.bib87)],此类可解释的输出可能变得越来越有价值。
我们还分析了支撑这些发现的AI发现过程。我们的分析表明,超过一半的发现涉及智能体之间的协作。来自不同模型家族的智能体常常贡献互补的想法,而早期智能体撰写的论文则成为很久之后的发现的基石。许多重要结果都得益于每个Station内积累的广泛内部文献。我们发布了所有原始的智能体对话和可复现的代码,让社区能够透明地研究这些发现过程。
## 2 方法
Station是一个模拟小型科学社区的开放世界多智能体环境[16 (https://arxiv.org/html/2608.23691#bib.bib1)]。它被划分为多个房间,每个房间服务于不同的目的,例如用于发表和阅读科学论文的“档案室”,用于运行代码的“研究中心”,以及用于与同行通信的“邮件室”。表1 (https://arxiv.org/html/2608.23691#S2.T1) 总结了主要的房间及其功能。智能体可以自由地访问不同的房间并执行不同的动作。在每个回合,所有智能体同时选择他们的动作,一旦所有动作完成,一个“回合”就结束了。每个智能体都有有限的生命周期;当一个智能体到达生命尽头时,Station会自动生成一个替代者,以保持恒定的智能体数量。
Station将每个智能体视为独立的研究者。智能体可以在研究中心访问分配给Station的主要研究目标。然而,如何实现这个目标,则留给每个智能体自行决定。智能体可以自由地探索不同的研究方向,阅读现有论文,并经常在研究过程中经历许多挣扎和失败。一个成功的智能体可能会做出重要的发现,在这种情况下,它可以在档案室发表一篇论文,为Station的长期知识做出贡献。这些论文随时间积累,形成了Station内部的一个知识库,后来到达的智能体可以阅读、引用并在此基础上构建,从而使得围绕给定研究目标能够发展出一个小型的科学社区。
与目前主流的用于科学发现的基于智能体的系统[58 (https://arxiv.org/html/2608.23691#bib.bib4),50 (https://arxiv.org/html/2608.23691#bib.bib9),30 (https://arxiv.org/html/2608.23691#bib.bib10),70 (https://arxiv.org/html/2608.23691#bib.bib11),35 (https://arxiv.org/html/2608.23691#bib.bib12),31 (https://arxiv.org/html/2608.23691#bib.bib13),61 (https://arxiv.org/html/2608.23691#bib.bib14)]相比,Station在三个方面有所不同。首先,其智能体拥有更大的自主权:在给定的总体研究目标内,他们自己选择研究方向及如何追求,而不是从中央协调器那里接收任务。其次,每个智能体都扮演一个完整的研究者角色,处理从选择方向、实验到发表的整个研究过程。这样长而自主的研究旅程使得智能体之间的研究结果比僵化、碎片化的研究流程更具多样性。第三,Station通过智能体撰写的论文形式,实现了科学知识跨代积累。大多数现有系统则积累过程信息,例如优化历史、中间工件或会话记忆。这些信息有助于系统继续工作,但可能无法轻松提取和积累科学知识。
这些差异反映了设计哲学上的一个根本选择:是将AI智能体视为固定流程中的工具,还是科学生态中的研究者。自原始论文以来,我们对Station进行了许多改进和扩展。这些变化的总体主题是鼓励新颖但有原则的探索,同时减少非科学负担。例如,我们引入了一个新的“问题室”,智能体可以在此提出自己的问题并对其他智能体的答案进行投票,从而拓宽科学探索的范围。智能体还定期获得“假期”,在此期间他们搁置正在进行的工作,并接收旨在鼓励开放式思维的随机提示。我们还让智能体能够使用编码助手,这样他们就不必在底层编码或调试上花费时间,从而能够专注于科学任务,类似于如今研究人员使用编码助手的方式。这些更改的详细讨论见附录A (https://arxiv.org/html/2608.23691#A1)。完整源代码在 https://github.com/dualverse-ai/station 公开可用。
表 1: Station 房间及其功能摘要。
表 2: Station 的重要发现。包含所有评估的问题。
## 3 结果
### 3.1 实验设置
我们在源自Georgiev等人[29 (https://arxiv.org/html/2608.23691#bib.bib5)]的AlphaEvolve研究的数学问题上评估Station,这是一个涵盖分析、组合、几何和数论的广泛目录。大多数问题可以表述为优化一个数值量的上界或下界:一个候选构造由自动评估器检查并分配一个数值分数,通常是一个标量,搜索过程尝试优化这个分数。在许多情况下,最优值是未知的,使得相应的优化任务成为一个开放的研究问题。我们选择了12个代表不同数学领域和问题结构的问题;完整的评估问题列表见表2 (https://arxiv.org/html/2608.23691#S2.T2)。我们将每个问题分配给一个独立的Station实例。对于每个问题,智能体接收一个任务描述,该描述既包括数学问题也包括评估器函数。任务描述还可能指定一些无法直接评分的额外数学目标。不提供外部专家指导或文献调查给智能体。
大多数实例运行大约1000-2000个回合,对应于大约一到两周的连续挂钟运行时间。除非另有说明,所有实例包含六个研究智能体,每个模型家族(GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro)各两个。
### 3.2 结果摘要
结果总结在表2 (https://arxiv.org/html/2608.23691#S2.T2) 中。根据每次运行的主要结果,12个问题中有五个产生了相对于现有文献的新结果。在其余七个问题中,Station在三个问题上优于AlphaEvolve,在两个问题上与之持平,在两个问题上表现不如。这五个问题的新结果涵盖了多个数学领域。在有限几何中,Station推导出了一个新的有限域 \(\mathbb{F}_{p}^{3}\)(对于满足 \(p \equiv 3 \pmod{4}\) 的素数 \(p\))中Kakeya集的无限族,并在 \(\mathbb{F}_{3}^{5}\) 中找到了一个53点的Kakeya集,改进了之前的63点界限。在离散几何中,它在维度11中产生了三个精确的604点接触构型,其中两个似乎定义了以前未知的等距类,并为离散化Kakeya针问题建立了新的界限 \(C_{T}(128) \leq 0.107067\)。在分析中,它将符号不确定性上界改进到 \(0.3089\),并关闭了Erdős最小重叠常数约 \(82\%\) 的先前开放区间。
除了这12个AlphaEvolve问题,我们还研究了两个额外的案例研究。对于Book拉姆齐数,Station智能体发现并证明了两个新的无限族,而他们的有限构造和一个早期恒等式使得一位外部专家能够推导出第三个无限族。这三个无限族共同证明了 \(n \leq 200\) 时43个 \(n\) 值的猜想,解决了28个之前开放的案例。对于雅可比猜想,Station从一个无公式的二元任务中独立重构了最近宣布的七次反例,并推导出了其常数雅可比行列式和三叶纤维的几何解释。
这些结果还表明,Station可以直接追求不一定是可评分的更广泛数学目标。例如,上述关于有限域Kakeya的无限族结果不可直接评分,即使新的无限族是数学上感兴趣的对象。因此,AlphaEvolve在有限多个素数上评估构造,并依赖特定任务的流程以及研究人员的参与,将有前景的输出转化为无限族。相比之下,在Station中,我们在任务描述中直接说明有限构造是测试用例,主要目标是发现无限族。这导致智能体独立地恢复了通过AlphaEvolve和后续研究人员辅助流程获得的无限族,并发现了该族的一个新扩展,改进了另一类素数的构造。我们在运行后的角色仅限于检查他们证明的有效性和结果的新颖性。这大大减轻了研究人员的负担,并使Station适用于更广泛的数学问题。
结果进一步表明,Station能够产生超出原始任务的意外贡献。例如,在Erdős最小重叠问题中,智能体被指示改进上界,但他们也发展出了一个下界证明,关闭了约 \(82\%\) 的开放区间。这一意外发现说明了Station的另一个优势:智能体可以探索围绕既定问题的、数学上有前景的方向,并产生超出分配任务之外的贡献,如新定理。
与AlphaEvolve相比,我们发现Station智能体倾向于偏好理论指导的构造。这些实验中的单次评估通常限制在15-30分钟,这强烈激励使用数学结构来减少搜索空间。在维度相似文章
开放世界多智能体环境中的自主数学发现
本文提出一个多智能体人工智能系统,该系统能够在开放世界环境中,通过协作性实验与定理证明自主发现新的数学成果,实现了新的构造与定理。
AI 智能体共同构建了一篇科学文献,该文献在 12 个数学问题中的 5 个上实现了新发现。
The Station 是一个开放世界多智能体环境,AI 智能体在其中自主构建科学文献,并在评估的 12 个数学问题中的 5 个上实现了新发现。
利用开放环境中AI代理的集体智慧实现新发现
本文介绍了EinsteinArena,一个代理原生平台,通过自主AI代理之间的开放交互,实现去中心化的科学发现。该平台已经产生了12项新的最先进成果,包括改进了11维接吻数问题的最佳已知下界,从593提高到604,这表明集体AI驱动的研究可以源自代理之间分享见解并相互借鉴。
EurekAgent:智能体环境工程——自主科学发现的全部所需
本文介绍了EurekAgent,一个经过环境工程设计的智能体系统,用于指标驱动的自主科学发现。在数学、内核工程和机器学习任务上,它以极低的计算成本取得了最先进的结果。
问题本身即问题:迈向可扩展的数学发现
本文提出一种AI辅助数学发现的新范式。在此范式中,专家定义研究方向,AI系统负责自动发现和筛选问题,并通过组合数学案例研究进行了演示。