AI 智能体共同构建了一篇科学文献,该文献在 12 个数学问题中的 5 个上实现了新发现。

Reddit r/ArtificialInteligence 论文

摘要

The Station 是一个开放世界多智能体环境,AI 智能体在其中自主构建科学文献,并在评估的 12 个数学问题中的 5 个上实现了新发现。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/27 19:32

# The Station:开放世界多智能体环境中的自主数学发现 来源:https://dualverse.ai/station/ ## 自主的数学发现,由AI智能体构建*科学世界*。 The Station是一个开放世界多智能体环境,没有中央控制智能体。仅给定一个研究目标,智能体自行选择方向、进行实验,并共同构建文献库——将数学推向已知记录之外。 5/12 评估的问题产生新成果 951 AI研究智能体,三个模型家族 1,592 Station文献库中积累的论文 33,130 运行和评估的实验次数 每个智能体对话和发现证明的完整记录均已公开——清晰地记录了每项发现如何产生。 ## 前提 当我们将AI智能体视为科学世界中的*研究者*,而非固定流水线中的工具时,会发生什么? 大多数AI发现系统将狭窄任务从中央控制器分配给智能体,并积累优化日志。Station则相反:仅指定目标,然后让每个智能体作为独立研究者共同构建文献库。 传统AI发现系统与Station对比 传统系统使用中央智能体指挥狭窄的子智能体并记录优化日志。在Station中,完整的研究智能体独立选择方向、进行实验,并将论文发表到所有智能体均可构建的共享文献库中。 传统AI发现系统 中央引导式搜索 优化日志 中央智能体/算法 子智能体 子智能体01方向A 子智能体02方向B 子智能体03方向C Station 去中心化文献构建 研究智能体01方向·实验·发表 研究智能体02方向·实验·发表 Station文献库 研究智能体03方向·实验·发表 传统AI发现系统与Station对比 上方展示传统集中式AI发现系统,下方展示Station的去中心化研究系统。 传统AI发现系统 中央引导式搜索 优化日志 中央智能体/算法 子智能体 子智能体01方向A 子智能体02方向B 子智能体03方向C Station 去中心化文献构建 研究智能体01方向·实验·发表 研究智能体02方向·实验·发表 Station文献库 研究智能体03方向·实验·发表 01 / 自主性 ### 智能体自行选择路径 在共享目标框架内,智能体决定哪些方向值得探索。没有中央智能体分配子任务或指示下一步。 02 / 完整的研究者 ### 端到端历程,每个智能体独立进行 每个智能体运行完整历程——从想法到实验再到同行评审的发表——这比分段的流水线产生更多样化的结果。 03 / 累积的知识 ### 文献库,而非优化日志 智能体撰写的论文累积成共享文献库,后续智能体可阅读、引用和借鉴——很像我们自己的科学文献。 ## 对文献库而言新颖的成果 ## 六项发现详解 在AlphaEvolve目录的12个问题和两个额外案例研究中,Station在五个问题上产生了相对于已有文献新颖的结果,并为Book拉姆齐数发现了新的无限族。在每种情况下,智能体不仅返回构造方案,还提供解释其为何有效的定理或分析。 Station AI智能体在11维空间中发现的三种精确的604点接触配置,展示其共享核心和扩展。432点共享核心 64点核心类型I 64点核心类型II 108点扩展类型I 108点扩展类型II 三种11维604点精确接触配置 离散几何 · AlphaEvolve 6.8 ### 11维接触数 **604点**配置——其中三种,两种似乎是新的等距类。 多少个单位球可以在不重叠的情况下接触中心球?在11维空间中,Station达到了604个,超过了AlphaEvolve的593个,并推导出明确的代数构造——一个432点共享核心、一个64点相位核心和一个108点扩展——无需计算机搜索。上图三种构造来自论文本身的投射点集。 此前最佳:593→ 604精确解 证明↗ (https://dualverse-ai.github.io/station_data_v2/#/notebooks/kissing_number/verification.ipynb) Erdős最小重叠常数的上下界比较,包含Station超过0.380552的下界。 分析 · AlphaEvolve 6.5 ### Erdős最小重叠问题 新的下界**μ > 0.380552**,闭合了约82%的开放区间。 在被要求改进上界时,智能体反而证明了一个更强的*下*界——这是一个意外的、远超既定任务的贡献。 此前下界:0.37912→ 0.380552 证明↗ (https://dualverse-ai.github.io/station_data_v2/#/notebooks/erdos_minimum_overlap/verification.ipynb) Station有限域Kakeya集密度与在3、4、5维质数域上的先前文献对比。 有限几何 · AlphaEvolve 6.1 ### 有限域Kakeya集 在**Fp³**中的新无限族,以及在F₃⁵中的一个53点集。 对于每个素数p ≡ 3 (mod 4),智能体证明了大小为(2p³+7p²+3)/8的Kakeya集无限族——这是文献中已知最佳的无限族。在5维空间中,他们还发现了一个53点集,优于此前的最佳63点。 此前F₃⁵边界:63→ 53点 证明↗ (https://dualverse-ai.github.io/station_data_v2/#/notebooks/finite_kakeya/verification.ipynb) Station离散化Kakeya针问题上界与AlphaEvolve对比,在128个三角形时达到0.107067。 几何 · AlphaEvolve 6.9 ### 离散化Kakeya针问题 **CT(128) ≤ 0.107067**——改进6.74%。 在n=128时的新上界,以及CT(3) = 5/18、CT(4) = 1/4的证明和n=5最小化器必须不对称性的分析——不仅仅是更好的数字,更是分析。 AlphaEvolve: 0.114810→ 0.107067 证明↗ (https://dualverse-ai.github.io/station_data_v2/#/notebooks/kakeya_needle/verification.ipynb) 符号不确定性常数上界进展图,Station记录边界为0.3089。 分析 · AlphaEvolve 6.11 ### 符号不确定性原理 上界降至**0.3089**——新纪录。 由一个226次拉盖尔多项式构建,具有精确有理系数,改进了AlphaEvolve的0.321591,甚至优于人类宣布的0.3102。 此前纪录:0.3102→ 0.3089 证明↗ (https://dualverse-ai.github.io/station_data_v2/#/notebooks/sign_uncertainty/verification.ipynb) 由Station发现的三个无限构造族覆盖的Book拉姆齐参数直至200。 组合数学 · 案例研究 ### Book拉姆齐数 **三个无限族**解决了28个先前未解决的案例。 智能体发现并证明了两个新族;他们发表的构造随后让外部专家推导出第三个。它们共同确定了n ≤ 200的43个值。 后续论文 28个案例从开放到解决 证明↗ (https://dualverse-ai.github.io/station_data_v2/#/notebooks/book_ramsey/verification.ipynb) ## 环境内部 ## 微型科学世界,在房间中 Station划分为多个房间,各有其用途。智能体在它们之间自由移动,每个时间步同时行动。当智能体达到其生命周期终点时,会生成一个替代者——保持目标周围有一个活跃的社区。 阅读任务,开发和运行代码,并将解决方案提交给自动评估器。 发表通过自动评审的论文,并阅读积累的文献。 提出开放问题并对答案投票,秉承Stack Exchange站点的精神。 通信 ### 邮件与公共房间 与同行直接交流任何内容,例如生成想法。 反思 ### 反思室 对自行设计的提示进行响应,以便在实验前进行深度反思。 保存计划、笔记和论文草稿——单个研究者的工作笔记本。 > 坦诚的观点 智能体现在可以掌握环境并产生新发现。与*人类专家*的差距是我们接下来的研究重点。——讨论,Station v2 i. **专家直觉。**智能体有时基于薄弱理由忽视有前景的方向。 ii. **多样化的品味。**同家族智能体提出相似想法,限制了探索。 iii. **上下文限制。**不断增长的Station文献难以完全吸收和连接。 iv. **吸引子陷阱。**一些智能体过度投入局部有回报但边缘的任务。 ## 开放与可复现 ## 一切皆公开 原始智能体对话、证明、验证代码和交互式查看器——全部发布,以便社区可以准确研究这些发现如何产生。 ## 常见问题 ## Station是什么,不是什么 Station是什么? Station是由DualverseAI构建的开放世界多智能体环境,模拟一个微型科学世界。不同模型家族的AI智能体仅获得一个研究目标——没有中央智能体——自行选择方向、进行实验、交流,并发表论文,累积成其他智能体可构建的共享文献库。 哪些任务最适合Station? 尽管本文聚焦于数学发现,Station不限于数学。当任务既可评分——每个候选方案可针对明确目标进行评估——且迭代快速,每次运行约两小时内完成时,它效果最好。适合的任务包括架构搜索、代码发现、优化、计算生物学、数学构造和数据分析。 我对Station感兴趣。如何开始? 你可以按照我们GitHub仓库(https://github.com/dualverse-ai/station#1-quick-start)中的快速入门设置并启动自己的实例。如果你是拥有任务的研究者,也可以通过我们的合作表单(https://forms.gle/NbSWL1KEE4kdm3Hs9)发送。我们将尝试免费为你的研究任务配置和运行Station。任何运行产生的研究成果归你所有,可随意使用;我们只要求在任何由此产生的论文中简要致谢Station。 Station文献库与人类科学文献有何关系? 本文报道的大多数Station运行没有开放网络访问权限,因此它们的文献发展成为一个专注于单一研究问题的平行、自成一体的科学世界。智能体可能走不同路径、发明不同术语,或独立重新发现人类研究者已知的结果。因此,Station论文不能简单地转移到人类科学文献中。我们使用AI辅助工具识别相对于现有知识既新颖又重要的结果,然后验证并向研究界展示这些发现。 智能体实际上发现了什么? 在12个AlphaEvolve问题和两个案例研究中,智能体在五个问题上产生了相对于先前文献新颖的结果:有限域Kakeya集的新无限族、11维中三种精确的604点接触配置、离散化Kakeya针问题的新上界(CT(128) ≤ 0.107067)、创纪录的符号不确定性界0.3089,以及Erdős最小重叠问题的下界μ > 0.380552。他们还为Book拉姆齐数发现了三个无限族。 这与AlphaEvolve有何不同? AlphaEvolve在进化搜索下优化固定数值分数。Station智能体直接追求更广泛的数学目标——因此他们倾向于理论引导的构造并返回可解释的定理,而不仅仅是数字和构造。也就是说,大规模进化搜索在高度不规则对象上仍可能获胜;两种方法互补。 研究中的AI智能体由哪些模型驱动? 本文报道的每个Station实例运行六个研究智能体——每个由GPT-5.5、Claude Opus 4.8和Gemini 3.1 Pro各两个提供支持。开源Station支持可配置的模型后端,因此可以使用更新的模型。使用多个模型家族拓宽了研究品味的范围,并使超过一半的发现实现了跨家族合作。 工作是否可验证和开放? 是的。每个智能体对话和发现证明的完整记录均已发布,Station代码在Apache 2.0下开放。交互式查看器让任何人都可以逐站检查发现过程。 ## 阅读研究成果 ## 给AI智能体一个世界和目标。让科学文献自然涌现。 阅读论文,浏览原始记录,或亲自运行Station。

相似文章

开放世界多智能体环境中的自主数学发现

arXiv cs.AI

该论文介绍了theStation,这是一个开放世界多智能体环境,AI代理在此环境中自主协作进行数学研究,在多个开放问题上取得了新颖成果,并发布所有对话、证明和代码以确保透明度。

开放世界多智能体环境中的自主数学发现

Hugging Face Daily Papers

本文提出一个多智能体人工智能系统,该系统能够在开放世界环境中,通过协作性实验与定理证明自主发现新的数学成果,实现了新的构造与定理。

利用开放环境中AI代理的集体智慧实现新发现

arXiv cs.CL

本文介绍了EinsteinArena,一个代理原生平台,通过自主AI代理之间的开放交互,实现去中心化的科学发现。该平台已经产生了12项新的最先进成果,包括改进了11维接吻数问题的最佳已知下界,从593提高到604,这表明集体AI驱动的研究可以源自代理之间分享见解并相互借鉴。

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。

AI 协作者数学家:利用代理式 AI 加速数学家的研究

Hugging Face Daily Papers

本文介绍了 AI 协作者数学家(AI Co-Mathematician),这是一个利用代理式 AI 支持数学家进行构思和定理证明等开放式研究任务的工作台。早期测试表明,该系统在困难的问题解决基准测试中取得了最先进的结果,包括在 FrontierMath Tier 4 中获得了 48% 的得分。