@Montreal_AI: 科学有一个隐藏的边界。不是真相的边界。而是可思考的边界。一个非凡的新预印本…

X AI KOLs Timeline 论文

摘要

一篇新的预印本提出了'科学的外星空间'这一概念——即那些与文献一致但当前科研社区在认知上无法触及的研究方向——并提出了一种方法,利用LLM论文中的思想原子来采样这类方向,结果显示该方法可以在不牺牲一致性的情况下探索3.5至7倍更广泛的思想空间。

科学有一个隐藏的边界。 不是真相的边界。 而是可思考的边界。 一篇由 Alejandro H. Artiles、Martin Weiss、Levin Brinkmann、Iyad Rahwan、Bernhard Schölkopf、Christopher Pal、Hugo Larochelle、Anirudh Goyal 和 Nasim Rahaman 撰写的非凡新预印本为这个边界赋予了一个名字: **科学的外星空间 (The Alien Space of Science)**。 前提十分有力: 有些研究方向与文献一致,但当前从事该领域的研究人员在认知上无法触及。 不是因为研究人员缺乏智慧。 而是因为领域具有结构。 它们有偏好的工具、共享的直觉、热门的问题、常见的数据集、机构激励、合作者网络以及继承下来的品味。 这些结构使得某些想法容易想象。 而其他想法几乎不可见。 现代LLM继承了同样的偏见。当被要求提出“新颖想法”时,它们往往重新组合文献中密集的区域——也就是该领域已经觉得自然的概念。 本论文瞄准的是互补区域。 不是废话。 不是随机的创新。 不是为了怪异而怪异。 而是超出社区先验的连贯方向。 该方法非常具体且优雅。 作者分析了16,068篇经过同行评审的LLM论文,并将其提炼为273个可重复使用的“思想原子”。 然后他们学习两个模型: **一致性**:这些原子的组合能否形成一个可行的研究方向? **可得性**:是否有任何现有的作者社区有能力产生这个方向? 外星采样则搜索这两者之间的边界: 高一致性 低可得性 这就是关键所在。 将“科学上可行”与“当前可能被想到”区分开来。 结果令人瞩目:该采样器探索的有效原子词汇量比前沿LLM构思基线大3.5-7倍,且不牺牲一致性,产生的想法在盲法LLM评估、人工评估和下游实验中达到或超越这些基线。 这不仅仅是一个想法生成器。 它是一台科学盲点探测器。 而其意义远不止一个领域。 如果AI辅助发现仅仅加速当前社区已经知道如何提出的问题,那它只是提高吞吐量。 但如果它能浮现出任何现有社区自然无法看到的连贯方向,那么它改变的是搜索空间本身。 这就是更快科学与扩展科学之间的区别。 完全归功于作者: Alejandro H. Artiles, Martin Weiss, Levin Brinkmann, Iyad Rahwan, Bernhard Schölkopf, Christopher Pal, Hugo Larochelle, Anirudh Goyal, Nasim Rahaman。 论文:The Alien Space of Science https://arxiv.org/abs/2603.01092 我附上了第一页,因为摘要值得仔细阅读。 边界不仅是科学已知的东西。 而是科学尚未组织起来去思考的东西。 #ArtificialIntelligence #ScientificDiscovery #MachineLearning #LLM #Research
查看原文
查看缓存全文

缓存时间: 2026/05/23 18:15

科学有一片隐藏的边疆。

不是真理的边疆。

而是可思考之物的边疆。

一篇引人注目的新预印本由Alejandro H. Artiles, Martin Weiss, Levin Brinkmann, Iyad Rahwan, Bernhard Schölkopf, Christopher Pal, Hugo Larochelle, Anirudh Goyal和Nasim Rahaman撰写,为这片边疆命名:

科学的异域空间

其前提非常有力:

有些研究方向与文献一致,但在认知上对当前从事该领域的研究人员来说是不可及的。

并非因为研究人员缺乏智力。

而是因为领域本身具有结构。

它们有偏爱的工具、共享的直觉、流行的问题、常见的数据集、制度激励、合作者网络以及继承的品味。

这些结构使得某些想法容易被想象出来。

而另一些则几乎不可见。

现代的LLM也继承了同样的偏见。当要求提出“新颖想法”时,它们往往会重新组合文献中密度较高的区域——那些该领域已经觉得自然的概念。

这篇论文针对的是互补的区域。

不是无稽之谈。 不是随机的创新。 不是为了怪异而怪异。

而是现有社群先验之外的连贯方向。

该方法非常具体且优雅。

作者分析了16,068篇经过同行评审的LLM论文,将其提炼为273个可重用的“想法原子”。

然后他们学习两个模型:

  • 连贯性:这些原子的组合能否形成一个可行的研究方向?
  • 可获得性:是否有一个现有的作者社群能够产生这个组合?

异域采样寻找两者之间的边界:

高连贯性 低可获得性

这就是关键一步。

将“科学上可行的”与“当前可能被想象到的”区分开来。

结果令人瞩目:与前沿的LLM构思基线相比,该采样器探索的有效原子词汇范围宽了3.5–7倍,且不牺牲连贯性,并在盲评的LLM、人工及下游实验评估中,产生的想法达到或超过了这些基线。

这不仅仅是一个想法生成器。

它是一个科学盲点探测器。

其含义超越了单一领域。

如果AI辅助的发现仅仅是加速当前社群已经知道如何提出的问题,那它只是提高了产出。

但如果它能浮现出没有现有社群自然有能力看到的连贯方向,那它就改变了搜索空间本身。

这就是“更快的科学”与“扩展的科学”之间的区别。

完全致谢作者: Alejandro H. Artiles, Martin Weiss, Levin Brinkmann, Iyad Rahwan, Bernhard Schölkopf, Christopher Pal, Hugo Larochelle, Anirudh Goyal, Nasim Rahaman。

论文:科学的异域空间 https://arxiv.org/abs/2603.01092

我附上第一页,因为摘要值得仔细阅读。

前沿不仅仅是科学已知的东西。

而是科学尚未组织起来去思考的东西。

#人工智能 #科学发现 #机器学习 #LLM #研究


科学的异域空间:采样连贯但认知上不可用的研究方向

来源:https://arxiv.org/html/2603.01092 Alejandro H. ArtilesTiptree Systems马克斯·普朗克人类发展研究所,柏林马克斯·普朗克智能系统研究所,蒂宾根Levin Brinkmann马克斯·普朗克人类发展研究所,柏林Iyad Rahwan马克斯·普朗克人类发展研究所,柏林Bernhard Schölkopf马克斯·普朗克智能系统研究所,蒂宾根ELLIS研究所蒂宾根Christopher Pal蒙特利尔理工学院加拿大CIFAR AI主席Mila – 魁北克AI研究所Hugo LarochelleMila – 魁北克AI研究所Anirudh GoyalNasim RahamanTiptree Systems

摘要

科学发现不仅受真理约束,还受当前探索某一领域的研究人员的认知可获得性约束。许多方向在文献中是连贯的,但不太可能被提出,因为没有现有社群拥有恰当的概念、方法和直觉组合。现代语言模型继承了这种偏见,当被要求提出新颖想法时,它们会重新组合文献中密度高的区域。我们引入了一个框架,针对的是互补区域,我们称之为科学的异域空间,其中的方向在现有知识结构下是合理的,但在现有研究人员的分布下却不太可能出现。我们的方法首先将论文分解为细粒度的概念单元,并将它们聚类到一个共享的想法原子词汇表中。然后,它在这个词汇表上学习两个互补的模型:一个连贯性模型评估原子组合是否能形成一个可行的研究方向;一个可获得性模型评估是否有现有作者社群能够产生给定的组合。对异域方向的采样则简化为对原子组合进行排序,使其在最大化连贯性的同时最小化可获得性。在来自NeurIPS、ICLR、ICML和主要NLP会议的16,068篇经过同行评审的LLM论文语料上,得到的采样器探索的有效原子词汇范围比前沿的LLM构思基线宽了3.5–7倍,且不牺牲连贯性,并在盲评的LLM、人工及下游实验评估中,产生的想法达到或超过了这些基线。通过将科学合理性与社群可获得性分离,我们的框架指向的AI构思能够补充而非仅仅加速人类科学,将探索扩展到当前社群可能忽视的连贯方向。

1 引言

科学发现常被描述为在可能想法的空间中进行搜索。但一个科学社群可见的空间只是可能科学上连贯的空间的一小部分。研究人员继承了概念、方法、合作者、数据集、制度和学科直觉,这使某些方向容易想象,而其他方向则几乎不可见。两个想法在文献看来可能同样合理,但在是否有任何现有研究人员或社群可能提出它们方面却可能大相径庭。

我们将后一个区域称为科学的异域空间:那些在现有知识结构下是连贯的,但不会自然地从现有研究人员在社群内的概念轨迹中产生的方向。事后看来,这些想法可能非常明显;但在出现之前,它们处于主流品味之外,需要该领域尚未组织的专业知识。它们之所以是异域的,不是因为它们推测性或非科学,而是因为它们对于当前围绕文献组织起来的社群来说在认知上是不可用的。

这种区别变得越来越重要,因为大语言模型(LLMs)被用于科学构思。LLMs擅长综合现有知识,但综合并不等同于逃离领域的先验。当被要求提出新颖想法时,它们倾向于在文献中已有的流行概念、显著机制和反复出现的研究模式之间进行插值。它们非但不可靠地帮助研究人员逃离社群先验,反而常常近似并放大它[53, 38, 34, 37]。

本文的核心问题是,我们能否显式地建模并搜索超越这一先验。我们不问一个想法在绝对意义上是否新颖,而是问它对于当前的科学社群是否认知上可获得。如果许多研究人员根据他们过去的工作自然有能力提出一个想法,则该想法高度可获得;如果它需要现有研究轨迹未充分代表的异常概念、方法或直觉组合,则认知上不可用。

这给出了科学构思的双轴视角。连贯性询问一个想法的组成部分是否以可能支持研究贡献的方式结合在一起。可获得性询问这个组合是否可能由当前活跃在该领域的研究人员和社群产生。标准的LLM构思往往是连贯但可获得的。随机重组可能不可获得且不连贯。我们寻求的是高连贯性、低可获得性的边界:既合理又不显而易见的想法。

图1:异域科学采样流程概览。论文被提炼为概念单元,聚类成共享的想法原子词汇表。连贯性模型学习哪些原子组合能形成可行的研究方向,而可获得性模型估计哪些现有作者社群有能力产生这些组合。通过最大化连贯性同时最小化可获得性来采样异域方向。

为了操作化这一观点,我们分三步进行。首先,我们将论文分解为短小的概念单元,并将重复出现的单元聚类成一个想法原子词汇表(第3.1节);每篇论文被表示为这些原子的稀疏组合。其次,我们在这个离散的想法空间上学习两个互补模型:一个连贯性模型(第3.2节),在论文的原子集上训练,评估一个组合是否类似于可行的研究方向;以及一个可获得性模型(第3.3节),学习一个作者-想法兼容性函数,评估现有研究人员社群是否有能力产生它。第三,我们采样那些最大化连贯性同时最小化可获得性的组合(第3.4节);高连贯性、低可获得性的边界就是我们所说的异域科学

贡献。我们的贡献有三点。(a) 想法原子。我们引入了一种科学方向的组合表示,将论文映射到一个共享的、由LLM提炼的可重组的想法原子词汇表上的稀疏组合。(b) 认知可获得性作为搜索目标。我们将认知可获得性操作化为一个可学习的、社群级别的作者-想法兼容性评分,并将其与连贯性模型配对,以搜索异域科学边界。(c) 搜索超越社群先验的经验证据。在一个由来自NeurIPS、ICLR、ICML和主要NLP会议的16,068篇LLM论文组成的精心策划语料上,我们验证了概念单元保留了论文内容;通过时间上的保留评估,我们展示了评分模型能够以远超随机的概率恢复未来论文的三个原子组合;并且发现异域采样探索的有效原子词汇范围相比前沿的LLM基线宽了3.5–7倍,同时在盲评的LLM、人工及下游实验评估中达到或超过了这些基线。

2 相关工作

AI辅助的科学发现。

自动化发现的历史悠久,涉及数学、化学和科学建模。近年来,基于LLM的系统如AI-Scientist和AlphaEvolve将这一议程扩展到更广泛的科学和工程环境,使用语言模型提出、实施、评估和优化候选发现。我们的焦点是这个更广泛循环中的构思步骤:系统应如何选择要研究的方向?

构思瓶颈。

LLM在文献综合、编程、实验设计和科学写作方面越来越擅长。然而,开放式的构思暴露了一种独特的失败模式:模型反复回到熟悉概念、模板和方法主题的狭窄区域,也被Lu等人指出。我们将此解释为社群先验问题。问题不仅仅在于新颖性低,而在于合理性通常是通过靠近现有研究人员的分布来实现的。

检索增强和反馈增强的构思。

诸如SCIMON、ResearchAgent和AI Co-Scientist等系统通过文献检索、知识图谱、审查循环和优化程序来增强LLM。这些系统改善了基础和执行,但它们通常从人类提供的种子概念、核心论文或问题表述开始。由于人类种子往往来自认知可获得的区域,下游系统可能继承同样的偏见。

概念重组。

一条更接近的路线将LLM视为外部提供的概念组合的解码器:系统从文献中构建一个非平凡的组合,并要求模型在其上进行推理。我们同意新颖性可以通过将模型置于其自然无法达到的概念状态来诱导。我们在两个方面有所不同。首先,先前的系统通常操作于粗略的关键词级别概念,如LLMRAGMCTS;我们自底向上从论文级别的方法学陈述构建一个含有内容的词汇表。其次,先前的系统通过随机选择、人工选择或距离启发式进行采样;我们学习一个显式分离连贯性和可获得性的搜索目标。

组合性技能表示。

我们的表示也类似于最近将语言模型行为视为可重用技能之上的组合的工作。Arora和Goyal给出了一个理论解释,其中复杂能力源于基本技能的组合。基于这一观点,Skill-Mix评估模型是否能灵活组合随机选择的技能子集,而元认知技能标记工作表明LLM能引出并聚类可解释的问题解决技能标签。Instruct-SkillMix建设性地使用了这个想法:它从指令遵循技能和随机技能对生成的合成数据中提取LLM技能,以改进指令微调。我们的想法原子起到类似的组合作用,但在来源和目标上都不同。它们不是任务技能或指令遵循标签;它们是自底向上从科学论文中提炼的方法学单元。此外,我们不依赖随机混合。

相似文章