基于证据的LLM信念用于持续科学发现

arXiv cs.AI 论文

摘要

本文通过引入基于证据的非平稳信念,解决了基于LLM的科学发现中静态惊奇度的局限性,并提出了信念更新过滤和多样性最大化来改进发现,在五个领域实现了30.62%更高的非平稳惊奇度。

arXiv:2606.29182v1 公告类型: new 摘要: 使用大型语言模型(LLM)进行开放式科学发现越来越多地作为一个长期循环运行,包括假设搜索和验证,其中奖励信号指导下一步测试哪些假设。一个最近显著的例子是AutoDiscovery,它使用“贝叶斯惊奇”——LLM在观察假设证据后经历的信念转变——作为发现指标和搜索奖励。我们首先观察到AutoDiscovery将惊奇度视为静态量,而人类推理中的惊奇度是非平稳的——它相对于随着经验演变的信念来定义,这是持续科学发现的先决条件。我们通过基于证据的LLM信念来解决这个不匹配:用先前假设的证据更新先验,以计算新假设的非平稳惊奇度。我们比较了上下文信念更新机制,发现基于嵌入的检索增强生成在先前发现上最能预测最终后验,识别出37.5%的静态惊奇度为虚假。然后我们修改搜索以避免这些虚假奖励,并优先考虑在非平稳信念下仍然令人惊讶的假设。具体来说,我们对原始搜索程序引入了两个互补的变化:信念更新过滤和多样性最大化。在五个发现领域,我们的方法相比原始搜索程序平均提高了30.62%的累积非平稳惊奇度,表明使用LLM进行持续科学发现不仅需要更好的信念测量,还需要避免冗余并鼓励多样性的搜索程序。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:32

# 基于证据的LLM信念用于持续科学发现
来源:https://arxiv.org/html/2606.29182
![[未命名图片]](https://arxiv.org/html/2606.29182v1/figs/ai2.png)
Dhruv Agarwalαβ,Reece Adamsonβ,Andrew McCallumα,Peter Clarkβ,Ashish Sabharwalβ,Bodhisattwa Prasad Majumderβ
α马萨诸塞大学阿默斯特分校
β艾伦人工智能研究所
[email protected], [email protected]
22https://github.com/allenai/autodiscovery-continual-beliefs

###### 摘要

使用大语言模型(LLM)进行开放式科学发现日益表现为一个长期循环的假设搜索与验证过程,其中奖励信号引导下一步应测试哪些假设。近期一个值得注意的例子是AutoDiscovery(Agarwal等人,2025b (https://arxiv.org/html/2606.29182#bib.bib2)),它利用“贝叶斯惊奇”——即LLM在观察到某个假设的证据后发生的信念变化——作为发现度量和搜索奖励。我们首先观察到,AutoDiscovery将惊奇视为一个*静态*量,而人类推理中的惊奇是*非平稳*的——它相对于随经验演化的信念来定义,这是持续科学发现的先决条件。我们通过*基于证据的LLM信念*来纠正这一错配:利用先前假设的证据更新先验,从而计算新假设的*非平稳惊奇*。我们比较了上下文中的信念更新机制,发现基于嵌入的检索增强生成(RAG)在利用先前发现来预期最终后验方面表现最佳,识别出37.5%的静态惊奇为虚假。然后我们修改搜索过程,避免这些虚假奖励,并优先考虑在非平稳信念下仍然令人惊讶的假设。具体地,我们对原始搜索过程引入了两项互补的改动:信念更新过滤和多样性最大化。在五个发现领域上,与原始搜索过程相比,我们的方法平均将累积非平稳惊奇提高了30.62%,这表明使用LLM进行持续科学发现不仅需要更好的信念度量,还需要避免冗余并鼓励多样性的搜索过程。

## 1 引言

科学发现本质上是*持续*的——每一次观察都会改变未来应该被视为新颖、有信息量或令人惊讶的标准。这一观点是科学探究形式化描述的核心,其中证据不仅用于孤立地验证假设,还会修正发现主体的认知状态,从而改变未来可能假设的空间(Alchourrón等人,1985 (https://arxiv.org/html/2606.29182#bib.bib4);Gärdenfors,1988 (https://arxiv.org/html/2606.29182#bib.bib11);Martin和Osherson,1997 (https://arxiv.org/html/2606.29182#bib.bib28))。在贝叶斯科学推理中,这种修正通过条件化来捕捉,其中证据将一组先验信念转化为后验信念,后续推理基于更新后的后验而非原始先验进行(Earman,1992 (https://arxiv.org/html/2606.29182#bib.bib10);Howson和Urbach,2006 (https://arxiv.org/html/2606.29182#bib.bib15))。同样,关于科学理论如何演化的计算描述强调,假设的接受或拒绝并非独立进行,而是基于它们与累积解释和观察的一致性(Thagard,1989 (https://arxiv.org/html/2606.29182#bib.bib35),1992 (https://arxiv.org/html/2606.29182#bib.bib36);Jansen等人,2026 (https://arxiv.org/html/2606.29182#bib.bib18))。因此,在持续发现场景中,信念状态应该是*非平稳*的,并随着先前结果而演化。例如,在评估新颖性时,一旦观察到某个发现,其他被该发现蕴含或强烈暗示的假设应该被认为*不那么*新颖。

参见图注
图1:静态信念与非平稳信念。AutoDiscovery在五个发现领域找到的7500个假设的信念分布。AutoDiscovery使用*静态*信念,通过不变的LLM先验对假设进行评分,这导致那些已被搜索过程中先前证据蕴含的发现被错误地视为新颖。基于证据的LLM先验将参考信念状态移向最终后验,从而可以计算*非平稳*惊奇,与原始搜索发现的惊奇数量相比降低了37.43%。

使用大语言模型(LLM)的自动科学发现在这种持续场景中已展现出潜力,它在长期范围内交替进行假设提出(“搜索”)和假设支持评估(“验证”)(Lu等人,2024 (https://arxiv.org/html/2606.29182#bib.bib24);Yamada等人,2025 (https://arxiv.org/html/2606.29182#bib.bib38);Gottweis等人,2025 (https://arxiv.org/html/2606.29182#bib.bib13))。这类系统的一个近期显著例子是AutoDiscovery(Agarwal等人,2025b (https://arxiv.org/html/2606.29182#bib.bib2)),它使用“贝叶斯惊奇”(Itti和Baldi,2005 (https://arxiv.org/html/2606.29182#bib.bib17))作为假设搜索的奖励——给定一个假设\(H\),系统引出LLM关于\(H\)支持度的先验信念\(P(\theta_H)\),利用可用数据\(D\)上的验证程序\(\mathcal{V}_D\)评估\(H\),然后引出后验信念\(P(\theta_H\mid\mathcal{V}_D)\),根据产生的信念变化计算奖励。该奖励随后用于引导搜索朝向可能使LLM感到惊讶的候选假设,作为发现的代理信号。

然而,我们观察到,在惊奇奖励和评估指标中,AutoDiscovery都将LLM先验视为*静态*——每个假设都独立地根据模型参数化信念进行评估,而不考虑搜索轨迹中先前的发现。这种静态处理在LLM驱动的发现与人类科学推理之间造成了错配:作为评估指标,静态惊奇高估了进展,将衍生假设计为成功发现;作为搜索奖励,它浪费了预算,反复将代理引导向假设空间中的饱和区域。通过神经科学和社会科学领域的人类专家研究,我们发现在每个领域中,分别有29.54%和25%被AutoDiscovery视为令人惊讶的假设在很大程度上已被其先前发现所蕴含,而非真正新颖。类似于将人类学习视为对假设进行概率推理的贝叶斯认知模型(其中观察更新信念,进而支持进一步的预测和探索)(Tenenbaum等人,2006 (https://arxiv.org/html/2606.29182#bib.bib33);L Griffiths等人,2008 (https://arxiv.org/html/2606.29182#bib.bib22);Tenenbaum等人,2011 (https://arxiv.org/html/2606.29182#bib.bib34)),我们认为LLM驱动的发现必须转而使用*非平稳*惊奇,即基于持续利用先前假设证据更新的先验信念。

我们比较了使用上下文学习进行信念更新的不同机制,包括一种结构化记忆基线(Chhikara等人,2025 (https://arxiv.org/html/2606.29182#bib.bib7)),并发现简单的基于嵌入的top-k检索增强生成(RAG)在整合先前证据以预期最终后验方面表现最佳,平均将总惊奇降低了37.43%111其中基于证据的先验与验证后后验相匹配的假设。如图1 (https://arxiv.org/html/2606.29182#S1.F1) 所示,非平稳先验信念的分布能够更接近实验后验。然后我们研究能否将浪费在虚假惊奇上的搜索预算重新分配给那些在非平稳信念下仍然令人惊讶的假设。为此,我们在AutoDiscovery中提出了基于证据的搜索,引入两种互补机制:(a) 信念更新过滤,用于采样那些无法通过先前发现利用上下文推导出的假设;(b) 多样性最大化,通过选择与先前发现嵌入相似性最低的假设来明确优先探索。在五个发现领域(Majumder等人,2025 (https://arxiv.org/html/2606.29182#bib.bib27);Gu等人,2024 (https://arxiv.org/html/2606.29182#bib.bib14)),这些修改使累积非平稳惊奇平均比原始搜索过程提高了30.62%,表明持续发现需要明确管理冗余、信念饱和与多样性的搜索策略。总之,我们的贡献包括:

- • 我们识别了持续LLM驱动发现中*静态惊奇*的一种失效模式:尽管搜索过程中证据不断累积,假设却仍根据未变化的先验进行评分。我们通过神经科学和社会科学领域的人类专家验证了这种失效模式,表明分别有29.54%和25%的假设在使用静态信念时被认为是令人惊讶的,但这些假设可从先前发现推导出来。
- • 我们引入了*非平稳惊奇*,它相对于利用先前测试假设证据更新的LLM信念来评估假设。我们比较了基于ICL的信念更新机制,发现基于嵌入的RAG在预期后验信念方面表现最佳,将静态惊奇总数降低了37.5%。
- • 我们为AutoDiscovery提出了基于证据的搜索,包括信念更新过滤和多样性最大化,在五个发现领域使累积非平稳惊奇平均提高了30.62%。

## 2 背景

##### 数据驱动发现。遵循Majumder等人(2025 (https://arxiv.org/html/2606.29182#bib.bib27))的定义,我们将*数据驱动假设* \(H\in\mathcal{H}\) 定义为一个自然语言陈述。给定数据集\(D\),\(H\)的真值由验证程序\(\mathcal{V}_D:\mathcal{H}\to\{\mathrm{supported},\mathrm{unsupported}\}\)确定,其中\(\mathcal{V}_D\)可以是任意可执行的Python程序。

##### AutoDiscovery。本文聚焦于近期一个开放式的发现系统AutoDiscovery(Agarwal等人,2025b (https://arxiv.org/html/2606.29182#bib.bib2)),其中给定数据集\(D\)和搜索预算,发现代理使用基于“贝叶斯惊奇”的奖励,通过带有渐进式扩宽的MCTS(Coulom,2006 (https://arxiv.org/html/2606.29182#bib.bib9);Couëtoux等人,2011 (https://arxiv.org/html/2606.29182#bib.bib8))迭代搜索有前景的假设。这里我们使用MCTS的一种变体——UCB1递归,它递归地在节点及其子节点间贪婪选择下一个扩展的状态,直到选中父节点或叶节点。遵循Agarwal等人(2025b (https://arxiv.org/html/2606.29182#bib.bib2)),我们通过观察验证程序结果前后假设预期信念的变化来衡量贝叶斯惊奇\(BS\)。为引出信念,我们从LLM中基于五个类别采样多个响应:*“肯定为假”*、*“可能为假”*、*“不确定”*、*“可能为真”*和*“肯定为真”*,然后通过分配分数0、0.25、0.5、0.75和1.0将其映射为伪伯努利计数。使用Beta-伯努利共轭性可将这些计数转换为Beta分布。为简单和可解释性,我们使用经验惊奇来评估信念变化,定义为后验与先验经验均值之差。每个经验均值只是采样的类别响应的平均数值分数,因此所得量直接反映模型引出的信念在[0,1]尺度上的变化。

## 3 从静态惊奇到非平稳惊奇

考虑持续发现过程在时间步\(t\)的代理,在观察到假设\(\{H^{(i)}\}_{i=1}^{t-1}\)及其验证结果\(\{\mathcal{V}_D^{(i)}\}_{i=1}^{t-1}\)之后。为了评估新假设\(H^{(t)}\),从LLM中引出先验信念\(P(\theta_{H^{(t)}})\),该先验在标准情况下用于根据后验信念\(P(\theta_{H^{(t)}}\mid\mathcal{V}_D^{(t)})\)测量惊奇。然而,先前的工作对每个新假设从相同的*静态*222编码在LLM参数(在模型训练的不同阶段)中的信念分布独立引出先验。

##### 静态先验的失效模式。我们首先观察到在持续发现中使用静态信念会导致系统性的失效模式。那些被早期发现部分或完全蕴含的假设仍可能引发显著的先验-后验变化,从而错误地被视为令人惊讶。因此,发现代理可能会反复提出信息增益低的衍生假设,甚至“重新发现”先前的假设,虚假地增加搜索空间(即搜索树中的节点)中饱和区域的奖励,导致搜索预算的浪费。因此,评估新假设\(H^{(t)}\)的相关先验并非*静态*的无条件信念\(P(\theta_{H^{(t)}})\),而是以先前发现为证据更新后的信念状态:
\[
P\left(\theta_{H^{(t)}}\mid\{(H^{(i)},\mathcal{V}_D^{(i)})\}_{i=1}^{t-1}\right).
\]
我们将上述表达式定义为*非平稳先验*,从而正式定义*非平稳惊奇*为:
\[
S_{\mathrm{NS}}(H^{(t)},\mathcal{V}_D) := \mathbbm{1}\left[\left|\mathbb{E}_{P(\theta_{H^{(t)}}\mid\mathcal{V}_D)}[\theta_{H^{(t)}}] - \mathbb{E}_{P(\theta_{H^{(t)}}\mid\{(H^{(i)},\mathcal{V}_D^{(i)})\}_{i=1}^{t-1})}[\theta_{H^{(t)}}]\right| \geq \tau\right],
\]
其中\(\tau\)是用于判断信念变化是否应标记为惊奇的阈值333本文中我们将该值设为0.3。这种非平稳观点与形式化和贝叶斯科学推理的描述一致,其中证据会修正代理的认知状态,并改变哪些未来假设应被视为合理、有信息量或令人惊讶(Alchourrón等人,1985 (https://arxiv.org/html/2606.29182#bib.bib4);Gärdenfors,1988 (https://arxiv.org/html/2606.29182#bib.bib11);Martin和Osherson,1997 (https://arxiv.org/html/2606.29182#bib.bib28);Earman,1992 (https://arxiv.org/html/2606.29182#bib.bib10);Howson和Urbach,2006 (https://arxiv.org/html/2606.29182#bib.bib15);Thagard,1989 (https://arxiv.org/html/2606.29182#bib.bib35),1992 (https://arxiv.org/html/2606.29182#bib.bib36);Jansen等人,2026 (https://arxiv.org/html/2606.29182#bib.bib18);Tenenbaum等人,2006 (https://arxiv.org/html/2606.29182#bib.bib33);L Griffiths等人,2008 (https://arxiv.org/html/2606.29182#bib.bib22);Tenenbaum等人,2011 (https://arxiv.org/html/2606.29182#bib.bib34))。

##### 人类信念中的非平稳性。我们通过神经科学和社会科学领域的人类专家对AutoDiscovery生成的假设验证了这一前提。在每个领域中,我们要求专家在获得前5个最相似的先前假设及其验证结果后,对50个假设标注他们的先验信念。首先,我们发现专家确实*更新*了他们的信念

相似文章

FirstResearch: 面向LLM科学发现代理的可审计问题形成框架

arXiv cs.AI

FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。

LLM-AutoSciLab:通过主动实验实现闭环科学发现

arXiv cs.LG

LLM-AutoSciLab是一个闭环框架,利用LLM迭代生成假设、选择信息量大的实验并优化机制,在物理和生物学基准测试上相比之前的静态方法实现了更高的准确性和样本效率。