StatefulDiscovery: 开放端科学发现中基于证据校准的主张形成

arXiv cs.AI 论文

摘要

介绍StatefulDiscovery,一个用于开放端科学发现的框架,它利用外部化的调查状态来校准证据和主张,在生成得到充分支持的高价值主张方面优于基线方法。

arXiv:2606.11851v1 公告类型:新 摘要:开放端科学发现要求智能体超越为预定义问题执行分析。在多轮探索中,发现智能体必须决定哪些现象值得调查,同时避免过度解读——即新出现的主张超出支撑其分析证据的范围。这引出了一个证据校准问题:探索轨迹必须与主张状态耦合,使证据既能指导下一步调查内容,也能指导可以提出的主张。我们提出StatefulDiscovery,一种将调查状态外部化并用其协调前沿选择、证据获取和主张裁决的发现框架。我们在40个真实数据发现任务上评估了StatefulDiscovery。与多个基线相比,StatefulDiscovery生成的总体主张中被认为既得到充分支持又具有高价值的数量更多。消融实验表明,结构化假设、局部裁决和前沿控制对性能有贡献。综合来看,这些结果表明显式的发现状态能够将探索与基于证据校准的主张形成耦合起来。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:49

# StatefulDiscovery:开放式科学发现中证据校准的声明形成
来源:https://arxiv.org/abs/2606.11851
查看PDF (https://arxiv.org/pdf/2606.11851)

> 摘要:开放式科学发现要求智能体超越执行预定义问题的分析。在多轮探索中,发现智能体必须决定哪些现象值得调查,同时避免过度解读——即新形成的声明超出支撑其分析的证据范围。这产生了证据校准问题:探索轨迹必须与声明状态耦合,使证据既能指导下一步调查什么,又能指导可以声明什么。我们引入StatefulDiscovery,一种将调查状态外部化并利用它来协调前沿选择、证据获取和声明裁决的发现框架。我们在40个真实数据发现任务上评估了StatefulDiscovery。与多个基线相比,StatefulDiscovery生成了更多被判定为既有充分支持又有高价值的声明。消融实验表明,结构化假设、局部裁决和前沿控制对性能有贡献。这些结果共同表明,显式的发现状态能够将探索与证据校准的声明形成耦合起来。

## 提交历史

来自:Jiayao Chen [查看邮件 (https://arxiv.org/show-email/b7af9ecb/2606.11851)] **\[v1\]** 2026年6月10日星期三 09:28:28 UTC (2,709 KB)

相似文章

基于证据的LLM信念用于持续科学发现

arXiv cs.AI

本文通过引入基于证据的非平稳信念,解决了基于LLM的科学发现中静态惊奇度的局限性,并提出了信念更新过滤和多样性最大化来改进发现,在五个领域实现了30.62%更高的非平稳惊奇度。

FirstResearch: 面向LLM科学发现代理的可审计问题形成框架

arXiv cs.AI

FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。

通过迭代元反射实现自主科学发现

Hugging Face Daily Papers

DiscoPER 是一个自主框架,利用大型语言模型和动态代码生成进行开放式科学研究,通过二阶元反射综合发现结果,并采用统计检验确保严谨性。在多模态生态基准测试中,它在恢复已知模式方面优于基线方法。

形式化猜想:数学中可验证发现的开放且持续演进的基准

arXiv cs.AI

本文介绍了形式化猜想(Formal Conjectures),这是一个持续演进的基准,包含2615个在 Lean 4 中形式化的数学陈述,其中包括用于证明发现的开放研究猜想和用于自动形式化的已解决问题,旨在零污染地评估自动推理系统。

证据账本裁决:实现主张-证据可追溯性

arXiv cs.AI

本文介绍了证据账本裁决(evidence-ledger adjudication),一种用于AI辅助写作中主张-证据可追溯性的工作流,并在基于AVeriTeC、CLIMATE-FEVER和SciFact构建的盲测基准上进行了评估,结果表明基于智能体的方法优于基线方法。