Distribird:基于文献信息的贝叶斯模型校准先验分布设计

arXiv cs.AI 论文

摘要

本文介绍Distribird,一个智能体Web应用,通过搜索和阅读科学文献来自动设计贝叶斯模型校准的信息性先验分布。文章使用本地开放权重LLM在十个领域的24个参数上评估了该工具,强调可追溯性、隐私性和范围外拒绝,而非原始准确率。

arXiv:2608.11210v1 公告类型:新 摘要:基于过程的模型贝叶斯校准需要为每个模型参数设定先验分布。尽管方法论研究已进行了数十年,研究人员几乎总是退而使用均匀先验。主要原因是,从科学文献中构建信息性先验非常耗时,且需要领域和统计两方面的专业知识。我们提出了\textbf{Distribird},一个智能体Web应用,可自动化这一过程。给定参数名称、物理描述和领域背景,Distribird部署一个多智能体流水线:搜索文献,按领域相关性提取并加权所报告的值,并通过AIC模型选择拟合概率分布。当没有可用的文献时,系统会回退到合理的无信息备选方案,并清楚报告其生成的每个先验背后的证据和置信水平。它针对那些模型具有物理可解释参数、且领域知识存在于已发表文献中的问题而设计。我们使用三个开放权重模型(Qwen3.6 27B、Gemma 4 31B、Mistral Small 4 119B)与单提示LLM基线进行比较,在10个科学领域的24个参数上评估了该工具。在先验质量方面,完整流水线与基线\emph{匹配}。每个先验都可追溯到构建它所依据的具体论文和数值;内置的有效性层会拒绝为范围外请求生成先验,而单提示基线在30个模型-参数案例中的11个中,对这些请求返回了自信但无根据的先验;并且每次语言模型调用都在本地运行,因此没有任何参数描述或未发表的建模细节被传输给第三方LLM提供商(只有生成的搜索词会到达公共文献数据库)。我们认为,对于科学用途而言,这些性质比点估计准确率的边际提升更为重要。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:20

# 1 引言 来源:https://arxiv.org/html/2608.11210 ![[无题图]](https://arxiv.org/html/2608.11210v1/assets/logo.png) Distribird:面向贝叶斯模型校准的文献知情先验分布设计 Patrik P\. Süli1,2, György Eigner1,2,3, Roland Hollós4,5 1 欧布达大学应用信息学与应用数学博士学院,匈牙利布达佩斯 2 欧布达大学约翰·冯·诺依曼信息学学院生物数学与应用人工智能研究所,匈牙利布达佩斯 3 欧布达大学生理控制研究中心,匈牙利布达佩斯 4 HUN\-REN农业研究中心,Brunszvik u\. 2\., Martonvásár 2462, 匈牙利 5 捷克科学院全球变化研究所,捷克共和国 suli\.patrik@uni\-obuda\.hu, eigner\.gyorgy@uni\-obuda\.hu, hollos\.roland@hun\-ren\.hu 2026 预印本,提交至 arXiv 摘要 基于过程的模型的贝叶斯校准需要为每个模型参数指定先验分布。尽管方法论研究已进行了数十年,研究人员几乎总是退而使用均匀先验。主要原因是:从科学文献中构建信息性先验既缓慢又需要领域知识和统计专业知识。我们提出了Distribird,一个实现该流程自动化的智能体化 Web 应用。给定参数名称、物理描述和领域上下文后,Distribird 部署一个多智能体 LangGraph 流水线,并行检索 Semantic Scholar 和 OpenAlex,通读检索到的论文全文,提取所报告的数值,根据每个来源的研究语境与目标领域的匹配程度对数值进行加权,并通过 AIC 模型选择从预定义的分布集合中拟合最佳匹配的概率分布。当没有可用文献时,系统会回退到合理的无信息替代方案(均匀先验或宽 Normal 分布),并清晰报告其产生的每个先验背后的证据和置信水平。它的设计目标是那些它能发挥最大作用的问题:基于过程的模型中具有物理可解释性的参数——这类参数的领域知识存在于已发表的文献中。我们在十个科学领域的 24 个参数上,使用三个开放权重模型(Qwen3.6 27B、Gemma 4 31B、Mistral Small 4 119B)在完全本地硬件上运行,并与单提示 LLM 基线进行受控比较。在先验质量方面,完整流水线与该基线持平而非超越;它的贡献属于另一种类型。每个先验都可追溯到用于构建它的具体论文和数值;内置的有效性层会拒绝为超出范围之外的请求生成先验,在每个模型上都标记出了全部五个超出范围的测试参数,而单提示基线在 30 个模型–参数组合中的 11 个中为这些参数返回了自信但毫无根据的先验;并且每一次语言模型调用都在本地开放权重上运行,因此不会有参数描述或未发表的建模细节被传输给第三方 LLM 提供商(只有生成的搜索词会到达公共文献数据库)。对于科学应用而言,我们认为这些性质比点估计精度的边际提升更重要。 ### 1\.1 校准问题 基于过程的模型使用带有参数的机理方程来描述复杂的自然系统(如作物生长、土壤中水的运动、生物地球化学循环、疾病传播等),这些参数代表物理、化学或生物量。由于许多参数无法直接测量,必须通过调整参数值直到模型输出与可用数据匹配,从观测中推断它们。这个过程称为模型校准,或逆建模(Hollós等,2022 (https://arxiv.org/html/2608.11210#bib.bib10))。解决该参数识别问题的方法从经典优化到现代机器学习估计器不等,例如,一种带有可微 ODE 求解器的神经网络估计器可以直接从测量中恢复肿瘤生长模型的患者特定参数(Kisbenedek等,2025 (https://arxiv.org/html/2608.11210#bib.bib11))。贝叶斯校核算得上是解决该问题最可靠的方法,无论从统计还是哲学角度都是如此(Gelman等,2013 (https://arxiv.org/html/2608.11210#bib.bib24))。它将关于参数的先验知识与观测数据中的信息结合起来,并返回一个后验分布,该分布不仅捕捉最可能的参数值,还捕捉其周围的不确定性。这种不确定性量化对于决策制定和如实报告模型预测至关重要。显式表示参数不确定性同样是以鲁棒模型为基础控制此类系统的核心,因为控制器的性能直接取决于该不确定性如何被捕捉(Varga等,2025 (https://arxiv.org/html/2608.11210#bib.bib12))。 ### 1\.2 先验问题 贝叶斯方法要求研究人员在查看数据之前为每个参数指定一个先验分布。这立即引出一个实际的问题:应该使用什么先验?数学上方便的回答是使用均匀先验:声称一个范围内的所有参数值都同样可信。这种做法在实践中几乎被普遍采用(Wallach等,2021 (https://arxiv.org/html/2608.11210#bib.bib21))。但它也几乎总是不充分的。Pericchi 和 Walley (1991 (https://arxiv.org/html/2608.11210#bib.bib16)) 表明,没有单一的无信息先验能在所有情况下有效。特别是均匀先验在重新参数化下不具有不变性,这是一个众所周知的局限:隐含的先验会随参数的书写方式而变化。使用均匀先验时,后验众数与最大似然估计完全重合(Gelman等,2013 (https://arxiv.org/html/2608.11210#bib.bib24)),使贝叶斯推断退化为它本应改进的方法。忽略真实先验知识所丢失的信息会产生实际后果:采样器收敛更慢,可信区间比必要的更宽,而当数据稀缺时,在信息性先验本可稳定后验的地方,后验却约束不足。信息性先验(捕捉关于参数的真实知识的先验)能改善所有这些性质;通过仔细推理参数来构建它们,而不是默认选择方便的做法,是一个长期原则(Gelman, 1996 (https://arxiv.org/html/2608.11210#bib.bib23))。构建它们所需的知识是存在的。它就存在于科学文献中:在报告测量值的论文中,在综合各项研究范围的综述文章中,在描述物理约束的教科书中。问题不在于知识缺失。问题在于收集和整合这些知识代价高昂。对于一个有二十个参数的模型,从文献中构建信息性先验可能需要数日阅读。研究人员默认使用均匀先验,不是因为他们认为它合适,而是因为替代方案成本太高。知道问题所在却缺乏可扩展解决方案,这种差距已经持续了三十多年。 ### 1\.3 大型语言模型作为解决路径 近年来能够自行搜索数据库的大型语言模型(LLM)创造了一个新选项。LLM 智能体可以搜索科学数据库、检索相关论文、提取所报告的数值,并自动将它们组合成概率分布,其成本使该过程可以常规使用(Huang, 2025 (https://arxiv.org/html/2608.11210#bib.bib4))。事实上,直接提示 LLM 获取先验已被证明可以快速、廉价地产生位置良好、信息丰富的分布(Riegler等,2025 (https://arxiv.org/html/2608.11210#bib.bib17);Emődi等,2025 (https://arxiv.org/html/2608.11210#bib.bib1)),这也是我们在整篇论文中采用单提示 LLM 作为基线的原因。然而,同一项研究也指出了直接引出先验的重要局限,并强调在科学实践中依赖它们时需要谨慎。LLM 返回的先验没有可追溯的基础:正如我们所展示的,模型会轻易为一个没有经验对应物、存在排版错误或属于软件内部调优常数的参数生成自信且信息丰富的先验。在科学语境中,每个先验都必须可辩护、可审计,这是不可接受的。同样重要的是归因问题:当语言模型综合文献中的发现却不引用其来源时,产生这些实证工作的研究人员得不到应有的认可,这种结果破坏了累积科学所依赖的激励结构。因此,我们的目标不是从语言模型中提取更准确的点估计,而是使基于文献的先验构建值得信赖。具体而言,这意味着三件事:每个值都可追溯到被引用的来源;超出范围的请求会被拒绝而非编造;整个流程在研究者自己的硬件上使用开放权重模型运行,因此不会有未发表的建模细节或专有数据被传输给第三方提供商。我们提出 Distribird,一个实现该流水线的 Web 应用和 Python 库。Distribird 不是通用先验引出工具。它专门针对最适用、最具影响力的基于文献的先验构建问题类别:具有物理可解释参数的基于过程的模型、活跃的发表社区、以及编码在科学记录中的真实先验知识。这带来一个明确的权衡:在我们的基准测试中,完整流水线并没有比一次精心提示的 LLM 调用产生更准确的先验,而且运行成本要高得多(第 3 节 (https://arxiv.org/html/2608.11210#S3))。它提供的是来源可溯性、对伪造证据的鲁棒性以及完全本地运行——这些性质使自动化先验工具适合科学工作流程。 ## 2 系统设计 ### 2\.1 概述 Distribird 实现为 Python 3\.10\+ 包,通过PyPI (https://pypi.org/project/distribird/)分发,并提供两个面向用户的接口:一个基于 FastAPI 的 REST API 和一个交互式 Streamlit Web 应用。两个接口调用相同的核心流水线,因此无论使用哪一个,行为都完全相同,并且两者都接受单个参数或一批参数,并按批次并行处理若干参数。系统通过环境变量(全部以DISTRIBIRD\_为前缀)进行配置,因此可以轻松通过 Docker 或直接安装部署。用户提供一个ParameterInput对象,指定参数名称、通俗的物理描述、测量单位、领域上下文字符串(例如“Biome\-BGCMuSo 玉米作物建模,中欧条件”),以及可选的物理约束(下界、上界)。例如:
```
ParameterInput(
    name="TMAX",
    description="Maximum temperature for photosynthesis",
    unit="°C",
    domain_context="Biome-BGCMuSo maize, Central Europe",
    constraints=ConstraintSpec(lower_bound=30.0, upper_bound=50.0)
)
```
系统返回一个PipelineResult,其中包含拟合后的先验分布、其置信水平、贡献来源数量、所有尝试过的搜索查询、检索到的论文完整列表及提取值、可选的情境丰富上下文,以及在启用多智能体审议时的主持人理由和任何被排除的论文。一个简化示例:
```
PipelineResult(
    prior=FittedPrior(
        family="truncated_normal",
        params={"mu": 40.5, "sigma": 3.2, "a": 30.0, "b": 50.0},
        confidence="high",
        is_informative=True,
        n_sources=6
    ),
    papers_found=16,
    values_extracted=8,
    search_queries=["maize maximum photosynthesis temperature", ...]
)
```
这一完整的来源链允许用户审计从文献搜索到最终分布的每一个步骤。 ### 2\.2 多智能体 LangGraph 流水线 Distribird 的核心是一个 LangGraph[脚注 1:LangGraph,一个用于多智能体 LLM 图的库:https://www.langchain.com/langgraph。] StateGraph,它编排一个具有三个反馈回路和一条条件前向路径的多智能体流水线。与有向无环图不同,该流水线允许循环:当初始证据过于单薄时,图会路由回早期节点再次尝试,然后再进入综合阶段。所有节点都读写一个共享的PipelineState类型化字典,该字典遵循黑板模式:一个仅追加的消息日志(BlackboardMessage),节点通过它共享发现、术语更新、查询建议、交叉引用和警告,而无需彼此直接连接。 #### 2\.2\.1 流水线总览 图 1 (https://arxiv.org/html/2608.11210#S2.F1) 展示了完整的图拓扑,包括三个反馈回路、一条条件前向路径和多智能体搜索子系统。该流水线包含十一个主要处理节点(包括一个范围规划节点和一个末端有效性分类节点,第 2.4 节 (https://arxiv.org/html/2608.11210#S2.SS4))和三个精化节点,由三个实现条件逻辑的路由函数连接。输入→Enrich→SearchStrategy→QueryGen→Search→RelevanceJudge→CrossEnrich(滚雪球式引用扩展)→FetchFulltext→Extract→QualityGate→Synthesize→ValidityCheck→输出
- 识别到≥2 篇相关论文:继续
- 否则:Loop B
- 证据充分:继续
- 值不足:Loop A
- 置信度低:Loop C
- EARLY\-SKIP:无法识别的参数。跳过整个流水线,不进行搜索、提取或综合;节省 80–95% 的运行时间
并行源智能体:• Semantic Scholar • OpenAlex • Deep Research(可选) • Web Search(可选)
↓ Moderator LLM 去重并选择共识论文
- 调度
- RefineSearch(0 值)
- Loop A:加宽领域(相关论文少)
- Loop B:RefineExtraction(置信度低)
- Loop C
图 1:Distribird LangGraph 流水线,包含三个反馈回路(A:搜索精化,B:领域加宽,C:提取精化)、一条交叉丰富前向路径,以及一条从 Enrich 到 Validity Check 的早期跳过路径(红色虚线),用于无法识别的参数(第 2.4 节 (https://arxiv.org/html/2608.11210#S2.SS4))。范围规划节点(SearchStrategy)设置初始搜索广度;当领域内证据单薄时,Loop B 会加宽它。Search 节点内部调度到并行源智能体,其输出由 Moderator LLM 协调。 #### 2\.2\.2 流水线节点与反馈回路 该流水线包含十一个主要处理节点:Enrich(参数语义扩展)、SearchStrategy(搜索范围规划;第 2.3 节 (https://arxiv.org/html/2608.11210#S2.SS3))、QueryGen(搜索查询生成)、Search(并行 API 查询)、RelevanceJudge(论文评分)、CrossEnrich(引用滚雪球式扩展)、FetchFulltext(PDF 检索与解析;第 2.6 节 (https://arxiv.org/html/2608.11210#S2.SS6))、Extract(数值提取)、QualityGate(路由逻辑)、Synthesize(分布拟合;第 2.7 节 (https://arxiv.org/html/2608.11210#S2.SS7))和 ValidityCheck(超范围分类,第 2.4 节 (https://arxiv.org/html/2608.11210#S2.SS4))。三个反馈回路和一条条件前向路径使流水线在初始证据不足时能够迭代改进结果。其中三条路由在质量门控处决定,质量门控按优先级顺序考虑它们(先领域加宽,再搜索精化,然后提取精化),否则继续进入综合阶段;交叉丰富前向路径则在相关性判断之后立即单独决定。四条路由是:
- 回路 A,搜索精化。当质量门控发现提取到的值为零时

相似文章

CalBrief:大型语言模型证据校准式科学简报的试点诊断基准

arXiv cs.CL

本文介绍了CalBrief——一个包含16个证据包和96个人工验证结论的试点诊断基准,用于评估大型语言模型是否能够生成证据校准的科学简报。研究发现,结构化组织能提升推理能力,但显式的强度校准策略过于保守,且这种保守性主要源于标签空间的扩展,而非信号注入。

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。