SGHA:基于证据的研究问题发现与本地语言模型

arXiv cs.AI 论文

摘要

SGHA是一个完全自动化的系统,使用本地9B语言模型,通过结构化证据和检测结构空白,从科学文献中发现研究问题,提供比专有模型更高的透明度和隐私保护。

arXiv:2608.17501v1 公告类型:新 摘要:近期在全自动AI科学家方面的努力表明,语言模型代理能够生成假设、执行实验并起草科学手稿。然而,在研究的早期阶段,当研究问题被提出时,这些AI科学家往往严重依赖专有的前沿模型。他们的提案受到不透明的参数知识以及基于提案本身的文献搜索的影响。这种知识实际上是一个黑箱,这种依赖使得生成的研究问题的证据基础和有效性难以审计,并且使过程容易受到模型特定的幻觉和偏见的影响。此外,如果专有研究材料被传输到外部API,使用这些模型会引发保密性、隐私和数据治理方面的担忧。 我们介绍了结构空白假设代理(SGHA),这是一个完全自动化的、基于语料库的研究问题发现系统,完全运行在本地LLM上。SGHA将科学文献语料库结构化为证据链接的论文对象和类型化的证据图,检测跨论文的未解决结构模式,在提出前筛选候选空白,并生成可追溯的研究问题族。特别地,它能够输出假设、目标、成功标准和剩余的歧义。SGHA的所有基于LLM的组件都使用本地服务的开放权重9B语言模型执行,无需专有的前沿模型API。我们在五个机器学习领域将SGHA与AI Scientist-v2的想法制定模块进行了比较。我们的结果表明,显式的语料库结构和证据约束推理可以支持有前景的、可检查的研究问题制定,无需在生成或验证过程中依赖前沿模型。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:05

# SGHA:基于本地语言模型的证据导向研究问题发现
来源:https://arxiv.org/html/2608.17501
###### 摘要
近期在全自动化AI科学家领域的研究表明,语言模型智能体能够生成假设、执行实验并撰写科学论文。然而在研究的早期阶段——即研究问题被提出时,这类AI科学家往往严重依赖专有的前沿模型。它们的提案受到不透明的参数知识及基于自身提案的文献检索所塑造。这类知识实质上是个黑箱,这种依赖使得生成的研究问题的证据基础和有效性难以审计,并且使整个过程容易受到模型特有的幻觉和偏见影响。此外,如果专有研究材料通过外部API传输,使用这些模型还会引发保密性、隐私和数据治理方面的顾虑。

我们提出了**结构差距假设智能体**(SGHA),这是一个完全自动化、以语料库为先的研究问题发现系统,完全在本地LLM上运行。SGHA将科学文献语料库构建为具有证据链接的论文对象和类型化证据图,检测跨论文的未解决结构模式,在问题表述前筛选候选差距,并生成可追溯的研究问题族。特别是,它能够输出假设、目标、成功标准和剩余的歧义。SGHA的所有基于LLM的组件均使用本地部署的开源9B参数语言模型执行,无需依赖专有的前沿模型API。

我们在五个机器学习领域将SGHA与AI Scientist-v2的想法构思模块进行了比较。结果表明,在生成或验证过程中不依赖前沿模型的情况下,显式的语料库结构和证据约束推理能够支持有前景且可检验的研究问题表述。

## 1 引言
近期的语言模型智能体能够生成研究想法并自动化科学工作流的部分环节,包括编写代码、运行实验、分析结果以及准备论文[21,13,18,20,9,14,5]。若干端到端系统首先在用户提供的主题或实验框架内生成候选想法,然后尝试发展这些想法。在本文中,我们研究一个不同的起点:自动化系统能否识别科学文献中已由未解决模式所暗示的研究问题——即使没有单篇论文直接陈述这些问题。

如图1所示,许多研究问题只有在综合考虑多篇论文时才会显现。一组方法可能在同一条件下失效,多个保证可能依赖于同一强假设,或者某个局限性被反复报告却未能转化为具体的研究问题。在这种情况下,问题的证据已经存在,但分散在不同论文中。

作为一个简单例子,考虑1985年至2011年关于随机多臂老虎机的文献。研究者尝试用累积奖励缺口(称为遗憾)来表征算法性能。一种基于置信区间的流行算法使用集中不等式对有界奖励实现了O(log T)的遗憾值[4];这一速率是最优的[11]。然而其向重尾奖励的扩展当时并不广为人知。Bubeck等人后来使用鲁棒估计器填补了这一空白,Agrawal等人随后改进并澄清了与有界奖励模型的联系[6,1]。在重尾奖励下表征遗憾的研究问题就是我们所说的**结构差距**:一种存在于文献中但尚未解决的模式。

SGHA通过前瞻性地检测和验证类似的语料库级差距,并将其表述为证据导向的研究问题来模拟这一过程。

现有系统要么将假设生成条件化于包含明确研究问题和先前工作综述的研究背景[19],要么在由人类编写的代码模板(AI Scientist v1)[13]、宽泛的主题描述(AI Scientist v2)[18]、科学家指定的研究目标[9]、选定的核心论文[5]或用于图导向文献检索的输入主题[12]所锚定的搜索空间内表述候选研究问题、方向或假设。

ResearchAgent明确包含一个基于LLM的问题识别步骤,但问题是从核心论文、其引文邻域和检索到的实体生成的。最近,Graph2Idea根据输入主题检索论文,将其转换为结构化知识三元组,动态构建以目标为中心的知识图谱,然后规划研究方向,最后综合完整的想法[12]。据我们所知,这些系统均未整合以下三项能力:对主题限定的全文语料库进行类型化结构差距检测、表述前的语料库级验证,以及为证据、反证据和显式歧义提供段落级出处。

除了基础模型能力外,部署是另一个独立的实际考量。在其已报告的实现或主要实验配置中,几个著名系统使用专有模型或托管推理服务进行核心想法的生成或优化[13,5,18,9],这相对于本地部署的开源权重推理,限制了精确的可重现性和模型级别的可审计性。

我们提出**SGHA**(结构差距假设智能体),这是一个无需训练的系统,用于从科学论文中生成候选研究问题族。图1总结了该流程。给定一个主题,SGHA检索并解析相关论文,提取有证据支持的科学元组和论文级对象,并构建链接到支持段落的类型化证据图。然后,它搜索该图中的候选结构差距。只有通过严格验证关卡的差距才能进入表述阶段。SGHA首先撰写一个接近证据的直接表述,然后生成更广泛的变体,并使用单独的评审机制来拒绝那些无支撑或仅修辞上更强的变体。幸存的表述被分组为项目族,并转换为半形式化的问题描述,其中包含主要变量、假设、反馈/观测模型、目标、成功标准和未解决的歧义。当证据太弱时,SGHA报告低信号结果而非强制生成研究菜单。

SGHA还支持两种互补模式。配置条件化模式使用研究者的文献背景和可选的目标主题来优先处理与此背景相关的问题。进化探索分支通过迭代拓宽基于文献的种子来产生额外的候选方向。这些模式使用相同的基本目标:使生成的问题与证据保持关联,而非将其视为不受约束的提示补全。

我们在五个机器学习领域评估SGHA:老虎机、上下文学习、推理与测试时计算、离线强化学习和不确定性估计。主要实验使用冻结的本地Qwen/Qwen3.5-9B模型进行生成,无需特定任务的训练或微调。在1,250篇选定论文中,SGHA从1,044篇论文中提取结构化内容。经过验证后,保留39个候选差距,并产生15个形式化的项目族。

我们的主要比较对象是配置相同本地模型并匹配输出数量的AI-Scientist-v2构思工作流。这是一种系统级比较,而非信息匹配的消融研究:SGHA使用限定语料库,而AI-Scientist-v2保留其Semantic Scholar检索。由于SGHA旨在撰写研究问题表述而非完整的项目计划,我们使用仅针对表述的评分标准进行评估。在此标准下,使用来自不同提供商的五个前沿模型评审员进行的、掩盖方法标签的评估显示,SGHA在所有表述质量标准(包括问题明确性、假设边界清晰度、形式化可能性、来源特定性和歧义处理)上的平均得分均高于AI-Scientist-v2(除一项外)。仅在范围控制方面,本地AI-Scientist-v2基准获得了更高的平均分,这与其倾向于生成更狭窄的提案式想法的特点一致。

托管评审员仅在候选输出冻结后用于事后评估,不参与SGHA的生成或验证流程。我们还使用Claude Opus在AI-Scientist-v2工作流中以及公开的MOOSE-Star HC模型[19]进行了额外比较。在匹配保留输出数量但不匹配计算或信息预算的Claude Opus诊断中,SGHA在总体表述质量上获得了与使用Claude Opus的AI-Scientist-v2相当的数值平均分。

我们还报告了关于配置条件化、模型配置、语料库大小和进化输出可用性的探索性诊断,将其视为能力或敏感性分析而非受控比较。

### 主要贡献
•**以语料库为先的研究问题发现**。我们提出SGHA,这是一个端到端流程,检测限定语料库中跨论文的未解决模式,并将验证后的差距转化为证据导向的研究问题族。所有生成和验证阶段均在本地部署的开源LLM上运行,无需专有的前沿模型API。
•**表述前的验证**。SGHA并非为每个检测到的模式表述研究问题。它首先筛选每个候选问题在限定语料库内的证据支撑和先前覆盖情况,仅对通过验证的问题进行表述,并使用单独的评审机制来拒绝无支撑的野心膨胀变体。
•**可追溯的问题表述**。SGHA输出包含显式假设、目标和成功标准的问题规格说明。每个规格说明保留其源模式类型,并包含段落级证据和反证据链接以及显式歧义标注。
•**质量、广度和失败模式的实证分析**。我们在多个领域使用本地模型评估SGHA,主要将其与本地配置的AI-Scientist-v2想法生成工作流进行比较,并报告了关于配置条件化、跨模型行为、语料库大小、低信号行为和进化探索可用性的探索性诊断。

### 相关工作:使用本地LLM的自动化研究构思
开源本地LLM已被用于自动化科学构思。SciMON在生化案例研究中微调了T5-large和Meditron-7B,基于论文生成的监督数据,而其报告的迭代新颖性提升实验使用了GPT-4[17]。HypER使用Llama-3.1-70B教师模型来构建和评分引文链,并使用LoRA微调Phi-3 Mini 3.8B进行相关性和链验证任务;然后在推理时基于验证后的链进行假设生成[15]。MOOSE-Star微调R1-Distill-Qwen-7B模型,用于灵感检索和假设组合,其监督数据由本地部署的32B教师模型生成[19]。这些可本地执行的开源实例依赖于特定任务的微调或蒸馏,且它们没有将研究问题发现明确建模为检测和验证限定文献语料库中的未解决结构差距。

HypoGeniC可以使用开源的Mixtral-8x7B模型运行,并从标记样本中更新预测性自然语言假设库,而无需微调生成器;它不搜索文献语料库来发现研究问题[21]。

在最相关的先前工作中,**通过知识图谱中的结构模式进行问题发现(PRISM)**[8]通过检测论文语料库中的结构差距来探索基于结构模式的问题发现,将图模式转换为结构化问题对象,并使用新颖性和可行性评审器进行细化。其专家评估协议被提出但未实施,因此无法确定检测到的模式是否代表真正的未解决差距,而非检索或提取的伪影或语料库其他地方已涵盖的问题。SGHA在限定语料库内部分解决了此问题,通过在表述前验证候选差距、合并冗余方向并使剩余歧义显式化。

## 2 结构差距假设智能体
SGHA围绕一个简单约束设计:生成的研究问题应与文献中的证据相关联。给定一个主题,系统首先从论文中构建结构化证据基础,然后在该证据中寻找重复模式,验证由此产生的候选差距,最后才表述研究问题族。这不同于要求语言模型直接从主题生成想法。语言模型仅在特定阶段使用,而图构建、模式检测、验证关卡、族合并和最终审计则使流程保持扎根。

引言中的概览图展示了完整流程。在本节中,我们描述流经它的主要对象:证据元组、类型化证据图、结构模式、候选差距、已验证差距、项目族和形式化问题陈述。我们使用一个老虎机示例作为贯穿参考。在选定的语料库中,SGHA提取到基于扩散的汤普森采样(dTS)在线性奖励或链接函数假设及有界背景下被分析,而相关证据则指出非线性评分函数需要近似。这条线索后来导向项目族**刻画基于扩散的上下文老虎机的非凸失效机制**。

相似文章

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。