AquiLLM:评估科学研究中开源权重RAG-LLM系统的忠实度

arXiv cs.AI 论文

摘要

本文评估了开源权重RAG-LLM系统AquiLLM在天文学科学研究中的忠实度,显示其在检索任务上表现优异,但在综合方面存在挑战。

arXiv:2609.16519v1 Announce Type: new 摘要:科学研究日益依赖大规模、异构的数据源,这推动了检索增强生成(RAG)系统的兴趣,这些系统提供对科学知识和研究工作流的自然语言访问。研究人员正在探索这些系统作为文档搜索和生成分析代码及流程组件的自然语言接口的可行性。同时,对数据隐私和研究基础设施控制的担忧促使人们关注在研究机构内部署的开源权重模型和开源部署。 在天文学领域,这一发展遵循了计算基础设施开发的悠久历史,从档案数据库和基于SQL的系统到LLM辅助的研究工具。本文对AquiLLM的忠实度进行了领域专家评估,AquiLLM是一个开源权重的离线RAG-LLM平台,旨在支持科学研究小组使用和保存隐性及显性知识。 我们将忠实度定义为生成的响应基于检索到的科学上下文而不包含无支持主张或遗漏的程度。我们报告了一个天文学案例研究的结果,评估了AquiLLM在检索和科学分析任务中的表现。AquiLLM在基于RAG集合的显性检索相关问题上表现最可靠,而在需要综合或解决歧义的查询中忠实度有所下降。这些结果突出了开源权重RAG-LLM系统在科学研究中的前景和局限性,并证明了超越标准基准排行榜的领域专家评估的重要性。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:00

# AquiLLM:评估开放权重RAG-LLM系统在科学研究中的忠实性  
来源:https://arxiv.org/html/2609.16519  
Bernie Boscoe¹, Srinath Saikrishnan⁴, Vikram Seenivasan², Jack Stark², Andrew Lizarraga³, Morgan Himes², Jonathan Soriano², PJ Allen¹, Tuan Do²  
**所属机构**:  
¹美国南俄勒冈大学计算机科学系  
²美国加州大学洛杉矶分校物理与天文学系  
³美国加州大学洛杉矶分校统计系  
⁴美国加州大学洛杉矶分校计算机科学系  

**联系邮箱**:  
[email protected], [email protected], [email protected], [email protected], [email protected], [email protected], [email protected], [email protected], [email protected]  

#### 摘要  
科学研究越来越依赖于大规模、异构的数据源,这推动了检索增强生成(RAG)系统的应用——这些系统能够为科学知识和研究工作流提供自然语言接口。研究人员正在探索这些系统作为文档搜索自然语言接口,以及生成分析代码和流程组件的可行性。与此同时,对数据隐私和研究基础设施控制的担忧,促使人们关注开放权重模型和研究机构内部署的开源方案。在天文学领域,这一发展延续了其计算基础设施建设的悠久历史——从归档数据库和基于SQL的系统到大语言模型辅助研究工具。本文通过领域专家评估了AquiLLM的忠实性,这是一个面向科学研究组的开放权重离线RAG-LLM平台,旨在支持隐性与形式化知识的利用与保存。我们将忠实性定义为:生成的回答在多大程度上扎根于检索到的科学上下文,而不包含无依据的主张或遗漏。我们报告了通过天文学案例研究评估AquiLLM在检索与科学分析任务中的表现。AquiLLM在基于RAG集合的明确检索型问题上表现最可靠,但在需要综合分析或模糊解析的查询中,忠实性有所下降。这些结果既揭示了开放权重RAG-LLM系统在科学研究中的潜力与局限,也证明了超越标准基准排行榜进行领域专家评估的重要性。  

#### 关键词  
检索增强生成,大语言模型,科学工作流,自然语言接口,忠实性评估,天文学,开放权重模型  

## I 引言  
随着科学数据系统规模和复杂性的增长,自然语言接口能够降低研究人员获取日益异构的知识形式的门槛\[1\]。现代科学工作流需要在大型且通常互不兼容的平台中导航数据与代码。研究知识也以较非正式的隐性形式存在,包括未发表的手稿、会议记录、电子邮件、软件文档和Jupyter笔记本。这些来源的碎片化给研究人员带来了巨大的认知和技术负担。  

天文学长期以来一直是开发计算数据基础设施和大规模科学归档库的先锋,以应对观测数据规模和复杂性的增长。诸如斯隆数字巡天等项目通过可搜索的存储库、数据库驱动架构以及天文与计算机科学交叉合作开发的基于SQL的查询界面,改变了天文数据的访问方式\[2\]。这些系统帮助建立了一种更广泛的数据密集型科学范式,即大型观测数据集可以通过网络门户和结构化数据库查询进行远程探索。  

尽管基于SQL的系统极大地普及了科学数据的访问,但它们仍需要熟悉数据库模式和查询语法。自然语言接口提供了一种降低这种复杂性的方法,允许研究人员以对话方式与科学系统交互,无需专门的查询语言或软件专业知识\[3,4\]。检索增强大语言模型(RAG-LLM)系统在从结构化SQL查询系统向自然语言科学接口的转变中尤为重要\[5\]。大语言模型、RAG和易于获取的计算基础设施的最新进展加速了各科学领域的兴趣\[6,7\]。  

尽管势头强劲,许多研究组对于在涉及未发表数据和专有分析的工作流中依赖商业AI平台仍持谨慎态度。围绕隐私、可重复性和成本的担忧,促使人们对开放权重模型和本地部署的RAG-LLM系统的兴趣日益增长。AquiLLM作为一个开源、开放权重的平台被开发出来,旨在帮助研究组共同保存并与形式化和隐性知识进行交互\[8,30\]。我们使用“开放权重”来指代其训练参数公开可用,而底层训练数据、代码和方法论不可用的模型。这些模型仍可本地部署和微调。  

AquiLLM系统允许研究人员创建个人或团队集合,并使用自然语言进行查询,以支持信息检索和新成员入职。此外,AquiLLM是模块化的,使研究组能够使模型适应特定领域的工作流和在专业研究语料库上的检索。  

开放权重语言模型正在迅速普及,但它们仍通过基准排行榜和通用语言任务进行评估\[10\]。虽然这些基准提供了有用的比较指标,但标准化评估的表现并不一定反映在科学环境中的可靠性。科学应用要求系统准确反映原始材料,避免无依据的推理。  

在这项工作中,我们将**忠实性**定义为:生成的回答在多大程度上扎根于检索到的科学上下文,而不包含无依据的推理。虽然人类评估仍然是评估忠实性的金标准,但此类评估在大规模实施时困难且成本高昂\[11\]。我们进行了一项领域专家评估,天文学家们根据其研究组自身的数据和文档创建的科学查询类别,评估AquiLLM的回答。该研究包括涉及事实检索和比较科学分析的问题。  

通过此评估,我们研究了忠实性在不同形式的科学交互中的变化,并识别了标准基准评估未能捕捉到的局限性。这项工作为理解开放权重离线RAG-LLM系统在领域科学中的局限性奠定了基础,并强调了领域专家评估对于改进可信赖RAG-LLM系统的重要性。  

本文做出三项贡献。首先,我们介绍了AquiLLM,一个已部署的模块化、开放权重RAG-LLM系统(第III节),研究组可以直接采用该系统进行本地、隐私保护的自身科学知识访问。其次,我们引入了一种基于五个查询类别的领域专家评估方法,涵盖了不同程度的检索复杂性和推理(第IV-D节),其他研究组可以重用此方法来评估其自身科学RAG部署中的忠实性。第三,我们报告了将此方法应用于一个天文学研究组的经验发现,识别了六种常见的失败模式,并表明忠实性在跨源综合和比较推理方面特定下降,而不是均匀地在所有查询类型上下降(第V节)。由于这是一项初步的、单一研究组、单一领域的研究,我们将这些贡献视为基线评估而非通用基准;第VII节详述了由此产生的范围限制,包括缺乏与替代RAG系统的控制比较。  

## II 相关工作  
早期关于数据库自然语言接口的工作探讨了用户如何通过对话方式而非SQL等正式查询语言进行查询\[1\]。自然语言处理(NLP)随着旨在支持数据密集型研究工作流的赛博基础设施平台的发展而发展\[12\]。研究软件工程师,无论其头衔如何,在构建和维护这些系统以辅助计算研究方面发挥了核心作用\[13\]。在研究软件工程师(RSE)角色更加规范化之前,领域科学家通常依赖研究生、与计算机科学家的合作,或跨学科和计算领域的研究人员来开发科学软件和基础设施。  

当代的大语言模型接口源于数十年科学赛博基础设施的发展,将早期的数据库系统扩展为对话式知识接口\[14\]。最近的RAG架构将大语言模型与检索系统相结合\[15\],使用向量数据库和语义搜索方法使回答扎根于特定领域的文档集合。在科学环境中,这些系统已被探索用于文献检索、科学问答以及与技术文档和代码的交互\[16,6,17\]。许多特定领域的RAG系统专注于基于事实的生成,以减少幻觉并提高生成回答的可靠性\[18\]。AquiLLM建立在这些方法之上,同时强调保存隐性研究知识和研究组上下文\[19\]。  

近期大语言模型接口的许多发展是通过商业AI平台和托管服务实现的。相比之下,开放权重模型和本地开发的RAG-LLM系统使研究组能够直接控制其科学知识系统的配置、审计和维护,而无需依赖外部提供商的基础设施或服务条款。其他科学领域的基准测试同样发现,开源模型可以匹敌闭源模型的性能,同时提供更高的透明度、可重复性、成本效益和数据隐私性\[20\]。AquiLLM通过模块化、本地控制的开源方法构建RAG-LLM系统,正是基于这一观点。  

这些系统的核心是回答的可靠性。大语言模型可能生成看似合理但却是捏造或误导性的信息\[21\]。先前的工作已经探讨了用于评估生成回答的概念,包括正确性、事实性、忠实性和基于事实性\[22,23\]。在科学环境中,这些问题很重要,因为研究工作流依赖于对原始材料的准确解释和技术知识的可信赖传达。科学应用比通用对话系统需要更高的可靠性标准。看似合理但无依据的主张,或跨文档的错误综合,会破坏对大语言模型驱动工作流的信任。检索增强系统旨在通过基于检索的证据使回答扎根于事实,从而减少这些风险,但在实践中这些系统如何忠实地表示科学原始材料仍存在疑问\[24,25\]。  

基准排行榜提供了有用的比较指标,但未能充分捕捉特定科学领域的可靠性\[10\]。评估专业的科学知识需要情境理解和对研究工作流的熟悉,而自动化指标可能无法检测到这些\[18\]。  

![图1:AquiLLM高级架构示意图。后台工作器处理文档摄入和索引,而运行时请求通过协调检索、记忆和工具使用的提示编排层。本地推理通过vLLM提供服务,使用单独的模型进行聊天、嵌入、重排序和多模态处理。](https://arxiv.org/html/2609.16519/extracted/x1.png)  
**图1:** AquiLLM高级架构。后台工作器处理文档摄入和索引,而运行时请求通过协调检索、记忆和工具使用的提示编排层。本地推理通过vLLM提供服务,使用单独的模型进行聊天、嵌入、重排序和多模态处理。  

因此,人类评估仍然是评估科学系统中忠实性和可靠性的重要方法。然而,专家标注困难且成本高昂。这些挑战促使开发情境评估框架,由领域专家评估基于其自身研究组知识库的回答,而不是仅仅依赖模型开发者制定的标准化基准任务。  

## III AquiLLM系统概述  
AquiLLM是一个基于浏览器的开源RAG-LLM工具,旨在通过自然语言交互支持研究组与科学知识集合的交互\[8\]。用户可以创建包含已发布和私有数据的个人或共享集合,然后通过对话方式查询这些材料。该系统支持信息检索,同时保存嵌入在科学工作流和研究协作中的隐性知识。  

最初为天文学和环境科学研究组开发,AquiLLM被设计为一个面向研究组知识系统的通用框架。AquiLLM的源代码和部署配置通过GitHub项目仓库公开提供,允许研究组构建和部署自己的AquiLLM实例。持久的公共部署仍然受到支持本地托管的开放权重模型和多模态检索工作负载所需计算资源的限制。我们当前的研究部署在专用GPU基础设施上运行,以支持交互式工作流和并发用户。我们定期提供现场演示,同时探索为研究组提供计算上更易访问的部署配置。  

### III-A 天文学案例研究  
在本研究中,我们评估了一个针对天文学领域部署的AquiLLM,该部署围绕天文学和机器学习研究集合构建。参与的天文学家准备了一个专用集合,包含用于其研究的巡天文档和出版物。对于这项初步研究,我们专注于形式化的科学产物,包括未发表的手稿和技术文档,而非更广泛的隐性工作流和

相似文章

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

arXiv cs.AI

介绍了EnterpriseRAG,一个包含六个领域983个专家验证样本的基准测试,用于评估LLM在非理想企业检索条件下的指令遵循和鲁棒性,这些条件包括噪声、知识缺口和事实冲突。对13个LLM的评估揭示了单个约束满足率与整体合规率之间的巨大差距,凸显了在生产级RAG系统中需要上下文感知协议。