利用大语言模型进行疾病传播模型系统文献综述

arXiv cs.AI 论文

摘要

本文开发了一个LLM流水线,用于自动化疾病传播建模中的系统文献综述,并将GPT-4.1和GPT-5.0的性能与人工进行的综述进行比较。

arXiv:2608.26150v1 Announce Type: new 摘要:大语言模型(LLMs)的最新进展为简化和潜在地自动化许多研究过程创造了新机会,包括系统文献综述(SLRs)。本研究报告了一个LLM流水线的开发,用于从536篇同行评审的基于代理的建模论文中提取与模型相关的信息。我们将结果与人工进行的SLR进行比较。我们的结果显示,GPT-4.1的论文级准确率约为77.95%,GPT-5.0约为81.67%。字段级准确率范围从32.40%到100.00%,更复杂或主观的字段性能较差。重要的是,我们发现LLMs之间的一致性是输出质量的潜在指标:低一致性可能表示幻觉,而高一致性与低准确性相结合可能指向人类数据集中的噪声或错误。总体而言,我们的研究为提示开发提供了实践见解,并突出了在建模和仿真领域使用LLMs进行全规模SLRs的潜力和局限性。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:28

# 利用大语言模型对疾病传播模型进行系统文献综述
来源:https://arxiv.org/html/2608.26150
\\WSCpagesetup

Cinar, Ozkose, Von Hoene, Roess, Anderson, and Kavak

Timur Emre Ozkose² Emma Von Hoene³ Amira Roess⁴ Taylor Anderson³ and Hamdi Kavak² 
1乔治梅森大学计算机系,弗吉尼亚州费尔法克斯,美国
2乔治梅森大学计算与数据科学系,弗吉尼亚州费尔法克斯,美国
3乔治梅森大学公共卫生学院,弗吉尼亚州费尔法克斯,美国
4乔治梅森大学地理与地理信息科学系,弗吉尼亚州费尔法克斯,美国

## 摘要

大型语言模型(LLMs)的最新进展为简化甚至自动化许多研究流程创造了新的机遇,包括系统文献综述(SLRs)。本研究报告了一种LLM流程的开发,该流程用于从536篇经同行评审的基于代理的建模论文中提取与模型相关的信息。我们将结果与人工进行的系统文献综述结果进行了比较。我们的结果显示,GPT-4.1的论文级准确率约为77.95%,GPT-5.0约为81.67%。字段级准确率在32.40%到100.00%之间,其中更复杂或主观性更强的字段表现不太可靠。重要的是,我们发现LLMs之间的一致性是输出质量的潜在指标:低一致性可能意味着出现“幻觉”,而高一致性结合低准确率则可能指向人类数据集中的噪声或错误。总体而言,我们的研究为提示词开发提供了实用见解,并强调了在建模与仿真领域使用LLMs进行大规模系统文献综述的潜力和局限性。

## 1 引言

系统文献综述(SLR)通过透明且可重复的方法来识别和综合科学证据,以回答研究问题。SLRs广泛应用于许多学科,包括疾病传播仿真模型的进展、社会生态系统、人类流动性和政策建模等领域。SLRs遵循严格的流程和报告指南,如PRISMA。因此,SLRs研究密集型,既耗时又昂贵。它们需要时间进行搜索、筛选、全文评估和手动数据提取。先前的工作量化了SLR中的劳动力投入,发现单个SLR至少需要6-16个月,成本约为141,194.80美元。

大型语言模型(LLMs)的快速发展为减少进行SLRs的时间和成本创造了新的机遇。因此,研究人员开始评估LLMs在SLR工作流多个阶段中的性能。最近的一项综述确定了37篇研究LLMs在SLR中应用的论文。LLM方法涵盖了大部分SLR步骤,包括文献搜索(n = 15, 41%)、研究筛选(n = 14, 38%)和数据提取(n = 11, 30%)。将LLM结果与人类参考数据进行比较的验证研究约占研究的一半(n = 21, 57%)。

在LLMs应用于SLR的这一更广泛背景下,数据提取尤其引人关注,因为这是最耗费人力的步骤之一,且容易受到审稿人主观性的影响。现有评估整合LLM潜力的研究在小样本上提供了概念验证结果,通常针对临床SLRs。虽然文献证明了基于LLM的提取在SLR中的可行性,但当扩展到系统性综述的全部容量时,这些方法的表现证据仍然有限,尤其是在建模与仿真领域。例如,LLM主要应用于临床SLR,这促使我们需要更好地理解LLMs在其他情境下的性能,例如提取仿真模型特征(例如,模型目的、校准、不确定性报告)。

本研究的目标是通过评估基于LLM的数据提取(使用GPT-4.1和GPT-5.0)来解决这一空白,所用的参考数据集来自先前完成的关于536篇COVID-19基于代理模型(ABMs)的SLR。根据参考数据集的数据模式,我们开发了一个自动化的LLM流程,该流程处理全文科学论文,并生成结构化输出,可以与人类提取的数据进行逐字段比较。该流程设计允许在系统文献综述工作流的不同阶段(如筛选或综合)之外,对人类提取的数据和LLM提取的数据进行比较。

本文其余部分的结构如下。第2节总结了人工智能(AI)工具如何用于简化和推进研究。第3节介绍了本研究使用的方法。第4节是人类提取的SLR数据与LLM提取的SLR数据之间的比较,以及不同LLM输出(GPT-5.0 vs. GPT-4.1)之间的比较。第5节以总结和讨论结束本文。

## 2 系统文献综述中的大型语言模型

人们早已认识到,研究过程中的关键组成部分可以被形式化并得到计算支持。20世纪80年代的早期工作认为,重要的科学发现过程,如假设生成、模型构建和理论修正,遵循已知的模式,这使得在过程中对它们进行建模成为可能。这些想法隐含地为自动化科学活动奠定了基础,包括文献综述、知识综合和新的发现。截至本文撰写时,已有大量用于加速科学的AI工具被开发出来,其中一些声称实现了数十年前提出的愿景。鉴于LLMs的快速发展,现在至关重要的是要刻画使用LLMs回答SLR研究问题的现状。

根据PRISMA(系统综述和荟萃分析优先报告项目)指南,一个典型的SLR需要遵循几个必要步骤才能被认为是合规的。这些步骤包括:(1)定义综述的理由和目标;(2)指定资格标准;(3)确定信息来源;(4)制定可重复的搜索策略;(5)筛选研究资格;(6)从纳入的研究中提取数据;(7)定义结果和其他变量;(8)综合;和(9)报告。LLMs有可能以两种基本方式为这些步骤做出贡献。首先,LLMs可以协助审稿人简化不同的步骤。例如,在确定资格标准时,LLMs可以推荐相关关键词,并将原始标准扩展为更全面的内容。我们可以将这种方法称为“LLM辅助”流程,其中人类仍在循环中并做出决策。其次,LLMs可以完全取代人类。例如,在决定一项研究的资格时,LLMs能够根据给定标准自动确定是否应纳入该研究。我们可以将这种方法称为“基于LLM”的流程,其中人类不直接参与决策。Lieberum等人(2025)最近的一篇综述显示,LLMs已被用于SLR的大多数步骤中,支持LLM辅助和基于LLM两种模式,突显了它们的潜力。

我们这项工作的重点是从纳入的研究中进行数据提取。许多基于LLM的数据提取研究使用广泛可用的工具在零样本设置下进行,无需特定任务的微调或额外的训练数据。例如,Mahmoudi等人(2025)使用基于网络的ChatGPT提示从10篇研究样本中提取与COVID-19仿真中行为模型相关的数据,发现随着提示的优化,其准确率有所提高,在明确数据提取(例如研究设置)方面比主观数据表现更好。在类似设置下,Gartlehner等人(2024)使用基于网络的Claude 2从10篇研究样本中提取临床研究参与者数据,发现总体准确率很高(96%)。此外,他们的研究报告了易用性高,无需技术专长。总的来说,这些研究表明零样本、通用可访问的LLM显示出有希望的结果。

其他研究将数据提取任务扩展到多个具有不同版本的LLMs。Konet等人(2024)使用基于网络的Claude 2和GPT-4从10篇论文中提取临床研究参与者数据,发现Claude 2的准确率更高,同时指出了GPT-4的技术挑战。另一方面,Gartlehner等人(2025)利用Claude的网络界面(版本2.1、3.0 Opus和3.5 Sonnet)从63项研究中提取数据。他们比较了人工数据提取与LLM辅助(人在回路)的数据提取,发现LLM辅助的准确率更高(91% vs. 89%)。

总体而言,这些研究表明了在SLR数据提取中使用LLMs的潜力,支持了Lieberum等人(2025)的说法。然而,现有用于SLR数据提取的文献大多在小样本文章上进行测试,并且使用了可重复性较低的基于网络的LLM界面。同样重要的是,对临床研究的关注限制了这些发现扩展到其他领域(如建模与仿真)的可能性。我们的研究是大规模的(N=536),专注于COVID-19基于代理模型,并有可能揭示对建模与仿真社区至关重要的见解。

## 3 方法

在本研究中,我们评估了LLMs在多大程度上能够大规模复制SLR数据提取,使用来自系统性综述COVID-19 ABMs的参考人工提取数据集。我们通过开发一个自动化的LLM流程来实现这一点,该流程处理每篇全文论文,并使用GPT-4.1和GPT-5.0(通过OpenAI应用程序编程接口(API))生成与人工提取模式一致的结构化输出。我们使用Jaccard指数和重叠系数量化了LLM生成数据与人工提取数据之间的相似性,结果按提取字段和论文进行了汇总。人工提取的SLR数据的详细信息见第3.1节,用于数据提取和评估的LLM流程详见第3.2节。

### 3.1 人工提取的参考数据

本研究将LLMs提取的SLR数据与人类审稿人提取的相应数据进行比较。人类参考数据集来自对2020年1月至2023年12月期间发表的536篇COVID-19基于代理建模(ABM)论文的系统性综述。原始人工提取SLR数据的详细信息由Von Hoene等人(2026)报告。原始研究的目标是评估COVID-19 ABMs在多大程度上符合模型有用性的最佳实践,标准涵盖模型透明度和可重用性、跨学科合作和利益相关者参与以及模型评估。

简而言之,作者开发了一个标准化的提取表单,以系统化地从每篇论文中收集数据。在进行大规模提取之前,审稿人已在试点阶段接受了提取表单的培训。每篇论文分配给两名独立的审稿人,分配大致平衡,以便审稿人之间在整个数据集中配对。使用Covidence系统综述软件存储源文本和提取的响应,并在配对审稿人输入冲突值时自动标记差异。人工间一致性平均为74%,范围从68.8%(最低)到83.8%(最高)。遵循SLR最佳实践,所有分歧都提交给第三位共识审稿人(两位主要研究员之一),他使用Covidence的并排比较界面来验证条目与源文本,并做出最终决定,如图1所示。作者指出,虽然Covidence支持工作流组织和冲突解决,但它并未自动化任何提取判断。除书目元数据外,所有数据均为手动提取,因此受到审稿人解释的影响。

最终数据集包含21个数据字段,其值通过共识过程确定(问题见图3)。大约一半的字段是二元(是/否)的,用于确定作者是否:1)明确陈述了模型目的;2)声明模型已经或可以被其他人(例如政策制定者、决策者)使用;3)将模型指定到特定研究区域;4)使用了开源的ABM平台和软件包(例如Repast, NetLogo, Mesa);5)使用标准化协议(例如ODD, ODD+D, TRACE)记录了模型;6)清晰地陈述了假设和局限性;7)提供代码供下载;8)扩展或重用了现有模型;9)涉及多个学科;10)在建模周期中纳入利益相关者反馈;11)报告进行了模型评估(验证、校准、敏感性测试、确认);以及12)量化并传达了不确定性。对应于每个是/否二元字段,审稿人还从文本中复制粘贴了半结构化的支持证据(例如研究区域名称、ABM平台、报告协议)。总体而言,对536篇论文的大规模提取耗时约一年(2024年2月至12月),这凸显了即使有系统综述软件支持,此类大规模手动数据提取的高成本。

图1:Covidence界面。

### 3.2 LLM流程

我们使用OpenAI API实现了一个数据提取流程,使得与LLMs的交互完全可编程且可重复。整个流程如图2所示,显示了六个主要步骤。所有实验均通过安全的API调用进行,这与先前依赖网络界面的研究(见第2节)不同,以确保可靠执行、受控批处理以及详细的模型使用日志记录。这种方法允许每篇论文独立处理,并使提取流程能够跨整个数据集进行扩展。

我们使用了GPT-4.1和GPT-5.0,这是在本研究进行时研究界广泛可用且稳定的LLMs。两个模型都在零样本配置下使用,未对人工提取数据集进行任何适应或调整。这是一个有意识的决定,旨在了解LLMs在默认使用条件下的能力和局限性。

相似文章

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。