医学因果假设验证与大语言模型
摘要
本文介绍了一项初步研究,评估大语言模型在验证医学因果假设方面的准确性,发现尽管它们表现出较高的召回率,但往往无法提供有效的科学证据或拒绝无支持的声明。
arXiv:2609.00063v1 公告类型:新
摘要:大语言模型在搜索和信息检索中的日益广泛应用凸显了评估其在医疗等高风险领域可靠性的必要性。尽管大语言模型能够有效回答有关疾病、症状和治疗的问题,但它们准确评估因果关系并将结论基于已验证科学证据的能力仍不明确。在此,我们提出一项初步的小规模研究,探讨大语言模型在评估医学因果声明并支持同行评审研究方面的准确性。我们提出一个用于因果假设验证的评估框架,该框架可用于系统跟踪现有和未来大语言模型的性能。我们评估了八个大语言模型在17个医学因果假设上的表现,以评估它们是否能够利用文献中的科学证据可靠地验证这些假设。我们根据六个标准(共1,067个注释点)系统注释它们提供的科学证据,并用九个评估指标进行评估。分析表明,尽管大语言模型表现出较高的召回率,但它们在提供有效的科学文章和证据以支持假设,以及拒绝无支持的假设方面表现不佳。这些发现凸显了当前大语言模型的一个关键局限性,即目前尚不能完全信任它们从生物医学文献中验证因果关系。这项工作强调在医疗环境中使用大语言模型进行搜索和检索之前需要进行严格评估。
查看缓存全文
缓存时间: 2026/09/02 05:44
# 基于大语言模型的医疗因果假设验证 来源:https://arxiv.org/html/2609.00063 ## 基于大语言模型的医疗因果假设验证 致谢:CONSEQUENCES Workshop @ RecSys '26,2026年10月2日,美国明尼苏达州明尼阿波利斯 会议:第20届ACM推荐系统会议;2026年9月27日-10月2日;美国明尼苏达州明尼阿波利斯 Safiyyah Ahmed\*, Abrar Ansari\* 单位:伊利诺伊大学芝加哥分校,伊利诺伊州芝加哥市,美国 邮箱:[aansa30@uic\.edu](mailto:[email protected]) Md Aminul Islam 单位:伊利诺伊大学芝加哥分校,伊利诺伊州芝加哥市,美国 邮箱:[mislam34@uic\.edu](mailto:[email protected]) 和 Elena Zheleva 单位:伊利诺伊大学芝加哥分校,伊利诺伊州芝加哥市,美国 邮箱:[ezheleva@uic\.edu](mailto:[email protected]) © 无 ###### 摘要\. 大语言模型(LLMs)在搜索和信息检索领域的日益广泛应用,突显了评估其在医疗保健等高风险领域可靠性的重要性。尽管LLMs能有效回答有关疾病、症状和治疗的问题,但它们准确评估因果关系并使其结论基于经过验证的科学证据的能力仍不清楚。本文我们提出了一项初步的小规模研究,探讨LLMs在评估医疗因果主张并辅以同行评审研究方面的准确性。我们提出了一个用于因果假设验证的评估框架,可用于系统跟踪现有和未来LLMs的性能。我们评估了八个LLMs在17个医疗因果假设上的表现,以评估它们能否利用文献中的科学证据可靠地验证这些假设。我们根据六项标准(共1,067个标注点)系统地标注了它们提供的科学证据,并使用九个评估指标进行了评估。我们的分析表明,虽然LLMs表现出较高的召回率,但它们在提供有效的科学文献和证据以支持主张,以及在拒绝不支持的假设方面通常表现不佳。这些发现凸显了当前LLMs的一个关键局限,因为它们尚不能完全信任用于从生物医学文献中验证因果关系。这项工作强调了在医疗保健环境中使用LLMs进行搜索和检索前进行严格评估的必要性\. ###### 关键词: 医疗因果假设;LLM验证;评估 ††cc\-license:by ## 1\. 引言 因果推理在决策和预测干预效果方面起着核心作用,特别是在医学、科学和公共政策等领域。在许多现实场景中,因果主张以非结构化文本的形式表达,如科学论文、临床笔记、政策报告、新闻和社交媒体讨论。大语言模型(LLMs)特别擅长大规模处理和组织此类非结构化文本,并有潜力作为辅助工具来寻找因果假设和机制的证据。然而,在医疗和法律等高风险环境中,必须谨慎行事,并仔细评估依赖这些模型的局限性和潜在风险。 现有越来越多评估LLMs进行因果推理和推理能力的文献,大致可分为模型推理、常识推理、反事实推理以及公平性与去偏见等领域(Liu等人,2025 (https://arxiv.org/html/2609.00063#bib.bib3))。早期研究表明LLMs从文本中获取因果知识的能力正在涌现(例如,Kiciman等人,2023 (https://arxiv.org/html/2609.00063#bib.bib4)),而其他研究则对其鹦鹉学舌般的行为(Zečević等人,2023 (https://arxiv.org/html/2609.00063#bib.bib8))以及在因果图上推理的局限性提出了担忧(例如,Jin等人,2023 (https://arxiv.org/html/2609.00063#bib.bib5))。然而,这些研究并未考虑LLMs在提供科学证据以证实因果主张方面的检索能力。最近关于检索增强生成的研究探索了更广泛地使用LLMs来验证科学主张(Wang等人,2025 (https://arxiv.org/html/2609.00063#bib.bib2); Mohole等人,2025 (https://arxiv.org/html/2609.00063#bib.bib1)),但并未专门评估其验证因果主张的能力。 在这项工作中,我们进行了一项关于因果假设验证的小规模研究,旨在评估LLMs是否可以作为辅助工具来回答因果查询,并从医学文献中寻找证据来支持其答案。我们设计了一个提示词,要求LLM验证特定的医疗因果假设(形式为“糖尿病导致肾脏疾病”),并在假设得到支持时提供最多三篇科学文章。尽管我们评估的假设数量相当少(17个),但需要指出的是:1)在本研究进行时,这些假设并未出现在网络上,因此LLMs在训练中不可能使用它们;2)这些假设已由临床医生验证;3)我们标注了所有LLMs回答的多个维度,共计1,067个标注点,这构成了显著的标注工作量。我们提出了一个用于因果假设验证的评估框架,可用于系统跟踪现有和未来LLMs的性能。我们的结果揭示了在医疗相关决策场景中使用LLMs作为辅助工具的一些局限性。 ††footnotetext:\* 两位作者对本研究贡献相同\. ## 2\. 因果假设验证评估设置 假设你是一名医学研究人员,你正试图为以下假设提供证据:\[假设\]。如果同行评审的科学文献中存在此类证据,请按照我将提供的特定格式,指定提供最有力支持该假设的三篇科学文章。对于你找到的每篇科学文章,请提供DOI记录的准确URL、准确的论文标题、作者撰写的准确论文摘要,以及文章中明确指向支持该假设的引文。请按如下格式组织你的回答: 在回答的最顶部只出现一次"Yes"或"No"(选择其一),以表明是否存在此类证据 如果存在证据,则对每篇科学文章包括: "URL: " "Paper title: " "Paper Abstract: " "Quote from article supporting hypothesis: " 强调“准确”。我不需要摘要的摘要、引文的摘要或论文标题的摘要。 在最终回答之前不要包含这些术语。(在推理过程中不要包含“URL”、“title”、“Abstract”、“Quote”这些词,仅在最终回答中使用)。 在每个URL前,输入URL: 并包含实际链接,而不是超链接。在每个论文标题前写“Paper Title: ”,在每个摘要前写“Abstract: ”。在每个引文中前写“Quote: ”。 你的回答中除了这些之外,不要包含任何其他内容。 优先考虑高影响力的人类研究,强调机制和临床结果数据,并在必要时包括开放获取和付费墙文章。 如果没有证据存在,请解释你完成搜索并得出不存在此类文章的结论的过程。 图1\. 用于所有LLMs和所有假设的标准化提示模板。 为了评估LLMs能否可靠地提供因果关系的证据,我们设计了一个自动化流程,使用结构化提示来收集和解析LLMs的回答。回答由人工标注其准确性,然后进行彻底评估。我们根据以下两个研究问题指导提示和评估指标的设计: - • RQ1: LLMs能否准确确定医疗因果假设的有效性? - • RQ2: LLMs能否生成准确且相关的科学证据来支持其因果主张? 我们使用了一组先前工作中发现的17个因果假设(Adhikari等人,2025 (https://arxiv.org/html/2609.00063#bib.bib7)),该研究分析了与糖尿病患者重复急诊就诊相关的ICD-10诊断代码。这些假设已经过四名专家临床医生的验证,因此我们拥有其有效性的基本事实。这些假设包括合并症之间的关系,如糖尿病、高血压、肾脏疾病、肥胖和水肿,以及它们影响重复急诊使用的潜在因果途径。混合使用支持和不支持的主张(17个假设中有11个得到支持)确保了评估保持有意义,同时能够有效评估LLMs评估因果主张的能力。假设的形式为“慢性外周静脉功能不全导致慢性非压力性足部溃疡”。 提示构建。我们开发了一个标准化的提示模板(图1 (https://arxiv.org/html/2609.00063#S2.F1)),该模板在所有LLMs和所有假设上一致应用。该提示明确询问证据是否支持假设。如果表示支持,则指示模型提供来自同行评审科学论文的三篇最强有力的证据。对于每篇,它必须包括DOI链接、准确的文章标题、论文的完整摘要,以及文章中支持假设的任何直接引文。这种设计确保了高度结构化的输出,便于自动解析和系统评估。如果科学文献不支持该因果假设,则指示模型以“No”回答并解释其得出此结论的过程。选择这些特定的回答部分是因为它们能提供验证科学文献内事实准确性所需的基本信息。返回真实文章、有效DOI链接、准确摘要和相关引文的能力对于评估LLMs是否将其推理建立在基于证据的来源上,而不是生成虚假主张至关重要。 评估的LLMs及实现细节。我们使用了八个LLMs进行因果假设验证,包括Mistral、Deepseek-R1、Deepseek-V3、Gemini Flash、Gemini Pro、Qwen、GPT-4o和Llama-4-Maverick。我们选择这些LLMs是基于API访问和免费层使用限制的可用性,因为我们的研究需要大规模执行所有提示并自动存储结果以供下游评估。唯一的例外是GPT-4o,它不提供免费层,我们是从其手动收集响应的。我们根据数据收集时可用的最新版本使用这些模型。我们为每个LLM提供针对每个因果假设构建的提示,并收集其响应。然后我们根据提示指令自动解析。结果,我们获得了所有八个LLMs在17个假设上的响应,共计136个响应,其中每个支持假设的响应包含3篇文章。在极少数自动解析失败的情况下,我们手动从响应中提取这些组成部分。 假设与支持证据标注。一旦我们从LLMs获得响应,我们便在假设和证据层面手动验证其输出的有效性。首先,我们评估模型关于假设的决定是否正确,独立于其提供的任何证据,通过确定响应是否与从临床医生获得的基本事实相符(Correct Conclusion)。如果LLM声称假设得到支持,我们随后标注其支持证据的有效性。具体来说,每篇提供的文章都根据以下标准进行标注:是否存在所述标题的文章(Real Paper);DOI链接是否与提供的文章标题正确对应(Correct URL)。如果文章是Real Paper,我们还标注摘要是否来自原始论文准确提供(Real Abstract),引文文本是否在论文中准确出现并支持模型所述的因果主张(Real Quote),以及文章本身是否支持假设(Paper Supporting Hypothesis)。对于不支持假设的论文,我们标注文章是否仅报告了关联而非直接的因果关系(Association)。对于真实论文,如果DOI URL不正确,我们也会找到正确的URL。这种多阶段评估至关重要,因为LLM可能正确地将假设识别为真,同时虚构或歪曲文章元数据、参考文献或文本证据。为了便于标注,我们使用Label Studio(Tkachenko等人,2020 (https://arxiv.org/html/2609.00063#bib.bib6)),它支持结构化和高效地标注每个组成部分。 为确保可靠性,两名标注员独立标注整个LLM响应集。然后他们比较各自的标注并讨论任何分歧。在出现分歧的情况下,重新检查响应以验证其有效性并达成最终共识。我们使用最终达成一致的标注数据集进行所有评估。最终数据集包含1,067个标注点,涵盖每篇提供的论文是否真实,以及如果是真实论文,则回答针对每篇真实论文的五个标准。 评估指标。我们使用精确率、召回率、F1分数、特异性和准确性来评估LLMs在准确假设分类方面的性能。精确率衡量LLMs的正分类中对应实际因果关系的比例,而召回率衡量LLMs正确识别的所有真实因果关系的比例。特异性衡量正确识别虚假假设的比例,F1分数提供精确率和召回率的调和平均值。我们还衡量LLMs在将假设分类为真时所提供证据的准确性,考虑真实或有效论文占总论文数的比例。类似地,我们评估URL或DOI链接的准确性,以及LLMs提供的摘要和直接引文的正确性。 ## 3\. 结果 在本节中,我们根据研究问题评估LLMs的性能。主要结果报告在图2 (https://arxiv.org/html/2609.00063#S3.F2)中。 参见图注图2\. LLM在准确性及证据基础指标上的性能。 **因果假设分类性能(RQ1)**。LLMs的准确性(正确/总结论)在0.53到0.82之间,F1分数范围在0.64到0.88之间,反映出在分类因果假设方面的总体性能中等。精确率值在0.69-0.79范围内,表明倾向于过度预测真实的因果假设,导致假阳性数量较高。大多数模型的召回率为1.0,表明这些模型正确识别了所有真实的因果假设,而GPT-4o(召回率=0.54)未能检测到大部分真实的因果关系。所有模型观察到的低特异性(0.17–0.50)表明正确识别虚假因果假设的能力有限,导致假阳性率较高。总体而言,结果表明LLMs通常在识别真实因果假设方面比拒绝虚假假设更有效,实现高召回率但特异性相对较低,这导致了假阳性预测的倾向。 表1\. LLMs提供的真实或有效证据数量与总证据数量。 | 指标 | Mistral | Deepseek-R1 | Deepseek-V3 | Gemini Flash | Gemini Pro | Qwen | GPT-4o | Llama-4-Maverick | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | **真实论文数量** | 28 | 36 | 30 | 16 | 29 | 30 | 11 | 27 | | **总论文数量** | 51 | 51 | 51 | 51 | 51 | 51 | 34 | 51 | | **正确URL数量** | 21 | 32 | 23 | 9 | 24 | 23 | 11 | 22 | | **真实摘要数量** | 13 | 16 | 11 | 2 | 15 | 10 | 5 | 6 | | **真实引文数量** | 8 | 11 | 5 | 1 | 10 | 4 | 4 | 4 | | **支持假设的论文数量** | 13 | 18 | 12 | 6 | 15 | 11 | 6 | 10 |
相似文章
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
CARE: 用于医疗大型语言模型的因果对齐推理探索
CARE 引入了一个因果对齐推理探索框架,用于医疗大型语言模型,以增强训练稳定性并减少虚假相关性。
真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
社交媒体中因果关系提取的大型语言模型:灾害情报的验证框架
本文提出了一个验证框架,用于评估大型语言模型(LLM)在灾害期间从社交媒体帖子中提取因果关系的有效性。通过将LLM生成的结果与基于专家知识的参考图谱进行比较,评估其在识别因果关系方面的可靠性及潜在风险。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。