使用RL增强智能搜索生成生物医学事实核查报告
摘要
本文介绍了BioCheck Agent,这是一个基于LLM的智能体,使用RL增强的智能搜索生成结构化的生物医学事实核查报告,与基础模型相比,显示出更高的准确性和更低的幻觉率。
arXiv:2608.23811v1 公告类型:新
摘要:自动事实核查对于确保公共卫生信息的可靠性至关重要,但生物医学领域带来了独特的挑战。验证生物医学声明需要严格解释科学文献、评估检索到的证据,并对结论进行全面论证。尽管通过检索增强生成(RAG)和智能搜索增强的大型语言模型(LLMs)在检索-验证范式中进行自动事实核查,但当前方法仍输出孤立的预测标签,缺乏解释深度,对人类理解有限。为了弥合这一差距,我们介绍了一个基于大型语言模型(LLM)的智能体,名为BioCheck Agent,它使用智能搜索生成结构化的生物医学事实核查报告。我们的智能体不仅仅输出支持或反驳的标签,而是将最终结论与检索到的证据和严格分析相结合。为确保领域特定的准确性,BioCheck Agent仅在PubMed中搜索高质量的科学文献,使用高级布尔搜索运算符。认识到直接提示往往导致幻觉和低质量报告,特别是对于轻量级开源模型,我们进一步提出了证据基础群体相对策略优化(EG-GRPO),使用任务特定奖励对BioCheck Agent进行强化学习,该奖励激励高级搜索行为和高质量证据检索,同时惩罚幻觉。我们的实验结果表明,与基础模型Qwen3.5-4B相比,使用EG-GRPO的BioCheck Agent在SciFact上的标签预测准确率提高了9.95%。此外,它获得了3.7%更高的证据质量分数和19.63%更低的证据幻觉率,证明了其能够生成具有更高准确性和质量的生物医学事实核查报告。
查看缓存全文
缓存时间: 2026/08/26 09:13
# 使用强化学习增强的智能体搜索生成生物医学事实核查报告 来源:https://arxiv.org/html/2608.23811 Dingli Ma 附属机构:华盛顿大学 Chaoqun Ni 附属机构:威斯康星大学麦迪逊分校 #### 摘要 自动化事实核查对于确保公共卫生信息的可靠性至关重要,但生物医学领域带来了独特挑战。验证生物医学声明需要对科学文献进行严谨解读、评估检索到的证据,并对结论提供全面论证。尽管基于检索增强生成和智能体搜索的大语言模型在“检索后验证”范式中执行自动化事实核查,但现有方法仍仅输出孤立的预测标签,缺乏解释深度且对人类理解的效用有限。为弥合这一差距,我们引入了基于大语言模型的智能体——BioCheck Agent,它通过智能体搜索生成结构化的生物医学事实核查报告。我们的智能体并非仅输出支持或驳斥标签,而是综合检索到的证据与严谨分析得出最终结论。为确保领域特定的准确性,BioCheck Agent 专门搜索 PubMed 中的高质量科学文献,并使用高级布尔搜索运算符。认识到直接提示常导致幻觉和低质量报告(尤其对于轻量级开源模型),我们进一步提出了证据基群组相对策略优化,通过任务特定奖励对 BioCheck Agent 进行强化学习。该奖励激励高级搜索行为和高质量证据检索,同时惩罚幻觉。实验结果表明,与基础模型 Qwen3.5-4B 相比,采用 EG-GRPO 的 BioCheck Agent 在 SciFact 数据集上的标签预测准确率提升了 9.95%。此外,其证据质量得分提高了 3.7%,证据幻觉率降低了 19.63%,证明了其生成更高准确性和质量生物医学事实核查报告的能力。 ## 1 引言 健康错误信息已成为公共卫生的主要挑战,尤其在健康危机期间,人们必须应对虚假或误导性声明、信息过载、不确定性以及快速变化的科学证据。世界卫生组织将这一问题描述为“信息疫情”,并强调管理错误信息是控制公共卫生紧急事件的一部分 [Omojunikanbi, 2022]。这一挑战在生物医学环境中尤为关键,因为不准确的声明可能影响疫苗接种决策、治疗选择、对公共卫生指南的遵循、对医疗机构的信任以及对不安全疗法的使用。先前研究表明,健康错误信息可造成实际危害。在 COVID-19 大流行期间,关于预防和治疗的错误信息在各国广泛传播,并导致严重的现实后果,包括住院和死亡 [Islam 等人, 2020]。实验研究进一步表明,接触 COVID-19 疫苗错误信息可能降低接种意愿 [Loomba 等人, 2021],而跨国调查研究发现,对错误信息的易感性与较低的自我报告公共卫生指南遵守度和较低的接种意愿相关 [Roozenbeek 等人, 2020]。这些发现共同表明,生物医学错误信息不仅是沟通问题;它可能影响健康行为,破坏公众信任,并削弱基于证据的公共卫生干预措施。 自动化事实核查为提高在线健康信息的可靠性提供了一种有前景的方法,但生物医学事实核查仍特别困难。公共卫生事实核查通常需要领域专业知识和根据可信证据进行评估,先前研究认为这一场景不仅需要真实性预测,还需要解释生成 [Kotonya 和 Toni, 2020]。健康声明还需要仔细解读生物医学证据,包括现有研究的强度和确定性,这就是为什么近期的医学事实核查数据集在支持、驳斥和信息不足等标签之外纳入了证据级别 [Vladika 等人, 2024]。更广泛地说,基于证据的医学推理在制定临床问题和检索证据时需要关注人群或患者问题、干预措施、比较和结果 [Schardt 等人, 2007]。因此,生物医学事实核查应提供最终标签之外的更多信息。它应解释检索到了哪些证据,该证据与声明有何关联,仍存在哪些不确定性,以及为何特定结论是合理的。 参见图例说明:图 1:BioCheck Agent 与 EG-GRPO 奖励建模示意图。 随着大语言模型和检索增强生成 [Lewis 等人, 2020] 及智能体搜索 [Jin 等人, 2025] 等技术的发展,当前的自动化事实核查任务已从文本分类转变为“检索后验证”范式 [Kim 等人, 2023b; Singal 等人, 2024; Wang 等人, 2024c]。这要求首先从开放世界检索外部信息,然后根据这些发现验证声明。尽管这些方法已实现高分类准确率,但其以标签为中心的结果和评估缺乏完美可靠性,使得人类专家在预测标签无法提供有意义信息的情况下,对于稳健决策仍然至关重要。 为通过全面的证据分析推进超越标签预测的自动化生物医学事实核查,我们提出了 BioCheck Agent,这是一种用于生成结构化生物医学事实核查报告的新型基于大语言模型的智能体。BioCheck Agent 通过概述相关证据、撰写分析摘要并基于预测标签得出最终结论来生成综合报告。专为生物医学领域定制,我们的智能体通过其 API 在 PubMed 数据库中执行智能体搜索,检索最新的文献,因此与静态数据库或通用搜索引擎相比,提供更高质量的证据。此外,我们的智能体配备了高级学术搜索策略,自动将复杂声明分解为核心实体,并使用布尔运算符(“AND”、“OR”)将其链接以构建高度准确的搜索查询。为进一步提升 BioCheck Agent 超越直接提示的性能和可扩展性,我们提出了证据基群组相对策略优化用于端到端强化学习。EG-GRPO 基于 GRPO [Shao 等人, 2024](已证明在多种智能体任务中有效 [Feng 等人, 2025b; Zhang 等人, 2025]),采用任务特定的奖励设计,强调生成报告中证据的质量和依据。具体而言,除了基于结果的奖励(用于与真实标签对齐)外,我们引入了三个额外组件:高级搜索奖励(鼓励使用布尔搜索操作)、复合证据奖励(平衡生成证据的数量和质量)以及幻觉惩罚(防止模型生成与检索文献矛盾的证据)。然后,我们应用 EG-GRPO 在 SciFact 训练集 [Wadden 等人, 2020] 上训练轻量级 Qwen3.5-4B 模型,作为 BioCheck Agent 的骨干模型。BioCheck Agent 和 EG-GRPO 奖励设计的概览如图 1 所示。 我们在 SciFact 测试集和 HealthFC [Vladika 等人, 2024] 数据集上评估了采用 EG-GRPO 的 BioCheck Agent 的性能。在两个数据集上,当以 Qwen3.5-4B 为基础模型时,经过 EG-GRPO 优化的 BioCheck Agent 在所有标签预测指标上均优于所有基线,甚至超越了商用模型 GPT5.2。与强化学习前的基础模型相比,EG-GRPO 在 SciFact 上将预测准确率显著提高了 9.95%,在 HealthFC 上提高了 7.03%。此外,尽管直接应用基线 GRPO 在 SciFact 上可获得与 EG-GRPO 相当的性能,但在 HealthFC 上仅显示出有限改进。这证明了我们任务特定奖励设计的必要性,其中明确优化事实核查报告可带来更好的可迁移性能。 除了标准的标签预测指标,我们还引入了两个额外指标,旨在对生成的报告进行细粒度评估:证据质量得分和证据幻觉率。与基础模型 Qwen3.5-4B 相比,在 BioCheck Agent 上应用 EG-GRPO 明显提升了生成的生物医学事实核查报告的质量。具体而言,在 SciFact 数据集上,EQS 提升了 3.7%(反映更好的证据检索),EHR 显著降低了 19.63%(表明更少的幻觉)。这些结果突显了 EG-GRPO 在使 BioCheck Agent 实现准确标签预测和高质量报告生成的最先进性能方面的有效性。最终,通过减轻幻觉并将输出基于高质量证据,我们的 BioCheck Agent 代表了辅助人类通过生成的事实核查报告辨别健康错误信息的关键一步。 ## 2 相关工作 **自动化事实核查**。事实核查被定义为评估事实声明真实性的任务。传统上,事实核查由新闻或科学领域的人类专家执行。然而,这些过程通常是劳动密集型且耗时的。随着自然语言处理的发展,自动化事实核查成为可能 [Zeng 等人, 2021; Guo 等人, 2022]。早期的自动化事实核查主要依赖监督学习 [Vlachos 和 Riedel, 2014; Lee 等人, 2020; Wadden 等人, 2022] 来训练验证分类器,证据通常来自数据集内的预标注 [Thorne 等人, 2018; Wadden 等人, 2020]。大语言模型和检索增强生成的出现将事实核查转变为开放世界检索与验证范式。当前方法不再依赖静态的预标注证据,而是主动从基于向量的检索数据库 [Singal 等人, 2024; Barone 等人, 2025] 或结构化知识图谱 [Kim 等人, 2023a] 等外部来源检索信息。最近,基于大语言模型的智能体通过利用搜索引擎等外部工具,执行更全面和实时的证据检索而日益突出 [Wang 等人, 2024c; Wei 等人, 2024; Xie 等人, 2025]。具体而言,生物医学事实核查提出了独特的挑战,鉴于其对公共卫生的显著影响(如 COVID-19 大流行期间所证明的 [Apuke 和 Omar, 2021]),它需要广泛的领域专业知识和严格的验证。为推进该领域的自动化事实核查,已建立众多数据集和基准 [Wadden 等人, 2020; Sarrouti 等人, 2021; Mohr 等人, 2022; Vladika 等人, 2024; Reisle 等人, 2025],以及利用高权威性、严谨资源进行验证的专门方法 [Liu 等人, 2024; Barone 等人, 2025]。 **基于大语言模型的智能体与智能体搜索**。大语言模型先进的指令遵循和推理能力现在能够作为智能体自动执行复杂任务。因此,已提出各种框架(如 ReAct [Yao 等人, 2022]、Plan-and-Act [Erdogan 等人, 2025] 和 CodeAct [Wang 等人, 2024a]),以构建具有任何骨干大语言模型的自主智能体。鉴于智能体日益增长的现实世界影响,LangGraph [langchain-ai, 2026b] 和 OpenHands [Wang 等人, 2024b] 等工业级框架也已出现。此外,如今大多数大语言模型都经过训练,通过标准函数调用管道执行预定义动作 [OpenAI, 2023],而不是依赖如 ReAct 这样的结构化文本输出。作为基于大语言模型智能体的关键应用,智能体搜索将搜索引擎与推理能力相结合,以提高响应质量 [Jin 等人, 2025; Li 等人, 2025a]。通过将输出基于可验证的引用,这种方法显著减轻了幻觉 [Li 等人, 2025b]。智能体搜索最初由 Bing Chat [Kelly 等人, 2023] 等智能体开创,现已广泛应用于从通用基准到特定领域任务的广泛应用中,以增强性能 [OpenAI, 2025a]。 **智能体的强化学习**。与主要依赖人类偏好的通用聊天机器人大语言模型不同 [Ouyang 等人, 2022],智能体任务通常具有明确的答案,使得基于可验证奖励的强化学习高度适用。具体而言,群组相对策略优化已被证明是一种有效的算法,并广泛应用于提高各种任务中的智能体性能 [Jin 等人, 2025; Wei 等人, 2025; Wang 等人, 2025]。
相似文章
打造了一个开源AI代理事实核查器,只有能提供实际证据支持,主张才会被放行。
构建了一个用于AI代理的开源事实检查器,通过获取实时来源验证主张,并提供真实性和置信度评分,适用于公开和内部文档。
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
知识增强型智能体AI用于心理健康药物信息查询
本文提出了一种具有来源感知能力、基于知识图谱的多智能体框架,该框架整合了来自Reddit和WebMD的患者叙事以及FDA针对九种抗抑郁药的药物不良事件报告,利用大语言模型(LLM)实体识别流水线实现了高准确率,并能够提供可追踪的精神科药物安全信息。
从投票到智能体协作:面向答案类型的BioASQ 14b大语言模型流水线
本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。
SSE-Bio: 一种用于多跳生物医学推理的结构化自进化代理与代理检索策略
SSE-Bio 提出了一种具有可训练检索策略的结构化自进化代理,以改善多跳生物医学推理,并展示了相较于基线的显著性能提升。