强化学习用于大型语言模型的寻求证据诊断推理
摘要
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
arXiv:2607.02983v1 公告类型: 新
摘要:最近以推理为中心的大型语言模型(LLM)取得了显著进展,但它们主要采用被动推理模式,假设信息完整。相比之下,现实世界的临床智能本质上是一个迭代的调查过程,需要策略性地获取证据。为了弥补这一差距,我们将医学诊断形式化为一个迭代的寻求证据任务。我们利用具有可验证奖励的强化学习(RLVR)在闭环环境中激发内在推理,并由一套新颖的奖励机制引导,以强制诊断准确性和检查一致性。为此,我们引入了基于检索增强生成的检查模拟器(RAGES),这是一个高保真临床预言机,提供基于知识的真实后续证据。跨多个数据集的实验结果表明,我们的框架使大型语言模型从被动响应者转变为自主助手。值得注意的是,我们的模型在性能上与更大或增强推理的基线相当,而RAGES在生成生物学上合理的临床反馈方面优于普通大型语言模型。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 基于强化学习的大语言模型寻求证据诊断推理 来源:https://arxiv.org/html/2607.02983 **表3:** 人类专家与LLM评判者之间的一致性,使用Cohen's κ 衡量。 ### 5.2 寻求证据诊断的比较性能 表5.1 (https://arxiv.org/html/2607.02983#S5.SS1)和5.1 (https://arxiv.org/html/2607.02983#S5.SS1)总结了我们框架与更大模型及专业医学推理基线的性能比较。我们进行了2000次bootstrap重采样,并计算了整体性能的95%置信区间以估计不确定性。结果揭示了关于模型效率和推理对齐的几个关键见解。 首先,我们的 Ours-RL-7B 模型表现出色,常常超越参数规模更大和特定数据积累量更多的模型(例如 Qwen2.5-32B 和 Huatuo-7B)。在初始咨询阶段,Ours-RL-7B 在英文数据集上实现了领先的 DiffAcc 62.0,在中文数据集上达到64.8,优于所有基线。这表明专门的 RLVR 能够提炼高级临床推理,有效缩小了小模型与前沿模型之间的差距。虽然较大的SFT模型(Ours-SFT-32B)展示了强大的模式匹配能力,但我们的RL训练模型在多语言环境中表现出更优的策略行为。 在后续阶段(表5.1 (https://arxiv.org/html/2607.02983#S5.SS1)),我们观察到尽管我们的模型相对于标准医学LLM保持了显著优势,但与诸如 QwQ-32B 等大型推理模型以及 Qwen2.5-72B 等更大模型相比,仍存在性能天花板。我们将此归因于阴性证据推理(排除过程)的复杂性,这需要高度的逻辑严谨性和领域知识来综合额外的免疫组化信号。 同时,我们可以观察到人类专家与独立LLM评判者之间存在实质性的一致性(>0.6),支持了评估协议的可靠性,如表3 (https://arxiv.org/html/2607.02983#S5.T3)所示。DxAcc的一致性略低于DiffAcc,这很可能是因为最终诊断评估需要对密切相关的疾病实体进行更精细的区分。 ### 5.3 临床询问的真实性 诊断模型的可靠性取决于其提出的问题。如图4 (https://arxiv.org/html/2607.02983#S5.F4)所示,我们评估了所请求检查的临床合理性。我们使用 GPT-5-Minimal 作为外部评估者。GPT-5 的任务是基于模型的鉴别诊断,评估建议的检查项目是否恰当。为了确保稳定性并减少方差,每次评估重复三次,并将通过率作为最终指标。 当前LLM中适中的总体通过率通常来自“彻底性偏差”,即模型针对宽泛的鉴别清单中每个候选诊断请求冗余的检查。与通用基线相比,我们的SFT和RL模型展现出与专家级检查方案更好的对齐,反映了成功向假设驱动的证据寻求模式的转变。 ### 5.4 消融研究 消融研究探讨了两个关键方面:(1)在RL过程中融入不同τ值的排名敏感诊断奖励的有效性(RL奖励消融),以及(2)RAGES组件的贡献(RAGES消融)。 **表4:** 不同诊断奖励的消融研究。 **表5:** RAGES不同阶段的消融研究。 **RL奖励消融。** 我们评估了诊断奖励的四种变体。(1)二元奖励:命中得1分,否则得0分,这可以看作是 τ→0 的极限情况。(2)τ=0.8 时的排名敏感奖励,(3)τ=1.5 时的排名敏感奖励,(4)动态τ值的排名敏感奖励作为主要设置。我们使用三个指标评估性能:鉴别准确率(DiffAcc)、最终诊断准确率(DxAcc)和初始鉴别列表的平均长度(#DDx),以直接展示奖励函数如何塑造模型的诊断行为。较低的τ值有效地激励更广泛的鉴别搜索,在早期阶段最大化探索能力。相反,较高的τ值强化临床聚焦,迫使模型承诺于最可能的诊断。我们的动态τ策略通过有效管理不确定性-精度权衡,优于所有静态配置。它允许模型在信息稀疏时进行探索,并在证据出现后做出决定,模仿了人类专家的认知转变。 **RAGES消融。** RAGES的有效性在表5 (https://arxiv.org/html/2607.02983#S5.T5)中得到了验证。我们观察到,忠实复述与经验知识之间的协同效应对于闭合推理循环至关重要。完整配置达到了最高的正确率(总体84.8%),证实了将模拟器扎根于结构化医疗环境优于仅依赖LLM的原始内部知识。这强化了RAGES作为可靠临床预言家(Clinical Oracle)在训练和评估自主证据寻求模型中的作用。 ## 6 结论与讨论 在这项工作中,我们正式定义并解决了当前医学LLM中的一个根本性差距:从被动推理向自主诊断主体转变。通过将诊断定义为迭代的证据寻求轨迹,我们证明了模型可以通过战略性信息获取来解决临床不确定性。我们的框架,包括基于RLVR的推理引擎、RAGES临床预言家以及精心策划的病理语料库,为闭环医学推理提供了稳健的蓝图。实证结果表明,提供主动询问机制可以带来诊断真实性的量子跃迁,我们的RL训练模型即使在7B参数规模下也展现出高度的临床优先性和简洁性。 尽管取得了这些进展,我们的工作标志着一个更广泛研究议程的开始。有几个高影响力的方向仍然值得探索。(1)虽然已经过临床验证,我们的排名敏感奖励 \(R_d\) 是领域无关的。它在数学上适用于任何需要假设优先排序的层次决策任务。未来的工作将探索这种奖励如何在更广泛的非医学背景下塑造从探索到决策的转变。(2)虽然目前作为离线的模拟器使用,但RAGES可以集成到在线RL循环中,以实现多轮自主推演和长期诊断前瞻。此外,将框架扩展到包括放射学和肿瘤学数据,将检验其在复杂多源信息环境中的稳健性。(3)未来的对齐应从仅基于结果的指标转向基于过程的奖励设计。通过将内部推理步骤与既定的临床指南对齐,我们可以确保模型通过可验证和可信的路径得出正确诊断。 总体而言,这项工作为交互式辅助诊断建立了一个结构化框架。通过赋予LLM主动信息获取的能力,我们离以下未来更近了一步:AI不仅仅是静态的百科全书,而是临床诊断过程中动态的、基于证据的伙伴。 ## 伦理声明 本工作利用了来自多个来源的病理案例研究,引发了两个主要的伦理考量,即患者隐私和数据再分发。关于患者隐私,所有从公共网站和期刊收集的案例报告在来源处均已被匿名化。我们仔细从内部数据集中移除了任何个人身份信息,仅保留了临床推理所需的必要信息,如年龄和性别。关于数据分发,出于机构数据保护政策,我们不会公开发布我们的内部数据集。对于外部来源的案例,我们严格遵守每个网站或期刊指定的使用指南。为避免未经授权再分发,我们将仅发布链接到原始案例来源的URL,允许其他研究人员访问材料,同时尊重原始数据所有权和许可条款。 本工作的风险还可能来自不当的响应(包括重复模式、虚假信息和冒犯性输出),因为我们没有专门加强模型的安全性。所呈现的案例可能包含冒犯性内容。 ## 参考文献 - Self-evolving multi-agent simulations for realistic clinical interactions. External Links:2503.22678, Link (https://arxiv.org/abs/2503.22678) 被引用于: §2.3 (https://arxiv.org/html/2607.02983#S2.SS3.p1.1). - Z. Bao, W. Chen, S. Xiao, K. Ren, J. Wu, C. Zhong, J. Peng, X. Huang, and Z. Wei (2023) DISC-medllm: bridging general large language models and real-world medical consultation. External Links:2308.14346, Link (https://arxiv.org/abs/2308.14346) 被引用: §2.3 (https://arxiv.org/html/2607.02983#S2.SS3.p1.1). - M. Besta, N. Blach, A. Kubicek, R. Gerstenberger, M. Podstawski, L. Gianinazzi, J. Gajda, T. Lehmann, H. Niewiadomski, P. Nyczyk, and T. Hoefler (2024) Graph of thoughts: solving elaborate problems with large language models. In Proceedings of the Thirty-Eighth AAAI Conference on Artificial Intelligence and Thirty-Sixth Conference on Innovative Applications of Artificial Intelligence and Fourteenth Symposium on Educational Advances in Artificial Intelligence, AAAI’24/IAAI’24/EAAI’24. External Links: ISBN 978-1-57735-887-9, Link (https://doi.org/10.1609/aaai.v38i16.29720), Document (https://dx.doi.org/10.1609/aaai.v38i16.29720) 被引用: §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1). - J. Chen, Z. Cai, K. Ji, X. Wang, W. Liu, R. Wang, J. Hou, and B. Wang (2024) HuatuoGPT-o1, towards medical complex reasoning with llms. External Links:2412.18925, Link (https://arxiv.org/abs/2412.18925) 被引用: §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1). - X. Chen, H. Yi, M. You, W. Liu, L. Wang, H. Li, X. Zhang, Y. Guo, L. Fan, G. Chen, et al. (2025) Enhancing diagnostic capability with multi-agents conversational large language models. NPJ digital medicine 8(1), pp. 159. 被引用: §2.3 (https://arxiv.org/html/2607.02983#S2.SS3.p1.1). - Y. Chen, Z. Wang, X. Xing, huimin zheng, Z. Xu, K. Fang, J. Wang, S. Li, J. Wu, Q. Liu, and X. Xu (2023) BianQue: balancing the questioning and suggestion ability of health llms with multi-turn health conversations polished by chatgpt. External Links:2310.15896, Link (https://arxiv.org/abs/2310.15896) 被引用: §2.3 (https://arxiv.org/html/2607.02983#S2.SS3.p1.1). - DeepSeek-AI (2025) DeepSeek-r1: incentivizing reasoning capability in llms via reinforcement learning. External Links:2501.12948, Link (https://arxiv.org/abs/2501.12948) 被引用: §1 (https://arxiv.org/html/2607.02983#S1.p1.1), §1 (https://arxiv.org/html/2607.02983#S1.p3.1), §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1), §4.1 (https://arxiv.org/html/2607.02983#S4.SS1.p1.5). - G. Emmi, A. Bettiol, E. Gelain, I. M. Bajema, A. Berti, S. Burns, M. C. Cid, J. W. Cohen Tervaert, V. Cottin, E. Durante, J. U. Holle, A. D. Mahr, M. M. Del Pero, C. Marvisi, J. Mills, S. Moiseev, F. Moosig, C. Mukhtyar, T. Neumann, I. Olivotto, C. Salvarani, B. Seeliger, R. A. Sinico, C. Taillé, B. Terrier, N. Venhoff, G. Bertsias, L. Guillevin, D. R. W. Jayne, and A. Vaglio (2023) Evidence-based guideline for the diagnosis and management of eosinophilic granulomatosis with polyangiitis. Nature Reviews Rheumatology 19(6), pp. 378–393. External Links: ISSN 1759-4804, Link (http://dx.doi.org/10.1038/s41584-023-00958-w), Document (https://dx.doi.org/10.1038/s41584-023-00958-w) 被引用: §1 (https://arxiv.org/html/2607.02983#S1.p1.1). - Z. Fan, L. Wei, J. Tang, W. Chen, W. Siyuan, Z. Wei, and F. Huang (2025) AI hospital: benchmarking large language models in a multi-agent medical interaction simulator. In Proceedings of the 31st International Conference on Computational Linguistics, O. Rambow, L. Wanner, M. Apidianaki, H. Al-Khalifa, B. D. Eugenio, and S. Schockaert (Eds.), Abu Dhabi, UAE, pp. 10183–10213. External Links: Link (https://aclanthology.org/2025.coling-main.680/) 被引用: §2.3 (https://arxiv.org/html/2607.02983#S2.SS3.p1.1). - M. Y. Guan, M. Joglekar, E. Wallace, S. Jain, B. Barak, A. Helyar, R. Dias, A. Vallone, H. Ren, J. Wei, et al. (2024) Deliberative alignment: reasoning enables safer language models. arXiv preprint arXiv:2412.16339. 被引用: §2.2 (https://arxiv.org/html/2607.02983#S2.SS2.p1.1). - E. J. Hu, Y. Shen, P. Wallis, Z. Allen-Zhu, Y. Li, S. Wang, L. Wang, and W. Chen (2022) LoRA: low-rank adaptation of large language models. In International Conference on Learning Representations, External Links: Link (https://openreview.net/forum?id=nZeVKeeFYf9) 被引用: §A.8 (https://arxiv.org/html/2607.02983#A1.SS8.p4.3). - J. Hu, X. Wu, Z. Zhu, Xianyu, W. Wang, D. Zhang, and Y. Cao (2024) OpenRLHF: an easy-to-use, scalable and high-performance rlhf framework. arXiv preprint arXiv:2405.11143. 被引用: §4.1 (https://arxiv.org/html/2607.02983#S4.SS1.p1.5). - Z. Huang, G. Geng, S. Hua, Z. Huang, H. Zou, S. Zhang, P. Liu, and X. Zhang (2025) O1 replication journey – part 3: inference-time scaling for medical reasoning. External Links:2501.06458, Link (https://arxiv.org/abs/2501.06458) 被引用: §A.8 (https://arxiv.org/html/2607.02983#A1.SS8.p1.1), §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1), §4.2 (https://arxiv.org/html/2607.02983#S4.SS2.p3.1). - Hugging Face (2025) Open r1: a fully open reproduction of deepseek-r1. External Links: Link (https://github.com/huggingface/open-r1) 被引用: §2.2 (https://arxiv.org/html/2607.02983#S2.SS2.p1.1). - A. Jaech, A. Kalai, A. Lerer, A. Richardson, A. El-Kishky, A. Low, A. Helyar, A. Madry, A. Beutel, A. Carney, et al. (2024) Openai o1 system card. arXiv preprint arXiv:2412.16720. 被引用: §1 (https://arxiv.org/html/2607.02983#S1.p1.1), §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1). - S. Jiang, Y. Liao, Z. Chen, Y. Zhang, Y. Wang, and Y. Wang (2025a) MedS3: towards medical small language models with self-evolved slow thinking. External Links:2501.12051, Link (https://arxiv.org/abs/2501.12051) 被引用: §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1). - Y. Jiang, K. C. Black, G. Geng, D. Park, J. Zou, A. Y. Ng, and J. H. Chen (2025b) MedAgentBench: a realistic virtual ehr environment to benchmark medical llm agents. External Links:2501.14654, Link (https://arxiv.org/abs/2501.14654) 被引用: §2.3 (https://arxiv.org/html/2607.02983#S2.SS3.p1.1). - D. Jin, E. Pan, N. Oufattole, W. Weng, H. Fang, and P. Szolovits (2021) What disease does this patient have? a large-scale open domain question answering dataset from medical exams. Applied Sciences 11(14), pp. 6421. 被引用: §A.4 (https://arxiv.org/html/2607.02983#A1.SS4.p1.1). - T. Kwon, K. T. Ong, D. Kang, S. Moon, J. R. Lee, D. Hwang, Y. Sim, B. Sohn, D. Lee, and J. Yeo (2024) Large language models are clinical reasoners: reasoning-aware diagnosis framework with prompt-generated rationales. External Links:2312.07399, Link (https://arxiv.org/abs/2312.07399) 被引用: §2.1 (https://arxiv.org/html/2607.02983#S2.SS1.p1.1). - W. Kwon, Z. Li, S. Zhuang, Y. Sheng, L. Zheng, C. H. Yu, J. E. Gonzalez, H. Zhang, and I. Stoica (2023) Efficient memory management for large language model serving with pagedattention. In Proceedings of the
相似文章
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。