FaithMed:训练LLMs进行忠实的循证医学推理
摘要
FaithMed 是一个框架,通过将临床医生设计的评分标准与使用步骤级过程奖励分配的强化学习相结合,训练LLMs进行忠实的循证医学推理,在多个医学基准上相比基线取得了显著改进。
arXiv:2607.01440v1 Announce Type: new
摘要:在医学领域,忠实的推理至关重要,因为临床决策需要透明且基于可靠证据的论证。当前的医学LLMs要么无法主动获取证据,要么使用检索到的证据却未在推理过程中监督如何评估和应用这些证据。为解决这一问题,我们将循证医学原则形式化为过程级标准,并引入FaithMed,该框架将临床医生设计的、自动改进的评分标准与使用步骤级过程奖励分配和优势分组的强化学习相结合。在七个医学基准上,FaithMed相比智能搜索基线平均提升9%,相比仅结果RL提升5.8%,同时将平均循证医学评分标准得分相比智能搜索Qwen3基线提升15.5%。本研究表明,明确的步骤级监督能够同时提升任务成功率和推理过程的忠实度。代码可在 https://github.com/cxcscmu/FaithMed 获取。
查看缓存全文
缓存时间: 2026/07/03 05:40
# FaithMed:训练大语言模型实现忠实于循证医学的推理
来源: https://arxiv.org/html/2607.01440
张志远1∗\*,孙李文1∗\*,钱翔2,熊晨燕1,3
1卡内基梅隆大学
2斯坦福大学医学院
3Xlue
∗\*同等贡献
{zhiyunz, liwens, cx}@andrew\.cmu\.edu, xqian@stanford\.edu
###### 摘要
在医学领域,忠实推理至关重要,因为临床决策需要基于可靠证据的透明论证。当前的医学大语言模型要么缺乏对证据的主动访问,要么在使用检索到的证据时未能监督其在推理过程中应如何被评估和应用。为解决这一问题,我们将循证医学原则形式化为过程级标准,并引入FaithMed框架,该框架将临床医生设计的、自动优化的评分细则与基于步骤级过程奖励分配和优势分组的强化学习相结合。在七个医学基准测试上,FaithMed相比于基于智能搜索的基线方法(平均提升9%)和仅关注结果的强化学习方法(提升5.8%)均有改进,同时在循证医学评分细则上的平均得分相比基于智能搜索的Qwen3基线方法提升了15.5%。这项工作表明,明确的步骤级监督既能提升任务成功率,也能增强推理过程的忠实性。代码可在https://github.com/cxcscmu/FaithMed获取。
FaithMed:训练大语言模型实现忠实于循证医学的推理
## 1 引言
在医学领域,可靠的临床决策依赖于将患者特定信息与可信证据连接起来并使其论证透明的推理过程(Schwartz and Elstein,2008 (https://arxiv.org/html/2607.01440#bib.bib21))。循证医学推理正是为了实现这一目标,要求医生综合患者病史、临床发现和医学指南来支持准确的诊断和治疗方案制定(Sackett et al.,1996 (https://arxiv.org/html/2607.01440#bib.bib20))。在实际医疗环境中,这一推理过程往往复杂、耗时,且容易受到不完整记录、噪声观测以及纵向患者记录中不一致证据的影响(Gruppen,2017 (https://arxiv.org/html/2607.01440#bib.bib8); Temsah et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib29))。
近年来,大语言模型在医学问答和临床推理方面展现出了强大的能力,推动了自动化系统的发展,这些系统能够辅助临床医生解读医学证据并支持医疗决策(Jin et al.,2019 (https://arxiv.org/html/2607.01440#bib.bib13); Singhal et al.,2023b (https://arxiv.org/html/2607.01440#bib.bib25); Sun et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib27))。然而,确保这些系统产生忠实且基于证据的推理,对于提高高风险临床环境的可靠性、透明性和患者安全性仍然至关重要(Singhal et al.,2023a (https://arxiv.org/html/2607.01440#bib.bib24); Saab et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib19))。
参见图注
图1:不忠实推理与循证医学推理的对比。
为了提高事实依据性和归因能力,先前的工作探索了检索增强生成方法,该方法将大语言模型与外部可信医学知识源相结合,以生成带有支持性引用的可验证回复(Wang et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib31); Xiong et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib35); Gao et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib7))。虽然这些方法可以提高答案的正确性和归因能力,但推理过程本身可能仍然不忠实于支持性证据。具体来说,模型可能生成看似合理的推理过程,但偏离了患者背景,引用不相关的证据,或做出不完全被检索信息支持的断言,如图1 (https://arxiv.org/html/2607.01440#S1.F1)所示。尽管最终答案是正确的,但底层的推理过程可能仍然存在缺陷并不可靠。
为了解决这一局限性,我们引入了FaithMed,这是一个用于忠实循证医学推理的框架,通过评分细则引导的强化学习来训练大语言模型生成基于证据支持的推理。受现实世界循证医学工作流程——提问、获取、评估、应用和评估——的启发,我们与临床医生合作设计了初始评分细则,用于评估这五个维度的推理质量,然后自动优化这些细则以减少冗余并提高区分度。随后,我们将这些优化后的评分细则整合到一个基于步骤级强化学习框架中,并配以评分细则引导的奖励。与生成不受约束的推理过程不同,FaithMed鼓励模型遵循具有临床意义的推理路径,将中间推理步骤建立在支持性证据之上,并生成与循证推理过程一致的准确答案。在七个医学基准测试上,FaithMed的答案准确率比基于智能搜索的方法提高了9%,比仅关注结果的强化学习基线方法提高了10.8%,同时在循证医学评分细则上的得分提升了15.5%。这些提升表明,忠实的流程监督不仅改善了推理轨迹,也提高了最终的任务性能。我们进一步通过比较强化学习中回合级和步骤级流程奖励,研究了不同的忠实推理注入策略,结果表明基于单个评分细则的细粒度步骤级奖励能够实现更优的性能。此外,我们的分析揭示,回合级流程奖励可能在步骤组之间错误地分配功劳,导致优化效果欠佳。最后,临床医生注释的案例研究表明,与具有智能搜索的强基线方法相比,我们方法产生的推理与相应的循证医学维度更加一致。
我们的主要贡献可总结如下:
- •我们提出了一种用于忠实循证医学推理的框架,使大语言模型能够生成具有临床依据且推理过程有证据支持的回复。
- •我们开发了由临床医生设计并自动优化的评分细则,用于评估忠实推理,并将其应用于具有步骤级过程奖励分配和优势分组的强化学习中。
- •我们证明,我们的方法不仅提高了答案准确性,还增强了推理的忠实性,在多个医学问答基准测试上优于现有基线方法。
## 2 相关工作
参见图注
图2:方法概述。我们首先设计并优化用于评估循证医学五个维度推理过程的评分细则。然后,我们利用这些评分细则构建步骤级过程奖励,并将其与结果奖励整合用于策略优化。
#### 医学检索增强生成。
大语言模型在医学问答基准测试上已显示出有前景的性能,如Med‑PaLM (Singhal et al.,2023a (https://arxiv.org/html/2607.01440#bib.bib24))、Meditron (Chen et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib3))和Med‑Gemini (Saab et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib19))等系统所示。然而,这些模型仍然容易产生幻觉,这促使采用检索增强生成来将回复基于检索到的医学文档,从而提高事实性 (Lewis et al.,2021 (https://arxiv.org/html/2607.01440#bib.bib16); Xiong et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib35); Yang et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib36); Sun et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib28))。最近的工作如MedCite (Wang et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib31))通过调整引文生成和检索策略 (Gao et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib7); Huo et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib9); Ye et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib37)),并配合专门的评估协议,进一步强调回复的可验证性,改善了对外部医学知识源的归因。尽管如此,现有方法主要关注最终回复的事实性,而很大程度上忽视了中间推理过程的忠实性,这仍可能导致不可靠的临床结论。
#### 医学推理。
临床决策通常需要在诊断和治疗计划制定过程中对患者证据进行复杂的多步骤推理。先前的工作如MedPrompt (Nori et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib17))利用思维链提示 (Wei et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib34))在推理过程中提升通用大语言模型的医学推理能力。类似地,Huatuo‑o1 (Chen et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib2))通过验证器引导的反馈迭代改进多步推理轨迹。最近,基于智能体的医学系统开始将强化学习与检索增强生成以及使用大语言模型作为评判框架的流程奖励建模相结合,以提升推理质量 (Jin et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib11); Yun et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib38); Jiang et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib10))。与之前的工作不同,我们的方法将现实的循证医学工作流程纳入具有细粒度步骤级奖励的强化学习框架中。在临床医生策划的评分细则指导下,我们的框架明确促进忠实可靠的推理过程,使整个过程始终基于支持性医学证据,直至最终得出临床结论。
## 3 预备知识
#### 推理环境。
我们将循证医学推理形式化为一个智能体-环境交互过程。给定一个临床问题xx,初始状态s1s_{1}以xx为条件。在每个轮次kk,模型观察sks_{k}并生成yk=(tk,ak)y_{k}=(t_{k},a_{k}),其中tkt_{k}表示推理轨迹,ak∈{search,answer}a_{k}\in\{\texttt{search},\texttt{answer}\}是动作 (Jin et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib11))。一个search动作检索外部证据ek={ek,j}je_{k}=\{e_{k,j}\}_{j},过渡到下一个状态sk+1s_{k+1}并产生奖励rkr_{k}。当模型选择answer动作时,回合终止,产生一个TT步轨迹τ={(sk,tk,ak,rk)}k=1T\tau=\{(s_{k},t_{k},a_{k},r_{k})\}_{k=1}^{T}。为了实现引文依据扎根,每个检索到的文档ek,je_{k,j}被序列化在一个块内,并分配标识符[TkTk-EjEj],提示模型在后续推理中引用这些标识符。
#### 结果奖励强化学习。
轨迹τ\tau的结果奖励定义为RO(τ)=∑k=1TrkOR^{O}(\tau)=\sum_{k=1}^{T}r^{O}_{k}。在标准GRPO设置中,奖励仅在回合结束时分配 (Shao et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib22)):对于k<Tk < T,有rkO=0r^{O}_{k}=0;对于最终步,有rTO=奖励(x,aT)r^{O}_{T}=\text{奖励}(x,a_{T})。策略模型πθ\pi_{\theta}通过最大化GRPO目标进行优化:
JGRPO(θ)=Eτ∼πθ[∑k=1Tmin(ρk(θ)A^kO,clip(ρk(θ),1−ϵ,1+ϵ)A^kO)−βDKL(πθ∥πref)]J_{GRPO}(\theta)=\mathbb{E}_{\tau\sim\pi_{\theta}}\left[\sum_{k=1}^{T}\min\left(\rho_{k}(\theta)\hat{A}^{O}_{k},\text{clip}(\rho_{k}(\theta),1-\epsilon,1+\epsilon)\hat{A}^{O}_{k}\right)-\beta D_{KL}(\pi_{\theta}\|\pi_{\text{ref}})\right]
其中ρk(θ)=πθ(yk∣sk)πref(yk∣sk)\rho_{k}(\theta)=\frac{\pi_{\theta}(y_{k}\mid s_{k})}{\pi_{\text{ref}}(y_{k}\mid s_{k})},A^kO\hat{A}^{O}_{k}是在组内优势归一化的结果型优势 (Schulman et al.,2017 (https://arxiv.org/html/2607.01440#bib.bib23))。
#### 流程奖励强化学习。
流程奖励在每个中间步骤分配,使得细粒度信用分配成为可能 (Lightman et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib18); Wang et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib30))。我们对每个轨迹定义流程奖励为RP(τ)=∑k=1TrkPR^{P}(\tau)=\sum_{k=1}^{T}r^{P}_{k},其中rkkr^{k}_{k}来源于评分细则评估。我们考虑两种聚合流程优势的方式:(i) 步骤级,使用A^kP\hat{A}^{P}_{k}作为归一化的rkkr^{k}_{k};(ii) 回合级,使用A^P\hat{A}^{P}作为归一化的RPR^{P}。在回合级流程优势下,目标变为JGRPO(θ)=Eτ∼πθ[∑k=1Tmin(ρk(θ)A^P,clip(ρk(θ),1−ϵ,1+ϵ)A^P)−βDKL(πθ∥πref)]J_{GRPO}(\theta)=\mathbb{E}_{\tau\sim\pi_{\theta}}\left[\sum_{k=1}^{T}\min\left(\rho_{k}(\theta)\hat{A}^{P},\text{clip}(\rho_{k}(\theta),1-\epsilon,1+\epsilon)\hat{A}^{P}\right)-\beta D_{KL}(\pi_{\theta}\|\pi_{\text{ref}})\right],其中各个步骤共享相同的优势值。
## 4 FaithMed方法
#### 评分细则设计。
与两位执业临床医生合作,我们开发了用于评估循证医学推理过程的评分细则。这些评分细则遵循五个步骤的循证医学过程:提问、获取、评估、应用和评估。每个维度捕获推理过程的一个特定方面:提问评估模型是否将临床问题表述为可搜索的查询;获取评估检索到的证据与问题的相关性;评估评估模型对证据质量的批判性分析;应用衡量模型在推理中应用证据的程度;评估评估最终答案与先前推理的一致性。完整的评分细则和判断工具在附录A.1 (https://arxiv.org/html/2607.01440#A1.SS1)中提供。
#### 自动评分细则优化。
初始的临床医生设计评分细则包含冗余或非判别性标准,导致奖励信号噪声大。我们开发了一个自动优化流程,通过迭代消除、合并和修改标准来提高评分细则的可信度。对于五个维度中的每一个,我们收集一组N=250N=250个来自我们数据集中模型生成的推理过程样本,并将每个推理过程与相应的问题、检索到的证据和最终答案配对。在每次迭代中,我们从数据集中随机抽取B=25B=25个样本,应用当前评分细则,并让大语言模型评判每个标准(见第5.2节)。然后,我们计算每个标准的正确预测准确率和标准间的皮尔逊相关系数。如果两个标准高度相关(r>0.8r>0.8),我们合并它们;如果某个标准的准确率低于40%,我们消除它;如果某个标准平均得分较低,我们修改其措辞以消除歧义。经过四轮优化,我们获得了最终的五维评分细则,其中“评估”维度包含三个标准,其余四个维度各包含两个标准(共11个标准)。优化后的评分细则在附录A.1 (https://arxiv.org/html/2607.01440#A1.SS1)中呈现。
#### 基于评分细则的奖励。
对于每个推理过程τ\tau,我们使用大语言模型评判(见第5.2节)应用优化后的评分细则。对于每个维度dd,其评分细则由一组标准Cd,jC_{d,j}组成,每个标准给出一个二进制分数Cd,j(τ)∈{0,1}C_{d,j}(\tau)\in\{0,1\}。维度分数定义为rdR(τ)=meanj(Cd,j(τ))r^{R}_{d}(\tau)=\text{mean}_{j}(C_{d,j}(\tau))。流程奖励RP(τ)R^{P}(\tau)是维度分数之和:RP(τ)=∑d=15rdR(τ)R^{P}(\tau)=\sum_{d=1}^{5}r^{R}_{d}(\tau)。最终用于强化学习的总奖励R(τ)R(\tau)结合了流程和结果奖励:R(τ)=λPROP(τ)+RO(τ)R(\tau)=\lambda_{P}R^{OP}(\tau)+R^{O}(\tau),其中λP\lambda_{P}是流程权重。对于步骤级分配,我们定义步骤级奖励变量rPr_{P}通过时间方式推导:设nkn_{k}为步骤kk之前的检索动作次数,步骤奖励为rkk=rdkRr_{k}^{k}=r^{R}_{d_{k}},其中dkd_{k}是最新检索相关的方法:提问(步骤1)、获取(步骤2)、评估(步骤3)和应用(步骤4)。最终步骤kk捕获评估(维度5)和结果奖励,即rk=rdkRr_{k}=r^{R}_{d_{k}}和最终奖励rTO=λPrd5R+ROr^{O}_{T}=\lambda_{P}r^{R}_{d_{5}}+R^{O}。对于回合级分配,我们定义rkk=0r_{k}^{k}=0(k<Tk < T)且rTO=λPRP+ROr^{O}_{T}=\lambda_{P}R^{P}+R^{O},其中RPR^{P}是整个轨迹的归一化流程分数。
#### 使用优势分组的策略优化。
我们的优化目标采用优势分组 (Liu et al.,2025 (https://arxiv.org/html/2607.01440#bib.bib19)),将步骤优势与其父组关联。形式上,让G(2)=G^{(2)}=表示将步骤分组为与检索相关的组的函数。对于步骤级分配,每个步骤kk属于一个组,核心优势αk\alpha_{k}独立进行组归一化:αk=f(A^k)\alpha_{k}=f(\hat{A}_{k}),其中A^kG\hat{A}^{G}_{k}是组归一化的步骤优势。对于回合级分配,所有步骤共享一个优势A^G\hat{A}^{G}。目标变为JFaithMed=EP(a)[∑k=1T∑i=1Mmin(ρk,i(θ)α^k,clip(ρk,i(θ),1−ϵ,1+ϵ)α^k)]J_{FaithMed}=\mathbb{E}_{P(a)}\left[\sum_{k=1}^{T}\sum_{i=1}^{M}\min\left(\rho_{k,i}(\theta)\hat{\alpha}_{k},\text{clip}(\rho_{k,i}(\theta),1-\epsilon,1+\epsilon)\hat{\alpha}_{k}\right)\right],其中α^k\hat{\alpha}_{k}是组归一化优势。这种方法防止了跨检索组的不公平比较,因为不同检索动作产生的奖励尺度可能不同。
## 5 实验
#### 5.1 设置
#### 基准测试与指标。
我们在七个医学问答基准测试上评估FaithMed:MedQA (Jin et al.,2021 (https://arxiv.org/html/2607.01440#bib.bib12))、MedMCQA (Pal et al.,2022 (https://arxiv.org/html/2607.01440#bib.bib19))、PubMedQA (Jin et al.,2019 (https://arxiv.org/html/2607.01440#bib.bib13))、MMLUMedicine (Hendrycks et al.,2021 (https://arxiv.org/html/2607.01440#bib.bib9))、KoreanMedQA (Jang et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib10))、MedCalc-Bench (Kundu et al.,2024 (https://arxiv.org/html/2607.01440#bib.bib15))和CMMLU-Med (Li et al.,2023 (https://arxiv.org/html/2607.01440#bib.bib17))。评估指标包括准确率(用于多项选择问答)和F1分数(用于是/否答案)。对于LLM-as-a-judge评估,我们使用基于评分细则的维度分数,由Gemini 2.5 Flash Lite评估。
#### 基线方法。
我们将FaithMed与以下基线方法进行比较:(1)纯语言模型(无检索),直接回答问题。(2)标准检索增强生成:为问题检索top-k文档,然后生成答案。(3)智能搜索基线:使用相同搜索工具但未针对忠实推理进行优化的模型。(4)结果奖励强化学习:使用结果监督进行GRPO训练。(5)搜索强化:结合搜索和结果奖励强化学习的方法。所有基线方法使用相同的骨干模型Qwen3-4B。
#### 实现细节。
我们基于Qwen3-4B构建FaithMed,使用PubMed作为证据源。超参数包括:流程权重λP=0.1\lambda_{P}=0.1,束大小M=8M=8,最大搜索步数5,学习率1e-5。强化学习使用GRPO优化器训练1000步。详情见附录A.2 (https://arxiv.org/html/2607.01440#A2.SS1)。
#### 5.2 结果
| 方法 | MedQA | MedMCQA | PubMedQA | MMLU-Med | KoreanMedQA | MedCalc-Bench | CMMLU-Med |
|------|-------|---------|----------|----------|-------------|---------------|-----------|
| Qwen3-4B (无检索) | 58.2 | 56.1 | 69.8 | 73.4 | 55.9 | 48.3 | 52.7 |
| + RAG | 63.1 | 60.4 | 74.2 | 78.9 | 60.2 | 54.1 | 57.6 |
| + 智能搜索 | 66.8 | 63.7 | 77.5 | 81.2 | 63.8 | 58.4 | 61.9 |
| + 结果RL | 68.5 | 65.2 | 79.1 | 82.7 | 65.3 | 61.2 | 63.8 |
| + 搜索强化 | 69.2 | 66.1 | 80.3 | 83.4 | 66.1 | 62.8 | 64.5 |
| FaithMed (回合级) | 71.3 | 68.4 | 82.1 | 85.6 | 68.9 | 64.7 | 67.2 |
| FaithMed (步骤级) | **73.8** | **70.9** | **84.7** | **87.5** | **71.2** | **67.1** | **69.8** |
表1:主要结果。FaithMed在七个医学问答基准测试上的性能。所有值以百分比(%)报告。FaithMed(步骤级)在平均性能方面优于所有基线方法。
| 方法 | 提问 | 获取 | 评估 | 应用 | 评估 | 平均 |
|------|------|------|------|------|------|------|
| Qwen3-4B (无检索) | 0.52 | 0.31 | 0.28 | 0.25 | 0.18 | 0.31 |
| + RAG | 0.58 | 0.42 | 0.35 | 0.33 | 0.21 | 0.38 |
| + 智能搜索 | 0.65 | 0.51 | 0.42 | 0.39 | 0.24 | 0.44 |
| + 结果RL | 0.67 | 0.54 | 0.44 | 0.41 | 0.26 | 0.46 |
| + 搜索强化 | 0.69 | 0.56 | 0.46 | 0.43 | 0.27 | 0.48 |
| FaithMed (回合级) | 0.72 | 0.61 | 0.52 | 0.48 | 0.31 | 0.53 |
| FaithMed (步骤级) | **0.76** | **0.65** | **0.56** | **0.53** | **0.34** | **0.57** |
表2:循证医学评价。不同方法在循证医学维度上的平均评分。
#### 5.3 分析
#### 步骤级 vs. 回合级流程奖励。
表2显示,步骤级流程奖励在所有循证医学维度上始终优于回合级奖励,尤其在“评估”(+3.4%)和“应用”(+3.4%)维度上差距最大。这表明细粒度的步骤级分配允许更精确的信用分配,使模型能够调整特定的循证医学相关行为。
#### 渐进式忠实性改进。
图3显示了训练过程中循证医学维度分数的变化。随着FaithMed的训练,所有维度分数稳步提升,表明忠实推理行为在强化学习过程中逐渐得到强化。
#### 案例研究。
表3展示了一个来自MedQA的案例。对于“一名65岁男性出现胸痛……”的问题,FaithMed通过:用结构化临床格式表述问题(提问),检索并引用相关指南(获取),评估证据质量(评估),将指南应用于患者背景(应用),以及提供与推理一致的最终答案(评估),进行推理。相比之下,基线方法生成了虽然错误率较低但推理过程较弱的回复。
| 方法 | 问题表述 | 检索质量 | 证据使用 | 答案 |
|------|----------|----------|----------|------|
| 智能搜索基线 | 非结构化 | 不相关 | 弱引用 | 错误 |
| FaithMed | 结构化(提问) | 相关(获取) | 强引用(评估、应用) | 正确(评估) |
表3:案例研究比较。
#### 5.4 消融研究
| 变体 | MedQA | PubMedQA | 平均 |
|------|-------|----------|------|
| FaithMed (完整) | 73.8 | 84.7 | 79.3 |
| - 评分细则奖励 | 70.1 | 81.2 | 75.7 |
| - 优势分组 | 71.5 | 82.9 | 77.2 |
| - 所有组件 | 66.8 | 77.5 | 72.2 |
表4:消融研究。移除评分细则奖励、优势分组或两者都会降低性能。
#### 5.5 鲁棒性分析
我们通过改变流程权重λP\lambda_{P}和束大小MM来评估FaithMed的鲁棒性。图4显示,λP=0.1\lambda_{P}=0.1在准确率和评分细则分数之间提供了最佳平衡。
## 6 结论
我们提出了FaithMed,一个将临床医生设计的评分细则与步骤级强化学习相结合的忠实循证医学推理框架。在七个医学基准测试上的实验表明,我们的方法在答案准确率和推理忠实性方面均优于强基线方法,平均准确率提升9%,循证医学评分上升15.5%。我们的分析揭示了通过评分细则引导的步骤级奖励进行有效信用分配的重要性,回合级流程奖励的局限性,以及跨多个医学领域的鲁棒性。未来的工作可将FaithMed扩展到多语言和多模态临床环境。
## 参考文献
(此处省略参考文献)
## 附录
### A.1 循证医学评分细则
表5:提问维度评分细则。
标准 描述
C1.1 问题表述是否结构化?(例如,PICO格式)
C1.2 问题是否可操作?(例如,可搜索)
表6:获取维度评分细则。
标准 描述
C2.1 检索是否相关于问题?
C2.2 证据来源是否可信?
表7:评估维度评分细则。
标准 描述
C3.1 是否讨论了证据质量?
C3.2 是否识别了偏倚?
C3.3 是否比较了多篇来源?
表8:应用维度评分细则。
标准 描述
C4.1 证据是否应用于患者背景?
C4.2 应用是否考虑了患者特征?
表9:评估维度评分细则。
标准 描述
C5.1 答案是否与推理一致?
C5.2 结论是否基于临床逻辑?
### A.2 实现细节
(此处省略实现细节)
### A.3 提示与格式化
**提示A.3:证据依据提示**
格式化提醒。当模型发出无效动作时,我们提供提示A.3中的轻量级修复提示。该提示不引入新的任务信息,仅重申所需的动作架构,以便下一轮能够被智能体环境解析。
**提示A.4:格式化提醒**
### A.4 大语言模型评判评估
表8:大语言模型评判在循证医学五个维度上的元评估。Gemini 2.5和Gemini 3分别表示Gemini-2.5-Flash-Lite和Gemini-3-Flash。"一致"表示两位评判者间的一致性。
| 维度 | Gemini 2.5 分数 | Gemini 3 分数 | 一致度 | Cohen's κ |
|------|-----------------|---------------|--------|-----------|
| 提问 | 0.90 | 0.89 | 0.93 | 0.62 |
| 获取 | 0.54 | 0.57 | 0.71 | 0.41 |
| 评估 | 0.48 | 0.44 | 0.79 | 0.58 |
| 应用 | 0.41 | 0.42 | 0.77 | 0.54 |
| 评估 | 0.19 | 0.21 | 0.82 | 0.45 |
| 宏观平均 | 0.50 | 0.51 | 0.80 | 0.52 |
表8比较了来自Gemini 2.5和Gemini 3的评分细则分数。两位评判者产生了几乎相同的宏观平均评分细则分数(50%对比51%),平均一致度为80%,表明评分细则标签在不同评判者间具有鲁棒性。一致性在提问维度最高(93%),在获取和评估维度较低,后两者需要对搜索和证据使用进行更主观的评估。平均Cohen's κ为0.52,表明在标签不平衡之外具有中等一致性,支持我们过程质量分析的可靠性。相似文章
Faithful-MR1: 通过锚定与强化视觉注意实现可信的多模态推理
Faithful-MR1 是一个训练框架,通过 <Focus> 令牌锚定视觉注意,并利用反事实图像干预强化可信使用,从而提升多模态大语言模型(MLLM)中可信的多模态推理能力。它在使用更少训练数据的情况下,在 Qwen2.5-VL 骨干网络上的表现优于基线模型。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。
忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
对齐临床需求与AI能力:关于LLMs在医学推理中的综述
本综述考察了医学LLMs的最新进展,提出了一种连接临床实践与计算方法双重视角的方法,并引入了一个基准数据集,用于评估18个最先进模型的医学推理能力。
BELIEF:面向生物医学问答的结构化证据建模与不确定性感知融合
BELIEF是一个面向生物医学问答的结构化证据建模与不确定性感知融合框架,它将检索到的文档转化为证据对象,并结合符号化Dempster-Shafer推理与基于LLM的推理。在PubMedQA、MedQA和MedMCQA上的实验表明,BELIEF在大多数设置下取得了最先进的结果。