通过方差感知的评分标准奖励与GRPO改进LLMs心脏相关医疗问答

arXiv cs.CL 论文

摘要

本文提出一种使用GRPO的方差感知奖励框架,以改进LLMs在心脏相关医疗问答上的性能,在一个HealthBench子集上实现了显著的准确率和F1分数提升。

arXiv:2606.05174v1 Announce Type: new 摘要:大语言模型(LLMs)在医疗应用中展现出巨大潜力。然而,由于数据隐私限制、推理成本高以及边缘或设备端适用性有限,通用模型在实际场景中的部署仍然困难。这些挑战推动了开发更小、更高效模型的需求,这些模型需要强大的训练后策略来确保可靠的医疗推理。在本工作中,我们研究了组相对策略优化(GRPO)用于在基于RaR-Medicine的评分标准监督下,对LLMs进行心脏相关医疗问答的训练后优化。我们提出了一种方差感知奖励框架,该框架扩展了评分标准显式聚合和隐式聚合策略(作为奖励),通过用基于评分标准级别结果的连续分析奖励函数替代加权二元标准聚合和单一总体李克特风格评分。这种公式为稀疏、多标准且难以自动验证的反馈提供了更丰富的优化信号,并使在线策略强化学习更加稳定。在HealthBench的一个保留心脏相关子集上,我们最佳的GRPO变体相对于Qwen3-14B基础模型,将准确率从0.362提升至0.502,F1分数从0.532提升至0.668,同时与GPT-OSS-120B(准确率0.508,F1分数0.674)保持竞争力。我们的研究结果表明,精心设计的基于评分标准的奖励为改善LLMs中心脏相关医疗问答提供了一种实用策略,并有望扩展到其他基于评分标准的任务。
查看原文
查看缓存全文

缓存时间: 2026/06/05 08:04

# 通过基于方差感知评分标准奖励的GRPO提升心脏领域医学问答中大语言模型的表现  
来源: https://arxiv.org/html/2606.05174  

Arash Ahmadi  
电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,美国  
创新研究与工程智能神经形态与量子理解(INQUIRE)实验室,俄克拉荷马大学,诺曼,OK,美国  

Parisa Masnadi Khiabani  
数据科学与分析研究所,俄克拉荷马大学,诺曼,OK,美国  
社会挑战数据研究所(DISC),俄克拉荷马大学,诺曼,OK,美国  

Sarah Sharif  
电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,美国  
创新研究与工程智能神经形态与量子理解(INQUIRE)实验室,俄克拉荷马大学,诺曼,OK,美国  

Charles Nicholson  
工业与系统工程学院,俄克拉荷马大学,诺曼,OK,美国  
数据科学与分析研究所,俄克拉荷马大学,诺曼,OK,美国  

David Ebert  

Mike Banad  
电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,美国  
创新研究与工程智能神经形态与量子理解(INQUIRE)实验室,俄克拉荷马大学,诺曼,OK,美国  
通讯作者: [email protected]  

###### 摘要  

大语言模型(LLMs)在医疗应用中展现出巨大潜力。然而,由于数据隐私限制、推理成本以及对边缘或设备端部署的适应性有限,通用模型在真实场景中的部署仍然困难。这些挑战促使我们开发更小、更高效的模型,这些模型需要强大的训练后策略以确保可靠的医学推理。在这项工作中,我们研究了基于评分标准的监督信号(源自RaR-Medicine),将组相对策略优化(GRPO)应用于心脏领域医学问答的训练后阶段。我们提出了一种方差感知奖励框架,该框架扩展了Rubrics as Rewards的显式聚合和隐式聚合策略,用源自标准级别评分结果的连续分析奖励函数取代了加权二元标准聚合和单一整体Likert式评分。这种公式为稀疏、多标准且难以自动验证的反馈提供了更丰富的优化信号,并实现了更稳定的策略内强化学习。在HealthBench保留的心脏相关子集上,我们最好的GRPO变体相对于Qwen3-14B基座模型,将准确率从0.362提升至0.502,F1分数从0.532提升至0.668,同时与GPT-OSS-120B(准确率0.508,F1分数0.674)保持竞争力。我们的研究结果表明,精心设计的基于评分标准的奖励为提升大语言模型中心脏领域医学问答提供了实用策略,并有可能扩展到其他基于评分标准的任务。  

人工智能正在日益塑造医学研究和临床护理,其应用涵盖预测、影像和基于语言的分析。预测性AI模型用于风险分层和结果预测,而深度学习系统在基于图像的任务中表现出色,如皮肤癌分类、糖尿病视网膜病变检测和乳腺癌筛查[39(https://arxiv.org/html/2606.05174#bib.bib1)、17(https://arxiv.org/html/2606.05174#bib.bib20)、6(https://arxiv.org/html/2606.05174#bib.bib6)、9(https://arxiv.org/html/2606.05174#bib.bib7)、22(https://arxiv.org/html/2606.05174#bib.bib8)]。与此同时,自然语言处理方法正在帮助临床医生和研究人员从电子健康记录和生物医学文献中日益增加的非结构化文本中提取、组织和解释信息[14(https://arxiv.org/html/2606.05174#bib.bib11)、15(https://arxiv.org/html/2606.05174#bib.bib12)、5(https://arxiv.org/html/2606.05174#bib.bib13)、20(https://arxiv.org/html/2606.05174#bib.bib14)]。这些进展共同突显了AI在现代医疗和医学研究中日益扩大的作用,尽管更广泛的真实世界部署仍取决于可靠性、透明度以及对敏感临床数据的谨慎处理[39(https://arxiv.org/html/2606.05174#bib.bib1)、38(https://arxiv.org/html/2606.05174#bib.bib2)]。  

大语言模型(LLMs)延续了这一趋势,因为它们能够解释自然语言问题并生成自由形式的解释。这一能力暗示了在患者分诊、共享决策和临床医生支持中的应用。通用LLMs仍然在临床特异性方面存在困难。它们可能生成看似合理但不包含禁忌症、混淆鉴别诊断或表达不当确定性的叙述。心脏领域的医学问答就体现了这一挑战,因为胸痛、呼吸困难、心悸等症状需要保守的指导、恰当的不确定性处理以及审慎的风险评估。2023年全球疾病负担研究[25(https://arxiv.org/html/2606.05174#bib.bib63)]强调了该领域的临床重要性,该研究报告指出,从1990年到2023年,缺血性心脏病和中风一直分列全球年龄标准化死亡率的第一和第二大原因,其中缺血性心脏病除2021年被COVID-19暂时超越外,每年均保持首位。这种持续存在的负担使得心脏相关临床推理成为AI辅助决策支持的高优先级目标。  

早期的临床自然语言处理系统依赖于任务特定的管道,这些管道使用实体提取、检索、基于规则的启发式方法或监督分类器。这些方法提供了可控性和可审计性,但需要大量的特征设计,并且在不同机构或笔记风格之间往往迁移不佳。最近的开源医疗模型如Med-Gemma表明,与通用基线相比,领域适应可以提高事实准确性和临床相关性[30(https://arxiv.org/html/2606.05174#bib.bib16)]。CancerGPT表明,任务适应的LLM可以在数据有限的情况下支持少样本生物医学推理[19(https://arxiv.org/html/2606.05174#bib.bib50)]。一种针对症状的抑郁症评估进行微调的轻量级LLM进一步证明,临床对齐的适应可以支持症状级别的评估,而不仅仅是粗略的筛查[45(https://arxiv.org/html/2606.05174#bib.bib54)]。在轻量级疾病诊断系统方面的工作也强调了针对资源受限临床环境进行部署感知设计的重要性[36(https://arxiv.org/html/2606.05174#bib.bib49)]。综合来看,这些研究表明,临床效用往往不取决于使用尽可能大的模型,而在于根据领域结构和部署约束来调整模型、数据和目标。  

最近的医疗LLM系统还表明,基础事实、检索、个性化、可解释性和可审计输出对于部署都至关重要。临床实体增强检索通过检索以实体为中心的笔记片段(而非仅依赖通用语义相似度)改进了临床信息提取,这可以在减少不必要上下文的同时提高相关性[21(https://arxiv.org/html/2606.05174#bib.bib51)]。检索增强生成同样提升了本地模型在放射学对比剂咨询中的质量,当与精心策划的知识和人工监督相结合时,支持隐私保护的部署[41(https://arxiv.org/html/2606.05174#bib.bib58)]。集成EHR的患者教育代理展示了个性化LLM支持的前景,同时也强调了面向患者环境中安全控制和临床监督的必要性[13(https://arxiv.org/html/2606.05174#bib.bib57)]。KT-LLM通过基于证据、策略感知且可审计的序列文本建模进一步推动了这一方向[47(https://arxiv.org/html/2606.05174#bib.bib56)]。医学中的整体AI同样强调,可解释性和性能应共同改进,而不是作为分离的目标[28(https://arxiv.org/html/2606.05174#bib.bib55)]。这些研究显示出朝向临床基础可靠且值得信赖的LLM系统的明显进展,但它们并未直接解决如何在训练后阶段针对多标准临床评分条优化医学助手的问题。  

领域适应通常使用监督微调(SFT)在策划好的指令或对话数据上进行。SFT优化对参考答案的模仿。它可能继承标注伪影,并可能鼓励对训练样本的记忆,这在目标是稳健的临床推理和安全的泛化时是不希望的。SFT还将多因素临床质量压缩为单个目标序列。基于评分标准的评估使这一局限性更加明显,因为临床答案必须满足涵盖正确性、安全性、完整性和恰当沟通的多个标准。因此,一种能够直接针对此类标准进行优化的训练方法对于高风险临床助手具有吸引力。  

强化学习(RL)提供了一种互补的范式,因为它根据奖励信号而不是固定的演示目标来优化行为[37(https://arxiv.org/html/2606.05174#bib.bib36)]。早期的基于价值的算法如Q-learning为动作价值估计建立了基本原则[44(https://arxiv.org/html/2606.05174#bib.bib37)]。随后,SARSA和深度Q网络等方法将RL扩展到随机控制和高维观测[43(https://arxiv.org/html/2606.05174#bib.bib39)、23(https://arxiv.org/html/2606.05174#bib.bib38)]。Double DQN及其后续针对移动目标不稳定性问题的修改减少了高估偏差并提高了稳定性[40(https://arxiv.org/html/2606.05174#bib.bib40)、12(https://arxiv.org/html/2606.05174#bib.bib41)]。策略梯度和Actor-Critic方法也实现了对大动作空间的可扩展优化。优势Actor-Critic提供了实用的深度RL基线[2(https://arxiv.org/html/2606.05174#bib.bib42)]。信任区域和近端策略优化提高了策略更新的鲁棒性[31(https://arxiv.org/html/2606.05174#bib.bib43)、32(https://arxiv.org/html/2606.05174#bib.bib44)]。RL已经证明,超越模仿的优化可以产生监督目标中不存在的策略。AlphaGo通过自我对弈和搜索突出了这一能力[35(https://arxiv.org/html/2606.05174#bib.bib45)]。AlphaFold将基于学习的优化扩展到科学发现,并表明结构化目标可以解锁超出传统启发式管道的能力,在蛋白质结构预测方面[16(https://arxiv.org/html/2606.05174#bib.bib5)]。  

最近,语言模型的强化学习后训练已成为改进推理的实用途径。DeepSeek-Math和DeepSeek-R1项目表明,RL可以提升相对较小模型在困难推理任务上的表现[34(https://arxiv.org/html/2606.05174#bib.bib3)、11(https://arxiv.org/html/2606.05174#bib.bib28)]。组相对策略优化(GRPO)是一种专为语言模型后训练设计的RL算法,它避免了显式的价值函数,并使用组内相对优势估计[34(https://arxiv.org/html/2606.05174#bib.bib3)]。这种设计相比于训练单独critic的方法减少了内存需求。它也适用于相对排名比绝对校准更稳定的奖励设置。GRPO首先在数学推理中展现出强劲效果,随后已扩展到更广泛的生成任务。最近的研究表明,GRPO可以通过将推理驱动的反馈整合到优化循环中,改进在代表性不足的编程语言中的代码生成[27(https://arxiv.org/html/2606.05174#bib.bib59)]。相关基于GRPO的RL也改进了深度推理翻译,表明奖励驱动的后训练可以扩展到具有精确验证器的领域之外,进入更开放的生成设置[42(https://arxiv.org/html/2606.05174#bib.bib60)]。  

在医学AI中,这一趋势开始出现在多模态设置中。MedVLM-R1将强化学习应用于医学视觉-语言推理,鼓励显式的自然语言推理,并在放射学任务中提升了医学推理能力[26(https://arxiv.org/html/2606.05174#bib.bib46)]。RARL同样结合了强化学习、LoRA和LLM-as-a-judge式评估,以改进在有限数据和硬件预算下的医学视觉-语言推理和泛化能力[29(https://arxiv.org/html/2606.05174#bib.bib47)]。这些研究加强了向医学对话任务应用GRPO式后训练的论点,在这些任务中,正确性是多维的,奖励是稀疏的,答案质量不仅取决于事实准确性,还取决于解释质量、安全性和完整性。  

本文开发了一个基于GRPO的框架,用于心脏领域的医学助手,该助手回答自由形式的问题,同时满足基于评分条定义的临床标准。我们的训练数据来自RaR-Medicine。我们通过一个专用分类器(使用基于LLM的决策规则或高召回率关键词过滤器)将语料库过滤到与心脏问题直接相关的查询。我们使用MedGemma-27B[30(https://arxiv.org/html/2606.05174#bib.bib16)]生成的合成推理轨迹来增强过滤后的子集,这些轨迹鼓励显式的中间解释。我们使用结构化的输出格式,通过专用标签将推理与最终建议分开,这与先前关于在语言模型中引发多步推理的工作一致[46(https://arxiv.org/html/2606.05174#bib.bib48)]。模型接受初始的监督阶段以学习这种格式并稳定生成。主要优化阶段将GRPO应用于同一心脏相关训练池的不相交子集。奖励计算遵循HealthBench风格评分条的结构。每个提示包含正负标准以及相关的分值。图1(https://arxiv.org/html/2606.05174#S1.F1)提供了完整管道的概览。一个大型评判模型独立评估每个标准并返回二元决策,这遵循了更广泛的LLM-as-a-judge方向[48(https://arxiv.org/html/2606.05174#bib.bib26)]以及rubrics-as-rewards框架[10(https://arxiv.org/html/2606.05174#bib.bib35)]。这种标准级设计也与近期医学评估工作一致,这些工作表明专家基础自动化验证可以在专业QA中扩展评估[7(https://arxiv.org/html/2606.05174#bib.bib52)],并且类似评分条的LLM评判可以在临床总结中与人类评估者高度一致[4(https://arxiv.org/html/2606.05174#bib.bib53)]。相关的医学RL研究如RARL以及更广泛的基于GRPO的工作如DeepTrans也支持在精确验证器不可用时使用基于模型的评判和结构化奖励标准[29(https://arxiv.org/html/2606.05174#bib.bib47)、42(https://arxiv.org/html/2606.05174#bib.bib60)]。标准级评分减少了当单个模型为整个响应分配整体分数时产生的脆弱性。原始评分条分数随后通过一个奖励塑形函数转换为标量奖励。我们研究了多种塑形族,这些族解决了稀疏奖励问题,保留了对完全正确和安全的答案的强激励,并考虑了...(文章未完,但根据要求应继续翻译?不过原文此处截断了,应该是原文到此为止。但看用户消息最后是"accounts for"后面没有内容,可能原文就是如此。需按给定内容翻译。)  

(注意:用户消息最后是“accounts for ”,没有完整句子。根据指令,只需翻译给定内容。因此我翻译到“并考虑了”即可。)

相似文章

面向跨基准医学问答的临床结构化秩门控LoRA

arXiv cs.CL

本文提出BiRG-LoRA,一种用于医学问答的秩门控LoRA方法,利用临床结构化先验选择稀疏秩子集,在四个基准上达到69.31%的宏平均准确率,同时使用的参数少于混合专家方法。

Mental-R1:对齐LLM推理用于心理健康评估

arXiv cs.AI

提出认知相对策略优化(CRPO),一种用于对齐大语言模型在心理健康评估中推理的强化学习框架,在加权F1分数上比现有基线平均提高10.4个百分点。