使用基于评分指导的反事实推荐改善医疗沟通
摘要
本文提出了一种基于语言模型指导的反事实推荐流程,用于改善基于文本的远程医疗中医患沟通。该流程识别出语气和可操作性等可解释特征,并建议在不改变医疗内容的前提下,通过最小化变更来增加患者积极反馈,平均预测积极反馈提升6.41%。
arXiv:2606.18889v1 公告类型: 新论文
摘要: 基于文本的远程医疗越来越依赖轻量级的患者反馈,然而这种反馈主要反映的是感知沟通质量而非医疗准确性。我们引入了一种基于语言模型指导的反事实推荐流程,该流程发现并优化了可解释的沟通特征,如语气、个性化、可操作性和对患者问题的回应完整性,而不干扰医疗内容。这些特征与患者-医生互动元数据一起用于估计积极反馈。在推理时,系统搜索低成本的顺序特征变化,并推荐预测能提高积极反馈概率的最小沟通变化,同时独立的审计模型测试这些收益是否超越选择模型。在互动中,推荐在独立审计模型下平均使预测的积极反馈概率提升+6.41%,且93.31%的推荐非负。这些结果表明,小而可解释的沟通变化可以捕获大部分预测收益,同时保留医生对医疗推理和最终措辞的控制。
查看缓存全文
缓存时间: 2026/06/18 05:46
# 使用评分导向的反事实推荐优化医疗沟通 来源:https://arxiv.org/html/2606.18889 Adrian Cosma§, Nicoleta\-Nina Basoc†\\dagger, Andrei Niculae†\\dagger, Cosmin Dumitrache†\\dagger, Emilian Radoi†\\dagger §IDSIA(多乐尔人工智能研究所),†\\dagger布加勒斯特理工大学国家科学技术大学,通讯作者:emilian\.radoi@upb\.ro (https://arxiv.org/html/2606.18889v1/mailto:[email protected]) ###### 摘要 基于文本的远程医疗越来越依赖轻量级患者反馈,但这种反馈主要反映的是感知到的沟通质量而非医疗准确性。我们提出了一种LM引导的反事实推荐流程,用于发现并优化可解释的沟通特征(如语气、个性化、可操作性和对患者关切的完整性),且不干扰医疗内容。这些特征与医患互动元数据一起用于估计正面反馈。在推理时,系统搜索低成本的序数特征变化,并推荐最小的沟通调整,以预测能提升正面反馈概率;同时,独立的审计模型测试这些提升能否推广到选择模型之外。跨互动分析表明,在独立审计下,推荐方案使正面反馈预测概率平均提升\+6.41%,93.31%的推荐为非负效果。这些结果说明,微小、可解释的沟通变化即可捕获大部分预测收益,同时保留医生对医疗推理和最终措辞的控制权。 Improving Medical Communication using Rubric\-Guided Counterfactual Recommendations Adrian Cosma§, Nicoleta\-Nina Basoc†\\dagger, Andrei Niculae†\\dagger,Cosmin Dumitrache†\\dagger,Emilian Radoi†\\dagger§IDSIA(多乐尔人工智能研究所),†\\dagger布加勒斯特理工大学国家科学技术大学,通讯作者:emilian\.radoi@upb\.ro (https://arxiv.org/html/2606.18889v1/mailto:[email protected]) ## 1 引言 图1:所提流程概述。从医患问答对出发,LM首先优化一组可解释的回复级特征,然后将这些特征细化为针对特定特征的提取提示,用于标注数据集。提取的语义特征与结构化元数据一起,用于训练反馈预测模型。推理时,我们搜索语义特征的反事实变化,并推荐能最大化正面反馈概率的最小特征修改。远程医疗平台日益成为患者与医生首次接触的中介。据报道,2024年全球在线问诊用户超过1.16亿Statista (2026 (https://arxiv.org/html/2606.18889#bib.bib107))。其中一些互动通过书面文本进行:患者提交问题,医生异步回复,交流通常以轻量级反馈信号(如正面或负面评分)结束。这种反馈很重要,因为它塑造医生声誉、作为患者满意度的代理指标,并激励医生更有效地与患者沟通。 然而,患者反馈并不反映回复的医疗准确性,因为患者无法评估临床正确性。他们的判断主要受沟通质量影响,如清晰度、同理心、个性化和可操作性。先前研究表明,医生的沟通显著影响患者体验、治疗依从性和对医疗的看法 (Martin 等,2005 (https://arxiv.org/html/2606.18889#bib.bib6); Geng 等,2024 (https://arxiv.org/html/2606.18889#bib.bib59))。这给远程医疗平台提出了一个重要问题:如何在不自动化医疗建议或重写回复的前提下,支持医生提升回复中面向患者的质量? 我们将此问题视为*反事实推荐*问题。给定患者问题、医生回复及问答元数据,我们的目标是识别回复中最小的沟通特征集合,通过改进这些特征能最大程度提升正面患者反馈的概率。与之前的工作 Niculae 等 (2025 (https://arxiv.org/html/2606.18889#bib.bib87)); Li 等 (2023 (https://arxiv.org/html/2606.18889#bib.bib44)); Zhao 等 (2025a (https://arxiv.org/html/2606.18889#bib.bib96),b (https://arxiv.org/html/2606.18889#bib.bib97)) 不同,我们不使用*语言模型* (LM) 生成新的医疗回复。我们推荐可解释的编辑目标,例如增加个性化、提供更清晰的解释或使建议更具可操作性。医生保留对最终回复的完全控制权,可以接受、修改或忽略推荐。 这一设定对任何用于改进医生回复的系统提出了三点要求: R1\\mathfrak\{R\}\_\{1\} 可解释性:推荐应以可解释的沟通特征来表达。 R2\\mathfrak\{R\}\_\{2\} 反馈改进:推荐的更改应增加正面患者反馈的预测概率。 R3\\mathfrak\{R\}\_\{3\} 最小编辑工作量:推荐应能以最小的编辑工作量实现反馈改进。 为满足这些要求,我们提出了一种基于LM引导的反事实推荐流程,用于基于文本的远程医疗回复。该流程利用了*自动提示优化* (APO) 技术。 本文的主要贡献如下: 1. 1. 我们改编并验证了 Cosma 等 (2026 (https://arxiv.org/html/2606.18889#bib.bib100)) 提出的自动化特征发现方法,用于基于文本的远程医疗反馈建模,利用LM发现、优化并提取与患者满意度相关的回复级语义特征 (R1\\mathfrak\{R\}\_\{1\}, R2\\mathfrak\{R\}\_\{2\})。通过训练一个可解释的反馈估计器(达到71.5%的ROC-AUC),我们评估了这些特征的预测价值。 2. 2. 我们提出了一种预算受限的反事实搜索过程,基于序数语义特征,通过平衡预测反馈增益与编辑工作量来生成低成本推荐 (R2\\mathfrak\{R\}\_\{2\}, R3\\mathfrak\{R\}\_\{3\})。我们对所提推荐进行了定量研究,发现对于93.31%的回复,推荐能提高正面反馈的预测概率,平均提升\+6.41%。 ## 2 相关工作 LM驱动的特征发现。过去,LM已被用于在固定框架下进行可靠的特征*提取* (He 等,2024 (https://arxiv.org/html/2606.18889#bib.bib62); Gilardi 等,2023 (https://arxiv.org/html/2606.18889#bib.bib42); Törnberg 2023 (https://arxiv.org/html/2606.18889#bib.bib47))。最近,研究开始利用LM*发现*应该提取哪些特征 (Cosma 等,2026 (https://arxiv.org/html/2606.18889#bib.bib100); Balek 等,2025 (https://arxiv.org/html/2606.18889#bib.bib77); Zhou 等,2024 (https://arxiv.org/html/2606.18889#bib.bib75); Zhang 等,2025 (https://arxiv.org/html/2606.18889#bib.bib84))。除了像APO那样针对单一预测优化指令 (Zhou 等,2022 (https://arxiv.org/html/2606.18889#bib.bib36); Pryzant 等,2023 (https://arxiv.org/html/2606.18889#bib.bib48); Yuksekgonul 等,2025 (https://arxiv.org/html/2606.18889#bib.bib94)),Cosma 等 (2026 (https://arxiv.org/html/2606.18889#bib.bib100)) 将特征发现视为数据集级别的提示优化问题,其中优化后的提示引入一个共享的特征框架,其性能由下游分类器评估。我们改编并改进此框架,加入了无监督提示细化步骤,并将其应用于远程医疗反馈。我们将发现的特征视为反事实推荐 (Jiang 等,2024 (https://arxiv.org/html/2606.18889#bib.bib63)) 的动作空间。 医疗中的沟通质量。临床医生的沟通影响患者依从性、健康结果以及患者对医生的评价 (Martin 等,2005 (https://arxiv.org/html/2606.18889#bib.bib6); Street Jr 等,2009 (https://arxiv.org/html/2606.18889#bib.bib8); Stergiopoulos 和 Martimianakis,2023 (https://arxiv.org/html/2606.18889#bib.bib50))。在远程医疗平台上,医生回复的语言特征与患者满意度相关 (Geng 等,2024 (https://arxiv.org/html/2606.18889#bib.bib59))。尽管LM在医疗中的应用日益增多 (Anthropic 团队,2026 (https://arxiv.org/html/2606.18889#bib.bib1)),面向患者的部署仍然困难:在LM辅助下的用户表现并不优于对照组 (Bean 等,2025 (https://arxiv.org/html/2606.18889#bib.bib78)),而被认为涉及AI的建议信任度较低 (Reis 等,2024 (https://arxiv.org/html/2606.18889#bib.bib68); Hohenstein 等,2023 (https://arxiv.org/html/2606.18889#bib.bib43))。这促使开发面向医生的辅助系统,让医生保持作者身份。 ## 3 方法 我们的流程包含五个阶段,如图1 (https://arxiv.org/html/2606.18889#S1.F1) 所示。首先,我们应用数据集级别的自动特征发现 (Cosma 等,2026 (https://arxiv.org/html/2606.18889#bib.bib100)) 来优化一组回复级语义特征,这些特征很可能对患者反馈具有预测性。每个特征描述医生回复中一个可变的沟通属性。然后,我们采用一种基于APO方法(如MIPRO)的提示细化流程 (Opsahl-Ong 等,2024 (https://arxiv.org/html/2606.18889#bib.bib67)),为每个特征优化专属的提取提示。这些提取器用序数语义特征值标注每对医患互动。 提取的语义特征与结构化的问答元数据一起,用于训练一个反馈估计器,预测正面患者反馈的概率。推理时,我们枚举回复语义表示的低成本正向变化,并选择在预测反馈改进和编辑工作量之间达到最佳折中的反事实。输出是一小组特征级推荐,描述哪些沟通方面应被改进。 考虑一位患者提问“我过去两周几乎每天都头痛。我该担心吗?”,医生回复“很可能是紧张性头痛。我建议咨询神经科医生”。该回复在医学上合理,但简短、缺乏个性且未提供具体指导。我们将在本节中使用此互动来说明流程的每个阶段;与之相关的所有数值仅为示意。 ### 3.1 问题定义 令 D=\{\(qi,ri,mi,yi\)\}i=1n\\mathcal\{D\}=\\\{\(q\_\{i\},r\_\{i\},m\_\{i\},y\_\{i\}\)\\\}\_\{i=1\}^\{n\} 为一个互动数据集,其中 qiq\_\{i\} 为患者问题,rir\_\{i\} 为医生回复,mim\_\{i\} 表示非文本元数据,yi∈\{0,1\}y\_\{i\}\\in\\\{0,1\\\} 指示该互动是否获得正面患者反馈。元数据可能包含回复时间、医生活动历史等变量,以及回复撰写时可获得的其他信息。 我们假设医生回复 rir\_\{i\} 可由一组可解释的语义特征 F=\{f1,...,fk\}\\mathcal\{F\}=\\\{f\_\{1\},\\ldots,f\_\{k\}\\\} 来表征,每个特征描述沟通风格的一个可变方面,例如同理心或可操作性。每个特征 fjf\_\{j\} 取自一个有序有限集 Rj=\{rj,1,...,rj,mj\}R\_\{j\}=\\\{r\_\{j,1\},\\ldots,r\_\{j,m\_\{j\}\}\\\},例如5点李克特量表,从“低”到“高”。 给定问答对 \(qi,ri\)\(q\_\{i\},r\_\{i\}\),一个ExtractorLM模块将互动映射为序数语义表示 si=E\(qi,ri;F\)∈R1×⋯×Rks\_\{i\}=E\(q\_\{i\},r\_\{i\};F\)\\in R\_\{1\}\\times\\cdots\\times R\_\{k\}。我们训练一个策略模型 π\\pi 来估计 π\(mi,si\)=P\(yi=1∣mi,si\)\\pi\(m\_\{i\},s\_\{i\}\)=P\(y\_\{i\}=1\\mid m\_\{i\},s\_\{i\}\),用于选择推荐。为在评估时减少自我确认偏差,我们独立训练审计模型 α1,...,αL\\alpha\_\{1\},\\ldots,\\alpha\_\{L\},它们不参与推荐选择。 ### 3.2 通过APO进行数据集级别特征发现 我们将 Cosma 等 (2026 (https://arxiv.org/html/2606.18889#bib.bib100)) 提出的数据集级别特征发现框架实例化到远程医疗反馈场景。在此公式化中,提示并不直接对每个输入产生预测,而是引入一个全局特征框架 Fφ=\{f1,...,fk\}\\mathcal\{F\}\_\{\\phi\}=\\\{f\_\{1\},\\ldots,f\_\{k\}\\\},其中 φ\\phi 表示提供给FeatureProposer的指令和示例上下文。与标准提示优化不同(标准优化中提示直接提升任务预测),φ\\phi 的质量仅通过间接方式确定:一个好的提示应产生这样的特征——其提取值能改善下游反馈预测,同时保持可解释性和可操作性。 给定训练语料的一个子集,我们优化一个FeatureProposerLM,以生成医生回复的候选语义特征。每个特征包括名称、有序值集和提取指令。我们在多种提示上下文(带反馈标签的示例、不带标签的示例以及有书面患者反馈时的示例)下运行FeatureProposer,手动合并不同运行中重复出现的特征,并移除冗余、临床不安全或不可操作的特征。所得特征定义了反事实推荐的动作空间。我们在附录A (https://arxiv.org/html/2606.18889#A1) 中展示了最终特征集;与之前的工作 Niculae 等 (2025 (https://arxiv.org/html/2606.18889#bib.bib87)) 不同,所选特征并非基于组织或监管需求定义(这对反馈预测可能不理想),而是直接针对正面反馈预测进行优化。 ### 3.3 无监督提示细化 初始的特征定义通常过于简洁,无法直接作为可靠的提取提示;同时,由于语义特征没有真值标签,我们无法针对提取准确性运行有监督的提示优化器。与 Cosma 等 (2026 (https://arxiv.org/html/2606.18889#bib.bib100)) 的原始公式(单个Extractor模块处理所有特征)不同,我们为每个特征 fjf\_\{j\} 实例化一个专门的Extractor模块 EjE\_\{j\}。 我们采用受MIPRO (Opsahl-Ong 等,2024 (https://arxiv.org/html/2606.18889#bib.bib67)) 的有理指令提议阶段启发的流程来细化每个提示,但省略了其迭代搜索阶段。对于每个特征,LM接收特征定义、序数值集、代表性的问答示例以及任务描述。它生成一个细化的提取提示,指定每个序数类别的含义、决策标准,并总结在示例中观察到的领域特定模式。我们发现细化能提高提取特征的可靠性。因此,每个特征拥有自己的提取器:Ej\(qi,ri;ψj\)→s^i,jE\_\{j\}\(q\_\{i\},r\_\{i\};\\psi\_\{j\}\)\\rightarrow\\hat\{s\}\_\{i,j\},其中 ψj\\psi\_\{j\} 是特征 fjf\_\{j\} 的细化提示。完整的语义表示通过应用所有特征特定的提取器获得:s^i=\(E1\(qi,ri;ψ1\),...,Ek\(qi,ri;ψk\)\)\\hat\{s\}\_\{i\}=\(E\_\{1\}\(q\_\{i\},r\_\{i\};\\psi\_\{1\}\),\\ldots,E\_\{k\}\(q\_\{i\},r\_\{i\};\\psi\_\{k\}\)\)。
相似文章
ConRub-Med:基于共识评分标准的开放医学问答强化学习
本文介绍了ConRub-Med,一种利用多个语言模型生成的共识评分标准来对开放医学问答进行奖励的强化学习方法,在包括HealthBench-Hard在内的多个基准上取得了最先进的结果。
G-CARL:面向患者医疗报告解读的接地检查清单对齐奖励学习
本文介绍了G-CARL,一个接地的检查清单对齐强化学习框架,用于面向患者的医疗报告解读,以及MMedReport基准,展示了在事实性和与患者需求对齐方面的改进。
引导语言模型更具同理心:通过人类与LLM协作生成文化敏感的心理健康建议
本文提出了RP-RCAF提示策略,用于在低资源语言中生成文化敏感的心理健康建议,并介绍了G-REFS评估框架,实验表明在多个LLM上均优于传统提示方法。
面向临床智能体的世界反馈:在FHIR环境中诊断强化学习
本文研究了在FHIR环境中为临床协议执行任务使用来自世界反馈的强化学习,识别了诸如高静默完成上限和零梯度任务等结构性障碍,并引入了具有更低上限的MedAgentBench-v3。它表明,由于这些障碍,纯强化学习表现不如基于规则的SFT,并提出了一种结合SFT+RL的方法。
MedRealMM:一个用于中国在线医疗咨询的现实世界多模态基准
MedRealMM是一个基于真实医患交互构建的新的多模态基准,用于评估大语言模型在在线医疗咨询中的下一响应生成能力,并配有临床评价标准。