评估大语言模型在多轮医疗对话中的误解纠正能力

arXiv cs.CL 论文

摘要

本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。

arXiv:2607.12884v1 公告类型:新 摘要:寻求医疗信息的患者经常提出包含错误假设或误解的问题。在这种情况下,安全的医疗沟通不仅需要回答问题,还需要识别并纠正潜在的错误信念。这种互动自然地在多轮对话中展开,这一模式现在也反映在与LLM的交互中。然而,当前的评估框架并未捕捉模型在这些场景中的行为——误解可能在对话过程中出现、持续或演变。LLM能否可靠地随时间纠正这类误解,在很大程度上仍未被研究。为此,我们引入了ThReadMed-QA,一个包含2,437条患者-医生对话线索(共8,204个问答对)的多轮医疗对话数据集,这些数据来自AskDocs上的真实患者互动。该数据集能够系统评估模型在多轮情境下检测和纠正误解的能力。我们使用基于评分标准的LLM-as-a-Judge框架评估了五种LLM,该框架根据模型识别和纠正误解的能力对响应进行评分。实验揭示了普遍模式:即使是能在单次交互中处理误解的前沿模型,在后续轮次中性能也显著下降。GPT-5和Claude-Haiku在初始问题中纠正这些错误预设的比例约为85%,但在两次追问内降至约50%。一项用医生回复替换模型先前输出的预言分析表明,性能下降很大程度上由错误传播驱动,即使在正确语境下,模型表现也并非完美。即使模型在初始阶段倾向于纠正误解,其性能在后续轮次中也会大幅下降,导致面向患者场景中出现不一致且可能不安全的指导,这凸显了需要能够捕捉多轮行为的评估框架。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:23

# 评估大语言模型在多轮医疗对话中的误解处理能力

来源:https://arxiv.org/html/2607.12884

\NameMonica Munnangi\[email protected] \addrKhoury College of Computer Sciences Northeastern University  
\NameSaiph Savage\[email protected] \addrKhoury College of Computer Sciences Northeastern University  

###### 摘要

患者在寻求医疗信息时,常常会提出包含错误假设或误解的问题。在这种情况下,安全的医疗沟通不仅需要回答问题,还需要识别并纠正潜在的错误信念。这些互动自然地在多轮对话中展开,这一模式如今也反映在用户与LLM的交互中。然而,当前的评估框架并未捕捉模型在这些情境中的行为——误解可能在对话过程中出现、持续或演变。LLM能否在持续对话中可靠地纠正此类误解,仍然研究不足。为研究这一问题,我们引入了ThReadMed-QA,这是一个包含2,437条医患对话线程(共8,204个问答对)的多轮医学对话数据集,数据来源于r/AskDocs上的真实患者交互。该数据集支持系统评估模型在多轮上下文中检测和纠正误解的能力。我们使用基于评分标准的LLM-as-a-Judge框架评估了五种最先进的LLM,根据其识别和纠正误解的能力对响应进行评分。实验揭示了一个一致的模式:即使是能够在单次交互中处理误解的前沿模型,在后续轮次中性能也显著下降。GPT-5和Claude-Haiku在初始问题上的误假纠正率约为85%,但在两次追问后下降至约50%。此外,GPT-4o下降更为剧烈,从65%降至21%,表明其在对话中无法维持安全的推理。一项最佳情况分析将先前的模型输出替换为医生响应,结果表明性能下降很大程度上源于误差传播,即使在正确上下文下性能也并非完美。这些发现揭示了LLM中一个关键的可信度缺口。即使模型倾向于在初始时纠正误解,其性能在后续轮次中仍显著下降,导致面向患者的场景中指导不一致且可能不安全,凸显了需要能够捕获多轮行为的评估框架。

## 1 引言

LLM正越来越多地被患者用作医疗信息来源,在传统临床环境之外提供了前所未有的医疗指导可及性(Costa-Gomes et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib9))。调查显示,相当一部分且不断增长的患者现在从LLM寻求健康建议,尤其是在临床护理获取受限的地区(Montero et al., 2026 (https://arxiv.org/html/2607.12884#bib.bib23))。在这些交互中,患者常常提出包含关于其病情、症状或治疗的错误假设或误解的问题(Srikanth et al., 2024 (https://arxiv.org/html/2607.12884#bib.bib39))。这些误解往往是隐含的,由不完整知识或先前信念所塑造。因此,安全的医疗沟通不仅需要回答问题,还需要识别并纠正潜在的错误信念,而不是接受原问题的前提。

表1:医疗QA数据集比较。我们的数据集ThReadMed-QA是首个包含患者撰写问题、自然追问以及经医生验证的响应的数据集。

此外,在临床实践中,医患互动本质上是对话式的,随着患者细化其担忧、引入新信息或重新解释先前的指导,对话在多轮中展开(Heritage and Maynard, 2006 (https://arxiv.org/html/2607.12884#bib.bib15))。这一模式日益体现在与LLM的交互中——用户进行迭代式对话而非孤立查询,且误解可能在对话的任何一点出现(图1 (https://arxiv.org/html/2607.12884#S1.F1))。然而,现有的评估框架并未评估模型在这些场景中的行为。早期的医疗QA数据集主要强调事实回忆和考试式推理。MedQA(Jin et al., 2020 (https://arxiv.org/html/2607.12884#bib.bib17))、MedMCQA(Pal et al., 2022 (https://arxiv.org/html/2607.12884#bib.bib30))和PubMedQA(Jin et al., 2019 (https://arxiv.org/html/2607.12884#bib.bib18))基于执业考试或生物医学文献构建,对真实患者交互的洞察有限(Raji et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib32); Agrawal et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib3))。尽管后来的数据集纳入了面向消费者的问题,包括预设(Sambara et al., 2026 (https://arxiv.org/html/2607.12884#bib.bib34); Zhu et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib43)),但它们仍然以孤立方式评估响应(Abacha et al., 2019 (https://arxiv.org/html/2607.12884#bib.bib2); Singhal et al., 2023a (https://arxiv.org/html/2607.12884#bib.bib37); Nguyen et al., 2023 (https://arxiv.org/html/2607.12884#bib.bib27))。最近的工作通过合成或对抗性追问来探索多轮鲁棒性,但并未捕捉真实患者就自身病情提出医疗问题时,误解如何在真实多轮交互中产生和演变(Manczak et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib22); Laban et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib21))。因此,一个关键问题仍未得到解答:LLM能否在患者撰写的多轮交互中可靠地识别并纠正患者的误解?

为解决这一问题,我们引入了ThReadMed-QA,这是一个基于r/AskDocs上真实医患交互的多轮医学对话数据集。该数据集包含2,437条对话线程,共8,204个问答对。与现有资源不同,ThReadMed-QA捕捉了真实患者迭代寻求医疗指导的过程,保留了各轮次中追问、澄清和不断演变的担忧的自然流程。如表1(https://arxiv.org/html/2607.12884#S1.T1)所示,它是首个在单一评估环境中结合患者撰写问题、多轮交互和医生验证响应的数据集。这种结构支持系统评估LLM是否能在初始接触时、以及在对话中误解出现、持续或演变时,识别并纠正它们。

我们评估了五种最先进的LLM在多轮对话中识别和纠正患者误解的能力。具体而言,我们评估模型能否检测患者问题中嵌入的错误假设,并在交互过程中适当地质疑或纠正它们。为实现可扩展的评估,我们采用了基于评分标准的LLM-as-a-Judge框架(经专家评估验证),对模型处理误解的有效性进行评分。我们的结果揭示了一个一致的失败模式:模型无法随时间可靠地维持这种行为,随着对话推进性能下降。这种不稳定性表明,LLM的误解纠正并非一项持久能力,而是在真实的多轮交互中会失效。

### 关于机器学习在医疗场景中的可推广见解

我们的研究突显了当前面向患者的医疗LLM评估中的一个重要空白。我们发现,识别和纠正患者误解的能力并非一种稳定能力,而是会随着交互在轮次间的推进而退化。这强调了评估模型在交互中误解产生和演变时如何处理误解的必要性。通过支持对真实患者撰写的问题和追问(包含医生响应)进行评估,ThReadMed-QA为研究模型在真实条件下的行为奠定了基础。除误解处理外,我们提出的设置还可支持评估交互中出现的其他安全关键行为。我们的发现表明,未来的基准测试和模型开发在评估面向患者的系统时必须明确考虑交互动态。为促进该方向的未来研究,我们发布了代码¹¹https://github.com/monicamunnangi/ThReadMed-QA-Misc 和数据集²²https://huggingface.co/datasets/monicamunnangi23/threadmed-qa。

图1:来自ThReadMed-QA的代表性对话线程。误解可能出现在对话早期(左图)或后续轮次(右图)。医生会纠正这些误解,并提供安全的答案,不论它们出现在何处。

## 2 相关工作

##### 医学QA数据集的演变

早期医学问答基准主要强调事实回忆和考试式推理。如MedQA(Jin et al., 2020 (https://arxiv.org/html/2607.12884#bib.bib17))、MedMCQA(Pal et al., 2022 (https://arxiv.org/html/2607.12884#bib.bib30))和PubMedQA(Jin et al., 2019 (https://arxiv.org/html/2607.12884#bib.bib18))等数据集基于医学执业考试或生物医学文献构建,能够对医学知识进行受控评估,但对真实患者交互的洞察有限(Raji et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib32); Agrawal et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib3))。后续工作通过纳入健康相关搜索查询和社区撰写的问题(包括Medication QA(Abacha et al., 2019 (https://arxiv.org/html/2607.12884#bib.bib2))和HealthSearchQA(Singhal et al., 2023a (https://arxiv.org/html/2607.12884#bib.bib37)))来更好地反映面向消费者的用例。还有一些数据集基于在线健康论坛、搜索日志和远程医疗咨询构建(Nguyen et al., 2023 (https://arxiv.org/html/2607.12884#bib.bib27); Abacha and Demner-Fushman, 2019 (https://arxiv.org/html/2607.12884#bib.bib1))。这些数据集提高了对非专业语言和消费者关切的覆盖,但仍主要通过单轮设置评估模型。据我们所知,ThReadMed-QA是首个包含患者撰写问题和追问的多轮医疗数据集。

##### 医学误解与LLM的奉承行为

包含误解的问题在语言学中早有研究(Kaplan, 1978 (https://arxiv.org/html/2607.12884#bib.bib20); Duží and Číhalová, 2015 (https://arxiv.org/html/2607.12884#bib.bib12)),适当的回应通常是质疑或否定错误的预设。然而,已知LLM会与用户保持一致,即使用户事实上错误(Perez et al., 2023 (https://arxiv.org/html/2607.12884#bib.bib31)),这种现象被称为奉承行为。在医疗背景下,这种倾向尤其令人担忧,因为错误假设可能涉及诊断、药物安全或症状严重程度。近期工作引入了数据集来探索一般领域(Yu et al., 2023 (https://arxiv.org/html/2607.12884#bib.bib42))和特定医疗场景(包括妊娠与母婴健康(Srikanth et al., 2024 (https://arxiv.org/html/2607.12884#bib.bib39))和癌症护理(Zhu et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib43)))中的误解处理。然而,大多数先前工作专注于单轮设置(Sambara et al., 2026 (https://arxiv.org/html/2607.12884#bib.bib34))或依赖合成生成的问题(Zhu et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib43)),缺乏患者特定语境,且低估了真实交互中误解隐含出现并随时间演变的难度。我们的数据集通过支持对真实多轮患者交互的评估来填补这一空白。

##### 医学中的多轮LLM交互

近期工作强调了医疗LLM评估方式与实际使用方式之间的脱节(Agrawal et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib3); Stanwyck et al., 2026 (https://arxiv.org/html/2607.12884#bib.bib40))。系统综述显示,大多数医疗LLM评估依赖合成或考试式数据,极少使用真实临床或患者生成的文本(Bedi et al., 2024 (https://arxiv.org/html/2607.12884#bib.bib5))。另一方面,研究报告LLM在单轮设置中具有接近临床医生的准确性(Singhal et al., 2023b (https://arxiv.org/html/2607.12884#bib.bib38)),但在转向多轮交互时性能急剧下降(Laban et al., 2025 (https://arxiv.org/html/2607.12884#bib.bib21))。误差传播也是先前在序列和对话系统研究中观察到的模式,表明早期模型输出可能影响后续预测,在交互中产生复合性失败(Chen et al., 2017 (https://arxiv.org/html/2607.12884#bib.bib8); Ranzato et al., 2016 (https://arxiv.org/html/2607.12884#bib.bib33))。在医疗场景中,这种脆弱性尤其令人担忧:在静态问题上表现胜任的模型,可能无法在对话推进过程中保持一致性、质疑错误前提或维护适当的安全指导。然而,Manczak et al.(2025 (https://arxiv.org/html/2607.12884#bib.bib22))在考试式多项选择题中采用了对抗性设置,并未模拟真实患者的信息寻求轨迹。我们的工作通过明确评估基于真实患者行为的医患多轮LLM交互来填补这一空白。

## 3 数据集

图2:数据集构建与筛选过程。我们选择了2015年1月至2023年6月期间r/AskDocs上的帖子,共计约180万条。经过预处理并保留原始发帖人与医生的线程后,我们得到最终集合,包含8,204个问答对,分布在2,437条对话线程中。

我们引入ThReadMed-QA,这是一个多轮医学对话数据集,源自r/AskDocs(一个Reddit社区,患者在此向医疗专业人士寻求建议)上的真实医患交互。与先前的QA数据集不同,ThReadMed-QA捕获了扩展的医患对话,其中患者提出追问以澄清、细化或质疑初步答案。

### 3.1 r/AskDocs

我们收集了子论坛r/AskDocs³³https://www.reddit.com/r/AskDocs/的数据,这是一个在线论坛,非专业用户在此向医生和医疗专业人士组成的社区寻求医学建议。在此环境中,用户发布其症状、病史和担忧的详细描述,并可能随着对话发展提出追问。回复通常由社区验证的医疗专业人员提供,其资质由子论坛版主审核,并通过用户标签(例如“physician”、“doctor”)标示。这种结构实现了基于真实临床沟通的多轮医患对话,其中初始问题常通过后续互动得到细化或扩展。该论坛强制执行结构化发帖指南,鼓励用户包含相关人口统计学和临床背景信息,从而产生详细且一致的患者描述。

相似文章

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。

长期历史感知的医疗对话合成与评估

arXiv cs.CL

本文介绍了一种利用大语言模型(LLMs)合成长期医疗对话数据集的框架,并创建了 MediLongChat,包含三个基准任务,用于评估医疗智能体的记忆与推理能力。实验表明,即使是最先进的 LLMs 也难以完成这些任务。

MedAction:迈向主动式多轮临床诊断大语言模型

arXiv cs.CL

本文介绍了 MedAction 框架,该框架通过模拟迭代式的检查开具与假设更新,训练大语言模型(LLM)进行主动的多轮临床诊断。文章提出了一个新的数据集 MedAction-32K,并展示了开源模型在医学基准测试上的最先进水平(SOTA)性能。