CLExEval:一种用于定性评估LLM临床推理的人机交互框架

arXiv cs.CL 论文

摘要

CLExEval 引入了一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理,揭示了 GPT-4o-mini 和 HuatuoGPT-o1 等模型中存在的失败模式,如冗长偏见、隐藏知识悖论以及推理与输出不匹配。

arXiv:2606.31608v1 公告类型:新 摘要:大语言模型(LLMs)在众多医学基准测试中取得了优异成绩,但其临床推理能力仍然难以可靠评估。一个核心风险是评价幻觉:即使最终诊断错误,流畅且结构良好的解释也可能在临床上显得令人信服。我们引入 CLExEval,这是一种人机交互框架,用于在渐进信息遮蔽条件下评估 LLM 临床推理。CLExEval 结合了 5,600 条专家医师注释和来自 40 个罕见诊断病例的 200 条临床推理轨迹。我们的分析识别出三种重复出现的失败模式:(i) 冗长偏见,其中 GPT-4o-mini 的诊断准确率在信息稀缺时从 95.0% 下降到 32.5%;(ii) 隐藏知识悖论,即一个专科模型达到 92.5% 的最大诊断潜力,但在冗长语境中无法可靠地检索该知识;(iii) 68.6% 的推理与输出不匹配,即正确诊断出现在推理轨迹中,但未在最终答案中体现。我们进一步在经人工验证的失败集(n = 142)上评估了“LLM 作为评审”范式。GPT-4o-mini 认可了 47.9% 的临床错误输出,而 HuatuoGPT-o1 认可了所有有效评分的失败,并表现出正向的自我偏好偏差。这些结果表明,如果没有基于专家的验证,独立的自动化临床评估可能会大幅高估临床可靠性。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:34

# 一种用于大语言模型临床推理定性评估的人机协同框架
来源:https://arxiv.org/html/2606.31608
Ajmal M.¹,² Abin Roy³,∗ Afthab Salam Kanniyan³,∗ Jawadh Abdul Kabeer³,∗ Jerin James³,∗ Preslav Nakov¹ Zhuohan Xie¹
¹MBZUAI ²印度理工学院马德拉斯分校 ③卡利卡特医学院
[email protected]
[email protected]
∗同等贡献。
项目 (https://24f2004489.github.io/CLExEval-Project-Page/)
RARECASE-2000 (https://huggingface.co/datasets/AjmalMIITM/RARECASE-2000)
代码 (https://github.com/24f2004489/CLExEval)

###### 摘要

大语言模型(LLMs)在许多医学基准测试中取得了显著成果,但其临床推理能力仍难以可靠评估。一个核心风险是**评估幻觉**:即使最终诊断是错误的,流畅且结构良好的解释也可能在临床层面显得令人信服。我们提出CLExEval,一个在渐进式信息遮蔽下评估LLM临床推理的人机协同框架。CLExEval将5600条专家医师标注与源自40个罕见诊断病例的200条临床推理轨迹相结合。我们的分析识别出三种反复出现的失败模式:(i) **冗余偏见**,在信息稀缺情况下,GPT-4o-mini的诊断准确率从95.0%骤降至32.5%;(ii) **隐藏知识悖论**,一个专科模型达到92.5%的最大诊断潜力,但在冗余上下文中无法可靠地检索该知识;(iii) **68.6%的推理-输出不匹配**,即正确的诊断出现在推理轨迹中,但未在最终答案中反映。我们进一步在一个人工验证的失败集(n=142)上评估了LLM作为评判者范式。GPT-4o-mini批准了47.9%的临床错误输出,而HuatuoGPT-o1批准了所有有效评分的失败,并表现出正向自我偏好偏差。这些结果表明,没有专家验证的独立自动化临床评估可能会严重高估临床可靠性。
![[无标题图像]](https://arxiv.org/html/2606.31608v1/robo.png)

CLExEval:一种用于大语言模型临床推理定性评估的人机协同框架
Ajmal M.¹,² Abin Roy³,∗ Afthab Salam Kanniyan³,∗ Jawadh Abdul Kabeer³,∗ Jerin James³,∗ Preslav Nakov¹ Zhuohan Xie¹
¹MBZUAI ²印度理工学院马德拉斯分校 ③卡利卡特医学院
[email protected]
[email protected]
∗同等贡献。
项目 (https://24f2004489.github.io/CLExEval-Project-Page/)
RARECASE-2000 (https://huggingface.co/datasets/AjmalMIITM/RARECASE-2000)
代码 (https://github.com/24f2004489/CLExEval)

参考图注
图1:一个临床病例中的推理-输出不匹配。HuatuoGPT-o1-8B的一个示例,其中推理轨迹包含幽门闭锁线索,但最终答案却判定为十二指肠闭锁。自动化评判者给予满分(1.00),而人类专家将诊断评为错误(0.00)。

## 1 引言

大语言模型(LLMs)在多项任务中展现了广泛能力,包括推理、生成以及特定领域应用(Zhao等人,2023 (https://arxiv.org/html/2606.31608#bib.bib50);Xie等人,2023 (https://arxiv.org/html/2606.31608#bib.bib51))。这些能力加速了将LLMs应用于临床工作流程的兴趣,促使大量评估医学推理的基准测试涌现,包括交互式测试(Chiu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib10))、结构化推理任务(Wang等人,2024 (https://arxiv.org/html/2606.31608#bib.bib11))以及动态信息寻求(Li等人,2024 (https://arxiv.org/html/2606.31608#bib.bib3))。为了扩大评估规模,近期工作越来越多地采用**LLM作为评判者**范式,依赖前沿模型来自动评分临床输出(Qiu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib12);Zhang等人,2025 (https://arxiv.org/html/2606.31608#bib.bib7))。

尽管取得了进展,当前的评估管线存在一个重要盲点:**评估幻觉**(Agrawal等人,2025 (https://arxiv.org/html/2606.31608#bib.bib2)),即自动化评判者可能会奖励流畅且结构良好的推理,尽管其临床有效性薄弱。如图1 (https://arxiv.org/html/2606.31608#S0.F1) 所示,为了模拟LLM作为评判者范式,自动化评估者被提供了明确的基本事实诊断以及模型的完整推理轨迹。由于推理显得自信且连贯,自动化评判者对临床错误的诊断给出了满分,而人类专家尽管呈现流畅,却识别出了诊断失败。除了这个问题,现有基准主要关注最终诊断准确性,但通常不解释推理为何失败——是由于知识缺失、检索不稳定,还是信息稀缺下决策错位,而这正是现实临床实践所固有的。

为了解决这些局限性,我们提出了CLExEval,一个在不确定性条件下评估临床推理的人机协同评估框架。CLExEval基于临床医生精挑细选的RARECASE-200基准,应用渐进式信息遮蔽(级别0-3)来模拟临床医生必须在信息不完整且不断演变的证据下进行推理的现实诊断场景。这种设计防止模型依赖表面线索,并能够对推理行为进行受控的压力测试。结合5600条专家标注,CLExEval提供了一个细粒度的视角,不仅评估模型是否失败,还评估失败的方式和原因。

利用这个框架,我们表明常见的评估实践可能会高估模型能力。在我们的共识失败集中,自动化评判者经常批准错误的临床推理,许多模型失败不仅源于知识缺失,还源于内部推理与最终输出之间的错位,以及对上下文的敏感性。我们的贡献如下:
(i) CLExEval,一个结合渐进式信息遮蔽与专家标注的人机协同框架,用于评估不确定性下的临床推理;
(ii) 评估幻觉 Δ=Communication−Precision 的形式化,以及独立LLM评判者的幻觉批准率(HAR)评估;
(iii) 使用ROM、ISS和MVR进行机制分析,以分离知识缺陷、推理-输出错位和上下文敏感性,表明模型可能包含相关的潜在知识,但在信息稀缺下无法可靠表达。

## 2 相关工作

| 工作/基准 | 任务类型 | 信息设置 | 评估信号 | 机制洞察 | 评估者 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| **静态医学问答与考试类基准** | | | | | |
| MedQA(Jin等人,2021 (https://arxiv.org/html/2606.31608#bib.bib8)) | 医学考试多选题 | 静态/完整 | 最终答案准确率 | 无;标准答案评分 | 自动 |
| MedMCQA(Pal等人,2022 (https://arxiv.org/html/2606.31608#bib.bib25)) | 多学科医学多选题 | 静态/完整 | 最终答案准确率 | 无;标准答案评分 | 自动 |
| MMLU 临床(Hendrycks等人,2021 (https://arxiv.org/html/2606.31608#bib.bib26)) | 广泛医学知识问答 | 静态/完整 | 最终答案准确率 | 无;标准答案评分 | 自动 |
| Chen等人(Chen等人,2025 (https://arxiv.org/html/2606.31608#bib.bib21)) | 挑战性医学问答+解释 | 静态/完整 | 多选题准确率+解释指标 | 解释质量,退化洞察有限 | 自动+有限人类 |
| **临床推理、不确定性与医生验证评估** | | | | | |
| Kanjee等人(Kanjee等人,2023 (https://arxiv.org/html/2606.31608#bib.bib22)) | NEJM诊断挑战 | 静态/完整 | 鉴别诊断质量 | 仅最终鉴别诊断 | 医生 |
| Cabral等人(Cabral等人,2024 (https://arxiv.org/html/2606.31608#bib.bib23)) | 顺序临床推理 | 信息积累 | R-IDEA推理评分 | 推理记录质量 | 医生 |
| McCoy等人(McCoy等人,2025 (https://arxiv.org/html/2606.31608#bib.bib24)) | 脚本一致性测试 | 添加新信息 | 临床医生一致性李科特更新 | 不确定性下的概率更新 | 专家小组 |
| Bhasuran等人(Bhasuran等人,2026 (https://arxiv.org/html/2606.31608#bib.bib19)) | 临床因果推理 | 静态/完整 | 最终答案+推理质量 | 因果推理层次 | 医学专家 |
| **EHR、智能体与自动化评估框架** | | | | | |
| MEDALIGN(Fleming等人,2024 (https://arxiv.org/html/2606.31608#bib.bib28)) | EHR指令遵循 | 静态EHR上下文 | 临床正确性/偏好 | 输出质量,非推理崩溃 | 临床医生 |
| MedAgentBench(Jiang等人,2025 (https://arxiv.org/html/2606.31608#bib.bib29)) | EHR智能体任务 | 交互式工具使用 | 最终API/动作成功 | 工具使用成功,非推理轨迹 | 基于规则 |
| MedR-Bench(Qiu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib12)) | 临床工作流程推理 | 阶段式交互 | 效率、事实性、完整性 | 推理步骤质量 | 智能体评估者 |
| HealthBench(Arora等人,2025 (https://arxiv.org/html/2606.31608#bib.bib14)) | 开放式健康对话 | 静态/多轮 | 医生编写的评分标准 | 临床有意义的回复质量 | 基于评分标准 |
| CARDBiomedBench(Bianchi等人,2026 (https://arxiv.org/html/2606.31608#bib.bib16)) | 生物医学研究问答 | 静态/完整 | RQR+弃权安全性 | 安全-准确率权衡 | 自动化评判者 |
| **CLExEval(本文)** | **罕见诊断推理轨迹** | **渐进式信息遮蔽** | **7维专家评分标准+评判者审计** | **ROM、ISS、MVR、HAR、退化Δ** | **人类小组,5600条标注** |

表1:CLExEval的定位。与先前的临床LLM基准不同,CLExEval结合了渐进式信息遮蔽与专家标注,以定位推理退化、推理-输出不匹配以及评判者对临床错误输出的批准。

### 2.1 临床任务设计的演变

静态医学问答基准,如MedQA(Jin等人,2021 (https://arxiv.org/html/2606.31608#bib.bib8))、MedMCQA(Pal等人,2022 (https://arxiv.org/html/2606.31608#bib.bib25))、MMLU临床子集(Hendrycks等人,2021 (https://arxiv.org/html/2606.31608#bib.bib26))、MedicationQA(Abacha等人,2019 (https://arxiv.org/html/2606.31608#bib.bib27))以及最近的执业考试评估,如中国NMLE研究(Wang等人,2026 (https://arxiv.org/html/2606.31608#bib.bib15)),使用信息完整的输入和固定答案键来测试医学知识。这些基准对于标准化比较很有用,但它们主要评估最终答案的选择或检索,而非开放式推理轨迹、基于证据的验证(Xie等人,2025b (https://arxiv.org/html/2606.31608#bib.bib52))、可验证的中间步骤(Xie等人,2025a (https://arxiv.org/html/2606.31608#bib.bib53))、诊断不确定性或信息缺失下的失败模式。Chen等人(2025 (https://arxiv.org/html/2606.31608#bib.bib21))通过JAMA临床挑战和Medbullets扩展了这一范式,为挑战性医学问答添加了专家编写的解释,但这些任务仍然是信息完整案例的静态评估。

后续工作转向临床推理和医生验证评估。临床研究使用医生判断评估了LLM在复杂诊断案例上的表现,包括NEJM临床病理会议案例(Kanjee等人,2023 (https://arxiv.org/html/2606.31608#bib.bib22))以及与主治医师和住院医师的R-IDEA比较(Cabral等人,2024 (https://arxiv.org/html/2606.31608#bib.bib23))。其他基准通过脚本一致性测试(McCoy等人,2025 (https://arxiv.org/html/2606.31608#bib.bib24))、因果实验室测试场景(Bhasuran等人,2026 (https://arxiv.org/html/2606.31608#bib.bib19))、动态口试(Chiu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib10))、主动信息寻求(Li等人,2024 (https://arxiv.org/html/2606.31608#bib.bib3))、对临床笔记的诊断推理(Wang等人,2024 (https://arxiv.org/html/2606.31608#bib.bib11))、EHR衍生问题(Zhang等人,2025 (https://arxiv.org/html/2606.31608#bib.bib7))、临床医生生成的EHR指令(Fleming等人,2024 (https://arxiv.org/html/2606.31608#bib.bib28))、虚拟EHR智能体任务(Jiang等人,2025 (https://arxiv.org/html/2606.31608#bib.bib29))以及顺序临床工作流程评估(Rao等人,2026 (https://arxiv.org/html/2606.31608#bib.bib17))来探究不确定性或交互。这些工作超越了简单的最终答案准确率,但它们通常评估静态案例、信息积累、工具使用成功或整体推理质量,而不是系统性地测量当诊断证据逐步移除时同一案例如何退化。

与先前的框架不同,CLExEval将四级渐进式信息遮蔽与5600点专家审计配对,能够进行案例内分析,判断失败源于知识缺失、信息稀缺下的不稳定性还是推理-输出不匹配。

### 2.2 评估与评判者幻觉

通过自动化指标或评判者模型进行可扩展评估伴随着自身的风险:流畅、结构良好的回复尽管临床有效性薄弱,却可能被过度奖励,Agrawal等人(2025 (https://arxiv.org/html/2606.31608#bib.bib2))将此模式称为评估幻觉。Arora等人(2025 (https://arxiv.org/html/2606.31608#bib.bib14))展示了医生编写的评分标准在开放式医疗评估中的价值,而相关工作记录了临床NLI中的知识-推理分离(Jullien等人,2025 (https://arxiv.org/html/2606.31608#bib.bib31))、跨NLP任务中LLM评判者一致性的巨大差异(Bavaresco等人,2025 (https://arxiv.org/html/2606.31608#bib.bib30))以及医学安全评判者与人类在复杂安全维度上的标注错位(Diekmann等人,2025 (https://arxiv.org/html/2606.31608#bib.bib32))。许多近期框架仍然依赖自动化指标或评判者模型来扩展评估,包括MedR-Bench(Qiu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib12))、LLMEval-Med(Zhang等人,2025 (https://arxiv.org/html/2606.31608#bib.bib7))和CARDBiomedBench(Bianchi等人,2026 (https://arxiv.org/html/2606.31608#bib.bib16))。此类判断可能与临床有效性相关性差,并掩盖有缺陷的推理行为(Sim和Chen,2025 (https://arxiv.org/html/2606.31608#bib.bib5);Bedi等人,2025 (https://arxiv.org/html/2606.31608#bib.bib4));例如,MedR-Bench显示,当关键推理步骤被省略时,性能会崩溃(Qiu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib12))。关于模式破坏(Bedi等人,2025 (https://arxiv.org/html/2606.31608#bib.bib4))和知识冲突(Wu等人,2025 (https://arxiv.org/html/2606.31608#bib.bib6))的研究进一步表明,当模型无法依赖表面线索时会退化。这些局限性共同促成了CLExEval:一个基于专家的框架,在相同的匹配诊断案例上进行压力测试、渐进式遮蔽、专家评分和评判者失败分析。

## 3 方法

我们提出CLExEval,一个人机协同评估框架,旨在评估信息稀缺下的临床推理。我们的方法结合了渐进式信息遮蔽与专家标注,不仅评估最终诊断准确性,还评估推理失败背后的机制。管线的概述如图2 (https://arxiv.org/html/2606.31608#S3.F2) 所示。

参考图注
图2:CLExEval管线概览,包括病例整理、渐进式信息遮蔽、模型评估和专家评估。

### 3.1 数据集

我们初步整理了500个病

相似文章

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。