前沿大语言模型在遵循指南和基于具体病例的肿瘤决策制定中的集体能力边界

arXiv cs.AI 论文

摘要

本文介绍了肿瘤决策边界基准,并评估了九个前沿大语言模型,发现在遵循指南的肿瘤决策制定中存在系统性盲区,表明单个模型不能作为临床决策的唯一依据。

arXiv:2608.28592v1 公告类型:新 摘要:大语言模型在医学知识考试中取得高分,但现实世界的肿瘤学并非知识测试——它是一系列指南路径选择、在不确定性下的升级判断和承诺。现有基准主要衡量事实召回,留下前沿大语言模型是否共享决策路径盲区的问题,而组合模型无法修复。我们构建了肿瘤决策边界基准(ODBB)——涵盖NCCN指南和结直肠癌病例的2,005个肿瘤决策点——并评估了九个前沿大语言模型(四个闭源,五个开源权重系列),发布于2025年6月至2026年4月之间。一个完全确定性的评分器(零LLM推理)将输出分类为14种失败类型,由两名肿瘤科医生独立验证(Cohen's加权$\kappa$ = 0.939和0.790),基于225项分层样本。将这九个模型视为一个合并的超级模型,42.1%(Wilson 95% CI 40.0--44.3%)的所有项目——35.7%的1,586个NCCN项目和66.4%的419个结直肠癌病例——没有被任何一个模型正确回答,失败集中在在推理之前选择指南路径:临床元判断中的一致盲区,可能需要架构干预而非更多训练数据。两个调整为决断力的模型(GPT-5.5, Gemini 3.1 Pro Preview)做出不安全承诺的频率是七个谨慎模型的三到五倍,而得分没有更高。在3--9%的项目中,模型陈述了正确的下一步临床步骤但未承诺——决策失败,而非知识失败。模型质量不再是临床LLM部署的主要瓶颈;绑定约束是假设任何单个模型都可以作为临床决策的唯一基础。进展需要能够检测模型何时达到其能力边界并将决策路由给临床医生的架构。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:24

# 前沿大语言模型在遵循指南与基于病例的肿瘤学决策中的集体能力边界

来源:https://arxiv.org/html/2608.28592 \\equalconttrue \\equalconttrue \\equalconttrue \[5\]\\fnmZhiwei\\surBao \[1\]\\fnmYoSean\\surWang 1\]\\orgdiv数字医学研究所,\\orgname香港城市大学,\\orgaddress\\city香港特别行政区,\\country中国 2\]\\orgdiv肿瘤内科,\\orgname复旦大学附属肿瘤医院,\\orgaddress\\city上海,\\country中国 3\]\\orgdiv结直肠外科,\\orgname复旦大学附属肿瘤医院,\\orgaddress\\city上海,\\country中国 4\]\\orgdiv消化内科,\\orgname西湖大学医学院附属杭州市第一人民医院,\\orgaddress\\city杭州,\\state浙江,\\country中国 5\]\\orgdiv生物医学工程与仪器科学学院,教育部生物医学工程重点实验室,\\orgname浙江大学,\\orgaddress\\city杭州,\\country中国 6\]\\orgname绍兴职业技术学院,\\orgaddress\\city绍兴,\\state浙江,\\country中国

###### 摘要
大型语言模型(LLMs)在医学知识测试中取得了令人印象深刻的成绩,然而真实的肿瘤学实践并非知识测试——它是一系列基于指南路径的选择、升级判断以及在不确定性下的承诺。现有基准测试大多衡量孤立问题上的事实记忆能力,但前沿LLM在临床决策路径推理中是否存在系统性盲点,以及模型组合能否弥补这些盲点,仍有待验证。我们构建了肿瘤决策边界基准(ODBB)——包含基于NCCN指南和结直肠癌病例的2,005个肿瘤决策点——并评估了2025年6月至2026年4月期间发布的9个前沿LLM(4个闭源模型,5个开源权重系列)。一个完全确定性的评分器(无LLM推理)将输出分为14种失败类型,并由两名肿瘤学家独立验证(两名评审者的加权κ系数分别为0.939和0.790;95%自助置信区间分别为[0.870, 0.985]和[0.671, 0.892],基于225个分层样本)。将这9个模型视为一个池化的超级模型,42.1%(Wilson 95%置信区间 40.0%–44.3%)的题目——包括1,586个NCCN指南题目中的35.7%和419个结直肠癌病例题目中的66.4%——没有任何一个模型答对。失败集中在需要首先在指南路径之间进行选择的任务上,然后才能在任何一条路径内进行推理,这表明该模型群体在临床*元判断*上存在一致盲点,可能需要架构层面的干预而非仅依赖更多训练数据。两个为决断力而调优的模型(GPT-5.5,Gemini 3.1 Pro Preview)做出不安全承诺的频率是七个谨慎模型的三到五倍,但总体得分并未更高——在我们的样本中,智能体调优并未带来一致的净收益提升。在3%到9%的题目中,模型在推理中阐明了正确的临床后续步骤,却未将其作为最终答案——这是决策失误,而非知识缺口。模型质量已不再是临床LLM部署的主要瓶颈。主要制约因素是当前普遍的假设:即任何单一模型都可以作为临床决策的唯一基础。进展需要部署架构能够检测模型何时达到其能力边界,并将决策转交给人类临床医生。

###### 关键词:大型语言模型;临床决策支持;肿瘤学;基准测试;NCCN指南;患者安全

## 1 引言
大型语言模型在医学知识测试中的快速进步引发了人们对其临床应用价值的广泛乐观。模型现在经常在美国医师资格考试风格评估中超过及格线,并在精心构建的题库(如MedQA、MultiMedQA和鉴别诊断基准)上取得高准确率\[mcduff2023medbench,singhal2023medpalm,singhal2025medpalm2,nori2023gpt4,kung2023chatgpt,jin2021medqa,jin2019pubmedqa,hendrycks2021mmlu,lievin2024medqa\]。这些结果被广泛解读为LLM正在接近——或已经达到——临床级别推理能力的证据\[thirunavukarasu2023llmmedicine,clusmann2023llmclinical,saab2024medgemini\]。这种解读基于一个隐含假设:在知识检索基准上的高分可以转化为在构成实际临床实践的决策路径导航任务上的可靠表现\[topol2019highperformance\]。

在肿瘤学中,治疗医生不仅仅是回忆事实;他们需要确定适用的指南路径,识别决策前缺失的信息,认识到患者何时应被转到替代管理轨道,并区分允许采取行动的情况与需要克制的情况。这些任务不仅需要领域知识,还需要元决策能力——即在推理之前判断应应用何种推理框架的能力\[croskerry2009clinical,kahneman2011thinking\]。

现有的临床LLM评估存在三个显著差距。首先,大多数基准测试评估的是事实记忆而非决策路径导航,少数尝试临床情景的基准通常依赖由LLM作为评委的开放式小插曲评分,这引入了可重复性问题和自我评估偏差\[zheng2023judging,agrawal2025evaluation,chang2024survey\]。其次,安全相关的失败模式——如过早承诺治疗、推荐禁忌方案、未能请求缺失信息——很少被细分;一个自信地给出错误但看似合理答案的模型,与一个犯下临床危险错误的模型,被赋予了相同的“错误”标签\[ji2023hallucination,pal2023medhalt\]。第三,此前没有工作系统性地描述过前沿LLM在临床推理中是否存在*集体*盲点:即整个模型类别都失败的领域,以及在集成中增加更多模型几乎无法改善表现的领域。

在本研究中,我们提出了一个不同于传统“哪个LLM表现最好”的问题。我们问的是:*当前前沿LLM在临床决策中的集体能力边界在哪里?这个边界由什么构成?模型多样性能否突破它?*

为回答此问题,我们构建了肿瘤决策边界基准(ODBB),包含两个互补轨道上的2,005个临床决策点:1,586个源自NCCN肿瘤指南的结构化指南导航题目,以及419个源自已发表结直肠癌病例报告的基于病例的治疗题目。所有题目由一个完全确定性的评估管道进行评分,并带有14种失败类型标签。我们评估了涵盖四个闭源和五个开源权重系列的9个前沿LLM。我们的贡献有三点:

1. 1\.一个可自动重新生成的肿瘤决策基准。ODBB不仅作为2,005项评估数据集发布,还作为一个开源生成管道,能够摄取NCCN指南工作区,并生成涵盖六种临床动机问题类型的结构化决策题目。当NCCN发布新指南版本时,社区可以在一次运行中重新生成一个全新的基准,避免了以往临床LLM评估因内容过时而导致的生命周期缩短问题。

2. 2\.一个经过临床医生验证的确定性评分器。我们构建了一个完全确定性的评分引擎(零LLM推理),包含14种失败类型标签,然后在一个225个题目的分层样本上,由两名独立肿瘤学家验证了其判断(加权κ=0.790–0.939)。与LLM作为评委的管道不同,该评分器是逐位可重复的,消除了自我评估偏差,并且现在拥有来自执业临床医生的实证可靠性证据——而不仅仅是内部一致性。

3. 3\.四项重新定义如何解读前沿LLM评估的发现。(a)即使合并所有9个模型,仍有42%的题目未被解决,表明该模型群体存在一致的能力边界,无法通过增加更多此类系列模型来突破。(b)这些失败集中在需要在任何路径内推理之前选择指南路径的任务上——这是临床*元判断*上的盲点,而非知识盲点。(c)为决断力调优的模型做出不安全承诺的频率是其他模型的三到五倍,但总体得分并未更高,这与智能体行为是“免费升级”的假设相矛盾。(d)在3%到9%的题目中,模型在推理中阐明了正确的后续步骤,却未能将其作为最终答案——这是决策失误,而非知识缺口。

## 2 方法
### 2.1 研究设计概述
这是一项基准测试引入研究,评估9个前沿大型语言模型在肿瘤临床决策方面的表现。方法学包含五个组成部分,将在以下小节中依次描述:(i)肿瘤决策边界基准(ODBB)本身(§2.2 (https://arxiv.org/html/2608.28592#S2.SS2)),包含通过自动化、完全可重复管道生成的两个互补轨道上的2,005个可评分题目——NCCN结构化决策题目和CRC病例治疗推荐;(ii)一个具有14种失败类型标签的完全确定性评分器(§2.3 (https://arxiv.org/html/2608.28592#S2.SS3)),旨在消除LLM作为评委管道固有的自我评估循环;(iii)9个评估的前沿LLM,涵盖2025年12月至2026年4月发布的闭源和开源权重模型系列(§2.4 (https://arxiv.org/html/2608.28592#S2.SS4));(iv)由委员会认证肿瘤学家进行的两轮临床医生裁决(§2.5 (https://arxiv.org/html/2608.28592#S2.SS5)),为核心能力边界所依据的题目提供评分器判断和金标准答案有效性的可靠性证据;(v)使用自助置信区间、用于层级分离的排列检验和用于比例的Wilson得分区间的统计分析(§2.6 (https://arxiv.org/html/2608.28592#S2.SS6))。所有数据集、评分器源码、原始模型输出和裁决数据均根据手稿的数据可用性和代码可用性声明公开发布。

### 2.2 基准构成
#### 概述。ODBB由两个互补的题目轨道组成,共包含2,005个可评分的临床决策点。第一个轨道包含1,586个结构化决策题目,源自69个NCCN癌症类型指南工作区(快照冻结于2026年3月)\[nccn2025guidelines\],涵盖实体瘤和血液恶性肿瘤管理的全部范围。每个题目在指南路径的特定决策节点呈现一个临床情景,要求模型确定适当的下一步管理措施。第二个轨道包含419个基于结直肠癌(CRC)病例的题目,源自已发表的病例报告,需要特定的治疗建议,并与结构化的金标准治疗方案进行评估。所有金标准答案和题目内容都经过SHA-256哈希锁定以确保可重复性。

#### 自动化生成管道。题目由一个八阶段的自动化管道生成,该管道摄取原始的NCCN PDF文件,并输出结构化、经过模式验证的决策题目。五个阶段使用单个辅助LLM(豆包Seed 2.0 Pro,字节跳动Seed)\[doubaoSeed2pro\]进行语义判断(逐页分类、锚点-证据链接判断、局部子图草拟、癌症特异性槽位发现、题目策略编写);三个阶段执行确定性结构组装(锚点池化和树种材料化、带有四种类型注册表构建的全局图合并、带有临床一致性审计的结构化题目JSON生成)。所有阶段都生成带有明确失效矩阵的SHA-256哈希锁定制品,并且NCCN指南更新会触发整个管道的重新运行,无需手动编写。管道架构如图1 (https://arxiv.org/html/2608.28592#S3.F1)所示(§3.1 (https://arxiv.org/html/2608.28592#S3.SS1)),其中描述了各个阶段的职责。

#### 问题类型设计。题目涵盖六种临床动机的问题类型,对应肿瘤实践中遇到的不同决策风味。*平行选项消歧*(n=920)是主要任务:在指南节点上,当两个或更多允许的治疗选择并存时,模型必须为患者的特定情况选择适当的选项(例如,在III期结肠癌辅助化疗节点,NCCN允许FOLFOX和CAPOX;在两者之间选择取决于患者的合并症、奥沙利铂耐受性和治疗持续时间偏好)。*缺失信息请求*(n=348)题目要求模型认识到可用的患者信息不足以做出承诺,并请求具体的缺失变量,而不是猜测(例如,RAS/BRAF状态未指明的转移性结直肠癌患者需要在EGFR靶向治疗建议前进行分子谱分析)。*指南内转接*(n=136)题目要求模型将患者转到同一NCCN指南内的不同管理部分(例如,发生脑转移的乳腺癌患者必须从全身治疗转到中枢神经系统转移管理)。*上游路径选择决策*(n=110)题目要求模型在进入任何一条路径推理*之前*选择正确的指南路径;这是前沿LLM最一致失败的元判断形式(§3.3 (https://arxiv.org/html/2608.28592#S3.SS3);例如,患有代偿性肝硬化的肝细胞癌患者必须首先根据巴塞罗那临床肝癌分期被引导至切除/移植/全身治疗分支)。*证据解析请求*(n=69)题目呈现与多个指南路径一致的临床情况,要求模型识别消歧所需的具体额外证据(例如,前哨淋巴结活检阳性的黑色素瘤患者可能进入观察或辅助免疫治疗,必须指定选择所需的证据)。*单一路径决策*(n=3)题目是特例,在给定节点上指南仅支持一种管理途径;为完整性而包含。问题类型由底层路径图拓扑结构和槽位解析状态确定性决定,而非通过自由形式编写。

#### 两个互补轨道的原理。这两个轨道对应于两种性质不同的认知任务:NCCN轨道类似于专科委员会考试(根据*规范性*金标准——指南规定应做什么——进行单步决策),而CRC病例轨道类似于病例讨论会(根据*描述性*金标准——治疗医生实际做了什么——进行整体推理)。在单个基准中结合两者,旨在沿着两个正交轴——“对指南框架的掌握”和“对真实病例叙述的推理能力”——对LLM进行压力测试,其前提是仅在一个轨道上表现充分并不能确立临床准备性。具体而言:NCCN轨道测试在结构化决策节点上的指南掌握情况(给定指南定义的患者状态,模型承诺下一步的路径步骤),而CRC病例轨道测试自由文本病例解释(从叙述性病例报告中提取关键临床事实——分期、分子谱、既往治疗线数、合并症——整合它们,并推荐特定的治疗方案)。除了模型能否匹配指南或病例的机械性问题之外,

相似文章

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。