大语言模型在代理式临床推理中的信息寻求失败

arXiv cs.AI 论文

摘要

本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。

arXiv:2607.10275v1 公告类型:新 摘要:大语言模型在医学知识评估中取得了高分,但临床推理需要在不确定性下主动决定需调查哪些信息。我们为血液肿瘤学开发了一个代理式评估框架,模型必须在三个连续轮次中主动请求临床数据,然后才能确定诊断和治疗方案。在 32 个前沿模型中,最佳模型的整体准确率仅为 68%。信息利用率(实际请求的可用数据比例)是诊断准确率的最强预测因子(R = 0.69,P < 0.001),但在最后一轮中利用率从 57% 骤降至 26%,导致对治疗选择至关重要的分子和细胞遗传学数据未被检查。推理轨迹在临床推理评分标准上得分很高(91% 超过阈值),但与准确率不相关,揭示了局部连贯推理与全局正确结论之间的差距。错误分析发现,搜索满意化、锚定和过早闭合是主要的失败模式,这些正是双过程诊断推理模型中新手临床医生所具有的认知偏差。这些发现表明,当前模型在临床肿瘤学中的主要限制并非医学知识不足,而是在不确定性下信息寻求的系统性失败。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:19

# 大语言模型在代理式临床推理中的信息搜寻失败
来源:https://arxiv.org/abs/2607.10275
作者:Krischan Braitsch (https://arxiv.org/search/cs?searchtype=author&query=Braitsch,+K),Laura K. Schmalbrock (https://arxiv.org/search/cs?searchtype=author&query=Schmalbrock,+L+K),Theresa Weltermann (https://arxiv.org/search/cs?searchtype=author&query=Weltermann,+T),Andrew F. Berdel (https://arxiv.org/search/cs?searchtype=author&query=Berdel,+A+F),Isabella Miller (https://arxiv.org/search/cs?searchtype=author&query=Miller,+I),Kai Tran (https://arxiv.org/search/cs?searchtype=author&query=Tran,+K),Michael Heider (https://arxiv.org/search/cs?searchtype=author&query=Heider,+M),Sabrina Kraus (https://arxiv.org/search/cs?searchtype=author&query=Kraus,+S),Florian Bassermann (https://arxiv.org/search/cs?searchtype=author&query=Bassermann,+F),Jacqueline Lammert (https://arxiv.org/search/cs?searchtype=author&query=Lammert,+J),Sebastian Ziegelmayer (https://arxiv.org/search/cs?searchtype=author&query=Ziegelmayer,+S),Marcus Makowski (https://arxiv.org/search/cs?searchtype=author&query=Makowski,+M),Lisa C. Adams (https://arxiv.org/search/cs?searchtype=author&query=Adams,+L+C),Keno K. Bressem (https://arxiv.org/search/cs?searchtype=author&query=Bressem,+K+K)

查看 PDF (https://arxiv.org/pdf/2607.10275)

> 摘要:大语言模型在医学知识评估中取得了高分,但临床推理要求在不确定性下主动决定调查什么。我们开发了一个血液肿瘤学领域的代理式评估框架,模型必须在三个连续轮次中主动请求临床数据,然后才能做出诊断和治疗计划。在32个前沿模型中,最佳模型的总体准确率仅为68%。信息利用率(即实际请求的可用数据比例)是诊断准确率的最强预测因子(R = 0.69,P < 0.001),但利用率从第一轮的57%骤降至最后一轮的26%,导致对治疗选择至关重要的分子和细胞遗传学数据未被检查。推理轨迹在临床推理评估表中得分很高(91%超过阈值),但与准确率不相关,揭示了局部连贯的推理与全局正确结论之间的差距。错误分析确定了搜索满足、锚定和过早闭合是主要的失败模式,这些认知偏差与双重过程诊断推理模型下新手临床医生的特征相同。这些发现表明,当前模型在临床肿瘤学中的主要限制并非医学知识不足,而是在不确定性下系统性的信息搜寻失败。

## 投稿历史

来自:Keno Bressem [查看邮件 (https://arxiv.org/show-email/0c212e4b/2607.10275)] **\[v1\]** 2026年7月11日星期六 12:10:33 UTC (2,783 KB)

相似文章

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。