大语言模型在代理式临床推理中的信息寻求失败
摘要
本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。
arXiv:2607.10275v1 公告类型:新
摘要:大语言模型在医学知识评估中取得了高分,但临床推理需要在不确定性下主动决定需调查哪些信息。我们为血液肿瘤学开发了一个代理式评估框架,模型必须在三个连续轮次中主动请求临床数据,然后才能确定诊断和治疗方案。在 32 个前沿模型中,最佳模型的整体准确率仅为 68%。信息利用率(实际请求的可用数据比例)是诊断准确率的最强预测因子(R = 0.69,P < 0.001),但在最后一轮中利用率从 57% 骤降至 26%,导致对治疗选择至关重要的分子和细胞遗传学数据未被检查。推理轨迹在临床推理评分标准上得分很高(91% 超过阈值),但与准确率不相关,揭示了局部连贯推理与全局正确结论之间的差距。错误分析发现,搜索满意化、锚定和过早闭合是主要的失败模式,这些正是双过程诊断推理模型中新手临床医生所具有的认知偏差。这些发现表明,当前模型在临床肿瘤学中的主要限制并非医学知识不足,而是在不确定性下信息寻求的系统性失败。
查看缓存全文
缓存时间: 2026/07/14 04:19
# 大语言模型在代理式临床推理中的信息搜寻失败 来源:https://arxiv.org/abs/2607.10275 作者:Krischan Braitsch (https://arxiv.org/search/cs?searchtype=author&query=Braitsch,+K),Laura K. Schmalbrock (https://arxiv.org/search/cs?searchtype=author&query=Schmalbrock,+L+K),Theresa Weltermann (https://arxiv.org/search/cs?searchtype=author&query=Weltermann,+T),Andrew F. Berdel (https://arxiv.org/search/cs?searchtype=author&query=Berdel,+A+F),Isabella Miller (https://arxiv.org/search/cs?searchtype=author&query=Miller,+I),Kai Tran (https://arxiv.org/search/cs?searchtype=author&query=Tran,+K),Michael Heider (https://arxiv.org/search/cs?searchtype=author&query=Heider,+M),Sabrina Kraus (https://arxiv.org/search/cs?searchtype=author&query=Kraus,+S),Florian Bassermann (https://arxiv.org/search/cs?searchtype=author&query=Bassermann,+F),Jacqueline Lammert (https://arxiv.org/search/cs?searchtype=author&query=Lammert,+J),Sebastian Ziegelmayer (https://arxiv.org/search/cs?searchtype=author&query=Ziegelmayer,+S),Marcus Makowski (https://arxiv.org/search/cs?searchtype=author&query=Makowski,+M),Lisa C. Adams (https://arxiv.org/search/cs?searchtype=author&query=Adams,+L+C),Keno K. Bressem (https://arxiv.org/search/cs?searchtype=author&query=Bressem,+K+K) 查看 PDF (https://arxiv.org/pdf/2607.10275) > 摘要:大语言模型在医学知识评估中取得了高分,但临床推理要求在不确定性下主动决定调查什么。我们开发了一个血液肿瘤学领域的代理式评估框架,模型必须在三个连续轮次中主动请求临床数据,然后才能做出诊断和治疗计划。在32个前沿模型中,最佳模型的总体准确率仅为68%。信息利用率(即实际请求的可用数据比例)是诊断准确率的最强预测因子(R = 0.69,P < 0.001),但利用率从第一轮的57%骤降至最后一轮的26%,导致对治疗选择至关重要的分子和细胞遗传学数据未被检查。推理轨迹在临床推理评估表中得分很高(91%超过阈值),但与准确率不相关,揭示了局部连贯的推理与全局正确结论之间的差距。错误分析确定了搜索满足、锚定和过早闭合是主要的失败模式,这些认知偏差与双重过程诊断推理模型下新手临床医生的特征相同。这些发现表明,当前模型在临床肿瘤学中的主要限制并非医学知识不足,而是在不确定性下系统性的信息搜寻失败。 ## 投稿历史 来自:Keno Bressem [查看邮件 (https://arxiv.org/show-email/0c212e4b/2607.10275)] **\[v1\]** 2026年7月11日星期六 12:10:33 UTC (2,783 KB)
相似文章
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
LLM 无法认知自身知识局限:通过临床表格数据上的跨模型归因差异检测认知盲点
本文探讨了大语言模型在结构化临床数据上无法识别自身知识局限的问题,提出了一种跨模型归因差异方法来检测认知盲点。该方法结合少样本示例和 SHAP 衍生的特征证据,无需训练即可改进校准性和准确性。