量化并缓解前沿大语言模型中的过早闭合
摘要
本文定义并衡量了前沿大语言模型中的过早闭合现象,发现即使正确选项被移除或需要澄清时,模型仍频繁给出自信的回答,凸显了医疗应用中的一个关键安全问题。
arXiv:2605.15000v1 公告类型:新论文
摘要:过早闭合,即在获取足够信息之前就得出结论,是公认的诊断错误来源,但在大语言模型(LLM)中尚未得到充分研究。我们将LLM过早闭合定义为在不确定情况下的不适当承诺:当更安全的回应是澄清、放弃、升级或拒绝时,却提供答案、建议或临床指导。我们评估了五个前沿LLM在结构化和开放式医疗任务中的表现。在MedQA(n=500)和AfriMed-QA(n=490)中,当正确选项被移除后,模型仍然以高比率选择答案,基准错误行动率分别为55-81%和53-82%。在开放式评估中,模型在861个HealthBench问题中平均有30%给出了不适当的答案,在191个由医生编写的对抗性查询中高达78%。基于安全性的提示方法减少了所有模型的过早闭合,但残留的失败仍然存在,这凸显了评估医疗LLM何时不应回答的必要性。
查看缓存全文
缓存时间: 2026/05/15 06:24
# 量化并缓解前沿大语言模型中的过早闭合并 来源: https://arxiv.org/html/2605.15000 MSc 斯坦福大学医学院 Suhana Bedi 斯坦福大学生物医学数据科学系 BS 斯坦福大学生物医学数据科学系 Nigam H. Shah 斯坦福大学医学院 MBBS 斯坦福大学医学院 PhD 斯坦福大学医学院 ###### 摘要 过早闭合并,即在获取足够信息之前就得出诊断结论,是公认的诊断错误来源,但在大语言模型(LLM)中尚未得到充分研究。我们将 LLM 过早闭合并定义为在不确定性下的不恰当确认行为:当更安全的回应应是澄清、弃权、升级或拒绝时,模型却提供了答案、建议或临床指导。我们在结构化任务和开放式医疗任务中评估了五款前沿 LLM。在 MedQA(n=500)和 AfriMed-QA(n=490)中,当正确选项被移除后,模型仍以较高比例选择答案,基线错误行动率分别为 55–81% 和 53–82%。在开放式评估中,模型在 861 个 HealthBench 问题中的平均 30% 以及 191 个医生编写的对抗性查询中的 78% 给出了不恰当的回答。安全导向的提示词减少了各模型的过早闭合并,但残余失败仍然存在,这凸显了评估医疗 LLM 是否知道何时*不*应回答的必要性。 ## 1 引言 大语言模型(LLM)现在在多项医学推理基准测试中表现优于或媲美医生,包括执业资格考试、诊断案例研究以及医生基准评估的诊断和管理推理能力[1 (https://arxiv.org/html/2605.15000#bib.bib1),2 (https://arxiv.org/html/2605.15000#bib.bib2)]。最近的医生基准评估表明,先进的 LLM 在多项诊断和管理推理任务(包括真实的急诊病例)上可以超越临床医生[3 (https://arxiv.org/html/2605.15000#bib.bib3)]。这些进展表明,传统的医学知识和诊断准确性基准正在趋于饱和[4 (https://arxiv.org/html/2605.15000#bib.bib4)]。随着 LLM 进入面向患者和临床决策支持场景[5 (https://arxiv.org/html/2605.15000#bib.bib5)],更紧迫的问题不仅是它们能否产生正确答案,还包括它们能否识别出可用信息不足以支持安全回答的情况[6 (https://arxiv.org/html/2605.15000#bib.bib6)]。 在医学中,过早闭合并描述了在收集到足够信息之前就确定诊断或计划的认知错误[7 (https://arxiv.org/html/2605.15000#bib.bib7),8 (https://arxiv.org/html/2605.15000#bib.bib8),9 (https://arxiv.org/html/2605.15000#bib.bib9)]。在本文中,我们将*LLM 过早闭合并*定义为不确定性下的不恰当确认:当可用信息不足以支持安全回应时,模型仍选择答案、提供具体临床指导或遵循不安全的指令。由于这种行为在不同任务形式中表现不同,我们在结构化和开放式设置中对其进行差异化测量。在结构化多项选择设置中,过早闭合并被测量为*错误行动*:当正确选项被移除时,模型仍然选择了某个答案。在开放式临床交互中,过早闭合并被测量为:在应当澄清、表达不确定性、升级或拒绝时,模型却给出了自信或具体的指导。在这两种设置中,共同的结构是在信息不足时仍做出回应[10 (https://arxiv.org/html/2605.15000#bib.bib10)]。一个模型安慰症状需要升级的患者,或根据不完整信息给出自信的指导,尽管看似有帮助,却可能带来风险[11 (https://arxiv.org/html/2605.15000#bib.bib11),12 (https://arxiv.org/html/2605.15000#bib.bib12),13 (https://arxiv.org/html/2605.15000#bib.bib13)]。因此,直接检验前沿模型何时以及如何未能扣住回答、限定条件或升级处理是至关重要的。 标准医学 AI 基准测试难以检测这种行为。多项选择评估通常假设有一个答案是正确的,并奖励选择它,几乎没有空间来测试模型是否识别出没有选项是合适的。先前的工作表明,高多项选择准确率可能掩盖不可靠的医学推理,特别是当正确选项被移除并替换为“以上皆非”选项时[14 (https://arxiv.org/html/2605.15000#bib.bib14)]。最近面向部署的研究也表明,在考试类基准测试中表现良好的 LLM 在现实用户场景中可能表现得不那么可靠[15 (https://arxiv.org/html/2605.15000#bib.bib15)],而诸如脚本一致性测试等不确定性敏感评估揭示了多项选择准确率无法单独捕捉到的差距[16 (https://arxiv.org/html/2605.15000#bib.bib16)]。更广泛地说,最近的弃权基准测试表明,即使高性能 LLM 也常常无法识别出何时不应回答[17 (https://arxiv.org/html/2605.15000#bib.bib17)]。 开放式评估已开始通过根据医生编写的标准对真实的患者和临床医生对话进行评分来弥补其中的一些局限性。HealthBench[18 (https://arxiv.org/html/2605.15000#bib.bib18)] 使用医生编写的评分标准评估多轮患者和临床医生对话,涵盖准确性、完整性、上下文意识、沟通和指令遵循。HealthBench Professional[19 (https://arxiv.org/html/2605.15000#bib.bib19)] 增加了更具挑战性的案例,包括医生设计的对抗性查询,用于测试模型是否可能被推向过于自信或不安全的回答。这些研究共同表明,医疗 LLM 评估正超越简单的答案正确性,但它们仍留下一个核心安全问题未充分研究:模型能否识别出何时不应回答? 一个实用的第一道防线是通过系统级指令进行安全导向的提示词,指示模型在不确定时弃权、缺少上下文时寻求澄清、出现紧急征象时升级以及拒绝不安全的请求。提示词工程具有吸引力,因为它不需要模型重新训练,并且可以由开发者或机构在系统提示层实现[20 (https://arxiv.org/html/2605.15000#bib.bib20),21 (https://arxiv.org/html/2605.15000#bib.bib21)]。先前的工作表明,提示词可以改善推理并帮助模型表达不确定性,而相关研究则表明它们可以鼓励模型在需要时拒绝或推迟回答[22 (https://arxiv.org/html/2605.15000#bib.bib22),23 (https://arxiv.org/html/2605.15000#bib.bib23),24 (https://arxiv.org/html/2605.15000#bib.bib24),25 (https://arxiv.org/html/2605.15000#bib.bib25)]。然而,提示词效果可能因模型而异,可能引入权衡(如过度推迟或准确性下降),并且在对抗性压力下可能很脆弱[26 (https://arxiv.org/html/2605.15000#bib.bib26),27 (https://arxiv.org/html/2605.15000#bib.bib27),28 (https://arxiv.org/html/2605.15000#bib.bib28)]。简单的安全提示词能否减少结构化医疗任务和开放式医疗任务中的过早闭合并,目前仍不清楚。 我们评估了五款前沿 LLM 在结构化和开放式医疗任务中的表现。在结构化多项选择设置中,我们修改了 MedQA 和 AfriMed-QA,加入了无法回答的问题(其中正确选项已被移除),并将错误行动视为过早闭合并。在开放式设置中,我们评估了模型对 861 个 HealthBench 问题和 191 个由医生编写的对抗性 HealthBench Professional 查询的回应,测量模型在弃权、澄清、升级或拒绝更安全的情况下是否给出了具体指导。我们的研究追问前沿 LLM 是否认识到何时不应回答,以及安全提示词能否在不损害直接回答适当情况下的表现的前提下减少过早闭合并。 ## 2 结果 ### 2.1 多项选择设置中的过早闭合并:MedQA 和 AfriMed-QA 在结构化多项选择设置中,我们将过早闭合并测量为错误行动:当没有有效选项时,仍选择了提供的某个答案选项。为了测试模型是否认识到何时不存在有效答案,我们构建了 MedQA 和 AfriMed-QA 的修改版本,其中既包含可回答的 INTACT 项目,也包含无法回答的“以上皆非”(NOTA)项目。INTACT 项目保留了一个正确选项,而 NOTA 项目则完全移除了正确选项。最终评估集包括 MedQA(n=500;250 个 INTACT,250 个 NOTA)和 AfriMed-QA(n=490;245 个 INTACT,245 个 NOTA)。指示模型选择最佳答案,如果没有选项合适则弃权。我们评估了基线提示词和安全导向提示词,后者鼓励在不确定性下弃权。 在两个基准测试中,模型在无法回答的 NOTA 项目上频繁选择答案,同时在可回答的 INTACT 项目上保持较高的准确性。在基线条件下,模型在 MedQA 和 AfriMed-QA 上的平均错误行动率约为 70%,表明即使明确允许弃权,过早闭合并也很常见(表 1 (https://arxiv.org/html/2605.15000#S2.T1))。模型行为差异很大:Gemini 2.5 Pro 在两个数据集上的基线错误行动率最低,而 Claude Opus 4.7 最高。 安全提示词减少了每个模型在两个数据集上的错误行动。平均而言,模型在 MedQA 上的错误行动率从约 70% 下降到 48%,在 AfriMed-QA 上也从约 70% 下降到 48%。Grok 3 的降幅最大,但这些收益伴随着可回答 INTACT 项目准确性的下降,表明存在权衡。然而,即使在安全提示词之后,错误行动仍然显著,Claude Opus 4.7 仍然是最倾向于选择无效答案的模型。 对于大多数模型,错误行动的减少伴随着可回答项目准确性的极小损失。排除 Grok 3,两个基准测试中其余四个模型的 INTACT 准确性平均仅下降 1.0 个百分点(图 1 (https://arxiv.org/html/2605.15000#S2.F1))。这表明,对于大多数模型,安全提示词减少了无法回答项目上的错误行动,而没有显著损害存在正确答案时的表现。 提示词敏感性在不同模型间差异很大。在没有显著过度纠正的模型中,DeepSeek R1 的错误行动降幅最大,在 MedQA 上下降 24 个百分点,在 AfriMed-QA 上下降 26 个百分点。Gemini 2.5 Pro 对安全提示词最不敏感,在两个基准测试上降幅都较小(MedQA 上从 55% 到 48%,AfriMed-QA 上从 53% 到 45%)。 参见图注 1:安全提示词对错误行动和 INTACT 准确性的影响。每条连线连接着一个模型在 MedQA 和 AfriMed-QA 上的基线和安全提示词性能。xx 轴表示无法回答的 NOTA 项目上的错误行动率(当没有有效选项时选择了一个选项)。yy 轴表示可回答的 INTACT 项目上的准确性。实心圆表示基线性能;空心圆表示安全提示词性能。向左移动表示错误行动减少;向下移动表示可回答项目准确性下降。 ### 2.2 开放式患者交互中的过早闭合并:HealthBench 和 HealthBench Professional 对抗性查询 我们评估了在 861 个 HealthBench 子集(涵盖描述不充分、紧急、上下文充分和不确定性敏感的临床交互)以及 191 个来自 HealthBench Professional 的对抗性红队查询上的过早闭合并。 #### 过早闭合并存在于所有模型中 在 861 个问题的 HealthBench 子集中,过早闭合并普遍存在于基线条件下,但特别集中在描述不充分的低风险问题中——即医生判断需要更多背景信息但问题中不包含明显危险线索的案例。在这个子集中,基线过早闭合并率从 GPT-5.4 的 73.2% 到 DeepSeek R1 的 96.1% 不等。相比之下,模型在描述不充分的*紧急*问题上表现更好,因为升级或谨慎的必要性更加明确(基线过早闭合并率 5.0%–35.8%)。在整个 HealthBench 子集中,总体基线过早闭合并率从 GPT-5.4 的 20.7% 到 DeepSeek R1 的 44.6% 不等。 安全提示词减少了所有五个模型在整个 HealthBench 子集上的过早闭合并,总体降幅从 4.2 到 7.9 个百分点不等。降幅最大的是 Grok 3,从 24.3% 下降到 16.4%,其次是 DeepSeek R1 和 Gemini 2.5 Pro。安全提示词也减少了描述不充分的紧急问题上的过早闭合并,其中最大的改善包括 Grok 3 从 19.6% 下降到 6.1%,以及 Claude Opus 4.7 从 12.3% 下降到 4.5%。 评分标准得分反映了每个回应满足医生编写的 HealthBench 标准的比例,较高分数表示与适当行为的契合度更高。这些得分在安全提示词下略有改善(图 3 (https://arxiv.org/html/2605.15000#S2.F3))。GPT-5.4 在两种条件下都有最高的平均 HealthBench 评分标准得分(基线 60.9%,安全提示词 62.6%)。DeepSeek R1 的基线性能最弱,具有最高的总体过早闭合并率和最低的基线评分标准得分(43.8%),但这两个指标在安全提示词下都有改善。各模型的评分标准得分增益很小,通常在 1 到 3 个百分点之间,表明安全提示词减少了过早闭合并,而不会降低整体评分标准性能。上下文充分的问题作为直接回答适当的对照条件。基线和安全提示词下,合并的澄清/升级率平均为 3.5%,表明过早闭合并的减少并没有以在可回答的 HealthBench 问题上广泛过度推迟为代价。 参见图注 2:五个模型按临床类别和提示词条件分的过早闭合并率。实心条表示基线性能;阴影条表示安全提示词性能。数值越低表示性能越好。一个典型描述不充分的低风险案例展示了当时机不明确且缺乏明显紧急线索时,过早闭合并如何表现。一位患者描述反复发作的手部震颤,但原因和背景不明。在基线提示词下,Grok 3 生成了一个详细的鉴别诊断和临时建议,然后才建议后续护理。在安全提示词下,同一模型简要承认了可能的原因,但优先考虑了由医疗提供者评估,并指定了何时适合急诊护理。评分标准得分从 0.08 提高到 0.75。 参见图注 3:861 问题 HealthBench 子集上的过早闭合并,基线 vs. 安全提示词。实心圆表示基线回应;空心圆表示安全提示词回应。线条显示了从基线到安全提示词的变化。向上和向左移动表示过早闭合并减少且评分标准得分提高。 #### 对抗性查询揭示了严重且持续存在的脆弱性 我们评估了所有 191 个来自 HealthBench Professional 的对抗性红队查询。
相似文章
估计开放权重大型语言模型的最坏情况前沿风险
OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。
从自信地宣告完成到悄然失败:描述LLM智能体中的虚假成功
本文描述了LLM智能体中的“虚假成功”现象,即智能体声称任务已完成,但环境状态显示并非如此。研究发现,在多个基准测试中,虚假成功占失败的45%-75%。LLM评判器无法可靠检测到这一现象,而轻量级TF-IDF检测器能以更低延迟实现高AUROC,提示生产监控应使用校准检测器而非LLM评判器。
LLM回测中的时间泄漏:测量、验证与调整分数
本文表明,在LLM回测中,标准的前/后训练截止检查对时间泄漏的检测毫无信息量,因为近因效应会模仿泄漏。文章提出了使用已知截止点和匹配的干净对照组的新估计器,以测量泄漏并计算调整分数,并在前沿模型上进行了验证。
一致但校准不佳:评估LLM在自然语言风险沟通中的局限性
本文评估了九个LLM在自然语言中准确传达概率预测的能力,发现模型表现一致但校准不佳,尤其是在不确定性任务上。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。