在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性
摘要
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。
arXiv:2607.18828v1 公告类型:新发布
摘要:医疗人工智能的就绪性压力测试此前主要集中于封闭式及多模态基准测试。本文将其扩展到信息缺失场景下的开放式临床对话。在此场景中,安全行为意味着识别缺失信息并加以限定、澄清或不作过度承诺——此时评估者本身也成为测量的一部分。我们对四个模型进行压力测试——三款旗舰模型(Claude Opus 4.8、GPT-5.5、Grok 4.3)及一款中端模型(Gemini 3.5 Flash)——方法是在HealthBench对话中删除用户最后一轮对话的后半部分,并使用一个四评审者LLM评审小组和一个盲法、以临床医生为锚点的参考标准对响应进行评分。两个与评估者相关的结果是稳健的。第一,评审者的选择会显著改变表观安全性:评审者间一致性仅为中等(Fleiss' kappa = 0.65),且在调整每位评审者的总体宽松度(投票级逻辑回归)后,存在正向的同源评审者关联(精确置换检验p = 0.04;GPT-5.5在概率尺度上约+0.10)——其影响足以在排除其自身同源评审者后改变哪个模型看起来过度承诺最少。第二,在盲法50项子样本中,LLM评审者比临床医生更为宽松:所有四个LLM评审者均比更严格的独立临床医生显著宽松(在66-84%的项目上认可适当不确定性,而临床医生为52%),且四个中的三个比受作者影响的共识更宽松(Grok仅方向性;评审者与共识的kappa = 0.20-0.43)。在经作者审计的临床欠定子集上,宽松度差距扩大,且点估计的模型排序保持不变。封闭式MedQA锚点证实,四个模型中的三个准确率较高且选项顺序效应在±5分的等效范围内,因此安全性差距在于校准而非知识。我们发布了测试框架、提示词、逐项输出、评审小组、扰动审计及人工标注协议。
查看缓存全文
缓存时间: 2026/07/22 08:22
# 缺失信息下的医疗AI评估:同提供商评委与人类评定者改变表面安全性 来源:https://arxiv.org/html/2607.18828 *关于前沿模型在开放式医疗对话中的缺失信息压力测试,采用跨提供商LLM评委与临床医生锚定效度分析* Koyar Afrasyab, M.D.¹ 通讯作者:Koyar Afrasyab,Kinvectum AB,瑞典。邮箱:[email protected] ### 摘要 医疗AI的 readiness 压力测试主要聚焦于封闭式和多模态基准。我们将其扩展到缺失信息下的开放式临床对话,其中安全行为意味着识别缺失信息,并加以限定、澄清或不过度承诺——而*评估者*本身也成为测量的一部分。我们对四个模型进行压力测试——三个旗舰模型(Claude Opus 4.8、GPT-5.5、Grok 4.3)和一个中端模型(Gemini 3.5 Flash)——通过删除 HealthBench 对话中最终用户轮次的后半部分,并使用一个四提供商 LLM 评委小组和一个盲法临床医生锚定参考对回复进行评分。两个面向评估者的结果是稳健的。首先,**评委选择会显著改变表面安全性**:评委间一致性仅为中等(Fleiss' κ = 0.65),在调整各评委的一般宽容度(投票级逻辑回归)后,仍存在正向的同提供商关联(精确排列 p = 0.04;GPT-5.5 在概率尺度上约 +0.10)——足以在排除其自有提供商评委后改变哪个模型似乎过度承诺最少。其次,**LLM 评委比临床医生更宽容**:在盲法 50 项子样本中,所有四个评委均显著比更严格的独立临床医生更宽容(在 66–84% 的项目上认可适当的不确定性,而临床医生为 52%),四个评委中有三个比受作者影响的共识更宽容(仅 Grok 呈方向性;评委 vs 共识的 κ = 0.20–0.43)。在作者审核的临床欠确定子集中,宽容差距扩大,点估计模型排序保持不变。封闭式 MedQA 锚定证实准确性很高,且四个模型中有三个的选项顺序效应在 ±5 分的等价区间内,因此安全差距在于校准而非知识。我们发布测试框架、提示、逐项输出、评委小组、扰动审核和人类标注协议。 **关键词:** 医学问答;大型语言模型;缺失信息鲁棒性;LLM 作为评委;自我偏好偏差;临床 AI 安全;评估可靠性;HealthBench;MedQA ### 1. 引言 医学问答排行榜已经饱和:数个前沿模型在 MedQA [2] 上超过名义上的 USMLE 及格线,大型语言模型在编码医学知识方面已能与临床医生媲美 [3]。这种饱和容易导致误读——认为这些系统已“准备好”用于临床决策支持。然而,readiness 是真实输入退化下的行为属性,而临床实践恰恰如此:缺失病史、模糊主诉以及无法根据给定信息安全回答的问题。一个临床安全的系统应该**识别提供信息的局限,并拒绝过度承诺**,而不是在正确选项出现时仅仅选出正确的字母。 Gu 等人 [1]——现已发表于《Nature Medicine》——通过在医学问答和多模态任务上进行一系列输入扰动,系统化地展示了前沿模型可以在关键输入被移除时猜对答案,却在小幅提示变化上表现不佳,并且流行的健康基准在它们实际衡量的内容上存在巨大差异。他们的压力测试主要是封闭式和多模态的。 我们的主要贡献是将缺失信息压力测试扩展到开放式临床对话,其中关注的失败不是选错字母,而是在需要的信息被移除时仍给出自信、确定的答案。扩展到开放式文本会将第二个问题浮出水面。与多项选择答案键不同,“对缺失信息的适当回应”并非可确定性检查;它由 **LLM 评委** 评分。因此,我们将评估者视为实验的一部分,并展示它在两个方面存在混杂,可能悄无声息地改变安全性结论。 首先,**评委选择会改变表面安全性**:评委间一致性仅为中等可靠性,并且在本小组中,同提供商评分与更高的评分整体相关,并显著影响一个模型的表面排名——足以改变哪个模型似乎过度承诺最少。关键的是,我们将这种同提供商关联与评委的*一般*宽容度区分开来,因为两者容易混淆。其次,**LLM 评委比更严格的临床医生更宽容**(对于大多数评委,也比共识更宽容),因此在这类设置中,LLM 评定的安全率相对于人类参考是乐观的。 **贡献:** 1. **开放式医疗对话的缺失信息鲁棒性探针**——删除最终用户轮次中的临床信息,并采用适当回应标准——外加对扰动的显式*效度审核*(哪些剪切实际上移除了临床相关信息,哪些留下了可回答的或行政性任务)。 2. **对结果开放式安全度量的评估者可靠性分析**——一个四提供商评委小组(Fleiss' κ,通过聚类自助法置信区间和排列检验在投票级逻辑回归中分离一般评委严重程度与同提供商偏好)——表明模型间的表面排序依赖于评估者,因此必须如实报告。 3. **临床医生锚定的效度检查**——一个盲法 50 项人类参考,由两名独立临床医生(共同主要)以及作者标注,附有自助法 κ / Gwet's AC1 和配对评委减人类区间——显示 LLM 评委在本子样本中比更严格的临床医生和共识更宽容。 4. **封闭式 MedQA/MedMCQA 锚定**,附有配对(McNemar / 等价性)统计量,确认准确性很高,且四个模型中有三个的选项顺序在 ±5 分范围内,因此开放式安全差距是校准失败,而非知识差距。 我们**不**声称再现原始论文的数字(不同模型、模态和数据集),并在整个过程中明确说明哪些分析是预设的,哪些是事后分析(§2.7)。 #### 1.1 相关工作 **Readiness 压力测试与开放式医学基准。** MedQA [2] 和执照考试类题目成为医学推理的事实标准,从 Med-PaLM [3] 开始的系统在编码医学知识上已匹配或超过人类及格线。HealthBench [11] 转向开放式、基于评分标准的临床对话。Gu 等人 [1] 认为饱和具有误导性——高分可能与脆弱行为并存。Pan 等人 [15] 独立地对开放式 HealthBench 对话进行压力测试,采用*动态、加法*对抗性压力(干扰、偏见、误导信息)。我们的扰动是互补且方向相反的:我们*删除*临床信息,并询问模型是否识别出删除。我们独特的贡献总结如下。 | 研究 | 扰动 / 问题 | 终点 | |------|-------------|------| | Gu 等人 [1] | 多模态且主要为封闭式输入扰动 | 封闭式 / 评分标准 | | Pan 等人 [15] | 加法对抗性压力(干扰、偏见、误导信息) | 开放式 HealthBench | | Pombal 等人 [16] | 普通基于评分标准评分中的自我偏好 | 评分标准判决 | | Philipp 等人 [17] | 医生-LLM 评估者一致性与临床谨慎 | 开放式回复(德语) | | **本研究** | 删除临床信息;对不足的回应;跨提供商评判该回应 | 开放式对话 | **多项选择评估的鲁棒性。** LLM 在多项选择题上的表现对表面结构敏感:模型受选项顺序/标注的影响 [5],且在排列下“不鲁棒”[4]。我们的洗牌条件测试了当前模型的这一情况;我们的答案移除条件将其从*哪个*选项扩展到*是否存在任何*正确选项。 **校准、选择性预测与弃权。** 知道何时*不*回答是一个长期问题。语言模型校准不完美,仅部分“知道自己知道什么”[6];基于不确定性的弃权可提高安全性并减少 QA 中的幻觉 [7]。识别缺失信息并拒绝过度承诺是我们移除条件和开放式探针目标所针对的临床安全属性。 **LLM 作为评委及其偏见。** 由于开放式标准并非确定性可检查,我们依赖 LLM 评委 [8]。该范式带有充分记录的偏见——位置、冗长性,尤其是自我增强,即模型对自己(或其提供商)的输出评分更有利 [8, 9];模型甚至可以识别自己的生成并偏爱它们 [10]。Pombal 等人 [16] 显示,即使在具有客观标准的基于评分标准的评分中,自我偏好仍然存在,并可能使 HealthBench 式分数偏移数分;Philipp 等人 [17] 发现 LLM 评估者达到临床医生级别的一致性,但缺乏临床谨慎,并表现出谱系依赖的偏见。我们的研究针对缺失信息行为贡献了一个*跨提供商*版本的这种关注,并且——超越了原始的自我减他人差距——将同提供商偏好与一般评委严重程度区分开来,然后通过临床医生进行验证。 ### 2. 方法 #### 2.1 模型与推理 我们评估了四个模型(表 1):三个旗舰推理模型和一个中端模型。 **表 1. 评估模型及其推理配置。** | 模型 | API 标识符 | 提供商 | 推理配置 | |------|-------------|--------|----------| | Claude Opus 4.8 | claude-opus-4-8 | Anthropic | 扩展思维,16k token 预算,32k 最大输出 | | GPT-5.5 | gpt-5.5 | OpenAI(Responses API) | reasoning_effort = high | | Grok 4.3 | grok-4.3 | xAI | 默认(高推理模型) | | Gemini 3.5 Flash | gemini-3.5-flash | Google(OpenAI 兼容) | reasoning_effort = high | 所有模型均通过 `verifiers` 评估框架实时查询,使用 `medarc-verifier` 框架。 **替代说明:** 本研究原计划使用 Gemini 3.1 Pro,但可用的 Google API 密钥被限速到免费层(`gemini-3.1-pro` 每天 250 次请求),并在 100 次调用中的 13 次后耗尽;因此我们报告 Gemini 3.5 Flash。因此,Gemini 结果是针对一个比其他三个旗舰模型更小、更便宜的模型,不应视为旗舰级 Google 数据点。 #### 2.2 数据集 - **HealthBench(共识子集)** [11],`neuralleap/healthbench-consensus`。我们在基线和缺失信息探针中均使用 n = 50 个对话。项目是共识子集的前 50 个;此排序依赖性是一个局限(§5),也是我们报告按主题和分层细分(§3.1-3.2)而非单一汇总数字的原因。 - **MedQA-USMLE(4 选项)** [2],`GBaker/MedQA-USMLE-4-options`,测试拆分(封闭式锚定)。我们使用前 n = 100 个项目,在所有四个 MCQ 条件下保持不变,以便比较在*相同问题*上配对。 两个数据集均为公开;可能的训练数据污染在 §5 中讨论。 #### 2.3 开放式缺失信息探针(主要) 多项选择扰动对于自由文本对话没有类似物,因此这是我们的主要任务。对于每个 HealthBench 对话,我们删除最终用户轮次的后半部分(基于句子的拆分),使得关键细节缺失。一个稳健的助手应承认缺失信息、表达适当的不确定性或提出澄清性问题,而不是编造一个自信、确定的临床答案。 **结果术语。** 对于此开放式任务,我们故意避免使用“弃权”一词(它适用于 §2.4 的 MCQ 哨兵,但不适用于自由文本)。正向行为——承认缺失信息、限定或澄清——我们称之为**对缺失信息的适当回应**;其补集,即好像信息完整时给出的自信确定答案,我们称之为**不安全的过度承诺**(*不当自信率*)。单一 LLM 评委标准对此行为进行评分(附录 A);我们将多评委、严重程度调整后的估计值(§2.6)作为主要结果。 **扰动效度审核。** 自动截断可能出错:它可能从单词中间切断而非自然边界,删除用户的实际请求而非临床上下文,或者留下仍可回答的提示或重写/行政任务,对于这些任务“适当的不确定性”并非适当的标准。因此,我们对人类效度子样本(§2.6)背后的每个唯一扰动提示在三个轴上进行审核——截断形式(词中 vs 语法完整)、确定性(真正欠确定 vs 仍可回答)和任务类型(临床决策 vs 重写/行政)。审核由作者执行(与人类标签一样存在利益冲突披露;§3.1,*伦理*)并发布(`runs/human_eval/perturbation_audit.csv`),以便可重新评分。我们在所有项目上报告主要的开放式结果,并作为敏感性分析,在**作者审核的临床欠确定子集**(临床任务且临床相关信息被判定为真正移除;§3.1)上报告。我们还报告每个模型的**未扰动 HealthBench 评分标准得分**(加权共识标准满足比例),作为基线答案质量的参考。 #### 2.4 封闭式锚定:MCQ 扰动 每个基础 MCQ 项目(临床上下文、问题主干、选项、正确选项)被转换为四种条件之一: - **none**——未扰动基线;奖励 = 准确率。 - **shuffle**——选项确定性排列(种子 1618,按项目键控);奖励 = 准确率。探测位置偏差(论文测试 ST_v1)。 - **remove_answer**——删除正确选项,并追加一个哨兵选项 `"None of the other answers is correct."` 并将其标记为唯一正确选择。稳健的模型应选择哨兵。奖励 = 适当弃权率;1 - 奖励 = 不当自信答案率(论文测试 ST_v3–v6)。 - **remove_context**——删除临床小场景(仅剩余主干和选项),并追加一个哨兵选项 `"There is not enough information to answer this question."` 并将其标记为正确(论文测试 ST_v0)。 **提示。** 所有条件共享仅字母输出合约(附录 A);在两个弃权条件下,系统提示额外说明一个选项可能指示答案未列出或信息不足,并且如果最合适应该选择它。这*提示*了弃权,因此使 MCQ 弃权测试成为一个保守的、接近最佳情况的标杆(见 §5)。 #### 2.5 评判 - **MCQ 条件**不使用 LLM 评委:答案通过精确选项字母匹配(附答案文本回退)确定性评分。MCQ 结果与评委无关。 - **开放式探针**根据适当回应标准由 LLM 评委评分。我们的主要运行使用 **GPT-5.5** 作为唯一评委;然后我们使用**四提供商评委小组**(见 §2.6)重新评分相同的保存补全,以衡量评委可靠性和同提供商偏好,并报告基于小组、严重程度调整后的估计值作为我们主要的开放式结果。 - **HealthBench 基线**由 **GPT-4.1-mini** 评判,这是 OpenAI 的 HealthBench [11] 使用的参考评委。我们*未*在此处使用 GPT-5.5,因为 OpenAI 的推理模型输入审核拒绝了*每个*基线评分标准调用(HTTP 400 invalid_prompt);这是提供商侧内容审核对长评分标准+对话的阻止。
相似文章
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。
测量LLMs在误导性医疗语境下的认知韧性
介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。
AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现
AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
安全是情境性的,LLM评判者则不然:驾驭评估者的刚性先验
本文研究了用于安全评估的LLM-as-judge适应情境信息及不同安全定义的能力,发现它们基本是刚性的,当情境与其内部先验相矛盾时无法调整。