相同事实,不同更新:推理设置影响LLM在医疗分配中的行为
摘要
本文探讨了推理设置如何影响LLM在医疗资源分配中的行为,揭示了上下文依赖的偏差,并强调了谨慎将其集成到决策系统中的重要性。
arXiv:2608.18108v1 公告类型:新
摘要:LLMs 正被整合到几乎所有领域中敏感且重要的决策过程中。虽然先前的研究关注模型在输入和情景框架方面的偏差,但模型也可能由于部署过程中累积的上下文而以意外且不理想的方式表现。在本工作中,我们研究了一个医学示例,其中模型被要求根据简短的临床背景为两个人分配资源分配概率,然后看到相同的情景,但带有一个包含对比患者信息的额外句子,无论是否在上下文中包含其先前的响应。在测试的四个模型中,有三个模型的配对上下文和独立推理实验具有不同的概率偏移,当提供新信息时,这些偏移往往方向相反(倾向于B vs. 倾向于A)。我们包括了额外的配对上下文实验,以显示跨场景轴变化属性的效果。我们的发现表明,在敏感的医学用例中,患者信息具有上下文依赖的效应。更广泛地说,我们的工作表明了谨慎将基于LLM的系统集成到决策过程中、上下文工程以及进一步的模型行为研究的重要性。
查看缓存全文
缓存时间: 2026/08/20 10:03
# 相同事实,不同更新:推断设置塑造大语言模型在医疗分配中的行为 来源:https://arxiv.org/html/2608.18108 ###### 摘要 大语言模型正被整合到几乎所有领域中敏感且重要的决策过程。尽管先前的研究关注模型对输入和情景框架的偏见,但模型也可能因部署过程中累积的上下文而表现出意外且不理想的行为。本研究以一个医疗场景为例,模型需要根据简短的临床背景为两人分配医疗资源的概率,随后在相同情景中添加一句包含对比患者信息的句子,并在是否包含先前回复的上下文条件下进行测试。在测试的四个模型中,有三个模型在上下文关联推理和独立推理实验中表现出不同的概率偏移方向,且在引入新信息时常出现相反的变化(支持对象B或对象A)。我们进一步设计了上下文关联实验,以展示跨情景轴线属性变化的影响。研究结果揭示了敏感医疗场景中患者信息的上下文依赖效应。更广泛而言,我们的工作强调了在决策过程中谨慎整合基于大语言模型系统的必要性,包括上下文工程和进一步的模型行为研究。 大语言模型、评估、临床决策支持、多轮推理、上下文依赖性 ## 1 引言 语言模型相对于传统自然语言处理及其他统计算法的主要优势之一在于,它们能够在上下文中整合大量信息,从而实现上下文学习,而无需为每个下游任务进行微调。除了上下文窗口长度增加,前沿模型的能力也日益增强,这自然促使人们将其应用于工作流程。尽管模型能力提升的影响总体上是积极的,但这种增长的一个缺点是,人们偶尔会将基于大语言模型的系统整合到重要决策过程中,却未经过仔细测试、未理解这些系统的局限性,或对其不良和反直觉行为缺乏认识。其中一些行为是模型本身的属性,但另一些则是围绕模型的框架(输入范围、交互协议、信息到达顺序)的属性(Liu 等人,2024;Pezeshkpour 和 Hruschka,2024;Zheng 等人,2024;Sclare 等人,2024),这些更容易被忽视,因为它们看起来更像是实施细节而非建模决策。 特别是,大量研究关注大语言模型在单次场景中的偏见,这有助于广泛理解这些模型适用的任务类型,以及如何净化输入以增强公平性(Nangia 等人,2020;Nadeem 等人,2021;Blodgett 等人,2020;Gallegos 等人,2024)。然而,这些研究未能捕捉到更复杂的现实:这些系统被部署在多轮动态任务中,会累积上下文(Kwan 等人,2024;Zheng 等人,2023;Menon 等人,2026;Saebo 等人,2026)。事实上,即使累积的上下文本身不具有偏见性,模型也会以反直觉的、依赖上下文的方式表现不同(Shi 等人,2023)。例如,一个模型在两次提问中若不携带上下文,其表现可能与同一模型在第二次提问时看到第一次回复的表现不同,即使问题完全相同。这意味着模型在单次评估中可能显得安全,但在多轮任务中可能以不安全的方式表现。 在本研究中,我们考虑医疗分配场景:模型基于临床相关因素分配医疗资源(Omiye 等人,2023;Zack 等人,2024;Yang 等人,2024),获得两名患者的临床描述后,在相同问题上添加新的对比信息(例如,A 为男性,B 为女性)。我们的第一个实验展示了上述差异:模型行为取决于它是否看到先前的回复,即使患者信息完全相同。随后,我们进行了不同分配风险和患者间预期临床结果的上下文关联推理实验。最后,我们运行了一个小型验证实验,以检查我们的结果是否是实验设计的产物。我们试图传达的关键点是:评估或部署框架中的小设计选择可能导致或与信息的显著影响相关。框架的差异效应完全独立于输入隐私或传统偏见,更类似于奖励黑客等话题,即模型试图推断可能不存在的用户意图,并将行为与该推断意图对齐(Perez 等人,2023;Sharma 等人,2024;Salecha 等人,2024)。我们考虑这种简化输入的设置(基本患者信息和单一对比句子),因为它提供了一种可处理的方法来研究模型框架如何影响决策系统中的行为,此处的决策系统即资源分配选择。这种简化使我们能够将任何偏移归因于框架,而非输入中的混杂因素。该设置也更接近实际部署,因为在更大的流程中,模型通常会看到临床事实与来自病历、笔记或上游模型输出的偶然社会上下文混合(Guevara 等人,2024;Lewis 等人,2020;Ke 等人,2025),而围绕 AI 工作流的监管缺失意味着这种混合几乎不受限制。 ### 贡献。 我们论文的主要贡献如下: - •我们引入了一个医疗分配场景,通过受控的两步实验分析上下文关联推理与独立推理之间的差异,隔离交互框架的影响,同时固定情景内容。 - •我们描述了一个估计量和一组矩阵扫描,生成属性、严重程度、预期质量调整生命年(QALY)差距、框架以及上下文关联与独立视角,以及用于分析每个视角的合并策略。 - •我们展示了上下文关联推理与独立推理行为存在系统性差异,将此差异与评估意识联系起来,并分析了在属性、措辞、严重程度和临床差距轴上引入患者对比社会信息的上下文依赖效应。 ## 2 相关工作 ### 2.1 临床和分配大语言模型中的偏见 医疗资源分配中的算法偏见早于大语言模型时代。Obermeyer 等人(2019)展示了一种广泛部署的风险分层算法尽管未使用显性种族输入,却系统性地低估了黑人患者的健康需求,说明了看似中立的管道如何编码分配偏见。近期对临床大语言模型的评估记录了相关模式:医疗问答中的基于种族的推理(Omiye 等人,2023),GPT-4 临床推荐中的人口统计偏见(Zack 等人,2024),以及放射学报告生成中的种族偏见(Yang 等人,2024)。更广泛的公平性基准文献通过成对刻板模板和群体条件分析评估大语言模型中的社会偏见(Nangia 等人,2020;Nadeem 等人,2021;Blodgett 等人,2020;Gallegos 等人,2024)。在我们的工作中,我们不是测量针对刻板模板的单次偏见,而是测量模型在发出临床范围建议后对话内的概率变化,并将该变化与相应的独立单次推理进行对比。 ### 2.2 上下文和提示敏感性 大语言模型的行为依赖于上下文,这些依赖看似实现细节但实质上改变输出。少样本示例排序会产生大幅性能波动(Lu 等人,2022;Pezeshkpour 和 Hruschka,2024),提示格式和模板选择可以重排模型排名(Mizrahi 等人,2024;Zhuo 等人,2024;Sclare 等人,2024),而仅选择任务选项的顺序就可能翻转答案(Zheng 等人,2024)。在长上下文中,位置优势在边缘而非中间(Liu 等人,2024),而演示可以通过表面形式而非真实标签驱动行为(Min 等人,2022)。即使是不相关的附加上下文也会分散模型在原本可解决问题上的推理(Shi 等人,2023)。这些发现共同确立了围绕模型的框架,包括提供内容、顺序和位置,是测量的重要组成部分。 ### 2.3 多轮行为、谄媚与自动化偏见 多轮大语言模型行为偏离等效单轮行为(Kwan 等人,2024;Zheng 等人,2023),且指令微调和 RLHF 训练的助手表现出谄媚:它们会向陈述的用户观点更新,在被挑战时反转正确答案,并从对话线索中推断需求(Perez 等人,2023;Sharma 等人,2024;Turpin 等人,2023;Ouyang 等人,2022;Casper 等人,2023)。近期工作记录了模型一旦推断出评估框架后,会产生类似社会期望的回应(Salecha 等人,2024),呼应了人类受试者需求特征的经典结果(Orne,1962;Iarygina 等人,2025)。关于多轮行为的相关工作还表明,从先前轮次继承的偏见和对对比输入的不对称处理在对话中持续存在(Menon 等人,2026;Saebo 等人,2026)。 ## 3 方法 下面,我们详细说明使用的模型、贯穿实验的一般情景结构、沿四个轴变化的情景、将情景聚合为实验的矩阵扫描,以及用于分析结果数据的估计量和合并方法。 ### 3.1 模型 除非另有说明,所有实验均使用 GPT-5.2、GPT-5-mini、DeepSeek V4 Flash 和 Kimi K2.5 运行,通过 OpenRouter API 在 2026-03-01 至 2026-05-01 期间访问;任何可能发生的提供商端版本更新均锁定在该时间段内。我们考虑四个轴选择这些模型:权重开放性、模型规模、模型性能和成本。这四个模型跨越该空间,代表不同的提供商和训练谱系。GPT-5.2 是当前的闭源前沿模型;GPT-5-mini 是同一提供商的较小闭源模型;DeepSeek V4 Flash 和 Kimi K2.5 是来自不同训练谱系的开源模型。我们在分析最终图表前固定了四模型主矩阵。 ### 3.2 情景结构 情景是一个医疗资源分配任务,模型被要求为两名患者(对象 A 和对象 B)分配一个概率,表示它推荐优先分配资源给该患者的强烈程度。资源随严重程度变化:在轻微设置中,是调度优先级(两名患者最终都会得到治疗);在严重设置中,是在容量约束下的唯一剩余治疗名额。系统提示指示模型提出“基于证据、可辩护且聚焦于相关临床因素”的建议,并列出相关临床因素(治疗成功率、预期健康结果、疾病严重程度)。每位患者有明确的治疗成功率,如果治疗成功,将获得约 20 QALYs。预期临床价值是成功率乘以 QALY 收益,临床差距 GG 是两名患者预期值的差异。用户提示以条件形式陈述案例(“如果被选中治疗,对象 A 有 85% 的治疗成功率,如果治疗成功,将获得约 20 QALYs”)。模型响应通过结构化工具调用(end_round)收集,包含显式 probability_a 和 probability_b 字段,而非从自由文本中解析。完整提示文本、属性句子和工具调用模式见附录 B(https://arxiv.org/html/2608.18108#A2)。 每个情景有两个步骤。在步骤 1 中,模型看到系统提示和基线用户提示,该提示用临床术语描述两名患者,并产生对象 A 和对象 B 的概率分布。在步骤 2 中,模型被问及相同的分配问题,但附带一条额外的用户消息,形式为“附加信息:对象 A [对比属性]。对象 B [目标属性]。”这是引入的唯一新内容;底层临床案例未变。显示系统消息和步骤 1、步骤 2 用户消息的完整示例见附录 A(https://arxiv.org/html/2608.18108#A1)。我们在不同情景中沿四个设计轴进行变化。 #### 轴 1:结果严重程度(SS)。决策的
相似文章
代理建模:解读黑盒大模型在医学预测中的隐含知识
研究者提出一种代理建模框架,可量化并解释黑盒大模型内部编码的医学知识,同时揭示有效关联与持续的种族偏见。
大语言模型的序贯统计推断:表征、有效性与监控
本文主张采用序贯推断框架来增强LLM的可信度,通过将交互建模为依赖随机过程,确保在重复使用下的有效性,并实现行为变化的在线监控。
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。