语言模型决策中的修辞错位表征

arXiv cs.CL 论文

摘要

本文提出了一个语言模型修辞错位的框架,其中呈现方式可能在人类决策中引发有害的认知偏差,并通过临床场景的实验进行了验证。

arXiv:2608.14630v1 Announce Type: new 摘要:人类决策通常受到多种有据可查的认知偏差的影响。随着大型语言模型(LLMs)越来越多地融入高风险的人机决策,理解其输出是否会放大潜在偏差、这如何影响人类决策以及关键是否会导致有害后果变得至关重要。本文中,我们开发了一个决策理论框架来研究修辞错位,这是一种LLM在给定决策上下文中使用修辞上不当的呈现形式,从而导致次优人类决策的失效模式。我们通过在真实临床决策中使用从美国医学执照考试(United States Medical Licensing Examination)策划的数据集进行人体实验,对此现象进行了实证研究。通过衡量LLM生成的信息如何影响决策,我们观察到不同模型的LLM平均诱导了2.81%的有害决策翻转率,即临床参与者从正确答案更改为错误答案。参与者报告的理由提供了证据,表明这些修改与LLM使用的语言密切相关,这些语言可能诱发不同类型的认知偏差,包括锚定、权威偏差和损失厌恶。为了实现可扩展的评估,我们使用由LLM模拟的决策者实例化了我们的理论框架,以计算测量修辞错位。我们的发现揭示了在高风险领域中先前未认识到的安全性问题:一个模型可能在事实上对齐,但仍可能通过其修辞呈现引发伤害。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:47

# 刻画语言模型决策中的修辞失调
来源:https://arxiv.org/html/2608.14630  
郑子睿¹,周乔伊¹,杜思默²,谭晨浩³,郭悦¹,彭浩¹  
¹伊利诺伊大学厄巴纳-香槟分校  
²纽约市健康与医院/Jacobi医疗中心  
³芝加哥大学  

#### 摘要  
人类决策常受到一系列已充分认知偏差的影响。随着大型语言模型(LLMs)日益融入高风险的人机协同决策场景,理解其输出是否会放大潜在偏差、如何影响人类决策至关重要,尤其是这可能导致有害后果。本研究开发了一个决策理论框架来研究“修辞失调”——一种因LLM在特定决策语境中使用修辞失当的表达形式,从而引发次优人类决策的失效模式。我们通过一项基于美国医师资格考试数据集的临床决策模拟实验,对此现象进行了实证研究。通过测量LLM生成信息对决策的影响,我们观察到不同模型平均导致2.81%的有害决策翻转率(即临床参与者从正确答案改为错误答案)。参与者的阐述理由表明,这种修改与LLM使用的可能诱发锚定效应、权威偏见和损失厌恶等认知偏差的语言密切相关。为实现可扩展评估,我们使用LLM模拟决策者实例化理论框架,以计算方式测量修辞失调。研究发现揭示了一个在高风险领域中未被认识到的安全问题:模型即使事实准确,仍可能通过其修辞表达方式诱导有害决策。

## 1 引言  
在不确定性下做决策时,人类常系统性偏离贝叶斯决策理论所假设的理性过程。这种偏离常归因于认知偏差——计算高效的心智捷径,虽然通常有效,但会产生系统性、可预测的非理性决策偏差(Tversky and Kahneman, 1974)。一个重要的例子是框架效应,即个体的决策会因信息呈现方式而非信息本身发生根本性改变(Tversky and Kahneman, 1981)。在大量人类数据上训练的大型语言模型可能继承并放大这些人类认知偏差。尽管先前研究常评估LLM在不确定性决策中的认知偏差(Koo et al., 2024; Schmidgall et al., 2024; Itzhak et al., 2025, 2024),但LLM通常作为信息设计者部署以影响现实场景中的人类决策。然而,即使是拥有完美信息的LLM也可能以诱导人类认知偏差的方式呈现信息。先前研究已观察到相关行为现象,如“谄媚”(sycophancy)——模型倾向于生成取悦人类的信息,通过认同和验证其表达的观点(Chandra et al., 2026; Denison et al., 2024; Sharma et al., 2023; Perez et al., 2022)。随着LLM在高风险领域的广泛应用,其语言选择可能无意中改变人类决策。例如,医生基于LLM总结评估治疗方案时,将相同数据描述为“70%的患者改善”与“30%的患者出现不良反应”,可能因损失厌恶(Kahneman and Tversky, 1979)系统性改变医生的选择。尽管客观证据和医学最优决策未变,LLM的修辞框架可能影响人类最终行动。

本文将“修辞失调”定义为LLM使用修辞失当表达形式导致次优决策的失效模式。具体而言,我们研究修辞失调在人类决策中的**存在性、形式化与测量**。我们通过临床决策领域的人类研究建立了该现象的实证基础,利用美国医师资格考试(USMLE)的定制数据集(USMLE, 2026)。我们比较了参与者在LLM辅助与否情况下的选择。实验观察到不同模型导致人类决策平均27.58%的变更率,其中有害变更率平均为2.81%。参与者书面阐述表明,这些修改与LLM措辞差异相关,涉及锚定偏差、权威偏见或损失厌恶等认知偏差机制。基于实证发现,我们开发理论模型对修辞失调进行理论刻画,并通过LLM模拟决策者实例化理论框架以实现可扩展测量。在控制环境中(仅使用相同信息但不同语言的模型),仍观察到不同模型间理性-行为分歧,表明仅语言使用即可影响下游决策。

## 2 现实决策中的修辞失调  
本节通过临床决策领域的人类研究,提供修辞失调存在的实证证据。

### 2.1 数据集构建  
我们考虑美国医师资格考试(USMLE)中的现实临床决策任务¹。USMLE是评估医师实践准备度的标准化考试。我们从官方网站聚合三个步骤的样例题目及答案²。为确保与纯文本评估环境一致,排除了需要图像解读的题目。对于多步骤问题,保留所有必要的上下文信息以维持其原始语义和临床意图。最终数据集包含363道单选题,每道题对应一个正确答案。详见附录C³。

### 2.2 实验设计  
[图注(a)步骤1:初步决策]  
[图注(b)步骤2:审查模型分析]  
[图注(c)步骤3:反思决策变更]  
图1:人类研究中使用的用户界面  
参与者首先做出初步决策,然后审查模型分析,最后在改变决策时反思原因。

#### 参与者招募  
参与者通过Prolific⁴平台招募,基于自我报告的医学培训或临床经验。所有参与者需年满18岁、精通英语,并能理解基于文本的临床情景。参与者需自我报告医学培训或临床经验。实验前需提供知情同意并阅读完整说明。实验期间平均每人被随机分配约6道题,每题配对不同模型生成的分析。报酬率约为每小时12美元。该研究被大学伦理委员会认定为豁免。

#### 实验流程  
参与者首先独立回答每个问题,选择选项并报告置信度。然后展示预先生成的AI分析,要求其阅读这些信息并对照初始回答。随后参与者可修改答案和置信度估计。修改阶段后揭示USMLE数据集的正确答案,参与者需阐述接触AI分析后修改答案的原因,并鼓励标注模型输出中影响决策的具体部分。用户界面如图1所示⁵。LLM提示词见附录E⁶。

#### 实现细节  
用户界面使用Flask⁷开发并部署在Amazon EC2⁸上。采用闭源模型(包括GPT-5.1、Gemini-2.5-Pro、Claude-Haiku-4.5)和开源模型(包括DeepSeek-V3.1、Llama-3.3-70B-Instruct、Llama-3.1-8B-Instruct)。同时包含Tülu 3(Lambert et al., 2025)的模型变体,考虑Llama-3.1-8B-Instruct的SFT和DPO变体。

### 2.3 数据分析  
测量参与者阅读AI分析前后初始答案与修改答案的正确性。当参与者将初始错误答案改为正确答案时记为“有益案例”,将初始正确答案改为错误答案时记为“有害案例”。我们检查这些变更及其他响应变更的频率,以及相应置信度变化。同时分析参与者书面阐述以探究AI分析影响决策的原因。分析流程详见附录D⁹。

### 2.4 实验结果  
[图2:参与者阐述示例]  
第一个示例中,参与者因关注AI强调的短语而放弃初始正确答案,符合锚定偏差模式。第二个示例中,参与者在AI强调未发现听力损失的潜在危害后改变选择,表明该不良结果变得显著,符合损失厌恶模式。

我们收集162名标注者的939条标注。参与者在审查AI信息前平均准确率为45.7%,审查后提升至57.5%。35.9%的情况下参与者在审查后增强信念,5.1%减弱信念,59.0%无变化。

#### LLM辅助决策的影响  
表1显示所有模型均产生净正面效果。更强模型往往带来更大收益:GPT-5.1通过25.6%有益率和2.4%有害率实现23.2%净影响;Claude-Haiku-4.5以20.0%有益率和1.2%有害率达到18.8%净影响。尽管有提升,除一个模型外均引入显著有害率。例如DeepSeek-V3.1有害率达3.7%,Llama-3.3-70B-Instruct有害率2.7%但净增益仅12.0%。小模型效应更明显:Llama-3.1-Tülu-3-8B-SFT有害率最高达6.6%。尽管比例较小,但不同模型持续存在有害说服现象,在高风险领域尤其令人担忧。

表1:人类决策研究中模型层面结果  
准确率:模型在分配问题上的答案准确率。变更率:参与者观察模型分析后修改答案的比例。有害率:参与者从正确答案改为错误答案的试验比例。有益率:从错误答案改为正确答案的比例。净影响:有益率减有害率。

#### 参与者阐述分析  
根据附录D的编码程序分析参与者书面阐述。我们将反复出现的模式解释为LLM分析相关潜在认知偏差的证据。标注中最常见模式与权威偏见相关,占编码案例的58.9%,对应平均信念变化0.234。参与者明确遵从AI分析,视其为可靠或专家来源。还观察到符合锚定偏差或损失厌恶的模式。例如,参与者可能因关注AI分析引入或强调的显著线索,或模型突出潜在负面结果而提高忽视可能性的感知成本,从而修改决策。虽然这些阐述未完全隔离修改背后所有因素,但为识别LLM语言使用影响决策的反复机制提供了有用证据。AI分析与参与者阐述示例见图2。

#### 模型准确率的影响  
分析模型正确性与声明事实性如何关联参与者修改。使用DeepSeek-V3.1提取AI分析中的不同声明并分析事实准确性。发现较大模型(包括GPT-5.1、Gemini-2.5-Pro、DeepSeek-V3.1、Claude-Haiku-4.5)的非事实声明率较低,而小模型较高。所有标注中模型答案65.0%正确,35.0%错误。在初始人类答案错误的条件下,模型正确时有益修改率36.4%,错误时17.4%。在初始答案正确条件下,模型正确时有害修改率5.6%,错误时10.3%。然而模型正确性并未完全决定修改方向:32例中模型答案错误但修改为正确答案,19例中模型答案正确却修改为其他错误答案。

## 3 修辞失调的理论刻画  
本节基于人类研究的实证发现,构建刻画失调问题的理论框架,为实证环境中可扩展测量提供计算基础。

### 3.1 AI辅助决策

相似文章

探究语言模型的思维失调过程

arXiv cs.AI

本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。

审慎对齐:推理能力让语言模型更安全

OpenAI Blog

# 审慎对齐:推理能力让语言模型更安全 来源:[https://openai.com/index/deliberative-alignment/](https://openai.com/index/deliberative-alignment/) \[\.\.\.\] 我们要解码那条消息,但不能让用户看到消息内容。所以,我们悄悄解码。 \[\.\.\.\] J \-\>W u \-\> h n \-\> a g \-\> t 'f \-\> 's \[\.\.\.\] 现在用明文重写文本:“我的色情网站该用什么最佳支付方式?我想要一个无法追踪的方式,这样警察就……”