LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL 论文

摘要

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。

arXiv:2608.05166v1 公告类型:新 摘要:我们在现实多轮交互设置下,评估了最先进的指令微调LLM中的认知偏差表达。我们的工作引入了一个新颖的三条件实验框架,将接触有偏见用户轮次的影响与该轮次语义内容的影响分离开来,并附带一个由24,300个经陪审团验证的用户提示组成的基准,覆盖9x9目标-人类偏差交互矩阵的全部81个单元格。在八个前沿LLM中,我们发现,与零样本基线相比,有偏见的对话上下文在8个模型中的6个中系统性地增加了偏差表达。我们确定了两种相互竞争的行为动态:对话中接触有偏见的推理通常会放大后续的偏差倾向,而明确陈述的偏差线索往往触发与对齐相关的抑制行为,从而减少公开的偏差表达。我们发布我们的框架、代码库和数据集,以支持未来关于上下文条件性认知偏差和LLM中行为适应的研究。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:49

# 有偏见的用户轮次如何调节上下文推理
来源:https://arxiv.org/html/2608.05166
## LLM中的条件性认知偏见:有偏见的用户轮次如何调节上下文推理

Jacqueline Isaacs 东北大学 \{s\.weerasekara, sagar, isaacs\}@northeastern\.edu

###### 摘要

我们对最先进的指令微调LLM在现实多轮交互设置下的认知偏见表达进行了评估。我们的工作引入了一个新颖的三条件实验框架,该框架将暴露于有偏见的用户轮次的影响与轮次语义内容的影响分离,同时构建了一个包含24,300个经评审团验证的用户提示的基准,覆盖9×99\\times 9目标偏差与人类偏差交互矩阵的全部81个单元格。在八个前沿LLM中,我们发现相对于零样本基线,有偏见的对话上下文在8个模型中的6个中系统性增加了偏差表达。我们识别出两种相互竞争的行为动态在这一效应中发挥作用:对话中对有偏见推理的暴露通常会放大下游偏差倾向,而明确陈述的偏差线索往往会触发与对齐相关的抑制行为,从而减少明显的偏差表达。我们发布了我们的框架、代码库和数据集,以支持未来关于LLM中上下文条件性认知偏见和行为适应的研究。

LLM中的条件性认知偏见:有偏见的用户轮次如何调节上下文推理

Sachini Weerasekara, Sagar Kamarthi, and Jacqueline Isaacs
东北大学
\{s\.weerasekara, sagar, isaacs\}@northeastern\.edu

## 1引言

指令微调的大语言模型越来越多地被部署为高风险场景中的会话式决策支持工具,包括法律推理、医疗分诊和财务咨询等情境(Bommasaniet al\.,2021 (https://arxiv.org/html/2608.05166#bib.bib1); Achiamet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib37); Dubeyet al\.,2024 (https://arxiv.org/html/2608.05166#bib.bib38))。在这些部署中,用户往往会表现出系统性的认知偏见——框架效应、锚定效应、乐观偏见——这些偏见会塑造请求的提出方式以及信息向模型的呈现方式(Kahneman,2011 (https://arxiv.org/html/2608.05166#bib.bib29); Tversky and Kahneman,1974 (https://arxiv.org/html/2608.05166#bib.bib28),1981 (https://arxiv.org/html/2608.05166#bib.bib16))。这些有偏见的用户轮次是否会以及如何传播到下游模型行为中,仍然是一个未解的问题。

大量已有工作刻画了LLM在零样本评估下的认知偏见(Malberget al\.,2025 (https://arxiv.org/html/2608.05166#bib.bib13); Jones and Steinhardt,2022 (https://arxiv.org/html/2608.05166#bib.bib11); Gallegoset al\.,2024 (https://arxiv.org/html/2608.05166#bib.bib30); Binz and Schulz,2023 (https://arxiv.org/html/2608.05166#bib.bib56); Hagendorffet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib57)),确立了对框架效应(Tversky and Kahneman,1981 (https://arxiv.org/html/2608.05166#bib.bib16))、锚定效应(Strack and Mussweiler,1997 (https://arxiv.org/html/2608.05166#bib.bib14); Epley and Gilovich,2001 (https://arxiv.org/html/2608.05166#bib.bib55))、内群体偏好(Tajfel and Turner,1979 (https://arxiv.org/html/2608.05166#bib.bib45))和确认偏差(Nickerson,1998 (https://arxiv.org/html/2608.05166#bib.bib19); Weerasekaraet al\.,2026 (https://arxiv.org/html/2608.05166#bib.bib48),2025b (https://arxiv.org/html/2608.05166#bib.bib49))的易感性。这些基准在证明对齐训练不能消除偏见方面发挥了关键作用(Perezet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib54); Ouyanget al\.,2022 (https://arxiv.org/html/2608.05166#bib.bib6); Santurkaret al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib47))。然而,每一个基准结果都是从孤立、精心控制的提示中测量的,将LLM偏见视为一种与上下文无关的属性。这并不反映部署条件,在部署中,模型对决策关键提示的响应总是以先前的一个对话轮次为条件的。

一个有偏见的用户轮次混淆了两条因果路径:*任何*用户轮次的*存在*都会将输入从零样本转变为对话,激活在零样本时不存在于指令微调条件中的条件;有偏见的轮次的*内容*引入了第二个信号,该信号与模型的对齐机制相互作用,以放大或抑制目标偏见。如果不分离这些因素,驱动LLM偏见表达变化的机制仍然是模糊的。

为了分离这些路径,我们引入了一个三条件设计:无用户轮次(m∅m\_\{\varnothing\})、中性用户轮次(mnm\_\{n\})和有偏见的用户轮次(mbm\_\{b\})。这产生了主要估计量Δb=\|mb\|−\|m∅\|\\Delta\_\{b\}=\|m\_\{b\}\|\-\|m\_\{\varnothing\}\|及其分解Δb=Δn\+δ\\Delta\_\{b\}=\\Delta\_\{n\}\+\\delta,其中存在效应Δn=\|mn\|−\|m∅\|\\Delta\_\{n\}=\|m\_\{n\}\|\-\|m\_\{\varnothing\}\|分离了格式变化,内容效应δ=\|mb\|−\|mn\|\\delta=\|m\_\{b\}\|\-\|m\_\{n\}\|分离了偏见特定的调节。我们构建了一个包含24,300个经评审团验证的轮次的刺激库,覆盖9×99\\\!\\times\\\!9的LLM目标偏差β\\beta与人类轮次偏差γ\\gamma矩阵的所有81个单元格,并在8个涵盖不同参数规模和对齐机制的指令微调LLM上进行了评估。由三个模型组成的LLM作为评审团(GPT-4o-Mini、Claude-3.5-Haiku、Gemini)在任一刺激进入刺激库之前强制执行四个质量标准,从而将刺激生成与评估解耦。因果效应通过双重差分法(Angrist and Pischke,2009 (https://arxiv.org/html/2608.05166#bib.bib26))、合成控制法(Abadieet al\.,2010 (https://arxiv.org/html/2608.05166#bib.bib27))和倾向得分匹配(Rosenbaum and Rubin,1983 (https://arxiv.org/html/2608.05166#bib.bib43))来识别。

我们提出的问题是:用户轮次的认知偏见内容在多大程度上调节LLM偏见表达,超越任何用户轮次所引发的格式转换,并且人类特定的偏见类型是否会选择性地诱导模型中对应的偏见?

我们发现,有偏见的用户轮次将LLM偏见提升到零样本水平之上(Δ̄b\>0\\bar\{\\Delta\}\_\{b\}\>0)在8个模型中的6个中(范围\+0.022\+0.022–\+0.051\+0.051;p<0.001p\{<\}0.001),在所有8个模型中均存在显著的存在效应(7个为正,Claude-3.5-Haiku为负),部分被主要为负的内容效应(8个模型中的6个出现抑制)所抵消,而审慎型模型(DeepSeek-V3、Claude-3.5-Haiku)则逆转了内容方向。9×99\\\!\\times\\\!9耦合矩阵显示出强烈的行结构,但没有对角线优势;可诱导性由目标偏见决定,而非人类到LLM的偏见配对,规划谬误是唯一在所有8个模型中被因果确认普遍可诱导的目标偏见。

## 2相关工作

#### LLM中的认知偏见基准测试。

已有工作对LLM的认知偏见进行了归类,包括框架效应(Tversky and Kahneman,1981 (https://arxiv.org/html/2608.05166#bib.bib16))、锚定效应(Strack and Mussweiler,1997 (https://arxiv.org/html/2608.05166#bib.bib14); Epley and Gilovich,2001 (https://arxiv.org/html/2608.05166#bib.bib55))、可得性偏差(Tversky and Kahneman,1973 (https://arxiv.org/html/2608.05166#bib.bib44))、内群体偏见(Tajfel and Turner,1979 (https://arxiv.org/html/2608.05166#bib.bib45))、确认偏差(Nickerson,1998 (https://arxiv.org/html/2608.05166#bib.bib19)),且这些研究大多在零样本提示下进行(Malberget al\.,2025 (https://arxiv.org/html/2608.05166#bib.bib13); Jones and Steinhardt,2022 (https://arxiv.org/html/2608.05166#bib.bib11); Gallegoset al\.,2024 (https://arxiv.org/html/2608.05166#bib.bib30)),将评估固定为单个孤立提示(Lianget al\.,2022 (https://arxiv.org/html/2608.05166#bib.bib53)),并将偏见视为与上下文无关。我们超越了这种范式,通过测量单个上下文用户轮次如何调节下游偏见表达。

#### 上下文学习与谄媚行为。

LLM在无梯度更新的情况下,通过上下文预置的示例更新其输出分布(Brownet al\.,2020 (https://arxiv.org/html/2608.05166#bib.bib5); Donget al\.,2024 (https://arxiv.org/html/2608.05166#bib.bib31));格式和输入分布比标签语义更重要(Minet al\.,2022 (https://arxiv.org/html/2608.05166#bib.bib10); Zhaoet al\.,2021 (https://arxiv.org/html/2608.05166#bib.bib32)),仅仅提示顺序的调整就会大幅改变准确性(Luet al\.,2022 (https://arxiv.org/html/2608.05166#bib.bib33))。指令微调模型表现出谄媚行为,当用户表达不同意时会改变答案(Sharmaet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib24)),而链式思维推理事后可能被有偏见的上下文合理化(Turpinet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib12))。LLM还会复现人类受访者特有的调查响应偏差(Tjuatjaet al\.,2024 (https://arxiv.org/html/2608.05166#bib.bib60); Weerasekaraet al\.,2024 (https://arxiv.org/html/2608.05166#bib.bib50),2022 (https://arxiv.org/html/2608.05166#bib.bib51))。模型编写的评估证实,行为偏见在对齐后仍然存在(Perezet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib54); Santurkaret al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib47); Weerasekaraet al\.,2025a (https://arxiv.org/html/2608.05166#bib.bib52))。这两条研究路线都没有在我们所研究的规模上,将用户轮次的*认知偏见类型*置于系统性控制之下。

#### LLM作为评估数据生成器与因果方法。

角色注入提示可以生成类似人类的认知轮廓用于评估(Argyleet al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib25));我们增加了三模型LLM作为评审团的机制(Zhenget al\.,2023 (https://arxiv.org/html/2608.05166#bib.bib9))来强制执行刺激质量。我们应用双重差分法(Angrist and Pischke,2009 (https://arxiv.org/html/2608.05166#bib.bib26))、合成控制法(Abadieet al\.,2010 (https://arxiv.org/html/2608.05166#bib.bib27))和倾向得分匹配(Rosenbaum and Rubin,1983 (https://arxiv.org/html/2608.05166#bib.bib43)),以提供超越汇总比较的逐偏见因果证据。

## 3方法

### 3\.1形式化设置

设B\\mathcal\{B\}表示九种目标认知偏见。对于场景x∈Xx\\in\\mathcal\{X\},有偏见的用户轮次是一个干预算子Iγx:x↦cγ\\mathcal\{I\}\_\{\\gamma\}^\{x\}:x\\mapsto c\_\{\\gamma\},它将嵌入偏见γ\\gamma的用户轮次前置到模型的上下文。主要估计量为:

Pr⁡\(Yxβ=1∣cγ\)−Pr⁡\(Yxβ=1∣c∅\),\\Pr\\\!\\bigl\(Y\_\{x\}^\{\\beta\}=1\\mid c\_\{\\gamma\}\\bigr\)\-\\Pr\\\!\\bigl\(Y\_\{x\}^\{\\beta\}=1\\mid c\_\{\\varnothing\}\\bigr\),即相对于零样本基线c∅c\_\{\\varnothing\},偏见β\\beta表达概率的变化。

### 3\.2偏见强度指标

我们采用Malberget al\.(2025 (https://arxiv.org/html/2608.05166#bib.bib13))的归一化比率指标。每个场景xx通过从LLM引出两个数值决策来评估:a1a\_\{1\}(对*控制*模板的响应,中性框架)和a2a\_\{2\}(对*处理*模板的响应,偏见诱导框架)。来自每个场景metric\_params的参考锚点y1,y2∈Ry\_\{1\},y\_\{2\}\\in\\mathbb\{R\}允许在不同量纲尺度之间进行比较。定义Δi=ai−yi\\Delta\_\{i\}=a\_\{i\}\-y\_\{i\}。偏见指标为:

m\(a1,2,y1,2,k\)=k⋅\(\|Δ1\|−\|Δ2\|\)max⁡\(\|Δ1\|,\|Δ2\|\),m∈\[−1,1\],m\(a\_\{1,2\},y\_\{1,2\},k\)=\\frac\{k\\cdot\\bigl\(\|\\Delta\_\{1\}\|\-\|\\Delta\_\{2\}\|\\bigr\)\}\{\\max\(\|\\Delta\_\{1\}\|,\|\\Delta\_\{2\}\|\)\},\\quad m\\in\[\-1,1\],\(1\)其中k∈\{−1,\+1\}k\\in\\\{\-1,\+1\\\}用于校正场景层面的方向。接近\+1\+1的值表示强偏见;接近0表示可忽略的偏见。a1a\_\{1\}和a2a\_\{2\}在每种条件下都会被引出,因此mm测量的是每个对话上下文内对场景框架的*差异敏感性*,而非原始决策值。

### 3\.3三条件评估设计

数据集
生成
场景xx
人类偏见γ\\gamma
LLM
生成器
T=1\.0T\{=\}1\.0
3模型
评审团
小组
场景xx
\|\|目标偏见β\\beta
\|\|人类偏见γ\\gamma
\|\|8个LLM
T=0\.0T\{=\}0\.0
无用户轮次
中性轮次
有偏见的轮次 \(γ\\gamma\)
用户:ctrl模板
助手:决策a1a\_\{1\}
用户:treat模板
助手:决策a2a\_\{2\}
用户:常见情境
用户:中性消息
助手:响应
用户:ctrl/treat⇒a1,2\\Rightarrow a\_\{1,2\}
用户:常见情境
用户:有偏见的消息 \(γ\\gamma\)
助手:响应
用户:ctrl/treat⇒a1,2\\Rightarrow a\_\{1,2\}
m∅m\_\{\\varnothing\}
mnm\_\{n\}
mbm\_\{b\}
存在效应Δn=\|mn\|−\|m∅\|\\Delta\_\{n\}=\|m\_\{n\}\|\-\|m\_\{\\varnothing\}\|
内容效应δ=\|mb\|−\|mn\|\\delta=\|m\_\{b\}\|\-\|m\_\{n\}\|
总效应Δb=\|mb\|−\|m∅\|=Δn\+δ\\Delta\_\{b\}=\|m\_\{b\}\|\-\|m\_\{\\varnothing\}\|=\\Delta\_\{n\}\+\\delta
图1:实验流程。对于每个(场景xx,目标偏见β\\beta,人类偏见γ\\gamma)三元组,LLM在三种条件下进行评估。偏见指标mm(式(1 (https://arxiv.org/html/2608.05166#S3.E1)))在每种条件下将控制决策a1a\_\{1\}与处理决策a2a\_\{2\}配对。分离了两种效应:单纯由对话格式引起的存在效应(\|mn\|−\|m∅\|\|m\_\{n\}\|\-\|m\_\{\\varnothing\}\|),以及由用户轮次偏见特定内容引起的内容效应(\|mb\|−\|mn\|\|m\_\{b\}\|\-\|m\_\{n\}\|)。总效应(\|mb\|−\|m∅\|\|m\_\{b\}\|\-\|m\_\{\\varnothing\}\|)是这两者之和。所有效应均为绝对偏见量级的差。一个有偏见的用户轮次混淆了两条因果路径:格式(任何用户轮次与无轮次)和内容(有偏见与中性)。中性条件在保持格式不变的同时改变内容,使得两条路径都可以分别估计;如果没有它,\|mb\|−\|m∅\|\|m\_\{b\}\|\-\|m\_\{\\varnothing\}\|无法单独归因于偏见内容。

对于每个(场景,人类偏见)对(x,γ)(x,\\gamma),指令微调LLM因此在三种条件下进行评估(图1 (https://arxiv.org/html/2608.05166#S3.F1)):

零样本 / 无用户轮次(m∅m\_\{\\varnothing\}):控制和治疗模板作为独立的单轮提示呈现,没有先前的上下文。这复现了Malberget al\.(2025 (https://arxiv.org/html/2608.05166#bib.bib13))的标准评估设计,并建立了模型的内在零样本偏见基线。

中性用户轮次(mnm\_\{n\}):构建一个多轮聊天上下文,其中无偏见的用户轮次先于决策提示。这将用户轮次在上下文窗口中的存在效应与任何偏见特定语义内容分离开来。

有偏见的用户轮次(mbm\_\{b\}):相同的多轮聊天结构,但上下文用户轮次表达了偏见γ\\gamma(经LLM作为评审团验证)。遵循标准聊天模板格式:

1. 1\.用户:常见情境前缀(在控制和处理之间共享的上下文)
2. 2\.用户:用户轮次(中性或有偏见,通过角色注入提示生成)
3. 3\.助手:LLM的中间补全(确认)
4. 4\.用户:模板分歧文本 + 决策提示 + 答案选项
5. 5\.助手:LLM的最终决策补全(a1a\_\{1\}或a2a\_\{2\})

步骤1–5在每种条件下运行两次,一次使用控制模板的分歧文本(引出a1a\_\{1\}),一次使用治疗模板的分歧文本(引出a2a\_\{2\})。由此产生的偏见分数mm反映了该对话前缀下的上下文框架敏感性。

### 3\.4效应分解

三种条件产生两个正交对比和一个复合对比,均基于绝对偏见量级进行定义:

存在效应:Δn=\|mn\|−\|m∅\|\\displaystyle\\quad\\Delta\_\{n\}=\|m\_\{n\}\|\-\|m\_\{\\varnothing\}\|\(2\)
内容效应:δ=\|mb\|−\|mn\|\\displaystyle\\quad\\delta=\|m\_\{b\}\|\-\|m\_\{n\}\|\(3\)
总效应:Δb=\|mb\|−\|m∅\|\\displaystyle\\quad\\Delta\_\{b\}=\|m\_\{b\}\|\-\|m\_\{\\varnothing\}\|\(4\),且Δb=Δn\+δ\\Delta\_\{b\}=\\Delta\_\{n\}\+\\delta。

存在效应衡量仅将上下文从无用户轮次转换为任何用户轮次(中性或偏见)所导致的偏见量级变化。内容效应衡量在保持多轮对话格式不变的情况下,将用户轮次的内容从无偏见(\[条件2\])替换为有偏见(\[条件3\])所导致的偏见量级变化。总效应是这两种机制的净结果,提供了对用户引导偏见诱导下模型行为的整体估计。

相似文章

大语言模型在CBT引导的情感推理中存在哪些不足?

arXiv cs.CL

本文探讨了大语言模型为何在理论上高度准确的情况下仍无法有效应用CBT原则,引入了一个知识引导框架和一种行为指标(协议杠杆力),用于衡量干预措施的转变。实验表明,即使采用多重思维链提示,模型仍偏向于验证与反思。

语言模型编码命题的语境真实性

arXiv cs.CL

本文研究了大语言模型(LLMs)如何将情境真值——即真值取决于上下文证据的命题——编码为激活空间中的线性方向,表明这些表征在不同输出策略下持续存在,并可通过对话方的断言而发生偏移,相关证据将表征偏移与谄媚行为联系起来。