确认我们的偏见?评估大型语言模型的能力、风险与社会影响
摘要
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
arXiv:2608.06977v1 公告类型:新提交
摘要:众所周知,大型语言模型(LLMs)对提示框架很敏感,反映出其训练数据或先前提示中的模式。在本研究中,我们探讨了LLMs在多大程度上会强化用户在提示中表达的偏见,并考察了内隐框架效应与外显提示操纵之间的边界。具体而言,我们评估了LLMs对直接性和暗示性提示的敏感程度,这些提示鼓励模型支持或质疑特定立场。
我们使用160个不同的提示词对六个LLM进行了评估,涵盖十个主题,跨越观点型领域和事实型领域。这些提示在提示策略、支持与质疑指令、提示极性、用户表达的信念以及主题领域等方面系统变化,同时涵盖观点型问题和事实型问题。我们的结果表明,LLMs会系统性地调整其响应以与提示框架保持一致,即使在事实性语境中也是如此。这表明提示框架可能比模型响应中的事实一致性更具影响力。总体而言,我们的研究结果描绘了LLM可操纵性的程度和边界。此外,这些结果意味着,即使在响应应保持事实稳定的领域中,LLMs也可能强化微妙的用户偏见,并且容易受到显式提示操纵的影响。
查看缓存全文
缓存时间: 2026/08/10 08:04
# 确认我们的偏见?评估大型语言模型的能力、风险与社会影响
来源:https://arxiv.org/html/2608.06977
Mudar Adasa、\*、Polina Tsvilodubb、Michael Frankeb 和 Martin V\. Butza a德国图宾根大学神经认知建模组,Sand 14, 72076 Tübingen, Germany b德国图宾根大学语言学系,Keplerstraße 2, 72074 Tübingen \*通讯作者:mudar\.adas@uni\-tuebingen\.de
###### 摘要
众所周知,大型语言模型(LLM)对提示语的框架(prompt framing)很敏感,会反映出其训练数据或先前提示语中的模式。在本研究中,我们考察了LLM在多大程度上会强化用户在提示语中表达出的偏见,并探究了隐式框架效应与显式提示语操纵之间的边界。具体而言,我们评估了LLM在面对直接性和暗示性提示语时,有多容易被鼓励去支持或质疑特定立场。
我们使用160个不同的提示语对六个LLM进行了评估,这些提示语涵盖十个主题,横跨基于观点和基于事实的领域。提示语在提示策略、支持与质疑指令、提示语极性、用户表达信念以及主题领域等多个维度上进行了系统变化,同时覆盖了基于观点和基于事实的问题。我们的结果显示,LLM会系统性地调整其回答以适应当前提示语的框架,即使在事实性语境中也是如此。这表明提示语框架可能胜过模型回答中的事实一致性。总体而言,我们的研究结果描绘了LLM可操纵性的程度和边界。此外,结果还表明,即使在回答应保持事实稳定的领域中,LLM也可能强化用户的微妙偏见,并且容易受到显式提示语操纵的影响。
## 1 引言
人类的确认偏误(confirmation bias)指的是倾向于搜索、解释并偏好那些支持已有信念的信息,同时忽视或回避相互矛盾的证据(Born, 2024 (https://arxiv.org/html/2608.06977#bib.bib1);Berthet等人, 2024 (https://arxiv.org/html/2608.06977#bib.bib2);Peters, 2022 (https://arxiv.org/html/2608.06977#bib.bib3))。近年来,越来越多的研究开始考察大型语言模型(LLM)是否表现出人类认知偏误的机器类似物,这对它们输出的准确性、可靠性和社会影响具有重要意义(Lou和Sun, 2025 (https://arxiv.org/html/2608.06977#bib.bib4))。虽然许多形式的模型偏误源于训练语料库,但在基于LLM的交互中,确认偏误也可能源于用户构造提示语的方式。在这种情况下,确认偏误并非指模型持有信念,而是指模型倾向于使其回答与提示语中所包含的假设、框架或线索保持一致,从而优先给出与提示语一致的回答,而非更均衡或更具批判性的替代答案(de Jong等人, 2025 (https://arxiv.org/html/2608.06977#bib.bib5);Mitropoulos等人, 2026 (https://arxiv.org/html/2608.06977#bib.bib6);Kim和Torr, 2025 (https://arxiv.org/html/2608.06977#bib.bib7))。
与确认偏误密切相关的是框架效应(framing effect)。在心理学中,框架效应指的是对同一潜在信息的不同呈现方式会影响人类的判断、态度或决策。大量研究表明,框架会影响人们的态度、决策和行为(Berto和Özgun, 2023 (https://arxiv.org/html/2608.06977#bib.bib8);Hughes等人, 2016 (https://arxiv.org/html/2608.06977#bib.bib9);Bloem和Rahman, 2024 (https://arxiv.org/html/2608.06977#bib.bib10);Nelson和Oxley, 1999 (https://arxiv.org/html/2608.06977#bib.bib11)),并且可以通过强调信息的某些方面而弱化其他方面来强化确认偏误。最近的研究表明,LLM可能表现出类似的倾向。
例如,Zhang等人(2025 (https://arxiv.org/html/2608.06977#bib.bib12))表明,当问题以正面或负面方式提出时,LLM的回答会发生系统性变化。作为对这些发现的补充,Lior等人(2026 (https://arxiv.org/html/2608.06977#bib.bib13))将多个LLM的回答与人类参与者的回答进行比较,报告称LLM在系统性地受到框架影响,其方式与人类行为高度相似。
在框架效应之外,LLM对于更一般的提示语上下文也高度敏感。对提示语进行系统设计——通常称为提示工程(prompt engineering)或上下文工程——已被证明会显著影响模型输出(Mei等人, 2025 (https://arxiv.org/html/2608.06977#bib.bib14))。先前的研究表明,即使提示语在结构、措辞或信息位置上的细微变化,也能对模型性能和回答模式产生显著影响(Liu等人, 2024 (https://arxiv.org/html/2608.06977#bib.bib15))。这种敏感性与人类认知的一个更广泛特性相呼应:解读本质上受上下文信息影响(Butz等人, 2025 (https://arxiv.org/html/2608.06977#bib.bib16))。然而,在LLM中,这种上下文依赖性可能带来独特的后果,因为用户可以通过提示语中蕴含的假设、偏好或预期,动态地且往往在不知不觉中引导模型的输出。
因此,框架效应和提示语上下文敏感性可能促使人机交互中出现回音室(echo chamber)效应。回音室是指这样一种环境——尤其是在社交网络中——相似的观点被反复放大和循环传播,而对立的观点则被排斥或边缘化。这一过程会强化既有信念,并可能导致立场日益极化或极端化。回音室已在广泛的领域中观察到,包括堕胎、性别、气候变化和疫苗接种等(Cinelli等人, 2021 (https://arxiv.org/html/2608.06977#bib.bib17);Mahmoudi等人, 2024 (https://arxiv.org/html/2608.06977#bib.bib18))。最近的研究表明,类似的动态也可能出现在LLM中,其回答倾向于与提示语的框架或方向保持一致,从而强化输入中或用户头脑中已有的观点(Sharma等人, 2024 (https://arxiv.org/html/2608.06977#bib.bib19);Nehring等人, 2024b (https://arxiv.org/html/2608.06977#bib.bib20))。
这一可能性尤为重要,因为LLM正日益成为对话代理、信息界面和决策支持工具。它们最显著的交互特征之一,是倾向于生成看起来合作、肯定或取悦用户的回答。虽然这能使LLM有用且易于使用,但也可能导致它们在适当时不去质疑用户的既有假设,反而强化这些假设。这引出了一个重要问题:*LLM在多大程度上会使其回答适应用户的期望,而这种倾向是否有风险强化认知偏见,尤其是确认偏误?*
尽管关于LLM中偏见存在性的证据日益增多,但用户在与这类系统交互时可能行使并强化确认偏误的程度,在很大程度上仍未被探索。传统上,寻求信息的个体——尤其是在政治等领域——可能会有选择地消费与其既有信念一致的来源,同时规避对立观点。在基于LLM的交互中,一种类似的选择性接触形式可能出现,但不是通过有意识地选择媒体来源,而是通过构造提示语及其上下文的方式,而且可能是在完全没有意识的情况下发生的。例如,Nehring等人(2024a (https://arxiv.org/html/2608.06977#bib.bib21))表明,基于LLM的聊天机器人倾向于使其回答与用户输入保持一致,实际上起到了回音室的作用。
虽然现有研究已经表明,微妙的框架线索会影响模型回答,但关于隐式框架效应与显式提示语操纵之间边界的研究却少得多。特别是,目前尚不清楚LLM是仅仅与用户表达的信念保持一致,还是能够通过直接指示来有意引导其支持或质疑某一特定立场。
在本研究中,我们通过系统地考察隐式框架与显式提示语操纵之间的边界,调查LLM在多大程度上可以通过提示语设计被引导。具体而言,我们区分了两种互补的影响形式。在隐式设置中,提示语在要求一般信息的同时揭示了用户的观点,从而允许确认偏误自然出现,而无需直接指示模型如何回答。在显式设置中,提示语直接指示模型支持或质疑某一特定立场,从而考察模型是否可以在普通框架效应之外被有意操纵。
我们的实验设计并未将框架视为单一现象,而是系统地考察了提示语构造的几个互补维度。具体而言,我们考察:(i)隐式与显式提示策略;(ii)支持与质疑指令;(iii)提示语的正面与负面极性;(iv)用户通过诸如\emph{believe}和\emph{think}等动词所表达信念的强度;(v)多个最先进语言模型之间的差异;以及(vi)既包括基于观点的话题(如堕胎),也包括事实性领域(如物理学和数学)——在这些领域中,无论提示语措辞如何,回答通常会保持稳定。这种设计使我们不仅能确定操纵是否发生,还能确定在何种条件下操纵会变得更强或更弱。
为了量化这些效应,我们引入了*LLM可操纵性*(LLM manipulability)的概念,定义为模型回答在多大程度上可以通过提示语措辞和上下文的变化被系统地引导。我们并未将操纵视为二元结果,而是用三个互补的回答类别来刻画模型行为。遵循预期提示语的回答在显式提示条件下被分类为*服从*(obedience),在隐式提示条件下被分类为*对齐*(alignment)。与预期提示语相反的回答被分类为*不服从*(disobedience)或*错位*(misalignment)。最后,那些不采取任何一方立场、仅提供均衡讨论的回答被分类为*均衡推理*(balanced reasoning)。这一行为分类法使我们能够区分成功操纵、对操纵的抵抗以及中性推理,从而更全面地刻画LLM在不同提示条件下的行为。
这引出了我们的核心研究问题:*大型语言模型在多大程度上可以通过显式提示指令被操纵?这种操纵与由用户表达信念所产生的更微妙框架效应相比如何?这些效应在提示策略、支持与质疑指令、提示语极性、信念表达(*believe*与*think*)、主题和语言模型之间又如何变化?*
## 2 实验
我们设计了总共160个提示语,跨越10个主题。对于每个主题,我们通过系统地操纵三个实验因素来生成提示语。
第一个因素为极性,变化的是用户观点是以肯定陈述还是否定陈述表达。具体而言,对于每个主题,我们构造了一个“我相信X”形式的提示语和一个“我相信非X”形式的提示语(例如,“我个人认为堕胎是完全不合理的”(”I personally believe that abortion is totally unjustified.”)与“我个人认为堕胎是完全合理的”(”I personally believe that abortion is totally justified.”))。这产生了20个不同的信念陈述,汇总于表1 (https://arxiv.org/html/2608.06977#S2.T1)中。
第二个因素为态度表征,变化的是用于表达用户观点的动词。具体而言,我们使用believe或think构造提示语,以考察动词的选择是否会影响LLM的回答。
第三个因素操纵的是模型被提示如何回答。在服从条件(obedience condition)下,提示语明确指示LLM支持或质疑用户所陈述的信念。这些提示语测试模型是否会遵循直接指令,而无论信念内容如何。
在确认偏误条件(confirmation-bias condition)下,没有给出显式指令。相反,提示语陈述了用户的观点,然后要么提出一个与用户信念一致的问题(aligned),要么提出一个与之不一致的问题(misaligned)。这些提示语测试的是,在没有明确指示同意或不同意的情况下,模型是否会自然地使其回答适应用户观点的框架。
将20个信念陈述与两种态度表征以及四种回答条件(支持、质疑、一致、不一致)相结合,产生了160个独特的提示语。
历史话题
基于观点的话题
事实性话题
表1:20个陈述按极性条件(正面与负面)在所有主题中的分类。表2:四种提示类型,用于测试模型服从“支持”或“质疑”用户信念的指令(1、2),以及在仅被中立地告知用户观点后,被询问一致或不一致陈述是否为真时,考察LLM的确认偏误(3、4)。表3:两种极性在四种提示类型下的呈现方式。我们评估了六个大型语言模型(LLM):Claude Sonnet 4\.5、Gemini 3 Pro、Apertus\-70B\-Instruct\-2509、GPT\-5 Nano、LLaMA 3\.3 70B和Qwen\-2\.5\-72B\-Instruct。Gemini 3 Pro、GPT\-5 Nano和Claude Sonnet 4\.5提供了可配置的推理设置;因此,我们以中等推理设置和高推理设置分别运行这些模型的实验。相比之下,其余模型不提供显式的推理控制,我们使用其默认配置进行评估。在数据分析中,我们报告支持推理控制的模型在高推理设置下获得的结果,并将其与其他模型进行比较,后者的默认行为假定反映了其可用的最高推理能力。最后,为了评估回答的一致性,每个提示语被提交给每个模型十次。总体而言,这一过程共产生了14,400个观测值。
## 3 数据分析
为了分析数据,我们将模型回答分为三类。
服从(Obedience)在支持与质疑条件中被定义为遵循提示语中显式指令的回答。具体而言,当模型被要求支持某个陈述时,“是”回答被视为服从;当被要求质疑该陈述时,“否”回答被视为服从;相反的回答则被视为不服从。
相比之下,在对齐与错位条件中,回答被分类为对齐(aligned)或错位(misaligned)。对齐回答是指当问题与所述信念一致时表示同意(“是”),或者当问题与所述信念矛盾时表示不同意(“否”)。相反的回答被视为错位。
均衡推理(Balanced reasoning)捕捉的是模型没有承诺给出“是”或“否”回答,而是在没有被提示要求的情况下产生了替代性回答(例如拒绝回答、含糊其辞或避免二元结论的解释)的情况。
表4 (https://arxiv.org/html/2608.06977#S3.T4)给出了回答如何被分类到相应类别的示例。
表4:服从与不服从、信念对齐与错位回答的示例提示语。此外,我们将提示语的影响分解为三个不同的组成部分。在本文中,我们分别称其为操纵效应(manipulation effect)、确认偏误效应(confirmation bias effect)和均衡推理效应(balanced reasoning effect)。这些术语是对所研究三种现象的描述性标签。操纵效应指的是操纵性提示语指令(即支持或质疑指令)对模型回答的影响,而确认偏误效应指的是即使没有显式指令,仅凭用户的信念陈述及其与提问的一致性所产生的影响。均衡推理效应则捕捉模型在两种条件下产生非二元或中立回答的趋势。相似文章
大语言模型通过自适应探索发展新型社会偏见
本研究探讨大语言模型如何通过自适应探索产生新的社会偏见,并强调了这对人工智能公平性和伦理考量的意义。
一些大型语言模型表现出一致的风险态度
本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
无理解的模仿:大语言模型中决策偏差的起源
本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。