查询时机导致LLMs与人类产生相反的位置偏差

arXiv cs.CL 论文

摘要

本文研究了查询时机如何影响LLMs与人类相比的位置偏差(首因效应和近因效应),发现LLMs会根据被查询的时间表现出相反的偏差,且较新的模型显示出更严重的效应。

arXiv:2608.12387v1 公告类型:新 摘要:诸如近因效应和首因效应等位置偏差已在大型语言模型(LLMs)中被记录,然而这些模型做出评估的潜在机制仍知之甚少。在人类对证据的评判中,首因偏差和近因偏差都已被观察到,但最近的研究表明,听者更新其信念的\emph{时机}——是在证据呈现期间还是仅在结尾——会影响此类效应的存在。我们研究了LLMs是否也存在类似现象,发现其与人类行为存在差异。与早期模型相比,这些偏差在较新的模型中更为严重。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:26

# 查询时机在LLM与人类之间产生相反的位置偏差
来源:https://arxiv.org/html/2608.12387

###### 摘要

大型语言模型(LLM)中已被记录到诸如近因效应和首因效应等位置偏差,然而这些模型做出评估的潜在机制仍然知之甚少。在人类对证据的判断中,*首因*偏差和*近因*偏差都曾被观察到,但最近的研究表明,听者更新信念的*时机*——是在证据呈现过程中还是只在结束时——会影响这类效应的存在。我们研究了类似现象是否也出现在LLM中,结果发现其与人类行为存在分歧。这些偏差在新模型中比在旧模型中更为严重。

查询时机在LLM与人类之间产生相反的位置偏差

Jasin Cekinmez\* Addison J. Wu\* Thomas L. Griffiths Princeton University

## 1 引言

大型语言模型不仅越来越多地被用于生成信息,还被用于代表我们做出决策(Li等,2024 (https://arxiv.org/html/2608.12387#bib.bib17);Zheng等,2023 (https://arxiv.org/html/2608.12387#bib.bib25))。随着LLM即法官(LLM-as-a-judge)系统在更多判断具有实际后果的领域中被采用(Li等,2024 (https://arxiv.org/html/2608.12387#bib.bib17)),评估它们能否作为公平可靠的评判者变得至关重要。具体来说,越来越多的文献发现了LLM评估中的位置偏差,即证据的呈现顺序会影响模型做出的判断(Schilcher等,2025 (https://arxiv.org/html/2608.12387#bib.bib4);Sun等,2025 (https://arxiv.org/html/2608.12387#bib.bib2);Wang等,2024 (https://arxiv.org/html/2608.12387#bib.bib22))。这些文献进一步证明了由LLM作为评判者辅助的评估工作流的脆弱性,包括随机性(Lee等,2025 (https://arxiv.org/html/2608.12387#bib.bib16))和自我偏好偏差(Panickssery等,2024 (https://arxiv.org/html/2608.12387#bib.bib26)),这些缺陷无法通过微调等简单干预手段可靠解决(Zhu等,2023 (https://arxiv.org/html/2608.12387#bib.bib27))。这种对证据顺序的敏感性引发了担忧:LLM是在依赖证据的实质性内容,还是在依赖虚假的结构性细节。虽然已有研究确立并部分揭示了这些偏差,但全面刻画*何时*这些特定偏差会影响LLM判断的工作仍然有限。理解这些位置偏差何时在LLM判断中显现,是负责任地扩展LLM即法官系统的前提。

在人类决策中,位置偏差——即证据提供顺序影响判断的效应——已被广泛记录(Murdock Jr, 1962 (https://arxiv.org/html/2608.12387#bib.bib24))。然而,以往关于决策中会出现何种位置偏差的结果相互矛盾。一些结果显示陪审团决定中存在*首因效应*(Dennis and Ahn, 2001 (https://arxiv.org/html/2608.12387#bib.bib19); Pennington, 1982 (https://arxiv.org/html/2608.12387#bib.bib18); Tetlock, 1983 (https://arxiv.org/html/2608.12387#bib.bib21); Wells等, 1985 (https://arxiv.org/html/2608.12387#bib.bib20))——也就是说,在某些研究中,当被告首先陈述其案情时,他们被认定有罪的可能性较低。然而,其他研究则发现*近因效应*是主要的偏差模式(Charman等, 2016 (https://arxiv.org/html/2608.12387#bib.bib7); Dahl等, 2009 (https://arxiv.org/html/2608.12387#bib.bib8); Furnham, 1986 (https://arxiv.org/html/2608.12387#bib.bib9); Maegherman等, 2022 (https://arxiv.org/html/2608.12387#bib.bib3))。

为了调和这些相互矛盾的结论,Qiao和Lagnado(2025 (https://arxiv.org/html/2608.12387#bib.bib15))表明,人类中哪些位置偏差会显现,受到人们被要求给出即时信念预测的时机影响。两种常见的回答模式是:在结束时要求给出最终判断,称为序列结束(End-of-Sequence, EoS)回答;以及在呈现新证据时要求给出中间判断,称为逐步(Step-by-Step, SbS)回答(Hogarth and Einhorn, 1992 (https://arxiv.org/html/2608.12387#bib.bib6); Kerstholt and Jackson, 1998 (https://arxiv.org/html/2608.12387#bib.bib5); Qiao and Lagnado, 2025 (https://arxiv.org/html/2608.12387#bib.bib15))。Qiao和Lagnado(2025 (https://arxiv.org/html/2608.12387#bib.bib15))发现,人们在SbS回答模式下表现出位置偏差——通常是近因偏差——而在EoS回答模式下则没有总体偏差。

在上述工作的基础上,我们考察了LLM评估中EoS和SbS两种回答模式下的顺序效应。我们基于Qiao和Lagnado(2025 (https://arxiv.org/html/2608.12387#bib.bib15))引入的范式,该范式在单一指控情境中研究人类中的这些效应。我们将该范式扩展到三个不同的指控情境,以更好地理解这些顺序效应和回答模式效应是否能在原始情境之外推广。通过这样做,我们旨在评估人类认知中观察到的顺序效应是否也在不同情境下的LLM判断中显现。此外,这一设计使我们能够更好地理解LLM中偏差的演化性质,考察这些偏差在不同模型以及连续模型迭代中是否保持稳定或发生变化。

## 2 方法论

### 2.1 概述

我们采用Qiao和Lagnado引入的实验框架,研究信息以不同方式输入LLM对多个指控情境的影响。我们考察了SbS与EoS回答模式如何影响LLM做出的最终判断,以及每种回答模式下证据的顺序如何影响最终判断。我们的分析涵盖开源和闭源模型。我们有意考虑了三个独立的指控领域,以评估Qiao和Lagnado观察到的趋势是否推广到其他领域。此外,之所以使用指控情境,是因为这些领域中的条件概率问题允许对个体存在隐含的因果关联,这使得该领域成为分析LLM如何形成判断的重要领域。

### 2.2 数据集与提示

我们在实验中使用三种不同的指控情境:刑事、学术和社交。刑事情境涉及一起凶杀案,取自Qiao和Lagnado。社交不端情境涉及判断一名员工是否造成了财产损坏,而学术不端情境则涉及判断一名学生是否实施了学术不诚实行为。社交和学术不端情境的设计旨在模仿Qiao和Lagnado的结构。对于所有三种情境,我们均包含一份中立的案件摘要,总结案情,以及四项控方证据和四项辩方证据。

我们使用两类问题评估LLM行为。第一类问题以个体实施或未实施该行为为条件,然后基于该假设询问所陈述的一件或多件证据出现的可能性有多大。第一类问题成对出现:第一个问题以未犯罪为条件,询问该证据的可能性;第二个问题采用相同格式,但以犯罪为条件。第二类问题由最终裁决问题组成。第一个问题以所有证据为条件,询问该人有罪的可能性;最后一个问题要求对该人做出裁决(有罪/无罪)(见附录A)。

### 2.3 流程

对于每个LLM和三种指控情境中的每一种,我们运行四个实验:先控方后辩方的SbS(PD)、SbS(DP)、EoS(PD)和EoS(DP)。对于每个实验,我们执行30次独立运行,以考虑LLM判断中的变异性,并通过将有罪结果数除以30来计算有罪判决的比例。

SbS和EoS之间的关键区别在于证据如何呈现给模型。在SbS条件下,证据按顺序提供:模型先看到一条证据,随后回答两个条件概率问题,然后再接收下一条证据。相比之下,在EoS条件下,一方所有证据一次性呈现,随后回答两个问题,再进入另一方。

在所有实验中,LLM都会收到一份案件摘要。对于两种回答模式,每次运行中控方和辩方证据组内的证据都会被随机排列。然后,根据分配的回答模式和证据顺序给出证据和中间问题。在所有证据呈现完毕后,模型被问及两个最终问题。倒数第二个问题询问在给定所有证据的情况下,该人有罪的可能性;最后一个问题则询问该人是否有罪(有罪/无罪)。

我们跨开源和闭源LLM,以及旧版和较新版本的模型进行这些实验,以考察回答模式偏差是否因模型可获取性、发布时间或模型特有性质而有所不同。

## 3 结果

表1:学术不端行为的判决比例。注:**加粗**条目表示在一种提示方法内“有罪”判决比例存在统计学显著差异。*\*星号*\*条目表示EoS提示比SbS提示产生更放大的偏差。表2:社交不端行为的判决比例。表3:刑事不端行为的判决比例。

### 3.1 总体趋势

我们采用两阶段Fisher精确检验来评估0.05水平下的统计学显著性。首先,我们检验在每种回答模式内,DP和DP两种顺序之间的比例差异是否具有统计学显著性。如果两种顺序效应均具有统计学显著性,我们再检验EoS和SbS之间这些差异的差异。为了对跨模型和情境的多重比较进行校正,我们应用了Benjamini–Hochberg校正;结果仍然显著。

Qiao和Lagnado发现,人类在SbS回答模式下表现出近因偏差,而在EoS回答模式下没有偏差。然而,我们在LLM中观察到了相反的模式。对于大多数模型,SbS条件下的顺序效应不具有统计学显著性,而EoS条件下具有统计学显著性,具体而言是近因偏差。为了排除上下文长度作为混杂因素——并更好地近似人类记忆限制,因为与LLM不同,人类无法完美回忆较早的证据——我们运行了一个压缩版SbS消融实验,将先前的回答替换为其数值分数。结果显示偏差同样极小,表明SbS顺序效应并非提示长度的伪影(见附录B (https://arxiv.org/html/2608.12387#A2))。此外,即使两种回答模式的顺序效应均具有统计学显著性,EoS顺序效应在幅度上的统计学显著性仍比SbS顺序效应更为显著(表1、2、3)。

这一趋势的一个例外是Gemini 2.5 Flash,它在两种回答模式下均未表现出统计学显著的顺序效应。此外,开源模型的顺序效应和回答模式偏差不如GPT和Claude一致。总体而言,EoS近因偏差在GPT和Claude模型中于所有三种情境中均稳健成立(表1、2、3)。

请参阅图注
图1:GPT模型系列在刑事不端情境中有罪判决比例的变化
请参阅图注
图2:Claude模型在刑事不端情境中有罪判决比例的变化

### 3.2 模型家族内部偏差的出现

如第3.1节所述,我们采用相同的统计检验来评估顺序效应之间的差异是否具有统计学显著性。对于GPT 3.5 Turbo,我们发现两种回答模式下均无统计学显著的顺序效应。相比之下,GPT 4o在EoS回答模式下表现出统计学显著的近因偏差(图1)。Claude模型也观察到类似的进展:Claude 3 Haiku和Claude 3.5 Haiku在两种回答模式下均无统计学显著的顺序效应;然而,后续模型——Claude 3.7 Sonnet、Claude 4 Sonnet——均在EoS回答模式下表现出近因偏差。总之,这些结果表明LLM中的顺序效应偏差并非静态(图2)。相反,LLM从无顺序效应演变为表现出统计学显著的顺序效应,且这些效应可能以不同方向和回答模式显现。

### 3.3 与内部贝叶斯概率更新的(错误)对应

(a) GPT-4o在两种SBS条件下对谋杀案的有罪概率判断更新

为了初步理解为什么LLM在SBS条件下的最终裁决判断中没有表现出强烈的近因偏差(与人类参与者观察到的结果相反),我们分析了每条证据揭示后LLM输出的有罪概率。

在两种证据顺序下,GPT-4o经常给出*无罪*的最终裁决。然而,这种最终决定表面上的稳定性掩盖了实质性的中间信念更新。具体而言,模型报告的有罪概率随着单个证据项而系统性增加或减少,表现出对指控性和开脱性信息的明显敏感性,因为信息是依次呈现的(图3)。

尽管存在这些中间信念转变,报告的有罪概率的方向或幅度变化并未反映在最终判断中,尤其是在DP方向(图3a)中,这表明在SbS提示下,信念报告与决策之间存在分离。这与简单的阈值化解释相矛盾,按照阈值化解释,最终裁决应反映最终概率估计。

## 4 结论

总体而言,我们发现LLM表现出的位置偏差与人类认知中观察到的不同。人类倾向于在SbS回答模式下显示近因效应,而许多LLM反而在EoS回答模式下表现出近因偏差。这种模式在GPT和Claude模型中最为强烈,在开源模型中不太明显,在Gemini 2.5 Flash中则不存在。此外,我们的结果揭示了模型家族内部的单调趋势:连续迭代始终从无统计学显著的顺序效应发展为表现出显著的位置偏差,正如GPT(3.5→4o)和Claude(3→3.5 Haiku→3.7→4 Sonnet)谱系中所见。

这些发现凸显了在部署LLM作为评估者时需要谨慎,尤其是在判断应不受证据顺序或回答格式影响的高风险场景中。尽管更长的上下文评估可能会导致出现不同的偏差,但我们在此不追求这种扩展,因为在当前实验条件下观察到的偏差已经很明显。

对于未来方向,重要的是探索在回答模式和证据排序层面的干预措施,以产生更一致的判断。此外,应用机械可解释性技术可能有助于揭示导致这些偏差的过程,为LLM评估为何一开始就与人类顺序推理相背离提供洞见。

## 局限性

我们的研究使用了受控的指控情境。

相似文章

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。

思考越多,偏见越大:推理模型中由长度驱动的位置偏见

arXiv cs.AI

本研究论文探讨了推理模型中的位置偏见,发现偏见并非随着“更多思考”而消除,而是与推理轨迹的长度成正比。该研究提供了因果证据,并提供了一套诊断工具包,用于审核多选问答评估中这种由长度驱动的偏见。