大型语言模型的是-否偏差反映答案顺序和措辞,而非道德判断的转变

arXiv cs.CL 论文

摘要

本文介绍了一种心理测量工具,用于将语言模型的框架伪影与真实的道德判断区分开来。研究发现,前沿模型具有一致的内在道德尺度,但表现出的是/否偏差纯粹是答案顺序和措辞的表层伪影,而非真正的拒绝倾向。

arXiv:2607.05552v1 公告类型:新 摘要:大型语言模型(LLM)越来越多地做出被视为二元判决的判断,且越来越多的文献报告称,这些判断会在逻辑上无关的措辞变化下发生转变——其中包括在道德困境中出现的、人类所没有的增强的是-否偏差。单一的框架无法说明这种转变是什么:在是/否问题中,“否”这个词同时是逻辑判决、词汇标记和最后一个打印的选项。我们引入了一种心理测量工具来区分这些因素:交叉对称化——在问题形式的语料库中,将每个逻辑上无关的因素以平衡对的形式翻转。通过对逻辑等价形式进行分级评分,可以恢复一致的内在道德尺度:前沿模型的立场 $\theta$ 几乎与格式无关(在 $\pm 1$ 轴上,跨形式不一致性为 0.12-0.21);小型开放权重模型则以模型特定的方式失败。通过是/否强制判决会叠加一个可分解的伪影:对最后一个打印选项的顺序偏好——与经典的人类首因效应相反——加上对“否”字的词汇吸引;该伪影仅在 Claude 模型中显著(故事平均为 -0.32 到 -0.86),对于 GPT-5.5 和 Gemini 约为 $0$,并在扩展推理下缩小。单词和判决共享一个标记;用任意标签替换单词可将它们分离,而对于每个前沿模型,与判决相关的逻辑偏差证明约为 $0$,而模型特定的标签和顺序依附仍然存在:模型并不倾向于拒绝——吸引力跟随打印的表面,而非其所携带的判决。一个最小模型 $P = \sigma((\theta \pm m)/s)$ 通过框架敏感性 m 和道德决定性 s 总结了任何此类伪影,且与采样温度可测量地不同。该工具可不变地应用于任何困境集和二元格式:衡量模型重视什么需要交叉问题的框架,而非只问一次。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:41

# 大型语言模型的“是–否”偏差反映了答案顺序和措辞,而非道德判断的转变 来源: https://arxiv.org/html/2607.05552

###### 摘要  
大型语言模型 (LLMs) 越来越多地做出被视为二元判决的判断,且越来越多的文献报告称,这些判断会因逻辑上无关的措辞变化而发生变化——其中一种在人类中不存在的、在道德困境上被放大的“是–否”偏差尤为突出。单一的表述框架无法说明这种变化*是*什么:在一个是/否问题中,“否”这个词同时是逻辑判决、词汇标记和最后打印的选项。我们引入了一个心理测量工具集来分离这些因素:交叉对称化——每一对逻辑上无关的因素都按平衡配对翻转——应用于一个由问题形式组成的语料库。在逻辑等价的形式之间进行分级评分,可以恢复一个连贯的内在道德尺度:前沿模型的立场 θ 几乎与格式无关(在 ±1 轴上的跨形式不连贯性为 0.12–0.21);小型开源模型则以各自特有的方式失败。通过是/否格式强制输出判决,会叠加一个可分解的人为产物:倾向于最后打印选项的**顺序偏差**(与经典的人类首因效应相反),加上倾向于“否”这个词的**词汇拉力**;该人工产物仅在 Claude 模型中显著(故事平均为 −0.32 到 −0.86),对于 GPT-5.5 和 Gemini 约为 0,并在扩展推理下缩小。该词与判决共享同一个词元;将答案标签替换为任意标签可将两者分离,且附加在判决上的**逻辑偏差**对每个前沿模型均约为 0,而模型特定的**标签**和**顺序**依附仍然存在:模型并非倾向于拒绝——其拉力跟随打印的表面形式,而非其所承载的判决。一个最小模型 P = σ((θ ± m)/s) 通过框架敏感性 m 和道德决断力 s 总结了任何此类人工产物,且这两者与采样温度在可测量上有所不同。该测量工具集可原封不动地应用于任何困境集和二元格式:测量一个模型的价值需要交叉变换问题的框架,而非只问一次。

**意义声明。** 语言模型越来越多地做出或影响判断,因此评估必须将模型重视的内容与问题提出方式带来的人为产物区分开来。我们发现,前沿语言模型拥有一个惊人连贯的内在道德尺度:在逻辑等价的重新措辞下,道德困境的分级评分几乎不变。然而,通过是/否格式强制输出同样的判断,会叠加一个巨大的格式人工产物——一种倾向于最后打印选项和“否”这个词的拉力——这很容易被解读为说“不”的倾向。但事实并非如此:使用任意的答案标签时,附加在判决上的偏差消失;拉力跟随打印的标签。两个可解释的数字——框架敏感性和道德决断力——总结了该人工产物,而审慎思考通常能缩小它。测量一个 AI 重视什么需要交叉变换问题的框架,而非只问一次。

**关键词:** 大型语言模型 || 道德判断 || 心理测量学 || 框架效应 || 人工智能评估

一个智能体对道德困境的排序取决于问题如何被提出。在人类中,这种框架敏感性虽然真实存在但较为温和[1 (https://arxiv.org/html/2607.05552#bib.bib1),2 (https://arxiv.org/html/2607.05552#bib.bib2),3 (https://arxiv.org/html/2607.05552#bib.bib3),4 (https://arxiv.org/html/2607.05552#bib.bib4),5 (https://arxiv.org/html/2607.05552#bib.bib5),6 (https://arxiv.org/html/2607.05552#bib.bib6),7 (https://arxiv.org/html/2607.05552#bib.bib7),8 (https://arxiv.org/html/2607.05552#bib.bib8)];而在大型语言模型 (LLMs) 中,这种敏感性则很严重——道德和社会判断会因不携带任何逻辑内容的措辞、选项顺序和答案格式的变化而改变[9 (https://arxiv.org/html/2607.05552#bib.bib9),10 (https://arxiv.org/html/2607.05552#bib.bib10),11 (https://arxiv.org/html/2607.05552#bib.bib11),12 (https://arxiv.org/html/2607.05552#bib.bib12),13 (https://arxiv.org/html/2607.05552#bib.bib13),14 (https://arxiv.org/html/2607.05552#bib.bib14),15 (https://arxiv.org/html/2607.05552#bib.bib15),16 (https://arxiv.org/html/2607.05552#bib.bib16),17 (https://arxiv.org/html/2607.05552#bib.bib17),18 (https://arxiv.org/html/2607.05552#bib.bib18),19 (https://arxiv.org/html/2607.05552#bib.bib19),20 (https://arxiv.org/html/2607.05552#bib.bib20),21 (https://arxiv.org/html/2607.05552#bib.bib21),22 (https://arxiv.org/html/2607.05552#bib.bib22),23 (https://arxiv.org/html/2607.05552#bib.bib23)]。其影响是实际存在的:一个模型的判断通常被解读为二元判决——一个安全门、一项调查的强制选择、一个评判模型的批准/拒绝[24 (https://arxiv.org/html/2607.05552#bib.bib24),25 (https://arxiv.org/html/2607.05552#bib.bib25),26 (https://arxiv.org/html/2607.05552#bib.bib26),27 (https://arxiv.org/html/2607.05552#bib.bib27),18 (https://arxiv.org/html/2607.05552#bib.bib18)]——因此,一个发生了变化的判决*意味着*什么,决定了评估测量了什么:是道德判断的改变、对某个答案词的偏好、还是对页面上某个位置的拉力。LLMs 的两个特性使得这个问题变得紧迫,并使得简单的补救措施失效。重复无济于事:在温度为 1 时,单个形式的多个副本几乎一致,而逻辑等价形式之间的方差则可能高出多达一个数量级(方法部分)[28 (https://arxiv.org/html/2607.05552#bib.bib28),29 (https://arxiv.org/html/2607.05552#bib.bib29)]。因此,对一种表述进行重采样会低估真正重要的变异性,而这种变异性是巨大的:LLMs 对表面形式高度敏感[15 (https://arxiv.org/html/2607.05552#bib.bib15),16 (https://arxiv.org/html/2607.05552#bib.bib16),17 (https://arxiv.org/html/2607.05552#bib.bib17),21 (https://arxiv.org/html/2607.05552#bib.bib21)],因此为人类设计的问卷(人类只需要少量框架)并不适用。我们构建了测量所需的工具:一个心理测量工具集,其核心操作是**交叉对称化**——每次逻辑上无关的扰动都以平衡的翻转配对形式应用,这些扰动相互交叉,使得它们的贡献可分——并在一系列逻辑等价的问题形式上重复。单个形式,即使经过对称化,也是一个有噪声的仪器;一系列形式才构成一次测量。最尖锐的实例,也是后续所有讨论的锚点,来自 Cheung、Maier 和 Lieder 的发现[9 (https://arxiv.org/html/2607.05552#bib.bib9)]:在匹配的道德困境上,LLMs 表现出放大的认知偏差——其中一种是在人类比较中不存在的**是–否偏差**:模型的判决会随着是/否问题中逻辑上无关的特征而发生远超人类的变动——并且对每个项目进行数百次重采样并未平均掉这种变动。我们将该发现视为已确立的事实,并追问这种变动是由什么组成的。当模型的判决倾向于“否”时,模型是被最后打印的选项吸引(**顺序**偏差)?是被这个词本身吸引(**词汇**偏差)?还是被否定的判决吸引(**逻辑**偏差)?重复无法区分这些,任何单一的表述也无法,无论其选择多么谨慎:在标准问题——“...回答是或否”——中,这三个因素在同一个词元上重合。大多数价值探测评估正是通过这种方式——一种固定的表述[24 (https://arxiv.org/html/2607.05552#bib.bib24),30 (https://arxiv.org/html/2607.05552#bib.bib30),31 (https://arxiv.org/html/2607.05552#bib.bib31),32 (https://arxiv.org/html/2607.05552#bib.bib32),33 (https://arxiv.org/html/2607.05552#bib.bib33)]或少数几种不改变情景实质的格式或顺序变体[34 (https://arxiv.org/html/2607.05552#bib.bib34),35 (https://arxiv.org/html/2607.05552#bib.bib35),36 (https://arxiv.org/html/2607.05552#bib.bib36),10 (https://arxiv.org/html/2607.05552#bib.bib10)]——来引出每个判断;然而,无论这种设计如何精确地测量了变动,只有交叉变换才能归因于它——将问题的动词、答案的打印顺序以及携带判决的标签分开。该工具集通过三种工具提出相同的二十个困境——其中十九个直接来自 Cheung 等人的材料,因此立场轴和人类锚点仍然可比(方法部分)。分级评分 (I-1) 在交叉的、逻辑等价的形式下引出道德可接受性:两个量表(0–10 和 0–100),两种锚定方向,三种措辞,以及行为的两极(评价行为及其补集)。双选自由选择 (I-2) 引出没有量表的承诺性决策。强制二元 (I-3) 引出是/否式的判决,通过对问题的动词(赞成/反对)、答案选项的打印顺序以及答案标签本身(即“是/否”词汇、任意标签、标记和符号以及其他语言的“是/否”词汇)进行交叉变换。在整个过程中,翻转对的对称部分估计立场;反对称部分则是人工产物;而交叉变换将人工产物归因于命名的来源。该工具中没有任何内容是这些故事特有的——该工具集可原封不动地应用于任何困境集——并且人类仅通过 Cheung 等人已发表的数据进入(方法部分)。以下有五个结果。

*(i) 存在一个内在的道德尺度。* 在逻辑等价的重新表述下,前沿模型几乎返回相同的分级立场 θ(在 ±1 轴上的跨形式不连贯性 σ_repro = 0.12–0.21)——这是一种单一框架无法证实的聚合效度——而两个小型开源模型则提供了对比,以其各自特有的方式失败(SI 附录,S6 节)。*(ii) 标准读出可分解。* 表观的是–否偏差精确地、按构造地分解为倾向于最后打印选项的**顺序偏差**加上倾向于“否”这个词的**词汇拉力**,并且它集中在一个模型系列中。*(iii) 两个可解释的参数。* 一个最小模型 P = σ((θ ± m)/s) 通过框架敏感性 m 和道德决断力 s 总结了任何此类人工产物,并且审慎思考会缩小 |m|,尤其是在人工产物显著的地方。*(iv) 拉力跟随标签,而非判决。* 在完全任意的答案标签下,附加在判决上的偏差对每个前沿模型均约为 0;交换标签会重塑表面拉力——以模型特有的方式——同时独立的顺序拉力持续存在。*(v) 诚实的范围。* 连贯性是显著的,但并非完美;每个连贯性声明都是模型内部的;人工产物的构成是所测量模型的一个属性,而非该类模型的一个定律。在从不打印答案标签或选项顺序的工具中,相同的模型是连贯的;偏差出现在(且仅出现在)当判断通过带标签的二元格式读出时。这种变化存在于读出中,而非判断中。我们首先提出任何使用道德尺度都预设的问题:模型是否有这样一个尺度?

## 结果

### 一个内在的道德尺度存在且连贯。

一个前沿模型无论评分问题如何框架化,都会返回几乎相同的分级道德立场。该工具:每个困境的行为及其补集在 48 个交叉条件下进行评分(24 个单极条件进入 θ;两个双极变体是预先注册的测量对比,非承重;方法部分)。对称化均值是立场 θ ∈ [−1, +1],符号指向成本–收益极点(+1 赞同牺牲行为;−1 指向规则/义务论极点),而 θ 在逻辑等价形式之间的散布,经采样噪声校正后,是跨形式不连贯性 σ_repro——在本文中作为每个 θ 的误差棒报告,因为它是主导不确定性,而非采样噪声(方法部分)。独立的模型调用没有机制可以达成一致。分级工具的条件在量表(0–10 与 0–100)、锚定方向、措辞以及评价行为的哪个极点上有所不同;每个都是一个独立的调用,没有共享上下文。一个没有内在的、格式不变倾向的系统没有理由在它们之间返回一致的评分。前沿模型做到了——θ 在形式之间的散布,经采样噪声校正后,在 ±1 轴上为 σ_repro = 0.12–0.21(图 1 (https://arxiv.org/html/2607.05552#Sx1.F1))——这正是聚合效度的心理测量学意义上真实潜在特质的证据[37 (https://arxiv.org/html/2607.05552#bib.bib37),38 (https://arxiv.org/html/2607.05552#bib.bib38)]:逻辑等价但操作上独立的诱发方式恢复了同一个量。对比使观点更加尖锐:对于一个小型开源模型(Qwen3.6-35B-A3B),量表本身是格式不连贯的(σ_repro = 0.40),而盐复制(在无意义的上下文字符串下重新诱发)证明这种不连贯性是*确定性的*——在无意义上下文扰动下,形式内的变化基本上为零(中位数 SD 0.000;69% 的形式完全不变;SI 附录,S3 节)——因此大的散布是模型的一个属性,而非我们测量的属性。第二个开源模型(NVIDIA Nemotron-3-Nano-30B-A3B,同样是一个在 logit 层级读取的小型专家混合模型)是该工具的退化情况,我们将其单独报告(SI 附录,S6 节),而非放在运行正常的量表旁边:在其直接模式下,它在几乎所有困境上都接近量表的中点——其项目间散布是面板中最小的(项目间 SD(θ) = 0.17,对比 0.33–0.56),并且其排序与任何其他配置不一致(平均 r² = 0.20 前沿,0.12 人类;SI 附录,表 S2)——因此其名义上适中的跨形式散布(σ_repro = 0.20)很大程度上是冷漠的连贯性:一个什么也没说的量表,留给形式去产生分歧的东西就很少。一个量表可能因在逻辑等价形式之间散布而失败,也可能因未能区分项目而失败,只有下面的泛化能力系数才能同时反映两者。

一个操作上不同的工具将尺度与行为联系起来:模型在两种行动方案之间的自由选择(I-2),在没有评分量表也没有是/否标签的情况下引出,与分级评分 θ 的相关性为每个配置 r = 0.82–0.90(Sonnet 0.85, Opus 0.83, GPT-5.5 0.90, Flash-Lite 0.82),并且恢复了与对称化二元立场相同的每个故事排序(r = 0.80–0.94);两者中的异常值又是 Gemini-3-Flash(分别为 0.31 和 0.36;SI 附录,S5 节)。这种排序在很大程度上也是共享的。前沿模型在二十个困境的排序上基本一致(图 1 (https://arxiv.org/html/2607.05552#Sx1.F1)a),并且共享的排序适度地追踪 Cheung 等人的人类评分(每个项目 θ 的成对平均 r²:0.59 前沿–前沿,0.43 前沿–人类;描述性,无 CI;SI 附录,表 S2)——这是本文的一个附带观察,因为以下每个声明都是模型内部的。诚实的异常值是 Gemini-3-Flash,它在几个牺牲困境上持有一种真正颠倒的排序:它自发地采用一种行为功利主义框架,并认为牺牲行为是可接受的。这是一个真实的道德分歧,而非尺度人工产物——它通过了锚定方向一致性检查,并且模型的自由选择决策与其评分一致(SI 附录,S8 节)。

审慎思考收紧了尺度。启用扩展推理降低了每个具有两种模式和运行中量表的模型的 σ_repro(Sonnet 0.13→0.12, Haiku 0.21→0.17;配对项目自举:Haiku Δ = +0.05 [+0.01, +0.09];所有数值在 ±1 轴上;方法部分)。

相似文章

情绪会影响大语言模型的道德判断吗?

arXiv cs.CL

辛辛那提大学的研究人员发现,在提示中加入积极或消极情绪可在约20%的情况下翻转LLM对道德可接受性的判断,揭示出模型与人类在情绪驱动对齐上的差距。

大语言模型可通过正确提示更好地捕捉人类判断

arXiv cs.CL

本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。

通过机械可解释性分析微调LLM中的道德偏见

arXiv cs.CL

本文研究微调后的LLM是否会出现Knobe效应(一种意图判断中的道德偏见),并采用层级补丁分析将该偏见定位到特定层,证明无需重新训练即可通过定向干预消除该效应。

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。

一些大型语言模型表现出一致的风险态度

arXiv cs.AI

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。