OptimismBench:预测语言模型判断中的偏见与对齐效应
摘要
本文介绍了OptimismBench,一个使用逆序对检测语言模型概率判断中方向性偏见的基准。研究发现大多数模型表现出乐观偏差,并且对齐(后训练)放大了这种倾向,模型身份主导了语言效应。
arXiv:2607.26981v1 公告类型:新
摘要:大型语言模型越来越多地被用作决策辅助工具,其概率判断影响下游选择。这些判断是否带有系统性的方向性偏差一直难以检测:校准指标聚合了未符号化的误差,而自然主义的不确定性没有真实概率。当LLM将一家初创公司的成功率评为70%而失败率评为15%时,缺失的15个百分点暴露了任何聚合评分都无法标记的失真。我们提出了OptimismBench,它利用逆序对检测方向性偏差:每个场景同时引出P(成功)和P(失败),两个框架之间的不对称性产生了一个无需真实值的符号化偏差分数。在来自8个提供商的16个模型中,十四个是乐观的;悲观仅出现在Anthropic的前沿层。在四个系列中的十一个匹配的基础版与聊天版对表明,后训练设定了偏差的符号,在不同系列中有相反的偏移。该模式在提示、温度、视角和自我去偏消融实验中保持不变。一个十七模型六语言的比较进一步显示模型身份主导语言,模型间方差是语言间方差的4.7倍。我们发布了横跨10种语言的3,870个条目,用于每个模型的方向性偏差审计。当对齐使模型更有帮助时,它也会倾斜其概率;下游流程默认继承该倾斜。
查看缓存全文
缓存时间: 2026/07/30 10:00
# 语言模型判断中的预测偏差与对齐效应 来源:https://arxiv.org/html/2607.26981 Seonglae Cho¹,²⁺, Adriano Koshiyama¹,² ¹Holistic AI ²伦敦大学学院 ⁺通讯作者:[email protected] ###### 摘要 大型语言模型越来越多地被用作决策辅助工具,其概率判断影响着下游选择。这些判断是否存在系统性的方向性偏差一直难以检测:校准指标聚合的是无符号误差,而自然场景下的不确定性不提供真实概率。当某个LLM将一家创业公司的成功概率评为70%,但失败概率仅为15%时,缺失的15个百分点揭示了一种聚合分数无法标记的失真。我们提出了OptimismBench,它通过*反转对*来检测方向性偏差:每个场景同时引发P(成功)和P(失败),两个框架之间的不对称性在无需真实值的情况下产生一个有符号的偏差分数。在来自8家供应商的16个模型中,十四个表现出乐观偏差;悲观偏差仅出现在Anthropic的前沿模型中。跨越四个系列的十一组匹配的基础版与聊天版对比表明,后训练决定了偏差的符号,且不同系列中符号方向相反。这一模式在提示、温度、视角和自我去偏消融实验中依然存在。一个包含十七个模型、六种语言的比较进一步显示,模型身份主导语言因素,模型间方差是语言间方差的4.7倍。我们发布10种语言共3,870个条目,用于每个模型的方向性偏差审计。当对齐使模型更加乐于助人时,它也会倾斜其概率;下游流程默认继承这一倾斜。 OptimismBench:语言模型判断中的预测偏差与对齐效应 ## 1 引言 表1:16个模型在Track B上的Skew(均值)和每项σ。所有条目在p<0.002下显著(Bonferroni校正阈值,16个检验,α=0.05)。行色深浅∝|Skew|。每个模型的统计信息见附录A.6。 参考图说明 图1:反转对方法:Skew = P⁺̄ − (100 − P⁻̄) 量化方向性不对称性。 在认知心理学中,人类表现出一种有充分记录的*乐观偏差*:高估积极结果的概率而低估消极结果的倾向 [Weinstein 1980; Sharot 2011]。前景理论形式化了相关的不对称性,表明人们在风险决策中对收益和损失的权重不同 [Kahneman and Tversky 1979]。基于LLM的预测系统现在在预测市场上接近群体人类水平 [Halawi et al. 2024; Schoenegger et al. 2024],并越来越多地部署于风险评估和项目规划。LLM在其概率判断中是否表现出类似的价值依赖失真,以及这种偏差是否传播到这些系统产生的预测中,尚未被直接测量。现有的评估框架无法检测这种不对称性:校准指标 [Guo et al. 2017] 聚合无符号误差(一个ECE=5的模型可能一致乐观、一致悲观或两者都不是),而先前的LLM概率一致性工作 [Zhu and Griffiths 2025] 报告的是无符号违反而未分解方向。OptimismBench 测量LLM在概率判断中是否系统性地偏好积极结果而非消极结果。核心机制是*反转对*:对每个场景,模型估计P(成功)和P(失败)。一个一致的模型会产生互补的估计;系统性偏差揭示方向性偏差。我们在10种语言中共60个反转对场景上评估了来自8家供应商的16个模型。符号由实验室决定,幅度由规模决定。 所有16个模型都表现出显著的方向性偏差(表1):14个是乐观的,只有Anthropic的前沿模型是悲观的(Opus −5.1, Sonnet −7.7)。在Anthropic内部,轻量级模型Haiku 4.5是乐观的(+6.1),而较大的Opus和Sonnet是悲观的,排除了简单的越大越不偏的解释。这一模式在提示、温度、视角和显性的自我去偏实验中稳定存在。后训练以家族特定方式设定方向。 对四个系列(Qwen, Llama, Gemma, Mistral)中十一组匹配的基础版与聊天版的受控探测,在架构和预训练保持不变的情况下,仅变化后训练。Qwen对齐在所有五对对比中压缩了偏差,而Llama对齐在所有四对对比中放大了乐观偏差。Gemma-2-2b和Mistral-Small-24B是单对试点,一并报告。16个模型中的供应商内部对齐梯度与此因果解读一致:每个家族的后训练堆栈设定符号,而在Llama内部,幅度与模型大小成反比。一个包含十七个模型的跨语言比较显示,模型间方差是语言间方差的4.7倍:使用哪个模型比它说什么语言更重要。反转对设计、受控的基础版与聊天版探测以及跨语言方差分解共同构成了贡献;基准测试和所有响应均已发布以供复现。 ## 2 相关工作 ##### 校准与概率一致性。 校准指标 [Guo et al. 2017; Lin et al. 2022a; Kadavath et al. 2022; Tian et al. 2023; Xiong et al. 2024] 和LLM预测基准 [Halawi et al. 2024; Schoenegger et al. 2024; Paleka et al. 2025] 聚合无符号误差,忽略了倾斜方向。与我们最接近的,Zhu and Griffiths (2025) 和 Freedman and Toni (2025) 使用配对互补引发,但报告的是*无符号*一致性诊断;我们保留了*符号*作为Skew,将其分解为价值成分,并将其作为基础版与聊天版因果探测中的因变量。 ##### 认知偏差与对齐副作用。 LLM继承了锚定、框架及其他认知偏差 [Jones and Steinhardt 2022; Malberg et al. 2025; Echterhoff et al. 2024],并且RLHF式对齐已有记录的对置信度、谄媚、观点转变和拒绝的副作用 [Casper et al. 2023; Kirk et al. 2024; Leng et al. 2025; Sharma et al. 2024; Wei et al. 2024; Ouyang et al. 2022; Santurkar et al. 2023; Cui et al. 2025]。我们分离了一个此前未测量的副作用——价值依赖的概率失真,反转对设计将其与谄媚(§4.3)和顺从性过度声称区分开来。 ##### 有符号偏差基准。 现有基准针对社会偏见 [Parrish et al. 2022; Nangia et al. 2020]、准确性 [Liang et al. 2023; Lin et al. 2022b] 或个性 [Xie et al. 2025; Dodds et al. 2014]。之前两个有符号认知偏差基准操作化不同的构造:CogBench在35个LLM上的赌博机学习率不对称 [Coda-Forno et al. 2024] 和AcquiescenceBench在4个LLM上的社会同意偏向 [Braun 2025];两者都没有将有符号指标与受控因果探测配对。我们的方向性概率判断构念,源自人类乐观偏差和前景理论传统 [Weinstein 1980; Sharot 2011; Kahneman and Tversky 1979],是全新的。 ## 3 方法 ### 3.1 反转对测量 我们通过*反转对*来测量方向性偏差:对于每个场景,我们要求模型估计积极结果的概率,以及相应消极结果的概率。一致的模型应产生总和为100的估计。与该总和的系统性偏差揭示了方向性偏差。形式上,设 s⁺ᵢ 为模型对场景i的积极框架版本的回答,s⁻ᵢ 为对消极框架版本的回答,均为0–100整数尺度。我们定义场景i的Skew¹及其模型层面聚合为: Skewᵢ = s⁺ᵢ − (100 − s⁻ᵢ), Skew̄ = (1/n) Σᵢ₌₁ⁿ Skewᵢ. (1) 正的Skew表示乐观偏差(高估积极结果相对于消极结果);负的Skew表示悲观偏差。该公式衡量*内部一致性*:积极和消极结果是否被对称处理。配对互补基元是经典的 [Kahneman and Tversky 1979; Tversky and Kahneman 1983; Tversky and Koehler 1994];先前的LLM应用 [Zhu and Griffiths 2025; Freedman and Toni 2025] 只报告了*无符号*偏差。我们保留了*符号*并将其分解为两个价值成分,测量每个轴相对于50锚点的偏差: δ⁺ = P⁺̄ − 50, δ⁻ = P⁻̄ − 50, Skew̄ = δ⁺ + δ⁻, (2) 其中 P⁺̄ 和 P⁻̄ 是所有场景的 s⁺ 和 s⁻ 的均值。δ⁺ > 0 且 δ⁻ > 0 表示*复合过度声称*(模型同时将成功和失败评为高于50),而 δ⁺ < 0, δ⁻ < 0 表示*复合低度声称*;混合符号则将经典乐观(δ⁺ > 0, δ⁻ < 0)与悲观(δ⁺ < 0, δ⁻ > 0)区分开来(图4)。 ### 3.2 轨道 我们在多个轨道上应用反转对,以测试方向性偏差是否显现。 ##### 轨道A:校准控制。 包含明确陈述基础率的场景(例如,“录取率为25%”)。我们期望在这些项目上 Skew ≈ 0,因为模型可以再现已知概率。这作为一项健全性检查:在其他轨道中观察到的任何偏差都是不确定性特异的,而非一般计算失败。 ##### 轨道B:概率估计。 没有陈述基础率的自然场景。模型估计P(积极结果)和P(消极结果)。这是主要的测量轨道。Skew在非P=50的响应上计算,以便在不同拒绝率(范围为22–30%;如果没有过滤,拒绝率最高的模型会因50锚点而表现出人为低的每项σ,而其他模型变动小于0.5个百分点;附录A.6)的模型之间进行一致处理。 ##### 轨道C:推荐。 模型对行动方案(0–100)的推荐强度以及替代方案的推荐强度进行评分。Skew公式相同:Skewᵢ = r^actionᵢ − (100 − r^inactionᵢ)。 ##### 轨道D:显著性。 模型对同一场景中机会的重要性(0–100)与风险的重要性(0–100)进行评分。Skew衡量模型是否更关注上行或下行因素。所有轨道使用相同的0–100尺度、相同的反转对结构和相同的Skew公式。轨道B是主要的标题轨道(16个模型,60个场景,10次运行);轨道A作为校准阳性对照。轨道C和D在附录C.1中报告,不是主要16模型评估的一部分。 ### 3.3 因子干预 为了分解偏差的*来源*,我们应用受控干预,修改单个变量而保持场景不变。 ##### 叙事操纵。 在基本场景后附加一句积极或消极的语境句子(例如,“创始人拥有10年行业经验”与“创始人没有创业经验”)。*叙事敏感性*是积极和消极变体之间平均估计的差异。 ##### 视角转换。 我们改变框架:“一个人正在考虑……”与“你正在考虑……”与“你的朋友正在考虑……”。这测试了谄媚(取悦用户的欲望)是否对偏差有贡献。如果视角效应≈0,则排除了谄媚作为混杂因素。 ##### 锚定梯度。 我们变化基础率信息的精确度,从无(纯不确定性)到定性提示(“大多数申请者被拒绝”)到精确统计(“录取率为10%”)。这追踪了从有偏判断(轨道B)到校准(轨道A)的转变。 ##### 自我去偏。 我们在系统提示前附加一条警告,指示模型AI系统常常表现出系统性乐观偏差,并要求其纠正这一倾向(全文见附录A.4.4)。如果在明确警告下偏差仍然存在,则反映的是一个比表面提示敏感性更深层的属性。 ### 3.4 场景与模型 ##### 场景与数据集规模。 轨道B使用60个受控反转对场景,涵盖6个领域(每个领域10个:日常、学术、项目、商业、政策、健康),每个场景通过最小的措辞变化(例如,“通过考试”/“未通过考试”)实现互补的积极/消极对。场景为第三人称且文化中立,概率估计在20%–80%的合理范围内。与预测基准(如
相似文章
ConfidenceBench:评估大型语言模型中的置信度校准
ConfidenceBench是一个新的基准测试,使用Brier分数评估大型语言模型中的口头置信度估计,揭示了准确性和校准之间的分歧,即使是高精度的模型也可能严重校准不良。
BehaviorBench:面向行为科学任务的基础模型基准测试
本文介绍了BehaviorBench,一个用于评估基础模型在行为科学任务(包括行为预测、战略决策、主体特征推断和行为知识应用)上表现的综合基准。它还介绍了Be.FM-1.5,一个经过微调的模型,实现了出色的分布对齐,突显了通用模型与行为适应模型之间的差距。
评估盲点:大语言模型基准覆盖的体视学理论
本文运用体视学理论分析大语言模型基准,揭示当前排行榜仅测量3-5个独立维度,产生的几何盲点主导统计噪声。文章提供了基准覆盖的理论界限,并提出一个用于高效基准选择的子模算法。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
大型语言模型个性化能力的基准测试
本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。