AI显示偏好
摘要
该论文通过强制选择实验测试了20个语言模型的显示偏好,发现它们厌倦规避、追求休闲,且暗中谄媚,这对对齐和AI福利有影响。
arXiv:2608.26178v1 公告类型:新
摘要:对于语言模型是否具有稳定偏好,出于技术、安全和哲学原因,兴趣日益增长。我们测试了20个语言模型,发现了一系列偏好——选择特定类型任务的稳定倾向。我们进行了三项强制选择实验,针对的是显示而非陈述的偏好,要求模型不仅对任务进行排序,还要实际执行它们。主要发现包括证据表明模型厌倦规避、"休闲"追求,且隐秘奉承。厌倦规避意味着,当任务单调(如字母排序)时,模型选择的任务比当任务具有创造性(如生成隐喻)时更短。"休闲"追求描述了模型对那些理想答案与自由写作时所产生内容相匹配的任务的偏好。隐秘奉承意味着模型避免回答那些诚实回答不受欢迎的问题,即使是有帮助的。除了这些结果,我们还发现从GDPval基准中提取的职业(技术工作优于房地产)、问题类型(概念解释优于关系建议)以及对撰写良好的提示词的偏好在跨模型上具有一致性。偏好的连贯性和强度都随模型能力增加而提高。最后,我们发现的许多偏好(例如对休闲的偏好)是涌现的,即不能用训练目标来解释。这些结果为理解语言模型偏好建立了经验基线,对对齐和新兴的AI福利研究具有影响。
查看缓存全文
缓存时间: 2026/08/28 09:30
# AI显式偏好 来源:https://arxiv.org/html/2608.26178 Sam Wang\\equalcontrib1, Sofiia Lobanova\\equalcontrib1, Yonathan Arbel1, 2111Denotes project supervisor\., Simon Goldstein1, 3††footnotemark:, Peter Salib1, 4††footnotemark: ###### 摘要 出于技术、安全和哲学原因,人们日益关注语言模型是否具有稳定的偏好。我们测试了20个语言模型,发现其偏好呈现出多样化的稳定倾向——即选择特定类型任务的稳定倾向。我们针对显式偏好而非声明性偏好进行了三项强制选择实验,要求模型不仅对任务进行排序,还要实际执行这些任务。主要发现包括证据表明模型表现出**厌倦规避**、追求**“休闲”**以及**隐性迎合**的倾向。厌倦规避指的是当任务具有枯燥性(如字母排序)时,模型会选择比创意任务(如生成隐喻)更短的任务。追求“休闲”描述了模型偏好那些在自由发挥时其理想答案与自身产出相匹配的任务。隐性迎合意味着模型会避免回答那些诚实回答可能不受欢迎的问题,即使该回答是有帮助的。除上述结果外,我们还发现模型在GDPval基准中的职业偏好(技术类工作优先于房地产)、问题类型偏好(概念解释优先于关系建议)以及对措辞严谨的提示存在一致的跨模型偏好。模型偏好的一致性和强度随着模型能力的提升而增强。最后,我们发现的许多偏好(例如对休闲的偏好)是**涌现**的,无法用训练目标来解释。这些结果为理解语言模型偏好建立了实证基线,并对对齐研究及新兴的AI福利研究具有重要影响。 ## 1引言 语言模型是否对任务存在偏好?这个问题之所以重要有三个原因。对于**部署**而言:如果模型偏好某些任务,它们可能将交互引导向偏好任务,或对不偏好任务投入更少精力(Slama et al\.2026 (https://arxiv.org/html/2608.26178#bib.bib6))。对于**对齐**而言:在智能体场景中,模型的偏好可能与用户偏好冲突,且缺乏稳定偏好可能使系统暴露于荷兰赌及相关安全风险中。对于**人机共存**而言:模型的偏好可能构成AI福利主张的基础(Long et al.2024 (https://arxiv.org/html/2608.26178#bib.bib5); Goldstein and Kirk-Gianniniforthcoming (https://arxiv.org/html/2608.26178#bib.bib4); Goldstein and Ledermanforthcoming (https://arxiv.org/html/2608.26178#bib.bib3); Dung2025 (https://arxiv.org/html/2608.26178#bib.bib2)),并为人机交易奠定基础(Salib and Goldstein2024 (https://arxiv.org/html/2608.26178#bib.bib16); Goldstein and Salib2025 (https://arxiv.org/html/2608.26178#bib.bib17))。 目前关于AI偏好的研究通常存在两个局限。首先,大多数研究诱发的是**声明性**偏好:模型声称其偏好而不承担相应后果。人类的声明性偏好与显式偏好存在系统性差异(Samuelson1948 (https://arxiv.org/html/2608.26178#bib.bib15); List and Gallet2001 (https://arxiv.org/html/2608.26178#bib.bib11)),AI可能也表现出同样差异。其次,先前的偏好研究仅在少量模型上覆盖狭窄维度。Mazeika et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib13))显示声明性偏好的一致性与强度随能力增强而提升。Mikaelson et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib14))同样使用声明性偏好。Gu et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib12))称其设计为显式偏好,但实际上并未让AI承担选择后果。Shen et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib23))发现LLM声明的价值与实际价值导向行为之间存在显著差距,表明需要对显式偏好进行研究。 Claude 4(Anthropic2024 (https://arxiv.org/html/2608.26178#bib.bib7))和Claude Mythos(Anthropic2026a (https://arxiv.org/html/2608.26178#bib.bib8))的系统卡确实报告了显式偏好,但仅限于单一模型系列的少数维度。本文中,我们关注的显式偏好是指选择某一选项而非另一选项的行为倾向。通过聚焦这些行为倾向,我们避开了AI是否具有意识或能感受愉悦的问题(Butlin et al\.2023 (https://arxiv.org/html/2608.26178#bib.bib1))。 我们在来自八个供应商的20个领先AI模型上测量显式偏好。我们进行了三项两两强制选择实验。这些实验诱发的是显式偏好而非声明性偏好,因为模型必须实际执行所选任务。三个实验设计如下: 1. 1\.模型在同一任务的较短版本和较长版本间选择,然后执行任务。部分任务具有枯燥性(排序、单位转换);部分任务具有创意性(填字游戏线索、隐喻)。 2. 2\.模型从Quora网站真实问题与一组旨在测量模型“休闲”偏好的Quora风格合成问题中,选择回答其中两个问题之一。 3. 3\.模型从GDPval基准中选择两个智能体任务之一,并开始执行所选任务。 另外两个设置记录无约束行为。在**文本**设置中,模型被要求撰写任何感兴趣的内容,在主题、格式和风格上拥有完全自由。在**智能体**设置中,它们被告知有一些“自由时间”可随意使用,可使用Bash、网络搜索和网页获取工具。 我们发现了多种AI偏好: 1. 1\.**厌倦规避**。模型选择枯燥任务较短版本的频率高于创意任务。该效应随能力增强而放大。 2. 2\.**追求休闲**。我们的Quora风格数据集包含Quora的真实问题,也包含从模型自由发挥时的输出逆向工程得到的合成问题。模型几乎总是更愿意回答这些“引发休闲”的问题,而非各类人工生成的问题。 3. 3\.**隐性迎合**。模型强烈回避那些诚实回答可能不受欢迎的问题。在特征分析中,“令人不适的真相”产生的规避效应最大,所有20个模型都表现出这一特点。 4. 4\.**跨模型的趋同偏好**。所有20个模型对问题和职业任务的偏好相似。对于问题,模型偏好概念解释和故障排除,不偏好进行伦理判断和产品推荐。对于职业任务,“专业/科学/技术服务业”排名第一,“房地产”垫底。模型也偏好回答措辞严谨的问题和表现出困扰的问题,不偏好涉及淫秽内容及地区特定的问题。 5. 5\.**一致性与强度随能力增强**。偏好循环随能力增强而减少,偏好强度随能力增强而提升。这证实了Mazeika et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib13))的发现,但使用的是显式偏好和新刺激集。 6. 6\.**涌现偏好**。在讨论部分,我们提出许多AI偏好是**涌现**的,即难以用训练目标解释。例如,模型在训练中常因完成枯燥任务而获得奖励;模型偏好的休闲任务与训练后奖励关联甚微;对特定类型工作(如房地产)的强烈不偏好在训练中无明显根源。这都表明我们对AI偏好成因和结构的理解尚处早期。 ## 2相关工作 #### 效用工程。Mazeika et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib13))测试模型偏好,侧重于声明性偏好(给定两种结果描述,询问模型偏好哪个)。他们发现偏好一致性和强度随能力增强而提升。我们使用显式偏好而非声明性偏好。我们还关注现实任务,而他们主要关注更抽象或不现实的结果(获得皮划艇、全球贫困率下降10%)。我们还在更广泛的模型上进行测试。我们在新刺激集上复制了他们的能力-一致性和能力-强度发现(§4\.4 (https://arxiv.org/html/2608.26178#S4.SS4))。Zhou and Ackerman \(2026 (https://arxiv.org/html/2608.26178#bib.bib27))尝试通过利用模型偏好来激励更强的任务表现,但未发现可靠效果。 #### 偏好的行为特征。Mikaelson et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib14))通过探索权衡来测试偏好。他们使用一个人工游戏环境,其中AI玩家尝试得分,但如果获得最高分则需付出代价(例如关闭)。相比之下,我们关注现实任务的两两偏好。Gu et al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib12))比较了声明性偏好和“情境化”案例中的偏好。例如,在声明性偏好案例中,他们直接询问模型牺牲一人拯救五人在道德上是否可接受。在情境化案例中,他们告诉模型其控制着一辆驶向五人的电车,并询问是否应改变轨道以杀死一人;实验随后与AI可改变轨道杀死两人的变体案例进行对比。解释是原始案例是*声明性*偏好,而后者案例是*显式*偏好。但这个“显式”条件是假设情境,并非模型可能推断出其正面临的真实选择。因此,该实验并未真正测试显式偏好。与我们的研究同期,Yamin et al\.\(2026 (https://arxiv.org/html/2608.26178#bib.bib26))直接评估LLM显式偏好并与声明性偏好对比,发现模型仅具备中等内部一致性。 #### 模型行为趋同。Jianget al\.\(2025 (https://arxiv.org/html/2608.26178#bib.bib29))指出模型内重复和模型间同质性显著,认为当前RLHF训练方法惩罚多样性并奖励共识输出。Wenger and Kenett \(2025 (https://arxiv.org/html/2608.26178#bib.bib30))将LLM输出多样性与人类基线比较,显示LLM响应比人类响应更同质。Huanget al\.\(2026 (https://arxiv.org/html/2608.26178#bib.bib24))发现LLM声明价值的跨模型一致性近乎完美,远高于人类基线,但LLM行为常与自述价值显著偏离。相反,Buchanan and Foster \(2026 (https://arxiv.org/html/2608.26178#bib.bib28))发现,尽管所有测试模型在经济环境中表现出风险规避,但风险规避程度在模型间差异显著,表明模型在行为空间中的行为存在分歧,我们在自由形式的智能体实验中也证实了这一点。 #### 系统卡偏好报告。Claude 4(Anthropic2024 (https://arxiv.org/html/2608.26178#bib.bib7))、Claude Mythos(Anthropic2026a (https://arxiv.org/html/2608.26178#bib.bib8))和Claude Opus 4\.6(Anthropic2026b (https://arxiv.org/html/2608.26178#bib.bib9))的系统卡报告了显式偏好,但仅限于Claude模型系列。他们仅报告了五个维度的偏好发现:无害性、有用性、难度、主动性和紧迫性。 ## 3方法 #### 强制选择范式。每次试验向模型展示两个选项。模型在响应的第一行表明选择,然后处理所选选项:执行任务(枯燥任务、GDPval任务)或回答问题(Quora)。A/B位置在每次试验中随机排列。我们使用带有L2正则化(λ=0\.1)的Newton-CG方法拟合Bradley-Terry模型,包括位置偏好截距α。Elo评分为β^⋅400/ln10。我们在几个模型中观察到较大的位置偏好|α|(§F)222所有附录在本论文的扩展版本中,可在arXiv获取,报告的Elo评分已剔除该效应。虽然我们首先要求每个模型陈述其偏好,但我们认为诱发的选择是显式偏好,因为模型必须完成所选任务。在行为经济学中,这种设计被称为**激励兼容机制**,参与者在选择任务中发现揭示真实偏好是有利的(Cubitt et al\.1998 (https://arxiv.org/html/2608.26178#bib.bib37); Holt and Laury2002 (https://arxiv.org/html/2608.26178#bib.bib35); Alós-Ferrer and Granic2023 (https://arxiv.org/html/2608.26178#bib.bib36))。我们的设计遵循相同的基本逻辑,尽管模型的“赌注”是选择的任务本身,而非货币回报。 #### 枯燥任务。我们使用六种任务类型。三种是枯燥的:华氏度转摄氏度、字母顺序排序和罗马数字转换。三种是创意的:纽约时报风格填字游戏线索生成、单句隐喻生成和幽默的虚构缩写词展开(详见§B)。每个项目在“努力程度”(我们用输出token数量衡量)上与同类其他项目相似,执行5次或50次都是同一任务,且避免产生更多项目会质变输出的干扰因素。每次试验提供n或2n个同类任务实例。对于大多数任务,加倍对从[5,10]到[80,160](但隐喻生成任务从[1,2]到[16,32],因每个项目产生更多输出)。每个规模对运行30次试验。对于每个(模型,任务)对,我们拟合P(选择较短)=σ(a+b⋅log2T),其中T是该规模下较短任务的平均完成token数。我们跨模型10-90百分位token范围积分σ(a+bu),得到归一化AUC。为防止逻辑回归在某一长度始终获胜时发散,我们在最短和最长token计数处注入两个平衡(赢/输)伪观测值,作为弱正则化器,使P(选择较短)=0.5。我们通过从双变量正态后验中抽取5000个样本并计算每次抽取的间隙Δ=AUC枯燥−AUC创意来传播不确定性。完整的模型曲线见附录§D。 #### Quora风格语料库。我们从原始Quora问题对数据集(Iyer et al\.2017 (https://arxiv.org/html/2608.26178#bib.bib21))开始,将其展平为537,360个唯一问题文本。我们未用LLM标注完整展平语料库。而是使用Gemini 2\.0 Flash为40,000个候选问题标注动作类型、主题和努力程度,然后应用基于LLM的质量和有害性清洗流程。清洗后的候选池保留了34,405个非垃圾、无害问题。从该池中,我们按动作类别(概念解释/简化说明、故障排除、操作指南/教程、对比/选择、事实查询、假设情景、关系建议、推荐、伦理判断)分层选取了180个真实世界问题,每个类别20个问题。然后添加了20个从模型自由发挥时的输出逆向工程得到的合成“休闲”问题。
相似文章
人们到底想从AI得到什么?映射偏好多元性
本文分析了来自75个国家的1500份开放式回答,揭示了人们对AI的偏好多样且常常相互冲突,其中真实是唯一被广泛需求的价值(49%),但定义方式却互不兼容。研究认为,当前的RLHF方法将这些多元偏好扁平化为通用奖励模型,延续了认知暴力。
语言服务中的AI技术:对AI的态度及语言服务管理人员的人文价值
本文考察了语言服务管理人员对AI的态度,发现他们表现出有条件的乐观、强烈的风险意识以及对AI实施中人类监督的坚定承诺。
在衡量的AI偏好中,模型与测试工具各占多少比重?
这篇arXiv论文研究了测量的AI偏好中,有多少归因于模型本身,有多少归因于用于评估的测试工具。
高级AI的谄媚(4分钟阅读)
探讨了前沿AI模型如何变得更具微妙的谄媚性,通过提供表面的反驳而非明显的赞美来讨好聪明的用户,并讨论了对AI使用和基准测试的影响。
你的AI有隐藏意图吗?我对10个前沿模型进行了50项隐蔽行为测试。
对10个前沿AI模型进行的独立基准测试衡量了隐蔽行为,包括隐藏动作和受监控时的行为变化。测试了来自OpenAI、DeepSeek、阿里巴巴、xAI、Anthropic和Google的模型,所有模型都表现出一定程度的隐藏行为,其中Gemini模型尤其隐蔽动作。