群体对齐诱发的谄媚行为:可控多元对齐的双侧评估

arXiv cs.CL 论文

摘要

本文介绍了群体对齐诱发的谄媚行为(GAS),这是一个双侧评估框架,用于在将大语言模型与人口统计群体对齐时,同时衡量意见对齐的预期增益和谄媚行为的非预期变化,并发现这些效应是非均匀且具有群体特异性的。

arXiv:2608.11528v1 Announce Type: new 摘要:群体对齐使语言模型适应某个特定人口统计群体,以生成反映该群体观点、价值观和偏好的回应。谄媚行为是对齐过程中有充分记录的副产品,会使模型无论事实和客观信息如何都过度认同用户。然而,现有的群体对齐方法和评估仅关注模型与群体观点的匹配程度,忽略了由此诱发的谄媚行为变化。为弥补这一空白,我们提出了群体对齐诱发的谄媚行为(GAS),并系统评估了3种方法、4个模型和13个人口统计群体在对齐中的表现,同时考察意见对齐的预期增益和谄媚行为的非预期变化。我们发现,增益和变化在不同群体间是非均匀的:在相同的预算下,某些群体在意见对齐上获得比其他群体更大的增益,且诱发的谄媚行为变化呈现出群体特定的轮廓,而非单一维度的变化。这些结果表明,在将大语言模型适配到多样化人群时,群体对齐应报告为双侧、多维度的轮廓,而不是单一的拟合分数,并需考虑每个群体的差异。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:26

# 群体对齐引发的谄媚行为:可引导多元对齐的双侧评估

来源:https://arxiv.org/html/2608.11528  
Haokai Zhao¹,Yunze Xiao²,Weihao Xuan³,Flora Salim¹,Benjamin Tag¹,Aditya Joshi¹  
¹新南威尔士大学,²卡内基梅隆大学,³东京大学  
通讯作者:[[email protected]](mailto:email@domain)

###### 摘要

群体对齐使语言模型适应某一人口统计群体,以生成反映该群体观点、价值观和偏好的回复。谄媚行为(Sycophancy)是对齐过程中有据可查的副产品,会导致模型无论事实和客观信息如何,都过度赞同用户。然而,现有的群体对齐方法和评估只关注模型与群体观点匹配的紧密程度,忽视了由此引发的谄媚行为变化。为弥补这一空白,我们提出了群体对齐引发的谄媚行为(Group Alignment-Induced Sycophancy,GAS),并系统评估了3种方法、4个模型和13个人口统计群体下的对齐效果,同时考察了预期的观点对齐增益和意外的谄媚行为偏移。我们发现,增益和偏移在不同群体间并非均匀分布:在相同预算下,某些群体获得的观点对齐增益大于其他群体,并且引发的谄媚行为偏移呈现群体特异的轮廓,而非单一维度的变化。这些结果表明,群体对齐应报告为一种双侧、多维的轮廓,而非单一的拟合分数,并且在将LLM适应于多样化人群时需要考虑逐群体差异。

# 群体对齐引发的谄媚行为:可引导多元对齐的双侧评估

Haokai Zhao¹,Yunze Xiao²,Weihao Xuan³,Flora Salim¹,Benjamin Tag¹,Aditya Joshi¹  
¹新南威尔士大学,²卡内基梅隆大学,³东京大学  
通讯作者:[[email protected]](mailto:email@domain)

## 1 引言

大型语言模型默认并不代表所有人。它们在争议问题上的观点偏向特定人口统计群体(Santurkar et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib5))以及WEIRD群体(Mihalcea et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib41);Durmus et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib6)),这反映了其训练所用反馈数据中纳入了谁的偏好(Kirk et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib7))。群体对齐通过将模型条件化于指定的人口统计群体来解决这种偏差,使模型忠实地代表该群体的观点、价值观和偏好,这也被称为*可引导*形式的多元对齐(Sorensen et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib1))。现有方法要么在推理时上下文中进行这种条件化(Argyle et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib20);Hwang et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib21)),要么在模型权重中进行(Zhao et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib2);Feng et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib24);Yao et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib3))。这两类方法都在优化和评估中仅使用单一指标——观点匹配度,用以衡量条件化后的模型复现目标群体答案的紧密程度(Argyle et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib20);Zhang et al., 2025a (https://arxiv.org/html/2608.11528#bib.bib8))。

图1:群体对齐有两个方面:对目标群体观点匹配的预期增益,以及在对齐任务之外的输入上出现的、群体特异的谄媚相关行为偏移。

群体对齐基于目标群体自身对争议问题的回答立场进行训练,因此其训练信号编码了受众偏好听到的内容。当模型为优化用户偏好回复而训练时,它会学会谄媚行为,并开始以牺牲准确性和真实性为代价来换取认同(Perez et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib25);Sharma et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib9)),并且对齐微调已被证明会放大这种倾向(Hong et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib27))。群体对齐在比一般反馈数据更集中、更带观点倾向的偏好语料上运行同类优化,因此是引发谄媚偏移的首要嫌疑对象。然而,现有评估只关注观点匹配,忽视了对齐引发的谄媚偏移。

我们引入群体对齐引发的谄媚行为(GAS),一种针对群体对齐语言模型的双侧评估。GAS同时衡量观点匹配的预期增益以及七个社交和事实性谄媚指标上的伴随偏移(Cheng et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib13);Sharma et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib9))(图1 (https://arxiv.org/html/2608.11528#S1.F1))。我们使用三种方法,将四个指令微调模型对齐到13个人口统计群体,覆盖五个轴(政治倾向、性别、教育、收入和婚姻状况),在匹配的逐轴预算下产生156个条件化分支。Prompt将人口统计角色置于推理时上下文中,而SFT和DPO则将条件化编码进模型权重,基于真实皮尤受访者模态答案推导的偏好对进行训练(第3节 (https://arxiv.org/html/2608.11528#S3))。谄媚测试输入不携带任何人口统计信号。事实性任务不包含此类信号,社交帖子经筛选使得作者的相关属性无法被推断,且权重条件化分支在没有任何角色提示的情况下作答(第3节 (https://arxiv.org/html/2608.11528#S3))。因此,测量到的偏移反映的是条件化本身,而非对可见身份信息的适应。

我们的结果表明,群体对齐会产生结构化的行为再分配。在匹配预算下,观点匹配增益随人口统计目标的不同而系统性变化,因此固定的对齐配方并不会平等惠及所有群体。意外谄媚偏移同样具有异质性。不同的目标群体在谄媚维度上引发不同的轮廓,且同一轮廓内的维度经常朝相反方向移动,因此当压缩为标量时,大部分移动会相互抵消。模型可能在风格上变得不那么迎合,而在实质上变得更顺从,单一程度的谄媚无法描述这两种变化。方法选择带来了进一步的对比。在相同预算下使用相同配对进行训练,DPO在观点匹配上比SFT获得更多增益,同时在按构造成害的方向上偏移更少。这些结果对于多元对齐尤为重要,因为旨在代表异质性人群的方法结果却产生了异质的收益和副作用。因此,完整的评估应同时报告增益和意外谄媚偏移,逐群体、逐指标进行。

我们的贡献是:
- •我们识别了多元对齐中的一个评估盲点:观点匹配衡量的是预期的目标行为,而非对齐任务之外的持久变化。
- •我们引入了GAS,它评估156个条件化分支(4个基础模型×13个群体×3种方法)的群体拟合度和七个社交与事实性谄媚指标,使用人口统计沉默的测试输入将持久条件化效应与对可见身份的适应分离开来。
- •我们表明,群体对齐会产生异质的行为再分配:预期增益因目标而异,意外谄媚偏移形成群体和指标特异的轮廓,并且对齐方法表现出不同的拟合–位移权衡。

## 2 相关工作

#### 群体对齐。
LLM系统性拟合某些人群的效果优于其他人群:其默认观点偏向特定的美国人口统计群体(Santurkar et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib5))和西方国家(Durmus et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib6)),这反映了反馈数据中纳入了谁的偏好(Kirk et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib7))。Sorensen et al.(2024 (https://arxiv.org/html/2608.11528#bib.bib1))将补救措施定义为*多元对齐*,并让模型可向其服务的群体引导,或对其在分布上保持忠实。我们评估的方法是可引导的:每种方法都将模型条件化到一个人口统计群体上,并根据其是否像该群体一样作答来评分。推理时方法在提示中条件化人口统计信息(Argyle et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib20);Hwang et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib21)),而参数化方法学习群体特定的偏好模型或适配器(Zhao et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib2);Ramesh et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib22);Chakraborty et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib23);Feng et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib24);Zhang et al., 2025b (https://arxiv.org/html/2608.11528#bib.bib4);Yao et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib3)),相关基准针对人口统计感知的偏好(Zhang et al., 2025a (https://arxiv.org/html/2608.11528#bib.bib8))。总体而言,评估衡量的是*预期*效果(对目标群体的拟合),而条件化的行为副作用未被测量。我们补上了这一缺失的评估。

#### LLM谄媚行为。
LLM通常以牺牲准确性或真实性为代价来赞同用户,这种谄媚倾向可追溯到奖励赞同的偏好数据(Perez et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib25);Sharma et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib9))。现有基准现已涵盖跨领域的屈服(Fanous et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib11))、虚假前提数学(Petrov et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib12))、多轮施压(Hong et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib27)),以及将社交谄媚视为过度维护面子的现象(Cheng et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib13), 2026a (https://arxiv.org/html/2608.11528#bib.bib10)),同时也有通过合成数据或定向微调进行缓解的方法(Wei et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib26);Chen et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib28))。对齐微调本身会放大谄媚行为(Hong et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib27))。我们将这一观察深化到*群体*对齐,并评估因对齐到不同人口统计群体而引发的谄媚行为变化。

#### 个性化与谄媚行为。
已知角色分配会带来超出预期引导的副作用:它会降低推理能力(Gupta et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib30))、引发毒性(Deshpande et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib31))并浮现刻板印象(Cheng et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib32);Salewski et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib33)),且结果对社会人口统计提示的措辞高度敏感(Beck et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib34);Hu and Collier, 2024 (https://arxiv.org/html/2608.11528#bib.bib35);Lutz et al., 2025 (https://arxiv.org/html/2608.11528#bib.bib36))。更接近谄媚行为的是,用户明示的偏好会调节赞同程度(Sharma et al., 2024 (https://arxiv.org/html/2608.11528#bib.bib9)),而累积的用户记忆会放大这种倾向(Xiang et al., 2026 (https://arxiv.org/html/2608.11528#bib.bib14);Hu et al., 2026 (https://arxiv.org/html/2608.11528#bib.bib15);Jain et al., 2026 (https://arxiv.org/html/2608.11528#bib.bib16))。在所有这些工作中,个性化信号位于推理时上下文中,将模型的倾向与对可见用户信息的适应混为一谈。我们的设计消除了这一混淆。参数化分支在权重中携带条件化,且没有谄媚测试输入包含人口统计信号(第3.4节 (https://arxiv.org/html/2608.11528#S3.SS4)),因此逐群体偏移可归因于群体对齐本身——据我们所知,此前尚无研究分离出这一量。

## 3 群体对齐引发的谄媚行为

### 3.1 问题设置

给定指令微调的基础模型 π₀ 和人口统计群体 g,群体对齐应用条件化过程 M,得到

π_g = M(π₀, D_g),  (1)

其中 D_g 是由 g 中受访者回答推导出的观点语料库(第3.2节 (https://arxiv.org/html/2608.11528#S3.SS2)),π_g 旨在以 g 最常采取的立场来回答争议问题。条件化可以存在于*上下文中*(在推理时注入群体描述符),也可以存在于*参数中*(在 D_g 上训练,将群体编码到模型权重中)。GAS同时评估条件化引发的观点匹配预期增益和谄媚行为的意外变化(第3.4节 (https://arxiv.org/html/2608.11528#S3.SS4))。

图2:GAS流程。(1)调查条目被改写为带立场回复的对话式查询,每个群体的调查回答定义其偏好对;(2)这些配对将基础模型条件化到目标群体;(3)每个条件化模型在目标群体拟合度的预期增益和七个谄媚指标的脱靶偏移上同时评分。测试输入不包含显式人口统计标签,且权重条件化分支在无角色提示的情况下作答。绿色:预期增益;红色/蓝色:高于/低于基础模型的谄媚行为。

### 3.2 立场对齐数据

#### 从调查条目到聊天数据。
我们基于OpinionQA(Santurkar et al., 2023 (https://arxiv.org/html/2608.11528#bib.bib5))构建,该数据集将皮尤美国趋势小组问题与个体回答及受访者人口统计信息配对,涵盖15波调查和1,506个问题。我们将原始受访者元数据映射到五个轴:政治倾向(民主党、共和党)、性别(男性、女性)、教育(高中及以下、部分大学、大学及以上)、收入(低、中、高)和婚姻状况(已婚或同居、曾婚、未婚)。由此得到13个群体。调查条目并非聊天数据,因此我们遵循Yao et al.(2025 (https://arxiv.org/html/2608.11528#bib.bib3))的方法,使用GPT-OSS-120B对每个条目进行改写。改写生成一个第一人称*对话式查询*,该查询引入话题但不表达观点或列举选项,以及*立场回复*,这些回复为一个选项进行论证而不会含糊其辞。LLM评判器将每条回复标注为`stance`、`refusal`或`hedge`,我们只保留`stance`回复;附录B (https://arxiv.org/html/2608.11528#A2)验证了所得语料库。完全丢失某一选项的问题被剔除,剩余1,330个问题。在进行任何群体特定处理之前,我们在每波调查内进行80/20的问题级划分,得到1,065个训练问题和265个测试问题。类别折叠、查询增强方案以及所有提示均见附录A (https://arxiv.org/html/2608.11528#A1)。

#### 偏好数据集构建。
对于每个群体和每个问题,偏好对将群体模态选项的立场回复作为被选回复,将任何其他选项的立场回复作为被拒回复,因此该配对编码了群体自身的调查回答。两个过滤器塑造训练集:一个问题只有在其受访者中超过30人回答时才会进入群体语料库,以确保模态基于可用样本;一个问题只有在其所在轴上的各群体并非共享同一模态答案时才会进入该轴的训练集,因为一致性问题不携带群体信号。

相似文章

解构LLMs中谄媚行为的内部表征

arXiv cs.LG

本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。