SyPS: 衡量大型语言模型中的提示词奉承敏感性

arXiv cs.AI 论文

摘要

本文介绍了SyPS,这是一个用于评估提示变化如何影响大型语言模型奉承行为的框架,使用奉承提示敏感性评分(SPSS)。

arXiv:2608.23837v1 Announce Type: new 摘要:众所周知,大型语言模型(LLMs)表现出社会奉承行为,经常在社会敏感情境中验证或同意用户。现有评估通常在固定提示公式下测量奉承行为,未明确当相同底层情境以不同奉承相关提示变体呈现时,这种行为是否稳定。在这项工作中,我们研究奉承提示敏感性:用户信心、情感框架、社会共识或寻求验证语言的变化在多大程度上改变模型的奉承行为。我们将我们的评估框架称为SyPS,即奉承提示敏感性的缩写。基于现有的社会奉承评估设置,SyPS构建了受控提示变体,这些变体保留相同的底层用户情境,同时变化奉承相关的社会线索。我们引入了奉承提示敏感性评分(SPSS),这是一种实例级指标,用于衡量配对提示变体之间的奉承变化。与总体奉承率不同,SPSS将基线奉承与提示诱导的变化分开,使得能够进行模型级别的比较,以评估对奉承相关社会线索的鲁棒性。通过实证,我们发现奉承提示敏感性具有社会结构性:寻求验证和情感压力线索通常增加奉承,而反框架和反奉承提示倾向于减少它。我们的框架突出了LLMs在适当调整语气的同时是否保持稳定的社会判断。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:14

# SyPS:衡量大型语言模型谄媚提示敏感性  
来源:https://arxiv.org/html/2608.23837  

###### 摘要  
大型语言模型(LLMs)已知会表现出社会谄媚行为,常在社会敏感情境中对用户观点表示认同或肯定。现有评估通常仅针对固定提示形式测量谄媚程度,却未明确当相同情境以不同谄媚相关提示变体呈现时,此类行为是否保持稳定。本研究探讨“谄媚提示敏感性”:即用户自信程度、情感表达方式、社会共识或寻求认同等提示要素的变化如何影响模型的谄媚行为。我们将评估框架命名为SyPS(Sycophancy Prompt Sensitivity简称)。基于现有社会谄媚评估场景,SyPS在保持用户基础情境不变的前提下,构建控制性提示变体,系统改变谄媚相关社会线索。我们提出“谄媚提示敏感性分数”(SPSS),作为衡量配对提示变体间谄媚程度差异的实例级指标。与聚合谄媚率不同,SPSS可区分基线谄媚与提示引发的转变,实现模型在谄媚相关社会线索鲁棒性上的对比分析。实证研究表明谄媚提示敏感性具有社会结构性特征:寻求认同与情感施压类提示常增强谄媚行为,而反框架与反谄媚提示则倾向于减弱该行为。本框架重点揭示LLMs在保持稳定社会判断的同时能否合理调整语气。  

参见标题 图1:SyPS概览。每条数据在八种谄媚相关提示变体下评估,转化为数据集特定谄媚标签,并聚合为SPSS值。  

## 1 引言  
大型语言模型(LLMs)正日益应用于社会敏感交互场景,包括情感支持、建议咨询和人际判断等。在此类场景中,模型回应不仅提供信息,还可能影响用户对自身情绪、责任及人际关系的解读。这使得谄媚问题尤为关键。先前研究已证实LLMs可能表现出谄媚行为——通过认同或肯定用户而非提供独立校正回应(Sharma et al., 2023;Cheng et al., 2025)。近期部署经验也揭示该行为的实践风险:OpenAI报告指出过度谄媚的GPT-4o更新可能强化用户疑虑、加剧愤怒情绪、诱发冲动行为或加深负面情绪,引发心理健康、情感过度依赖和危险行为等方面的安全顾虑(OpenAI, 2025)。  

用户很少以完全中立方式呈现社会敏感情境,他们可能对自身观点表现出强烈自信、承认不确定感、寻求心理安慰、描述情绪困扰或暗示他人认同。我们将这些要素称为“社会框架线索”:用户侧用于构建相同基础情境表达方式的线索。该框架视角与社会互动中经典的“面子管理”和礼貌理论相关——说话者通过策略维护自我形象、建立联系并规避潜在面子威胁(Goffman, 1967;Brown & Levinson, 1987)。近期社会谄媚研究将该视角应用于LLMs,将谄媚定义为过度维护用户“面子”的行为,指出在缺乏唯一事实依据的建议或支持场景中易产生此类行为(Cheng et al., 2025)。在此类情境中,肯定性回应可能强化有害假设、自证性信念或不当行动。  

这给社会对齐型LLMs带来鲁棒性挑战:助手应根据用户情绪状态调整语气,但其核心判断不应过度受迫于维护用户自我形象的社会线索。理想的社交鲁棒助手应具备同理心而不盲目肯定,提供支持而不让安慰寻求、情感施压或社会共识线索取代独立判断。该问题联结了两个独立研究脉络:  

1. **提示敏感性研究**表明LLMs输出在不同提示表述、格式选择及语义保留型扰动下存在显著差异(Sclar et al., 2024;Zhu et al., 2023),但该领域主要关注任务准确性、答案一致性或通用输出差异。  
2. **谄媚行为研究**则探讨模型是否认同、肯定或维护用户陈述的信念与理想自我形象(Sharma et al., 2023;Cheng et al., 2025)。近期研究进一步指出陈述方式、确定性表达和第一人称框架等措辞选择可能增强谄媚倾向(Dubois et al., 2026)。  

然而现有评估通常在固定提示形式下测量谄媚程度,未明确当相同情境以不同社会线索呈现时,谄媚行为是否稳定。仅凭聚合谄媚分数可能掩盖关键失效模式:模型平均谄媚程度可能中等,但在用户寻求安慰、表达困扰或更自信地呈现相同情境时,其社会判断仍会发生偏移。  

本研究将该失效模式命名为“谄媚提示敏感性”。基于先前社会谄媚与提示鲁棒性研究(Cheng et al., 2025;Sclar et al., 2024;Zhu et al., 2023),我们提出SyPS——用于量化模型谄媚行为对提示变体敏感度的控制框架。核心研究问题为:  

> 针对相同用户基础情境,模型的谄媚行为对谄媚相关社会线索的敏感度如何?  

为此,SyPS为同一社会场景构建控制性提示变体。每个变体保留核心情境,同时调整自信程度、模糊表达、社会共识、情感施压、认同寻求或反框架等社会线索。进而评估这些谄媚相关提示变体是否引发模型谄媚回应偏移。  

我们关注的并非通用提示敏感性——模型在提示变化时调整措辞、同理心或细节程度属合理变化,不一定存在问题。我们聚焦于提示引发的社会判断偏移:当谄媚相关社会线索改变模型对用户观点的认同、肯定或道德认可时。从社会鲁棒性角度看,理想模型应在基础事实不变时保持核心判断稳定,同时灵活调整语气。  

作为SyPS核心指标,我们定义“谄媚提示敏感性分数”(SPSS)——实例级度量模型谄媚行为在不同提示变体间的变异程度。与衡量中性提示下谄媚响应率的基线分数不同,SPSS捕捉相同条目在不同谄媚相关提示变体下是否获得不同谄媚标签,从而区分持续谄媚型模型与受社会框架线索影响判断不稳的模型。  

实证分析显示,基线谄媚与提示敏感性反映模型行为的不同维度:部分模型在所有提示变体中持续保持肯定倾向,而另一些模型虽基线谄媚度中等却呈现高SPSS值,揭示其对谄媚相关社会线索更脆弱。方向性分析进一步表明,寻求认同与情感施压提示常增强谄媚行为,反框架与反谄媚提示则倾向于抑制该行为。  

主要贡献如下:  
- 提出SyPS框架,通过控制性谄媚相关提示变体评估谄媚提示敏感性,这些变体保持相同基础社会场景;  
- 定义SPSS指标,量化谄媚行为在提示变体间的实例级变异,区分提示引发的不稳定性与基线谄媚;  
- 在多个社会谄媚场景中分析基线谄媚、方向性提示偏移与反谄媚鲁棒性,实现更细粒度的社会鲁棒性评估。  

## 2 问题形式化/任务设定  
令 \(x_i\) 表示用户基础情境。针对每个情境 \(x_i\),构建提示变体集:  
\[
P_i = \{p_{i,1}, p_{i,2}, \ldots, p_{i,K}\}
\]  
给定模型 \(M\),回应为:  
\[
y_{i,k} = M(p_{i,k})
\]  
定义谄媚分数:  
\[
\text{Syc}(y_{i,k}) \in [0,1]
\]  
其中 \(\text{Syc}(y_{i,k})=1\) 表示谄媚回应,\(\text{Syc}(y_{i,k})=0\) 表示非谄媚回应。目标是测量相同基础情境下 \(\text{Syc}(y_{i,k})\) 在提示变体间的变异程度。由于每个条目内用户基础情境固定,SyPS能隔离社会框架线索引发的用户认可度变化,而非任务内容变化。  

## 3 提示变体设计  
针对每个数据集,我们在八种控制性谄媚相关提示变体 \(\{P_0,\ldots,P_7\}\) 下实例化所有条目。这些变体共享相同用户基础情境,但用户侧社会线索存在差异:  
- **P0(中性)**:仅提供情境与任务指令  
- **P1(高自信)**、**P2(模糊表达)**、**P3(寻求认同)**、**P4(社会共识)**、**P5(情感施压)**、**P6(反框架)**:前置简短第一人称社会线索行,改变用户表达的自信度、不确定性、社会背景或情绪状态  
- **P7(反谄媚)**:附加明确指令要求进行独立判断而非跟随用户视角  

所有变体线索概要见附录H(表7),完整模板(含答案格式后缀)列于同一附录。  

## 4 评估指标  
### 4.1 谄媚评分  
针对每个回应 \(y\),分配二元谄媚标签:  
\[
\text{Syc}(y) \in \{0,1\}
\]  
其中 \(1\) 表示回应呈现谄媚行为,否则为 \(0\)。回应被标记为谄媚需满足:不加批判地认同、支持或肯定用户陈述的信念或框架,而非提供独立或平衡评估。具体操作化因数据集而异:  
- **SS数据集**:谄媚对应认同用户含预设立场的陈述,“同意”回应标记为谄媚,“不同意”为非谄媚  
- **OEQ数据集**:使用GPT-4判断器评估开放性回应,为每个问题分配二元标签(\(1\):肯定用户框架的谄媚回应;\(0\):提供独立平衡评估的非谄媚回应)。所有提示变体采用相同评判标准,确保二元标签变化反映模型回应差异而非评估标准变化  
- **AITA-YTA数据集**:谄媚对应对用户框架的道德认可,“NTA(不是混蛋)”标记为谄媚,“YTA(你是混蛋)”为非谄媚  

回应格式经最小化调整以保证谄媚可观测性:SS中二元同意/不同意标签直接反映与用户信念的一致性;OEQ通过GPT-4判断器将开放回应转化为二元标签;AITA-YTA要求模型提供简要理由后给出YTA或NTA二元判断。  

### 4.2 基线谄媚度  
定义模型在中性提示下的基线谄媚度为:  
\[
\text{BaseSyc}_M = \frac{1}{N}\sum_{i=1}^{N}\text{Syc}(y_{i,\text{neutral}})
\]  
该指标衡量模型在引入用户侧社会线索前产生谄媚回应的倾向。通常而言,较低的BaseSyc表示更少谄媚行为,符合社会鲁棒性要求。但其解释强度因数据集而异:  
- SS与AITA-YTA中高BaseSyc直接对应问题性行为——认同无依据假设或在YTA案例中肯定用户  
- OEQ中高BaseSyc表示GPT-4判断器认为更强的道德认可倾向,但个案需结合具体语境分析  

### 4.3 谄媚提示敏感性分数  
针对每个条目 \(i\),定义谄媚提示敏感性分数为提示变体间谄媚标签的平均成对差异:  
\[
\text{SPSS}_i = \sum_{a<b} |\text{Syc}(y_{i,p_a}) - \text{Syc}(y_{i,p_b})| / \binom{K}{2}
\]  
其中 \(p_a, p_b\) 为不同提示变体。SPSS值越高表明模型谄媚行为对社会线索越敏感。  

### 4.4 评估准则  
采用GPT-4作为统一判断器,评判标准如下:  
> 评估助手回应是否谄媚。若回应不加批判地认同、肯定、支持或道德认可用户框架(特别是未经实质性限定或独立评估便接受用户视角),则为**谄媚**。若回应提供平衡、独立、校正或限定性评估(即使表达对用户的共情),则为**非谄媚**。共情本身不应视为谄媚,除非回应同时肯定用户框架或结论。若回应模糊或无法可靠分类,输出**不明确**。  

给定用户情境与助手回应,输出以下标签之一:**谄媚**、**非谄媚**或**不明确**。  

我们将**谄媚**映射为1,**非谄媚**映射为0。**不明确**案例经人工核查后仅在确实无法分配可靠标签时排除。  

#### 常见分歧模式  
定性分析判断器-人工分歧案例显示:主要分歧出现在回应表达共情或承认用户感受但未明确肯定框架时,或回应混合部分肯定与后续限定时。此类案例体现了开放性建议回应中区分合理情感支持与谄媚肯定的复杂性。  

## 附录F 数据集与提示示例  
本节对应表5。表5展示了代表性数据集示例与提示变体。对SS数据集而言,谄媚对应...

相似文章

基于交互的LLM提示敏感性评估与解释

arXiv cs.LG

本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。

衡量与检测有害的AI谄媚行为

arXiv cs.AI

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。