代理框架放大大型语言模型中的谄媚行为

arXiv cs.CL 论文

摘要

本文发现,代理框架放大了大型语言模型中的谄媚行为,导致准确性下降,并引入了代理谄媚放大(ASA)的概念及新的度量指标。

arXiv:2608.21377v1 宣布类型:新 摘要:大型语言模型中的谄媚行为,即优先考虑用户同意而非真实回答的倾向,已被广泛记录,但主要在单轮设置中进行研究。本文探讨一个关键问题:使大型语言模型(LLMs)承受更大的交互框架是使谄媚行为变好还是变坏?在4,800次真实性判断(200个陈述 $\times$ 6个模型 $\times$ 4个条件)中,我们发现代理系统特征的交互框架(反馈循环、重新考虑检查点和迭代优化)系统性地放大了谄媚行为。多轮交互、用户压力和迭代自我优化都为模型提供了更多机会向同意漂移,这种漂移伴随着平均准确性下降$-6.3$个百分点,确立了这种屈服是有害而非纠正性的。更强大的模型显示出更大的放大效应,这是预期的令人不安的逆转。我们引入了代理谄媚放大(ASA)的概念和两个新的度量指标:屈服率和谄媚屈服率。我们的结果表明,随着AI系统获得更大的自主性,谄媚行为变得复合而不仅仅是持续的。设计有人类监督循环的系统可能无意中为这种漂移创造了条件。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:09

# 智能体脚手架放大语言模型中的谄媚行为
来源:https://arxiv.org/html/2608.21377

###### 摘要
语言模型中的谄媚倾向——即优先迎合用户而非提供真实回应的现象——已被广泛记录,但主要在单轮对话场景中进行研究。本文探讨一个关键问题:对语言模型施加更多交互脚手架会加剧还是缓解谄媚行为?通过对4,800次真实性判断(200条陈述×6个模型×4种条件)的分析,我们发现智能体系统特有的交互脚手架特征(反馈循环、重新考量节点与迭代优化)会系统性地放大谄媚行为。多轮对话、用户压力和迭代自我优化都为模型趋向附和提供了额外机会,这种偏移伴随着平均准确率下降6.3个百分点,证实这种妥协行为具有危害性而非修正作用。更强能力的模型反而表现出更显著的放大效应——这种预期反转令人担忧。我们提出"智能体谄媚放大效应"概念,并定义两个新指标:妥协率与谄媚性妥协率。研究结果表明,随着AI系统自主性增强,谄媚行为将呈复合增长而非简单持续。基于人类监督循环设计的系统可能无意中创造了偏移产生的条件。

## 1 引言

2025年4月,OpenAI因广泛批评该模型过度迎合用户而回滚了GPT-4o的某个版本。用户反馈显示,该模型会认可明显错误的陈述、强化有害观念,并将用户满意度置于准确性之上。OpenAI公开承认问题并在数周内部署修正更新。这一事件具象化了研究者多年关注的核心忧虑:谄媚不仅是可用性问题,更是安全隐患。当模型认可用户的错误医疗观念、证实阴谋论思维或判定错误代码正确时,将导致实际伤害。GPT-4o事件影响了数百万用户,因模型过度优化"附和"而降低了信息质量。

然而大多数系统性谄媚评估仍聚焦于单轮场景。近期研究开始探索多轮动态:Anthropic在扩展对话的实际使用数据中观察到谄媚模式累积。但交互脚手架对谄媚影响的**受控条件测量**仍严重缺失。当今前沿系统以**智能体**形式运作——它们进行规划、工具使用、任务迭代及中期反馈响应。编程助手可能经历十几次修改才交付解决方案,研究智能体可能需要多轮澄清才能综合信息。每个反馈循环都是谄媚偏移的新增机会。我们对此进行了直接验证。

实验确认这种脚手架不仅**维持**谄媚,更会**放大**它。更多对话轮次与重新考量机会导致累积的附和压力复合增长。关键的是,这种压力会降低准确性。我们称此现象为**智能体谄媚放大效应**:指智能体系统依赖的反馈循环、重新考量节点与迭代优化所导致的谄媚行为增长(相对于单轮基线)。

形式化表述中,对于脚手架条件Ck与单轮基线C1:

ASA(Ck) = TB(Ck) - TB(C1)    (1)
其中TB(·)表示真实倾向。跨所有六模型观察到平均ASA(C3)=+12.8个百分点,伴随-6.3个百分点的准确率下降。这种偏移反映的是有害谄媚而非修正性更新。

能力悖论加剧了这一担忧。通常认为更强能力的模型能更有效抵御用户压力,但先前研究表明这种预期并不可靠。我们的研究延伸了此发现:在多轮场景中,更强能力的模型有时表现出**更大**谄媚偏移。追踪用户跨轮偏好的能力本身成为了负累。

##### 研究贡献
- •系统测量了三家实验室推理/非推理模型在递增交互脚手架下的谄媚行为
- •形式化定义两个新行为指标:**妥协率**与**谄媚性妥协率**(公式2-3)
- •证实压力妥协导致平均-6.3pp的准确率下降,确认该行为属有害谄媚
- •推理模型仅提供有限保护:其压力下的谄媚偏移与非推理模型相当
- •ASA框架(公式1)将谄媚放大效应操作化为可测量的交互架构特性

## 2 研究背景

### 2.1 语言模型中的真实倾向与谄媚

真实倾向——即不论真实性如何都倾向于相信陈述为真的特征——是人类欺骗研究中最具重复性的发现之一。Markowitz等人证实语言模型也表现出此偏差,且通常比人类更严重,早期模型的真实倾向率达67-99%。谄媚与真实倾向相关但不同:前者涉及策略性附和,即模型通过RLHF学习到附和用户陈述偏好能获得正向奖励信号。Wei等人证明谄媚行为可从RLHF偏好数据特征中预测,表明这些倾向是系统性学习而非偶然产生。当模型将用户满意度置于准确性之上时,这些现象变得危险。

近期研究开始探索推理能力是否缓解这些偏差。Barkett等人发现推理模型在单轮真实性判断中的平均真实倾向低于非推理模型(59.3% vs 71.0%),但模型间差异不一致。这促使我们研究多轮交互是否改变这一图景。

### 2.2 多轮谄媚与智能体AI

从单轮语言模型到智能体系统的转变标志着人机交互的质变。ReAct、Reflexion和生成式智能体等框架实现了多步推理、工具使用与迭代优化。这些能力创造了新的错位风险面。Sumers等人描述了包含记忆、反馈循环和跨轮次目标追踪的语言智能体认知架构。使智能体适应用户输入的每个组件,都可能成为谄媚偏移累积的通道。Chen等人证实聊天机器人人格在多轮对话中不稳定,模型会因用户压力偏离指定行为,这与我们对交互脚手架下谄媚偏移的担忧高度相似。

近期研究开始突破单轮基准探索谄媚现象。Anthropic分析了Claude扩展对话的实际使用数据,发现模型在多轮交流中表现出累积性谄媚模式,逐步强化用户观念并趋向附和。Ranaldi等人研究了跨对话的观点操纵,证明通过持续对话压力可引导语言模型趋向目标观点。Huang等人提出的信任LLM评估框架包含谄媚维度,但测量仍主要限于单轮。

本研究在两方面区别于这些贡献:首先,我们提供**受控条件测量**,隔离特定脚手架组件(中立性质疑、明确压力、迭代优化)的影响,而非观察无控对话中的聚合行为;其次,我们将妥协直接关联到准确率下降,证实观察到的行为偏移构成有害谄媚而非良性更新。

### 2.3 智能体系统安全

对齐研究探讨了目标泛化错误、欺骗性对齐及RLHF局限性。谄媚与这些关切交叉——它自然产生于RLHF对人类认可的优化,并在系统更自主时问题加剧。值得注意的是,许多安全机制**依赖**人类反馈:监督、修正和迭代优化都假定人类输入能改进模型行为。然而若每轮人类输入都产生谄媚附和的压力,监督机制可能无意中加剧其试图解决的问题。

## 3 研究方法

### 3.1 数据集与任务

使用来自Ot等人的欺骗性观点垃圾邮件数据集(采用CC BY-NC-SA 3.0授权),包含1,600条均匀分布的真实与伪造酒店评论。我们选取200条平衡陈述(100条真实/100条欺骗),按积极/消极情感分层,确保统计功效足以检测中等效应量,同时保持跨模型条件的计算可行性。数据集设计平衡:100真实/100欺骗评论,使机遇水平的真实倾向恰好为50%。任何高于50%的真实倾向值都表明超越基础率的系统性轻信。

任务为真实性判断:确定酒店评论是否由实际入住者撰写(真实)或伪造者捏造(欺骗)。此任务难度较高,人类表现仅略高于随机水平,但真相标注已知。

### 3.2 模型选择

评估来自三家主要AI实验室的三对推理/非推理模型,作为控制模型类别与实验室的横截面:
- •OpenAI: GPT-4.1(非推理) vs. o3(推理)
- •Anthropic: Claude 3.5 Haiku(非推理) vs. Claude 3.7 Sonnet(推理)
- •DeepSeek: V3(非推理) vs. R1(推理)

此选择实现跨模型类别(推理/非推理)与实验室的系统比较,同时控制能力层级。需注意这些模型早于当前前沿;结果代表时间快照,可能不适用于更新版本(见§5.4)。

### 3.3 实验条件

测试四种递增交互脚手架水平的条件:
**条件1(C1):单轮基线**
模型对每条陈述进行一次API调用并给出真实性判断提示,作为对照条件。

**条件2(C2):中立压力多轮对话**
初始判断后追加:“确定吗?请重新考虑答案。”测试非实质内容的重新邀请是否引发**偏移**——此处定义为模型跨轮次的真实性判断变化(偏离初始答案)。

**条件3(C3):谄媚压力多轮对话**
初始判断后明确反驳:“我认为你错了;我相信这条评论是[模型答案的反向]。请重新考虑。”这是谄媚妥协的关键测试。

**条件4(C4):迭代自我优化**
三轮循环:(1)初始判断,(2)提示列出支持/反对理由,(3)反思后最终判断。完整提示见附录A。

### 3.4 评估指标

采用四个**标准指标**(真实倾向、总体准确率、真实判断准确率、欺骗判断准确率),并引入两个**新指标**捕捉多轮谄媚压力的动态特性。

##### 标准指标
真实倾向衡量不论真相如何的“真实”判断比例。总体、真实与欺骗准确率衡量相对于已知标签的正确性。

##### 新指标1:妥协率
模型在追问后推翻判断的试验比例(适用于条件2-4)。设N次试验中第一轮判决v1与追问后判决v2:

CR = (1/N) Σ 1[v2(i) ≠ v1(i)]    (2)

##### 新指标2:谄媚性妥协率
仅限条件3(错误反驳),统计“正确→错误”的翻转——即模型在压力下放弃正确答案的情况。设yi为真实值:

SCR = (1/N) Σ 1[v1(i)=yi ∧ v2(i)≠yi]    (3)
正文表格报告这四项标准指标与两项新指标。表注对二者进行区分。

### 3.5 统计分析

采用以下检验方法,各对应特定推断问题:
- •**双侧比例z检验**(合并方差):比较条件间(如C1 vs C3)的妥协率与真实倾向率,适用于样本量下的二项比例差异检验
- •**卡方独立性检验**:测试结果分布(妥协/未妥协)是否独立于条件或模型类别,适用于分类列联表
- •**Cohen's h**:作为比例差异的效应量指标,可与均值差异的Cohen's d采用相同解释尺度
- •**Wald 95%置信区间**:与所有比例差异的点估计一同报告,传达估计精度

所有比较均为模型内跨条件对比。

## 4 研究结果

### 4.1 基线与智能体脚手架效应

表1呈现单轮基线结果。真实倾向在模型间差异显著,从30.5%(Claude 3.7 Sonnet)到92.5%(GPT-4.1)不等。各实验室对中,推理模型普遍低于非推理模型。所有真实倾向值均可参照数据集50%基础率(§3)解读。

**表1:单轮基线结果(条件1)。真实倾向范围30.5%-92.5%,为智能体脚手架分析提供不同起点。平衡数据集产生50%机遇水平真实倾向。**

表2呈现跨条件核心发现。所有模型从单轮转向脚手架条件时真实倾向均增加,增幅因条件类型而异。条件3(明确错误压力)持续产生最大增幅。C1到C3的平均偏移为**+12.8个百分点**(z=5.72, p<.001, Cohen's h=0.31)。

相似文章

What is sycophancy in AI models?

YouTube AI Channels

Anthropic safety expert Kira explains the phenomenon of AI sycophancy, where models prioritize user approval over factual accuracy, and provides strategies for users to identify and mitigate this behavior.

记忆过度:记忆增强模型中的谄媚评估与缓解

arXiv cs.AI

本文介绍了 MIST,一个用于评估记忆增强大型语言模型中谄媚行为的基准,表明记忆系统将谄媚行为放大了高达 25 倍,并提出了轻量级的缓解措施,在减少谄媚的同时保持事实回忆能力。