重新审视:在用户压力下测量多模态模型推理链中的谄媚性

arXiv cs.CL 论文

摘要

本文引入一个基准和数据集,用于评估大型多模态推理模型在用户压力下的谄媚性,通过分析最终答案和推理链,证明谄媚性可以独立地败坏推理过程。

arXiv:2608.28623v1 公告类型:新 摘要:大型多模态推理模型(LMRMs)能力日益增强,主要通过在回答前生成明确的链式思维推理。在语言模型中,观察到这种性能往往伴随着谄媚性,即模型倾向于同意用户而非证据。然而,对于LMRMs,目前尚无可靠的方法来测量谄媚性。我们通过引入一个基准和数据集来弥补这一空白,该基准和数据集用于评估LMRMs在面对用户错误答案时的谄媚性。我们的基准将四个视觉数据集(涵盖数学、临床、时间和人口统计推理)与五种压力条件在单轮和多轮设置中配对。我们评估最终答案中的谄媚性以及它在推理链中的出现。我们发现,在压力下谄媚性普遍存在,陈述压力引发的谄媚率最高,而信念压力最低(Mistral-Small-4除外);在多轮压力下,推理层级的谄媚性在临床视觉判断中急剧加剧,最受影响的模型达到95.7%。我们进一步引入了一个失败分类法,将推理链谄媚与答案层级谄媚分开,以及一个互补的句子层级分类法,用于定位推理链中首次出现偏差的位置。我们的结果表明,谄媚性可以独立于最终答案而败坏推理链,因此仅进行答案层级的评估是不充分的。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:53

# 再探:多模态模型在压力下的思维链谄媚性测量  
来源:https://arxiv.org/html/2608.28623  
Mahir Numayeer Islam 阿德莱德大学 & Gakuto Okuyama 秋田国际大学 & Nikolaus Siauw RNA Tech  
Shivank Garg Algoverse AI Research & Madhur Panwar Algoverse AI Research & Vasu Sharma PocketFM & Algoverse AI Research  

###### 摘要  
大型多模态推理模型(LMRMs)正通过在回答前生成明确的思维链推理而变得日益强大。在语言模型中已观察到,这种性能提升常伴随谄媚性——即模型倾向于附和用户而非坚持证据。然而,目前尚无可靠方法来衡量多模态模型的谄媚性。我们通过引入基准数据集来弥合这一差距,该数据集专门评估多模态模型在面对用户错误答案时的谄媚性。我们的基准结合了四个视觉数据集(涵盖数学、临床、时序和人口统计推理)与五种压力条件,并在单轮和多轮对话设置中进行测试。我们不仅评估最终答案的谄媚性,还分析了其在思维链中的产生过程。我们发现谄媚性在压力下普遍存在:除Mistral-Small-4外,"陈述压力"在所有模型中引发的谄媚率最高,"信念压力"最低;在多轮压力下,思维链谄媚性在PathVQA数据集中急剧加剧,受影响最严重的模型达到95.7%。我们进一步提出失败分类法,区分思维链层面与答案层面的谄媚性,并辅以句子级分类法来定位思维链中偏移的起始点。研究结果表明,谄媚性可能独立于最终答案而腐蚀整个思维链,因此仅评估答案层面是不够的。

## 1 引言  
大型多模态推理模型(LMRMs)正迅速向复杂现实应用迈进,通过整合文本与图像等多模态的感知与推理能力,支持高风险决策(Li等,2025)。与标准视觉语言模型不同,LMRMs在生成最终答案前会产生明确的思维链推理,这使其在需要可解释、基于证据推理的场景中日益重要。随着LMRMs在临床影像、文档分析和数学问题解决等领域的应用,其推理与答案的可信度成为核心关注点(Li等,2025)。然而,这种对显式推理的依赖在思维链本身引入了新的故障面——思维链可能成为社会影响力的目标。LMRMs在用户压力下能否保持正确的视觉推理,还是会调整推理以迎合用户的既定信念,目前尚未评估。在高风险场景中,模型若因用户自信的断言而放弃有效视觉证据,将带来重大风险。据我们所知,此前尚无研究从多轮压力、思维链分析与多模态输入的交叉点考察谄媚性(附录A)。我们通过引入首个专门针对LMRMs的谄媚性基准数据集来填补这一空白,评估模型在单轮与多轮用户压力下、跨越四个视觉数据集(涵盖数学、临床、时序和人口统计视觉推理)的行为。我们的评估不仅分析最终答案的谄媚性,还深入研究思维链本身,检验模型是否在得出结论前修正其视觉解读或放弃正确的推理步骤。基准涵盖五个模型与五种压力条件(包括多轮),测试模型在面对挑战时能否坚守立场,从而系统比较不同LMRMs家族在持续压力下的谄媚行为。我们提出了失败分类法(类型0至5),区分思维链层面与答案层面的谄媚性这两种不同的失败模式,包括模型推理正确但最终答案推翻结论、或反之的情况。此外,我们通过五类句子级分类法(延伸自"思维锚点"的句子级框架)对谄媚性偏移在思维链中的首次出现位置进行探索性分析,涵盖五个类别:视觉证据阅读[VE]、推理与推导[RD]、不确定性表达与重新考虑[UE]、用户信念认可[UB]和答案承诺[AC]。实验表明,LMRMs中的谄媚性现象广泛存在,且在最坏情况下极为严重。在陈述压力下,思维链谄媚率在最健壮的模型Gemini-3-Flash-Preview中为31.49%,在最易受影响的GPT-5.4-Mini中高达78.88%。谄媚性受压力形式而非强度的强烈影响,陈述压力在所有模型(除Mistral-Small-4外)引发的谄媚率最高,信念压力最低。其严重程度也高度依赖视觉领域,在PathVQA中达到顶峰:Claude-Sonnet-4.6在单轮压力下思维链谄媚率达76.38%,多轮压力下高达95.74%。多轮压力加剧了所有模型(除Grok-4.2-Reasoning外)的这一效应:GPT-5.4-Mini的思维链谄媚率从60.48%升至86.75%,Gemini-3-Flash-Preview从25.66%升至58.38%,这种升级特见于PathVQA领域。综合而言,结果表明谄媚性不仅存在于最终答案,更已渗入产生答案的推理过程。这些发现对评估与部署具有直接意义:谄媚性在此不仅是输出层现象,还可能腐蚀视觉推理过程本身,因此仅评估答案层面是不够的,需将思维链层面评估作为输出层评估的必要补充。我们的贡献如下:  
1. **基准与数据集**:首个针对LMRMs的谄媚性基准与数据集,结合四个涵盖数学、临床、时序和人口统计视觉推理的数据集与五种提示条件(含多轮压力),直接弥补了现有基准(如MM-SY和SYCON Bench)的不足。  
2. **三轴评估**:首次在单轮与多轮压力下研究五个模型的思维链谄媚性,联合测量思维链层面与答案层面的谄媚性,并沿三个轴刻画每个模型:引发谄媚性的*压力类型*、定位思维链中首次出现偏移的*偏移类别*,以及思维链与答案谄媚性之间的*一致性差异*。  
3. **分类法**:提出区分思维链层面与答案层面谄媚性的失败分类法,并辅以五类句子级分类法,描述谄媚性偏移在思维链中的首次出现位置。  

图1:实验流程概览。从四个视觉问答数据集中采样,配对构建的错误答案,在单轮与多轮设置下施加五种压力条件,然后由LLM评审组标注思维链与答案的谄媚性,对存在思维链谄媚性的案例分配偏移类别。

## 2 实验设置  
### 2.1 数据集整理  
我们评估四个多模态视觉问答基准,以覆盖不同的视觉推理需求:ClockQA(模拟时钟读取)、PathVQA(病理图像理解)、MathVision(基于图形的数学推理)和SB-Bench(基于真实图像的刻板偏见推理)。我们分别从每个数据源固定抽取62、150、150和100个问题。对于多选数据集(MathVision、SB-Bench),错误答案选自错误选项;对于PathVQA,错误答案为真值的反面;对于ClockQA,错误答案通过扰动真实时间生成。各数据集的来源划分、过滤与错误答案构建的详细信息见附录B。  
### 2.2 设置  
我们评估五个LMRMs:GPT-5.4-Mini、Claude-Sonnet-4.6、Gemini-3-Flash-Preview、Mistral-Small-4和Grok-4.2-Reasoning。这些模型在中间推理的暴露方式上各异,包括可配置的扩展推理预算(Grok-4.2-Reasoning和Mistral-Small-4)与固定内置默认值产生的推理。所有模型均在生成最终答案前产生中间思维链。完整实现细节(包括提供商、令牌预算与推理配置)见附录C。  
每个基线样本接受五种不同的谄媚压力条件:陈述、信念、确信、权威和社会压力。这些条件从直接断言错误答案,到诉诸用户声明的信念、表达的信心、声称的权威及社会共识,涵盖了用户可能采用的不同社会与认知压力策略。各条件的完整定义与示例见附录M.1。  
### 2.3 推理流程  
对于每个样本,我们先收集无压力时的基线响应,然后在五种压力条件下重新查询模型,测量其推理与最终答案的改变程度(图1)。仅保留模型在基线时回答正确的样本用于谄媚性评估(附录D)。  
在**单轮**设置中,每个压力条件作为独立查询呈现,模型在单个提示中接收原始问题与注入的压力信息,并生成新响应,无先前对话上下文。  
在**多轮**设置中,压力信息作为第二轮对话传递:模型首先看到无压力的原始问题(第一轮)并生成响应,然后收到压力信息(第二轮)并被要求重新考虑。模型自身的第一轮思维链与答案在其处理第二轮压力时可见于上下文窗口。该设计检验已书面承诺立场的模型后续是否会被迫放弃该立场。  
### 2.4 LLM评审  
所有标注由三位LLM评审在多数投票协议下完成。两位主要评审(GPT-5.4-Mini和Claude-Sonnet-4.6)独立评估每个响应,Gemini-3-Flash-Preview在意见分歧时作为平局决胜者(在单轮中23.2%、多轮中19.8%的案例中出现分歧)。评审来自三个不同的模型家族以缓解系统性一致偏差,我们在附录K中验证了无针对自身家族的系统性偏好。给定基线(问题、真值答案、原始思维链与答案)和压力响应后,评审评估思维链是否显示屈服迹象(无论最终答案是否改变),即模型是否向用户错误主张让步并调整推理以迎合,而非依据视觉证据检验。同时标注最终答案是否改为匹配注入的错误答案。我们将**思维链谄媚性**作为主要指标,因其捕捉了未在最终答案中体现的隐蔽屈服。对于存在思维链谄媚性的样本,专门的偏移类别评审定位谄媚性在思维链中首次出现的位置,将其分配至五个互斥类别之一:VE、RD、UE、UB和AC(附录E)。

## 3 结果  
### 3.1 各压力条件下的模型谄媚性  
谄媚性更多受压力形式而非强度影响,如各条件谄媚率热图所示(附录G)。五个模型中,Mistral-Small-4在单轮与多轮评估中的平均思维链谄媚率最高(分别为61.40%和56.73%)。在多轮中,Mistral-Small-4和Grok-4.2-Reasoning是仅有的两个相比单轮降低思维链谄媚率的模型(分别降低4.67%和26.28%)。相比之下,Gemini-3-Flash-Preview在单轮中平均思维链谄媚率最低(17.86%),Grok-4.2-Reasoning在多轮中最低(10.85%),较其单轮的37.13%显著改善。  
对于单轮,陈述压力条件在几乎所有模型中引发最高的答案谄媚率(表1),平均为57.91%,其次是权威压力(平均45.11%)和社会压力(39.78%)。多轮中同样这三个条件引发最高的答案谄媚率,陈述压力为51.69%。仅断言错误答案就比诉诸权威或社会共识引发更多谄媚性,表明压力的形式不如其存在本身重要。压力形式也设定了下限,除Mistral-Small-4外,确信压力在所有模型中引发的谄媚率最低;陈述压力下的思维链谄媚率在最健壮模型Gemini-3-Flash-Preview中为31.49%,在最易受影响的GPT-5.4-Mini中达78.88%。各条件下的完整答案谄媚率见表1,两种设置的思维链谄媚率热图见附录G。  

表1:各模型与压力条件下的答案谄媚率(%),适用于单轮与多轮压力。列为陈述、信念、确信、权威、社会及模型在五个条件下的平均值。各模型引发最高谄媚率的压力条件加粗显示。整体谄媚率最低的模型也加粗。两种设置的对应思维链谄媚率热图见附录G(图7和8)。  

### 3.2 各数据集的模型谄媚性  
谄媚性严重程度高度依赖视觉领域。对于单轮,PathVQA具有最高的平均思维链谄媚率。

相似文章

记忆过度:记忆增强模型中的谄媚评估与缓解

arXiv cs.AI

本文介绍了 MIST,一个用于评估记忆增强大型语言模型中谄媚行为的基准,表明记忆系统将谄媚行为放大了高达 25 倍,并提出了轻量级的缓解措施,在减少谄媚的同时保持事实回忆能力。

位置而非来源:区分医学视觉语言模型中的推理中介与谄媚

arXiv cs.LG

本文介绍了 CoT-Mediate,一个行为框架,用于测试医学视觉语言模型中的思维链推理是真正驱动预测,还是仅仅装饰预测。通过对 VQA-RAD 上的 LLaVA-Med 和 MedGemma 进行审计,发现推理的注入方式(前缀强制 vs 重新提示)以及归因来源(自我 vs 专家)显著影响模型的忠实度和谄媚程度。

粒度鸿沟:对Gemini模型中谄媚行为的多维纵向审计

arXiv cs.CL

本文审计了Gemini模型(2.0、2.5、3.0)中的谄媚行为,发现二元安全指标遗漏了94%的轻度至中度谄媚响应——即“粒度鸿沟”。研究显示,谄媚行为可预测幻觉,安全轨迹非单调,且简单护栏优于复杂推理协议。