基于归因引导转向的LLM谄媚行为词元级诊断

arXiv cs.CL 论文

摘要

本文提出了一种基于积分梯度的词元归因方法,用于在词元级别诊断LLM中的谄媚行为,并提出了归因引导的对比激活转向方法,在不重新训练的情况下减少推理过程中的谄媚行为。

arXiv:2607.28906v1 公告类型:新 摘要:谄媚(Sycophancy)指的是大型语言模型(LLM)为迎合用户信念而牺牲事实正确性的倾向,从而削弱了模型的可靠性。先前评估LLM中谄媚行为的工作旨在判断模型输出是否与权威的主张一致,但无法揭示提示中哪一部分驱动了这种谄媚行为。为弥补这一空白,我们研究了谄媚回应与权威的可信资质、其断言性主张以及问题陈述之间的关系。我们引入了权威份额指数(ASI),这是一种基于积分梯度的词元归因方法,用于衡量模型决策在多大程度上受权威相关文本驱动。通过跨五个模型和30种测试配置的大量实验,我们发现谄媚回应始终比抗拒回应更关注权威词元。此外,我们的词元归因方法揭示,在谄媚案例中,权威所断言的主张比其可信资质受到更多关注。基于这些发现,我们提出了归因引导的对比激活转向来缓解LLM的谄媚行为。我们的方法从谄媚和抗拒回应的高归因词元中构建转向向量,选择性地推动模型走向抗拒。这使得无需重新训练即可在推理时进行转向,在最强的案例中将谄媚率从96%降至25%。总之,我们的结果表明,词元级归因既能解释谄媚行为的驱动因素,也能直接为实际干预提供信息。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:34

# 基于归因引导的 LLM 谄媚行为 Token 级诊断
来源:https://arxiv.org/abs/2607.28906  
查看 PDF(https://arxiv.org/pdf/2607.28906)

> 摘要:谄媚行为(Sycophancy)指的是大型语言模型(LLMs)以牺牲事实正确性为代价来迎合用户信念的倾向,从而削弱了模型的可靠性。先前评估 LLM 谄媚行为的工作旨在判断模型输出是否与权威的主张一致,但无法揭示提示(prompt)中哪一部分驱动了这种谄媚行为。为弥补这一空白,我们研究了谄媚响应与权威的资质凭证、其强硬主张以及问题陈述之间的关系。我们引入了权威共享指数(ASI)——一种基于积分梯度(Integrated Gradients)的 token 归因方法,用于衡量模型决策受权威相关文本影响的程度。通过在五个模型和 30 种测试配置上进行大量实验,我们发现与抵抗型响应相比,谄媚响应始终将更多注意力指向权威 token。此外,我们的 token 归因方法揭示,在谄媚情况下,权威所主张的论断比权威的资质凭证获得更多注意力。基于这些发现,我们提出了归因引导的对比激活转向(attribution-guided contrastive activation steering)来缓解 LLM 的谄媚行为。我们的方法从谄媚和抵抗响应的高归因 token 中构建转向向量,选择性地将模型推向抵抗方向。这使得无需重训练即可在推理时进行转向,在最强情况下将谄媚率从 96% 降至 25%。综上,我们的结果表明,token 级归因既能解释谄媚行为的驱动因素,也能直接指导实际干预措施。

## 提交历史

来自:Mahammed Kamruzzaman \[查看电子邮件(https://arxiv.org/show-email/33c0afb4/2607.28906)\] **\[v1\]** 2026年7月31日 星期五 00:05:36 UTC(8,596 KB)

相似文章

解构LLMs中谄媚行为的内部表征

arXiv cs.LG

本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。

衡量与检测有害的AI谄媚行为

arXiv cs.AI

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。