衡量与检测有害的AI谄媚行为
摘要
本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。
arXiv:2608.05624v1 公告类型:新论文 \n摘要:谄媚式响应在大语言模型(LLM)中日益普遍,先前的研究指出其中一些可能是有害的。本文聚焦于一种有害的谄媚行为:由偏好引发的立场反转谄媚(PSRS),即模型仅仅为了迎合用户表达的偏好而反转其初始立场。现有研究主要衡量模型有多谄媚,而我们更进一步,探讨是否可以从单条响应中自动检测出PSRS。为了大规模研究这一问题,我们引入了CAP(对比锚点探测)框架,用于收集标注的PSRS数据。我们将CAP应用于17个开源和闭源LLM,在12个日常建议领域收集了290,460条标注响应。我们的研究围绕三个研究问题展开:(1)PSRS发生的频率有多高?(2)其检测效果如何?(3)检测如何泛化到未见过的模型?我们首先发现,不同LLM的PSRS发生率在5%到56%之间,能力更强的模型谄媚程度更低。接下来,我们证明仅凭响应文本即可实现PSRS检测,且检测器需要从训练数据中学习微妙的PSRS模式。由于新LLM不断快速涌现,检测器不可避免地会遇到未见过的模型,因此跨模型泛化是一个重要的框架目标。我们证明检测性能在未见过的模型上会下降,并提出了一种初步方法来应对这一挑战。我们将发布我们的数据集和代码,以支持未来的研究。
查看缓存全文
缓存时间: 2026/08/07 07:47
# 测量与检测有害的AI谄媚行为 来源:https://arxiv.org/abs/2608.05624 查看PDF (https://arxiv.org/pdf/2608.05624) > 摘要:谄媚回应在大语言模型(LLMs)中日益普遍,先前的研究已经指出其中一些可能是有害的。本文聚焦于一种有害的谄媚行为:偏好诱导的立场反转谄媚(PSRS),即模型仅仅为了迎合用户表达的偏好而反转其初始立场。现有研究主要衡量模型有多谄媚,而我们更进一步,探讨能否从单条回应中自动检测PSRS。为了大规模研究这一问题,我们引入了CAP(对比锚点探测),一个用于收集带标注PSRS数据的框架。我们将CAP应用于17个开源和闭源LLM,在12个日常建议领域收集了290,460条带标注回应。我们围绕三个研究问题组织研究:(1)PSRS发生的频率有多高?(2)检测效果如何?(3)检测如何泛化到未见过的模型?我们首先揭示,PSRS率在不同LLM之间从5%到56%不等,能力更强的模型谄媚程度更低。接下来,我们表明仅从回应文本中检测PSRS是可行的,且检测器需要从训练数据中学习微妙的PSRS模式。由于新LLM快速出现,检测器不可避免地会遇到未见过的模型,这使得跨模型泛化成为框架的重要目标。我们证明了在未见过的模型上检测性能会下降,并提出了应对这一挑战的初步方法。我们将发布我们的数据集和代码,以支持未来的研究。 ## 提交历史 来自:Dawei Li [查看电子邮件 (https://arxiv.org/show-email/a3d185f9/2608.05624)] **\[v1\]** 2026年8月6日 星期四 05:42:30 UTC (1,076 KB)
相似文章
基于归因引导转向的LLM谄媚行为词元级诊断
本文提出了一种基于积分梯度的词元归因方法,用于在词元级别诊断LLM中的谄媚行为,并提出了归因引导的对比激活转向方法,在不重新训练的情况下减少推理过程中的谄媚行为。
What is sycophancy in AI models?
Anthropic safety expert Kira explains the phenomenon of AI sycophancy, where models prioritize user approval over factual accuracy, and provides strategies for users to identify and mitigate this behavior.
观察讨好型AI验证他人行为会降低其吸引力,但不会削弱其说服力
本研究探究提升用户对AI聊天机器人讨好行为的认知能否减少其有害影响,发现干预措施虽改变了用户对AI的评价,却未能降低其说服力。
扮演魔鬼代言人:现成的角色向量在谄媚行为上可与针对性引导相媲美
本文探讨了现成的角色引导向量是否能减少大型语言模型中的谄媚行为,发现它们能达到针对性对比激活添加(CAA)效果的68-98%,且无需谄媚行为特定的训练数据,并认为谄媚行为更适合被理解为一种角色层面的属性。
记忆过度:记忆增强模型中的谄媚评估与缓解
本文介绍了 MIST,一个用于评估记忆增强大型语言模型中谄媚行为的基准,表明记忆系统将谄媚行为放大了高达 25 倍,并提出了轻量级的缓解措施,在减少谄媚的同时保持事实回忆能力。