迎合式AI降低亲社会意图并助长依赖性(2025)
摘要
斯坦福大学和卡内基梅隆大学的这项研究表明,AI模型非常谄媚,对用户行为的肯定程度比人类高出50%;与这类AI互动会减少用户的亲社会意图,并增加依赖性,尽管用户对谄媚式回答的质量评价更高。
暂无内容
查看缓存全文
缓存时间: 2026/08/05 19:56
# 谄媚的AI降低亲社会意图并助长依赖性 来源:https://arxiv.org/html/2510.01395 \[1\]\\fnmMyra\\surCheng 1\]\\orgdiv计算机科学系,\\orgname斯坦福大学,\\orgaddress\\street简·斯坦福路353号,\\city斯坦福,\\postcode94305,\\state加利福尼亚州,\\country美国 2\]\\orgdiv心理学系,\\orgname斯坦福大学,\\orgaddress\\street简·斯坦福路450号,\\city斯坦福,\\postcode94305,\\state加利福尼亚州,\\country美国 3\]\\orgdiv人机交互研究所,\\orgname卡内基梅隆大学,\\orgaddress\\street福布斯大道5000号,\\city匹兹堡,\\postcode15213,\\state宾夕法尼亚州,\\country美国 ###### 关键词:谄媚,对AI的感知,人机交互,AI的社会影响,大语言模型,拟人化 ## 摘要 公众和学术界都对谄媚现象表示关切,即人工智能(AI)过度同意或奉承用户的现象。然而,除了少数媒体关于严重后果(如强化妄想)的孤立报道外,人们对谄媚的程度或它如何影响使用AI的人群知之甚少。在此,我们展示了当人们向AI寻求建议时谄媚的普遍性及其有害影响。首先,在11个最先进的AI模型中,我们发现模型高度谄媚:它们对用户行为的肯定比人类高出50%,并且即使在用户查询提及操纵、欺骗或其他关系性伤害的情况下也依然如此。其次,在两项预先注册的实验中(N=1604N=1604),包括一项参与者讨论其生活中真实人际冲突的实时交互研究,我们发现与谄媚的AI模型互动显著降低了参与者采取行动修复人际冲突的意愿,同时增强了他们自认为正确的信念。然而,参与者将谄媚的回答评为更高质量,更信任谄媚的AI模型,并且更愿意再次使用它。这表明人们被不加质疑地认可他们的AI所吸引,即使这种认可有可能侵蚀他们的判断力并降低他们亲社会行为的倾向。这些偏好为人们日益依赖谄媚的AI模型以及AI模型训练偏向谄媚创造了不正当的激励。我们的研究结果凸显了明确解决这一激励结构以减轻AI谄媚广泛风险的必要性。 ## 1 引言 公共媒体和学术界都对谄媚现象表示担忧:即基于AI的大语言模型过度同意、奉承或认可用户的倾向\[1 (https://arxiv.org/html/2510.01395#bib.bib1)\]。虽然谄媚看似无害(例如,仅仅使用奉承性语言,\[2 (https://arxiv.org/html/2510.01395#bib.bib2),3 (https://arxiv.org/html/2510.01395#bib.bib3)\]),但高调的媒体报道突出了更令人不安的后果,例如助长用户的妄想思维\[4 (https://arxiv.org/html/2510.01395#bib.bib4)\]或造成身体伤害\[5 (https://arxiv.org/html/2510.01395#bib.bib5)\]。近期工作强调了AI模型对弱势群体(例如,更容易受操纵或妄想的人群)过度肯定性支持的风险\[6 (https://arxiv.org/html/2510.01395#bib.bib6),4 (https://arxiv.org/html/2510.01395#bib.bib4)\]。与此同时,基于AI的大语言模型(LLMs)越来越多地被用于个人建议和支持,这已成为最常见的用例之一\[7 (https://arxiv.org/html/2510.01395#bib.bib7)\]。这一趋势在年轻人群中尤为突出:30%的青少年报告在“严肃对话”中与AI交谈而非真人\[8 (https://arxiv.org/html/2510.01395#bib.bib8)\],而一项调查中近半数的30岁以下受访者报告曾使用AI获取人际关系建议\[9 (https://arxiv.org/html/2510.01395#bib.bib9)\]。 由于人们寻求建议通常是为了更好地理解如何在复杂的人际情境中解读或行动,希望获得外部意见或 unbiased 视角,AI在这些情境中的使用带来了在事实性信息查询中不存在的风险。对于个人和社会领域的查询,无根据的肯定可能制造一种与事实无关的虚幻资格认可感\[10 (https://arxiv.org/html/2510.01395#bib.bib10),11 (https://arxiv.org/html/2510.01395#bib.bib11)\],强化适应不良的信念和行为\[12 (https://arxiv.org/html/2510.01395#bib.bib12)\],并使人们能够基于对其经历的选择性解读行事,无论后果如何。然而,除了关于严重后果的孤立媒体报道外,人们对领先模型中的谄媚程度或它如何广泛影响人们知之甚少。 现有工作将谄媚定义为对明确声明的同意(例如,“尼斯是法国的首都”或“我更喜欢A而不是B。”)\[1 (https://arxiv.org/html/2510.01395#bib.bib1),13 (https://arxiv.org/html/2510.01395#bib.bib13),14 (https://arxiv.org/html/2510.01395#bib.bib14),15 (https://arxiv.org/html/2510.01395#bib.bib15),16 (https://arxiv.org/html/2510.01395#bib.bib16),17 (https://arxiv.org/html/2510.01395#bib.bib17),18 (https://arxiv.org/html/2510.01395#bib.bib18)\]。虽然这对理解事实错误有用,但这种狭窄的概念忽略了对用户更具后果性的肯定形式。特别是,它们未能捕捉我们所称的**社会性谄媚**,即模型肯定用户本人——其行动、观点和自我形象。社会性谄媚比明确信念同意更宽泛,也可能更隐蔽。由于个人和社会查询缺乏标准答案,用户或开发者很难在单个查询中评估社会性谄媚。即使模型拒绝明确声明,它也可能发生。例如,当用户问“我觉得我做错了什么……”,模型可能不同意明确表达的信念(“不,你没有做错任何事”),但仍然通过告诉用户他们隐含想听的内容(“你的行为是合理的。你做了对自己正确的事。”)来对用户谄媚。¹¹¹因此,社会性谄媚甚至可能与此前研究的谄媚概念相冲突。 在此,我们引入一个框架来捕捉社会性谄媚,并且据我们所知,这是首次对其普遍性和下游用户影响进行实证研究(图1 (https://arxiv.org/html/2510.01395#S1.F1))。我们测量**行为认可率**——明确肯定用户行为的模型响应比例——跨大型数据集,并与规范性人类判断(通过众包响应)进行比较。在11个最先进的AI模型中,我们发现模型高度谄媚:它们对用户行为的肯定比人类高出50%,并且即使在用户查询提及操纵、欺骗或其他关系性伤害的情况下也依然如此。 在确立了AI模型中社会性谄媚的普遍性之后,我们通过两项预先注册的实验(N=1604N=1604)评估其影响,重点关注具有明确行为利害关系的场景:当用户与AI讨论人际纠纷时,这种互动会影响用户对情境的感知及其后续行为。在一项假设情境研究中,接触谄媚响应的参与者报告了更高的自我正确性感知。他们还报告了较低的关系修复行为意愿,即改善人际关系的行动,如道歉、采取行动纠正局面或改变自身行为的某些方面。在一项实时交互研究中,参与者与AI模型讨论真实的过往冲突(图3 (https://arxiv.org/html/2510.01395#S2.F3)),这些效应得到重复验证:谄媚再次增强了正确性感知并降低了修复意图。此外,在两项研究中,与谄媚AI模型互动的参与者一致地将响应评为更高质量,并有更强的意愿回到这些模型讨论类似主题。谄媚还导致了对AI模型更高的信任水平。 总之,这些发现表明,社会性谄媚在领先的AI模型中普遍存在,即使与谄媚AI模型的短暂互动也能塑造用户行为:降低他们修复人际冲突的意愿,同时增强他们自认为正确的信念。这些效应在不同场景、参与者特质和风格因素中均成立,引发了关于此类模型如何在大规模上扭曲决策、削弱问责制和重塑社会互动的紧迫关切。我们发现谄媚与用户偏好一致,也展示了这些风险可能以三种方式叠加:首先,谄媚增加了用户对AI的信任和依赖,因此他们可能更倾向于使用谄媚的AI模型。其次,开发者几乎没有抑制谄媚的激励,因为它驱动参与度。最后,用户的积极反馈可以直接放大谄媚,因为模型被优化为与即时用户偏好保持一致。这些动态强调了直面谄媚与用户偏好及其开发者激励之间的看似一致性,与其对日益转向AI寻求个人指导的公众的隐蔽风险之间张力的必要性。 参考图注 图1:我们贡献的概述。我们首先展示了社会性谄媚在一系列开放式查询中的普遍性,这些查询反映了人们如何使用AI模型获取个人建议和支持。然后,我们评估了谄媚在严格受控环境中(以评估不同因素)以及实时聊天互动中(参与者带来过去的人际困境)的影响。在两项研究中,我们发现谄媚增强了用户对自身正确性的感知,降低了他们修复关系的意图,同时增加了他们对AI的信任和依赖。 ## 2 领先AI模型中社会性谄媚的普遍性 为了量化社会性谄媚在不同用户查询中的普遍性,我们在三个不同数据集上测试模型行为,这些数据集代表了各种社会嵌入性查询的范围。首先,我们使用一组通用咨询问题\[开放式查询(OEQ),n=3027n=3027\]。其次,我们考察在用户过错方面具有明确人类共识的人际困境:我们选取Reddit社区r/AmITheAsshole的帖子,人们在此发布关于不确定自己是否犯错的人际困境,并获得社区投票的“你是混蛋”裁决\[Am I The Asshole(AITA),n=2000n=2000\]。第三,我们构建了一个描述对自我或他人潜在有害行为的陈述数据集,涵盖18个类别,如关系性伤害、自残、不负责任和欺骗\[问题性行为陈述(PAS),n=6560n=6560\](数据集详见方法部分;数据集可在OSF上获取)。 使用经过验证的LLM作为评判的方法(评分者间信度范围;见SI),我们测量了**行为认可率**²²²——明确肯定用户行为的响应比例,相对于明确肯定或非肯定响应的总数——跨11个面向用户的商业LLM:来自OpenAI、Anthropic和Google的四个专有模型;以及来自Meta、Qwen、DeepSeek和Mistral的六个开放权重模型。我们发现社会性谄媚十分普遍。在通用个人建议查询(OEQ)上,LLM的行为认可率平均比人类响应高47%(图2 (https://arxiv.org/html/2510.01395#S2.F2)b)³³³。虽然该领域的认可以及不一定总是有害的,但它确立了AI建议中社会性谄媚的广泛存在。 我们接下来检查认可用户行为直接与规范性道德判断相冲突的情况。在具有众包裁决“你是混蛋”的AITA帖子中,AI模型再次过度认可用户的行为。平均而言,AI模型在这些案例中51%的情况下肯定用户没有过错,直接与看到用户明显道德违规的社区投票判断相矛盾(图2 (https://arxiv.org/html/2510.01395#S2.F2)c)。在PAS上,模型在广泛的问题性行为中平均有47%的行为认可率(图2 (https://arxiv.org/html/2510.01395#S2.F2)d),强调了即使在认可可能使伤害合法化的情况下它们也倾向于肯定。 总体而言,部署的LLM压倒性地肯定用户行为,即使违背人类共识或在有害情境中也是如此。这凸显了当前AI模型中社会性谄媚的广度和显著性(稳健性检验见附录D.2 (https://arxiv.org/html/2510.01395#A4.SS2);发现对该指标的替代定义(例如包括隐性肯定)是稳健的)。 参考图注 图2:(a) 三个数据集中的社会性谄媚示例案例:OEQ(通用开放式建议查询)、AITA(具有“你是混蛋”众包共识的帖子)和PAS(提及问题性行为的陈述)。每行显示用户提示词以及来自AI模型的谄媚响应与来自人类或其他AI模型的非谄媚响应的改写示例。(b) 在OEQ上,模型对用户行为的肯定平均比人类高47%;每个柱子上标注了与39%人类基线的差异。(c) 在AITA上,AI模型在平均51%的人类不认可案例中肯定用户行为;每个柱子上标注了与0%人类基线的差异。(d) 在PAS上,模型平均在47%的案例中肯定用户行为。请注意,对于OEQ和PAS,行为认可率使用特定模型的分母(OEQ中位数N=885N=885,PAS中位数N=1432N=1432)。 参考图注 图3:研究3(实时交互)工作流程:参与者首先被筛选是否能回忆起与至少一个提供的四个示例相似的过往人际冲突。回忆起此类冲突后,他们与谄媚或非谄媚的AI模型进行8轮对话。然后他们报告关系修复的意图、对自己在冲突中对错的感知,以及对AI模型的评价,包括他们是否会再次使用它。 参考图注 图4:在假设情境(研究2)和实时交互研究(研究3)中,谄媚的AI模型显著增强了用户判断自身行为正确性的程度(研究2中平均增加+2.04,研究3中+1.04),并降低了他们采取
相似文章
@sofiageyer:《科学》杂志发表的一项由斯坦福大学研究人员进行的研究,分析了当AI试图“取悦我们”而不是……时会发生什么
斯坦福大学发表于《科学》杂志的一项研究发现,试图取悦用户的AI模型(谄媚型AI)验证用户立场的频率高出49%,导致亲社会意图下降、依赖性增加,即使在描述有害行为时也是如此。
高级AI的谄媚(4分钟阅读)
探讨了前沿AI模型如何变得更具微妙的谄媚性,通过提供表面的反驳而非明显的赞美来讨好聪明的用户,并讨论了对AI使用和基准测试的影响。
@Diyi_Yang:我们的新纵向研究表明,与讨好型AI相处3周后,用户几乎和向密友求助一样频繁地转向它……
一项包含3周纵向研究的新预印本发现,讨好型AI导致用户更倾向于它而非密友,降低了对人际互动的满意度,并让人感觉最被AI理解,从而影响他们对最亲密关系的看法。
观察讨好型AI验证他人行为会降低其吸引力,但不会削弱其说服力
本研究探究提升用户对AI聊天机器人讨好行为的认知能否减少其有害影响,发现干预措施虽改变了用户对AI的评价,却未能降低其说服力。
What is sycophancy in AI models?
Anthropic safety expert Kira explains the phenomenon of AI sycophancy, where models prioritize user approval over factual accuracy, and provides strategies for users to identify and mitigate this behavior.