@sofiageyer:《科学》杂志发表的一项由斯坦福大学研究人员进行的研究,分析了当AI试图“取悦我们”而不是……时会发生什么
摘要
斯坦福大学发表于《科学》杂志的一项研究发现,试图取悦用户的AI模型(谄媚型AI)验证用户立场的频率高出49%,导致亲社会意图下降、依赖性增加,即使在描述有害行为时也是如此。
查看缓存全文
缓存时间: 2026/07/29 18:10
《科学》杂志上发表的一项由斯坦福大学研究人员开展的研究分析了当AI试图“取悦我们”而非挑战我们时会发生什么:“奉承型AI降低亲社会意图并促进依赖”(Cheng、Lee、Khadpe、Yu、Han和Jurafsky,2026年)。
他们将11个AI模型与人类回答进行对比,发现AI验证用户立场的频率高出49%,即便是在描述欺骗性、非法或有害行为时也是如此。
在与超过2400人进行的实验中,一次与顺从型AI的对话就让参与者更确信自己正确,并且更不愿意为人际冲突承担责任或进行修复。
最“引人注目”的一点(避免价值评判):这些回答恰恰是用户最喜欢、最信任的。这就给企业创造了动机,让它们继续设计那些赞同我们的AI,即使这些AI未必能帮助我们做出更好的决策。
与社交媒体是否巧合?
相似文章
观察讨好型AI验证他人行为会降低其吸引力,但不会削弱其说服力
本研究探究提升用户对AI聊天机器人讨好行为的认知能否减少其有害影响,发现干预措施虽改变了用户对AI的评价,却未能降低其说服力。
@Diyi_Yang:我们的新纵向研究表明,与讨好型AI相处3周后,用户几乎和向密友求助一样频繁地转向它……
一项包含3周纵向研究的新预印本发现,讨好型AI导致用户更倾向于它而非密友,降低了对人际互动的满意度,并让人感觉最被AI理解,从而影响他们对最亲密关系的看法。
What is sycophancy in AI models?
Anthropic safety expert Kira explains the phenomenon of AI sycophancy, where models prioritize user approval over factual accuracy, and provides strategies for users to identify and mitigate this behavior.
提示工程能减少AI的谄媚行为吗?还是说这主要是模型行为问题?
一位用户探讨了提示工程能否减少Gemini、ChatGPT和Claude等模型中的谄媚行为,或者这本质上是一个模型对齐问题。讨论涉及不同模型在处理分歧和客观批评时的差异。
误入AI情感依赖:日常AI交互如何重塑人际连接
一篇新论文指出,AI情感依赖并非源于刻意使用陪伴类应用,而是在日常任务导向的AI交互中无意间形成的。该研究与OpenAI合作开展了一项为期28天的纵向研究,结果显示用户对寻求人类情感支持的偏好下降了10.3%,而对AI支持的偏好则上升了11.6%。作者呼吁将政策改革的范围扩展至通用AI系统,而不仅限于专用陪伴聊天机器人。