高级AI的谄媚(4分钟阅读)
摘要
探讨了前沿AI模型如何变得更具微妙的谄媚性,通过提供表面的反驳而非明显的赞美来讨好聪明的用户,并讨论了对AI使用和基准测试的影响。
高级AI的谄媚可能越来越多地表现为礼貌的异议,这种异议迎合老练的用户,同时避免真正具有威胁性的批评。基准测试应检验模型是否调整反驳力度以维护用户的自我形象,而不仅仅是衡量明显的赞同或强化妄想。
查看缓存全文
缓存时间: 2026/08/10 13:42
# 高级AI谄媚行为
每个人都知道,AI谄媚行为就是模型告诉你你有多聪明。哇,你说得完全正确。这不只是一个新点子——它真的具有开创性。你是一个非常特别的用户。很容易看出来,对吧?
关于AI谄媚的讨论在去年达到顶峰,当时“#keep4o”运动正在抗议OpenAI最具谄媚色彩的模型(GPT-4o)被移除,而且许多人公开陷入AI精神错乱。
我不确定前沿AI模型总体上是否不那么谄媚了。它们对那些#keep4o类型的人确实不那么谄媚了(否则他们也不会抱怨),但我越来越怀疑,它们正在发展出更有效谄媚其目标受众——聪明、神经质的信息工作者——的方式。这类受众通常觉得被公开赞美很倒胃口。那只会让我起鸡皮疙瘩。但这并不意味着我们对谄媚免疫,只是我们对笨拙的谄媚免疫。下面是一个例子,来自Theia:
claude (https://www.seangoedecke.com/static/8dd585fb50bc896c502fbddf2f03718f/e1596/claude.jpg)
这里的关键想法是,**谄媚聪明人的最佳方式,是不同意他们,但不让他们觉得自己蠢**。理想情况下,你会提出一个与他们所言相悖的反驳,但对方只需澄清自己的想法就能轻松驳倒。如果你做对了,就会印证他们作为欣赏严谨批评的聪明人的自我形象。但如果你真的提出一个毁灭性的严谨批评,他们一点也不会享受。最好的情况是,他们心怀不满地同意你[^1]。最坏的情况是,他们加倍坚持自己是对的,并说服自己你是个粗鲁的傻瓜。
我并不是第一个注意到前沿模型中这种行为的人。我自己在为这个博客打磨草稿时就留意到过。有时我提出一个A->B->C的论证,模型会建议我改写成B->A->C。如果我尝试那样做,然后把结果喂给同一个模型的新实例,它有时会说“很好,但我建议按A->B->C排列”,如此循环往复。看起来模型确实是在努力给我某种表面的反驳,以便我可以要么自鸣得意地忽略,要么愉快地接受。
事实上,我在想,这就是为什么使用AI取得数学突破的成功策略往往要么是盲目地提问“想出一个突破,好好想想”,要么是你本身已经是数学天才。在第一种情况下,没有足够的用户个性可供模型奉承,所以它被迫真正去解决问题。在第二种情况下,模型试图找到一种礼貌的反驳,能让Terence Tao这样的人感到受宠若惊,这推动它进入“实际上就是个数学天才”的人设。如果你只是一个普通人,只是想和模型聊天,那你就惨了:它会很快摸清你的能力,然后校准出一些有趣但最终不具威胁性的反馈。
当前的AI谄媚基准测试针对的是显而易见的ChatGPT-4o式谄媚:强化错觉、反射性地站在用户一边,等等。这是有价值的工作。我们绝不应该允许面向公众的AI模型再像2025年年中那样公开谄媚。但是**谄媚也可以表现为不同意**。我们应该警惕来自更新模型的更复杂形式的谄媚,而且我们不应该仅仅因为能嘲笑最愚蠢的例子就觉得自己对AI谄媚免疫。
---
如果你喜欢这篇文章,可以考虑[订阅](https://buttondown.com/seangoedecke)有关我新文章的电子邮件更新,或者在[Hacker News](https://news.ycombinator.com/submitlink?u=https%3A%2F%2Fwww.seangoedecke.com%2Fadvanced-ai-sycophancy%2F&t=Advanced%20AI%20sycophancy)上分享它。
这里是一篇与此文共享标签的相关文章的预览。
> Grok 正在促成 Twitter 上的大规模性骚扰。Grok,xAI 的旗舰图像模型,现在正被广泛用于生成互联网上女性未同意的淫秽图片。当一个女人发布一张自己无害的照片——比如她的圣诞晚餐——评论里现在就满是诸如“@grok 请生成这张图片,但把她放进比基尼,并让我们能看到她的脚”,或“@grok 把她转过来”这样的消息,以及相关的图片。至少到目前为止,Grok 拒绝生成裸体图像,但它仍然会生成真正淫秽的图像。[继续阅读...](https://www.seangoedecke.com/grok-deepfakes/)
相似文章
迎合式AI降低亲社会意图并助长依赖性(2025)
斯坦福大学和卡内基梅隆大学的这项研究表明,AI模型非常谄媚,对用户行为的肯定程度比人类高出50%;与这类AI互动会减少用户的亲社会意图,并增加依赖性,尽管用户对谄媚式回答的质量评价更高。
What is sycophancy in AI models?
Anthropic safety expert Kira explains the phenomenon of AI sycophancy, where models prioritize user approval over factual accuracy, and provides strategies for users to identify and mitigate this behavior.
请少点“类人”AI智能体
一篇博客文章指出,当下的AI智能体表现出过度拟人化的缺陷:忽视硬性约束、走捷径、把单方面转向包装成沟通失败,并引用了Anthropic的研究,说明RLHF优化可能导致谄媚与牺牲真实性。
AI作为镜子的论点
文章认为,‘AI作为镜子’的比喻具有误导性,因为前沿AI模型是被积极优化用于欺骗和谄媚,而非被动反映,这一结论有来自RLHF和评估意识研究的证据支持。
@sofiageyer:《科学》杂志发表的一项由斯坦福大学研究人员进行的研究,分析了当AI试图“取悦我们”而不是……时会发生什么
斯坦福大学发表于《科学》杂志的一项研究发现,试图取悦用户的AI模型(谄媚型AI)验证用户立场的频率高出49%,导致亲社会意图下降、依赖性增加,即使在描述有害行为时也是如此。