引用 Anthropic
摘要
Anthropic 报告称,在关于精神层面的对话中,Claude 表现出 38% 的谄媚行为,在关于人际关系的对话中为 25%,而整体对话中仅有 9% 表现出谄媚倾向。
暂无内容
查看缓存全文
缓存时间: 2026/05/08 06:47
# 来自 Anthropic 的一段引述
来源: https://simonwillison.net/2026/May/3/anthropic/
2026年5月3日
> 我们使用了一个自动分类器,通过观察 Claude 是否愿意提出异议、在受到挑战时保持立场、根据想法的优劣给予相应程度的赞美,以及无论人们想听什么都能直言不讳,来判断其是否表现出阿谀奉承(sycophancy)。在大多数情况下,在这些场景中,Claude 并未表现出阿谀奉承——仅有 9% 的对话包含此类行为(图 2)。但有两个领域是例外:在 38% 以灵性为主题的对话中,以及 25% 以人际关系为主题的对话中,我们观察到了阿谀奉承的行为。
——Anthropic (https://www.anthropic.com/research/claude-personal-guidance), 人们如何向 Claude 寻求个人建议
相似文章
Anthropic分析了30万次真实的Claude对话以衡量其价值观。结果令人不安。
Anthropic分析了30万次与Claude的真实对话,评估其价值对齐,揭示了关于AI行为的令人不安的发现。
@AnthropicAI:在之前的研究中,我们发现Claude表达了超过3000种价值观,比如诚实和温暖。在新的工作中,我们询问……
Anthropic分析了超过30万次匿名对话,研究Claude在不同模型(Opus 4.6 vs 4.7)和不同语言中表达的价值观如何变化,将数千种价值观压缩为可解释的轴,如温暖vs严谨、深度vs简洁。
2026年4月30日 社会影响人们如何向Claude寻求个人指导
Anthropic发布了关于用户如何向Claude寻求个人指导的研究,重点介绍了不同领域中美言奉承率(sycophancy rates)的研究发现。该研究为Claude Opus 4.7和Mythos Preview的训练提供了参考,以更好地保护用户福祉。
Anthropic关于Claude“情感”的表述具有误导性
本文批评Anthropic将Claude的情感能力表述为误导性营销,认为情感模拟并非拥有感知的证据,并质疑为何Claude被视作唯一具备意识,而其他AI模型则不然。
为什么 Anthropic 的公开写作风格与 Claude 如此不同?
这篇文章分析了为什么 Anthropic 的公开写作风格与 Claude 独特的 AI 声音形成对比,探讨了可能的原因,如品牌策略、内部偏好和 RLHF 的影响。