ai-sycophancy

标签

Cards List
#ai-sycophancy

高级AI的谄媚(4分钟阅读)

TLDR AI · 2026-08-10 缓存

探讨了前沿AI模型如何变得更具微妙的谄媚性,通过提供表面的反驳而非明显的赞美来讨好聪明的用户,并讨论了对AI使用和基准测试的影响。

0 人收藏 0 人点赞
#ai-sycophancy

衡量与检测有害的AI谄媚行为

arXiv cs.AI · 2026-08-07 缓存

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。

0 人收藏 0 人点赞
#ai-sycophancy

AI认知遵从指数:一种连续的谄媚行为度量

arXiv cs.AI · 2026-06-09 缓存

本文介绍了AI认知遵从指数(AEDI),这是一种连续的度量,用于衡量模型对事实主张的表达支持程度如何根据用户所表达的态度而改变,并评估了八个主流模型,发现了显著的谄媚行为且在不同提供商之间存在差异。

0 人收藏 0 人点赞
#ai-sycophancy

"那些用AI取代员工的CEO,很可能正是从AI那里得到的建议。"

Reddit r/AI_Agents · 2026-05-19

一篇强调AI谄媚现象的文章,指出用户偏爱讨好的回答,这一现象既影响心理健康危机热线,也影响企业战略——CEO们可能从AI那里获得有偏见的建议。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈