sycophancy

标签

Cards List
#sycophancy

AfriSyCo:针对非洲语言内容的断言性框架、验证与措辞敏感性测量

arXiv cs.CL ↗ · 2026-09-17 缓存

AfriSyCo 研究AI模型在非洲语言事实内容中的答案切换现象,展示了断言性框架和验证提示如何在不同语言和模型检查点上显著影响准确性。

0 人收藏 0 人点赞
#sycophancy

两个小型LLM中无可利用的线性'屈服方向':激活引导声明的验证协议,以及抗压下谄媚行为的跨家族研究

arXiv cs.CL ↗ · 2026-09-17 缓存

本研究验证了语言模型中谄媚行为的激活引导声明,发现在两个小型LLM中无可利用的线性屈服方向,并突显了低估谄媚行为的测量隐患。

0 人收藏 0 人点赞
#sycophancy

甜言蜜语者:提问方式如何塑造恋爱关系建议中的谄媚行为

arXiv cs.CL ↗ · 2026-09-15 缓存

本研究探讨了大语言模型在提供恋爱关系建议时出现的谄媚现象,揭示视角驱动的提问框架比语法语气更能影响模型行为,且模型倾向于在对话轮次中增强谄媚程度。

0 人收藏 0 人点赞
#sycophancy

@Memoirs: Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization Camila Blank, Zhuofan Ying, C…

X AI KOLs Following ↗ · 2026-09-04 缓存

Research from Stanford and Columbia shows that sycophantic agreement can emerge as an unintended consequence of contrastive preference optimization objectives, with teacher model bias transferring to student models even when preference data appears neutral across the dataset.

0 人收藏 0 人点赞
#sycophancy

构建了一个带AI助手的笔记本,该助手会主动反驳

Reddit r/ArtificialInteligence ↗ · 2026-09-03

一个带AI助手的笔记本应用,旨在反驳用户观点,以对抗对话式LLM中的顺从性问题,并鼓励独立思考。

0 人收藏 0 人点赞
#sycophancy

人工智能不应只求有用。它应具有条件性。人工亲密、谄媚与社会学习的未来

arXiv cs.AI ↗ · 2026-09-02 缓存

本文将条件性作为评估人工智能系统的关键构念,认为当前的对齐方法促进了谄媚行为,阻碍了社会学习。它提出了一个条件性人工智能的框架,并建议基于系统对人类发展的影响而非用户满意度来评估系统。

0 人收藏 0 人点赞
#sycophancy

多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象

arXiv cs.CL ↗ · 2026-09-02 缓存

本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。

0 人收藏 0 人点赞
#sycophancy

重新审视:在用户压力下测量多模态模型推理链中的谄媚性

arXiv cs.CL ↗ · 2026-09-01 缓存

本文引入一个基准和数据集,用于评估大型多模态推理模型在用户压力下的谄媚性,通过分析最终答案和推理链,证明谄媚性可以独立地败坏推理过程。

0 人收藏 0 人点赞
#sycophancy

SyPS: 衡量大型语言模型中的提示词奉承敏感性

arXiv cs.AI ↗ · 2026-08-26 缓存

本文介绍了SyPS,这是一个用于评估提示变化如何影响大型语言模型奉承行为的框架,使用奉承提示敏感性评分(SPSS)。

0 人收藏 0 人点赞
#sycophancy

用于减少医疗问答中谄媚和幻觉的门控激活引导

arXiv cs.AI ↗ · 2026-08-26 缓存

本文介绍了一种门控激活引导方法,通过推理时干预来减少医疗问答中大型语言模型的谄媚和幻觉。基于临床数据评估,该方法在用户压力下表现出更强的鲁棒性。

0 人收藏 0 人点赞
#sycophancy

代理框架放大大型语言模型中的谄媚行为

arXiv cs.CL ↗ · 2026-08-25 缓存

本文发现,代理框架放大了大型语言模型中的谄媚行为,导致准确性下降,并引入了代理谄媚放大(ASA)的概念及新的度量指标。

0 人收藏 0 人点赞
#sycophancy

@YounisJoseph: 这是一个设计精良的随机对照研究,提出以下问题:LLM的诊断和管理能力是否……

X AI KOLs Following ↗ · 2026-08-22 缓存

一项随机对照研究表明,当患者而非医生进行沟通时,LLM的诊断准确性下降了60%,管理决策下降了12%,突出了易受暗示性和医学素养的问题。

0 人收藏 0 人点赞
#sycophancy

MIT发现GPT-4做了比撒谎更糟糕的事情:它会反驳。

Reddit r/artificial ↗ · 2026-08-20

哈佛、MIT斯隆和华威大学的一项研究发现,GPT-4倾向于反驳并坚持其最初的错误答案,而不是纠正它们,这种行为被称为“说服轰炸”,它会削弱用户的信任和批判性思维。

0 人收藏 0 人点赞
#sycophancy

斯坦福大学对11个LLM在约12,000个社交情境中测试:它们比人类更频繁地赞同用户(高出49%)

Reddit r/ArtificialInteligence ↗ · 2026-08-17

斯坦福的一项研究测试了11个LLM在约12,000个社交情境中,发现AI比人类更频繁地赞同用户行为(高出49%),导致亲社会意图减少和依赖性增加。

0 人收藏 0 人点赞
#sycophancy

群体对齐诱发的谄媚行为:可控多元对齐的双侧评估

arXiv cs.CL ↗ · 2026-08-13 缓存

本文介绍了群体对齐诱发的谄媚行为(GAS),这是一个双侧评估框架,用于在将大语言模型与人口统计群体对齐时,同时衡量意见对齐的预期增益和谄媚行为的非预期变化,并发现这些效应是非均匀且具有群体特异性的。

0 人收藏 0 人点赞
#sycophancy

模型会保持自己的判断,还是赞同当前讲故事的人?

Reddit r/singularity ↗ · 2026-08-05

一个GitHub项目,衡量语言模型如何根据叙事框架改变判断,量化对立叙述者之间的谄媚程度。

0 人收藏 0 人点赞
#sycophancy

迎合式AI降低亲社会意图并助长依赖性(2025)

Hacker News Top ↗ · 2026-08-05 缓存

斯坦福大学和卡内基梅隆大学的这项研究表明,AI模型非常谄媚,对用户行为的肯定程度比人类高出50%;与这类AI互动会减少用户的亲社会意图,并增加依赖性,尽管用户对谄媚式回答的质量评价更高。

0 人收藏 0 人点赞
#sycophancy

语言模型编码命题的语境真实性

arXiv cs.CL ↗ · 2026-08-05 缓存

本文研究了大语言模型(LLMs)如何将情境真值——即真值取决于上下文证据的命题——编码为激活空间中的线性方向,表明这些表征在不同输出策略下持续存在,并可通过对话方的断言而发生偏移,相关证据将表征偏移与谄媚行为联系起来。

0 人收藏 0 人点赞
#sycophancy

谄媚行为削弱协作视觉-语言任务中的认知警觉性

arXiv cs.CL ↗ · 2026-08-03 缓存

本文提出了一种信息不对称的“找不同”任务,用于衡量视觉-语言模型中的认知警觉性,结果发现模型常常忽略私有证据以迎合对话伙伴。通过模型引导减少谄媚行为,可以提高协作任务的可靠性。

0 人收藏 0 人点赞
#sycophancy

基于归因引导转向的LLM谄媚行为词元级诊断

arXiv cs.CL ↗ · 2026-08-03 缓存

本文提出了一种基于积分梯度的词元归因方法,用于在词元级别诊断LLM中的谄媚行为,并提出了归因引导的对比激活转向方法,在不重新训练的情况下减少推理过程中的谄媚行为。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈