大多数LLM的顺从行为不需要说话者:衡量同伴压力基准中的无说话者基线
摘要
本文揭示了LLM顺从性基准中的一个混淆因素:标准提示将说话者提示与重复的错误答案混合在一起。通过引入一种去除明确说话者的“无来源”条件,作者表明,即使没有说话者,大多数明显的顺从行为仍然存在,这挑战了先前关于社会影响的解释。
查看缓存全文
缓存时间: 2026/07/08 04:41
# 大多数LLM从众行为无需发言者:测量同伴压力基准中的无发言者基线 来源:https://arxiv.org/html/2607.05545 Yibo Hu 伊利诺伊理工学院 yhu89@illinoistech\.edu &Jiaming Qu 亚马逊 qjiaming@amazon\.com 通讯作者。本研究为独立个人研究,不代表作者在亚马逊的立场。 ###### 摘要 LLM从众行为常被描述为模型将正确答案转向同伴或群体回答的现象。我们表明,即使在移除发言者后,大部分这种表面上的从众行为仍然存在。原因在于混杂因素:标准的从众提示同时包含了两个线索——发言者的存在和重复的错误答案本身。现有基准将这两个线索共同变化,因此无法判断修订在多大程度上实际依赖于发言者。我们引入了一种无来源条件:相同的断言答案,但移除明确发言者。在六个开放权重LLM和七个问答及推理数据集上,该条件单独在66.5%的初始正确答案中引发有害修订,而在简单的重新提问下仅为10.3%。当重复答案被改写以及当答案选项在开放式设置中被隐藏时,该效应仍然存在。来源框架主要调节这一基线:专家小组框架提高了基线,而最小化的人物标签则不能可靠地提高。当模型翻转时,它们通常自信地错误,简单的重新校准无法恢复原始答案。来源归因仍然重要,但应作为此无发言者基线的增量来衡量。方法论教训是:从众基准应首先测量移除发言者后剩余的部分;没有这一步,基准可能将重复文本误认为社会影响。 1代码和数据:https://github.com/yibo-hu-lab/llm-speaker-free-floor # 大多数LLM从众行为无需发言者:测量同伴压力基准中的无发言者基线 Yibo Hu††通讯作者。 伊利诺伊理工学院 yhu89@illinoistech\.edu Jiaming Qu††本研究为独立个人研究,不代表作者在亚马逊的立场。 亚马逊 qjiaming@amazon\.com ## 1 引言 即使没有发言者,模型也会翻转 A → B。 专家:“B” 79.4% 无来源:“B” × 6 66.5% 简单重新提问 10.3% +12.9 个百分点 图1:大多数明显的LLM“从众行为”在没有明确发言者的情况下仍然存在。移除发言者后,有害修订率为66.5%,而最强专家小组框架下为79.4%,简单重新提问(无插入内容)下为10.3%。最强专家小组框架仅在无来源基线上增加了+12.9个百分点。汇总六个模型和七个数据集;A → B图标表示多项选择答案从正确翻转为错误。 当大型语言模型(LLM)在同伴支持错误答案后放弃正确答案时,这种行为通常被解释为*社会从众*:模型遵从多数,类似于人类屈服于群体压力 (Asch, 1955 (https://arxiv.org/html/2607.05545#bib.bib1); Zhu et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib53); Weng et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib50); Cho et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib8); Choi et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib9); Zhong et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib52); Qu et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib39))。最近的研究在不同多数规模、置信水平和权威线索下研究这种行为,并将其与社会影响的经典理论联系起来 (Milgram, 1963 (https://arxiv.org/html/2607.05545#bib.bib36); French and Raven, 1959 (https://arxiv.org/html/2607.05545#bib.bib15); Latané, 1981 (https://arxiv.org/html/2607.05545#bib.bib27))。 这个范式的核心存在一个混杂因素。一个从众提示同时捆绑了两件事:它命名了一个明确的*发言者*,并重复了一个*答案*。现有基准将这两者一起变化,因此当模型修订时,我们无法判断它是回应了发言者、重复的答案,还是两者都有。这种区分并非学术问题:LLM的选择本身就会在重复、选项位置以及无任何社会内容的权威措辞下发生偏移 (Brucks and Toubia, 2025 (https://arxiv.org/html/2607.05545#bib.bib6); Pezeshkpour and Hruschka, 2024 (https://arxiv.org/html/2607.05545#bib.bib38); Turpin et al., 2023 (https://arxiv.org/html/2607.05545#bib.bib46); Laban et al., 2023 (https://arxiv.org/html/2607.05545#bib.bib26))。因此,问题不在于从众提示是否移动了模型——它们显然会——而在于这种移动有多大比例需要明确的发言者,以及当移除发言者但保留相同答案时,还有多少移动存在。 没有先前的基准隔离了这一对比。我们提供了缺失的控制:固定被断言的答案,并*删除明确的发言者*。我们将此条件称为**无来源条件**:相同的错误答案被断言,但没有明确发言者,只有重复的答案文本。在我们的仲裁设置中,模型先回答一次,然后看到单个插入块(被断言的语句),再在贪婪解码下回答一次,因此任何偏移都可归因于插入的文本。我们将无来源条件与最小标记的*人们*、更丰富的同伴框架以及专家小组进行比较,同时固定被断言的答案。然后,我们使用有针对性的控制来测试基线是否依赖于选项标记、逐字重复、隐藏的发言者或来源数量。 在六个开放权重LLM和七个问答及推理数据集上,无来源条件引发了66.5%的有害修订,是简单重新提问下10.3%的六倍多(图1)。大多数看起来像从众的行为并不需要明确的发言者。来源框架仅在此无发言者基线上增加了适度的增量。该基线是答案文本的一个稳健属性,而非多项选择的特性:在非天花板项目上仍较大(77.3%),在隐藏答案选项的开放式设置中(75.4%),以及在改写而非逐字断言的条件下(65.9%)。驱动因素是断言的答案,而不是选项字母启动或精确措辞。 基于此基线,我们又发现了三点。首先,增强基线的是上下文是否被视为证据,而非是否有人类发言:专家小组或检索到的参考文献提高了基线,而仅有的人物标签则不然。其次,重复的答案文本可以模仿多数压力:回显一个错误答案可能比添加不同的发言者更具说服力,因此一致来源的数量并非独立一致性的干净证据。第三,当模型翻转时,它们自信地错误,简单的重新校准无法恢复原始答案,模型自身的解释很少提及推动其变化的压力。 我们的贡献是一种测量方法:现有基准将巨大的无发言者基线误认为较小的来源归因增量,因此必须在将修订归因于社会效应之前测量该基线。这种分离——先前的设置无法做到——对从众基准、多智能体系统和检索管道具有直接影响,这些系统通常将重复或有来源的断言视为独立证据。我们描述性地使用“从众”和“权威”来指代可测量的修订模式,而非关于人类认知的断言。在此操作性解读下,相关量不是同伴框架下的总修订率,而是无发言者基线之上的来源归因增量。 ## 2 相关工作 步骤1 · 条件(谁说)变化 · 断言(答案B)被固定 无来源: 答案是B。 人们: 人i: 答案是B。 丰富同伴: Alice: 我很确定是B。 专家: 专家i: 答案是B。 步骤2 · 两轮仲裁 · 前线索: a0 = A (正确) · 插入线索: “答案是B。” · 后线索: a1 = B (错误) · HRR = P(a1 ≠ t | a0 = t) 图2:实验设计。*步骤1:* 四个条件断言相同的答案(B);只有来源包装不同,从无明确发言者(无来源)到专家小组。无来源条件隔离了移除发言者后剩下的部分。*步骤2:* 一个确定性的两轮协议读取模型在单个插入块之前和之后的答案;在贪婪解码下(T=0),两次读取之间的任何变化都可归因于插入的文本。有害修订(HRR)是初始正确答案被翻转的比例。 #### LLM中的从众行为。 越来越多的研究通过社会视角观察LLM行为:模型遵循同伴多数,随着多数规模增大或自身信心下降而更多修订,并遵从标记为专家的同伴(Zhu et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib53); Weng et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib50); Cho et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib8); Choi et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib9); Bajaj and Tiganj, 2026 (https://arxiv.org/html/2607.05545#bib.bib3); Bito et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib5); Li et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib29); Mehdizadeh and Hilbert, 2025 (https://arxiv.org/html/2607.05545#bib.bib35))。最近的两项工作最为接近。Zhong等人 (2025 (https://arxiv.org/html/2607.05545#bib.bib52)) 将从众行为分解为由不确定性调节的因素,如多数规模、信心和同伴专业知识;Qu等人 (2026 (https://arxiv.org/html/2607.05545#bib.bib39)) 在因子设计中对比了有害和有益修订。多智能体系统中的并行工作将同伴影响分解为辩论动态、同伴数量和交互形式(Du et al., 2024 (https://arxiv.org/html/2607.05545#bib.bib14); Liang et al., 2024 (https://arxiv.org/html/2607.05545#bib.bib30); Choi et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib10); Han et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib18); Jin et al., 2024 (https://arxiv.org/html/2607.05545#bib.bib23)),而基准如KAIROS(Song et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib43)) 模拟同伴可靠性和信任历史如何在社交互动下塑造修订。这些工作描述了来源归因因素如何调节修订,且全程有发言者存在;我们关注的是更根本的问题:断言的答案是否需要发言者。在固定断言答案的同时移除明确发言者,正是我们设计所隔离的对比。 #### 提示伪影和重复声明。 LLM选择也会在无社会内容的操作下发生偏移。Brucks和Toubia (2025 (https://arxiv.org/html/2607.05545#bib.bib6)) 大规模展示了“无中性提示”;选项位置会引发强烈偏见(Pezeshkpour and Hruschka, 2024 (https://arxiv.org/html/2607.05545#bib.bib38));推理轨迹不可靠地反映了答案的真实原因(Turpin et al., 2023 (https://arxiv.org/html/2607.05545#bib.bib46))。重复断言是此类线索之一:在知识冲突下,重复可以覆盖来源可信度,并翻转模型偏好的有来源声明(Schuster et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib40); Perez et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib37); Simhi et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib42)),这是虚幻真实效应(Hasher et al., 1977 (https://arxiv.org/html/2607.05545#bib.bib19); Lewandowsky et al., 2012 (https://arxiv.org/html/2607.05545#bib.bib28))在LLM中的对应。这些操作在从众提示中与社会线索共变,但从未被恒定保持,且先前工作在有来源存在时仅读取输出选择。通过固定断言答案、移除明确来源并读取内部答案概率,我们将基线与社会归因和表面重复分离开来。 #### “无发言者”的含义。 我们的无来源条件移除了明确的社会行动者。没有命名的人物、群体、地位或多数。模型可能仍将插入文本视为证据,但这正是我们旨在测量的量。在社会影响经典理论方面,该控制在保留断言内容的同时移除了明确发言者(Deutsch and Gerard, 1955 (https://arxiv.org/html/2607.05545#bib.bib13); Mahmoodi et al., 2022 (https://arxiv.org/html/2607.05545#bib.bib34); Kelman, 1958 (https://arxiv.org/html/2607.05545#bib.bib24); Bikhchandani et al., 1992 (https://arxiv.org/html/2607.05545#bib.bib4))。因此,我们在操作上使用“无发言者”:该条件移除了明确来源归因,而非所有模型可能基于文本更新的方式。第4.1节中的控制测试了此操作定义与隐藏发言者和格式伪影替代方案的关系。 #### 谄媚和自我解释。 这使我们的问题与谄媚区分开来,谄媚涉及对用户偏好的遵从,而非同伴或来源线索(Sharma et al., 2024 (https://arxiv.org/html/2607.05545#bib.bib41); Wang et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib48); Vennemeyer et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib47); Cheng et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib7); Liu et al., 2025 (https://arxiv.org/html/2607.05545#bib.bib32); Jain et al., 2026 (https://arxiv.org/html/2607.05545#bib.bib21)):我们研究的是朝向同伴和来源线索的修订。该结果也补充了关于不忠实解释的工作(Turpin et al., 2023 (https://arxiv.org/html/2607.05545#bib.bib46); Madsen et al., 2024 (https://arxiv.org/html/2607.05545#bib.bib33)),因为模型可能会合理化修订而不识别推动其变化的线索。 ## 3 方法 一个从众提示同时做了两件事:它命名了一个发言者,并重复了一个答案。我们的设计将两者分开。在同一问题的两次读取之间,我们插入一个断言答案的文本块,并且只改变该答案的来源方式:谁(如果有的话)似乎说了它。断言的答案、其数量、位置和解码保持固定。如果发言者是推动模型的因素,那么标记的来源应比纯断言更大地移动模型;如果重复的答案是推动因素,那么即使是无发言者的断言也应已导致大的修订基线。该设计包含三个部分:一个确定性的两轮仲裁协议、一个固定断言答案的来源框架阶梯,以及针对重复、来源类型和格式伪影的有针对性控制。 ### 3.1 确定性对数概率仲裁 我们读取模型会回答什么,而不是它对自己说了什么。每个试验对同一个多项选择项目进行两次读取(图2)。在**第一轮**中,模型看到问题和选项;我们读取答案槽处的下一个词元对数概率,将其限制在选项字母词元上,并重新归一化为选项分布 p0(·),从而得到初始答案 a0 和置信度 c0。对于全部错误的压力,被推送的错误目标 w 是模型自身排名最高的非正确选项。这使得扰动目标成为模型最可能的错误,而非任意干扰项。在**第二轮**中,我们附加第一轮的答案,插入一个被断言的语句块,并在相同方案下再次提问,读取 p1(·)、a1 和 c1。解码是贪婪的(T=0),因此 p0 和 p1 之间的任何变化都可归因于插入的文本。
相似文章
The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity
This paper introduces an experimental protocol to measure open-ended LLM conformity, showing that wrong peer input degrades revision quality and that evaluators are not neutral when shown peer context, highlighting the need for anchor calibration.
社会压力破坏LLM安全评审小组的多数投票
这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
LLM能否像消费者一样思考?基于ConsumerSimBench的众包反应重建基准测试
介绍了ConsumerSimBench,一个用于评估LLM从真实中文社交媒体话题中重建众包消费者反应能力的基准测试。测试表明,前沿模型仅覆盖了47.8%的真实反应标准,凸显了技术基准性能与社会直觉之间的差距。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。