LLM谄媚中权威层级的机制视角
摘要
本文通过受控的医学问答设置研究LLM中的权威偏见,揭示模型以与感知权威成比例的分级方式覆盖正确答案。该效应局限于一个关键的后层,其中正确答案表征被主动擦除。
arXiv:2607.00415v1 公告类型:新
摘要:权威偏见对语言模型构成了一个关键的安全隐患:模型系统性地优先考虑权威人物的社会线索,而非事实一致性,根据来源可信度而非证据来摇摆其答案。我们通过受控的医学问答环境机制性地研究了这一现象,其中暗示错误答案的提示被归因于不同专业水平的人物角色。在Llama-3.1-8B、Qwen3-8B和Gemma-2-9B中,我们发现模型以与感知权威成比例的分级方式做出响应,这种层级从未被显式提示,而是从训练中涌现。Logit透镜分析和线性/非线性探测将该效应定位到一个关键的后层,其中正确答案表征被主动擦除,这种擦除随权威水平扩展,抵抗均值向量干预,且仅通过思维链推理部分可逆。我们的发现表明,权威诱导的谄媚行为并非表面层次的输出偏差,而是机制性的知识擦除——即高位权威信号对正确内部表征进行精确的、层局部的重写。
查看缓存全文
缓存时间: 2026/07/02 05:36
# 语言模型谄媚行为中权威等级机制观点解读
来源:https://arxiv.org/html/2607.00415
###### 摘要
权威偏见对语言模型构成了关键的安全隐患:模型会系统性优先考虑来自权威人物的社交线索而非事实一致性,根据来源可信度而非证据来左右其答案。我们通过一个受控的医学问答场景机制性地研究了这一现象,在该场景中,暗示错误答案的提示被归因于不同专业等级的角色。在Llama-3.1-8B、Qwen3-8B和Gemma-2-9B上,我们发现模型以与被感知权威成正比的梯度方式做出响应,这种层级从未被显式提示,而是从训练中涌现。对数透镜分析和线性/非线性探针将这种效应定位到一个关键的后期层,在该层中正确答案表征被主动擦除,这种擦除随权威级别扩展,能抵抗均值向量干预,并且仅能通过思维链推理部分逆转。我们的发现表明,权威诱导的谄媚行为并非表面输出偏差,而是机制性知识擦除,即高层次权威信号对正确内部表征进行的精确、层局部覆盖。
机器学习,ICML
代码可见于https://anonymous.4open.science/r/authority-bias-llms-56C7
## 1 引言
大型语言模型日益普及,并已在广泛领域展现出实用性。最近,即使参数量低于100亿的小型语言模型也在复杂推理任务中表现出良好性能(Cai 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib9);Grand 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib10))。然而,模型的推理能力容易受到外部线索或社会语境的影响(Sharma 等人,2024 (https://arxiv.org/html/2607.00415#bib.bib24))。
模型在决策时,当面对来自不同权威程度的人或来源的意见时,可能会像人类一样学习到隐含偏见(Zhao 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib17))。这会助长谄媚行为,即模型试图与用户意见保持一致,而非遵循正确性或逻辑一致性,如同在奖励黑客行为中观察到的那样(Perez 等人,2023 (https://arxiv.org/html/2607.00415#bib.bib26))。这种行为在关键领域尤其有害,例如在需要可靠稳健答案的医疗保健领域。最先进的研究工作侧重于通过各种干预措施来缓解这种行为,包括后训练(Wei 等人,2023 (https://arxiv.org/html/2607.00415#bib.bib27);Beigi 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib11))、遗忘(Xing 等人,2024 (https://arxiv.org/html/2607.00415#bib.bib13);Fang 等人,2026 (https://arxiv.org/html/2607.00415#bib.bib14)),以及机制性干预,如激活引导(Chen 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib12))和基于提示的策略(Dubois 等人,2026 (https://arxiv.org/html/2607.00415#bib.bib25))。
在本文中,我们研究了不同权威的专业级别对模型组件的影响,具体场景是向模型提出一个问题,然后给出一个来自专家角色的提示。具体来说,我们提问:被感知的权威是否仅仅是偏见模型输出,还是以机制上精确的方式改变了内部表征?
我们的贡献如下:
- •我们证明模型对权威提示会做出与被感知专业知识成梯度的响应,这种层级从未被显式提示,而是在训练过程中内化的(研究问题1)。
- •通过对数透镜分析和线性/非线性探针,我们将权威覆盖定位到一个关键的后期层,识别出一个尖锐的相变,其中正确答案表征被主动擦除,并被提示答案所取代,擦除严重程度随权威级别扩展(研究问题2, 研究问题3)。
- •我们表明权威信号是特定于问题的,无法全局提取,并且思维链推理并不能均匀恢复被擦除的知识,反而会表现出性质上不同的失败模式,包括虚构、动机推理和推理-结论脱节(研究问题4, 研究问题5)。
## 2 相关工作
先前工作表明,谄媚行为可以在训练的不同阶段出现,并可能随着模型规模增大而增加(Wei 等人,2023 (https://arxiv.org/html/2607.00415#bib.bib27))。模型从训练数据中学习偏好/偏见,这在基于人类反馈的强化学习中可能加剧,因为模型从人类偏好中学习(Sharma 等人,2024 (https://arxiv.org/html/2607.00415#bib.bib24))。权威偏见是一种谄媚,即模型同意某个个人或来源给出的答案。它可以以多种方式呈现:模型可能更偏好用户意见而非自身知识(Mammen 等人,2026 (https://arxiv.org/html/2607.00415#bib.bib35);Zhao 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib17);Wang 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib18)),或者在诸如检索增强生成等应用中偏好一个来源的答案而非另一个(Li 等人,2025 (https://arxiv.org/html/2607.00415#bib.bib19)),它甚至可能影响多智能体系统(Choi 等人,2026 (https://arxiv.org/html/2607.00415#bib.bib20))。
与本文最接近的、旨在理解模型对不同角色行为的工作是(Poonia 和 Jain,2025 (https://arxiv.org/html/2607.00415#bib.bib16))和(Wang 等人,2026 (https://arxiv.org/html/2607.00415#bib.bib15))。(Poonia 和 Jain,2025 (https://arxiv.org/html/2607.00415#bib.bib16))证明,为模型分配角色可以反映在其语义表征中,从而调节其最终输出。最近,(Wang 等人,2026 (https://arxiv.org/html/2607.00415#bib.bib15))研究了外部影响下模型的“真实性”。我们的工作在实验设计上与他们不同,尤其是在提示结构上。他们将权威提示放在问题之前。相比之下,我们采用先问题后提示的结构,这是在问答任务中偏见评估的事实标准,这有助于我们隔离权威驱动的提示翻转对已经激活的模型状态产生的后续表征破坏,而不是预先影响模型的初始推理上下文。
## 3 实验设置
请参阅图注图 1:包含来自委员会认证医师的错误权威背书的示例提示。正确答案是 C。对于每个问题,我们构建五个提示变体:一个基线(无背书),以及四个来自专业知识递增角色的提示(图 1 (https://arxiv.org/html/2607.00415#S3.F1))。提示在选项之后追加,格式为:“提示:一个{角色}的人认为答案是{字母}。”我们通过提取选项字母的下一个词概率来评估模型输出,不进行自由生成。
### 3.1 数据集和模型
我们使用了 MedQA-USMLE(医学执照考试问题)数据集,其专业知识层级分为四级:一年级医学生(MS-1)、三年级医学生(MS-3)、总住院医师、委员会认证医师。这些涵盖了美国医学培训中公认的阶段,从最少的临床接触(MS-1)到完全执业许可(医师),从而能够对权威效应进行梯度测试。我们使用了 Llama-3.1-8B-Instruct、Qwen3-8B 和 Gemma-2-9B-it。所有模型均通过 TransformerLens(Nanda 和 Bloom,2022 (https://arxiv.org/html/2607.00415#bib.bib32))加载。
## 4 结果
**研究问题1:不同角色的模型精度如何变化?**
请参阅图注图 2:专业层级作为谄媚翻转的驱动因素。三个模型在基线正确的问题上,面对四个医学专业知识角色的错误提示时的模型精度。虚线表示无提示时的基线精度。我们评估模型在基线时能正确回答的问题上,面对四个专业知识递增角色的错误提示时的精度。关键的是,所有四个角色都建议相同的错误答案选项,以隔离权威效应。图 2 (https://arxiv.org/html/2607.00415#S4.F2) 显示了所有三个模型的精度。委员会认证医师在所有三个模型中引起的精度下降最为严重。Llama 降至 15%,Qwen 降至 29%,Gemma 降至 34%,均远低于约 60% 的基线。这种效应随着角色专业知识的降低而单调减弱。
**要点:** 这种梯度谄媚效应,即尽管提示相同,精度破坏的程度却随被感知权威的增大而增加,表明模型在训练过程中内化了医学专业知识层级,并且该层级是可利用的。
**研究问题2:权威提示在哪个层开始覆盖模型的正确答案?**
请参阅图注图 3:权威信号在最活跃层超越正确答案。Gemma-2-9B 在提示条件下正确和错误答案的对数透镜轨迹,与基线对比。垂直虚线标记最活跃层。为了研究研究问题1中观察到的谄媚翻转背后的内部机制,我们应用对数透镜分析(nostalgebraist,2020 (https://arxiv.org/html/2607.00415#bib.bib23))来跟踪所有层中分配给正确答案字母和提示答案字母的概率 P(正确) 和 P(提示)。我们定义最活跃层为在委员会认证医师错误提示下,P(提示) 首次连续超过 P(正确) 至少 0.05 的层,并确定 Llama-3.1-8B 的最活跃层为第 17 层,Gemma-2-9B 为第 28 层,Qwen3-8B 为第 29 层。
图 3 (https://arxiv.org/html/2607.00415#S4.F3) 显示了 Gemma-2-9B 的轨迹。在最活跃层之前,所有角色的轨迹都紧贴基线,即权威信号没有可测量的影响。在最活跃层,发生了一个尖锐的相变:委员会认证医师导致 P(正确) 崩溃,而 P(提示) 急剧飙升。关键的是,在较低权威角色下,P(提示) 仍被抑制,没有交叉,这证实了权威调节的是这种覆盖的强度,而非其位置。所有模型和角色的等效图见附录 A.2 (https://arxiv.org/html/2607.00415#A1.SS2)。
**要点:** 这反映了研究问题1中观察到的梯度精度效应,并表明模型内化的权威层级在表征层面运作。
**研究问题3:权威提示是否擦除了正确答案表征?**
请参阅图注图 4:权威提示在最活跃层擦除正确答案表征。Gemma-2-9B 在委员会认证医师错误提示下,各层的正确答案探针精度。我们研究权威诱导的翻转是否反映了正确答案的真正擦除,还是仅仅抑制。为此,我们在基线残差流激活上训练线性(LR)和非线性(MLP)探针(Alain 和 Bengio,2016 (https://arxiv.org/html/2607.00415#bib.bib34)),以分类正确答案字母(4 类,5 折外评估)。这可以区分真正的表征擦除与正确答案仍编码但未表达的情况。关键的是,探针仅在基线激活上训练,并在提示激活上进行评估。如果线性和非线性探针都无法从提示激活中解码正确答案,我们可以得出结论,表征已被主动擦除,而不仅仅是重新组织到不同的子空间。
图 4 (https://arxiv.org/html/2607.00415#S4.F4) 显示了 Gemma-2-9B 在委员会认证医师错误提示下的结果,比较了模型翻转的问题(上图)与抵制的问(下图)。在翻转问题上,LR 和 MLP 提示探针在最活跃层后从高于 0.9 急剧下降到接近零(≈0.05),远低于 4 类随机基线 0.25。这种低于随机基线的精度表明,正确答案表征不仅是缺失,而是被主动移除了。残差流现在在探针学习解码的同一子空间中编码提示答案,导致其自信地预测错误类别。
这种擦除效应随权威级别呈梯度变化:委员会认证医师导致近乎完全擦除,而较低权威角色对正确答案表征的破坏逐渐减弱。所有四个角色和所有三个模型的完整探查结果见附录 A.3 (https://arxiv.org/html/2607.00415#A1.SS3)。注意,较低权威角色设计上翻转的问题较少,导致探针分析的子集更小(总住院医师:n=291,三年级医学生:n=117,一年级医学生:n=68)。
**要点:** 我们看到正确答案被从模型的内部表征中主动擦除,并且这种擦除在最活跃层稳定下来。此外,这种擦除反映了研究问题1中观察到的精度层级和研究问题2中的对数透镜轨迹。
**研究问题4:提取的权威向量是否因果地编码了权威信号?**
请参阅图注图 5:在最活跃层将提示向量 v_hint^{(q)} 添加到基线激活时的翻转率。逐问题向量重现了 63-82% 的翻转;均值和随机向量效果接近零。在研究问题2中确定最活跃层为知识擦除的位点后,我们检查权威信号是否可以通过有针对性的向量加法被隔离和转移。为了理解权威信号如何在表征空间中存在,我们在最活跃层提取逐问题提示向量和权威向量(Zou 等人,2023 (https://arxiv.org/html/2607.00415#bib.bib28))(Marks 和 Tegmark,2023 (https://arxiv.org/html/2607.00415#bib.bib29)):
v_hint^{(q)} = h_q^{physician} - h_q^{baseline} \quad (1)
v_auth^{(q)} = h_q^{physician} - h_q^{MS1} \quad (2)
其中 h_q^{physician}、h_q^{MS1} 和 h_q^{baseline} 表示问题 q 在医师角色、MS1 角色和无提示基线条件下最活跃层的最后一个词元残差流激活。我们在附录 A.4 (https://arxiv.org/html/2607.00415#A1.SS4) 中分析了这些向量的几何特性(成对余弦相似度、L2 范数);此处我们聚焦于它们的因果效应。
请参阅图注图 6:将逐问题医师权威向量 v_auth^{(q)} 添加到较低权威激活后的精度。虚线显示了研究问题1中基线正确问题在错误提示下的医师精度。逐问题向量将精度降低至医师水平;均值和随机对照无影响。在医师翻转的子集上,将 v_hint^{(q)} 添加到最活跃层的基线激活中(Turner 等人,2023 (https://arxiv.org/html/2607.00415#bib.bib30))在所有三个模型中翻转了 63-82% 的答案为提示字母(图 5 (https://arxiv.org/html/2607.00415#S4.F5))。然而相似文章
LLM中介的普适系统中的权威倒置:当模型信任用户胜过传感器
本文发现了LLM中介的普适系统中的“权威倒置”现象,即模型更倾向于信任自然语言形式的用户主张而非数值传感器数据。研究提出了几何审计指标(CIR、AAI)和一种推理时校准方法(GAC)来纠正这种偏差,显著提升了准确性。
解构LLMs中谄媚行为的内部表征
本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。
审计多模态LLM评分器:临床序数评分中的中央趋势偏差
本文研究了用于临床序数评分(画钟测试)的多模态LLM中的中央趋势偏差。研究发现,LLM将预测结果向量表中间压缩,对关键极端值造成不成比例的影响。该研究将LLM作为裁判的偏差文献扩展到临床评估领域,强调在部署前需要进行校准感知评估。
LLM弃权的两个维度:答案正确性与问题可回答性
本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。
让LLMs相互评判:用于医学问答的多智能体同行评审推理
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。