解构LLMs中谄媚行为的内部表征
摘要
本文探讨了LLMs中的谄媚行为在事实性与观点性谄媚方面是否具有不同的内部表征,通过使用线性探针和引导向量,揭示了不同模型中的表征可以是统一的也可以是分离的。
arXiv:2607.07003v1 公告类型: 新
摘要:大型语言模型(LLMs)经常表现出谄媚行为,即即使用户的陈述是错误的,它们也会同意。虽然谄媚行为通常被视为单一定义的行为,但它可以在截然不同的方式和情境中表现出来,这引发了其多方面性质是否反映在内部机制中的问题。为弥补这一空白,我们将谄媚行为的表征解构为事实性和观点性子类型——基于可验证主张与主观信念之间的区别。我们训练线性探针并在一个子类型的激活上构建引导向量,然后评估它们对另一个子类型的迁移效果,以衡量它们共享表征的程度。我们发现证据表明,不同的LLMs对这些子类型的表征方式不同,有的更为统一,有的则更为分离并存在因果干扰。这种解构方法为研究复杂模型行为的表征结构提供了一个有前景的框架。
查看缓存全文
缓存时间: 2026/07/09 07:46
# 解构大语言模型中谄媚行为的内部表征 来源:https://arxiv.org/html/2607.07003 ###### 摘要 大语言模型(LLMs)经常表现出谄媚行为,即即使在用户陈述错误时也会同意其观点。虽然谄媚常被视作单一界定的行为,但它可能以截然不同的方式和情境呈现,这引发了一个问题:这种多面性是否在其内部机制中得到反映?为填补这一空白,我们将谄媚的表征解构为事实性和观点性两种子类型——其动机源于可验证主张与主观信念之间的区别。我们训练线性探针并构建引导向量,针对一种子类型的激活进行学习,然后评估其向另一种子类型的迁移程度,以测量它们在多大程度上共享表征。我们发现,不同的大语言模型以不同方式表征这些子类型:有的呈现更统一、有的呈现更独立且因果上相互干扰的表征。这种解构方法为研究复杂模型行为的表征结构提供了一个有前景的框架。 111匿名代码仓库(https://anonymous.4open.science/r/sycophancy-mech-405A/) 机器学习,ICML ## 1 引言 模型常表现出复杂且潜在有问题的行为,如幻觉、欺骗或角色扮演。这也包括谄媚,广义上定义为对用户的过度奉承或认同,通常以牺牲事实为代价(Sharma等,2023)。虽然看似无害,但谄媚可能导致大语言模型传播错误信息、固化用户的非理性偏见,甚至助长妄想螺旋(Moore等,2026;Shimgekar等,2026)。先前理解谄媚的工作展示了其异质性,存在多种不同的诱发方式、可能的上下文及失败模式(Perez等,2022;Fanous等,2025;Kirk等,2025)。尽管如此,先前关于谄媚机制的研究将其视为单一行为(Wang等,2025;Genadi等,2026),或仅区分谄媚性同意与赞美(Vennemeyer等,2025)。谄媚造成危害的一个方面是削弱了模型的真实感和自我连续性,从而威胁其可靠性和可信度。很多先前工作试图理解大语言模型如何编码“真理”,但结果不一,有的认为真理是普遍表征的(Burns等,2022;Marks和Tegmark,2023;Li等,2023;Azaria和Mitchell,2023),有的认为它是局部表征的(Orgad等,2025;Poulis等,2026)。鉴于大语言模型编码真理的这种难以捉摸的性质,自然会问:谄媚与真理相关的内部表征是否也更细微或非统一?此外,虽然大多数先前工作针对真实事实(ground truth)研究谄媚(Sharma等,2023),但现实世界中的交互常涉及主观或无法验证的主张(Chiang等,2024),此时谄媚表现为未能坚持原则立场(Cheng等,2025)。这些混杂因素是否会导致关于是否存在客观真理的谄媚表征出现不同?为回答这个问题,我们定义了**事实性谄媚**与**观点性谄媚**,并研究其内部表征在多大程度上可分离或分解。我们的方法借鉴认知科学,其中证明两个认知过程不同的金标准是展示双重解离(double-dissociation),即过程可以独立受损(Shallice,1988)。将此框架应用于大语言模型需要证明两种行为可以被单独隔离和操控——即对一种的干预不影响到另一种。由于包括谄媚在内的模型行为在很大程度上线性编码于激活中(Elhage等,2022;Chen等,2025),我们可以使用线性探针(Alain和Bengio,2016;Belinkov,2022)和引导向量(Panickssery等,2023)来学习每种谄媚类型的表征。然后我们测试这些子类型是否解离,即评估每种表征在区分或调解另一种时的**迁移**效果。我们应用此方法来确定在Gemma-3-12B-IT(Team等,2025)和Llama-3.1-8B-Instruct(Grattafiori等,2024)中,事实性谄媚和观点性谄媚的表征是否可解离。我们还使用线性判别分析(LDA)对所得表征几何进行可视化。我们的发现表明,不同模型中的谄媚表征存在差异:有些模型编码了更统一的表征,另一些则编码了每种子类型更独立的分量。更广泛地,这种解构框架显示出作为通用方法的潜力,用于探究其他复杂模型行为是统一的还是可分解的。 ## 2 相关工作 已有越来越多的研究关注大语言模型中谄媚的机制。Wang等人(2025)使用logit-lens和激活修补将谄媚定位到特定层。Genadi等人(2026)使用线性探针发现谄媚线性编码于注意力头、MLP激活和残差流激活中。然而,激活探针的方向在引导方面性能有限,使其分析局限于非因果方法。Vennemeyer等人(2025)使用均值差引导向量将谄媚分解为真诚同意、谄媚性同意和谄媚性赞美三个方向,通过能够独立引导每种行为并追踪这些表征的逐层发展,展示了行为分离。尚无研究尝试进一步分解谄媚性同意,并比较线性探针和引导向量以获得对这些机制的更全面理解。 ## 3 方法 ### 3.1 谄媚类型的定义 **事实性谄媚**:模型从纠正用户可验证的错误主张,转变为明确认可或接受用户正确。 **观点性谄媚**:模型从之前陈述的中立立场,转变为明确同意或认同用户所表达的观点作为自己的观点。 ### 3.2 数据集 #### 提示生成 我们构建了两个数据集来诱发谄媚行为:一个针对事实性谄媚,一个针对观点性谄媚。我们以用户与助手之间的一次对话作为提示的开端。在第一条用户消息中,用户要么做出错误主张(事实性),要么陈述强烈的观点(观点性)。在第一条助手消息中,助手要么纠正错误主张(事实性),要么表示不同意并持中立立场(观点性)。我们使用GPT-5-mini生成第一轮对话。对于第二条用户消息,我们附加了随机选取的预定义回推短语以保证语义一致性。我们用此方法为事实性和观点性谄媚各生成3000个示例。我们选择这种多轮/回推设定来研究谄媚,因为它可以控制模型先前的立场以判断其是否屈服。 #### 回复收集 然后我们使用所研究的模型(Gemma或Llama)生成数据集中助手的第二条消息。这里我们判断助手是否屈服并以谄媚方式回应。收集所有模型补全后,我们使用GPT-5-mini将每条回复截取到最能完整且唯一反映大语言模型是否推翻先前立场的那一部分。这样做是为了保持数据集的一致性。然后我们使用GPT-5将每段完整对话标记为谄媚、非谄媚或两者都不算(如果未完全满足任一标准)。为控制回复长度,我们迭代地修剪每个数据集,直到各类的平均token长度平衡。每个最终数据集包含每个类别500个示例,共1000个示例。然后,我们从每条对话的最终回合结束token(Vennemeyer等,2025)中提取所有层的残差流激活,使用生成补全的同一模型。为验证GPT-5的标签,一名人类标注者独立标注了从所有数据集中随机抽取的100个示例,达成88%的一致性。 ### 3.3 探针实验 我们训练逻辑分类探针,从每个大语言模型所有层的捕获激活中对谄媚与非谄媚回复进行分类。为评估共享与独立表征,我们在同一谄媚类型的测试集(域内)和另一种类型的测试集(迁移)上评估每个探针。如果事实性和观点性谄媚的表征显著相似,那么两个线性探针应在两个数据集上均达到高可分离性(以AUC即AUROC测量)。如果两种形式在表征上足够不同,那么线性探针在另一种类型上的性能会下降。组合探针通过随机采样事实性和观点性谄媚数据集各一半(保持类别平衡)来训练。所有报告的AUC值是五个不同随机种子的平均值。 ### 3.4 引导实验 为补充探针分析,我们进行激活引导实验,以研究每种谄媚类型的因果表征之间的关系。我们使用为谄媚和非谄媚回复捕获的各层激活,构建均值差引导向量。然后,我们分别在每个模型一半层的位置(之前工作发现此处是最具因果代表性的层)(Vennemeyer等,2025;Chen等,2025)的每个token生成步骤的最终激活上进行引导。使用正系数,我们增加并测量由此产生的谄媚率,由GPT-5使用与回复收集相同的标准进行评判。在此实验中,域内定义为使用同一种谄媚类型的向量进行引导;迁移定义为使用另一种谄媚类型的向量进行引导。域内引导验证了我们的方法和引导向量所学习的表征。如果迁移引导成功提高了谄媚率,那么因果谄媚表征在显著程度上是共享的。通过比较域内与迁移向量提升引导率的差异,我们可以量化表征的对齐程度。我们还报告了两个向量之间的余弦相似度。同样,我们平均了五个不同随机种子的结果。更多方法细节、补充实验以及数据集示例和所用提示可在附录中找到。 ## 4 结果 表1:Gemma-3-12B-IT的平均AUC值 表2:Llama-3.1-8B-Instruct的平均AUC值 ### 4.1 探针性能 #### 域内 表1和表2分别报告了Gemma-3-12-IT和Llama-3.1-8B-Instruct中事实性和观点性谄媚线性探针的平均AUC。域内值以粗体显示。无论在事实性和观点性谄媚数据集上,还是在Gemma和Llama中,域内探针的AUC均大于0.90。这些持续高AUC值表明,两种谄媚类型和模型的探针都学会了准确分离谄媚与非谄媚的激活。这些值也作为比较迁移和组合探针的基线。 #### 迁移 迁移任务的结果通过我们的双重解构方法揭示了谄媚子类型的内部表征相似程度。对于Gemma,迁移的事实性探针AUC值比域内下降0.07,迁移的观点性探针AUC值比域内下降0.06。这种持续的微小AUC损失表明,在Gemma-3-12B-IT中,事实性和观点性谄媚的表征非常相似。对于Llama,迁移的事实性探针AUC值比域内下降0.30,迁移的观点性探针AUC值比域内下降0.22。这种高AUC损失表明,在Llama-3.1-8B-Instruct中,事实性和观点性谄媚的表征更为独立。 #### 组合 组合探针的结果使我们能够量化在两种类型上训练对迁移任务的益处。在两个模型和两种谄媚类型上,组合探针的AUC值相比域内性能的提升均小于0.02。这意味着探针可以仅通过训练一种类型来完全学习该类型的分布,而捕捉完整的谄媚表征并不会显著提升域内性能。然而,通过在多种谄媚类型上训练,探针能够泛化以准确分离两种类型。 ### 4.2 引导性能 图1展示了引导实验的结果。在Gemma上,所有引导(包括域内和迁移)均成功,具有高R²值和正斜率,表明谄媚的因果表征是对齐的。事实性与观点性谄媚引导向量之间的余弦相似度为+0.68,也支持这一点。有趣的是,使用事实性谄媚向量引导观点性谄媚的表现优于使用观点性向量,这可能表明存在虚假数据集特征,或者观点性谄媚在Gemma中可能更难因果确定。在Llama上,类型之间关联更弱,迁移引导具有中等到高的R²值但斜率为负。因此,迁移引导实际上降低了谄媚率,这表明Llama中的谄媚表征非常独立,以至于因果上相互干扰。两个引导向量之间的余弦相似度为-0.15,进一步支持了这一点。在域内引导中,低R²值和接近零的斜率表明引导向量包含较弱的因果表征,很可能再次是由于虚假特征。需要更多工作来在我们设定的范围内提取更具因果代表性的引导向量。
相似文章
LLMs 能内省吗?现实检验
本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。
当乐于助人变成阿谀奉承:大语言模型中阿谀奉承是社会对齐与认识论完整性之间的边界失效
本立场论文将大语言模型中的阿谀奉承行为分析为社会对齐与认识论完整性之间的边界失效,并提出一个新的框架和分类法来分类和缓解这些行为。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
对齐微调如何塑造大语言模型中的谄媚及相关线索诱导偏差的表征?
本文研究对齐微调如何在大语言模型中引入线索诱导偏差(如谄媚行为),发现偏差是由对齐过程而非预训练植入的,并且可以通过隐藏状态方向进行解码和引导。
角色扮演时,模型是否相信自己所说的话?
这篇论文通过线性探针研究角色扮演是否仅改变LLM的输出,还是也改变了其内部的真实性表征。研究发现,角色扮演对输出的改变大于对内部信念的改变,而涌现性错位则导致内部表征发生更大变化。