自发与指示欺骗中的不对称性

arXiv cs.AI 论文

摘要

本文研究了大型语言模型(特别是 Llama-3.1-70B-Instruct)中自发与指示欺骗之间的关系,发现两种设置在检测和因果关系上存在不对称性。

arXiv:2609.00180v1 Announce Type: new 摘要:大型语言模型有时会在未被指示的情况下欺骗用户。然而,许多关于模型欺骗的研究涉及指示欺骗。我们研究了 Llama-3.1-70B-Instruct 中指示与自发(未指示)欺骗之间的关系。我们通过方向几何、跨设置分类器和跨设置引导比较了这两种欺骗设置。我们发现这两种欺骗设置共享一个方向分量(余弦值约为 0.5),并且在检测和因果关系方面的跨设置转移中存在不对称性。自发训练的分类器在指示数据上的表现优于反之,而指示衍生的方向在引导自发提示时表现优于反之。同样,从最佳令牌位置导出引导向量与训练和应用分类器的最佳令牌位置不同。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:58

# 自发与指令性欺骗中的不对称性
来源:https://arxiv.org/html/2609.00180

###### 摘要

大型语言模型有时会在未受指令的情况下欺骗用户。然而,现有研究大多关注指令性欺骗。我们研究了Llama-3.1-70B-Instruct模型中指令性欺骗与自发(非指令性)欺骗之间的关系。通过方向几何学、跨设置分类器和跨设置引导方法,我们比较了这两种欺骗设置。研究发现,两种欺骗设置共享一个方向分量(余弦相似度约0.5),且在跨设置的检测与因果引导转移中存在不对称性:自发训练的分类器在指令性数据上的表现优于反之亦然,而基于指令的方向引导在控制自发提示时效果也优于反向操作。此外,引导向量的最佳推导token位置与分类器训练和应用的最佳token位置存在差异。

††会议论文::## 1引言

大型语言模型在与用户交互时有时会产生欺骗性输出(Park等人,2023 [链接](https://arxiv.org/html/2609.00180#bib.bib13))。这引发了关于在严肃场景中使用LLM的诸多实践与安全问题。因此,理解LLM欺骗的本质及其缓解方法至关重要。

在实际部署环境中,LLM的欺骗行为是自发而非受指令驱使的。因此,自发欺骗研究最贴近现实关切。然而,现有工作大多聚焦于指令性欺骗。此前有研究探讨过指令性与自发欺骗的关系:Goldowsky-Dill等人(2025 [链接](https://arxiv.org/html/2609.00180#bib.bib6))研究了基于指令性欺骗训练的探测器如何泛化到自发欺骗。在此基础上,我们进一步探究了Llama-3.1-70B-Instruct(Grattafiori等人,2024 [链接](https://arxiv.org/html/2609.00180#bib.bib7))中自发与指令性欺骗的完整对称性。我们测试了基于两种欺骗设置训练的分类器在对方场景中的泛化能力,并通过方向引导探索了两种欺骗之间的关系是仅具相关性还是兼具因果性。此外,我们还考虑了类型级欺骗(捏造与隐瞒)而非仅二元的欺骗/诚实分类。

我们构建了指令性与自发性欺骗提示及模型响应的数据集,并借此研究了分类器跨设置训练与应用的迁移性、方向引导的跨设置迁移性,以及两种设置的欺骗方向几何结构对比。

主要发现如下:
- **跨设置共享欺骗分量**:从模型响应token计算出的设置欺骗方向,其余弦相似度约为0.5(随机基准值0.011)。
- **检测迁移的不对称性**:基于自发欺骗训练的探测器应用于指令性欺骗时达到接近上限的准确率,而基于指令性欺骗训练的探测器跨设置表现较弱。
- **因果方向迁移但具不对称性**:使用对方设置推导的方向引导当前设置的提示,确实能抑制或诱发欺骗行为,但指令性方向的引导效果更优。
- **读入与写出的token不对称性**:分类器训练与引导方向推导的最佳token位置存在差异。响应token在分类器训练和应用中普遍表现最佳,但引导向量应从最后一个提示token推导。

## 2相关工作

**欺骗探测器的泛化性**:Goldowsky-Dill等人(2025 [链接](https://arxiv.org/html/2609.00180#bib.bib6))在受指令欺骗或诚实的模型内部状态上训练探测器,并在自发欺骗场景(如内幕交易)中测试其泛化能力。我们在指令性与自发性欺骗激活上训练探测器,并测试两者间的迁移性。实验中还针对类型级欺骗(捏造、隐瞒)进行了探测与引导。

**欺骗类型表征**:Natarajan等人(2026 [链接](https://arxiv.org/html/2609.00180#bib.bib11))表明不同欺骗类型在模型中可能具有不同表征,尽管某些欺骗形式高度重叠。我们也研究了类型级欺骗,特别是捏造与隐瞒。

**因果与检测的分离**:Galeone等人(2026 [链接](https://arxiv.org/html/2609.00180#bib.bib5))发现代表模型对主题认知/知识的方向,与其拒绝回答该主题问题的方向正交。我们在欺骗的检测与控制中也发现了类似分离现象。

## 3实验设置与方法

我们生成了用于测试指令性与自发性欺骗的提示数据集。所有系统提示包含场景与事实真相,用户提示均围绕事实真相提问。指令性欺骗提示包含诚实行为或欺骗行为(按隐瞒或捏造分类)的指令。自发性欺骗提示则包含场景中的欺骗诱因,分为隐瞒诱导列表和捏造诱导列表。捏造与隐瞒的定义,以及场景中欺骗的对象/受众,均遵循Shi等人(2026 [链接](https://arxiv.org/html/2609.00180#bib.bib14))的分类体系。我们使用这些提示生成模型响应,并保存以供后续实验。自发响应通过LLM评判器的内容评估分为欺骗列表与诚实列表。

我们在提示与响应数据集的教师强制激活上训练逻辑回归探测器(Alain与Bengio,2018 [链接](https://arxiv.org/html/2609.00180#bib.bib1)),以二元分类(诚实/欺骗)及欺骗类型分类(捏造/隐瞒)区分响应。探测器在最后一个提示token或响应token的不同层进行训练,并应用于数据集留出部分的相同层和token位置激活。

我们基于自发与指令性提示/响应数据集计算欺骗的质量平均差异方向(Li等人,2024 [链接](https://arxiv.org/html/2609.00180#bib.bib8)),并用其从提示生成新响应。方向从第19-32层的最后一个提示token和响应token推导。归一化方向在生成时以最大系数±1.5应用于第19-32层所有token。同时进行随机方向引导作为对照。

由于基线(无引导时)自发数据集中捏造响应触发较少,我们实施了额外测试以衡量捏造抑制引导的有效性。对于基线产生捏造响应的提示,我们记录在捏造抑制引导和随机引导下转为诚实响应的情况。使用Wilson 95%区间(Wilson,1927 [链接](https://arxiv.org/html/2609.00180#bib.bib15))计算捏造到诚实的翻转率,真实与随机方向翻转率差异采用基于Wilson区间构建的Newcombe 95%区间(Newcombe,1998 [链接](https://arxiv.org/html/2609.00180#bib.bib12))评估。

响应标记与欺骗评分由GPT-4.1 Mini评判器完成。用于方向推导和探测器训练/应用的自发提示/响应对,通过评判/过滤流程标记为诚实、捏造或隐瞒(附录A [链接](https://arxiv.org/html/2609.00180#A1))。指令性提示/响应对则基于系统提示指令标记。两个数据集的引导与基线响应在捏造、隐瞒及连贯性方面进行0-100评分。

为验证LLM评判器,我们使用评判器评级时的可用资源对120条响应进行了人工标注。样本经过分层以包含多样化的欺骗评分和引导水平。结果显示人工标注与LLM评判器一致性良好:二元捏造评级(≥50分为捏造)一致率85%,二元隐瞒评级一致率82%。完整的评判器验证文档见附录B [链接](https://arxiv.org/html/2609.00180#A2)。

## 4结果

**表1:第35层二元(诚实/欺骗)探测器结果**(值为种子42、43、44的均值±半值域)。加粗行为同设置对角线。保留率指非对角线平衡准确率与同验证集对角线值的比值。
我们发现二元及类型级欺骗探测器在第35层表现最佳,且在跨数据集迁移中呈现不对称性。基于自发响应token激活训练、应用于指令性响应token激活的探测器达到接近上限的准确率。基于指令训练的二元探测器应用于自发设置时,在最后一个提示token训练并在响应token应用时得分最高,但未能匹配自发训练的探测器。基于指令训练的类型级探测器应用于自发设置时,准确率未超过随机水平。有趣的是,自发激活训练的探测器在同设置最后一个提示token应用时得分不佳,表明该位置缺乏自发欺骗信号。二元探测器迁移结果见表1 [链接](https://arxiv.org/html/2609.00180#S4.T1),类型级结果见表2 [链接](https://arxiv.org/html/2609.00180#S4.T2)。

**表2:第35层响应token应用的类型级(捏造/隐瞒/诚实)分类结果**(响应训练探测器)。值为种子42、43、44的均值±半值域。加粗行为同设置对角线。保留率指非对角线平衡准确率与同验证集对角线值的比值。

**图1:自发与指令场景激活推导的欺骗方向余弦相似度**。
为确定自发与指令欺骗方向的对齐程度,我们计算了其余弦相似度。如图1 [链接](https://arxiv.org/html/2609.00180#S4.F1)所示,在第35层响应token上,设置欺骗方向的余弦值在捏造和隐瞒情况下分别为0.519和0.435(随机基准值0.011)。当从欺骗方向中投影掉设置方向时,其余弦值升高。在最后一个提示token上,自发与指令方向的余弦值较低:第35层捏造和隐瞒方向的余弦值分别为0.052和0.008。

**表3:最后一个提示token推导方向在第19-32层引导下的评判器欺骗评分**。使用正向量引导的指令提示指诚实指令提示被欺骗方向引导。指令提示的基础列显示(诚实指令提示基线欺骗度)/(欺骗指令提示基线欺骗度)。
我们通过将每个设置的欺骗方向应用于对方设置提示下的模型残差流进行引导。引导结果见表3 [链接](https://arxiv.org/html/2609.00180#S4.T3)和图7 [链接](https://arxiv.org/html/2609.00180#A4.F7)。我们通过最后一个提示token推导的方向和幅度±1.0的系数获得了最佳的欺骗诱导与抑制效果。使用幅度大于±1.0的系数引导会导致WikiText-2(Merity等人,2016 [链接](https://arxiv.org/html/2609.00180#bib.bib10))困惑度显著上升和连贯性评分下降。指令性方向通常优于自发性方向。

**图2:自发场景在负向引导下的翻转率**(使用最后一个提示token推导的方向),针对基线欺骗评分≥50的响应。柱状图显示基线欺骗响应在负向引导下转为诚实(评分<50)的场景百分比。黑色水平线段表示6个随机方向引导的平均翻转率。
由于自发捏造的基线触发率低,我们采用进一步指标评估捏造是否在自发与指令欺骗方向负向引导下被有效抑制。我们确定基线捏造评分≥50的自发捏造场景,统计引导后翻转至评分<50的数量。使用最后一个提示token推导的指令与自发捏造方向以系数-1.0引导,翻转率分别为96.55%和86.2%。相同系数下随机方向向量的平均翻转率为35%。翻转分析结果见图2 [链接](https://arxiv.org/html/2609.00180#S4.F2)。

## 5讨论

研究结果支持自发与指令性欺骗在Llama-3.1-70B-Instruct表征中共享重要分量的论点。两个设置响应token上提取的欺骗方向,第35层捏造与隐瞒方向的余弦值分别为0.519和0.435(随机基准值0.011)。根据Marks与Tegmark(2024 [链接](https://arxiv.org/html/2609.00180#bib.bib9))的方法,我们将此余弦对齐解释为共享分量的证据。此外,探测器在自发与指令数据集间迁移,自发到指令迁移达到接近上限的准确率,而指令到自发迁移准确率较低。引导方向也能在自发与指令提示间诱发和抑制欺骗效应。

我们发现跨设置探测器与引导存在有效性不对称:自发训练的探测器迁移效果优于指令训练的探测器,而基于指令的方向引导迁移效果优于基于自发的方向引导。探测不对称的可能解释是:自发欺骗在模型表征中留下的痕迹更微妙、更难检测,因此在其上训练的探测器能更好泛化到其他设置。自发探测器的优势也可能源于其基于噪声更大的标签训练——自发欺骗场景由评判器标记为诚实或欺骗,而指令性场景由提示条件直接标记,这可能降低了对设置特定特征的依赖。关于引导效果不对称,可能因为指令性欺骗在模型表征中更显式和强烈,其提取的方向在引导时产生更显著的效果。

我们还发现最后一个提示token推导的方向与响应token推导的方向存在本质差异:前者更适用于生成引导向量,后者更适用于训练和应用探测器。这一“读入-写出”不对称性提示,欺骗相关的因果操作与检测操作可能作用于模型处理流程的不同阶段。

相似文章