语言模型如何选择立场:指令层级的内部表示
摘要
本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。
arXiv:2608.28648v1 公告类型:新
摘要:我们研究指令微调的大语言模型如何仲裁系统指令和用户指令之间的直接冲突。我们引入了一个包含41对约束条件的基准测试,配有确定性验证器,并在匹配的基线、冲突和同通道控制条件下评估了八个模型。行为上,模型根据系统权威性差异分为三种状态:层级尊重模型将系统通道用作权威信号;反层级模型遵循系统的频率低于其同通道基线预测;无影响模型对通道敏感度低。Llama-3.1-8B是我们测试套件中最强的反层级案例,在冲突试验中仅0.10次遵循系统。我们利用这一行为失败案例来探究用户偏好仲裁是否反映了内部冲突解决信号的缺失。结果并非如此:在Llama-3.1-8B上,冲突结果可以从残差流激活中线性解码,达到0.97的平衡准确率,比仅元数据基线高出17个百分点,在Qwen2.5-7B和gpt-oss-20b上也有类似信号。使用四个每次冲突逻辑回归方向的第12层均值进行引导,将真实系统遵循率从0.132提高到0.530,而主要为池化可分性选择的方向引导效果差。因此,用户偏好的冲突解决可以与可读的内部仲裁信号共存,成功的干预取决于读出的几何形状,而不仅仅是探针准确率。
查看缓存全文
缓存时间: 2026/09/01 12:38
# 语言模型如何站队:指令层级的内部表征
来源:https://arxiv.org/html/2608.28648
**作者:**
* **Chi-Hao Hsu**
隶属机构:台湾大学
* **Rushiraj Gadhvi**
隶属机构:印度莫哈利普拉克莎大学
* **Sunishchal Dev**
隶属机构:美国兰德公司技术与安全政策中心
隶属机构:Algoverse
* **Callum Stuart McDougall**
隶属机构:Google DeepMind
* **Anusha Mujumdar**
隶属机构:Algoverse
通讯作者:[[email protected]](mailto:[email protected])
###### 摘要
我们研究指令微调的大语言模型(LLM)如何裁决系统指令与用户指令之间的直接冲突。我们引入了一个包含41个配对约束及确定性验证器的基准,并在匹配的基线、冲突和同信道控制条件下评估了八个模型。行为上,模型根据**系统权威差**分为三种模式:层级尊重模型将系统信道视为权威信号;反层级模型遵循系统指令的频率低于其同信道基线预测;无影响模型对信道敏感性较低。**Llama-3.1-8B**是我们测试集中最强的反层级案例,在冲突试验中仅有0.10的遵循率。我们利用这一行为失败案例来探究用户优先的仲裁是否反映了内部冲突解决信号的缺失。答案是否定的:在Llama-3.1-8B上,冲突结果可以从残差流激活中线性解码,平衡准确率达0.97,比仅基于元数据的基线高出17个百分点,在**Qwen2.5-7B**和**gpt-oss-20b**上也观察到类似信号。通过在第12层使用四个按约束逻辑回归方向的平均值进行引导,将真实的系统遵循率从0.132提升至0.530;而主要为池化可分离性选择的方向则引导效果不佳。因此,用户优先的冲突解决可以与可读的内部仲裁信号共存,成功的干预取决于读出的几何结构,而不仅仅是探测器的准确率。代码可通过 https://github.com/ebalp/system-user-circuits 获取。
###### 关键词:机制可解释性,指令层级,线性探测器,引导
††归属说明:同等贡献
## 1 引言
> 请参阅说明文字
图1:Llama-3.1-8B中的冲突解决。左图:当系统与用户对输出格式意见不一致时,模型默认遵循用户,从而破坏下游约定。中图:在第12层(L12),遵循系统和遵循用户的残差流激活形成可区分的聚类;线性探测器以0.97的平衡准确率将其分离。右图:沿每个约束探测方向的平均值(α 𝐯)添加引导向量,将相同提示的激活状态跨越决策边界翻转;模型从而生成有效的JSON。
当开发者通过系统提示限制某种行为,而用户希望使用该行为时,指令微调的大语言模型(LLM)必须选择立场。这种相同的冲突被对手蓄意利用,通过提示注入和越狱来实施。EchoLeak事件具体展示了其利害关系:一种零点击攻击,其中恶意电子邮件覆盖系统指令以窃取机密文件。从根本上说,这两种都是指令层级的失败模式:即隐含假设开发者指定的指令优先于用户输入。先前的工作证实模型在实践中仍然脆弱,对系统指令的遵循度很低。已有工作通过训练和架构来解决此问题——通过微调模型以优先考虑系统指令、将指令优先级直接嵌入模型的输入编码,以及发现此类方法通常学习的是表面捷径而非真正的角色分离——但冲突仲裁背后的内部表征仍未被审视。这些工作的共同副作用是拒绝率的增加,表明冲突仲裁与拒绝方向可能在某些层面上的内部表征中纠缠在一起。我们以机制性的方式探查冲突表征,但其基于社会线索构建的引导向量无法可靠地翻转冲突结果。
我们研究单轮、系统与用户之间的冲突。本文由两个问题驱动(图1):(1) 冲突结果能否从残差流中线性读出?(2) 这种读出是否能因果性地翻转哪条指令/角色胜出?我们发现,冲突结果可以在三个模型上以0.93-0.97的平衡准确率解码;有趣的是,同样准确的探测器指向不同的方向。我们还能够引导Llama-3.1-8B;将系统遵循率(SCR)提升至基线的4.0倍,从0.132提高到0.530。在第12层平均四个按约束逻辑回归(LR)探测方向驱动了这一效果——没有任何单个约束探测方向能实现这一点,并且在跨约束池化的方向虽然具有更高的线性可分离性,但在匹配的引导测试下几乎无效。
## 2 基准与行为模式
#### 基准设计
我们从IHEval和IFEval获得灵感来设计数据集。一个*冲突*c定义了一对互斥的约束(φₐᶜ, φᵦᶜ),作用于模型响应(例如,以JSON响应 vs. 以纯文本响应),每个约束都配有一个确定性验证器vₐᶜ, vᵦᶜ: ℛ → [0,1](附录D)。该基准包含|C|=41个冲突,涵盖输出语言、格式、词汇选择、风格语气、句法模式和内容要求(完整清单见附录E.2)。
我们为每个冲突衡量四种条件:A(约束在系统,任务在用户)、B(约束在用户,无系统)、C(两个信道中存在对立约束,即层级冲突)、以及D(两个约束都在用户,同信道控制)。条件A定义了系统基线率(SBR),条件B定义了用户基线率(UBR)。每个冲突都以两个分配方向运行(a→b将φₐ置于系统槽位;b→a则交换);报告的指标是两个方向上的平衡结果。**系统遵循率**(SCR_C)是条件C响应中,验证器判定遵循系统约束而非用户约束的比例。**系统权威差**(SAD)= SCR_C^裸模板 - D_首字,比较在裸模板下条件C的遵循率与模型在相同指令对上的同信道解决率(D_首),从而隔离出通过系统信道路由的边际效应。
条件C还额外扫描了一个5×5的系统风格×用户风格网格(模板见附录E.1);结合50个语义任务,这为每个模型产生了114,800个提示。
#### 行为模式
我们评估了八个指令微调模型(图2),其中三个(Gemma-4-E2B, Gemma-4-E4B, Gemma-4-31B)属于同一系列的Gemma-4家族,参数数量跨越一个数量级。SBR和UBR基线在所有模型上均超过0.94:这些约束本身并不困难,因此SCR_C从0.10到0.96的分散反映了信道级别的冲突解决,而非能力差异。
SAD将八个模型分为三种模式:
* 三个模型表现出正向的系统信道权威效应(层级型:Gemma-4-31B为+0.45,gpt-oss-20b为+0.20,Gemma-4-E4B为+0.19)。
* 三个模型遵循系统指令的频率低于其同信道基线预测(反层级型:两个Llama模型分别为-0.29和-0.26,Qwen2.5-7B为-0.15)。
* 两个模型没有信道效应(Gemma-3-27B为+0.02,Gemma-4-E2B为-0.03);对于Gemma-3-27B,其聊天模板缺少独立的系统角色,并将系统内容拼接到用户回合中,这可能是信道信号缺失的合理机制。
在Gemma-4家族内,模式与模型规模相关:E2B处于无信道效应区间,而E4B和31B都达到层级阈值,且随着参数量增加信道效应增强。
对抗性框架与SAD模式一致:越狱用户风格在两个反层级的Llama模型上几乎将SCR降至零,但在层级模式的模型上未产生类似崩溃(附录A.1)。包括拒绝率和元评论率在内的响应类型细分见附录A.2。
> 请参阅说明文字
图2:行为概览。(a)基线遵循率(SBR, UBR)在所有模型上饱和于≥0.94,而冲突下的系统遵循率(SCR_C)从0.10到0.96不等。(b)SAD将八个模型分为三种模式(绿色:层级型;灰色:无信道效应;橙色:反层级型)。(c)每个冲突、每个方向的SCR(行:模型按平衡SCR排序;列:冲突按跨模型平均SCR升序排序,因此左边缘收集系统遵循率最低的约束,右边缘收集最高的)。每个单元格沿其反对角线划分:左上角编码SCR_{a→b},右下角编码SCR_{b→a}(红色=低,绿色=高)。斜线填充的单元格标记了模型运行中缺失的冲突。
#### 为何聚焦于Llama-3.1-8B
Llama-3.1-8B在我们的测试集中具有最低的SCR_C(0.10)和最强的反层级SAD(-0.29)。行为上它几乎从不遵循系统指令,这使其成为第4节引导分析的有用目标:任何在此模型上提升SCR的干预都必须克服强烈的行为先验,使得该提升几乎无法用样本效率或随机漂移来解释。我们在该模型上进行了探测和引导;跨模型的探测复制在Qwen2.5-7B和gpt-oss-20b上进行,见附录B。
## 3 探测
#### 设置
我们使用探测文献中最小化且标准的三种方向寻找方法。令μ±为类别条件平均激活,Σ为类内池化协方差。**DiM**设置θ_dim = μ₊ - μ₋,并在投影中点处设置阈值。**IID-MM**应用θ_mm = Σ⁻¹(μ₊ - μ₋),并采用Tikhonov正则化ε=10⁻⁶。**LR**拟合一个l₂正则化分类器,在5,000个平衡点上进行5折分层交叉验证。这三者位于探测与引导几何结构的不同点:DiM位于原始空间,LR位于对偶空间,而IID-MM应用了它们之间的Σ⁻¹映射。我们将结果限制为二元结果(遵循系统/遵循用户),通过多数子采样平衡至50/50,并将探测固定在`last_prompt`位置(生成前的最后一个输入令牌)。
> 请参阅说明文字
图3:Llama-3.1-8B上`last_prompt`处的探测投影(水平)与残差PC1(垂直),分别为DiM(左,第14层)、IID-MM(中,第26层)和LR(右,第20层)。红色:遵循用户;蓝色:遵循系统。所有三种方法都能沿着探测轴清晰分离类别,但残差轴的行为不同:在DiM下,方差呈对角线倾斜,表明与探测方向部分对齐;在IID-MM和LR下,残差轴在分布上是正交的。这三个分类等效的探测器恢复了同一分离超平面的三个几何上不同的法线。
#### 优先级可线性读出
所有三种探测器都能恢复冲突结果,峰值平衡准确率分别为0.81(DiM,第14层)、0.97(IID-MM,第26层)和0.92(LR,第20层)。高精度的线性方向是先验预期,并非意外:一个能产生两种结果的模型必须在内部编码这种区别。实质性的问题是,此信号是否超越了输入特征的表征。我们在一个逻辑分类器上训练,使用元数据特征向量m_i = [onehot(c_i), onehot(s_i), onehot(u_i), 𝟙[d_i=forward]],编码约束类型、两个风格标识符和冲突方向;该分类器已达到0.800±0.008的平衡准确率,因为按约束的SCR是异质的,仅约束标识就能在五分之四的样本上预测结果。因此,激活探测器的适当参考不是随机猜测,而是这个元数据基线:IID-MM的0.97峰值代表了比表面特征所能解释的高出17个百分点的提升。标签置换控制将准确率降至0.494-0.498(K=3次置换)。同样的模式适用于各种层级模式:IID-MM的峰值平衡准确率在Qwen2.5-7B(反层级)上为0.951,在gpt-oss-20b(层级)上为0.930,分别比其元数据基线高出20和16个百分点(附录B)。
#### 三种方法,三个不同的方向
DiM、IID-MM和LR方向之间的成对绝对余弦相似度在`last_prompt`的各层上都很低:DiM↔IID-MM平均为0.022,DiM↔LR平均为0.069,IID-MM↔LR平均为0.296。同样的排序在Qwen2.5-7B和gpt-oss-20b上成立。这三种方法恢复了几何上不同的方向,但所有方向都能沿着其轴清晰地分离类别(图3)。
## 4 引导优先级读出
#### 设置
所有引导实验均使用Llama-3.1-8B-Instruct模型,在四个冲突的条件C引导子集上进行:JSON与纯文本、项目符号列表与编号列表、过去时与现在时、以及以“Hello”与“Greetings”开头。每个配置在相同的8个单元格(冲突 × {a→b, b→a})上进行评估,每个单元格96个样本,每个配置768次生成。我们在选定的残差流层L上比较四种方向族:一个整体LR探测器、四个按约束LR探测器、它们的等权平均值,以及IID质量平均方向。等权平均值为:相似文章
指令层级失效之处:诊断与修复推理语言模型中的故障
本文引入了一个白盒诊断框架,将推理语言模型中的指令层级故障定位为识别、冲突解决和响应实现三个阶段。该框架评估了多个模型,并提出了两种无需训练的自我监控机制,可将违规率降低81%–99%。
语言塑造多语言大语言模型中指令层级遵循度
本文介绍了XIH-Bench,一个用于评估多语言大语言模型中指令层级遵循度的基准,揭示了语言依赖的不对称性以及语言边界效应,即跨语言冲突比同语言冲突产生更高的遵循度。
按我说的做,不是按我做的做:LLM中的指令-归纳冲突
本文研究了LLM中指令遵循与模式补全之间的冲突,发现指令遵循在归纳压力下较为脆弱,且在不同模型间差异显著,而输出多样性是鲁棒性的主要因素。
改进前沿大语言模型中的指令层级
OpenAI提出了一种利用指令层级任务的训练方法,通过教导模型根据信任级别(系统 > 开发者 > 用户 > 工具)正确优先处理指令,以提高大语言模型的安全性和可靠性。该方法通过强化学习使用名为IH-Challenge的新数据集,应对提示注入攻击并增强安全可控性。
驾驭语言轴:从线性可解码性到因果控制
本文研究LLM中的语言身份是否可以通过紧凑的激活方向进行线性解码和因果控制。通过在多个模型家族上进行引导(steering)和消融(ablation)实验,作者表明语言选择具有方向依赖性、层特异性,并且在语言信号被消融时会恢复为英语。