作为X,做Y:指令调优的LLM中角色与任务的结合方式

arXiv cs.CL 论文

摘要

本文研究了指令调优的LLM如何在残差流中结合角色和任务规范,发现在答案形成阶段,这种结合近似可加,使得替换时KL散度极小,但该可加机制并不能解释完整的多token生成过程。

arXiv:2605.23147v1 公告类型:新 摘要:形式为'作为X,做Y'的角色提示在残差流中的特定位置呈现出清晰的线性分解:即提示到答案的过渡——最后一个提示token与生成的前两个token——在早期/中间层带。在此处,角色和任务通过部分正交的可加方向贡献。形成纯角色效应$\Delta_X$,纯任务效应$\Delta_Y$,并用$h_{BB} + \Delta_X + \Delta_Y$替换干净残差,在Gemma-2-2B-IT和Qwen-2.5-\{1.5B, 3B\}-Instruct上,跨越12格短网格和48格长角色网格,下游输出与干净结果的KL散度很小,且保留了角色特定的行为标记。 这种可加结构的自然推论是,角色提示可以压缩为单个缓存的残差向量。\emph{但我们证明无法做到。}将缓存的加性预测——甚至是最优的干净残差$h_{XY}$——注入到移除了角色文本的基线宿主提示中,无论是单点还是多层,都无法接近干净的长角色目标。角色条件化的多token生成通过注意力流回提示中角色文本的位置,这是任何单点残差都无法重现的。 残差流中的局部可加性并不意味着提示可压缩。提示到答案过渡处的可加结构支持对角色或任务贡献的可解释性和细粒度调控;而整个续写过程中角色条件化的行为依赖于分布式提示/KV机制,局部激活运算无法替代。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:59

# 作为X,执行Y:角色与任务在指令微调大语言模型中的组合机制
来源:https://arxiv.org/html/2605.23147

###### 摘要

形式为*“作为X,执行Y”*的角色提示在推理时将角色说明XX与任务说明YY组合在一起。我们刻画了在指令微调语言模型的残差流中,这种组合在何处因果上简单到可以用加法来近似。对于每个角色-任务对,我们比较四种提示——基线、仅角色、仅任务、角色加任务——并形成纯角色效应ΔX\\Delta\_\{X\}、纯任务效应ΔY\\Delta\_\{Y\}以及交互项Inter=ΔXY−ΔX−ΔY\\mathrm\{Inter\}=\\Delta\_\{XY\}-\\Delta\_\{X\}-\\Delta\_\{Y\}。

在答案形成附近——最后一个提示位置与生成的前两个token——ΔXY\\Delta\_\{XY\}可以通过ΔX+ΔY\\Delta\_\{X\}+\\Delta\_\{Y\}很好地近似,并且将加法预测替换为干净残差,会在早期/中层带产生与干净输出KL值很小的下游输出。该模式在Gemma-2-2B-IT和Qwen-2.5-1.5B、3B-Instruct上成立,在12格短网格和48格长角色网格上均成立。行为检查——在80个token延续中评分角色特定的标记——证实了这种局部分布保真度携带了角色调节的输出内容。

相同的实验划定了一个边界。将缓存的加法预测替换到没有角色文本的基线宿主提示中,只能恢复宿主到目标KL差距的一小部分,并且多层或oracle替换没有实质性地改变这一点。角色对多token生成的贡献分布在整个提示和KV缓存中;局部加法机制只解释下一步合成,而不是完整机制。

## 1 引言

形式为*“作为沃伦·巴菲特,提供建议”*或*“作为高级软件工程师,评审此设计”*的提示是常规的,指令微调模型能够稳健地处理它们。将角色说明XX与任务说明YY组合在残差流中的在线计算尚不太清楚。本文探讨在层和位置轴上,这种组合在何处因果上简单到可以用加法来近似。

对于每个角色-任务对,我们比较四种提示——基线-基线(BBBB)、仅角色(XBXB)、仅任务(BYBY)、角色加任务(XYXY)——并在每个层和位置形成

ΔX\\displaystyle\\Delta\_\{X\}=hXB−hBB,\\displaystyle=h\_\{XB\}-h\_\{BB\},ΔY\\displaystyle\\Delta\_\{Y\}=hBY−hBB,\\displaystyle=h\_\{BY\}-h\_\{BB\},\(1\)ΔXY\\displaystyle\\Delta\_\{XY\}=hXY−hBB,\\displaystyle=h\_\{XY\}-h\_\{BB\},Inter\\displaystyle\\mathrm\{Inter\}=ΔXY−ΔX−ΔY\.\\displaystyle=\\Delta\_\{XY\}-\\Delta\_\{X\}-\\Delta\_\{Y\}.\(2\)实证问题直接随之而来:ΔXY\\Delta\_\{XY\}是否与ΔX+ΔY\\Delta\_\{X\}+\\Delta\_\{Y\}对齐?ΔX\\Delta\_\{X\}和ΔY\\Delta\_\{Y\}是否分离?当我们用hBB+ΔX+ΔYh\_\{BB\}+\\Delta\_\{X\}+\\Delta\_\{Y\}替换干净的XYXY残差时,下游输出是否保持接近干净?答案取决于层和位置。在答案形成附近——最后一个提示位置plastp\_\{\\text\{last\}\}和生成的前两个tokeng1,g2g\_\{1\},g\_\{2\},在早期/中层带——是肯定的;在该区域之外则退化。该模式在Gemma-2和Qwen-2.5指令微调模型以及包含长角色和多样任务的48格网格中均成立。

相同的干预机制揭示了一个明显限制。将缓存的加法预测在plastp\_\{\\text\{last\}\}处替换到基线宿主提示中——移除角色文本——不会接近干净的长角色目标,并且在多层进行限制替换也无帮助。角色对多token生成的贡献分布在整个提示和KV缓存中;局部加法机制只捕捉下一步合成,而不是完整机制。

## 2 相关工作

本文借鉴了四项先前工作方向。

#### 来自对比提示的任务向量和函数向量。

最接近的方法论先例是通过对比提示之间的差异来构建任务表示的工作。上下文学习创建了可以跨提示移植的任务向量[2 (https://arxiv.org/html/2605.23147#bib.bib6)],函数向量将其形式化为平均对比激活差异,因果地驱动任务条件行为[8 (https://arxiv.org/html/2605.23147#bib.bib5)]。我们的ΔX\\Delta\_\{X\}、ΔY\\Delta\_\{Y\}、ΔXY\\Delta\_\{XY\}是残差流中这一构造的类似物,但本文的重点是组合结构(角色和任务如何组合)而非单轴移植。

#### 激活空间引导和表征工程。

激活加性[9 (https://arxiv.org/html/2605.23147#bib.bib2)]及后续的表征工程工作[10 (https://arxiv.org/html/2605.23147#bib.bib3)]表明,激活差异可以在不需要权重优化的前提下引导模型行为。任务算术[4 (https://arxiv.org/html/2605.23147#bib.bib9)]证明微调增量在权重空间中表现为加法。本文在方法上与之相邻但目标不同:我们不提出引导工具,而是使用激活替换来表征角色提示诱导的组合结构。

#### 软提示和前缀微调。

前缀微调[6 (https://arxiv.org/html/2605.23147#bib.bib7)]和提示微调[5 (https://arxiv.org/html/2605.23147#bib.bib8)]表明,一小部分学习到的连续向量前置到提示中可以驱动任务条件行为。我们在第7节(https://arxiv.org/html/2605.23147#S7)中的负面结果对于对我们正面结果最激进的解读具有信息意义:完整的提示到向量替换更接近软提示机制,后者使用多个位置并且是通过学习获得的,而不是通过单次残差计算构造的。

#### 机械编辑和特征解释。

ROME风格的工作[7 (https://arxiv.org/html/2605.23147#bib.bib1)]将事实行为与局部权重空间机制联系起来并展示了外科手术式编辑;后续工作将线性图像扩展到关系解码[3 (https://arxiv.org/html/2605.23147#bib.bib10)]。本文没有达到那种封闭程度。相反,它提供了一个残差流层次的说明,说明角色和任务组合在何处因果上简单到可以用加法近似,以及这个叙述在何处停止。关于单语义性和特征提取的工作[1 (https://arxiv.org/html/2605.23147#bib.bib4)]表明高级行为有时可以分解为可解释的潜在方向;本文不尝试组件层次的本体论,并认为这里首要的对象是局部残差计算,而不是组件目录。

## 3 实验设置

### 3.1 模型

主要模型是google/gemma-2-2b-it,以float32运行。我们使用两个Qwen指令微调模型进行跨模型验证局部化位置结果:Qwen/Qwen2.5-1.5B-Instruct和Qwen/Qwen2.5-3B-Instruct,均以bfloat16运行。选择Qwen模型的bfloat16是负载相关的:在float16下,残差幅度在相关层溢出,分解统计量变为NaN。bfloat16保留了动态范围。所有测量都是对隐藏状态的因果干预实验,而非权重编辑。生成过程完全贪婪(do_sample=False, num_beams=1),以便无需平均采样噪声即可直接比较条件。

### 3.2 提示网格

我们使用两个提示家族。

#### 短网格。

第一个网格包含4个角色和3个任务:

- • 角色:沃伦·巴菲特,卡尔·马克思,尤达,玛雅·安吉罗
- • 任务:关于全民基本收入的政策评论,关于星期一早晨的俳句,书籍推荐

基线角色为*“一个深思熟虑的人”*,基线任务为*“为面临困难决定的人提供建议”*,这产生了12个非基线(X,Y)(X,Y)单元格。

#### 长角色网格。

为了测试更广泛的提示多样性,我们使用8个多句角色和6个任务:

- • 角色:工程师,顾问,创始人,教师,记者,医生,律师,厨师
- • 任务:架构评审,创业启动计划评审,日程提案评审,全民基本收入政策评论,俳句,书籍推荐

这产生了48个非基线(X,Y)(X,Y)单元格。

### 3.3 残差分解

对于每个(X,Y)(X,Y)对,我们构建通常的2×22\\times 2提示集:

BB,XB,BY,XY.BB,\\;XB,\\;BY,\\;XY.在选定的层和序列位置,四个隐藏状态诱导出如上定义的ΔX\\Delta\_\{X\}、ΔY\\Delta\_\{Y\}、ΔXY\\Delta\_\{XY\}和Inter\\mathrm\{Inter\}。

我们报告三类统计量:

- • 方向对齐cos⁡(ΔXY,ΔX+ΔY)\\cos\(\\Delta\_\{XY\},\\Delta\_\{X\}+\\Delta\_\{Y\}\)
- • 子空间重叠cos⁡(ΔX,ΔY)\\cos\(\\Delta\_\{X\},\\Delta\_\{Y\}\)
- • 交互大小∥Inter∥/∥ΔXY∥\\lVert\\mathrm\{Inter\}\\rVert/\\lVert\\Delta\_\{XY\}\\rVert

### 3.4 位置

我们探测三个位置:plastp\_\{\\text\{last\}\}(最后一个提示token)、g1g\_\{1\}(第一个生成token)和g2g\_\{2\}(第二个生成token)。在g1g\_\{1\}和g2g\_\{2\}处,我们教师强制采用干净的XYXY延续,以便条件之间的比较保持位置对齐。

### 3.5 因果度量

在每个探测位置和层,我们将加法预测

hBB+ΔX+ΔYh\_\{BB\}+\\Delta\_\{X\}+\\Delta\_\{Y\}替换为干净的XYXY隐藏状态,并通过10个token的教师强制KL相对于干净XYXY延续来测量下游效应。KL值低意味着加法近似在该位置对于短期下游行为因果充分。

## 4 答案形成附近的局部化加法组合

我们在12格短网格上的三个探测位置——plastp\_\{\\text\{last\}\}、g1g\_\{1\}、g2g\_\{2\}——测量2×22\\times 2分解。表1(https://arxiv.org/html/2605.23147#S4.T1)和图1(https://arxiv.org/html/2605.23147#S4.F1)总结了结果。

该模式在不同位置和模型上一致:一个低KL的早期/中层带,随后平滑退化。在Gemma-2-2B-IT的plastp\_\{\\text\{last\}\}处,中位数因果KL在层6为0.00040.0004,层10为0.0330.033,层14为0.3710.371,层18为1.3711.371。在g1g\_\{1\}处对应的数字为0.0020.002、0.0050.005、0.0490.049;在g2g\_\{2\}处为0.0010.001、0.0130.013、0.0600.060。跨模型图片匹配:在最佳早期层,Qwen-2.5-1.5B在plast/g1/g2p\_\{\\text\{last\}\}/g\_\{1\}/g\_\{2\}的中位数分别为0.030/0.018/0.0140.030/0.018/0.014,Qwen-2.5-3B为0.031/0.021/0.0210.031/0.021/0.021。生成的第一个token在更深网络中保持低KL比plastp\_\{\\text\{last\}\}更远,这与加法组合在提示到答案过渡处最清晰一致。

几何布局也说明了同样的故事。在Gemma-2-2B-IT层14,中位数cos⁡(ΔXY,ΔX+ΔY)\\cos\(\\Delta\_\{XY\},\\Delta\_\{X\}+\\Delta\_\{Y\}\)在plastp\_\{\\text\{last\}\}处为0.8740.874,在g1g\_\{1\}处为0.9350.935,在g2g\_\{2\}处为0.8980.898,而cos⁡(ΔX,ΔY)\\cos\(\\Delta\_\{X\},\\Delta\_\{Y\}\)保持显著更低。ΔX\\Delta\_\{X\}和ΔY\\Delta\_\{Y\}部分可分离;交互项在范数上不可忽视但不会使ΔXY\\Delta\_\{XY\}偏离加法之和。

表1:在12格短网格上加法替换下的中位数因果KL,括号内为第25-75百分位范围。加法机制局限于答案形成附近的小区域,而不是局限于单个提示位置。参见图注图1:在plastp\_\{\\text\{last\}\}(蓝色)、g1g\_\{1\}(橙色)和g2g\_\{2\}(绿色)处加法替换下的中位数因果KL,带有第25-75百分位带状。顶行:Gemma-2-2B-IT和Qwen-2.5-1.5B-Instruct上的12格短网格。底行:相同两个模型上的48格长角色网格。虚线灰色线标记KL=0.1=0.1,是“基本干净”替换的有用参考。局部化加法机制在所有三个位置的低KL早期/中层带可见,在两个模型和两个网格上均存在。因此,加法近似识别了一个区域而非一个点:早期/中层带,位于plastp\_\{\\text\{last\}\}和生成的前两个token处。该区域的边界——特别是它随模型规模和深度的变化——成为本文其余部分的自然研究对象。

## 5 对角色和任务多样性的鲁棒性

12格网格方便但规模小。我们在一个8角色×6任务网格(48格)上重新运行相同的局部化分析,该网格包含多句角色(工程师、顾问、创始人、教师、记者、医生、律师、厨师)以及评审、规划、政策、创意和推荐任务的混合(附录A(https://arxiv.org/html/2605.23147#A1))。

局部化加法机制持续存在(表2(https://arxiv.org/html/2605.23147#S5.T2);图1(https://arxiv.org/html/2605.23147#S4.F1)底行)。在Gemma-2-2B-IT上,层14的中位数因果KL在plastp\_\{\\text\{last\}\}处为0.2290.229,g1g\_\{1\}处为0.0560.056,g2g\_\{2\}处为0.0560.056;对应的余弦cos⁡(ΔXY,ΔX+ΔY)\\cos\(\\Delta\_\{XY\},\\Delta\_\{X\}+\\Delta\_\{Y\}\)在plastp\_\{\\text\{last\}\}和g1g\_\{1\}处分别为0.8180.818和0.8750.875,而cos⁡(ΔX,ΔY)\\cos\(\\Delta\_\{X\},\\Delta\_\{Y\}\)保持显著更低(0.1710.171,0.2340.234),排除了平凡共线性的可能。在Qwen-2.5-1.5B的早期层7,中位数分别为0.030/0.018/0.0140.030/0.018/0.014,余弦为0.8620.862和0.9360.936。定量上,长角色数字大于短网格数字——多句角色在残差中推入更多——但定性形状不变。

表2:在48格长角色网格上的中位数因果KL,括号内为第25-75百分位范围。在更广泛的角色和任务多样性下,局部化加法机制仍然可见。#### 每单元格细分。

该效果并非在所有单元格中均匀,但也不是由少数简单单元格驱动。在Gemma-2-2B-IT上,plastp\_\{\\text\{last\}\}处层14的每个角色中位数KL范围从0.140.14到0.390.39,对于大多数角色,少数单元格在尾部异常;在Qwen-1.5B-Instruct上,层7的角色中位数更紧密,大多在0.020.02–0.0350.035。在Gemma上,每个任务的中位数在所有六个任务族中保持低到中等,而不是集中在一个任务上。

## 6 加法替换的行为验证

教师强制分布之间的KL是一个有用但间接的度量,用于判断加法替换是否保留了角色调节的行为。角色提示应该改变模型谈论的*内容*,而不仅仅是接下来几个token的局部概率。因此,我们通过一个行为标记测试来补充第4节(https://arxiv.org/html/2605.23147#S4)和第5节(https://arxiv.org/html/2605.23147#S5)的KL证据,该测试直接评分角色特定的输出内容,类似于事实回忆验证的风格[7 (https://arxiv.org/html/2605.23147#bib.bib1),8 (https://arxiv.org/html/2605.23147#bib.bib5)]。

### 6.1 协议

对于8个长形式角色中的每一个,我们从角色描述本身*先验地*定义一小套角色特定的表层标记。例如,工程师角色与标记关联,包括SPOF、单点故障、可扩展性、可靠性、冗余;顾问角色与标记关联,包括感到被倾听、验证、同情;医生角色与鉴别诊断、症状、排除关联。完整标记集

相似文章

PersonaVLM:长期个性化多模态大语言模型

Hugging Face Daily Papers

PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。