语言模型的更好起点:领域条件位置偏移

arXiv cs.LG 论文

摘要

本文介绍了领域条件位置偏移,这是一种添加到初始token嵌入中的学习向量,用于减少语言模型中的冷启动惩罚。该方法只需在少量文档上训练几分钟,无需更改模型权重,并且在多种模型规模上实现了高达27%的困惑度降低。

arXiv:2607.18302v1 公告类型:新论文 摘要:自回归语言模型在序列开头处准确性最低,因为此时上下文极少,模型不得不依赖通用的预训练先验。我们证明这种冷启动惩罚与领域相关,并通过领域条件位置偏移来降低它:这是一种在序列起始位置添加到嵌入激活中的单一学习向量,而所有模型权重保持不变。该偏移量在大约一百份文档上训练几分钟即可完成,可在领域间切换而无需添加序列状态,且没有可测量的延迟开销。在参数范围从4.1亿到80亿的八个Mamba、GPT-NeoX和Llama模型上,它将保留的域内困惑度降低了高达27%;该效果在700亿参数模型上依然存在,且仅一个位置就带来了大部分收益。一个匹配且收敛的直接logit偏置校正最多仅达到7.9%,且不影响后续token的损失,这表明偏移量是通过模型状态传播的,而不仅仅是重新校准输出先验。经过调优的LoRA可以达到更低的困惑度,但使用的参数数量多出两到三个数量级,并且需要一条活跃的低秩权重路径,而软提示则增加了序列位置。通过错误领域控制,当决策依赖于早期域内token时,偏移量改进了检索重排序和领域分类;对于信号出现在后期的少样本推理,结果保持不变。位置感知的预填充应用也有助于生成任务,而在每个缓存解码步骤中的简单应用会导致重复。因此,偏移量并不是最强的适配器,而是一种轻量级、可热切换的工具,适用于短距离域内评分和校准。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:18

# 语言模型更好的起点:领域条件位置偏移
来源:https://arxiv.org/html/2607.18302

###### 摘要

自回归语言模型在序列开头时准确性最低,因为上下文几乎为零,导致模型不得不依赖通用的预训练先验。我们表明这种冷启动惩罚具有领域依赖性,并通过领域条件位置偏移来减少它:一个在首个序列位置添加到嵌入激活上的单一学习向量,而所有模型权重保持不变。该偏移量可在大约一百份文档上训练数分钟完成,可在不增加序列状态的情况下在领域间切换,且几乎没有可测量的延迟开销。在涵盖 410M 到 8B 参数的八个 Mamba、GPT-NeoX 和 Llama 模型上,它使保留测试集上的领域内困惑度降低了高达 27%;该效果在 70B 模型上仍然存在,且单个位置就捕获了大部分收益。匹配的、收敛的直接 logit 偏置校正最多只能达到 7.9%,并且不改变后续 token 的损失,这表明该偏移量是通过模型状态传播的,而不仅仅是重新校准输出先验。调优后的 LoRA 可以达到更低的困惑度,但使用的参数多出两到三个数量级,并且需要一个活跃的低秩权重路径,而软提示则增加了序列位置。通过错误领域对照实验,偏移量在检索重排序和领域分类中有所改善,这些任务依赖于早期的领域内 token;而对于信号出现在后期的小样本推理,结果保持不变。基于位置感知的预填充应用也有助于生成任务,而在每个缓存的解码步骤中简单应用则会导致重复。因此,该偏移量并非最强的适配器,而是一种轻量级、可热切换的工具,用于短文本的领域内评分和校准。

## 引言

每个自回归语言模型在序列开始时都面临同样的困难:它必须在几乎没有上下文的情况下生成下一个 token 的分布,并且通过回退到预训练期间形成的隐式先验来实现这一点。由于该先验是整个预训练语料库的平均值,它很少能与任何特定领域良好匹配,其后果是可测量的冷启动惩罚:早期位置的预测比同一序列中后期(一旦积累了足够的上下文)的预测差得多。这种惩罚不仅仅是语言建模中的一个有趣现象。它在每个序列的开头都会发生,因此在模型处理大量短输入而非一个长输入的场景中会累积加剧,例如检索流水线、分类服务以及多智能体系统——每个智能体调用都从冷启动开始(Wu 等人,2023;Hong 等人,2024)。

自然的补救措施在为快速、按领域专门化时会产生成本。全微调会修改模型权重,而 LoRA 引入了低秩权重更新并需要适配器感知的服务,尽管 LoRA 适配器本身可以切换。提示和前缀微调会预置学习到的 token,这些 token 会消耗上下文位置,并且在 transformer 中会增加键值状态;正如我们确认的那样,一个普通的系统提示往往会将基础模型移出其预训练分布,并造成伤害而非帮助。我们探究一个更小的干预措施是否能够在无需添加序列位置或权重空间适配器的情况下捕获大部分可用收益。

我们研究领域条件位置偏移:一个单一的学习向量,大小约为几千个参数,被添加到序列前几个位置的 token 嵌入中。该向量通过在一个小样本的领域文本上最小化普通语言建模损失来训练,同时所有模型权重保持冻结。在推理时,它通过一个前向钩子应用,因此切换领域只改变一个小的张量,不增加序列状态,并且在我们基准测试中几乎没有可测量的延迟。一个小的学习提示可以降低语言模型的领域内困惑度这一点已知(Dingliwal 等人,2021);我们的目标不是重新确认几个参数就足够了,而是要精确描述这个干预措施能带来什么和不能带来什么。我们将该效果解释为早期位置现象,将其实现为一种不添加 token 的位置校正,因此甚至可以适用于没有可调起始 token 的模型,并映射其收益在何处迁移。冷启动效应及其校正跨架构和规模都能清晰地复现,并且单个位置承担了大部分收益,这支持了该方法的吸引力。同时,精心调优的 LoRA 比偏移量达到更低的困惑度,因此其贡献在于效率而非主导性,偏移量的价值在于其成本特性:近乎零参数、无权重修改、无额外序列位置。然后我们将分析推进到困惑度之外,因为更低的损失只有在能改变决策时才有用。通过使用一个如果在效果真正是领域先验的情况下就不应有所帮助的错误领域对照组,我们发现偏移量改善了检索重排序和领域分类——这两者都依赖于早期的领域内 token——同时保持了小样本任务准确性,其答案 token 位于偏移量触及范围后很远的位置。最后,当正确应用时,偏移量也改善了生成任务:在每个缓存的解码步骤触发的钩子会使文本退化为重复,而将偏移量限制在真正的早期位置则能保留生成质量。

综上所述,我们的贡献包括:对跨三个架构家族和广泛规模范围的领域依赖性冷启动惩罚及其通过单一向量的校正进行了仔细刻画;我们将我们的方法与替代方案进行比较,包括 LoRA 适配、微调起始 token 嵌入和单 token 软提示,这些方案隔离出了我们这里的新内容——一种不需要专用起始 token、不添加额外 token 且没有可测量延迟的位置校正;针对调优后的 LoRA 和学习到的软前缀进行了受控的效率比较,将偏移量定位为成本与收益之间的最佳权衡,而非最低困惑度;一组带有特异性控制的下游结果,包括一个标准分类基准;以及一项机制分析,除其他外表明,该校正减少了 transformer 对其注意力汇聚点的依赖。

## 相关工作

参数高效适配方法降低了专门化模型的成本,但修改了偏移量保持不变的部分。LoRA 向权重矩阵注入可训练的低秩更新,适配器在层间插入瓶颈模块;两者都用远少于全微调的参数进行有效适配,并且可以切换,但需要适配器感知的服务和活跃的权重空间模块。提示微调(Lester, Al-Rfou, and Constant, 2021)和前缀微调(Li and Liang, 2021)学习连续向量,这些向量被预先添加到输入中,这会消耗上下文位置,并且在 transformer 的解码过程中增加键值状态。这种机制已直接应用于语言模型领域适配,其中少量预先添加的领域 token 嵌入将领域内困惑度降低到与全微调相当的程度(Dingliwal 等人,2021),我们自己的软提示基线也复现了这个效果。相关的上下文校准工作纠正了来自无内容输入的标签先验偏差(Zhao 等人,2021);我们的设置则是为普通的语言模型评分学习一个领域先验,并通过序列位置来定位其效果。因此,小学习提示或校准先验的效率本身并不是新的;我们的贡献在于识别出这种校正所针对的早期位置冷启动惩罚,并表明修复措施根本不需要添加 token。我们的偏移量与预先添加的提示在两个轴向上都不同:它修改前几个位置的嵌入激活,而不是延长输入序列,因此不增加上下文位置或 transformer 键值状态;并且因为它针对的是位置而非专用的起始 token,所以它适用于诸如 Mamba 等没有可调起始 token 的循环模型。我们将精心调优的 LoRA 和学习到的软前缀作为评判偏移量的参考点,并与适当调优的基线(而非调优不足的基线)进行比较。

第二项工作涉及最早 token 的特殊作用。注意力汇聚点现象表明,transformer 将大量注意力分配给了第一个 token,并且保留它对稳定的长上下文和流式行为至关重要(Xiao 等人,2024);类似地,视觉 transformer 受益于吸收全局信息的专用寄存器 token(Darcet 等人,2024)。我们的方法可以解读为使最早的位置携带学习到的、领域特定的信号,而非通用信号,这将冷启动惩罚与这一更广泛观察联系起来,即位置零具有异常大的影响力。状态空间模型(Gu and Dao, 2023;Dao and Gu, 2024)使这一点更加尖锐,因为它们的循环计算将初始状态贯穿到每一个后续步骤,我们确实发现它们比同等规模的 transformer 获益更多。

最后,我们强调的下游场景是评分而非开放式生成。检索增强流水线(Lewis 等人,2020)和推测解码(Leviathan, Kalman, and Matias, 2023)都依赖于模型为短候选延续分配准确的似然度,而这正是序列开始处的领域内校准可能有所帮助的地方。持续预训练(Gururangan 等人,2020)仍然是深度领域适配的黄金标准,但对于我们目标中的快速、可热切换专门化来说成本过高,而我们的偏移量是对其的补充。

## 方法

### 冷启动瓶颈

考虑一个嵌入维度为 d 的自回归模型。给定 tokens x_1, ..., x_T,令 e_t = Embed(x_t),并令 p_t 表示任何架构特定的位置贡献,对于诸如 Mamba 等通过循环而非显式位置项编码顺序的架构,p_t = 0。馈送到第一个块的表示是 h_t^(0) = e_t + p_t。在 t=1 时,模型必须仅从第一个观察到的 token 预测 x_2,或者当分词器插入一个专用起始 token 时,因此该预测的质量取决于 h_1^(0) 作为目标领域先验的效果。我们假设预训练安装了一个通用的先验,即所有领域的平均值,这对于任何特定领域都是次优的。测量每个位置的交叉熵确认了一个显著且依赖于领域的冷启动效应(图1):前几个内容位置的损失比位置 64 处的损失高出数倍,并且差距的大小因领域而异,Wikipedia 显示出最强的惩罚,这与它相对于预训练混合的高词汇特异性一致。

参见图 1 的说明:Mamba-2.8B 上每个位置的交叉熵,有和没有领域偏移量,针对三个领域。损失在开头位置很高并随着上下文的积累而衰减;偏移量在早期区域降低损失,并且该收益通过模型的循环计算级联到后面的位置。

### 领域条件位置偏移

我们学习一个领域特定的偏移量 δ_D ∈ R^{K×d},它被添加到前 K 个位置的嵌入激活中,

h̃_t^(0) = h_t^(0) + δ_D[t], t = 1, ..., K, (1)

而位置 t > K 保持不变。实际上,单个位置 (K=1,一个维度为 d 的向量) 捕获了大部分收益,而 K 在 3 到 5 之间增加很少。对于一个 2.8B 模型,d=2560,偏移量在 2,560 到 12,800 个参数之间,大约是基础模型的 10^{-6}。它通过嵌入层上的一个前向钩子应用,没有架构变化,也没有自定义内核,因此最简单的说法是,钩子执行 h̃[:, :K, :] += δ_D。

### 训练与应用

给定来自领域 D 的 N 个文档,我们针对 δ_D 单独最小化标准语言建模目标,

L(δ_D) = -∑_{x∈B} ∑_{t} log p_θ(x_{t+1} | h̃_1, ..., h̃_t) + λ||δ_D||_2^2, (2)

并采用轻微的 L2 惩罚 λ=0.01。所有权重 θ 保持冻结,梯度仅到达 K×d 偏移量参数。我们使用学习率为 10^{-3} 的 Adam,序列最多 512 个 token,训练三个 epoch,训练在单 GPU 上远低于三分钟即可完成。两个特性使其鲁棒。参数空间的极低维度起到了强隐式正则化的作用,并且由于偏移量通过模型自身的计算塑造每个后续位置,它接收到的梯度信号会聚合整个序列,尽管该向量仅应用于前 K 个位置。

部署偏移量时有一个细微之处需要注意。当它用于评分现有文本,或在生成的提示处理(预填充)阶段时,偏移量正确地落在真正的早期位置上。然而,在缓存的逐自回归解码过程中,每个步骤都是一个长度为 1 的前向传播,因此一个简单的钩子会将 δ_D[0] 添加到每个新生成的 token 上,就好像它是位置零一样。因此,我们按绝对位置应用偏移量,仅当绝对位置 p < K 时才添加 δ_D[p],这将其限制在预填充区域,并使普通解码不受影响。

算法 1 领域条件偏移量
1. 训练(每个领域一次,3 分钟以内):初始化 δ_D ← 0;对于三个 epoch,对于每个文档,应用 h̃_{1:K} ← h_{1:K} + δ_D,计算 L(式 2)并用 Adam 更新 δ_D。
2. 应用(无额外开销):注册一个钩子,在绝对位置 p < K 处添加 δ_D[p];正常运行前向传播。

## 实验

我们评估了八个公开

相似文章

参数对齐缓解多语言专家语言模型中的灾难性遗忘

arXiv cs.CL

本文研究了持续预训练过程中多语言专家语言模型面临的灾难性遗忘问题,并提出了五种参数对齐策略(硬层冻结、软正则化、事后权重还原和模型合并),以在32种训练语言中最小化语言习得成本的同时减轻遗忘。

分散损失抵消小型语言模型中的嵌入凝聚

Hacker News Top

本文观察到小型语言模型中的词元嵌入会凝聚成一个狭窄的锥形子空间,这种现象称为嵌入凝聚,并提出一种分散损失来抵消它,从而改善泛化能力。

随机分词法提高模型鲁棒性

arXiv cs.CL

本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。

揭秘数据受限语言模型预训练中的训练时数据增强

Hugging Face Daily Papers

本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。