LOCUS: 面向令牌高效语言生成的任务感知低秩后训练
摘要
LOCUS是一种任务感知低秩后训练方法,可在保持偏好对齐的同时减少语言模型的输出令牌长度,在Pythia-2.8B上实现高达39.84%的减少,且仅需最少的参数更新。
arXiv:2609.11739v1 公告类型:新
摘要: 大语言模型的推理成本与输出序列长度成正比,然而,标准的偏好对齐往往会增加回答的冗长性而不提升实用性。我们研究了后训练更新的参数化是否影响生成长度:低秩子空间可以在不改变对齐损失的情况下改变序列长度。我们提出LOCUS,一种选择任务感知低秩适应子空间以在满足实用性约束下最小化输出令牌成本的方法。在此子空间内,后训练在冻结骨干网络的同时保留原始的偏好目标。在Anthropic HH-RLHF对话偏好上,我们评估了两个$\sim$3B解码器骨干网络Pythia-2.8B和Qwen2.5-3B,与协议匹配的全参数DPO和DrDPO分支以及发布的SamPO检查点进行对比。LOCUS在Pythia-2.8B上将续写长度减少高达39.84%,在Qwen2.5-3B上减少14.87--17.58%,同时仅更新0.24--0.28%的模型参数,内部偏好诊断无实质性变化。
查看缓存全文
缓存时间: 2026/09/11 08:34
# LOCUS:面向任务的低秩后训练实现令牌高效语言生成
来源:https://arxiv.org/html/2609.11739
###### 摘要
大语言模型的服务成本直接随输出序列长度增长,而标准的偏好对齐常会增加回复的冗长性,却未提升实用性。我们研究了后训练更新的参数化方式是否会影响生成长度:低秩子空间可在不改变对齐损失的情况下改变序列长度。本文提出LOCUS方法,该方法选择一个面向任务的低秩适配子空间,以在实用性约束下最小化输出令牌成本。在该子空间内,后训练保留原始的偏好目标,且骨干网络保持冻结。基于Anthropic HH-RLHF对话偏好数据集,我们评估了两个约3B参数的解码器骨干网络Pythia-2.8B和Qwen2.5-3B,对比了参数匹配的全参数DPO和DrDPO分支以及已发布的SamPO检查点。LOCUS在Pythia-2.8B上将续写长度缩减最多达39.84%,在Qwen2.5-3B上缩减14.87–17.58%,同时仅更新0.24–0.28%的模型参数,且内部偏好诊断指标无显著变化。
## 1 引言
服务大语言模型需要大量的计算和内存资源,单次请求的延迟和服务成本由自回归生成的输出令牌数量决定(Pope等,2023 (https://arxiv.org/html/2609.11739#bib.bib31);Kwon等,2023 (https://arxiv.org/html/2609.11739#bib.bib33))。在生产环境中,每个额外解码的令牌都需要通过整个模型深度进行迭代前向传播,消耗内存带宽并扩大键值缓存存储(Leviathan等,2023 (https://arxiv.org/html/2609.11739#bib.bib30);Dao等,2022 (https://arxiv.org/html/2609.11739#bib.bib32))。因此,生成过于冗长的回复会直接降低运营吞吐量并增加部署成本。开发能在保持严格答案质量的同时生成简洁回复的技术,是实际语言模型服务的核心目标。
后训练偏好对齐方法使模型与人类价值观对齐(Ouyang等,2022 (https://arxiv.org/html/2609.11739#bib.bib8);Rafailov等,2023 (https://arxiv.org/html/2609.11739#bib.bib1))。直接偏好优化(DPO)(Rafailov等,2023 (https://arxiv.org/html/2609.11739#bib.bib1))、分布鲁棒DPO(DrDPO)(Wu等,2025 (https://arxiv.org/html/2609.11739#bib.bib2))和下采样散度方法(Lu等,2024 (https://arxiv.org/html/2609.11739#bib.bib3))等算法成功地将模型输出引向偏好行为。然而,当针对所有骨干参数进行优化时,这些目标常出现冗长偏见,即模型学会认为更长的回复与更高的偏好分数相关(Singhal等,2024 (https://arxiv.org/html/2609.11739#bib.bib12);Saito等,2023 (https://arxiv.org/html/2609.11739#bib.bib14);Park等,2024 (https://arxiv.org/html/2609.11739#bib.bib4))。这些观察促使我们研究:在目标不变的情况下,偏好更新的参数化是否会影响生成长度。
先前试图缩减输出长度的方法通常引入临时正则化器或提示修改,但这些干预措施存在明显缺陷。应用启发式长度惩罚或负长度奖励的方法可能扭曲底层偏好公式,导致生成过早终止或回复质量下降(Li等,2026 (https://arxiv.org/html/2609.11739#bib.bib5))。同样,通过提示让模型保持简洁依赖于脆弱的指令遵循能力,在分布偏移时性能会下降(Zhou等,2023 (https://arxiv.org/html/2609.11739#bib.bib34))。这些方法修改了学习目标或推理接口,留下更新参数化对输出长度影响的空白待研究。
我们针对此问题的洞察是:后训练更新的参数化可能影响输出长度动态——低秩适配子空间可以在不改变对齐目标的情况下改变序列长度。低秩适配(LoRA)(Hu等,2022 (https://arxiv.org/html/2609.11739#bib.bib15))将可训练更新限制在分解矩阵中,使更新子空间成为研究生成长度的具体变量。通过冻结预训练骨干并将参数更新限制在结构化的低秩轨迹中,模型在原始偏好损失下会达到一个实质不同的质量-令牌操作点。
本文将上述洞察转化为一种后训练方法,即用于简洁效用保持序列的长度优化(LOCUS)。LOCUS在开发数据上选择一个面向任务的低秩适配子空间,以在效用约束下最小化输出令牌成本。在每个候选子空间内,适配使用原始的后训练目标且骨干保持冻结。LOCUS保持底层损失公式不变:不添加原始目标已指定之外的长度归一化、无显式令牌惩罚、无简洁性提示。目标固定后,LOCUS将低秩子空间配置(包括适配器秩、模块放置、层范围和训练检查点步数)作为结构化设计变量。
图1 (https://arxiv.org/html/2609.11739#S1.F1)总结了LOCUS在Anthropic Helpful and Harmless (HH)基准(Bai等,2022 (https://arxiv.org/html/2609.11739#bib.bib11))上使用Pythia-2.8B(Biderman等,2023 (https://arxiv.org/html/2609.11739#bib.bib24))针对三类偏好优化目标的主要实证结果。在Pythia-2.8B上的三次HH比较中,LOCUS分别在DPO、DrDPO和SamPO下将续写令牌数减少了20.73%、25.29%和39.84%,准确度变化可忽略不计(≤0.13个百分点),仅更新0.28%的参数。此外,在Qwen2.5-3B(Yang等,2024 (https://arxiv.org/html/2609.11739#bib.bib26))上进行的受控DPO和DrDPO比较显示,在0.24%的可训练参数下,令牌数分别减少了14.87%和17.58%。
图1:Pythia-2.8B上的令牌与准确度总结。
本文的主要贡献总结如下:
- • 我们将令牌高效的偏好后训练表述为一个面向任务的低秩子空间选择问题,该问题服从显式的效用约束。该表述保留了原始的对齐目标;第3节 (https://arxiv.org/html/2609.11739#S3)定义了该问题及选择流程。
- • 我们分析了可训练参数数量以及未合并与合并低秩更新在推理时的精确等价性。第4节 (https://arxiv.org/html/2609.11739#S4)给出了命题、证明和参数统计。
- • 我们在两个约3B参数的解码器骨干网络Pythia-2.8B和Qwen2.5-3B上,使用Anthropic HH-RLHF对话偏好数据集评估了LOCUS,并与参数匹配的全参数DPO和DrDPO分支以及已发布的SamPO检查点进行对比。参数匹配的分支在Pythia-2.8B和Qwen2.5-3B上分别实现了25.29%和17.58%的DrDPO缩减,而持续的SamPO适配实现了39.84%的缩减,使用的可训练子空间很小;完整的协议和结果见第5节 (https://arxiv.org/html/2609.11739#S5)。
## 2 相关工作
#### 偏好优化与对齐。
偏好对齐技术利用成对比较数据训练语言模型以与人类偏好对齐。基于人类反馈的强化学习(RLHF)(Christiano等,2017 (https://arxiv.org/html/2609.11739#bib.bib10);Stiennon等,2020 (https://arxiv.org/html/2609.11739#bib.bib9);Ouyang等,2022 (https://arxiv.org/html/2609.11739#bib.bib8))使用策略梯度技术优化奖励模型。直接偏好优化(DPO)(Rafailov等,2023 (https://arxiv.org/html/2609.11739#bib.bib1))通过推导出将奖励函数代入策略目标的封闭形式解,消除了单独的奖励建模阶段。后续方法通过替代目标扩展了直接偏好优化。例如,IPO(Azar等,2024 (https://arxiv.org/html/2609.11739#bib.bib6))引入了正则化线性损失,而KTO(Ethayarajh等,2024 (https://arxiv.org/html/2609.11739#bib.bib7))则模拟前景理论。DrDPO(Wu等,2025 (https://arxiv.org/html/2609.11739#bib.bib2))解决了参考分布偏移问题。先前的方法在全参数空间优化目标或修改损失公式;LOCUS则保留了原始的偏好损失,仅改变优化子空间。
#### 长度偏见与输出简洁性。
通过对齐偏好优化的语言模型常会发展出严重的长度偏见,生成不必要的冗长回复以最大化奖励(Singhal等,2024 (https://arxiv.org/html/2609.11739#bib.bib12);Saito等,2023 (https://arxiv.org/html/2609.11739#bib.bib14);Dubois等,2023 (https://arxiv.org/html/2609.11739#bib.bib13))。多项研究调查了这一现象:LR-DPO(Park等,2024 (https://arxiv.org/html/2609.11739#bib.bib4))通过分数调整将长度与质量解耦,而SamPO(Lu等,2024 (https://arxiv.org/html/2609.11739#bib.bib3))通过下采样参考序列长度来减少长度依赖性。GR3(Li等,2026 (https://arxiv.org/html/2609.11739#bib.bib5))在强化学习中应用分组相对奖励重缩放以缓解长度膨胀。先前方法引入临时的长度正则化项或启发式提示,扭曲了目标偏好分布,而LOCUS通过子空间参数化在不改变底层目标的情况下实现了令牌高效。
#### 参数高效微调。
参数高效微调(PEFT)通过更新一小部分参数而冻结基础权重来适配大语言模型。主要方法包括适配器插入(Houlsby等,2019 (https://arxiv.org/html/2609.11739#bib.bib19))、前缀调优(Li和Liang,2021 (https://arxiv.org/html/2609.11739#bib.bib17))、提示调优(Lester等,2021 (https://arxiv.org/html/2609.11739#bib.bib18))和低秩适配(Hu等,2022 (https://arxiv.org/html/2609.11739#bib.bib15))。近期工作通过量化(Dettmers等,2023 (https://arxiv.org/html/2609.11739#bib.bib16))、权重分解(Liu等,2024 (https://arxiv.org/html/2609.11739#bib.bib20))和自适应秩分配(Zhang等,2023 (https://arxiv.org/html/2609.11739#bib.bib21))扩展了低秩调优。理论研究证实语言模型适配具有低本征维度,表明过参数化的更新对于任务学习是冗余的(Aghajanyan等,2021 (https://arxiv.org/html/2609.11739#bib.bib22);Sharma等,2024 (https://arxiv.org/html/2609.11739#bib.bib23))。传统参数高效调优仅将低秩适配视为全量微调的资源节约型近似;相反,LOCUS将适配子空间视为帕累托设计变量,以在保持任务效用的同时控制生成长度。
## 3 方法
图2 (https://arxiv.org/html/2609.11739#S3.F2)将LOCUS流程总结为三个阶段。首先,LOCUS在选定的模块上附加低秩适配器。预训练骨干保持冻结,这将参数更新限制在这些适配器内。然后使用原始偏好目标训练这些适配器,使实验能够检验更新参数化是否在未添加长度惩罚或改变损失的情况下改变了生成长度。其次,LOCUS训练一小批候选适配器,它们在秩、目标模块、目标层或训练步数上有所不同。它在开发数据上评估每个候选适配器,并选择在效用差异允许范围内最短的一个。当有确认集时,选定的适配器在进行留出测试评估前必须通过该检查。最后,LOCUS为选定的适配器准备推理。适配器可以合并到骨干中用于单一部署,或者在单个骨干服务多个任务适配器时保持分离。
图2 (https://arxiv.org/html/2609.11739#S3.F2)中使用的正式符号,以及原始的DPO和DrDPO目标,在3.1节中定义。
图2:从原始目标训练到选定低秩部署的LOCUS流程。
算法1:LOCUS子空间选择
1: 基础损失$\mathcal{L}_{\mathrm{base}}$,初始权重$W_{0}$,训练集$\mathcal{D}_{t}^{\mathrm{train}}$,选择集$\mathcal{D}_{t}^{\mathrm{sel}}$,确认集$\mathcal{D}_{t}^{\mathrm{conf}}$,效用阈值$\epsilon_{t}$,候选适配器集合$\mathcal{C}$
2: 选定的适配器$c^{*}$和策略$\pi_{c^{*}}$
3: 基线效用$Q_{t}^{\mathrm{base}} \leftarrow \mathrm{EvalUtility}(\pi_{\mathrm{base}}, \mathcal{D}_{t}^{\mathrm{sel}})$
4: 对于每个$c \in \mathcal{C}$执行
5: $\Delta W_{c} \leftarrow \mathrm{Train}(\mathcal{L}_{\mathrm{base}}, W_{0}, \mathcal{D}_{t}^{\mathrm{train}}, c)$
6: $(T_{t}(c), Q_{t}(c)) \leftarrow \mathrm{Eval}(\pi_{c}, \mathcal{D}_{t}^{\mathrm{sel}})$
7: 结束循环
8: 可行集$\mathcal{C}_{\mathrm{feas}} \leftarrow \{c \in \mathcal{C} \mid Q_{t}(c) \geq Q_{t}^{\mathrm{base}} - \epsilon_{t}\}$
9: $c^{*} \leftarrow \arg\min_{c \in \mathcal{C}_{\mathrm{feas}}} T_{t}(c)$
10: 如果存在确认集$\mathcal{D}_{t}^{\mathrm{conf}}$
11: $(T_{\mathrm{conf}}, Q_{\mathrm{conf}}) \leftarrow \mathrm{Eval}(\pi_{c^{*}}, \mathcal{D}_{t}^{\mathrm{conf}})$
12: 基线确认效用$Q_{\mathrm{conf}}^{\mathrm{base}} \leftarrow \mathrm{EvalUtility}(\pi_{\mathrm{base}}, \mathcal{D}_{t}^{\mathrm{conf}})$
13: 基线确认长度$T_{\mathrm{conf}}^{\mathrm{base}} \leftarrow \mathrm{EvalLength}(\pi_{\mathrm{base}}, \mathcal{D}_{t}^{\mathrm{conf}})$
14: $u \leftarrow [Q_{\mathrm{conf}} \geq Q_{\mathrm{conf}}^{\mathrm{base}} - \epsilon_{t}]$
15: $l \leftarrow [T_{\mathrm{conf}} \leq T_{\mathrm{conf}}^{\mathrm{base}}]$
16: 如果$\neg (u \land l)$则拒绝$c^{*}$
17: 返回$c^{*}$,$\pi_{c^{*}}$
### 3.1 原始目标
设$\pi_{\theta}$为参数为$\theta$的策略,$\pi_{\mathrm{ref}}$为参考策略。对于偏好数据集$\mathcal{D}$,其中每个样本$(x, y_w, y_l)$包含提示$x$、优选回复$y_w$和劣选回复$y_l$。
直接偏好优化(DPO)(Rafailov等,2023 (https://arxiv.org/html/2609.11739#bib.bib1))的目标定义为:
$\mathcal{L}_{\mathrm{DPO}}(\theta) = -\mathbb{E}_{(x,y_w,y_l) \sim \mathcal{D}} \left[ \log \sigma \left( \beta \log \frac{\pi_{\theta}(y_w|x)}{\pi_{\mathrm{ref}}(y_w|x)} - \beta \log \frac{\pi_{\theta}(y_l|x)}{\pi_{\mathrm{ref}}(y_l|x)} \right) \right]$, (1)
其中$\beta > 0$控制从参考策略$\pi_{\mathrm{ref}}$发散的惩罚,$\sigma$表示sigmoid函数。
在分布鲁棒DPO(Wu等,2025 (https://arxiv.org/html/2609.11739#bib.bib2))中,目标针对样本级参考发散进行鲁棒化:
$\mathcal{L}_{\mathrm{DrDPO}}(\theta) = -\beta' \log \left( \frac{1}{B} \sum_{i=1}^{B} e^{-\ell_i(\theta)/\beta'} \right)$, (2)
其中$\ell_i(\theta)$表示微批次$B$中第$i$个样本的单独成对损失,$\beta'$控制分布鲁棒性。
在LOCUS中,我们严格保留原始目标$\mathcal{L}_{\mathrm{base}}$。我们通过公式(3) (https://arxiv.org/html/2609.11739#S3.E3)中的LoRA参数化限制可训练更新:
$W = W_0 + \Delta W = W_0 + \frac{\alpha}{r} BA$, (3)
其中$A \in \mathbb{R}^{r \times d_{2}} \sim \mathcal{N}(0, \sigma^{2})$,$B \in \mathbb{R}^{d_{1} \times r}$为零。相似文章
TALAN:面向大语言模型定向后训练的任务对齐潜在自适应网络
TALAN 引入了一种序列条件潜在侧路径,用于大语言模型的定向后训练,在 STEM/代码基准上以最小的开销实现了显著改进。
Hybrid-LoRA:桥接全微调与低秩适应的后训练方法
Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。
通过ℓp正则化在大语言模型中实现低秩适应的自动秩分配
本文介绍了一种基于ℓp正则化的自动秩分配方法ℓp-LoRA,该方法用于低秩适应,并在自然语言处理任务上展示了具有竞争力的性能。
LazyTrain:大语言模型训练中面向零浪费产出优化的有限资源分配
LazyTrain 是一个研究系统,通过将检查点选择、激活放置、重计算以及 CPU-GPU-NVMe 通信重叠建模为混合整数调度问题,优化有限硬件上的大语言模型训练,相比匹配基线实现了约 1.24 倍的 TFLOPS 提升。
通过令牌剪枝优化韩语中心的大语言模型
本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。