偏好微调作为频谱更新重组

arXiv cs.CL 论文

摘要

该论文揭示,基于偏好的后训练会诱导出具有频谱头-尾组织的参数更新,其中紧凑的头部承载主要的行为偏移,而微弱的尾部对于完整解恢复是必要的,从而将对齐重新定义为结构化的更新重组,而非单一的整体修正。

arXiv:2607.20438v1 Announce Type: new Abstract: 基于偏好的后训练通常通过端点行为来理解,但产生这种行为的学习更新在很大程度上仍然不透明。我们通过分析RLHF及相关偏好优化所诱导的参数更新的频谱结构来研究它们。通过分解有效的LoRA更新并将其频谱组件作为插件模块重新加载,我们将偏好诱导的更新转化为可隔离、可重组且可直接干预的对象。跨模型家族、优化算法和监督机制,这些更新始终发展出频谱头-尾组织。一个紧凑的头部早期出现并承载主要的端点偏移,而一个异质的残余尾部则保留下来。这种划分是功能性的,而不仅仅是描述性的。插件干预表明,头部解释了与基础模型的可见行为偏差,而尾部在孤立时很弱。跨运行重组进一步表明,混合适配器跟随头部的来源,表明头部承载了运行层面的求解器偏差。这种端点主导性并不意味着学习充分性。仅使用头部学习并非空洞,但未能恢复完整解,尤其是在分布外行为上。仅使用尾部学习几乎没有可见的增益,但如果没有尾部,则无法恢复完整解。这些发现将偏好后训练重新视为结构化的更新重组,而非单一的行为修正,并表明对齐增益和覆盖损失与学习更新本身的组织方式相关。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:15

# 偏好微调即谱更新重组
来源: https://arxiv.org/html/2607.20438
Haibo Jin 伊利诺伊大学厄巴纳-香槟分校
Liying Kang 香港理工大学
Haohan Wang 伊利诺伊大学厄巴纳-香槟分校

###### 摘要

基于偏好的后训练通常通过端点行为来理解,但产生这种行为的学习更新在很大程度上仍然是不透明的。我们通过其诱导参数更新的谱结构来研究 RLHF 及相关的偏好优化。通过分解有效的 LoRA 更新,并将其谱分量作为即插即用模块重新加载,我们将偏好诱导的更新转化为可以被隔离、重组和直接干预的对象。跨模型家族、优化算法和监督机制,这些更新持续发展出一种谱的头-尾结构。一个紧凑的头部早期出现,并承载了主要的端点偏移,而一个异质的残差尾部则依然存在。这种分离是功能性的,而不仅仅是描述性的。即插即用干预表明,头部解释了与基础模型可见的行为偏差,而尾部在隔离状态下则较弱。跨运行重组进一步表明,混合适配器遵循头部的来源,这表明头部承载了运行级别的求解器偏差。这种端点主导地位并不意味着学习充分性。仅头部学习并非空疏,但无法恢复完整的解决方案,尤其是在分布外行为上。仅尾部学习产生很少的可见收益,但没有尾部则无法恢复完整的解决方案。这些发现将偏好后训练重新定义为结构化的更新重组,而不是单一的行为修正,并表明对齐增益和覆盖损失与学习更新本身的组织方式息息相关。

## 1 引言

基于偏好的后训练已成为塑造现代大型语言模型 (LLM) 行为的标准机制 (Christiano et al., 2017 (https://arxiv.org/html/2607.20438#bib.bib10); Ouyang et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib8); Schulman et al., 2017 (https://arxiv.org/html/2607.20438#bib.bib11); Rafailov et al., 2023 (https://arxiv.org/html/2607.20438#bib.bib2))。它通常通过端点行为来判断:调优后的模型是否更可靠地遵循指令、产生更偏好的响应或在面向推理的任务上有所改进 (Jaech et al., 2024 (https://arxiv.org/html/2607.20438#bib.bib13); Guo et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib14); Team et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib17))。然而,这种端点视角使学习更新本身在很大程度上保持不透明。后训练不仅仅改变模型输出;它诱导一个参数更新,其内部组织可能决定哪些行为得到加强、保留或丢失。这种区别很重要,因为偏好调优通常改善广泛共享的对齐,同时削弱了更多条件性、专门化或长尾能力 (Liu et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib41))。因此,解释这种张力需要超越最终模型是否改进的问题,而是要问诱导的更新在模型内部是如何组织的。

先前的工作将这个问题框定为关于端点行为的争论:偏好调优仅仅是重新加权了基础模型中已有的能力,还是创造了新的推理和决策模式 (Mukherjee et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib18); Yue et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib19); Zhang et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib25); Chen et al., 2025a (https://arxiv.org/html/2607.20438#bib.bib23); Wang et al., 2025b (https://arxiv.org/html/2607.20438#bib.bib26))。这种框架忽略了一个更基础的结构性问题。一个偏好调优的模型与其初始化之间的差异是一个学习更新,然而这个更新通常被视为优化的一个整体性结果。因此,对齐增益、求解器偏差和覆盖损失是否来自相同的更新方向,还是来自具有不同角色的可分离组件,仍然不清楚。

因此,我们将学习更新作为分析的单位。对于每个偏好调优的检查点,我们将其与调优前初始化的差异视为一个加性有效更新,在我们的主要实验中通过 LoRA 适配器实例化 (Hu et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib16))。我们使用奇异值分解 (SVD) 来分解每个模块级别的更新 (Wall et al., 2003 (https://arxiv.org/html/2607.20438#bib.bib9)),得到一个领先的*谱头部*和一个互补的*残差尾部*。这些组件不仅是描述性的:它们可以转换回即插即用适配器,从而实现对它们的受控删除、隔离、跨运行重组和训练时限制。这将偏好诱导的更新从不透明的优化端点转变为可操作的实验对象。

这种以更新为中心的视角导致了对偏好后训练的不同理解。偏好调优并非作为一个单一的整体性行为修正起作用,而是将学习更新重组为结构上不同的组件。一个主导的谱头部巩固了主要的行为转变,而一个异质的残差尾部在隔离状态下仍然较弱,但与恢复更广泛和更条件性的行为相关。在这种观点下,对齐增益和覆盖损失之间的张力不仅仅是后训练的外部副作用,而是更新本身组织方式的一个属性。

我们通过三个发现来证实这一观点。

- •偏好诱导的更新发展出一个稳定的谱头-尾结构。跨模型家族、优化算法和监督机制,更新不会保持分散或坍缩为一个纯粹的低秩对象。一个连贯的谱头部早期出现,而一个异质的残差尾部贯穿训练始终。
- •谱分离是功能性的,而不仅仅是描述性的。源控制的即插即用干预表明,谱头部和残差尾部在隔离时诱导不同的端点行为。残差尾部在隔离状态下仍然较弱,而谱头部携带主导但运行依赖的行为效应。
- •功能分离在重组、训练和监督中具有机制性特征。跨运行重组表明,混合适配器遵循谱头部的来源,这表明头部承载了运行级别的求解器偏差。训练时投影表明,仅头部学习并非空疏,但无法恢复完整的解决方案,尤其是在分布外行为上。监督破坏进一步表明,连贯的提示-偏好对齐有助于决定是否能形成连贯的更新结构。

总之,这些发现将偏好后训练框定为结构化的更新重组,而不是单一的行为转移。谱头部解释了主导的端点行为,但残差尾部以及结构形成的监督条件对于理解广度、可学习性和覆盖损失至关重要。

## 2 相关工作

偏好后训练与行为解释。基于偏好的后训练已成为塑造大型语言模型行为的核心机制。早期工作研究了来自人类偏好比较的奖励学习 (Christiano et al., 2017 (https://arxiv.org/html/2607.20438#bib.bib10))。RLHF 后来成为指令对齐的标准方案 (Ouyang et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib8); Bai et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib12))。直接偏好优化通过直接从偏好对进行优化简化了这一流程,无需显式的奖励模型-强化学习循环 (Rafailov et al., 2023 (https://arxiv.org/html/2607.20438#bib.bib2))。最近面向推理的后训练将基于奖励的优化扩展到数学、编码和复杂推理任务。代表性的例子包括 DeepSeekMath (Shao et al., 2024 (https://arxiv.org/html/2607.20438#bib.bib7)) 中的 GRPO 风格训练,以及后来使用大规模强化学习训练的推理模型 (Guo et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib14))。这些工作定义了我们所研究的后训练过程类别,但它们主要通过端点行为来评估,例如指令跟随、偏好响应生成和推理准确性。我们没有提出新的偏好目标。我们分析由此类目标诱导的参数更新,并询问这个更新在模型内部是如何组织的。

RLHF 改变了语言模型的什么。最近的研究开始质疑端点改进反映了什么。一条工作线询问 RLVR 是否真正扩展了基础模型的推理能力,还是主要提高了基础分布中已经存在的高奖励路径的采样效率 (Yue et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib19))。其他工作分析了推理边界是否在训练期间以阶段依赖的方式缩小、扩大或改变 (Yao et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib28))。RLVR 中的能力边界坍缩也激发了旨在抵消这种缩小的混合策略和基于探索的方法 (Dong et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib33))。

另一条线以更细粒度定位 RL 诱导的变化。一些研究分析了 RL 如何重塑推理模式和 token 级别动态 (Chen et al., 2025b (https://arxiv.org/html/2607.20438#bib.bib24))。另一些研究表明,高熵或高重要性的决策 token 在基于 RL 的推理中扮演着不成比例的角色 (Wang et al., 2025a (https://arxiv.org/html/2607.20438#bib.bib30); Liu et al., 2026 (https://arxiv.org/html/2607.20438#bib.bib31))。轨迹级别的信息峰值也被用来识别推理痕迹中的关键思考 token (Qian et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib32))。在参数层面,最近的工作发现 RL 微调可以修改稀疏子网络而不是整个模型 (Mukherjee et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib18); Balashov, 2025 (https://arxiv.org/html/2607.20438#bib.bib22)),并且随机稀疏子网络可能足以进行有效的 RLVR (Adewuyi et al., 2026 (https://arxiv.org/html/2607.20438#bib.bib20))。关于 RLVR 更新方向的工作进一步认为,仅凭更新幅度或稀疏性不足以理解 RL 诱导的变化 (Huang et al., 2026 (https://arxiv.org/html/2607.20438#bib.bib21))。其他研究考察了基础模型兼容性、训练中期条件和 RL 后训练中的缩放行为 (Wang et al., 2025b (https://arxiv.org/html/2607.20438#bib.bib26); Tan et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib29))。后训练中的权衡,如遗忘和保留,也已被研究,有证据表明在线 RL 可以与监督微调不同地保留先前的能力 (Chen et al., 2025a (https://arxiv.org/html/2607.20438#bib.bib23); Shenfeld et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib27))。

这些研究表明 RL 效应不是均匀的端点分数改进。它们出现在推理轨迹、token 级别决策点、参数足迹、更新方向和能力覆盖中。然而,大多数分析仍然在行为轨迹、token 动态、稀疏子网络或粗略更新效应的层面上操作。我们转而研究偏好诱导的更新是否包含具有不同端点和学习角色的可分离谱组件。

模型行为的参数空间视角。一条互补的工作线将微调模型与其预训练初始化之间的差异视为参数空间中一个可操作的对象。任务算术将这种差异定义为任务向量,并通过组合它们来引导模型行为 (Ilharco et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib40))。模型汤对微调权重进行平均以在增加推理成本的情况下提高准确性 (Wortsman et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib39))。后来的合并方法研究了如何减少组合任务特定模型时的干扰 (Yadav et al., 2023 (https://arxiv.org/html/2607.20438#bib.bib38))。最近的工作进一步发展了用于高效模型编辑的任务向量基础 (Zeng et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib36))、用于分离任务特定知识与指令跟随行为的层感知任务算术 (Chen et al., 2025c (https://arxiv.org/html/2607.20438#bib.bib35)),以及用于减少模型合并中任务干扰的任务奇异向量 (Gargiulo et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib37))。

我们认同微调差异是用于分析和干预的有意义对象的观点,但先前的工作通常将更新作为一个整体进行操作以进行模型编辑或合并。最接近的是,任务奇异向量方法也使用 SVD 来分析任务矩阵 (Gargiulo et al., 2025 (https://arxiv.org/html/2607.20438#bib.bib37)),但他们的目标是减少模型合并中的干扰。我们的谱组件则作为偏好诱导更新内功能分离的诊断和干预对象,使我们能够区分端点显著性和学习充分性。

## 3 预备知识

端点行为将偏好调优的效果压缩为最终的模型响应。这种观点对评估有用,但它无法揭示是否相同的学习方向控制了可见的行为转变、支持了优化,或者保留了更多条件能力。因此,我们使用从调优前模型到调优检查点的加性更新作为分析的基本对象。一旦写成模块级补丁的集合,这个更新就可以被分解、移除、替换和重组,而无需改变基础模型。

### 3.1 有效更新

模块级线性投影为此分析提供了一个自然单元,因为每个投影的学习变化可以表示为对应基础权重上的加性补丁。令 \(W_{l,j}^{(0)}\) 表示 Transformer 块 \(l\) 中模块 \(j\) 的调优前权重,且令 \(W_{l,j}^{(t)}\) 表示检查点 \(t\) 处的对应权重。有效更新 \(\Delta W_{l,j}^{(t)}\) 定义为:

\[
W_{l,j}^{(t)} = W_{l,j}^{(0)} + \Delta W_{l,j}^{(t)}.
\]

对于密集微调,\(\Delta W_{j,j}^{(t)} = W_{l,j}^{(t)} - W_{l,j}^{(0)}\)。在我们的主要 LoRA 设置中 (Hu et al., 2022 (https://arxiv.org/html/2607.20438#bib.bib16)),主干网络被冻结,有效更新由缩放的适配器乘积给出:

\[
\Delta W_{l,j}^{(t)} = s_{l,j}^{(t)} B_{l,j}^{(t)} A_{l,j}^{(t)},
\]

其中 \(A_{l,j}^{(t)}\) 和 \(B_{l,j}^{(t)}\) 是 LoRA 因子,而 \(s_{l,j}^{(t)}\) 吸收了实现特定的缩放。

检查点级别的更新是这些模块级补丁在目标注意力和 MLP 投影上的集合。完整的模块列表、LoRA 维度和缩放约定在附录 A (https://arxiv.org/html/2607.20438#A1) 中给出。由于更新是加性的,组件的删除、隔离、跨运行替换和重组都可以被实现。

相似文章

Spectral Souping:在线偏好对齐的统一框架

arXiv cs.LG

本文介绍了Spectral Souping,这是一种通过发现通用谱表示来高效对齐LLM与个体用户偏好的框架,该表示能在推理时合并专门策略,无需昂贵的重新训练。

自我改进往往是突发的:大规模模型的Enlightenment式微调

arXiv cs.LG

本文介绍了Enlightenment,一种针对大规模模型的无需训练的后调整方法,它修改关键模块中的快捷连接而不更新权重,实现了突发的能力提升。通过注意力头混合和标量调制的残差连接,该方法在LLMs和VLMs上展示了有效性。

微调回归的引力解释

arXiv cs.LG

本文提出了微调回归的引力解释:早期训练形成了占主导地位的行为流形,后续的对齐只轻微地偏移它,从而产生了一个持久的回归方向。实验表明,阻止该方向能以极小的任务成本降低有害性。