大语言模型顺序后训练中的表征坍塌

arXiv cs.LG 论文

摘要

本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。

arXiv:2605.30524v1 公告类型: 新 摘要: 大型语言模型现在通过一系列后训练阶段进行适配,而非单一的指令微调过程。本文研究了这种顺序后训练是否逐渐将内部表征压缩为低秩、各向异性且同质的特征空间。我们定义了一套针对隐藏状态、logits、token轨迹和LoRA更新的测量方法,并利用它在受控的阶段顺序下分析监督微调、偏好优化、安全/拒绝调优、数学和代码专业化以及长思维链调优。核心假设是,过度表征集中不仅仅是一个几何奇观:它预示着后期适应中可塑性下降、域外泛化能力减弱以及校准效果变差。我们还评估了轻量级干预措施,包括混合领域重放、特征刷新、表征多样性正则化和LoRA更新去相关,作为在不放弃后训练行为增益的前提下保留未来可学习性的方法。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:26

# 大语言模型顺序后训练中的表示坍塌
来源:https://arxiv.org/html/2605.30524
Yichen Liu 杭州电子科技大学 & Mingyu Chen 浙江工商大学 & Hao Wang 宁波大学 Xiaoran Xu 上海大学 & Chenxi Lin 杭州电子科技大学 & Rui Zhang 浙江工商大学 Yutong Zhou 宁波大学 & Yuxin Yang 上海大学 & Jiarui Wu 上海大学 & Wei Sun 上海大学

###### 摘要

大型语言模型现在通过一系列后训练阶段进行适配,而非仅通过一次指令微调。本文研究这种顺序后训练是否逐渐将内部表示压缩成低秩、各向异性且同质的特征空间。我们定义了一套针对隐藏状态、logits、token轨迹和LoRA更新的测量方法,并用于分析监督微调、偏好优化、安全/拒绝调优、数学和代码专业化以及长思维链调优,在受控的阶段顺序下进行。核心假设是:过度的表示集中不仅是一个几何上的巧合:它预示着后期适应性降低、域外泛化能力减弱以及校准效果变差。我们进一步测试了轻量级干预措施,包括混合域重放、特征刷新、表示多样性正则化和LoRA更新去相关,作为在不牺牲后训练行为增益的前提下保持未来可学习性的方法。

## 1 引言

大型语言模型很少只进行一次后训练。当代发布的产品是长适配链的产物:广泛的指令微调、偏好优化、安全对齐、领域专业化、推理数据调优,以及针对风格、政策或产品分布变化的后缀刷新[38 (https://arxiv.org/html/2605.30524#bib.bib8),12 (https://arxiv.org/html/2605.30524#bib.bib25),6 (https://arxiv.org/html/2605.30524#bib.bib26),7 (https://arxiv.org/html/2605.30524#bib.bib27),42 (https://arxiv.org/html/2605.30524#bib.bib11),16 (https://arxiv.org/html/2605.30524#bib.bib50),36 (https://arxiv.org/html/2605.30524#bib.bib48),26 (https://arxiv.org/html/2605.30524#bib.bib49),41 (https://arxiv.org/html/2605.30524#bib.bib36),4 (https://arxiv.org/html/2605.30524#bib.bib40)]。主流的评估实践仅从行为角度看待这些阶段:如果模型能遵循指令、解决基准任务、拒绝不安全请求或在成对偏好比较中获胜,则认为模型更好。这种观点是必要的,但并不全面。微调可能会扭曲预训练特征并损害分布外行为,即使分布内性能有所提升[32 (https://arxiv.org/html/2605.30524#bib.bib33)]。因此,一个后训练阶段也会改变模型隐藏特征空间的几何结构,而这种几何结构可能决定了未来学习还剩下多少余地。

本文研究LLM顺序后训练中的**表示坍塌**。我们使用该术语是操作性的。坍塌并不意味着模型完全丧失能力,也不意味着每个低秩方向都是有害的。LoRA及相关适配方法之所以有效,正是因为许多有用的更新是紧凑的[27 (https://arxiv.org/html/2605.30524#bib.bib10),3 (https://arxiv.org/html/2605.30524#bib.bib19)]。我们关注的现象是过度集中:隐藏状态协方差丢失有效秩,样本与少数共同方向对齐,领域和token表征变得不易区分,logits变得过于自信或支持度低,不同阶段的适配器更新重复使用相同子空间。已知语言表示在某些训练范式下会表现出各向异性和退化[17 (https://arxiv.org/html/2605.30524#bib.bib2),37 (https://arxiv.org/html/2605.30524#bib.bib17),8 (https://arxiv.org/html/2605.30524#bib.bib34),19 (https://arxiv.org/html/2605.30524#bib.bib35)];顺序后训练提出了一个更尖锐的问题,因为几何结构反复被各个目标推动,这些目标单独看是有用的,但联合起来则具有路径依赖性。

风险是一种安静的失败模式。一个检查点可能会在最近的目标任务上表现更好,但同时为下一个任务变得缺乏可塑性。安全调优可能将生成压缩到拒绝模板中;长思维链调优可能雕刻出强烈的推理格式流形;偏好优化可能在与对比数据奖励的方向上锐化边界;领域调优可能偏好那些局部可预测但对全局脆弱的特征。持续学习早已表明,未来的学习依赖于保留有用的自由度,而不仅仅是保留当前的精度[18 (https://arxiv.org/html/2605.30524#bib.bib20),29 (https://arxiv.org/html/2605.30524#bib.bib5),35 (https://arxiv.org/html/2605.30524#bib.bib21),40 (https://arxiv.org/html/2605.30524#bib.bib23)]。本文的问题是:LLM后训练何时从有用的专业化跨越到使下一次适配更加困难的表示机制?

本文做出三项贡献:

- • 我们定义了一套逐层的后训练坍塌测量协议,涵盖隐藏状态谱、CKA漂移、各向异性、token多样性、logit多样性、校准以及LoRA更新重叠。
- • 我们提出了一个受控的顺序后训练基准,涵盖通用指令、数学、代码、安全/拒绝、长思维链和偏好数据,并配以匹配的token预算和一个固定的表示探测语料库。
- • 我们测试了坍塌指标是否能预测未来的适配性能,以及简单的多样性保持干预措施是否能改善目标任务增益与未来可学习性之间的权衡。

图1:顺序后训练被评估为轨迹,而非仅评估单个最终检查点。相同的探测语料库应用于每个检查点,以确保测量的几何变化不会因评估分布的变化而混淆。
## 2 相关工作

#### 表示坍塌与各向异性。

神经坍塌描述了一种终端监督学习机制,其中类内变异性缩小,类均值趋近于类似单纯形的结构[39 (https://arxiv.org/html/2605.30524#bib.bib1),24 (https://arxiv.org/html/2605.30524#bib.bib16)]。语言模型表现出相关但不同的几何特性:上下文嵌入通常占据具有主导性共同方向的各向异性空间,移除或正则化这些方向可以改善句子表示[17 (https://arxiv.org/html/2605.30524#bib.bib2),37 (https://arxiv.org/html/2605.30524#bib.bib17),8 (https://arxiv.org/html/2605.30524#bib.bib34),20 (https://arxiv.org/html/2605.30524#bib.bib18)]。语言生成中的表示退化进一步表明,似然训练可以将嵌入推入狭窄的锥体[19 (https://arxiv.org/html/2605.30524#bib.bib35)]。关于内在维度和低维微调的研究表明,有用的适配可以是紧凑的[3 (https://arxiv.org/html/2605.30524#bib.bib19),27 (https://arxiv.org/html/2605.30524#bib.bib10)],但紧凑的更新并不等同于经过多个阶段后的健康表示。本研究与这些设置的不同之处在于,它跟踪了多个后训练阶段的隐藏状态,而不是分析单个预训练检查点、最终分类器几何结构或单一适配方法。

#### 持续学习与可塑性。

灾难性遗忘和可塑性丧失已经通过参数正则化、重放、蒸馏、梯度投影、示例记忆和生物启发的去相关机制进行了研究[18 (https://arxiv.org/html/2605.30524#bib.bib20),29 (https://arxiv.org/html/2605.30524#bib.bib5),35 (https://arxiv.org/html/2605.30524#bib.bib21),34 (https://arxiv.org/html/2605.30524#bib.bib6),44 (https://arxiv.org/html/2605.30524#bib.bib7),9 (https://arxiv.org/html/2605.30524#bib.bib22),40 (https://arxiv.org/html/2605.30524#bib.bib23),55 (https://arxiv.org/html/2605.30524#bib.bib41)]。这些工作大多直接保留任务性能。我们的重点在于表示健康:特征空间是否保持足够的多样性和可分离性以支持后续适配。

#### 后训练与表示分析。

指令微调、领域自适应预训练、安全对齐和偏好优化是塑造模型行为的标准工具[23 (https://arxiv.org/html/2605.30524#bib.bib24),38 (https://arxiv.org/html/2605.30524#bib.bib8),47 (https://arxiv.org/html/2605.30524#bib.bib9),12 (https://arxiv.org/html/2605.30524#bib.bib25),6 (https://arxiv.org/html/2605.30524#bib.bib26),7 (https://arxiv.org/html/2605.30524#bib.bib27),11 (https://arxiv.org/html/2605.30524#bib.bib28),46 (https://arxiv.org/html/2605.30524#bib.bib29),45 (https://arxiv.org/html/2605.30524#bib.bib30),42 (https://arxiv.org/html/2605.30524#bib.bib11),16 (https://arxiv.org/html/2605.30524#bib.bib50),36 (https://arxiv.org/html/2605.30524#bib.bib48),26 (https://arxiv.org/html/2605.30524#bib.bib49),52 (https://arxiv.org/html/2605.30524#bib.bib51)]。推理和代码专业化通过长思维链轨迹、推理强化学习和程序合成分布引入了额外的结构[48 (https://arxiv.org/html/2605.30524#bib.bib31),30 (https://arxiv.org/html/2605.30524#bib.bib32),13 (https://arxiv.org/html/2605.30524#bib.bib13),25 (https://arxiv.org/html/2605.30524#bib.bib12),10 (https://arxiv.org/html/2605.30524#bib.bib14),5 (https://arxiv.org/html/2605.30524#bib.bib15),15 (https://arxiv.org/html/2605.30524#bib.bib55)]。CKA和SVCCA提供了跨网络和检查点比较表示的方法[43 (https://arxiv.org/html/2605.30524#bib.bib4),31 (https://arxiv.org/html/2605.30524#bib.bib3)]。我们将这些工具与logit空间诊断、token跨度分析和适配器子空间测量相结合,以提出一个具体问题:哪些后训练阶段保留了未来的可塑性,哪些阶段使模型在行为上改善但几何上变窄?

## 3 问题设置与测量套件

令M0M\_\{0\}为一个预训练或指令微调的基础模型。顺序后训练产生检查点M1,...,MTM\_\{1\},\\ldots,M\_\{T\},其中阶段tt由数据分布Dt\\mathcal\{D\}\_\{t\}、训练目标Lt\\mathcal\{L\}\_\{t\}、token预算和更新机制决定。大多数实验使用LoRA,并设置一个较小的全量微调条件,以测试观察到的效果是否与适配器具体相关。对于固定的探测语料库Xprobe\\mathcal\{X\}\_\{\\mathrm\{probe\}\},令Hlt\(Xprobe\)∈Rn×dH\_\{\\ell\}^\{t\}\(\\mathcal\{X\}\_\{\\mathrm\{probe\}\}\)\\in\\mathbb\{R\}^\{n\\times d\}为检查点MtM\_\{t\}在层l\\ell处的token隐藏状态矩阵,其中nn是采样token数,dd是隐藏维度。令Zt\(Xprobe\)Z^\{t\}\(\\mathcal\{X\}\_\{\\mathrm\{probe\}\}\)表示在相同教师强制序列上的logits。对于LoRA适配矩阵,阶段更新为

ΔWlt=αrBltAlt。\\Delta W\_\{\\ell\}^\{t\}=\\frac\{\\alpha\}\{r\}B\_\{\\ell\}^\{t\}A\_\{\\ell\}^\{t\}。
表示坍塌被定义为在固定探测分布下可测量的集中度或同质性增加。谱坍塌表现为隐藏状态有效秩或参与率降低。角度坍塌表现为在考虑均值偏移后平均余弦相似度增加。分布坍塌表现为提示领域或token跨度变得不易区分。功能坍塌表现为logits熵较低、边际较大或目标分布外校准较差。更新坍塌表现为不同阶段的LoRA更新占据重叠子空间。表1 (https://arxiv.org/html/2605.30524#S3.T1)总结了测量套件。

表1:每个检查点后使用的表示坍塌诊断。本文报告各个指标,而非仅依赖一个聚合的坍塌指数。### 3.1 指标

对于隐藏矩阵H=Hlt\(Xprobe\)H=H\_\{\\ell\}^\{t\}\(\\mathcal\{X\}\_\{\\mathrm\{probe\}\}\),定义中心化特征H ̄=H−1μ⊤\\bar\{H\}=H\-\\mathbf\{1\}\\mu^\{\\top\}和协方差Σ=\(n−1\)−1H ̄⊤H ̄\\Sigma=\(n\-1\)^\{\-1\}\\bar\{H\}^\{\\top\}\\bar\{H\}\。如果λ1≥⋯≥λd≥0\\lambda\_\{1\}\\geq\\cdots\\geq\\lambda\_\{d\}\\geq 0是特征值,且pi=λi/∑jλjp\_\{i\}=\\lambda\_\{i\}/\\sum\_\{j\}\\lambda\_\{j\},则归一化的有效秩为

erank~\(Σ\)=d−1exp⁡\(−∑ipilog⁡\(pi\+ε\)\)。\\widetilde\{\\mathrm\{erank\}\}\(\\Sigma\)=d^\{\-1\}\\exp\\left\(\-\\sum\_\{i\}p\_\{i\}\\log\(p\_\{i\}\+\\epsilon\)\\right\)。参与率为PR\(Σ\)=\(∑iλi\)2/∑iλi2\\mathrm\{PR\}\(\\Sigma\)=\(\\sum\_\{i\}\\lambda\_\{i\}\)^\{2\}/\\sum\_\{i\}\\lambda\_\{i\}^\{2\}。这两个指标一起报告,因为有效秩对谱尾部敏感,而参与率强调主导方向。top-kk方差,特别是当k∈\{1,8,32\}k\\in\\\{1,8,32\\\}时,使集中度易于直观解释。

几何指标侧重于对齐和漂移。平均成对余弦相似度分别在中心化前后计算,因为原始各向异性可能被均值偏移主导。CKA将每个检查点与基础模型以及紧邻的前一阶段进行比较:

CKA\(Hs,Ht\)=‖Hs⊤Ht‖F2‖Hs⊤Hs‖F‖Ht⊤Ht‖F。\\mathrm\{CKA\}\(H^\{s\},H^\{t\}\)=\\frac\{\\\|\{H^\{s\}\}^\{\\top\}H^\{t\}\\\|\_\{F\}^\{2\}\}\{\\\|\{H^\{s\}\}^\{\\top\}H^\{s\}\\\|\_\{F\}\\\|\{H^\{t\}\}^\{\\top\}H^\{t\}\\\|\_\{F\}\}。领域可分离性通过冻结的线性探针、轮廓分数和域间与域内协方差比来测量。这些简单诊断是有意选择的,因为坍塌测量套件必须足够廉价,以便在日常后训练中运行。

Token多样性在多个粒度上测量。主要分析计算所有探测token上的协方差秩,但更具诊断性的视图将提示token、早期响应token、后期响应token、思维链跨度和拒绝跨度分开。这种区分很重要,因为长思维链调优可能保留提示表示,但同时使后期推理迹在风格上变得同质。Logit空间分析使用教师强制参考延续来保持token身份固定,并报告熵、固定温度下的词汇支持大小、top-one/top-two边际、期望校准误差和每领域负对数似然。

对于LoRA更新,令QltQ\_\{\\ell\}^\{t\}为ΔWlt\\Delta W\_\{\\ell\}^\{t\}的top-kk左奇异向量的正交基。阶段重叠得分为

Ωl\(t,s\)=1k‖Qlt⊤Qls‖F2。\\Omega\_\{\\ell\}\(t,s\)=\\frac\{1\}\{k\}\\left\\\|\{Q\_\{\\ell\}^\{t\}\}^\{\\top\}Q\_\{\\ell\}^\{s\}\\right\\\|\_\{F\}^\{2\}。高重叠意味着后续阶段重复使用相同的方向。这种更新空间视角与持续表示学习方法相关,这些方法在适配过程中明确鼓励去相关或投影的特征[56 (https://arxiv.org/html/2605.30524#bib.bib42),33 (https://arxiv.org/html/2605.30524#bib.bib43)],也与最近的多任务LoRA工作相关,这些工作将任务特定的低秩更新模块化、神经调制或正交化[49 (https://arxiv.org/html/2605.30524#bib.bib44),50 (https://arxiv.org/html/2605.30524#bib.bib45),51 (https://arxiv.org/html/2605.30524#bib.bib46)]。为了可视化,我们还定义了一个标准化的坍塌指数,通过对zz分数后的秩损失、参与率损失、各向异性增加、顶部方差增加和LoRA重叠进行平均。

相似文章

作为文化演化的模型崩溃

arXiv cs.CL

本文将LLM中的模型崩溃重新定义为一种文化传播现象,表明迭代学习理论预测了自我训练下组合性的非单调轨迹,并在多种语言和模型上得到证实。

神经坍缩是被禁止的:语言模型中的信息下限

arXiv cs.CL

本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。