从上下文偏移到风格崩塌:为什么训练目标比规模更重要
摘要
本文研究训练对齐目标如何重塑大型语言模型的语言特征,发现指令微调系统坍塌语言熵的程度显著超过规模预期,并且熵正则化可以缓解这种坍塌。
arXiv:2605.28826v1 公告类型:新
摘要:在现代LLM中,语言特征并非作为风格产物,而是作为概率质量的探针,在训练对齐目标下分配。使用当代流水线训练的语言模型表现出语言特征的严重重塑,导致极端的语言重新分布。虽然先前的文体学分析探索了AI生成文本与人类文本之间的语言差异,但我们关注的是困扰LLM训练流水线本身的重塑。我们分析了17个模型(参数范围410M-100B+),使用24个语言学驱动的探针,记录到指令微调系统系统地沿话语和结构维度坍塌语言熵(平均放大倍数:1,949-16,853%,峰值:5,181-209,675%),同时选择性地将复杂标点符号抑制到基线频率的3.2-23.2%。这些效应在RLHF下并未恶化,因为在匹配的基础模型和指令微调模型对中,发散模式在统计上无显著差异(p > 0.25)。弱干预(λ=1.0)使坍加剧240%,而强控制(λ=5.0)实现了40.5%的改善,并且尽管规模劣势达200-1000倍,仍比前沿模型高出96.7-98.2%。此外,与中等正则化相比,λ=5.0的distinct-4提高了15%,词汇多样性提高了27%,重复率降低了78%,这表明对齐需要足够的控制强度,而不仅仅是分布平滑。我们的发现强调了现代LLM如何重新分配风格概率质量,尽管使用了RLHF和规模。更广泛地说,我们的工作揭示了当前对齐流水线的结构局限性:偏好优化重塑了语言分布,这些分布对标准质量指标不可见,但可通过分布探针检测到,这对AI检测、训练数据污染以及长期语言演化具有启示意义。
查看缓存全文
缓存时间: 2026/05/29 09:11
# 从上下文偏移到风格坍缩:为何训练目标比规模更重要
来源:https://arxiv.org/html/2605.28826
###### 摘要
在现代大语言模型(LLM)中,语言特征并非仅仅是风格上的产物,而是概率质量(probability mass)的探针,这些概率质量在训练对齐目标下被分配。然而,使用当代流水线训练的语言模型会严重重塑语言特征,从而导致极端的语言再分布。尽管之前的文体计量分析已经探讨了 AI 生成文本与人类文本之间的语言差异,但我们关注的是困扰 LLM 训练流水线本身的重塑现象。在这项工作中,我们分析了 17 个模型(参数从 410M 到 100B+),使用了 24 个基于语言学的探针,记录了指令微调系统如何在话语和结构维度上系统地坍缩语言熵(平均放大倍数:1,949–16,853%,峰值:5,181–209,675%),同时选择性地将复杂标点和句法多样性抑制到基线频率的 3.2–23.2%。关键在于,这些效应在 RLHF(基于人类反馈的强化学习)下并不会恶化,因为经过匹配的基础模型与指令微调模型对之间的分歧模式在统计上不可区分(p > 0.25),这表明文体计量偏差出现在流水线的后期阶段。我们表明,这种失败模式只能通过强熵正则化来缓解;相反,弱干预(λ=1.0)会使坍缩加剧 240%,而足够强的控制(λ=5.0)则能实现 40.5% 的改进,并在规模劣势 200–1000 倍的情况下,表现仍优于前沿模型 96.7–98.2%。此外,λ=5.0 相比中等正则化,能带来 distinct-4 提高 15%、词汇多样性增加 27%、重复率降低 78%,这确立了对齐需要足够的控制强度,而不仅仅是分布平滑。我们的发现强调了现代 LLM 如何重新分配风格概率质量,尽管有 RLHF 和规模扩大。更广泛地说,我们的工作揭示了当前对齐流水线的一个结构性局限:偏好优化以标准质量指标不可见的方式重塑语言分布,但通过分布探针却可检测到,这对 AI 检测、训练数据污染和长期语言演变具有重要影响。
## 1 引言
语言特征揭示了 AI 生成文本(AIGT)与人类内容之间的显著区别[16(https://arxiv.org/html/2605.28826#bib.bib21),30(https://arxiv.org/html/2605.28826#bib.bib22),23(https://arxiv.org/html/2605.28826#bib.bib23),19(https://arxiv.org/html/2605.28826#bib.bib33)]。虽然先前的工作集中在 AIGT 与人类文本之间的差异,但据我们所知,没有先前工作分析语言特征是如何被生成动态本身塑造的,也没有提供全面的机制解释。随着 AIGT 被嵌入高风险工作流、未来训练数据和全球语言学中,解决这些效应变得越来越重要[1(https://arxiv.org/html/2605.28826#bib.bib34)]。先前工作已经识别了相关现象:Holtzman 等人[14(https://arxiv.org/html/2605.28826#bib.bib1)]记录了解码过程中的样本内重复,Mitchell 等人[26(https://arxiv.org/html/2605.28826#bib.bib2)]展示了 AIGT 在 log-概率空间中占据独特区域,Zhang 等人[38(https://arxiv.org/html/2605.28826#bib.bib3)]确立了基于梯度的优化会创建系统性的归纳偏差。然而,没有先前工作系统性地量化风格分歧作为推理涌现现象,描述其选择性特征,或证明 RLHF 不会加剧它。我们的工作跨越 17 个模型和 24 个特征填补了这些空白,确立了机制起源,并通过熵正则化验证了训练阶段的缓解措施。我们做出了以下贡献。第一,我们记录了 17 个模型中的灾难性风格分歧:某些结构元素出现的频率是基线分布的 16,853%,而另一些则仅出现 3.2%,通过系统性的语言再分布产生了典型的“AI 写作风格”。第二,与 Kirk 等人[20(https://arxiv.org/html/2605.28826#bib.bib9)]和 Lindström 等人[24(https://arxiv.org/html/2605.28826#bib.bib10)]将对齐训练描述为放大公式化输出的观点相反,我们证明这种重塑与对齐无关:所有四组基础-指令对在分歧上统计不可区分(p > 0.25),揭示了 AI 的声音出现在流水线的后期阶段。第三,我们描述了这种分歧的选择性:话语标记(“delve into”:3,660%,“in conclusion”:5,048%)和结构元素(编号列表:1,949%,项目符号:3,063%)被系统性放大,而复杂标点被抑制(分号:-96.8%,破折号:-81.6%)。第四,我们通过两个互补机制提供了机理解释:上下文偏移,即部署场景不成比例地激活正式的解释性上下文;以及吸收性风格状态,即低熵特征将后续生成约束为自我强化的模式。第五,我们确立了一个控制强度原则:弱干预是有害的,λ=1.0 使分歧增加了 240%,而 λ=5.0 实现了 40.5% 的改进,并在规模劣势 200–1000 倍的情况下,分歧方面优于前沿 API 96.7–98.2%。这些发现在多种模型系列(Pythia、OLMo、Llama、Mistral、Gemma、GPT、Claude、Gemini)和规模(410M–100B+)中一致,前沿 API 的平均分歧为 977%,确立了普遍性。
## 2 相关工作
**AI 文本检测**。Mitchell 等人[26(https://arxiv.org/html/2605.28826#bib.bib2)]展示了 AI 生成文本在 log-概率空间中占据几何上独特的区域,从而支持零样本检测,而 Milička 等人[25(https://arxiv.org/html/2605.28826#bib.bib24)]从维度上描述了这些偏移。尽管他们确立了生成过程会创建系统性的分布伪迹,但他们没有描述这些伪迹是什么。我们的 24 特征分类法提供了这一描述,表明可检测性源于特定的、可量化的风格分歧模式,并且这些模式与对齐过程无关而持续存在。
**基于人类反馈的强化学习**。Ouyang 等人[27(https://arxiv.org/html/2605.28826#bib.bib4)]和 Bai 等人[3(https://arxiv.org/html/2605.28826#bib.bib6)]确立了 RLHF 作为主要的对齐范式。Kirk 等人[20(https://arxiv.org/html/2605.28826#bib.bib9)]发现,与 SFT 相比,RLHF 显著降低了输出多样性,这预示着对齐训练下风格分歧会恶化。我们的结果使这一图景复杂化:风格分歧在所有四组基础-指令对之间统计不可区分(p > 0.25),这表明尽管对齐训练在标准多样性指标所捕获的维度上收窄了分布,但它既没有产生也没有放大我们记录的特定分布坍缩[37(https://arxiv.org/html/2605.28826#bib.bib39)]。Lindström 等人[24(https://arxiv.org/html/2605.28826#bib.bib10)]指出,人类反馈优化的是感知到的有用性,这种优化方式并不能泛化到其他维度;我们的工作量化了偏好优化在结构上视而不见的一个维度。
**熵正则化**。Pereyra 等人[28(https://arxiv.org/html/2605.28826#bib.bib5)]表明,惩罚低熵预测可以改善分类任务的校准和泛化。我们将其扩展到语言模型预训练,证明熵正则化同时减少了风格分歧和模式坍缩[12(https://arxiv.org/html/2605.28826#bib.bib36),39(https://arxiv.org/html/2605.28826#bib.bib40)]。据我们所知,这是第一项表明单一干预同时有益于这两种现象的工作,并且以足够的强度(λ=5.0)执行时,尽管规模劣势 200–1000 倍,仍能优于前沿 API。
**训练动态**。Zhang 等人[38(https://arxiv.org/html/2605.28826#bib.bib3)]确立了基于梯度的优化会诱导出超出架构或数据单独决定的结构化归纳偏差。我们识别出语言生成中的一个特定偏差:交叉熵训练系统性放大高概率的显式模式,同时抑制低概率的细微模式,从而在风格特征上产生选择性而非均匀的分歧。
综合来看,先前工作已经分别记录了重复、可检测性和对齐改进。没有先前工作系统性地量化跨模型和特征的风格分歧,证明与对齐无关,或提供基于上下文偏移和吸收性风格状态的机理解释。我们的工作统一了这些线索,同时揭示了“AI 声音”位于对齐的上游——并且只能在那里被纠正[35(https://arxiv.org/html/2605.28826#bib.bib29)]。
## 3 理论
### 3.1 定义
我们通过比较学习到的分布与训练分布关于风格特征来形式化我们的假设。
1. 设 \(\mathcal{F} = \{f_1, f_2, \ldots\}\) 表示风格特征集,涵盖标点、话语标记、结构元素和语气标记。
2. 设 \(P_M(f)\) 表示特征 \(f \in \mathcal{F}\) 在模型 \(M\) 生成输出中的经验频率,以 token 百分比衡量。
3. 设 \(P_C(f)\) 表示特征 \(f\) 在模型训练语料库 \(C\)(人类书写文本的基线)中的经验频率。
4. 定义放大比:\(AR_M(f) = \frac{P_M(f)}{P_C(f)}\),其中 \(P_M(f)\) 和 \(P_C(f)\) 以每 1000 词的出现频率衡量(特征出现次数除以总词数,再乘以 1000)。对于 \(P_C(f) > 0\) 的特征,\(AR_M(f) = 1\) 表示与基线完美对齐,\(AR_M(f) > 1\) 表示放大,\(AR_M(f) < 1\) 表示抑制。
5. 定义分歧集:\(D_M(\delta) = \{f \in \mathcal{F} : AR_M(f) \notin [1-\epsilon, 1+\epsilon]\}\),其中 \(\epsilon\) 表示自然采样变异的容忍阈值。
6. 我们假设大多数风格特征偏离训练语料分布:\(\frac{|D_M(\delta)|}{|\mathcal{F}|} > 0.5\) (1)
### 3.2 机制解释
我们提出一个机制解释来说明观察到的风格分歧模式。特征的经验性放大和抑制无法仅用训练统计量来解释,因此我们表明这些效应源于上下文偏移和熵驱动生成动态的结合,这诱导出自我强化的风格机制。
#### 3.2.1 交叉熵训练与正确条件概率
由于模型正确学习了条件分布 \(P_\theta(x \mid \text{context})\),相对于其语料库的风格分歧并非源于训练频率。相反,我们将其归因于两种相互作用的机制:上下文偏移和熵驱动的自我强化。
#### 3.2.2 上下文偏移
极端放大的根本原因在于训练分布上下文与语言模型部署上下文之间的系统性错配。训练语料库包含异构的文档类型,而部署上下文不成比例地引发正式的、解释性的回应。因此,生成过程从狭窄的条件切片 \(P(\cdot \mid \text{explanatory})\) 中采样,而非整个训练分布。由于正式文档显示出更高的结构特征(例如标题、列表)频率,这种偏移单独就能产生很大的放大[4(https://arxiv.org/html/2605.28826#bib.bib35)]。相反,与叙述性上下文相关的特征(例如分号)则被抑制。
#### 3.2.3 条件概率与吸收态
并非所有特征都平等地放大。放大程度取决于一个特征对未来生成的约束力。那些显著降低条件熵的特征,即 \(H(P_\theta(\cdot \mid f)) \ll H(P_\theta(\cdot \mid \neg f))\),会诱导可预测的延续,并创建自我强化的风格机制。诸如标题或枚举之类的结构特征会将后续 token 约束为类似结构化的输出,而局部的风格选择(例如标点)则基本不改变分布。这种动态可以看作是一个关于上下文的马尔可夫过程,其中低熵特征诱导进入准吸收区域的转移:一旦进入结构化模式,后续 token 以高概率停留在该模式内,而高熵特征则不会持续或积累。
#### 3.2.4 自回归积累与极端幅度
经验观察到的极端放大的第三个原因是上下文偏移基线概率所启用的特征积累[6(https://arxiv.org/html/2605.28826#bib.bib32)]。上下文偏移增加了触发正式特征的概率,而随机采样确保了偶尔的激活。一旦被触发,其熵减少效应会导致在多个步骤中重复选择,从而在序列长度上产生线性积累。这解释了条件概率如何在实践中产生极端放大比。
### 3.3 熵正则化
在确定了语言模型表现出系统性风格分歧之后,我们现在形式化提出的缓解措施:熵正则化作为一种分布平滑机制,\(\mathcal{L}_{total} = \mathcal{L}_{CE} - \lambda \cdot H(P_\theta)\)[36(https://arxiv.org/html/2605.28826#bib.bib30),22(https://arxiv.org/html/2605.28826#bib.bib31),31(https://arxiv.org/html/2605.28826#bib.bib38)]。尽管风格分歧的主要原因是生成动态,我们选择训练阶段的解决方案以避免脆弱性。
#### 3.3.1 对风格分歧的预测效应
在风格特征的背景下,该机制在训练期间运作,但在生成期间以模式层面显现。由于熵正则化抵消了复合放大,我们预测它会导致跨上下文的分布平滑,从而导致更均匀的特征使用。形式上,我们假设对于中等至强的正则化强度 \(\lambda \geq 1\):\(D(M_\lambda) > 50\%\)。结构元素如标题和列表被强烈放大,复杂标点被抑制,OLMo-2-Instruct 显示出极端的标题放大(209,675%),表明分布坍缩。
在所有 13 个评估模型中,平均 19.9 个特征(83%)表现出超过 10% 容忍阈值(\(\delta = 0.1\))的分歧,大大超过了我们假设中提出的 50% 阈值,并验证了系统性而非孤立的分歧。分歧在不同架构中高度一致:句首的“However”被所有模型过度使用(平均:+332%,峰值:+813%),13 个模型中有 7 个将“delve into”放大了超过 1,000%。结构元素被大量过度生产,13 个模型中有 12 个的编号列表增加(平均:+1,949%,峰值:+5,181%),标题平均放大 +16,853%,在 OLMo-Instruct 中达到峰值 +209,675%……相似文章
自训练不会使语言扁平化——而是重组它:表层标记增强,深层句法消亡
本文提供的证据表明,对语言模型输出的自训练并不会均匀地使语言扁平化,而是对其进行重组,表层标记(话语连接词、模糊限制语、破折号)增加,而深层句法结构(被动语态、虚拟语气、插入语)崩溃,这被正式化为结构深度假说。
大语言模型顺序后训练中的表征坍塌
本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。
神经坍缩是被禁止的:语言模型中的信息下限
本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
LLM蕴含多样性:部署环境如何重塑模型层面的偏好与价值观
本文探讨大型语言模型在不同部署环境中是否具有稳定的偏好,发现环境变化引起的差异远大于提示扰动,表明测得的偏好是环境条件决定的而非固定属性。