无奖励的表征:JEPA对LLM微调的审计
摘要
本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。
arXiv:2605.15394v1 公告类型:新 \n摘要:联合嵌入预测架构(JEPAs)提出,当模型被训练来预测潜在表征而非观察到的输出时,它应该学习更有用的抽象。对于自回归语言模型的微调,该原则带来了更严格的要求:诱导的隐藏状态几何必须到达语言模型头部 \emph{并且} 改进解码任务指标。我们在固定的Llama-3.2-1B-Instruct LoRA框架下,在自然语言到正则表达式生成任务上测试了这一要求,比较了二十二个训练时的辅助目标,涵盖轨迹形状正则化、分布约束、预测器/目标不对称性、Fisher度量雅可比残差,以及一个构建在交叉熵正锥内的解码器可见JEPA目标。实证答案是一个结构化的零结果:几个辅助目标在没有校正的情况下通过了单细胞配对$\alpha = 0.10$(其中T3-Local的$\Delta = +2.53$~pp,$p = 0.003$是最强的),但没有任何一个在相关族系阈值下通过了Bonferroni或Holm--Bonferroni校正,尽管许多目标改变了曲率、各向异性、方差和梯度方向。解码器可见JEPA产生了本研究中第一个正的辅助目标-交叉熵梯度余弦,但精确匹配仍处于种子噪声范围内;在$n = 5$个种子上对该辅助目标进行全微调复现,在两个基准测试上都再现了零结果(TURK:$\Delta = +0.04$~pp,$p_{\text{paired}} = 0.96$;SYNTH:$\Delta = +0.52$~pp,$p_{\text{paired}} = 0.28$),因此对于解码器可见构造,零结果在LoRA和全微调下都是稳健的。因此,在该设置下,隐藏状态表征工作与解码任务准确率之间是弱耦合的;我们据此将LLM领域的JEPA评估重新框定为耦合问题,其中的关键问题是在哪些度量下有用的隐藏几何会变成解码器可见的任务信号。
查看缓存全文
缓存时间: 2026/05/18 06:40
# JEPA审计用于LLM微调
来源:https://arxiv.org/html/2605.15394
## 无奖励的表征:LLM微调的JEPA审计
###### 摘要
联合嵌入预测架构(JEPA)提出,当模型被训练用于预测潜在表征而非观测输出时,能够学到更有用的抽象。对于自回归语言模型的微调,这一原则意味着更严格的要求:诱导出的隐藏状态几何必须到达语言模型头部*并且*提升解码后的任务指标。我们在固定的Llama-3.2-1B-Instruct LoRA框架上,对自然语言到正则表达式生成任务进行了这一要求的测试,比较了二十二种训练时辅助目标,涵盖轨迹形状正则化、分布约束、预测器/目标不对称性、Fisher度量雅可比残差,以及一种构造为位于交叉熵正锥内的解码器可见JEPA目标。实证结果是一个结构化的零结果:在无校正的情况下,几个辅助目标在单细胞配对α=0.10\alpha=0.10水平上显著(T3-Local最强,Δ=+2.53\Delta=+2.53pp,p=0.003p=0.003),但没有任何一个在相关族系阈值下通过Bonferroni或Holm–Bonferroni校正,尽管许多目标改变了曲率、各向异性、方差和梯度方向。解码器可见JEPA产生了研究中首个正的辅助–交叉熵梯度余弦,但精确匹配仍处于种子噪声范围内;在n=5n=5个种子上的相同辅助目标的全微调复制在两个基准上均再现了零结果(TURK:Δ=+0.04\Delta=+0.04pp,ppaired=0.96p_{\text{paired}}=0.96;SYNTH:Δ=+0.52\Delta=+0.52pp,ppaired=0.28p_{\text{paired}}=0.28),因此对于解码器可见构造,零结果在LoRA和全微调下均为稳健的。因此,在此框架下,隐藏状态表征工作与解码任务准确性之间的耦合较弱;我们相应地将LLM领域的JEPA评估重新构架为耦合问题,其核心问题是:在哪些度量下,有用的隐藏几何能成为解码器可见的任务信号。
免责声明:本文由摩根大通及其附属机构(“JPMC”)的LLM Suite团队为信息目的准备,并非摩根大通研究部门的产品。摩根大通不作任何陈述、保证或承诺,并否认对本文所含信息的完整性、准确性或可靠性的所有责任。本文档不构成投资研究或投资建议,也不构成对购买或出售任何证券、金融工具、金融产品或服务的推荐、要约或招揽,也不得用于评估参与任何交易的价值,并且不应构成在任何司法管辖区或对任何个人的招揽,如果在该司法管辖区或对该个人的此类招揽将被视为非法。
## I. 引言
联合嵌入预测架构提出了一个引人注目的学习原则:预测缺失内容的表征,而非像素或标记本身。该思想的变体出现在多个研究项目中:基于预测误差的自监督预测网络[22 (https://arxiv.org/html/2605.15394#bib.bib30)]、命名了规范形式的联合嵌入预测架构(JEPA)[19 (https://arxiv.org/html/2605.15394#bib.bib32)],以及将预测误差思想扩展到探索的好奇心驱动模型构建[23 (https://arxiv.org/html/2605.15394#bib.bib31)]。该原则目前在视觉领域以I-JEPA[1 (https://arxiv.org/html/2605.15394#bib.bib1)]及其密集视频扩展[21 (https://arxiv.org/html/2605.15394#bib.bib5)]为代表,它们将潜在预测与预测器/目标不对称性相结合。对于语言模型微调的科学问题,并非这些目标能否移动隐藏状态——它们可以。更尖锐的问题在于:这种移动是否与解码器及任务指标耦合。自回归语言模型使这个问题异常严格。训练信号是下一个标记的交叉熵,下游系统是语言模型头部加上解码规则,许多符号任务通过精确匹配评分。一个表征可能在辅助损失作用下变得更平滑、更各向同性或更具预测性,同时选中的标记序列保持不变。因此,我们区分了JEPA原则在此场景中混淆的两个可检验主张:
> *H1(表征活动)*。将JEPA风格的辅助目标添加到LoRA微调中,相对于无辅助基线,会诱导隐藏状态几何的可测量变化——包括各向异性、轨迹曲率、种子间方差或梯度方向。
*H2(解码器耦合收益)*。该隐藏状态变化在同一检查点上转化为解码后精确匹配准确率的可测量提升。
H1关乎辅助目标是否*起作用*;H2关乎精确匹配指标是否*奖励*该作用。两个主张并非冗余:一个满足H1但不满足H2的辅助目标,正是本文致力于表征的实证信号。
语义管预测(STP)[16 (https://arxiv.org/html/2605.15394#bib.bib2)]提供了JEPA思想在语言领域的最小化版本。它将助手响应中的隐藏状态视为语义流形上的局部轨迹,并添加速度向量之间的余弦对齐损失。所报告的NL-RX-SYNTH上16×16\times数据效率提升激发了一个更广泛的假设:或许轨迹或表征预测压力可以在仅训练LoRA适配器时提供任务相关结构。我们通过固定模型、LoRA设置、数据格式、拼接点、解码器和精确匹配评估器,仅改变辅助目标来检验该假设。本研究涵盖二十二种训练时辅助目标和一种推理时投影器,用于Llama-3.2-1B-Instruct在自然语言到正则表达式生成任务上。这些目标并非作为损失清单组织,而是作为一系列机制性问题:轨迹吸引子有帮助吗?对比或预测压力有帮助吗?交叉熵隐式偏差方向之外的分布约束有帮助吗?JEPA的预测器/目标不对称性是缺失的要素吗?如果隐藏几何重要但欧几里得度量不合适,Fisher度量雅可比残差能否暴露它?如果梯度不对齐是障碍,解码器可见的JEPA目标能否迫使辅助目标进入交叉熵的正锥?
这些测试的结果是一个结构化的零结果。在不进行统计校正的情况下,几个辅助目标在单细胞配对α=0.10\alpha=0.10水平上达到显著:TURK上的提示局部JFR(+2.53+2.53pp,p=0.003p=0.003)、TURK上的T5(+1.53+1.53pp,p=0.08p=0.08),以及SYNTH上的三个Tier-1分布细胞(L1、L3、L4,配对pp在0.060.06到0.100.10之间)。但在相关族系阈值下进行Bonferroni或Holm–Bonferroni校正后,这些细胞均不显著。BYOL-LLM(预测器+EMA目标+停止梯度不对称性的直接测试)在两个基准上仍处于种子噪声范围内。Fisher度量替换移除了几何特征但未改善精确匹配。解码器可见JEPA产生了首个正向辅助–交叉熵梯度余弦,但其精确匹配增益在LoRA及n=5n=5种子的全微调复制下仍无统计显著性。因此,零结果并非源于不活跃的目标。几个损失减少了轨迹曲率,改变了隐藏状态各向异性,收紧了种子间方差,或改变了梯度方向。本文的核心主张反而是表征工作与解码性能之间的分离:在此框架下,JEPA风格的辅助目标可以重塑隐藏几何,而不会可靠地改变语言模型头部选中的精确符号输出。
#### 贡献。
1. 1. LLM微调中JEPA风格表征塑造的解码器可见测试。我们将核心问题框定为:辅助表征目标是否仅仅移动隐藏几何,还是产生能经受语言模型头部并改善精确匹配解码的变化。
2. 2. 受控假设映射。我们在Llama-3.2-1B-Instruct上评估了二十二种JEPA启发的训练时辅助目标和一种推理时投影器,保持模型、LoRA设置、数据、拼接点、解码器和评估器固定。菜单涵盖轨迹形状吸引子(STP,T1–T6)、对比和预测目标(T7,L12)、交叉熵隐式偏差方向之外的分布约束(L1–L6,L9)、预测器/目标不对称性测试(L13–L14)、Fisher度量雅可比残差(Tier-3),以及一种构造为位于交叉熵正锥内的解码器可见JEPA目标。
3. 3. 渐近精确匹配准确率的结构化零结果。无统计校正时,少数细胞在单细胞配对α=0.10\alpha=0.10水平上达到显著(TURK上的提示局部JFR和T5;SYNTH上的L1、L3、L4),但没有任何一个在相关族系阈值下通过Bonferroni或Holm–Bonferroni校正。这包括BYOL-LLM(预测器+EMA目标+停止梯度不对称性)和解码器可见JEPA(梯度位于交叉熵正锥内),两者均仍处于种子噪声范围内。
4. 4. 区分性能不活跃与表征不活跃的诊断。即使精确匹配准确率不变,几个辅助目标也改变了曲率、各向异性、方差和梯度方向。这些损失起作用;其作用在此框架下与解码器和度量的耦合较弱。
#### 论文组织。
第二部分 (https://arxiv.org/html/2605.15394#S2)将本文置于JEPA、对比和分布自监督学习文献背景下。第三部分 (https://arxiv.org/html/2605.15394#S3)引入统一拼接点,并给出三大结构类别中每个辅助目标的正式定义。第四部分 (https://arxiv.org/html/2605.15394#S4)描述实验框架和统计方法,包括我们通篇使用的Welch检验和族系级别校正。第五部分 (https://arxiv.org/html/2605.15394#S5)报告TURK和SYNTH结果、族内雅可比场分析,以及两种失败模式(T1崩溃、T9固定点解码)。第六部分 (https://arxiv.org/html/2605.15394#S6)将诊断与基准结果综合为解码器不可见的表征工作解读,并讨论对未来LLM领域JEPA工作的启示。
## II. 相关工作
#### 联合嵌入预测架构。
JEPA方法通过学习预测表征而非重构输入来运作。I-JEPA[1 (https://arxiv.org/html/2605.15394#bib.bib1)]通过掩码预测、可学习的预测器和EMA目标编码器为图像建立了这一模板;V-JEPA风格扩展[21 (https://arxiv.org/html/2605.15394#bib.bib5)]将相同思想推广到视频和密集中间特征。这些系统通常依赖不对称性——例如目标编码器、停止梯度操作或预测器头部——以防止崩溃同时保留语义信息。我们的研究有意去掉了大部分这类架构,以测试一个最小化问题:附着在LLM微调循环上的单个前向传播辅助损失能独立完成多少?
#### 对比、非对比和分布自监督学习。
对比目标如SimCLR[7 (https://arxiv.org/html/2605.15394#bib.bib7)]使用负对来塑造表征几何,而非对比方法如BYOL[11 (https://arxiv.org/html/2605.15394#bib.bib9)]、SimSiam[8 (https://arxiv.org/html/2605.15394#bib.bib10)]、VICReg[5 (https://arxiv.org/html/2605.15394#bib.bib11)]和Barlow Twins[29 (https://arxiv.org/html/2605.15394#bib.bib12)]使用预测器不对称性、方差或协方差约束。近期理论通过隐式方差正则化以及对比与非对比目标之间的对偶性将这些家族联系起来[26 (https://arxiv.org/html/2605.15394#bib.bib16),10 (https://arxiv.org/html/2605.15394#bib.bib17),12 (https://arxiv.org/html/2605.15394#bib.bib18)]。这些结果激发了本研究中的分布损失:如果STP风格的轨迹对齐因过于狭窄而失败,各向同性或协方差正则化仍可能将表征推向有用方向。
#### JEPA理论与语言领域变体。
近期分析认为,JEPA风格目标在适当的深度或架构不对称性下可能偏好语义有用的特征[20 (https://arxiv.org/html/2605.15394#bib.bib19)],并且各向同性高斯嵌入分布可能源于最小最大预测风险公式[4 (https://arxiv.org/html/2605.15394#bib.bib20)]。语言领域变体包括data2vec[3 (https://arxiv.org/html/2605.15394#bib.bib26)]、LLM-JEPA[15 (https://arxiv.org/html/2605.15394#bib.bib3)]和STP[16 (https://arxiv.org/html/2605.15394#bib.bib2)]。LLM-JEPA使用两个视图和预测器/目标风格机制;STP将思想简化为助手轨迹上的单个因果前向传播。我们的论文最好理解为对该简化框架的受控研究。我们并非测试完整的JEPA方案(含目标编码器和预测器不对称性)能否帮助LLM;而是测试仅将轨迹和分布压力添加到LoRA微调中是否能改善精确匹配。
#### 轨迹拉直作为正则化器。
激励STP及本研究中T1–T6细胞的拉直原理最近被证明能在不同的下游场景中提升任务性能。[27 (https://arxiv.org/html/2605.15394#bib.bib4)]训练了一个世界模型编码器加预测器,并使用了与STP结构相同的曲率正则化器——连续潜在速度之间的余弦惩罚——并报告在基于梯度的潜在规划中目标达成成功率提升了2020–60%60\%。他们还证明在线性动力学假设下,拉直正则化器控制了规划海森矩阵的条件数,从而为经验增益提供了直接机制。他们的结果与我们的零结果并不矛盾:他们的下游任务是基于梯度的规划,在学得的潜在动力学模型上进行,其中表征条件直接影响优化海森矩阵;我们的任务是交叉熵下的自回归标记生成随后进行argmax解码,其中表征仅通过LM头部的softmax进入。这一对比强化了我们的结构化零结果解读(第六部分D节) (https://arxiv.org/html/2605.15394#S6.SS4):改善基于梯度下游目标的相同几何工作,未必能改善其表征依赖仅通过最终标记argmax介导的度量。我们在附录C (https://arxiv.org/html/2605.15394#A3)中追求的解码器可见JEPA构造通过将辅助目标移出hh空间并进入LM头部的后softmax分布,直接解决了此不对称性。
#### 定位。
最接近的比较是STP[16 (https://arxiv.org/html/2605.15394#bib.bib2)],后者在NL-RX-SYNTH上报告了16×16\times数据效率提升。我们的评估在范围上有所不同:我们测量LoRA微调后的最终精确匹配准确率,将NL-RX-TURK作为不那么饱和的基准,并添加了曲率、各向异性和梯度对齐的诊断。因此,两种说法是兼容的:几何辅助目标可能在不提升渐近精确匹配上限的情况下改善样本效率。我们的贡献相似文章
注解版JEPA
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。
预测与重建:自监督语言表示学习的联合目标
本文提出了一种混合预训练目标,结合了JEPA潜在空间预测和MLM重建,用于语言模型,显示出改进的嵌入均匀性和语义-词汇平衡。
SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学
SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。
DLLM-JEPA:面向掩码扩散语言模型的联合嵌入预测架构
介绍了DLLM-JEPA,这是一种针对掩码扩散语言模型的JEPA公式,通过扩散噪声调度从单个输入构建两个视图,相比LLM-JEPA减少了33%的训练FLOPs,并在GSM8K等任务上提升了微调性能。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。