@reza_byt: 世界建模借助JEPA最近因一种名为"SIGReg"的新型抗坍缩机制而获得关注(作者:@yl…
摘要
解释了SIGReg,一种针对JEPA的新型正则化器,通过迫使嵌入遵循各向同性高斯分布来防止表征坍缩,具有理论保证和简洁的训练循环。
查看缓存全文
缓存时间: 2026/07/24 17:15
基于JEPA的世界建模最近因一种名为“SIGReg“的新型防坍缩机制(由@ylecun和@randall_balestr提出)而备受关注。其数学原理简洁,但鲜少从基本原理出发进行解释,因此我撰写了一篇详尽的博客文章来剖析它。
以下是摘要(原文链接):
问题:在JEPA中,预测损失的两端都经过同一个编码器。将每个输入映射到单个常数值点,预测器将轻易匹配,损失恰好为零。完美分数,零信息量。梯度下降默认会收敛到这个解。
先前的工作通过stop-gradients、EMA师生模型、冻结的预训练编码器以及带有6+手动调优系数的VICReg风格损失来修补这一问题。每种方法都会引入不稳定性、超参数或对他人预训练结果的依赖。
SIGReg用单一正则化器取代了上述所有方法,其核心主张只有一个:强制嵌入向量批次看起来像来自各向同性高斯分布N(0, I)的样本。LeJEPA证明这并非随意选择。该分布能在线性与非线性探测器中最小化最坏情况下的下游风险。
但“让嵌入向量服从高斯分布”说起来容易,计算起来难。你无法从小批量中估算200+维空间中的密度。解决方案是一系列四个经典结果的链条:用比较傅里叶变换替代比较密度,将比较过程转化为单一标量,用约16个点近似积分,并通过1936年的一个定理将整个过程从1维推广到任意维度。每一步都很简单,但组合起来才产生效果。请阅读本线程中的后续帖子以理解每一步。
为何它可证明有效:唯一使SIGReg = 0的分布是N(0, I),该分布固有满秩,每个特征值都等于1。坍缩的低秩编码器不可能成为最小值。它不仅仅是不太可能收敛到那里——而是在数学上被排除。
训练循环依然朴实无华:
总损失 = 预测损失 + λ·SIGReg
编码器从两项中接收梯度;预测器仅从预测项中接收梯度。没有交替更新,没有stop-gradients,没有双时间尺度技巧。
现在来看看下面的分解。
2/ 八个部分,每部分都包含可运行代码和可重新生成的图表。以下是概览。
3/ · 问题
当预测损失的两端使用同一个编码器时,坍缩并非你可以通过训练规避的bug,而是目标函数的全局最小值。文章明确展示了退化解,然后论证了你实际上想要的目标——各向同性高斯分布。
4/ · 特征函数
每个分布都有其傅里叶变换,且是唯一的。两个分布相同当且仅当它们的特征函数相同。估计器仅需一行代码:对批次中的e^(it·z)求平均。无需密度估计,完全可微。
5/ · 一维高斯性检验
Epps–Pulley检验:在频率范围内对经验特征函数与目标特征函数之间平方差的积分。
6/ · 数值积分
该积分必须在每一步运行。但无需昂贵:被积函数平滑且有效范围狭窄,约8-16个梯形节点即可达到真实值的0.04%以内。
7/ · Cramér–Wold
最精彩的部分。1936年的一个定理表明:任意维度的分布完全由其所有一维投影决定。因此你永远不需要在200维空间中进行测试。采样随机方向,投影,对每个方向运行廉价的一维检验,然后取平均。这个平均值就是SIGReg。
8/ · 为何它能可证明防止坍缩
这不是启发式方法。SIGReg = 0仅在N(0, I)时成立,该分布固有满秩。通过一个玩具版本演示:从人为的秩-1初始化开始,仅用SIGReg训练,观察协方差矩阵在几百步内被拉向各向同性。
9/ · 训练循环
所有部分联合训练。一个损失,一个λ,无需调度技巧。预测路径不受干扰;正则化路径仅收集嵌入向量形成批次并添加其项。
如果你正准备阅读LeJEPA或LeWorldModel,这篇文章为你提供了完整的梳理。
相似文章
Sub-JEPA:用于稳定端到端世界模型的子空间高斯正则化
作者提出了 Sub-JEPA,这是一种利用子空间高斯正则化来提高 LeWM 等端到端世界模型稳定性的方法,在连续控制基准测试中表现出一致的性能提升。
@_akhaliq: VISReg Variance-Invariance-Sketching Regularization 用于JEPA训练
介绍了VISReg,一种用于JEPA(联合嵌入预测架构)训练的正则化方法,它结合了方差(variance)、不变性(invariance)和Sketching约束。
Sub-JEPA:对LeCun团队的LeWorldModel的一个简单修复,可一致提升性能 [P]
Sub-JEPA通过在冻结的随机正交子空间中应用高斯正则化来改进LeWorldModel,在基准测试中一致优于原始版本,改进幅度高达+10.7个百分点。
SIGReg目标作为变分自由能:JEPA世界模型的理论主动推理解释
本文建立了联合嵌入预测架构(JEPA)中使用的SIGReg目标与主动推理框架之间的形式对应关系,表明在某些条件下,训练目标成为精确的变分自由能。它将非对比正则化器组织成一个熵估计器层次结构,并证明了理论结果,包括精确信息瓶颈和SIGReg保留的惊讶界。
DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]
DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。