@LeoKharon: 新世界模型:ylecun的团队带着高效模型回归!此项目涉及@ylecun、@lukaskuhn77、@lucasmae…

X AI KOLs Timeline 模型

摘要

LeVJEPA引入了一种更高效的自监督视频预训练方法,通过消除对目标网络和预测器的需求,使用带有SIGReg正则化器的单一共享编码器,并以更低的计算成本实现有竞争力的性能。

新世界模型:ylecun的团队带着高效模型回归! 此项目涉及@ylecun、@lukaskuhn77、@lucasmaes_、@quentinlldc和@randall_balestr。 首先,几个定义: - DINO:无标签的自蒸馏。一个自监督图像模型(Meta, 2021),学生网络学习匹配教师(自身的EMA副本)在相同图像的两个裁剪上,无标签无负样本。 - SIGReg:一个正则化器,通过强制嵌入匹配各向同性高斯分布来防止嵌入坍缩,使用正态性检验(Epps–Pulley)在许多随机1D投影上测试,而非全维度。 LeVJEPA是一种自监督视频预训练方法,以开源代码、权重和检查点发布。 它通过将同一视频片段的全局和局部裁剪的嵌入推到一起(不变性损失)来学习视频表示,同时一个名为SIGReg的正则化器强制嵌入趋向各向同性高斯分布,以可证明地防止表示坍缩。 与V-JEPA和V-JEPA 2不同,它使用一个带有投影器的单一共享编码器,没有目标网络、没有预测器和没有梯度停止。 每个视图丢弃95%的令牌,使用块因果注意力(每帧仅关注过去的帧),并具有单一损失权重。 它纯粹作为表示学习者通过冻结探针在ImageNet-1K、Something-Something-v2和Kinetics-400上评估,不在任何机器人上。 我发现有趣的是,V-JEPA和V-JEPA 2需要EMA目标编码器、梯度停止和容量受限的预测器来避免坍缩;LeVJEPA放弃所有这些,使用一个共享编码器加投影器,而是通过SIGReg正则化器在可证明的保证和单一超参数下防止坍缩。 JEPA中的“P”(预测器)实际上已消失。 LeVJEPA的计算强度也更低: - 总预训练计算比V-JEPA 2低5.6倍到20.8倍 - 在匹配FLOPs下,ImageNet-1K上高7.6个百分点 - 在8GB内存中以批量大小128训练,而V-JEPA 2在批量大小28时饱和 值得一提的是:ImageNet-1K准确率随着令牌丢弃率单调上升,从rho = 0时的33.9%到rho = 0.95时的47.6%。 激进的丢弃实际上在进行正则化工作。 关于JEPA与DINO的争论: - 在ImageNet-1K上(外观、静态)输给DINOv2 3.1个百分点 - 但在Something-Something-v2上(运动、时序)以近2倍的优势获胜 - 并在ViT-L上以5.6倍更低的成本击败V-JEPA 2 1.9个百分点。 -> 针对每个计算美元的时序和运动理解进行优化。
查看原文
查看缓存全文

缓存时间: 2026/09/01 19:47

新世界模型:@ylecun团队再次推出高效模型!

本项目成员包括@ylecun、@lukaskuhn77、@lucasmaes_、@quentinlldc和@randall_balestr。

首先明确定义:

  • DINO:无标签自蒸馏。这是一种自监督图像模型(Meta, 2021),其中学生网络学习在图像的两个裁剪版本上匹配教师网络(自身EMA副本),无需标签和负样本。
  • SIGReg:一种正则化器,通过强制嵌入匹配各向同性高斯分布来防止嵌入坍缩,通过在多个随机一维投影上使用正态性检验(Epps–Pulley)进行测试,而非全维度检验。

LeVJEPA是一种自监督视频预训练方法,已开源代码、权重和检查点。 它通过拉近同一视频片段的全局和局部裁剪嵌入(不变性损失)来学习视频表示,同时名为SIGReg的正则化器强制嵌入向各向同性高斯分布收敛,从而可证明地防止表示坍缩。

与V-JEPA和V-JEPA 2不同,它使用单一共享编码器配合投影器,无需目标网络、预测器和梯度停止。 它在每个视角丢弃95%的token,采用分块因果注意力机制(每帧仅关注过去帧),并使用单一损失权重。

评估纯粹作为表示学习器,通过在ImageNet-1K、Something-Something-v2和Kinetics-400上进行冻结探针测试,而非任何机器人任务。

有趣的是,V-JEPA和V-JEPA 2需要EMA目标编码器、梯度停止和容量受限的预测器来避免坍缩;LeVJEPA则通过单一共享编码器加投影器实现了这一点,转而使用SIGReg正则化器在可证明保证和单一超参数下防止坍缩。 JEPA中的“P“(预测器)实际上已消失。

LeVJEPA计算强度也更低:

  • 总预训练计算量比V-JEPA 2低5.6倍至20.8倍
  • 在匹配FLOPs下,ImageNet-1K准确率高7.6个百分点
  • 可在8GB显存中以批大小128训练,而V-JEPA 2在批大小28时即达到饱和

另外值得注意:ImageNet-1K准确率随token丢弃率单调上升,从ρ=0时的33.9%提升至ρ=0.95时的47.6%。 这种激进丢弃实际上起到了正则化作用。

关于JEPA与DINO的争论:

  • 在ImageNet-1K(外观/静态)上落后DINOv2 3.1个百分点
  • 但在Something-Something-v2(运动/时序)上以近2倍优势胜出
  • 在ViT-L架构上以5.6倍更低的成本超越V-JEPA 2达1.9个百分点 -> 在单位计算成本下针对时序和运动理解进行了优化。

感谢GPT

让我们开始吧,敬请期待!

确实如此!

简言之,你想说什么?

这不是视频模型,它不会生成视频或图像作为输出 他们确实做到了

相似文章

LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构

Papers with Code Trending

LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。