@LeoKharon: 新世界模型:ylecun的团队带着高效模型回归!此项目涉及@ylecun、@lukaskuhn77、@lucasmae…
摘要
LeVJEPA引入了一种更高效的自监督视频预训练方法,通过消除对目标网络和预测器的需求,使用带有SIGReg正则化器的单一共享编码器,并以更低的计算成本实现有竞争力的性能。
查看缓存全文
缓存时间: 2026/09/01 19:47
新世界模型:@ylecun团队再次推出高效模型!
本项目成员包括@ylecun、@lukaskuhn77、@lucasmaes_、@quentinlldc和@randall_balestr。
首先明确定义:
- DINO:无标签自蒸馏。这是一种自监督图像模型(Meta, 2021),其中学生网络学习在图像的两个裁剪版本上匹配教师网络(自身EMA副本),无需标签和负样本。
- SIGReg:一种正则化器,通过强制嵌入匹配各向同性高斯分布来防止嵌入坍缩,通过在多个随机一维投影上使用正态性检验(Epps–Pulley)进行测试,而非全维度检验。
LeVJEPA是一种自监督视频预训练方法,已开源代码、权重和检查点。 它通过拉近同一视频片段的全局和局部裁剪嵌入(不变性损失)来学习视频表示,同时名为SIGReg的正则化器强制嵌入向各向同性高斯分布收敛,从而可证明地防止表示坍缩。
与V-JEPA和V-JEPA 2不同,它使用单一共享编码器配合投影器,无需目标网络、预测器和梯度停止。 它在每个视角丢弃95%的token,采用分块因果注意力机制(每帧仅关注过去帧),并使用单一损失权重。
评估纯粹作为表示学习器,通过在ImageNet-1K、Something-Something-v2和Kinetics-400上进行冻结探针测试,而非任何机器人任务。
有趣的是,V-JEPA和V-JEPA 2需要EMA目标编码器、梯度停止和容量受限的预测器来避免坍缩;LeVJEPA则通过单一共享编码器加投影器实现了这一点,转而使用SIGReg正则化器在可证明保证和单一超参数下防止坍缩。 JEPA中的“P“(预测器)实际上已消失。
LeVJEPA计算强度也更低:
- 总预训练计算量比V-JEPA 2低5.6倍至20.8倍
- 在匹配FLOPs下,ImageNet-1K准确率高7.6个百分点
- 可在8GB显存中以批大小128训练,而V-JEPA 2在批大小28时即达到饱和
另外值得注意:ImageNet-1K准确率随token丢弃率单调上升,从ρ=0时的33.9%提升至ρ=0.95时的47.6%。 这种激进丢弃实际上起到了正则化作用。
关于JEPA与DINO的争论:
- 在ImageNet-1K(外观/静态)上落后DINOv2 3.1个百分点
- 但在Something-Something-v2(运动/时序)上以近2倍优势胜出
- 在ViT-L架构上以5.6倍更低的成本超越V-JEPA 2达1.9个百分点 -> 在单位计算成本下针对时序和运动理解进行了优化。
感谢GPT
让我们开始吧,敬请期待!
确实如此!
酷
简言之,你想说什么?
这不是视频模型,它不会生成视频或图像作为输出 他们确实做到了
相似文章
@TheTuringPost: 来自@ylecun、@randall_balestr及其同事的一篇新论文,扩展了LeJEPA——这次应用于视频。LeVJEPA的目标是m…
LeVJEPA将LeJEPA扩展到视频以实现高效训练,仅使用一个编码器和投影器处理5%的视频块,在计算量显著降低的情况下匹配或超越V-JEPA 2。
LeWorldModel:从像素出发的稳定端到端联合嵌入预测架构
LeWorldModel 提出了一种稳定的端到端联合嵌入预测架构(JEPA),可直接从像素进行训练,仅需极少超参数,并具有可证明的反坍塌保证。与基础模型相比,它在规划速度上实现了显著提升,同时在机器人操作任务中保持了具有竞争力的性能。
@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。
LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。
@LeRobotHF: VLA-JEPA 刚刚在 LeRobot 中发布。这个模型的特别之处在于它不仅学习从观测中采取什么行动……
VLA-JEPA,一种集成了 JEPA 世界模型以学习动作相关动态的新模型,已在 LeRobot 中发布。它支持使用人类视频进行预训练,仅需少量微调即可获得强大性能,并在 NVIDIA DGX Spark 上实时运行。
@LiorOnAI: 大多数世界模型预测接下来会发生什么。Sora预测像素,JEPA压缩观察结果。NEO试图弄清楚…
NEO是一种新型世界模型,它能够从原始观察中自行发现可重用的解释构建块,无需监督或语言,被选为ICML 2026的口头报告。