@TheTuringPost: 来自@ylecun、@randall_balestr及其同事的一篇新论文,扩展了LeJEPA——这次应用于视频。LeVJEPA的目标是m…
摘要
LeVJEPA将LeJEPA扩展到视频以实现高效训练,仅使用一个编码器和投影器处理5%的视频块,在计算量显著降低的情况下匹配或超越V-JEPA 2。
查看缓存全文
缓存时间: 2026/08/30 12:18
@ylecun、@randall_balestr 及其团队发布了一篇新论文,将LeJEPA框架扩展至视频领域。
LeVJEPA的核心目标是让视频训练过程变得更加经济高效。
为实现这一目标,该模型仅采用单一编码器配合轻量级投影器。训练完成后投影器即被舍弃 ↓
LeVJEPA的工作机制如下:
-
模型接收相同的16帧视频片段,并生成多种变体版本:一个完整视角配合多个裁剪/增强视角。所有版本均由同一编码器处理。
-
随后模型同步学习两项任务:
- 识别同一视频的不同视角并保持其表征一致性。
- 避免对所有内容生成相同表征。LeJEPA采用的SIGReg正则化方法能防止表征坍缩,保持多样性。
这两项设计选择同样提升了LeVJEPA的效率:
→ 训练过程中仅处理5%的视频块,随机丢弃其余95%以降低计算负荷。
→ 注意力机制具备时间因果性:每帧仅参考当前帧及前序帧,模型能随新帧输入持续更新表征。
这一特性对流式视频与世界模型尤为重要——这类系统需持续运行,并随着新观测数据的输入不断更新其“理解能力“。
基于上述优化,LeVJEPA在匹配训练周期的前提下,以5.6–20.8倍的计算效率提升,达到了与V-JEPA 2相当甚至更优的性能。
相似文章
AV-JEPA: 将LeJEPA扩展到音视频自监督学习
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。
@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。
LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。
@LeRobotHF: VLA-JEPA 刚刚在 LeRobot 中发布。这个模型的特别之处在于它不仅学习从观测中采取什么行动……
VLA-JEPA,一种集成了 JEPA 世界模型以学习动作相关动态的新模型,已在 LeRobot 中发布。它支持使用人类视频进行预训练,仅需少量微调即可获得强大性能,并在 NVIDIA DGX Spark 上实时运行。
@LeoKharon: 新世界模型:ylecun的团队带着高效模型回归!此项目涉及@ylecun、@lukaskuhn77、@lucasmae…
LeVJEPA引入了一种更高效的自监督视频预训练方法,通过消除对目标网络和预测器的需求,使用带有SIGReg正则化器的单一共享编码器,并以更低的计算成本实现有竞争力的性能。
注解版JEPA
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。