@TheTuringPost: 来自@ylecun、@randall_balestr及其同事的一篇新论文,扩展了LeJEPA——这次应用于视频。LeVJEPA的目标是m…

X AI KOLs Timeline 论文

摘要

LeVJEPA将LeJEPA扩展到视频以实现高效训练,仅使用一个编码器和投影器处理5%的视频块,在计算量显著降低的情况下匹配或超越V-JEPA 2。

来自@ylecun、@randall_balestr及其同事的一篇新论文,扩展了LeJEPA——这次应用于视频。 LeVJEPA的目标是大幅降低视频训练的成本并简化流程。 为此,它仅使用一个编码器加一个小型投影器。投影器在之后被丢弃 ↓ LeVJEPA的工作原理如下: 1. 它获取相同的16帧视频剪辑并创建多个版本:一个完整视图和几个裁剪/增强视图。相同的编码器处理所有这些。 2. 然后模型学习做两件事: - 识别同一视频的不同视图并保持其表示相似。 - 避免为所有内容学习相同的表示。SIGReg(LeJEPA中使用的正则化方法)防止表示坍塌,保持其多样性。 这两个设计选择也使LeVJEPA更加高效: → 在训练过程中,它仅处理5%的视频块。其他95%被随机丢弃以减少计算量。 → 注意力机制在时间上是因果的:每一帧仅使用当前和之前的帧,模型随着新帧的到来更新其表示。 这对于流式视频和持续运行的世界模型至关重要,它们需要随着新观察的到来更新其“理解”。 得益于所有这些,LeVJEPA在训练轮次匹配的情况下,以5.6–20.8倍更少的训练计算量匹配或超越V-JEPA 2。
查看原文
查看缓存全文

缓存时间: 2026/08/30 12:18

@ylecun、@randall_balestr 及其团队发布了一篇新论文,将LeJEPA框架扩展至视频领域。

LeVJEPA的核心目标是让视频训练过程变得更加经济高效。

为实现这一目标,该模型仅采用单一编码器配合轻量级投影器。训练完成后投影器即被舍弃 ↓

LeVJEPA的工作机制如下:

  1. 模型接收相同的16帧视频片段,并生成多种变体版本:一个完整视角配合多个裁剪/增强视角。所有版本均由同一编码器处理。

  2. 随后模型同步学习两项任务:

  • 识别同一视频的不同视角并保持其表征一致性。
  • 避免对所有内容生成相同表征。LeJEPA采用的SIGReg正则化方法能防止表征坍缩,保持多样性。

这两项设计选择同样提升了LeVJEPA的效率:

→ 训练过程中仅处理5%的视频块,随机丢弃其余95%以降低计算负荷。

→ 注意力机制具备时间因果性:每帧仅参考当前帧及前序帧,模型能随新帧输入持续更新表征。

这一特性对流式视频与世界模型尤为重要——这类系统需持续运行,并随着新观测数据的输入不断更新其“理解能力“。

基于上述优化,LeVJEPA在匹配训练周期的前提下,以5.6–20.8倍的计算效率提升,达到了与V-JEPA 2相当甚至更优的性能。

相似文章

AV-JEPA: 将LeJEPA扩展到音视频自监督学习

arXiv cs.AI

AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。

注解版JEPA

Hacker News Top

联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。