AV-JEPA: 将LeJEPA扩展到音视频自监督学习
摘要
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。
arXiv:2607.15295v1 公告类型:交叉
摘要:我们提出了AV-JEPA,这是LeJEPA到音视频自监督学习的一个优雅的多模态扩展。模型采用早期融合的视觉Transformer和模态丢弃作为掩码,训练目标是使全局视图和每个模态局部视图的嵌入对齐,同时SIGReg目标函数鼓励理论上最优的分布。这就在潜在空间中实现了跨模态对齐,从而得到了一个极为简洁的架构,没有解码器、EMA教师网络、复杂的多目标损失或对比负样本。所提出的AV-JEPA主干在VGGSound(top-1准确率57.1%)和AudioSet(mAP 32.7)上取得了有竞争力的分类性能,并原生支持零样本音视频检索。
查看缓存全文
缓存时间: 2026/07/20 09:24
# 将 LeJEPA 扩展到音视频自监督学习
来源:https://arxiv.org/html/2607.15295
###### 摘要
我们提出 AV-JEPA,这是 LeJEPA 在音视频自监督学习方面的一种简洁多模态扩展。通过使用早期融合视觉 Transformer 和*模态丢弃作为掩码*,该模型被训练为对齐全局视图和每个模态局部视图的嵌入,同时 SIGReg 目标鼓励理论上最优的分布。这实现了潜在空间中的跨模态对齐,从而产生了一个非常干净的架构,没有解码器、EMA 教师、复杂的多损失项或对比负样本。所提出的 AV-JEPA 主干网络在 VGGSound(57.1% top-1)和 AudioSet(32.7 mAP)上提供了具有竞争力的分类性能,并开箱即用地支持零样本音视频检索。
自监督学习、音频、视频、JEPA、多模态
## 1 引言
自监督学习(SSL)已成为从无标签数据中学习高质量表示的主流范式。在音视频领域,主流方法是*掩码自编码*:诸如 AV-MAE(Georgescu 等,2023(https://arxiv.org/html/2607.15295#bib.bib8))、CAV-MAE(Gong 等,2023(https://arxiv.org/html/2607.15295#bib.bib11))、MAViL(Huang 等,2023(https://arxiv.org/html/2607.15295#bib.bib14))和 CAV-MAE Sync(Araujo 等,2025(https://arxiv.org/html/2607.15295#bib.bib1))等模型通过专门的解码器网络重建掩码的音频频谱图和视频 patches。虽然这些方法有效,但它们缺乏关于嵌入质量的正式保证,并且需要架构开销,例如单独的解码器、精心调整的掩码比率或对比负对损失。
另一种范式,*联合嵌入预测架构*(JEPA,LeCun,2022(https://arxiv.org/html/2607.15295#bib.bib15)),完全避免了重建,而是在潜在空间中操作:模型学习从一个视图的嵌入预测另一个视图。最近,LeJEPA(Balestriero & LeCun,2025(https://arxiv.org/html/2607.15295#bib.bib3))为 JEPA 建立了严格的理论基础,证明了各向同性高斯分布是用于最小化下游预测风险唯一最优的嵌入分布,并通过*草图各向同性高斯正则化*(SIGReg)强制执行。然而,LeJEPA 仅在单模态视觉任务上得到验证。
具体来说,我们问道:*“JEPA 能否实现跨模态音视频对齐,特别是产生强大的音频表示,而无需解码器、对比负样本、EMA 教师、停止梯度或逐模态预训练?”*我们将 LeJEPA 扩展到音视频场景,提出 AV-JEPA。我们的主要贡献是:(i)将基于 JEPA 的自监督学习扩展到音视频表示学习;(ii)*跨模态视图生成*,其中局部视图在仅音频和仅视频输入(另一模态置零)之间交替,在潜在空间中创建隐式跨模态预测任务;(iii)早期融合 ViT 架构,通过单个共享 Transformer 联合处理两种模态;(iv)来自我们主要实验(AudioSet-2M 预训练后微调)的经验结果,显示生成的主干网络在 VGGSound 上达到 57.1% top-1,在 AudioSet 上达到 32.7 mAP,单模态分解确认了强音频驱动表示,并开箱即用地支持跨模态检索。定性地说,仅从 JEPA 目标出发,无需任何定位监督,就能自然地产生对声源的有意义的跨模态注意力。
视频片段音频频谱图3×16×224×2243\{\times\}16\{\times\}224\{\times\}2241×128×8011\{\times\}128\{\times\}801全局视图 1视频音频全局视图 2视频音频局部视图 1∅\\varnothing音频(仅音频)局部视图 2视频∅\\varnothing(仅视频)编码器共享 ViT-Base12 层,768 维投影器768→2048→2048→128768\{\\to\}2048\{\\to\}2048\{\\to\}128线性探针LN + Linear on [CLS]注意力探针Query + CrossAttndetachedLeJEPA 损失L=(1−λ)∑i‖z̄−zi‖2+λSIGReg({zi})\\mathcal\{L\}=(1-\lambda)\\\!\sum\_i\|\bar\{\{\bm\{z\}\}\}-\{\bm\{z\}\}\_i\|^2+\lambda\\,\mathrm\{SIGReg\}(\{\{\bm\{z\}\}\_i\})交叉熵损失309 类
图 1:AV-JEPA 训练流水线。每个片段被划分为 G=2G\{=\}2 个全局视图(两种模态)和 K=2K\{=\}2 个局部视图(交替为仅音频/仅视频,缺失模态置零)。所有视图通过共享的 ViT-Base 早期融合编码器,处理视频管状块和音频梅尔频谱图 patches。LeJEPA 损失将每个视图嵌入拉向联合模态中心 z̄\\bar\{\{\bm\{z\}\}\},同时 SIGReg 强制执行各向同性高斯嵌入分布。在 VGGSound 预训练期间,我们额外附加了解耦的线性分类探针和注意力分类探针。
## 2 方法
AV-JEPA 通过 (i) 将两种模态嵌入到单个 token 序列中的早期融合架构,以及 (ii) 使用模态丢弃作为部分视图机制的视图生成策略,将 LeJEPA 适应于跨模态音视频学习。完整流水线如图 1 (https://arxiv.org/html/2607.15295#S1.F1) 所示。
#### LeJEPA 损失
LeJEPA(Balestriero & LeCun,2025 (https://arxiv.org/html/2607.15295#bib.bib3))表明,各向同性高斯分布 N(0,I)\\mathcal\{N\}(\{\bm\{0\}\},\{\bm\{I\}\}) 对于线性和非线性下游探针都是最优嵌入分布,并通过 SIGReg 强制执行:这是一种切片特征函数检验,将嵌入投影到 M 个随机单位范数方向,并通过 Epps-Pulley 检验将每个单变量投影与高斯目标匹配。给定 G 个全局视图和 K 个局部视图,嵌入为 zi=Proj(fθ(xi))\{\bm\{z\}\}\_i=\mathrm\{Proj\}(f\_\{\theta\}(\{\bm\{x\}\}\_i)),联合视图中心为 z̄=1G∑g=1Gzg\\bar\{\{\bm\{z\}\}\}=\tfrac\{1\}\{G\}\sum\_\{g=1\}^G\{\bm\{z\}\}\_g,LeJEPA 损失为
L=(1−λ)1G+K∑i=1G+K‖z̄−zi‖2⏟不变性+λSIGReg({zi})⏟正则化,\\mathcal\{L\}=(1-\lambda)\,\underbrace\{\frac\{1\}\{G+K\}\sum\_\{i=1\}^\{G+K\}\|\bar\{\{\bm\{z\}\}\}-\{\bm\{z\}\}\_i\|^2\}\_\{\text\{不变性\}\}\;+\;\lambda\,\underbrace\{\vphantom\{\sum\_\{i=1\}^\{G+K\}\}\mathrm\{SIGReg\}(\{\{\bm\{z\}\}\_i\})\}\_\{\text\{正则化\}\}, (1)
其中 λ\\lambda 是单个权衡标量。
#### 音频-视频早期融合编码器
原始音频被重采样到 16 kHz 并转换为 1×128×8011\{\times\}128\{\times\}801 梅尔频谱图(128 个梅尔频段,8 秒片段产生 801 个时间帧);16×1616\{\times\}16 Conv2D patch 嵌入产生 8×50=4008\{\times\}50\{=\}400 个音频 token,带有因式分解的(频率,时间)位置嵌入。形状为 3×T×224×2243\{\times\}T\{\times\}224\{\times\}224(T=16T\{=\}16)的视频帧由 2×16×162\{\times\}16\{\times\}16 Conv3D 管状块进行 token 化,得到 1568 个视频 token,带有因式分解的(空间,时间)位置嵌入。一个可学习的 [CLS] token 被附加在开头:
[CLS;v1,...,v1568;a1,...,a400],[\texttt\{CLS\};\,\{\bm\{v\}\}\_1,\ldots,\{\bm\{v\}\}\_\{1568\};\,\{\bm\{a\}\}\_1,\ldots,\{\bm\{a\}\}\_\{400\}], (2)
并添加学习到的模态类型嵌入(ID 0 = 视频,ID 1 = 音频)以区分模态。完整的 1969 个 token 序列由 ViT-Base(Dosovitskiy 等,2021 (https://arxiv.org/html/2607.15295#bib.bib6))编码器(12L,d=768d\{=\}768,12 头)处理。[CLS] 输出通过一个 3 层 MLP(768→2048→2048→128768\{\to\}2048\{\to\}2048\{\to\}128,BatchNorm,GELU)投影,然后应用 LeJEPA 损失。完整编码器示意图请参见图 5 (https://arxiv.org/html/2607.15295#A12.F5)。
#### 模态丢弃作为部分视图机制
标准 LeJEPA 通过空间增强生成视图多样性。我们添加了一个音视频轴:每个 10 秒片段被分成两个时间偏移的 8 秒裁剪,用于形成两个全局视图(两种模态都存在,轻度增强)和两个局部视图,一个仅音频(视频 token 置零),一个仅视频(音频 token 置零,视频采用标准增强)。然后,方程 1 (https://arxiv.org/html/2607.15295#S2.E1) 中的不变性项将每个单模态嵌入推向联合模态中心 z̄\\bar\{\{\bm\{z\}\}\},因此模型必须仅从音频学习一个能够预测联合音频-视频表示的嵌入(反之亦然)。跨模态对齐完全发生在潜在空间中,没有解码器或重建目标。SIGReg 同时防止这些由丢弃引起的嵌入坍塌。
#### 在线探针
在带有标签的 VGGSound 数据集上,我们额外训练两个分类头,作用于*解耦的*主干特征:线性探针(LayerNorm + 线性层作用于 [CLS])和注意力探针(一个可学习查询,12 头交叉注意力作用于 patch token),两者都使用交叉熵和标签平滑 0.1,学习率为 10−310^{-3}。
## 3 实验
我们的主要实验在 AudioSet-2M(Gemmeke 等,2017 (https://arxiv.org/html/2607.15295#bib.bib7))上预训练 AV-JEPA,并在 VGGSound(Chen 等,2020 (https://arxiv.org/html/2607.15295#bib.bib5))上微调生成的主干网络,用于音视频分类(第 3.1 节 (https://arxiv.org/html/2607.15295#S3.SS1))。我们还使用相同的 AudioSet 预训练主干网络在 AudioSet 本身上进行微调(第 3.2 节 (https://arxiv.org/html/2607.15295#S3.SS2)),作为预训练迁移到其源分布的合理性检查,并探测跨模态检索(第 3.3 节 (https://arxiv.org/html/2607.15295#S3.SS3)),作为学习到的嵌入空间真正跨模态共享的补充检查。作为受控的辅助研究,我们还在 VGGSound 上单独进行预训练(和微调),将 JEPA 目标的贡献与数据规模分离。所有运行共享相同的 ViT-Base 早期融合编码器和 LeJEPA 方案,仅在预训练数据集、批次大小和训练预算上有所不同。
#### 数据集
AudioSet(Gemmeke 等,2017 (https://arxiv.org/html/2607.15295#bib.bib7)):约 2M 个 YouTube 片段,跨 527 个声音类别的多标签(不平衡分割用于预训练和下游微调;20k 平衡子集用于 AS-20k)。VGGSound(Chen 等,2020 (https://arxiv.org/html/2607.15295#bib.bib5)):约 184k 训练 / 15k 测试 10 秒片段,涵盖 309 个音视频事件类别。
#### 预训练
我们在 8× 个 NVIDIA H200 GPU(DDP,bf16)上使用 AdamW(Loshchilov & Hutter,2019 (https://arxiv.org/html/2607.15295#bib.bib16))训练 AV-JEPA,学习率为 5×10−45\{\times\}10^{-4},权重衰减 0.05,线性预热占训练的 15%,然后余弦衰减至 10−610^{-6},梯度裁剪 5.0,G=2G\{=\}2 个全局视图和 K=2K\{=\}2 个跨模态局部视图,λ=0.05\\lambda\{=\}0.05。AudioSet-2M 预训练运行 57 个 epoch,批次大小为 40/GPU(有效 320);较小的仅 VGGSound 运行使用 50 个 epoch,批次大小为 50/GPU(有效 400)。两种设置下的预训练损失都单调递减(图 2 (https://arxiv.org/html/2607.15295#S3.F2)),每维度嵌入标准差从约 0.8 上升到约 1.01(AudioSet)(VGGSound 上从约 0.8 到约 1.01),证实 SIGReg 在两种尺度下都收敛到各向同性高斯目标。
参见图注 (a) AudioSet-2M(57 ep.)
参见图注 (b) VGGSound(50 ep.)
图 2:LeJEPA 预训练损失,在 (a) AudioSet-2M 和 (b) VGGSound 上,分解为加权不变性和 SIGReg 项。两者都稳步下降,没有坍塌迹象。
#### 微调
我们在 [CLS] 之上附加一个 LayerNorm + 线性分类器(带有一个辅助注意力头),并解冻整个主干网络。AdamW,头学习率为 2×10−42\{\times\}10^{-4},主干网络低学习率(对于 AS-2M→VGGSound 主要结果为主干学习率 0.05× 头学习率,对于受控和 AudioSet 运行为 0.1×),权重衰减 0.05,标签平滑 0.1,梯度裁剪 1.0,预热 5% 然后余弦衰减至 10−710^{-7},bf16。我们在 4× 个 NVIDIA H200 上微调 VGGSound 13 个 epoch(受控仅 VGGS 研究为 6 个 epoch),在 8×(AS-2M,约 29 个 epoch)和 2×(AS-20k,约 46 个 epoch)H200 上微调 AudioSet,报告沿轨迹的最佳 top-1(分别为 mAP),并采用多片段聚合。
### 3.1 VGGSound 上的音视频分类
表 1 (https://arxiv.org/html/2607.15295#S3.T1) 比较了 AV-JEPA 与 VGGSound 上最先进的音视频 SSL 方法。经过 57 个 epoch 的 AudioSet 预训练和 13 个 epoch 的微调,AV-JEPA 使用注意力头达到 57.1% top-1,使用线性头达到 56.6%。据我们所知,这是基于 JEPA 的方法首次达到这样的分类精度水平。
表 1:VGGSound 上的音视频分类。AV-JEPA 是唯一基于 JEPA 的方法。主要结果(顶部)在 VGGSound 上微调了 AS-2M 预训练主干网络;中间报告了仅 VGGSound 的受控研究;底部列出了已发表的基于 MAE 的基线。MethodTypePre-trainEpochsEvalTop-1AS-2M→VGGS fine-tune (ours, headline)AV-JEPA (ours)JEPAAS-2M57+13FT (Att.)57.1AV-JEPA (ours)JEPAAS-2M57+13FT (Lin.)56.6Controlled VGGS-only (ours)AV-JEPA (ours)JEPAVGGS50+6FT49.8AV-JEPA (ours)JEPAVGGS50Att. (frozen)48.6AV-JEPA (ours)JEPAVGGS50Lin. (frozen)46.0LiteratureMAViLMAEAS-2M+IN80+60FT67.1CAV-MAEMAEAS-2M25+10FT65.4AV-MAEMAEVGGS800+50FT63.5CAV-MAE SyncMAEAS-2M25Lin. (frozen)52.7AV-MAE(Georgescu 等,2023 (https://arxiv.org/html/2607.15295#bib.bib8))、CAV-MAE(Gong 等,2023 (https://arxiv.org/html/2607.15295#bib.bib11))和 MAViL(Huang 等,2023 (https://arxiv.org/html/2607.15295#bib.bib14))的端到端微调结果(63–67%)更高,但这些方法依赖于重建解码器和对比目标,特别是 AV-MAE 预训练多达 800 个 epoch,MAViL 添加了 ImageNet 预训练的视觉编码器。剩余的差距与这些架构优势、缺乏特定视频的预训练阶段以及这是音视频设置中的首个 JEPA 配方一致。
### 3.2 AudioSet 上的音频分类
表 2:AudioSet 评估分割上的音视频 mAP。AV-JEPA 将 57 epoch 的 AS-2M 预训练主干网络端到端微调在完整的 AS-2M 集(约 29 个 epoch)和平衡的 AS-20k 子集(约 46 个 epoch)上,并在推理时报告逐模态(仅音频、仅视频)评估。Epochs 列列出了 AudioSet-2M 预训练 epoch。基线报告联合 A+V mAP。†线性探针。MethodTypePre-trainEpochsEvalAS-2MAS-20kEnd-to-end fine-tuning (ours)AV-JEPAJEPAAS-2M57A+V32.729.6AV-JEPAJEPAAS-2M57A-only26.023.7AV-JEPAJEPAAS-2M57V-only12.810.3Baselines (end-to-end fine-tuning)AV-MAEMAEAS-2M100A+V47.3–CAV-MAEMAEAS-2M25A+V51.242.0MAViLMAEAS-2M+IN80A+V53.344.9CAV-MAE SyncMAEAS-2M–A+V–30.5†表 2 (https://arxiv.org/html/2607.15295#S3.T2) 报告了在 AS-2M 上端到端微调 AS-2M 预训练 AV-JEPA 主干网络后的 AudioSet mAP。模型在 AudioSet 评估分割上达到 32.7 mAP。逐模态分解(仅音频 26.0 对比仅视频 12.8)显示清晰的音频主导:JEPA 目标产生的主干网络,其决策主要由音频承载,这与音频在许多 AudioSet 类别中的主导作用一致。基于 MAE 的基线通过专用重建解码器和对比目标(对于 MAViL,还有 ImageNet 预训练编码器)达到 42–53 mAP;缩小这一差距留待未来工作。相似文章
注解版JEPA
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。
@TheTuringPost: 来自@ylecun、@randall_balestr及其同事的一篇新论文,扩展了LeJEPA——这次应用于视频。LeVJEPA的目标是m…
LeVJEPA将LeJEPA扩展到视频以实现高效训练,仅使用一个编码器和投影器处理5%的视频块,在计算量显著降低的情况下匹配或超越V-JEPA 2。
@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。
LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。
DVD-JEPA:一个开源、完全可复现的JEPA世界模型 [P]
DVD-JEPA 是一个开源、极简的 JEPA 世界模型,它通过预测未来嵌入而非像素来从视频中学习表示。它使用弹跳的 DVD 标志来演示位置恢复、梦境生成和异常检测,所有这些都在浏览器中运行。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。