SiamJEPA:论JEPA中孪生学生编码器的作用

Hugging Face Daily Papers 论文

摘要

本文提出SiamJEPA,它在JEPA模型中使用带有EMA教师网络的遮蔽孪生学生编码器,与单编码器变体和MAE相比,显示出改进的表示可分性和训练效率。

最近,联合嵌入预测架构(JEPA)作为自监督表示学习的一种有前景框架,已在计算机视觉和机器学习社区引起广泛关注。与重建像素的掩码自编码器不同,JEPA模型通过预测掩码区域的潜在嵌入来学习表示。现有的基于JEPA的方法(如I-JEPA和V-JEPA)通常在学生网络中使用单个编码器。相比之下,使用孪生编码器作为学生网络更自然地符合受大脑启发的表示学习框架,但它们在JEPA模型中的作用尚未得到充分探索。在本文中,我们研究了孪生学生编码器在基于JEPA的表示学习中的效果。为此,我们提出了SiamJEPA,即配备指数移动平均(EMA)教师网络的掩码孪生学生编码器。SiamJEPA也可以看作是受大脑启发的表示学习模型PhiNet的JEPA表述。通过在ImageNet线性探测上的大量实验,我们证明孪生编码器作为JEPA目标的有效正则化器,提高了表示可分性并加速了训练早期的学习。此外,在有限的训练预算下,SiamJEPA始终优于可比单编码器JEPA变体,并且实现了比需要更长训练的掩码自编码器(MAE)更高的线性探测准确率。我们的发现表明,孪生学生编码器不仅是一种架构选择,而且是预测性表示学习的重要归纳偏置。这些结果为基于JEPA的模型设计提供了新的见解,并表明结合孪生学生架构为改进自监督表示学习提供了一种简单而有效的方法。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:53

论文页面 - SiamJEPA:论JEPA中孪生学生编码器的作用

来源:https://huggingface.co/papers/2607.04044

摘要

JEPA模型中的孪生学生编码器通过有效的正则化提升了表示的可分离性和训练效率,在有限训练预算下优于单编码器变体和MAE。

近年来,联合嵌入预测架构(https://huggingface.co/papers?q=Joint%20Embedding%20Predictive%20Architectures)(JEPA(https://huggingface.co/papers?q=JEPAs))作为自监督表示学习(https://huggingface.co/papers?q=representation%20learning)的一个有前景的框架,在计算机视觉和机器学习领域引起了广泛关注。与重建像素的掩码自编码器(https://huggingface.co/papers?q=masked%20autoencoders)不同,JEPA模型通过预测掩码区域的潜在嵌入来学习表示。现有的基于JEPA的方法(如I-JEPA和V-JEPA)通常在学生网络中采用单个编码器。相比之下,在学生网络中使用孪生编码器(https://huggingface.co/papers?q=Siamese%20encoders)更自然地符合受大脑启发的表示学习(https://huggingface.co/papers?q=representation%20learning)框架,然而它们在JEPA模型中的作用在很大程度上尚未被探索。在本文中,我们研究了孪生学生编码器在基于JEPA的表示学习(https://huggingface.co/papers?q=representation%20learning)中的效果。为此,我们提出了SiamJEPA,即配备指数移动平均(https://huggingface.co/papers?q=exponential%20moving%20average)(EMA)教师网络(https://huggingface.co/papers?q=teacher%20network)的掩码孪生学生编码器。SiamJEPA也可被视为受大脑启发的表示学习(https://huggingface.co/papers?q=representation%20learning)模型PhiNet的一种JEPA形式。通过在ImageNet线性探测(https://huggingface.co/papers?q=linear%20probing)上的大量实验,我们证明孪生编码器(https://huggingface.co/papers?q=Siamese%20encoders)作为JEPA目标的有效正则化器,改善了表示的可分离性,并在训练初期加速了学习过程。此外,在有限训练预算下,SiamJEPA始终优于可比的单编码器JEPA变体,并且比需要更长时间训练的掩码自编码器(https://huggingface.co/papers?q=Masked%20Autoencoders)(MAE)获得了更高的线性探测(https://huggingface.co/papers?q=linear%20probing)准确率。我们的发现表明,孪生学生编码器不仅仅是架构上的选择,更是预测性表示学习(https://huggingface.co/papers?q=representation%20learning)中的重要归纳偏置(https://huggingface.co/papers?q=inductive%20bias)。这些结果为基于JEPA的模型设计提供了新见解,并表明融入孪生学生架构是改进自监督表示学习(https://huggingface.co/papers?q=representation%20learning)的一种简单而有效的方法。

查看arXiv页面(https://arxiv.org/abs/2607.04044)查看PDF(https://arxiv.org/pdf/2607.04044)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.04044)

在你的agent中获取此论文:

hf papers read 2607\.04044

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0个

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.04044 以将其链接到此页面。

引用本论文的数据集0个

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.04044 以将其链接到此页面。

引用本论文的Space0个

没有Space链接到此论文

在Space README.md 中引用 arxiv.org/abs/2607.04044 以将其链接到此页面。

包含本论文的收藏1个

相似文章

注解版JEPA

Hacker News Top

联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。

SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学

arXiv cs.LG

SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。

无奖励的表征:JEPA对LLM微调的审计

arXiv cs.LG

本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。