标签
本文介绍了AC-MTM,一种对比逆动态方法,用于防止JEPA世界模型中的编码器崩溃,在多物体任务中无需高斯约束即可提升性能。
本文建立了概率联合嵌入预测学习(JEPA)与隐马尔可夫模型(HMM)之间的理论联系,提供了状态空间解释,并引入了马尔可夫链JEPA以增强一致性。
提出动作条件预测一致性(ACPC),这是一种JEPA世界模型的诊断方法,用于衡量在动作条件展开中干净观测与扰动观测如何发散,并为预测误差和规划器成本提供理论界限。在多个视觉控制任务上的实验验证了该诊断在LeWM和PLDM等模型上的有效性。
BioM-JEPA 引入了一种联合嵌入预测架构,通过预测图连接基因块而非单个基因来学习单细胞表示,在扰动响应任务中展现出更高的效率和下游性能。
This paper introduces NodeJEPA, a joint-embedding predictive architecture for node-level graph self-supervised learning that predicts latent representations of masked structure-aware ego-subgraphs, avoiding reconstruction and hand-crafted augmentations. The method is evaluated on node classification benchmarks and shows competitive performance.
SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。
This paper introduces HP-JEPA, a hierarchical partitioning framework for multi-resolution graph joint-embedding predictive learning, which outperforms the fixed-resolution Graph-JEPA baseline on most graph classification and regression benchmarks.
介绍了DENSEWORLD,一个包含1000小时拥挤的全球南方城市场景的数据集,以及FactorJEPA,一种将未来预测分解为布局、智能体和交互的JEPA变体,在遮挡和异质性条件下提高了准确性和鲁棒性。
本文介绍了集体状态JEPA(CS-JEPA),这是一种循环联合嵌入预测架构,使群体中的每个机器人能够从局部观测和受限消息中预测相同的未来集体状态。该方法展示了在预测误差和机器人间一致性方面的标签高效改进,并提供了与规划相关的价值估计。
本文分析了为什么确定性JEPA风格的潜在预测适用于图像但不适用于文本,将失败归因于语言中的高条件方差,其中被屏蔽的上下文允许多个有效补全,而这些补全的表征缺乏一致的质心。
INTACT 是一个端到端的统一 JEPA,直接学习意图到动作的映射,从而实现无搜索的世界模型控制。它在四个视觉控制任务上实现了 95.33% 的直接宏观成功率,测试时零搜索,规划延迟降低约 300 倍。
对 Yann LeCun 赌注的分析,他认为智能始于通过 JEPA 构建的世界模型,而非语言。此举得到 AMI Labs 10.3 亿美元资金支持。本文解释了为何像素预测会失败,以及 JEPA 如何在潜在空间中进行预测以避免模糊的未来。
Induction Labs 推出了想象模型(imagination models),这是一种新的基础模型架构,从互联网规模的视频中学习。他们的第一个模型 Photon-1 通过观看 18 年的屏幕录像(无动作标签)学习使用计算机,以比 Gemini 3.1 Flash 低 30 倍的预训练成本取得了更好的结果。
解释了SIGReg,一种针对JEPA的新型正则化器,通过迫使嵌入遵循各向同性高斯分布来防止表征坍缩,具有理论保证和简洁的训练循环。
Yann LeCun讨论了他在巴黎的新实验室AMI Labs,他专注于世界模型作为LLMs的替代方案,以及他对能够在物理世界中规划和行动的AI的愿景,该愿景得到了10亿美元投资的支持,并采用了JEPA架构。
AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。
本文建立了联合嵌入预测架构(JEPA)中使用的SIGReg目标与主动推理框架之间的形式对应关系,表明在某些条件下,训练目标成为精确的变分自由能。它将非对比正则化器组织成一个熵估计器层次结构,并证明了理论结果,包括精确信息瓶颈和SIGReg保留的惊讶界。
作者复现了联合嵌入预测架构(JEPA)世界模型,并在《超级马里奥兄弟》上进行了训练,发现虽然该模型能很好地预测帧,但在长期规划方面表现不佳。
本文探索将JEPA风格的预测学习应用于JA4衍生的网络指纹,构建了一个基于Transformer的模型(JA4-JEPA),该模型在JA4、JA4H、JA4S和JA4X子字段上进行训练。该模型在协议族分类任务上取得了优异表现,表明JEPA目标可以用于紧凑的网络指纹表示。