SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学
摘要
SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。
查看缓存全文
缓存时间: 2026/08/06 07:45
# SJEPA:通过混合符号-神经预测器学习优雅的潜动力学
来源:https://arxiv.org/html/2608.04060 \(2026年7月23日\)
###### 摘要
联合嵌入预测架构通过从上下文嵌入预测目标嵌入来学习抽象状态,但其转移模型通常是黑箱神经映射。我们提出 SJEPA,一个免重构的 JEPA 框架,它学习预测表示,使得其诱导动力学具有紧凑的符号描述。其混合转移将符号定律与正则化神经校正相结合,用于处理所选文法无法充分表达的动力学。核心原则是学习最简单且充分的动力学:表示约束将学习限制在信息丰富、非坍缩的预测坐标上,而算子压缩则倾向于选择预测上仍然充分的最低复杂度符号-神经转移。我们通过诱导动力学复杂度形式化这一原则,分析预测坐标的不可辨识性,并表明无约束的算子压缩会直接导致表示坍缩。该框架既支持交替的表示-方程学习,也支持对固定表示进行符号动力学拟合。在受控摆实验中,联合表示-方程学习发现的符号动力学比事后拟合简单得多,且长期展开误差和发散度更低;而无约束的单步诊断则实现了理论预测的坍缩捷径。在文法错误设定下,校正正则化保留了可表示的符号机制,并鼓励神经组件专注于残余动力学。结果表明,在预测保真度、表示质量、符号简洁性和符号-神经分配之间存在可控的权衡。SJEPA 在 JEPA 家族中提供了一条互补方向,可能适用于需要紧凑潜动力学、显式结构约束或受控残差建模的应用。
## 1 引言
联合嵌入预测架构(JEPAs)通过预测缺失或未来观测的表示来学习,而非重构所有观测细节(LeCun,2022 (https://arxiv.org/html/2608.04060#bib.bib1);Assran 等,2023 (https://arxiv.org/html/2608.04060#bib.bib2);Bardes 等,2024 (https://arxiv.org/html/2608.04060#bib.bib3);Assran 等,2025 (https://arxiv.org/html/2608.04060#bib.bib4))。这种设计将预测语义与像素级变异性分离,为通用世界模型提供了自然基础。然而,转移机制本身通常由神经预测器表示。这种预测器可以很准确,但不会揭示哪些变量相互作用、动作如何改变未来,或者学习到的坐标是否支持简洁的动力学描述。本文提出了一个不同于标准表示学习的问题:*JEPA 能否不仅学习预测状态,还学习这些状态上的优雅动力学?* 我们在精确的操作意义上使用“优雅”:优雅的转移是紧凑且简约的定律,同时保持对预测的充分性。因此目标不是尽可能短的方程。过于简单的方程会欠拟合;仅仅为了简化方程而将表示变得平凡也是不可接受的。目标是为信息丰富的预测状态找到*最简单且充分的支配定律*。核心原则是,算子压缩应选择诱导动力学简单且充分的预测坐标,而表示约束则防止通过坍缩来实现这种简单性。
我们提出符号 JEPA(SJEPA,我们使用不带连字符的缩写,因为该框架是通用的而非任务特定的),一个潜转移被分解为符号支配定律和神经校正的 JEPA。给定上下文嵌入 \(Z_C\) 和目标侧信息 \(\varepsilon\),其中 \(Z_T\) 提供预测目标,混合预测器为 \(\widehat{Z}_T = f_{\mathcal{E},\alpha}(Z_C,\varepsilon) + c_\phi(Z_C,\varepsilon)\)。(式 3 (https://arxiv.org/html/2608.04060#S3.E3))这里,\(\varepsilon\) 标识目标或转移,例如通过目标位置、时间偏移或动作。符号结构 \(\mathcal{E}\) 和系数 \(\alpha\) 捕获主导的可重用动力学,而 \(c_\phi\) 校正所选文法无法充分表示的影响。这种分解作用于转移算子,而非划分潜表示。
SJEPA 区分表示压缩和算子压缩。前者决定保留哪些与未来相关的状态;后者寻求支配该状态的简洁定律。这两个目标必须仔细耦合,因为对简单动力学的无约束压力会促使编码器擦除信息,直到转移变得平凡。因此,我们将 SJEPA 表述为受约束的算子压缩:
\[
\min_{\theta,\bar{\theta},\mathcal{E},\alpha,\phi} \Omega(\mathcal{E}) + \lambda_{\mathrm{c}}\mathcal{R}_{\mathrm{corr}}(\phi) \quad \text{(式 10 (https://arxiv.org/html/2608.04060#S4.E10))}
\]
满足
\[
\mathcal{L}_{\mathrm{pred}}(\theta,\bar{\theta},\mathcal{E},\alpha,\phi) \leq \delta_{\mathrm{pred}},\quad (\theta,\bar{\theta}) \in \Theta_{\mathrm{repr}}.
\]
目标函数偏好紧凑的符号定律,同时抑制对校正的不必要依赖。预测约束防止欠拟合,而 \(\Theta_{\mathrm{repr}}\) 将上下文和目标编码器限制为信息丰富、预测充分且非坍缩的表示。该公式引入了动力学复杂度泛函 \(\mathcal{C}_{\mathrm{dyn}}(E_\theta,E_{\bar{\theta}})\):在编码器选择的坐标上实现充分预测所需的最小符号加校正复杂度。
我们的贡献如下:
1. 1. **符号与混合 JEPA 动力学。** 我们用紧凑的符号定律取代 JEPA 中的黑箱神经预测器,并为所选符号文法无法充分表达的动力学提供可选的神经校正。
2. 2. **学习最简单且充分的动力学。** 我们将算子压缩引入为表示学习的补充:表示必须保持信息丰富且非坍缩,同时其转移应在不牺牲预测充分性的前提下尽可能紧凑。
3. 3. **一个有原则且模块化的学习框架。** 我们开发了控制符号复杂度并抑制神经校正不必要地吸收可表示动力学的目标。该框架既支持交替的表示-方程学习,也支持对冻结的预训练编码器进行符号动力学拟合。
4. 4. **理论与实证验证。** 我们解释了为什么预测坐标不是唯一的,展示了动力学压缩如何促进表示坍缩,并通过实验验证了这些效应。联合学习发现的潜动力学比事后方程拟合简单得多,符号展开更准确且发散更小;而校正正则化在文法错误设定下保留了主导符号机制。
5. 5. **扩展到不确定性与控制。** 我们提供了贝叶斯和动作条件公式,支持不确定性感知的潜动力学、敏感性分析、局部线性化和基于模型的规划。
## 2 相关工作
##### 联合嵌入预测架构。
JEPA 家族已扩展到多种模态和学习目标。I-JEPA 引入了针对图像的面具潜预测(Assran 等,2023 (https://arxiv.org/html/2608.04060#bib.bib2)),而 MC-JEPA 联合学习运动和内容特征,V-JEPA 将特征预测扩展到视频(Bardes 等,2023 (https://arxiv.org/html/2608.04060#bib.bib37);2024 (https://arxiv.org/html/2608.04060#bib.bib3))。Audio-JEPA、Point-JEPA 和 3D-JEPA 将该框架适配到音频和三维数据,VL-JEPA 将潜预测扩展到视觉-语言学习(Tuncay 等,2025 (https://arxiv.org/html/2608.04060#bib.bib38);Saito 等,2025 (https://arxiv.org/html/2608.04060#bib.bib39);Hu 等,2024 (https://arxiv.org/html/2608.04060#bib.bib40);Chen 等,202相似文章
注解版JEPA
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
NodeJEPA: Structure-Conditioned Latent Prediction for Node-Level Graph Self-Supervised Learning
This paper introduces NodeJEPA, a joint-embedding predictive architecture for node-level graph self-supervised learning that predicts latent representations of masked structure-aware ego-subgraphs, avoiding reconstruction and hand-crafted augmentations. The method is evaluated on node classification benchmarks and shows competitive performance.
预测与重建:自监督语言表示学习的联合目标
本文提出了一种混合预训练目标,结合了JEPA潜在空间预测和MLM重建,用于语言模型,显示出改进的嵌入均匀性和语义-词汇平衡。
无奖励的表征:JEPA对LLM微调的审计
本文对联合嵌入预测架构(JEPA)在自然语言到正则表达式任务上的LLM微调进行了审计,测试了二十二个辅助目标。结果表明,隐藏状态表征的改进与解码任务准确率之间仅存在弱耦合,没有辅助目标通过族系校正。