你的概率JEPA实际上是一个隐马尔可夫模型:联合嵌入预测学习的状态空间解释
摘要
本文建立了概率联合嵌入预测学习(JEPA)与隐马尔可夫模型(HMM)之间的理论联系,提供了状态空间解释,并引入了马尔可夫链JEPA以增强一致性。
arXiv:2608.13621v1 公告类型:新
摘要:隐马尔可夫模型(HMM)结合了三个角色:从观测中推断隐藏状态信念、通过马尔可夫转移传播、以及发射回观测空间。我们表明,完整的时间索引预测信息瓶颈VJEPA(PIB-VJEPA)展现了相同的计算结构:随机上下文编码器扮演了摊销过滤分布的角色,概率预测器定义了潜在状态动态,而解码器、逆目标编码器或诱导的隐式条件提供了发射方向。我们区分了4个逐渐增强的对应级别,并给出了精确序列级HMM等价的充分条件。为了使联系具体化,我们引入了马尔可夫链JEPA(MCJEPA),它用一个学习到的转移矩阵替换了潜在预测器;在有限时间齐次情况下,矩阵幂保证了精确的多时间尺度Chapman--Kolmogorov一致性。条件离散状态转移、连续状态马尔可夫核和连续时间动态扩展了这一构造,而确定性时间JEPA则作为退化狄拉克核的特例出现。我们进一步将预测信息瓶颈学习解释为寻求紧凑的预测状态:压缩促进最小性,而残差可预测性测试充分性。受控实验支持转移组合、过滤解释、已知合成过程中的预测马尔可夫化,以及JEPA潜在预测与HMM风格序列学习之间的区别。总之,这些结果为时间JEPA提供了有原则的状态空间解释。
查看缓存全文
缓存时间: 2026/08/17 09:46
# 你的概率 JEPA 实际上是一个隐马尔可夫模型 ## 联合嵌入预测学习的状态空间解释 来源:https://arxiv.org/html/2608.13621 作者:黄永超 [email protected] ###### 摘要 隐马尔可夫模型(HMM)结合了三个角色:从观测推断隐状态信念、通过马尔可夫转移传播、以及发射回观测空间。我们证明,完整的、带时间索引的预测信息瓶颈 VJEPA(PIB-VJEPA)展现了相同的计算结构:一个随机上下文编码器扮演了分摊滤波分布的角色,一个概率预测器定义了潜状态动力学,而一个解码器、逆目标编码器或诱导的隐式条件则提供了发射方向。我们区分了四个渐进增强的对应层级,并给出了实现精确序列级 HMM 等效的充分条件。为使联系具体化,我们引入了马尔可夫链 JEPA(MCJEPA),它用一个可学习的转移矩阵取代了潜预测器;在有限时齐情况下,矩阵幂确保了精确的多步 Chapman–Kolmogorov 一致性。条件离散状态转移、连续状态马尔可夫核和连续时间动力学扩展了这一构造,而确定性时间 JEPA 则表现为退化的狄拉克核特例。我们进一步将预测信息瓶颈学习解释为寻求一个紧凑的预测状态:压缩促进最小性,而残留的可预测性检验了充分性。受控实验支持了转移组合、滤波解释、在已知合成过程中的预测马尔可夫化,以及 JEPA 潜预测与 HMM 式序列学习之间的区别。总之,这些结果为时间 JEPA 提供了一个有原则的状态空间解释。 ###### 目录 1. [1 引言](https://arxiv.org/html/2608.13621#S1) 2. [2 从 JEPA 到马尔可夫链 JEPA](https://arxiv.org/html/2608.13621#S2) 1. [2.1 潜马尔可夫动力学](https://arxiv.org/html/2608.13621#S2.SS1) 2. [2.2 HMM 与 PIB-VJEPA 类比概览](https://arxiv.org/html/2608.13621#S2.SS2) 3. [2.3 时间 JEPA](https://arxiv.org/html/2608.13621#S2.SS3) 4. [2.4 MCJEPA:用马尔可夫链替换预测器](https://arxiv.org/html/2608.13621#S2.SS4) 5. [2.5 精确的多步路径一致性](https://arxiv.org/html/2608.13621#S2.SS5) 6. [2.6 避免离散状态坍缩](https://arxiv.org/html/2608.13621#S2.SS6) 3. [3 从转移矩阵到神经马尔可夫核](https://arxiv.org/html/2608.13621#S3) 1. [3.1 神经离散状态转移](https://arxiv.org/html/2608.13621#S3.SS1) 2. [3.2 连续状态随机转移](https://arxiv.org/html/2608.13621#S3.SS2) 3. [3.3 连续时间扩展](https://arxiv.org/html/2608.13621#S3.SS3) 4. [3.4 作为退化核的确定性时间 JEPA](https://arxiv.org/html/2608.13621#S3.SS4) 5. [3.5 递归预测器何时是马尔可夫的](https://arxiv.org/html/2608.13621#S3.SS5) 4. [4 概率 JEPA 实际上是一个 HMM](https://arxiv.org/html/2608.13621#S4) 1. [4.1 PIB-VJEPA 中的三个分布](https://arxiv.org/html/2608.13621#S4.SS1) 2. [4.2 编码–转移–发射的对应关系](https://arxiv.org/html/2608.13621#S4.SS2) 3. [4.3 当没有解码器时:隐式发射](https://arxiv.org/html/2608.13621#S4.SS3) 4. [4.4 四个对应层级](https://arxiv.org/html/2608.13621#S4.SS4) 5. [5 信息瓶颈学习作为马尔可夫化](https://arxiv.org/html/2608.13621#S5) 6. [6 残留可预测性作为马尔可夫充分性的诊断](https://arxiv.org/html/2608.13621#S6) 1. [6.1 类别概率创新](https://arxiv.org/html/2608.13621#S6.SS1) 2. [6.2 测试来自更早历史的增量可预测性](https://arxiv.org/html/2608.13621#S6.SS2) 3. [6.3 区分状态不充分与预测器误设](https://arxiv.org/html/2608.13621#S6.SS3) 4. [6.4 连续状态诊断](https://arxiv.org/html/2608.13621#S6.SS4) 7. [7 实验](https://arxiv.org/html/2608.13621#S7) 1. [7.1 实验 1:有限 HMM 恢复与马尔可夫组合](https://arxiv.org/html/2608.13621#S7.SS1) 2. [7.2 实验 2:滤波解决发射歧义](https://arxiv.org/html/2608.13621#S7.SS2) 3. [7.3 实验 3:预测压缩与马尔可夫化](https://arxiv.org/html/2608.13621#S7.SS3) 4. [7.4 实验 4:PIB-VJEPA 的 HMM 式训练](https://arxiv.org/html/2608.13621#S7.SS4) 5. [7.5 实验总结](https://arxiv.org/html/2608.13621#S7.SS5) 8. [8 讨论](https://arxiv.org/html/2608.13621#S8) 9. [9 结论](https://arxiv.org/html/2608.13621#S9) 10. [参考文献](https://arxiv.org/html/2608.13621#bib) 11. [附录 A 训练目标与最小算法](https://arxiv.org/html/2608.13621#A1) 12. [附录 B 证明](https://arxiv.org/html/2608.13621#A2) 1. [B.1 命题的证明](https://arxiv.org/html/2608.13621#A2.SS1) 2. [B.2 命题的证明](https://arxiv.org/html/2608.13621#A2.SS2) 3. [B.3 命题的证明](https://arxiv.org/html/2608.13621#A2.SS3) 13. [附录 C 发射方向的三种实现](https://arxiv.org/html/2608.13621#A3) 1. [C.1 显式解码器](https://arxiv.org/html/2608.13621#A3.SS1) 2. [C.2 可逆目标编码器](https://arxiv.org/html/2608.13621#A3.SS2) 3. [C.3 隐式发射](https://arxiv.org/html/2608.13621#A3.SS3) 14. [附录 D PIB-VJEPA 的 HMM 式训练目标](https://arxiv.org/html/2608.13621#A4) 1. [D.1 序列似然](https://arxiv.org/html/2608.13621#A4.SS1) 2. [D.2 类别 MCJEPA 的精确似然与滤波](https://arxiv.org/html/2608.13621#A4.SS2) 3. [D.3 连续状态扩展](https://arxiv.org/html/2608.13621#A4.SS3) 4. [D.4 与 JEPA 及混合训练的关系](https://arxiv.org/html/2608.13621#A4.SS4) 15. [附录 E 精确 HMM 表示条件](https://arxiv.org/html/2608.13621#A5) 1. [E.1 边际与滤波一致性](https://arxiv.org/html/2608.13621#A5.SS1) 2. [E.2 显式与可逆发射](https://arxiv.org/html/2608.13621#A5.SS2) 3. [E.3 隐式发射情况](https://arxiv.org/html/2608.13621#A5.SS3) 4. [E.4 定理证明的完成](https://arxiv.org/html/2608.13621#A5.SS4) 16. [附录 F 实验详情](https://arxiv.org/html/2608.13621#A6) 1. [F.1 评估指标](https://arxiv.org/html/2608.13621#A6.SS1) 2. [F.2 实验 1:有限 HMM 恢复与马尔可夫组合](https://arxiv.org/html/2608.13621#A6.SS2) 3. [F.3 实验 2:发射歧义下的滤波](https://arxiv.org/html/2608.13621#A6.SS3) 4. [F.4 实验 3:预测压缩与马尔可夫化](https://arxiv.org/html/2608.13621#A6.SS4) 5. [F.5 实验 4:PIB-VJEPA 的 HMM 式训练](https://arxiv.org/html/2608.13621#A6.SS5) 6. [F.6 可复现性与计算](https://arxiv.org/html/2608.13621#A6.SS6) ## 1 引言 联合嵌入预测架构(JEPAs)通过从观测到的上下文预测目标表示来学习,而非重构目标观测本身[10](https://arxiv.org/html/2608.13621#bib.bib5) [2](https://arxiv.org/html/2608.13621#bib.bib6) [3](https://arxiv.org/html/2608.13621#bib.bib7)。变分 JEPA(VJEPA)使这一预测概率化,用一个未来潜状态的条件分布取代了点预测器[9](https://arxiv.org/html/2608.13621#bib.bib9)。一个完整的预测信息瓶颈(PIB)扩展还使当前表示随机化,并明确控制其保留关于观测历史的多少信息[8](https://arxiv.org/html/2608.13621#bib.bib10)。这一进展产生了一个自然的问题:*一个完全随机的时间 JEPA 内部隐藏着什么熟悉的概率模型?*基本的状态空间类比是直接的。一个 HMM 遵循 X≤t → p(St|X≤t) → p(St+1|St) → p(Xt+1|St+1),而完整的 PIB-VJEPA,当配备一个显式观测模型时,具有相应的管道 X≤t → qθ(Zt|X≤t) → pφ(Zt+1|Zt, ξt) → pψ(Xt+1|Zt+1)。这里,Xt 表示观测级别的数据,如像素、视频帧或时间序列测量值;Zt 表示一个随机预测表示;而 ξt 包含辅助信息,如动作、流逝时间、目标位置或外生协变量[9](https://arxiv.org/html/2608.13621#bib.bib9)。式(2)中的观测空间路径对于核心 JEPA 目标是可选的。它可以通过一个显式的概率解码器 pψ(Xt+1|Zt+1) 来实现。或者,如果目标编码器 fθ̄ 在建模的数据域上是可逆的,其逆函数提供了一个确定性的状态到观测的映射:X̂t+1 = fθ̄⁻¹(Ẑt+1)。一个可靠的近似逆函数同样可以支持重构或预测,尽管它本身并不定义精确 HMM 式似然训练所需的归一化发射似然。在这些解释下,观测级数据对应于 HMM 观测,随机上下文编码器扮演隐状态推断的角色,预测器传播潜状态,解码器或逆目标编码器实现了状态到观测的方向。图(1)结合了这一类比的两个互补视角,表(1)逐组件总结了其对应关系。该图区分了两个经常被混淆的方向。在 HMM 中,发射分布将一个隐状态映射到一个观测,而滤波<sup>1</sup>则将观测映射到一个推断的隐状态。同样,PIB-VJEPA 编码器定义了一个识别或状态推断分布,而不是一个发射模型。在稍后开发的滤波一致性条件下,依赖历史的上下文编码器与相应的 HMM 滤波分布一致。直接的发射模拟物则是解码器 pψ(Xt|Zt),或者当可用时,逆目标编码器 fθ̄⁻¹。目标编码器本身将观测映射到潜状态;只有其逆函数才具有 HMM 发射的状态到观测方向。 <sup>1</sup> 这里,*滤波*是在状态空间意义上使用:它表示从直到时间 t 的可用观测推断当前隐状态信念 p(St|X≤t)。这个信念是通过结合基于转移的先前状态预测和当前观测提供的证据递归获得的。它不应仅被解释为噪声去除,尽管一个学习的 JEPA 编码器也可能抑制观测级别的噪声或其他与预测无关的变化。 **隐马尔可夫模型** ``` X1 --(p(X1|S1))-- S1 --(p(S2|S1))-- S2 --(p(S3|S2))-- S3 | | | (p(X2|S2)) (p(X3|S3)) v v v X2 X3 ``` 观测 → 隐马尔可夫链 ``` X≤t --(p(St|X≤t))--> St --(p(St+1|St))--> St+1 --(p(Xt+1|St+1))--> Xt+1 ``` 观测历史 → 状态推断 → 状态转移 → 发射 **完整 PIB-VJEPA** ``` X1 --qθ--> Z1 --pφ(Z2|Z1,ξ1)--> Z2 --pφ(Z3|Z2,ξ2)--> Z3 | | | | qθ̄ qθ̄ pψ 或 fθ̄⁻¹ pψ 或 fθ̄⁻¹ | | | | v v v v X2 X3 ``` 观测级数据 → 预测性潜状态过程 ``` X≤t --qθ(Zt|X≤t)--> Zt --pφ(Zt+1|Zt,ξt)--> Zt+1 --pψ(Xt+1|Zt+1) 或 fθ̄⁻¹--> Xt+1 ``` 观测历史 → 随机编码器 → 潜预测器 → 观测映射 **图 1:**HMM 与完整 PIB-VJEPA 的统一图形与计算比较。**上图:**经典的 HMM 视图,其中一个未观测的马尔可夫链生成观测。**下图:**相应的 PIB-VJEPA 视图,其中随机编码器从观测级数据推断预测性潜状态,而概率预测器传播这些状态。PIB-VJEPA 图中的实线向下箭头表示观测到状态的编码,而虚线向上箭头表示由显式解码器或逆目标编码器实现的可选状态到观测映射。框内行重现了式(1)和式(2)中对齐的计算管道。 **表 1:**HMM 与完整 PIB-VJEPA 之间的组件级类比。 因此,微妙之处不在于高级架构,而在于其精确的概率和训练解释。标准的 JEPA 训练将预测的未来表示与停止梯度的目标编码器表示匹配,并且不需要优化观测似然。一个显式的解码器或逆目标编码器可以完成观测空间的预测路径,但这样一个映射的存在本身并不会使 JEPA 目标与 HMM 最大似然相同。相反,当两个显式观测映射都不存在时,一个局部的随机编码器仍然可以诱导一个隐式发射分布,尽管该诱导的条件概率对于生成或似然评估可能不易处理。 #### 范围和术语。JEPA 表示一般的联合嵌入预测框架,而 VJEPA 表示其概率化的潜预测形式[9](https://arxiv.org/html/2608.13621#bib.bib9)。我们的主要研究对象是*完整的、带时间索引的 PIB-VJEPA*[8](https://arxiv.org/html/2608.13621#bib.bib10),其中当前表示、未来目标表示和潜转移都是概率化的。这种形式使状态空间结构最为清晰,因此为建立 HMM 对应关系提供了最干净的设定。我们在主要的概率推导中使用 *PIB-VJEPA*,在讨论更广泛的架构家族或相关特例时提及 JEPA 或 VJEPA。潜马尔可夫视角并不局限于 PIB-VJEPA:当其他概率时间 JEPA 形式的上下文和目标表示通过一个概率潜预测器连接时,它们继承了相同的编码–转移结构,而经典的时间 JEPA 作为退化情况恢复,其中相关的潜分布坍缩为点质量,预测器变成一个狄拉克转移核。稍后开发的充分条件结果更一般地针对概率时间 JEPA 进行了陈述,而完整的 PIB-VJEPA 是主要的具体实现。然而,精确的序列级 HMM 等效需要额外的发射和一致性条件。因此,我们的主要主张是: > 完整的、带时间索引的 PIB-VJEPA 暴露了隐马尔可夫模型的编码–转移–发射结构。其随机上下文编码器扮演隐状态推断或滤波的角色,其概率预测器传播潜状态,而解码器、逆目标编码器或诱导的隐式条件提供了发射方向。
相似文章
注解版JEPA
联合嵌入预测架构(JEPA)用于自监督学习的逐步注解实现与解释,涵盖I-JEPA、V-JEPA和LeJEPA。
SJEPA:学习具有混合符号-神经预测器的优雅潜在动力学
SJEPA 引入了一种无需重建的 JEPA 框架,学习混合符号-神经潜在动力学,旨在获得最简单且充分的预测表示。实验表明,与事后拟合相比,它能发现更简单的符号动力学,并具有更低的展开误差,同时在语法错误设定下控制符号-神经分配。
一个未来,每个机器人:去中心化JEPA下的标签高效集体状态预测
本文介绍了集体状态JEPA(CS-JEPA),这是一种循环联合嵌入预测架构,使群体中的每个机器人能够从局部观测和受限消息中预测相同的未来集体状态。该方法展示了在预测误差和机器人间一致性方面的标签高效改进,并提供了与规划相关的价值估计。
JEPA模型背后已有90年历史的想法:典型相关分析
这篇博文解释了JEPA(联合嵌入预测架构)模型与典型相关分析(CCA)之间的联系,典型相关分析是一种源于1936年的统计方法,文章认为CCA是JEPA的概念前身,并指出在嵌入空间中最大化相关性的思想可追溯到Hotelling。
我构建了Micro-JEPA:一个轻量级的JEPA(联合嵌入预测架构)Python实现
Micro-JEPA 是一个轻量级的JEPA(联合嵌入预测架构)Python实现,使智能体能够学习环境表征、在潜在空间中预测未来状态,并规划动作以避开障碍物。