Latent-Foresight:面向隐空间世界模型的端到端可预测表征学习

Hugging Face Daily Papers 论文

摘要

Latent-Foresight 提出了一种端到端框架,联合学习隐空间分词器与基于流的生成式动力学模型,显式地为时序可预测性构建隐空间结构,在未来场景理解任务上优于两阶段流水线方法。

预测场景的未来演化是世界建模的一项基础能力。近期研究显示,在视觉基础模型(VFM)的特征空间中进行操作,可以得到语义丰富的表征,从而支撑多样的未来场景理解任务。然而,现有方法依赖两阶段流水线:先使用固定的降维方法(例如 PCA)或独立训练的自编码器压缩 VFM 特征,然后在得到的冻结隐空间之上训练一个独立的预测器。这种表征学习与时序预测之间的解耦,以及直接在原始 VFM 特征上应用预测器的做法,都无法保证隐空间的结构适配可预测的动力学。在本文中,我们提出了 Latent-Foresight——一个端到端框架,联合学习隐空间分词器与基于流的生成式动力学模型,显式地对表征进行塑形以支持时序可预测性。为了实现稳定的联合优化,我们引入了几项关键设计,用以避免隐空间坍缩,并使重构目标与生成目标保持一致。大量实验表明,我们的方法能够学习到时序一致性更强的隐空间表征,在多种未来场景理解任务与不同预测时长上持续优于两阶段基线方法,同时省去了单独的训练阶段(包括高分辨率适配阶段)。我们在 https://github.com/Sta8is/Latent-Foresight 提供了实现代码与模型权重。
查看原文
查看缓存全文

缓存时间: 2026/10/02 12:28

论文页面 - Latent-Foresight:为隐空间世界模型端到端学习可预测表征

来源:https://huggingface.co/papers/2610.01942

摘要

预测场景的未来演化是世界建模的一项基础能力。近期研究表明,在 Vision Foundation Models(VFM)的特征空间中进行建模能够产生语义丰富的表征,从而支持多样的未来场景理解任务。然而,现有方法依赖于两阶段流水线:首先使用固定的降维方法(例如 PCA)或独立训练的自编码器压缩 VFM 特征,然后在得到的冻结隐空间之上训练一个独立的预测器。这种表征学习与时序预测之间的解耦,以及直接在原始 VFM 特征上应用预测器的做法,都无法保证隐空间具备面向可预测动态的结构。在本工作中,我们提出 Latent-Foresight,这是一个端到端框架,联合学习一个隐空间 tokenizer 和一个基于 flow 的生成式动态模型,显式地塑造表征以支持时序可预测性。为了实现稳定的联合优化,我们引入了若干关键设计选择,以避免隐空间坍缩,并使重建目标与生成目标保持一致。大量实验表明,我们的方法学到了时序上更加连贯的隐表征,在多个未来场景理解任务和不同预测时程上始终优于两阶段基线方法,同时消除了单独的训练阶段,包括在高分辨率适配阶段。我们在 https://github.com/Sta8is/Latent-Foresight 提供了实现代码和模型权重。

查看 arXiv 页面 · 查看 PDF · GitHub · 加入收藏夹

在你的 agent 中获取这篇论文:

hf papers read 2610.01942

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

暂无模型引用此论文。

在模型 README.md 中引用 arxiv.org/abs/2610.01942 即可从本页面链接到它。

引用此论文的数据集

暂无数据集引用此论文。

在数据集 README.md 中引用 arxiv.org/abs/2610.01942 即可从本页面链接到它。

引用此论文的 Space

暂无 Space 引用此论文。

在 Space README.md 中引用 arxiv.org/abs/2610.01942 即可从本页面链接到它。

包含此论文的收藏夹

暂无收藏夹包含此论文。

将此论文加入收藏夹 即可从本页面链接到它。

相似文章

未见先觉:世界行动模型的潜在未来

arXiv cs.AI

提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。

Next-Latent Prediction Transformers 学习紧凑世界模型

Papers with Code Trending

介绍了 Next-Latent Prediction (NextLat),这是一种自监督目标,训练 Transformer 预测其下一个潜在状态,鼓励形成紧凑的内部世界模型,并提高跨序列建模任务的泛化能力。

使用潜空间世界模型预测后果并强化导航策略

arXiv cs.AI

本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。