video-world-models

标签

Cards List
#video-world-models

SolarWM:面向长时程视频世界模型的开放数据与可扩展训练

Hugging Face Daily Papers · 5天前 缓存

SolarWM引入了一个开放框架和统一训练配方,用于通过跨多样数据源的可扩展训练构建交互式视频世界模型,从而实现长时程实时运行。

0 人收藏 0 人点赞
#video-world-models

ForgeWM:一种用于少步数动作条件视频世界模型的渐进式因果训练方法

Hugging Face Daily Papers · 2026-08-14 缓存

ForgeWM 是一个渐进式框架,它将双向视频生成器蒸馏为高效的少步数交互式世界模型,支持低延迟交互和重放时优化,在 Minecraft 和 FPS 游戏中展示了改进。

0 人收藏 0 人点赞
#video-world-models

视频世界模型中的记忆(6分钟阅读)

TLDR AI · 2026-08-12 缓存

NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。

0 人收藏 0 人点赞
#video-world-models

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

Hugging Face Daily Papers · 2026-08-10 缓存

Introduces Latent Dynamics Reasoning (LDR), a video world model that integrates kinematic dynamics in a structured latent space, enabling extrapolation of learned dynamics far beyond training distributions while using far fewer parameters and running much faster than video diffusion baselines.

0 人收藏 0 人点赞
#video-world-models

面向视频世界模型的可寻址记忆

Hugging Face Daily Papers · 2026-08-07 缓存

本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。

0 人收藏 0 人点赞
#video-world-models

HelloWorld:在视频世界模型中实现社交互动角色

Hugging Face Daily Papers · 2026-08-05 缓存

HelloWorld是一个视频世界模型,支持社交互动角色,用户只需按一次按钮即可提示屏幕上的角色做出回应。它利用自蒸馏和无训练交叉注意力掩码来使互动自然化,并引入了用于评估的HelloWorldBench。

0 人收藏 0 人点赞
#video-world-models

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers · 2026-08-02 缓存

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

0 人收藏 0 人点赞
#video-world-models

ShadowDancer:通过从视频及其阴影学习统一动力学表征,教会视频世界模型任意动作

Hugging Face Daily Papers · 2026-07-30 缓存

ShadowDancer 提出了一种方法,通过从视频及其阴影中学习统一的动力学表征,实现交互式视频世界模型的任意动作、帧级控制,从而在没有标签或运动估计器的情况下实现可迁移的动作控制。实验表明,与基线相比,动作迁移和展开性能均有提升。

0 人收藏 0 人点赞
#video-world-models

AlayaWorld:长跨度可交互视频世界生成

Hugging Face Daily Papers · 2026-07-07 缓存

AlayaWorld 是一个用于构建可交互生成世界的开源框架,支持实时用户交互和多样化动作。该框架统一了从数据准备到部署的完整开发流程。

0 人收藏 0 人点赞
#video-world-models

MemLearner:学习为视频世界模型查询上下文记忆

Hugging Face Daily Papers · 2026-06-30 缓存

MemLearner 提出了一种基于学习的自适应上下文查询方法,使用查询令牌来改善视频世界模型中的场景一致性和记忆,特别适用于具有遮挡和动态物体的长序列。

0 人收藏 0 人点赞
#video-world-models

Holo-World:面向视频世界模型的统一相机、物体与天气控制

Hugging Face Daily Papers · 2026-06-18 缓存

Holo-World 提出了一种统一的可控视频世界模型,能够从单张图像生成视频,并显式控制相机、物体运动与天气。该工作引入了一个新颖的数据集与技术,可在将场景迁移至目标天气状态的同时保持场景结构。

0 人收藏 0 人点赞
#video-world-models

MBench:面向视频世界模型记忆能力的综合基准

Hugging Face Daily Papers · 2026-06-08 缓存

本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。

0 人收藏 0 人点赞
#video-world-models

用于视频世界模型的潜在空间记忆

Hugging Face Daily Papers · 2026-06-08 缓存

本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。

0 人收藏 0 人点赞
#video-world-models

StressDream:引导视频世界模型实现鲁棒的策略评估与改进

Hugging Face Daily Papers · 2026-05-29 缓存

StressDream通过优化噪声初始化结合语义目标与合理性目标,将基于扩散的想象引导至具有高影响力且合理的结果,从而增强视频世界模型,实现鲁棒的策略评估与改进。

0 人收藏 0 人点赞
#video-world-models

minWM:用于实时交互式视频世界模型的全栈开源框架

Hugging Face Daily Papers · 2026-05-28 缓存

minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。

0 人收藏 0 人点赞
#video-world-models

Incantation: 自然语言作为多实体视频世界模型的动作接口

Hugging Face Daily Papers · 2026-05-18 缓存

Incantation 提出了一个交互式视频世界模型,该模型使用自然语言作为动作接口,实现细粒度的多实体控制和跨实体泛化,通过新颖的注意力机制和蒸馏技术实现了高性能和实时流式处理。

0 人收藏 0 人点赞
#video-world-models

MultiWorld:可扩展的多智能体多视角视频世界模型

Hugging Face Daily Papers · 2026-04-20 缓存

MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈