AlayaWorld: 交互式长视界世界建模 -- 完整技术报告
摘要
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
查看缓存全文
缓存时间: 2026/07/22 06:41
论文页面 - AlayaWorld: 交互式长程世界建模——完整技术报告
来源:https://huggingface.co/papers/2607.18367 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
与传统视频游戏开发依赖繁重的资产制作、动画、物理和编程管线不同,视频世界模型能够根据用户输入即时生成交互式环境。这使我们能够从文本、图像或视频中创建可定制、可探索且持续演进的虚拟世界。实现这一愿景需要四个紧密耦合的能力:交互、持续的时空一致性、稳定的长程生成以及高效响应。我们提出 AlayaWorld,一个交互式长程视频世界模型,可生成 24fps、分辨率达 540p 和 720p 的视频。该模型基于一个 15B 参数的视频扩散 Transformer,在相机轨迹和可切换文本提示下自回归地生成短潜变量块。其有界视觉上下文结合了持久关键帧、压缩的时间历史、几何对齐的空间记忆以及最近帧条件。为了减少长期漂移,模型使用自回归滚动过程中收集的损坏历史与预测残差进行训练。我们进一步引入一种离散自回归蒸馏公式,结合了分布匹配蒸馏、self-forcing++ 和一致性蒸馏,将推理从每个块约 30 步采样减少到 4 步。在 iWorld-Bench 上,AlayaWorld 在长程生成任务中取得了最佳性能。作为一项全栈、开源且长期的项目,AlayaWorld 旨在为未来交互式视频世界模型的研究提供可扩展的基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.18367) 查看 PDF (https://arxiv.org/pdf/2607.18367) 项目页面 (https://alaya-lab.github.io/AlayaWorld/) GitHub (https://github.com/AlayaLab/AlayaWorld) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18367)
在你的代理中获取此论文:
hf papers read 2607\.18367
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2607.18367 以将其链接到此页面。
引用此论文的数据集0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.18367 以将其链接到此页面。
引用此论文的 Space0
没有链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.18367 以将其链接到此页面。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
AlayaWorld:长跨度可交互视频世界生成
AlayaWorld 是一个用于构建可交互生成世界的开源框架,支持实时用户交互和多样化动作。该框架统一了从数据准备到部署的完整开发流程。
AlayaWorld 是一个全栈、开源的视频世界模型,支持720p、24帧/秒的流式视频生成,并具备相机控制功能。
AlayaWorld 是一个全栈、开源的视频世界模型,能够生成720p、24帧/秒的流式视频,支持相机控制,实现动态场景创建。
以游戏速度运行的生成式世界渲染器
本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
Waypoint-1.5: 面向日常GPU的更高保真交互式世界
Overworld发布Waypoint-1.5,一款面向日常GPU的实时视频世界模型,具备改进的视觉保真度,并新增360p和720p档位以支持更广泛的硬件设备。