ReWorld:一个具有长期记忆的交互式世界模型

Hugging Face Daily Papers 论文

摘要

ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。

交互式世界模型必须跟随用户的动作,记住它展示过的地方,并实时流式传输。其张力是结构性的:控制需要短视界,记忆需要无界视界。ReWorld在训练时分离两者,并在推理时约束它们。混合的每头注意力窗口将大多数头限制在近期,而少量全局头关注整个历史;随机头路由防止任一能力绑定到特定头;随机块丢弃使稀疏历史在分布内。在推理时,整个过去生活在一个固定预算下:由姿势索引地标库支持的有界KV缓存,模型从中检索最接近当前姿势的地标。度量尺度对齐的数据引擎将八个源——Unreal渲染的飞越、游戏漫游和真实世界镜头——放置在一个物理动作尺度上,因此同一按键在每个源中移动相机相同距离,回文轨迹提供记忆训练所需的回顾证据。限于LoRA适配器的分布匹配蒸馏将采样压缩到四步:一个骨干同时服务于高保真多步模式和实时交互模式,在超写实、游戏风格和风格化世界中流式传输704x1280视频。在涵盖动作跟随、长期回忆和视频质量的三轴协议下,与六个最近的交互式世界模型相比,它获得了最佳控制保真度(11.95度旋转误差和最佳相机运动一致性)和最佳生成质量;在长达一分钟的往返展开(64秒,384个潜在变量)上,其固定的12块缓存仍然重新生成起始视图——在滑动窗口早已驱逐证据且全KV注意力内存不足的展开长度上。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:33

论文页面 - ReWorld:基于长期记忆的交互式世界模型

来源:https://huggingface.co/papers/2608.23565
作者:

,

,

,

,

,

,

,

,

摘要

ReWorld在训练阶段分离短期控制与长期记忆,在推理阶段通过混合注意力窗口、姿态索引地标库与分布匹配LoRA蒸馏对二者进行统一约束,实现实时交互式世界建模,兼具高动作保真度与长期记忆召回能力。

交互式世界模型必须响应用户动作、记录已展示场景并实时生成视频流。其核心矛盾在于:控制需要有限时间跨度,而记忆需要无界历史。ReWorld在训练时分离二者,在推理时进行约束。混合逐头注意力窗口(Mixed per-head attention windows)将多数注意力头限制于近期历史,少量全局头(global heads)关注完整历史,随机头路由(random head routing)使两种能力不固定绑定至特定注意力头;随机块丢弃(random chunk dropping)确保稀疏历史仍处于训练分布内。推理时全部历史受固定计算预算约束:有界KV缓存(KV cache)由姿态索引地标库(pose-indexed landmark bank)支撑,模型可检索与当前姿态最相近的地标。度量尺度对齐数据引擎(metric-scale-aligned data engine)将八种来源——虚幻引擎渲染漫游、游戏探索与真实世界录像——统一至同一物理动作尺度,确保相同按键在所有来源中驱动摄像头移动相同距离;回文轨迹(palindrome trajectories)提供记忆训练所需的重复访问证据。限定在LoRA适配器(LoRA adapter)内的分布匹配蒸馏(Distribution-matching distillation)将采样压缩至四步:单一骨干网络同时支持高保真多步模式与实时交互模式,可在写实、游戏风格与艺术化世界中生成704x1280视频流。在涵盖动作跟随、长期记忆与视频质量的三维评测体系中,相较六种近期交互世界模型,ReWorld实现最佳控制保真度(11.95°旋转误差)与最佳相机运动一致性,同时获得最高生成质量;在一分钟级往返轨迹(64秒、384个潜在帧)测试中,其固定12块缓存仍能重建起始视角——此时滑动窗口已遗忘早期证据,而全上下文KV注意力会耗尽内存。

查看arXiv页面 (https://arxiv.org/abs/2608.23565)查看PDF (https://arxiv.org/pdf/2608.23565)项目主页 (https://zhifeichen097.github.io/ReWorld/)GitHub (https://github.com/zhifeichen097/ReWorld)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23565)

通过代理获取论文:
hf papers read 2608\.23565

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.23565以从本页面建立链接。

引用此论文的数据集 0

无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.23565以从本页面建立链接。

引用此论文的Space 0

无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.23565以从本页面建立链接。

包含此论文的合集 0

无合集包含此论文
将此论文添加至合集 (https://huggingface.co/new-collection)以从本页面建立链接。

相似文章

AlayaWorld: 交互式长视界世界建模 -- 完整技术报告

Hugging Face Daily Papers

AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。

面向视频世界模型的可寻址记忆

Hugging Face Daily Papers

本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。

视频世界模型中的记忆(6分钟阅读)

TLDR AI

NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。