ReWorld:一个具有长期记忆的交互式世界模型
摘要
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
查看缓存全文
缓存时间: 2026/08/25 04:33
论文页面 - ReWorld:基于长期记忆的交互式世界模型
来源:https://huggingface.co/papers/2608.23565
作者:
,
,
,
,
,
,
,
,
摘要
ReWorld在训练阶段分离短期控制与长期记忆,在推理阶段通过混合注意力窗口、姿态索引地标库与分布匹配LoRA蒸馏对二者进行统一约束,实现实时交互式世界建模,兼具高动作保真度与长期记忆召回能力。
交互式世界模型必须响应用户动作、记录已展示场景并实时生成视频流。其核心矛盾在于:控制需要有限时间跨度,而记忆需要无界历史。ReWorld在训练时分离二者,在推理时进行约束。混合逐头注意力窗口(Mixed per-head attention windows)将多数注意力头限制于近期历史,少量全局头(global heads)关注完整历史,随机头路由(random head routing)使两种能力不固定绑定至特定注意力头;随机块丢弃(random chunk dropping)确保稀疏历史仍处于训练分布内。推理时全部历史受固定计算预算约束:有界KV缓存(KV cache)由姿态索引地标库(pose-indexed landmark bank)支撑,模型可检索与当前姿态最相近的地标。度量尺度对齐数据引擎(metric-scale-aligned data engine)将八种来源——虚幻引擎渲染漫游、游戏探索与真实世界录像——统一至同一物理动作尺度,确保相同按键在所有来源中驱动摄像头移动相同距离;回文轨迹(palindrome trajectories)提供记忆训练所需的重复访问证据。限定在LoRA适配器(LoRA adapter)内的分布匹配蒸馏(Distribution-matching distillation)将采样压缩至四步:单一骨干网络同时支持高保真多步模式与实时交互模式,可在写实、游戏风格与艺术化世界中生成704x1280视频流。在涵盖动作跟随、长期记忆与视频质量的三维评测体系中,相较六种近期交互世界模型,ReWorld实现最佳控制保真度(11.95°旋转误差)与最佳相机运动一致性,同时获得最高生成质量;在一分钟级往返轨迹(64秒、384个潜在帧)测试中,其固定12块缓存仍能重建起始视角——此时滑动窗口已遗忘早期证据,而全上下文KV注意力会耗尽内存。
查看arXiv页面 (https://arxiv.org/abs/2608.23565)查看PDF (https://arxiv.org/pdf/2608.23565)项目主页 (https://zhifeichen097.github.io/ReWorld/)GitHub (https://github.com/zhifeichen097/ReWorld)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23565)
通过代理获取论文:
hf papers read 2608\.23565
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.23565以从本页面建立链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.23565以从本页面建立链接。
引用此论文的Space 0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.23565以从本页面建立链接。
包含此论文的合集 0
无合集包含此论文
将此论文添加至合集 (https://huggingface.co/new-collection)以从本页面建立链接。
相似文章
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
AlayaWorld: 交互式长视界世界建模 -- 完整技术报告
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
面向视频世界模型的可寻址记忆
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
视频世界模型中的记忆(6分钟阅读)
NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorld-MM 是一个面向实体的多模态记忆系统,专为开放式视频流设计,采用受人类记忆理论启发的分层长期记忆,在六个基准测试中达到了最先进的准确率。