ActionSplice: 交互式世界模型中的实时动作编辑
摘要
ActionSplice 引入反事实状态传输,将修订后的动作插入块自回归视频世界模型,无需重放已完成的评估,从而提高保真度和推理速度。
查看缓存全文
缓存时间: 2026/09/14 14:35
论文页面 - ActionSplice:交互式世界模型中的飞行中动作编辑
来源:https://huggingface.co/papers/2609.08230 发布于 9月 8日
·
由https://huggingface.co/PardisTaghavi提交
pardis (https://huggingface.co/PardisTaghavi) 于 9月 14日
摘要
ActionSplice 引入了反事实状态传输,将修订后的动作拼接到分块自回归视频世界模型中,无需重播已完成的评估,从而提高了保真度和速度。
分块自回归视频世界模型 (https://huggingface.co/papers?q=Chunk-autoregressive%20video%20world%20models) 通常将每个生成的片段以一个动作为条件。因此,采样过程中接收到的动作必须等待下一个片段,将未来的求解器评估建立在先前动作产生的状态之上,或者触发回滚以重复已完成的评估。我们引入了 ActionSplice (https://huggingface.co/papers?q=ActionSplice),一个将此问题形式化为反事实状态传输 (https://huggingface.co/papers?q=Counterfactual%20State%20Transport) (CST) 的推理框架。一个轻量级的校正器 (https://huggingface.co/papers?q=corrector) 将中断的骨干原生表示 (https://huggingface.co/papers?q=backbone-native%20representation) 传输到在相同求解器步骤中由修订动作引发的匹配状态。世界模型和采样器保持冻结,采样在未重播已完成评估的情况下恢复。重定向变体 CST{R} 更新整个活动片段,而时间拼接变体 CST{T} 保留时间前缀并仅更新后缀。在 minWM-Wan Action2V 和 HY-WM1.5 上,CST{R} 相对于直接条件交换分别将回滚相关 LPIPS (https://huggingface.co/papers?q=LPIPS) 降低了 61.5% 和 75.9%。CST{T} 分别将后缀 LPIPS (https://huggingface.co/papers?q=LPIPS) 降低了 56.1% 和 77.5%,同时相比等待提供了 2.73 倍和 1.69 倍的像素就绪加速。在 HY-WorldPlay 协议下,CST_{R} 相对于原始推演获得了 25.66 dB 的 PSNR (https://huggingface.co/papers?q=PSNR)、0.6902 的 SSIM (https://huggingface.co/papers?q=SSIM) 和 0.1337 的 LPIPS (https://huggingface.co/papers?q=LPIPS)。
查看 arXiv 页面 (https://arxiv.org/abs/2609.08230) 查看 PDF (https://arxiv.org/pdf/2609.08230) 项目页面 (https://pardistaghavi.github.io/actionsplice-website/) GitHub3 (https://github.com/PardisTaghavi/ActionSplice) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.08230)
通过您的代理获取此论文:
hf papers read 2609.08230
没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.08230 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.08230 以从此页面链接它。
引用此论文的空间 0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.08230 以从此页面链接它。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
Flash-WAM: 面向世界行动模型的模态感知蒸馏
Flash-WAM提出了一种面向世界行动模型的模态感知蒸馏方法,通过将扩散压缩为每个模态单步推理,实现了实时推理,速度提升23倍。
GameWAM:一种用于视频游戏的统一世界动作模型
GameWAM 引入了首个统一的世界动作模型,用于原生视频游戏控制,通过块因果流匹配和模式特定分布联合预测未来视觉和可执行动作。
World Pilot: 使用世界动作先验引导视觉-语言-动作模型
World Pilot 通过融入来自世界动作模型的动态场景演变和轨迹先验来增强视觉-语言-动作模型,在操作任务上实现了最先进的零样本性能。