ForgeWM:一种用于少步数动作条件视频世界模型的渐进式因果训练方法
摘要
ForgeWM 是一个渐进式框架,它将双向视频生成器蒸馏为高效的少步数交互式世界模型,支持低延迟交互和重放时优化,在 Minecraft 和 FPS 游戏中展示了改进。
查看缓存全文
缓存时间: 2026/08/21 04:08
论文页面 - ForgeWM:面向少步动作条件视频世界模型的渐进式因果训练
来源:https://huggingface.co/papers/2608.14022 作者: , , , , , , , , , ,
摘要
ForgeWM 将双向视频生成器逐步蒸馏为高效的少步交互式世界模型,支持对齐的离散与连续控制,实现低延迟交互和回放时精炼。
动作条件视频世界模型(https://huggingface.co/papers?q=Action-conditioned%20video%20world%20models)需要低延迟因果生成和对游戏原生控制的可靠响应。尽管因果蒸馏(https://huggingface.co/papers?q=causal%20distillation)可实现一步或少步视频合成(https://huggingface.co/papers?q=few-step%20video%20synthesis),但将其扩展到交互式世界模型仍具挑战,因为离散键盘状态与连续鼠标运动必须在因果训练和自回归展开(https://huggingface.co/papers?q=autoregressive%20rollout)期间,与时序压缩的潜在块(https://huggingface.co/papers?q=latent%20chunks)保持对齐。我们提出 ForgeWM——一个渐进式框架,通过领域适配、教师强制因果训练、因果一致性蒸馏(https://huggingface.co/papers?q=causal%20consistency%20distillation)以及结合双向教师(https://huggingface.co/papers?q=bidirectional%20teacher)的策略内分布匹配(https://huggingface.co/papers?q=on-policy%20distribution%20matching),将双向动作条件视频生成器转化为高效的少步世界模型。由此产生的预算特化学生模型分别在 1、2 和 4 步的稳定去噪预算下运行。ForgeWM 进一步支持双路径部署协议,结合延迟关键交互与可选的回放时精炼(https://huggingface.co/papers?q=replay-time%20refinement),其中一步学生模型会对其保存的草稿进行再加噪与精炼。在配对的 Minecraft 轨迹上,ForgeWM 在成像质量、参考对齐运动轮廓一致性、动作符号准确性和鼠标控制准确性方面领先于所评估的系统,同时实现了最低的参考 LPIPS;同样的四阶段方案可迁移至手柄控制的 FPS 游戏玩法。回放时精炼(https://huggingface.co/papers?q=Replay-time%20refinement)能匹配四步参考质量,同时其与经历轨迹的距离大约仅为从噪声重新生成的三分之一。这些结果证明了 ForgeWM 在可控少步视频生成方面的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.14022) 查看 PDF (https://arxiv.org/pdf/2608.14022) 项目页面 (https://asdfo123.github.io/ForgeWM/) GitHub76 (https://github.com/asdfo123/ForgeWM) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14022)
获取论文到你的代理中:
hf papers read 2608\.14022
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 1
ForgeWM/ForgeWM (https://huggingface.co/ForgeWM/ForgeWM)
引用此论文的数据集 1
ForgeWM/ForgeWM-data (https://huggingface.co/datasets/ForgeWM/ForgeWM-data)
引用此论文的空间 0
没有链接此论文的空间 在空间 README.md 中引用 arxiv.org/abs/2608.14022 以从本页面链接。
包含此论文的收藏夹 0
没有包含此论文的收藏夹 将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
minWM:用于实时交互式视频世界模型的全栈开源框架
minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
τ_0-WM: 用于机器人操作的统一视频-动作世界模型
τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。