可交互世界的精确编辑与灵活引用

Hugging Face Daily Papers 论文

摘要

EditWorld 是一种视频世界模型,用于在可交互世界中实现精确编辑和灵活引用,在WBench-Editing基准测试中取得了73.8的最佳总分。

我们提出EditWorld,一个用于在可交互世界中实现精确编辑和灵活引用的视频世界模型。现有的视频世界模型主要关注导航,让用户探索生成的世界,但对如何修改现有世界内容提供有限控制。EditWorld通过在自回归生成过程中流式传输编辑指令和参考图像,将世界建模从探索扩展到精确修改。为了支持这些功能,EditWorld引入了门控因果注意力机制,用于处理随时间变化的编辑条件和参考图像,以及一个稀疏上下文机制,为长期推理维护有限的历史上下文。我们进一步采用了联合自回归和双向训练,并结合退火自重采样,构建了专门的数据合成与标注流水线,为世界编辑提供监督。我们还提出了WBench-Editing,以系统评估流式世界编辑能力。EditWorld在WBench-Editing上取得了最佳整体表现,总分73.8,编辑分80.0,在编辑相关指标上显著优于现有方法。https://github.com/leoisufa/EditWorld
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:18

论文页面 - 可交互世界的精确编辑与灵活引用

来源:https://huggingface.co/papers/2609.34470

摘要

我们提出EditWorld,一个用于可交互世界精确编辑与灵活引用的视频世界模型。现有视频世界模型主要集中于导航功能,允许用户探索生成的世界,但对如何修改现有世界内容提供的控制能力有限。EditWorld通过在自回归生成过程中流式传输编辑指令和参考图像,将世界建模从探索扩展到精确修改。为支持这些能力,EditWorld引入了门控因果注意力机制来处理随时间变化的编辑条件和参考图像,同时采用稀疏上下文机制以维持有限的历史上下文进行长程推理。我们进一步采用了结合自回归与双向训练的策略,配合退火自重采样,并构建了专门的数据合成与标注流程,为世界编辑提供监督信号。我们还提出了WBench-Editing基准,用于系统性评估流式世界编辑能力。EditWorld在WBench-Editing上取得最佳整体表现,总分73.8,编辑得分80.0,在编辑相关指标上显著优于现有方法。https://github.com/leoisufa/EditWorld

查看arXiv页面 (https://arxiv.org/abs/2609.34470) 查看PDF (https://arxiv.org/pdf/2609.34470) GitHub4 (https://github.com/leoisufa/EditWorld) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34470)

获取论文到您的智能体中:

hf papers read 2609.34470

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.34470 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.34470 以从此页面链接。

引用此论文的Spaces 0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.34470 以从此页面链接。

包含此论文的收藏 0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。

ReWorld:一个具有长期记忆的交互式世界模型

Hugging Face Daily Papers

ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

HappyWorld-Bench

Hugging Face Daily Papers

HappyWorld-Bench 是一个全面的基准测试,用于评估世界模型在交互和修改下,在视频、空间和具身赛道中的可靠性。