EchoWM:开放且可进入的全模态世界模型

Hugging Face Daily Papers 论文

摘要

EchoWM 介绍了一种开放的全模态世界模型,能够生成同步的视频、声音、音乐和语音,并支持连续的6自由度导航,用于可进入的生成媒体。

我们推出 EchoWM,一个用于可进入生成媒体的全模态世界模型,它响应连续导航,同时联合生成720p视频、环境音效、音乐和语音。我们围绕相机意图组织交互:在第一人称场景中,它指定观察者运动;而在第三人称场景中,相机-角色动态从数据中学习,无需特定视角的控制器。离散命令和连续姿态被映射到共享的度量尺度相对6自由度轨迹,通过数据集级别的校准在异构数据中保持运动幅度。为了联合学习视听生成和轨迹控制,我们构建了一个互补的数据引擎,并采用渐进式训练,随后进行自回归后训练,以实现长时域生成。大量评估表明,EchoWM 在公开的世界模型基准测试中表现出强大的轨迹跟随能力和高视觉质量,支持第一人称和第三人称交互,并在长时域生成中保持同步的环境音效和语音。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:34

论文页面 - EchoWM:开放且可进入的全能模态世界模型

来源:https://huggingface.co/papers/2608.23189 发布于 2026年8月24日

#3 当日精选论文 (https://huggingface.co/papers/date/2026-08-25) 作者: , , , , , , , , , , , , , , , , , ,

摘要

EchoWM 是一个全能模态世界模型,能够生成同步的高分辨率视频、声音、音乐和语音,同时支持在第一人称和第三人称视角下遵循连续的 6自由度导航轨迹。

我们提出了 EchoWM,一个面向可进入式生成媒体的全能模态世界模型 (https://huggingface.co/papers?q=omnimodal%20world%20model) (https://huggingface.co/papers?q=enterable%20generative%20media),它能够响应连续导航,并同时生成 720p 视频、环境音、音乐和语音。我们围绕相机意图来组织交互 (https://huggingface.co/papers?q=camera%20intent):在第一人称场景中,它指定观察者运动;而在第三人称场景中,相机-角色动力学直接从数据中学习,无需视角特定的控制器。离散指令和连续姿态被映射到一个共享的、基于度量尺度的相对 6自由度轨迹 (https://huggingface.co/papers?q=6-DoF%20trajectory),并通过数据集级别的校准 (https://huggingface.co/papers?q=dataset-level%20calibration) 来保持跨异构数据的运动幅度。为了联合学习音视频生成 (https://huggingface.co/papers?q=audio-visual%20generation) 和轨迹控制,我们构建了一个互补的数据引擎,并采用了渐进式训练 (https://huggingface.co/papers?q=progressive%20training) 以及随后的自回归后训练 (https://huggingface.co/papers?q=autoregressive%20post-training) 来进行长序列生成 (https://huggingface.co/papers?q=long-horizon%20generation)。大量评估表明,\model 在公开的世界模型基准测试 (https://huggingface.co/papers?q=world-model%20benchmarks) 上实现了强大的轨迹遵循能力和高质量的视觉效果,支持跨多样主题的第一和第三人称交互,并在长序列生成 (https://huggingface.co/papers?q=long-horizon%20generation) 中保持同步的环境音和语音。

查看 arXiv 页面 (https://arxiv.org/abs/2608.23189)查看 PDF (https://arxiv.org/pdf/2608.23189)项目页面 (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/)GitHub 1.88k (https://github.com/jd-opensource/JoyAI-Echo)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23189)

在你的代理中获取这篇论文:

hf papers read 2608.23189

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.23189 以将其从本页链接。

引用本文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.23189 以将其从本页链接。

引用本文的空间 0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2608.23189 以将其从本页链接。

包含本文的收藏夹 1

相似文章

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。