EchoWM:开放且可进入的全模态世界模型
摘要
EchoWM 介绍了一种开放的全模态世界模型,能够生成同步的视频、声音、音乐和语音,并支持连续的6自由度导航,用于可进入的生成媒体。
查看缓存全文
缓存时间: 2026/08/25 08:34
论文页面 - EchoWM:开放且可进入的全能模态世界模型
来源:https://huggingface.co/papers/2608.23189 发布于 2026年8月24日
#3 当日精选论文 (https://huggingface.co/papers/date/2026-08-25) 作者: , , , , , , , , , , , , , , , , , ,
摘要
EchoWM 是一个全能模态世界模型,能够生成同步的高分辨率视频、声音、音乐和语音,同时支持在第一人称和第三人称视角下遵循连续的 6自由度导航轨迹。
我们提出了 EchoWM,一个面向可进入式生成媒体的全能模态世界模型 (https://huggingface.co/papers?q=omnimodal%20world%20model) (https://huggingface.co/papers?q=enterable%20generative%20media),它能够响应连续导航,并同时生成 720p 视频、环境音、音乐和语音。我们围绕相机意图来组织交互 (https://huggingface.co/papers?q=camera%20intent):在第一人称场景中,它指定观察者运动;而在第三人称场景中,相机-角色动力学直接从数据中学习,无需视角特定的控制器。离散指令和连续姿态被映射到一个共享的、基于度量尺度的相对 6自由度轨迹 (https://huggingface.co/papers?q=6-DoF%20trajectory),并通过数据集级别的校准 (https://huggingface.co/papers?q=dataset-level%20calibration) 来保持跨异构数据的运动幅度。为了联合学习音视频生成 (https://huggingface.co/papers?q=audio-visual%20generation) 和轨迹控制,我们构建了一个互补的数据引擎,并采用了渐进式训练 (https://huggingface.co/papers?q=progressive%20training) 以及随后的自回归后训练 (https://huggingface.co/papers?q=autoregressive%20post-training) 来进行长序列生成 (https://huggingface.co/papers?q=long-horizon%20generation)。大量评估表明,\model 在公开的世界模型基准测试 (https://huggingface.co/papers?q=world-model%20benchmarks) 上实现了强大的轨迹遵循能力和高质量的视觉效果,支持跨多样主题的第一和第三人称交互,并在长序列生成 (https://huggingface.co/papers?q=long-horizon%20generation) 中保持同步的环境音和语音。
查看 arXiv 页面 (https://arxiv.org/abs/2608.23189)查看 PDF (https://arxiv.org/pdf/2608.23189)项目页面 (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/wm/)GitHub 1.88k (https://github.com/jd-opensource/JoyAI-Echo)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23189)
在你的代理中获取这篇论文:
hf papers read 2608.23189
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.23189 以将其从本页链接。
引用本文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.23189 以将其从本页链接。
引用本文的空间 0
无空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2608.23189 以将其从本页链接。
包含本文的收藏夹 1
相似文章
开源全模态世界模型(GitHub仓库)
JoyAI-Echo是一个开源的GitHub仓库,提供长期音视频生成和全模态世界模型,用于创建持久故事和交互式世界。
minWM:用于实时交互式视频世界模型的全栈开源框架
minWM 是一个全栈开源框架,可将双向视频扩散模型转换为实时交互式视频世界模型,支持可控相机、低延迟推演和模块化架构。
HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型
Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。