开源全模态世界模型(GitHub仓库)
摘要
JoyAI-Echo是一个开源的GitHub仓库,提供长期音视频生成和全模态世界模型,用于创建持久故事和交互式世界。
EchoWM是一个全模态世界模型,遵循连续6-DoF相机轨迹,同时联合生成720p视频、环境音效、音乐和语音。它支持第一人称和第三人称交互,并使用渐进式加自回归训练以实现同步长期生成。
查看缓存全文
缓存时间: 2026/08/26 15:52
JoyAI-Echo
🎬 面向持久故事与交互世界的长时音视频生成
📄 论文1.0 | 📄 论文1.5 | 📄 Echo-WM论文 | 🌐 项目主页 | 🤗 长视频 Hugging Face
🤗 世界模型 Hugging Face | 🖥️ ComfyUI
相似文章
EchoWM:开放且可进入的全模态世界模型
EchoWM 介绍了一种开放的全模态世界模型,能够生成同步的视频、声音、音乐和语音,并支持连续的6自由度导航,用于可进入的生成媒体。
持久故事与交互式世界的长时间音视频生成
本文介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,适用于长视频和交互式世界,使用跨镜头记忆和几何感知控制来保持连贯性和持久性。
jdopensource/JoyAI-Echo
京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。
Cosmos 3: 用于物理AI的全模态世界模型
Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。
Ex-Omni-2D:具有原生视觉呈现的表现力全模态对话模型
Ex-Omni-2D 是一个全模态对话框架,通过视觉思维计划和蒸馏流式视频生成器,生成协调一致的文本、语音和参考条件视频响应,实现了实用的质量-效率权衡。