开源全模态世界模型(GitHub仓库)

TLDR AI 模型

摘要

JoyAI-Echo是一个开源的GitHub仓库,提供长期音视频生成和全模态世界模型,用于创建持久故事和交互式世界。

EchoWM是一个全模态世界模型,遵循连续6-DoF相机轨迹,同时联合生成720p视频、环境音效、音乐和语音。它支持第一人称和第三人称交互,并使用渐进式加自回归训练以实现同步长期生成。
查看原文
查看缓存全文

缓存时间: 2026/08/26 15:52

JoyAI-Echo

🎬 面向持久故事与交互世界的长时音视频生成

📄 论文1.0 | 📄 论文1.5 | 📄 Echo-WM论文 | 🌐 项目主页 | 🤗 长视频 Hugging Face

🤗 世界模型 Hugging Face | 🖥️ ComfyUI

相似文章

EchoWM:开放且可进入的全模态世界模型

Hugging Face Daily Papers

EchoWM 介绍了一种开放的全模态世界模型,能够生成同步的视频、声音、音乐和语音,并支持连续的6自由度导航,用于可进入的生成媒体。

jdopensource/JoyAI-Echo

Hugging Face Models Trending

京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。

Cosmos 3: 用于物理AI的全模态世界模型

Hugging Face Daily Papers

Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。