@AdinaYakup: JD刚刚发布了JoyAI-Echo,一个有趣的长视频生成模型,5分钟多镜头视频生成,跨模态……
摘要
JD发布了JoyAI-Echo,这是一个长视频生成模型,能够生成5分钟多镜头视频,具备跨模态记忆实现角色和声音一致性,原生音视频生成,并通过DMD蒸馏技术实现7.5倍速度提升(无质量损失)。
JD刚刚发布了JoyAI-Echo 📹 一个有趣的长视频生成模型
✨ 5分钟多镜头视频生成
✨ 跨模态记忆,实现角色和声音一致性
✨ 原生音视频生成
✨ 通过DMD蒸馏技术实现7.5倍速度提升(无质量损失) https://t.co/qIel5Gc8qX
查看缓存全文
缓存时间: 2026/06/03 13:51
京东刚刚发布了 JoyAI-Echo 📹
一个有趣的长视频生成模型
✨ 5分钟多镜头视频生成
✨ 跨模态记忆,角色与语音一致性
✨ 原生音频 + 视频生成
✨ 通过 DMD 蒸馏实现 7.5 倍加速(无损画质)
https://t.co/qIel5Gc8qX
相似文章
jdopensource/JoyAI-Echo
京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。
持久故事与交互式世界的长时间音视频生成
本文介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,适用于长视频和交互式世界,使用跨镜头记忆和几何感知控制来保持连贯性和持久性。
JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑
JoyAI-Video-Edit 是一个具有 160 亿参数的自回归扩散框架,用于实时、开放式视频编辑,可在单个 NVIDIA B200 GPU 上实现约 30 FPS 的 720p 编辑。
字节跳动新AI视频模型可根据单个提示生成30秒片段(2分钟阅读)
字节跳动发布了Seedance 2.5,这是一款AI视频模型,能够根据单个提示或最多50个参考素材生成30秒的4K片段,与OpenAI和谷歌的产品相媲美。
JoyAI-VL-Interaction: 实时视觉-语言交互智能
本文介绍了JoyAI-VL-Interaction,一个开源8B规模的视觉-语言模型,可实时持续运行,自主决定何时响应或委派。它包含一个完整的可部署系统和一个训练配方,在人类评估中优于Doubao和Gemini。