持久故事与交互式世界的长时间音视频生成
摘要
本文介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,适用于长视频和交互式世界,使用跨镜头记忆和几何感知控制来保持连贯性和持久性。
查看缓存全文
缓存时间: 2026/08/27 07:18
论文页面 - 面向持久故事与交互世界的长时程音视频生成
来源:https://huggingface.co/papers/2608.23383 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
JoyAI-Echo-1.5 通过跨镜头记忆、几何感知相机控制与展开感知训练,将长视频生成与交互式世界生成统一起来,从而在扩展序列中维持身份与连贯性。
视频生成正在从独立片段向长篇叙事和交互式世界演进,这要求模型保持身份一致性、遵循用户控制并在长程展开中保持稳定。我们推出 JoyAI-Echo-1.5——一个统一的音视频生成系统,包含两个专用变体。长视频变体引入了可组合的跨镜头记忆(https://huggingface.co/papers?q=cross-shot%20memory),该记忆聚合多个先前镜头的视觉证据,并从语音过滤的全镜头音频中提取说话者线索(https://huggingface.co/papers?q=speaker%20cues),从而在文本、图像和记忆条件的灵活组合中实现持久的角色外观与声音身份。世界模型变体将异构导航输入转换为校准的度量6自由度相机轨迹(https://huggingface.co/papers?q=6-DoF%20camera%20trajectories),并通过几何感知条件注入路径(https://huggingface.co/papers?q=geometry-aware%20conditioning)将其注入,从而实现跨灵活视角的控制器无关交互。为支持高效的长时程生成,我们利用渐进式教师强制(https://huggingface.co/papers?q=progressive%20teacher%20forcing)将双向音视频主干(https://huggingface.co/papers?q=bidirectional%20audio-visual%20backbone)转换为因果少步生成器(https://huggingface.co/papers?q=causal%20few-step%20generator),并在自生成展开(https://huggingface.co/papers?q=self-generated%20rollouts)上应用短时程与长时程自梯度强制(https://huggingface.co/papers?q=Self-Gradient%20Forcing)。实验表明两种场景均表现优异。JoyAI-Echo-1.5 在跨镜头一致性、视觉质量、文本对齐和语音保真度方面均优于现有长视频基线。其世界模型变体在 WBench 上排名第一,平均分达 81.7,并在 SANA-WM-Bench 上取得领先的视觉质量与长时程持久性。综合来看,这些结果表明记忆、几何控制与展开感知训练为生成连贯故事和持续演化的交互世界提供了实用基础。项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/。
查看 arXiv 页面 (https://arxiv.org/abs/2608.23383)查看 PDF (https://arxiv.org/pdf/2608.23383)项目主页 (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)GitHub1.95k (https://github.com/jd-opensource/JoyAI-Echo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.23383)
通过代理获取此论文:
hf papers read 2608.23383
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.23383 以将其链接至此页面。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.23383 以将其链接至此页面。
引用此论文的 Space0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.23383 以将其链接至此页面。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection)以将其链接至此页面。
相似文章
开源全模态世界模型(GitHub仓库)
JoyAI-Echo是一个开源的GitHub仓库,提供长期音视频生成和全模态世界模型,用于创建持久故事和交互式世界。
@AdinaYakup: JD刚刚发布了JoyAI-Echo,一个有趣的长视频生成模型,5分钟多镜头视频生成,跨模态……
JD发布了JoyAI-Echo,这是一个长视频生成模型,能够生成5分钟多镜头视频,具备跨模态记忆实现角色和声音一致性,原生音视频生成,并通过DMD蒸馏技术实现7.5倍速度提升(无质量损失)。
jdopensource/JoyAI-Echo
京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。
Echo-Forcing: 一种用于交互式长视频生成的场景记忆框架
Echo-Forcing 提出了一种用于交互式长视频生成的场景记忆框架,利用分层时间记忆、场景召回帧和差异感知记忆衰减来处理提示切换和长期回忆。该方法无需训练,在 VBench-Long 上取得了强劲的性能。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。