持久故事与交互式世界的长时间音视频生成

Hugging Face Daily Papers 论文

摘要

本文介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,适用于长视频和交互式世界,使用跨镜头记忆和几何感知控制来保持连贯性和持久性。

视频生成正从孤立的片段发展到长叙事和交互式世界,要求模型在长时间生成过程中保持身份、遵循用户控制并保持稳定。我们介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,具有两个专用变体。长视频变体引入了可组合的跨镜头记忆,该记忆聚合多个先前镜头的视觉证据以及从语音过滤的完整镜头音频中提取的说话人线索,从而在文本、图像和记忆条件的灵活组合中保持角色外观和声音身份的持久性。世界模型变体将异构导航输入转换为校准的度量6自由度相机轨迹,并通过几何感知条件通路注入它们,从而实现跨灵活视角的控制器无关交互。为了支持高效的长时间生成,我们通过渐进式教师强制以及在自生成展开上的短时和长时间自梯度强制,将双向音视频骨干转化为因果少步生成器。实验表明在两种设置下都具有强大的性能。JoyAI-Echo-1.5在跨镜头一致性、视觉质量、文本对齐和语音保真度方面相比现有长视频基线有所改进。其世界模型变体在WBench上排名第一,平均得分81.7,并在SANA-WM-Bench上实现了领先的视觉质量和长时间持久性。这些结果共同表明,记忆、几何控制和展开感知训练为生成连贯故事和持续演进的交互式世界提供了实用基础。项目页面:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/。
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:18

论文页面 - 面向持久故事与交互世界的长时程音视频生成

来源:https://huggingface.co/papers/2608.23383 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

JoyAI-Echo-1.5 通过跨镜头记忆、几何感知相机控制与展开感知训练,将长视频生成与交互式世界生成统一起来,从而在扩展序列中维持身份与连贯性。

视频生成正在从独立片段向长篇叙事和交互式世界演进,这要求模型保持身份一致性、遵循用户控制并在长程展开中保持稳定。我们推出 JoyAI-Echo-1.5——一个统一的音视频生成系统,包含两个专用变体。长视频变体引入了可组合的跨镜头记忆(https://huggingface.co/papers?q=cross-shot%20memory),该记忆聚合多个先前镜头的视觉证据,并从语音过滤的全镜头音频中提取说话者线索(https://huggingface.co/papers?q=speaker%20cues),从而在文本、图像和记忆条件的灵活组合中实现持久的角色外观与声音身份。世界模型变体将异构导航输入转换为校准的度量6自由度相机轨迹(https://huggingface.co/papers?q=6-DoF%20camera%20trajectories),并通过几何感知条件注入路径(https://huggingface.co/papers?q=geometry-aware%20conditioning)将其注入,从而实现跨灵活视角的控制器无关交互。为支持高效的长时程生成,我们利用渐进式教师强制(https://huggingface.co/papers?q=progressive%20teacher%20forcing)将双向音视频主干(https://huggingface.co/papers?q=bidirectional%20audio-visual%20backbone)转换为因果少步生成器(https://huggingface.co/papers?q=causal%20few-step%20generator),并在自生成展开(https://huggingface.co/papers?q=self-generated%20rollouts)上应用短时程与长时程自梯度强制(https://huggingface.co/papers?q=Self-Gradient%20Forcing)。实验表明两种场景均表现优异。JoyAI-Echo-1.5 在跨镜头一致性、视觉质量、文本对齐和语音保真度方面均优于现有长视频基线。其世界模型变体在 WBench 上排名第一,平均分达 81.7,并在 SANA-WM-Bench 上取得领先的视觉质量与长时程持久性。综合来看,这些结果表明记忆、几何控制与展开感知训练为生成连贯故事和持续演化的交互世界提供了实用基础。项目主页:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/。

查看 arXiv 页面 (https://arxiv.org/abs/2608.23383)查看 PDF (https://arxiv.org/pdf/2608.23383)项目主页 (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)GitHub1.95k (https://github.com/jd-opensource/JoyAI-Echo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.23383)

通过代理获取此论文:

hf papers read 2608.23383

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.23383 以将其链接至此页面。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.23383 以将其链接至此页面。

引用此论文的 Space0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.23383 以将其链接至此页面。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection)以将其链接至此页面。

相似文章

jdopensource/JoyAI-Echo

Hugging Face Models Trending

京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。

Echo-Forcing: 一种用于交互式长视频生成的场景记忆框架

Hugging Face Daily Papers

Echo-Forcing 提出了一种用于交互式长视频生成的场景记忆框架,利用分层时间记忆、场景召回帧和差异感知记忆衰减来处理提示切换和长期回忆。该方法无需训练,在 VBench-Long 上取得了强劲的性能。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。