基于自回归扩散变换器的流式同步空间音频生成
摘要
SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。
查看缓存全文
缓存时间: 2026/06/01 07:18
论文页面 - 通过自回归扩散变换器实现流式同步空间音频生成
来源:https://huggingface.co/papers/2605.30940
摘要
SwanSphere 提出了一种统一的流式框架,利用因果自回归扩散变换器与多模态学习策略,从全景视频和文本提示中生成高保真空间音频。
实时且精确的空间音频生成对于提供沉浸式体验至关重要。然而,现有的空间音频合成技术常常在生成质量与高推理延迟之间存在权衡,并且难以从多模态输入中捕捉精确的空间信息。为解决这些挑战,我们提出了 SwanSphere,一种统一的流式框架,用于从全景视频和文本提示中生成高保真空间音频。SwanSphere 的主要贡献如下:1) 我们引入了一种因果自回归扩散变换器架构,能够实现流式的高质量空间音频生成。2) 我们设计了一种空间视频-音频对比(SVAC)学习策略,使视频编码器与声学领域对齐,并进一步采用多目标在线直接偏好优化(ODPO)方案,从而获得强大的空间感知能力和稳健的多模态空间音频合成。3) 为缓解当前空间音频数据集的稀缺问题,我们还开发了一条自动标注管线,用于生成详细的空间描述。实验结果表明,SwanSphere 在视频到空间音频以及文本到空间音频生成任务中均取得了优越的性能。演示可在以下网址找到:https://swanaigc.github.io/。
查看 arXiv 页面 (https://arxiv.org/abs/2605.30940) 查看 PDF (https://arxiv.org/pdf/2605.30940) 项目页面 (https://swanaigc.github.io/#swansphere) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30940)
在你的 Agent 中获取这篇论文:
hf papers read 2605.30940
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.30940 以在此页面建立链接。
引用本论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.30940 以在此页面建立链接。
引用本论文的空间0
没有空间链接到此论文
在空间 README.md 中引用 arxiv.org/abs/2605.30940 以在此页面建立链接。
包含本论文的收藏0
没有收藏包含此论文
将本论文添加到收藏以在此页面建立链接。
相似文章
Stream4D:用于流式自回归扩散视频模型的4D一致性
Stream4D通过引入动态4D重建奖励和运动先验来增强流式自回归扩散视频模型,以保持连贯运动并减少几何漂移。
SwanTale:面向指令和零样本任务的统一多说话人语音与音频生成
本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。
Stereo2Spatial: 将立体声音乐曲目转换为空间化双声道混音 [P]
发布了一个模型(Stereo2Spatial),可将立体声音乐曲目转换为空间化双声道混音,采用流匹配扩散和振幅提升技术以实现稳定训练。该模型及一款Windows应用均以Apache 2.0许可证开源。
视频中定位万物:重新思考高效生成式时空视频定位
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
Pantheon360: 通过3D感知360度视频扩散驯服数字孪生生成
Pantheon360引入了一种3D感知360度视频扩散框架,该框架使用显式3D缓存来强制执行几何一致性,从而能够从稀疏360度输入中生成高保真数字孪生。