缺失的时间链接:用于脚本驱动音视频生成的Temporal Context Routing

Hugging Face Daily Papers 论文

摘要

Temporal Context Routing通过将脚本时间映射到共享的视频-音频时间轴,提升了联合音视频生成中脚本对齐的时间准确性,减少了镜头边界和对话的错误。

联合音视频生成模型在视觉质量和音视频同步方面已取得重大进展。然而,它们在控制镜头转换和对话发生的时间方面能力仍然有限。这一限制制约了其在脚本驱动内容创作中的应用,因为时间错误可能损害叙事连贯性和观看体验。当前的联合生成器在共享的时间轴上对齐视频和音频表示,但结构化提示中指定的镜头和对话的精确时间仅编码在提示的文本表示中,未与任一模态的时间坐标对齐。因此,视频和音频可能彼此同步,却都未能遵循脚本时间线。这种不匹配促使我们扩展时间对齐,将结构化脚本也纳入其中。因此,我们引入了Temporal Context Routing (TCR),它将脚本时间映射到视频和音频生成的共享时间轴上,并将每个提示的指导路由到两个模态中的相应位置。与基于200个测试脚本的基线相比,TCR将镜头边界MAE降低了96%,从1.11秒降至0.042秒,并将对话[email protected] s从28.3%提高到84.1%。TCR在实现这些改进的同时,保持了与基线相当的视觉质量和音视频同步。一项用户研究进一步表明,参与者在所有五个评估维度上都更偏好TCR。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:55

论文页面 - 缺失的时间链接:脚本驱动的音频-视频生成中的时间上下文路由

来源:https://huggingface.co/papers/2609.02367

摘要

时间上下文路由通过将结构化脚本的时间安排映射到共享的视频-音频时间轴上,改进了联合音频-视频生成中与脚本对齐的镜头和对话时间安排。

联合音频-视频生成(https://huggingface.co/papers?q=Joint%20audio-video%20generation)模型在视觉质量和音视频同步方面取得了显著进展。然而,它们对于镜头转换发生和对话何时进行的控制仍然有限。这一限制约束了它们在脚本驱动内容创作中的应用,因为时间安排上的错误可能会破坏叙事连贯性和观看体验。当前的联合生成器在共享的时间轴上对齐视频和音频表示,但结构化提示中指定的镜头和对话的精确时间安排仅被编码在提示的文本表示中,并且仍然与任何一种模态的时间坐标未对齐。因此,视频和音频可能彼此保持同步,但两者都未能遵循脚本时间线。这种不匹配促使我们将时间对齐(https://huggingface.co/papers?q=temporal%20alignment)扩展到视频和音频之外,以包括结构化脚本。因此,我们引入了时间上下文路由(Temporal Context Routing)(https://huggingface.co/papers?q=Temporal%20Context%20Routing)(TCR),它将脚本时间安排映射到视频和音频生成的共享时间轴上,并将每个提示的引导路由到两种模态中对应的位置。与200个测试脚本上的基线相比,TCR将镜头边界平均绝对误差(Shot Boundary MAE)降低了96%,从1.11秒降至0.042秒,并将0.5秒窗口的对话准确率(Dialogue [email protected] s)从28.3%提高到84.1%。TCR在实现这些改进的同时,保持了与基线相当的视觉质量和音视频同步性。一项用户研究进一步表明,参与者在所有五个评估维度上都更偏好TCR。

查看arXiv页面 (https://arxiv.org/abs/2609.02367)查看PDF (https://arxiv.org/pdf/2609.02367)项目页面 (https://dagroup-pku.github.io/Temporal-Context-Routing.github.io/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.02367)

在您的代理中获取此论文:

hf papers read 2609\.02367

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

starry0929/Temporal-Context-Routing 文本到视频• 约20小时前更新 • 2 (https://huggingface.co/starry0929/Temporal-Context-Routing)

引用此论文的数据集0

无链接此论文的数据集

在数据集的README.md中引用arxiv.org/abs/2609.02367以从本页面链接。

引用此论文的Space0

无链接此论文的Space

在Space的README.md中引用arxiv.org/abs/2609.02367以从本页面链接。

包含此论文的收藏0

无包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接。

相似文章

原生视听对齐生成

Hugging Face Daily Papers

NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。

FATE:帧级音视频时间嵌入

Hugging Face Daily Papers

提出FATE,一种帧级音视频时间嵌入方法,将帧序列在物理时间轴上对齐,实现语义与时间的联合理解。在时间检索、事件定位和生成评估指标上均优于基线方法。