缺失的时间链接:用于脚本驱动音视频生成的Temporal Context Routing
摘要
Temporal Context Routing通过将脚本时间映射到共享的视频-音频时间轴,提升了联合音视频生成中脚本对齐的时间准确性,减少了镜头边界和对话的错误。
查看缓存全文
缓存时间: 2026/09/04 03:55
论文页面 - 缺失的时间链接:脚本驱动的音频-视频生成中的时间上下文路由
来源:https://huggingface.co/papers/2609.02367
摘要
时间上下文路由通过将结构化脚本的时间安排映射到共享的视频-音频时间轴上,改进了联合音频-视频生成中与脚本对齐的镜头和对话时间安排。
联合音频-视频生成(https://huggingface.co/papers?q=Joint%20audio-video%20generation)模型在视觉质量和音视频同步方面取得了显著进展。然而,它们对于镜头转换发生和对话何时进行的控制仍然有限。这一限制约束了它们在脚本驱动内容创作中的应用,因为时间安排上的错误可能会破坏叙事连贯性和观看体验。当前的联合生成器在共享的时间轴上对齐视频和音频表示,但结构化提示中指定的镜头和对话的精确时间安排仅被编码在提示的文本表示中,并且仍然与任何一种模态的时间坐标未对齐。因此,视频和音频可能彼此保持同步,但两者都未能遵循脚本时间线。这种不匹配促使我们将时间对齐(https://huggingface.co/papers?q=temporal%20alignment)扩展到视频和音频之外,以包括结构化脚本。因此,我们引入了时间上下文路由(Temporal Context Routing)(https://huggingface.co/papers?q=Temporal%20Context%20Routing)(TCR),它将脚本时间安排映射到视频和音频生成的共享时间轴上,并将每个提示的引导路由到两种模态中对应的位置。与200个测试脚本上的基线相比,TCR将镜头边界平均绝对误差(Shot Boundary MAE)降低了96%,从1.11秒降至0.042秒,并将0.5秒窗口的对话准确率(Dialogue [email protected] s)从28.3%提高到84.1%。TCR在实现这些改进的同时,保持了与基线相当的视觉质量和音视频同步性。一项用户研究进一步表明,参与者在所有五个评估维度上都更偏好TCR。
查看arXiv页面 (https://arxiv.org/abs/2609.02367)查看PDF (https://arxiv.org/pdf/2609.02367)项目页面 (https://dagroup-pku.github.io/Temporal-Context-Routing.github.io/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.02367)
在您的代理中获取此论文:
hf papers read 2609\.02367
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
starry0929/Temporal-Context-Routing 文本到视频• 约20小时前更新 • 2 (https://huggingface.co/starry0929/Temporal-Context-Routing)
引用此论文的数据集0
无链接此论文的数据集
在数据集的README.md中引用arxiv.org/abs/2609.02367以从本页面链接。
引用此论文的Space0
无链接此论文的Space
在Space的README.md中引用arxiv.org/abs/2609.02367以从本页面链接。
包含此论文的收藏0
无包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接。
相似文章
ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频生成
ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。
视频中定位万物:重新思考高效生成式时空视频定位
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
CausalCine:用于多镜头视频叙事的实时自回归生成
CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。
原生视听对齐生成
NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。
FATE:帧级音视频时间嵌入
提出FATE,一种帧级音视频时间嵌入方法,将帧序列在物理时间轴上对齐,实现语义与时间的联合理解。在时间检索、事件定位和生成评估指标上均优于基线方法。