为什么视频扩散模型违反物理规律?揭示注意力机制中的缺陷

Hugging Face Daily Papers 论文

摘要

本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。

尽管视觉质量令人印象深刻,最先进的视频扩散模型常生成违反现实世界物理定律的内容。现有解决方案依赖外部先验或专门数据,而我们通过探索这些模型的内部机制来调查根本原因。具体来说,我们首次对文本到视频扩散模型的“运动规划”过程进行了可解释性研究,揭示了运动轨迹如何在早期去噪阶段形成。基于“先形状,后细节”的发现,我们结合交叉注意力轨迹模式和因果头贡献,识别出驱动运动规划的特定注意力头子集。进一步,我们的自注意力分析显示,旋转位置嵌入(RoPE)导致过度的空间注意力衰减。这使得早期候选区域过早锁定在物理上不合理的位置,抑制了相邻帧中的合理轨迹,并触发生成失败模式。为解决这一根本缺陷,我们提出一种轻量级的架构修改,在不同去噪步骤中调整RoPE的频率。该策略减少了过度的注意力衰减,帮助模型探索更好的候选区域以建立连贯的物理运动。最后,无需训练和基于训练的实验确认了我们的方法在增强生成视频物理常识方面的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/22 03:25

论文页面 - 为何视频扩散模型违背物理规律?揭秘注意力机制缺陷

来源:https://huggingface.co/papers/2609.23658

摘要

尽管具备出色的视觉质量,最先进的视频扩散模型仍常生成违反现实物理规律的内容。现有解决方案依赖外部先验或专门数据,而本研究通过探究模型内部机制寻找根本原因。我们首次对文本到视频扩散模型的“运动规划”过程进行可解释性研究,揭示早期去噪阶段运动轨迹的形成机制。基于“先整体形状,后局部细节”的发现,我们将交叉注意力轨迹模式与因果头贡献相结合,识别出驱动运动规划的特定注意力头子集。进一步的自注意力分析表明,旋转位置编码(RoPE)会引发过度的空间注意力衰减。这导致早期候选区域过早锁定在物理不合理的位置,抑制相邻帧的合理轨迹并触发生成失败模式。为解决这一根本缺陷,我们提出轻量级架构改进方案,在不同去噪步骤中动态调整RoPE的频率缩放。该策略减少了过度注意力衰减,帮助模型探索更优候选区域以建立连贯的物理运动。最后,通过免训练与需训练实验证实,本方法有效提升了生成视频的物理常识性。

查看arXiv页面(https://arxiv.org/abs/2609.23658)查看PDF(https://arxiv.org/pdf/2609.23658)项目页面(https://siriuslala.github.io/physics)GitHub1(https://github.com/Siriuslala/physics)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.23658)

在您的智能体中获取本文:

hf papers read 2609.23658

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无模型关联本文

在模型README.md中引用arxiv.org/abs/2609.23658以从本页面建立链接

引用本文的数据集0

暂无数据集关联本文

在数据集README.md中引用arxiv.org/abs/2609.23658以从本页面建立链接

引用本文的Spaces0

暂无Space关联本文

在Space README.md中引用arxiv.org/abs/2609.23658以从本页面建立链接

包含本文的合集0

暂无合集收录本文

将本论文添加至合集(https://huggingface.co/new-collection)以从本页面建立链接

相似文章

音频-视频模型中的注意力三角形

arXiv cs.AI

本文通过跨注意力机制中的‘注意力三角形’研究音频-视频扩散模型中的语义泄漏,并提出了在生成过程中增强语义锚定的方法。

YoCausal: 视频生成距离世界模型有多远?因果视角

Hugging Face Daily Papers

本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。