为什么视频扩散模型违反物理规律?揭示注意力机制中的缺陷
摘要
本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。
查看缓存全文
缓存时间: 2026/09/22 03:25
论文页面 - 为何视频扩散模型违背物理规律?揭秘注意力机制缺陷
来源:https://huggingface.co/papers/2609.23658
摘要
尽管具备出色的视觉质量,最先进的视频扩散模型仍常生成违反现实物理规律的内容。现有解决方案依赖外部先验或专门数据,而本研究通过探究模型内部机制寻找根本原因。我们首次对文本到视频扩散模型的“运动规划”过程进行可解释性研究,揭示早期去噪阶段运动轨迹的形成机制。基于“先整体形状,后局部细节”的发现,我们将交叉注意力轨迹模式与因果头贡献相结合,识别出驱动运动规划的特定注意力头子集。进一步的自注意力分析表明,旋转位置编码(RoPE)会引发过度的空间注意力衰减。这导致早期候选区域过早锁定在物理不合理的位置,抑制相邻帧的合理轨迹并触发生成失败模式。为解决这一根本缺陷,我们提出轻量级架构改进方案,在不同去噪步骤中动态调整RoPE的频率缩放。该策略减少了过度注意力衰减,帮助模型探索更优候选区域以建立连贯的物理运动。最后,通过免训练与需训练实验证实,本方法有效提升了生成视频的物理常识性。
查看arXiv页面(https://arxiv.org/abs/2609.23658)查看PDF(https://arxiv.org/pdf/2609.23658)项目页面(https://siriuslala.github.io/physics)GitHub1(https://github.com/Siriuslala/physics)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.23658)
在您的智能体中获取本文:
hf papers read 2609.23658
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型关联本文
在模型README.md中引用arxiv.org/abs/2609.23658以从本页面建立链接
引用本文的数据集0
暂无数据集关联本文
在数据集README.md中引用arxiv.org/abs/2609.23658以从本页面建立链接
引用本文的Spaces0
暂无Space关联本文
在Space README.md中引用arxiv.org/abs/2609.23658以从本页面建立链接
包含本文的合集0
暂无合集收录本文
将本论文添加至合集(https://huggingface.co/new-collection)以从本页面建立链接
相似文章
音频-视频模型中的注意力三角形
本文通过跨注意力机制中的‘注意力三角形’研究音频-视频扩散模型中的语义泄漏,并提出了在生成过程中增强语义锚定的方法。
@ZimingLiu11: 物理在世界模型中可编辑,但仅限关键深度。模型在某层'决定'物理。
论文引入了视频模型中的因果可写性,表明正确的物理运动保持可用但在关键深度后变得不可编辑,这影响了训练纠正错误的方式。
Stream4D:用于流式自回归扩散视频模型的4D一致性
Stream4D通过引入动态4D重建奖励和运动先验来增强流式自回归扩散视频模型,以保持连贯运动并减少几何漂移。
YoCausal: 视频生成距离世界模型有多远?因果视角
本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。