Helix4D:复杂4D网格生成
摘要
Helix4D 提出了一种从视频生成高质量动态4D网格的框架,通过扩展Trellis2,引入跨帧注意力机制和4D时间编码,在不增加参数的情况下重新利用冗余的空间RoPE频带,从而实现这一目标。
查看缓存全文
缓存时间: 2026/05/26 06:42
论文页面 - Helix4D: 复杂四维网格生成
来源:https://huggingface.co/papers/2605.26109
摘要
Helix4D 通过将 Trellis2 的帧局部注意力适配到跨帧共享,并利用 4D 时间信息扩展 3D 位置编码,实现了高质量动态网格生成。
当前的视频到 4D 方法在处理复杂拓扑变化、透明材质、薄结构和内表面时存在困难。我们提出 Helix4D,一个动态网格生成(https://huggingface.co/papers?q=dynamic%20mesh%20generation)框架,继承了 Trellis2(https://huggingface.co/papers?q=Trellis2)富有表现力的表示,并将其从图像到 3D 适配为视频条件驱动的 4D 生成。我们的设计源于两个关键问题:(a) 如何让 Trellis2(https://huggingface.co/papers?q=Trellis2)的帧局部注意力(https://huggingface.co/papers?q=frame-local%20attention)在跨帧共享信息的同时,保留其在透明物体和内表面等罕见案例上的预训练质量;(b) 如何在不断裂预训练能力的前提下,将时间信息注入纯粹的 3D 位置编码(https://huggingface.co/papers?q=positional%20encoding)。我们通过滑动窗口跨帧注意力(https://huggingface.co/papers?q=cross-frame%20attention)并锚定第一帧来解决 (a)。第一帧由基础 Trellis2(https://huggingface.co/papers?q=Trellis2)模型生成,并通过跨帧注意力(https://huggingface.co/papers?q=cross-frame%20attention)注入到我们的模型中,使其继承 Trellis2(https://huggingface.co/papers?q=Trellis2)在罕见案例上的质量。我们通过 4D 时间编码(https://huggingface.co/papers?q=4D%20temporal%20encoding)解决 (b),该编码将冗余的低频空间 RoPE 频带(https://huggingface.co/papers?q=RoPE%20bands)重新用于时间,从而将编码从 3D 扩展,无需增加额外参数。大量实验证明了 Helix4D 在 ActionBench(https://huggingface.co/papers?q=ActionBench)和我们自建的挑战性复杂动态集(https://huggingface.co/papers?q=complex%20dynamics%20set)上实现高质量动态网格生成(https://huggingface.co/papers?q=dynamic%20mesh%20generation)的有效性。
查看 arXiv 页面(https://arxiv.org/abs/2605.26109)查看 PDF(https://arxiv.org/pdf/2605.26109)项目页面(https://snap-research.github.io/helix4d/)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26109)
在你的 agent 中获取此论文:
hf papers read 2605\.26109
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
尚无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.26109 即可从本页面链接。
引用此论文的数据集0
尚无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.26109 即可从本页面链接。
引用此论文的 Spaces0
尚无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.26109 即可从本页面链接。
包含此论文的收藏集0
尚无收藏集包含此论文
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中即可从本页面链接。
相似文章
基于时空注意力链的快速4D网格生成
一种基于时空注意力链的无需训练4D网格生成方法,将创建时间加速至9秒(13倍加速),同时提升时间一致性并扩展到更长的序列,具备零样本追踪和相机估计能力。
Lift4D:协调单视角3D估计用于野外4D重建
Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。
Pantheon360: 通过3D感知360度视频扩散驯服数字孪生生成
Pantheon360引入了一种3D感知360度视频扩散框架,该框架使用显式3D缓存来强制执行几何一致性,从而能够从稀疏360度输入中生成高保真数字孪生。
超越像素:从视频先验到4D世界
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。
4DThinker:利用 4D 意象进行动态空间理解
4DThinker 是一个新框架,使视觉-语言模型能够利用 4D 潜在心理意象执行动态空间推理。该论文引入了可扩展的数据生成方法以及新颖的微调技术(包括 4D 强化学习),以提升模型在复杂动态任务上的性能。