Helix4D:复杂4D网格生成

Hugging Face Daily Papers 论文

摘要

Helix4D 提出了一种从视频生成高质量动态4D网格的框架,通过扩展Trellis2,引入跨帧注意力机制和4D时间编码,在不增加参数的情况下重新利用冗余的空间RoPE频带,从而实现这一目标。

当前的视频转4D方法在处理复杂的拓扑变化、透明材质、薄层结构和内表面方面存在困难。我们提出了 Helix4D,一个动态网格生成框架,它继承了 Trellis2 的表达能力,并将其从图像到3D的生成扩展到视频条件下的4D生成。我们的设计源于两个关键问题:(a) 如何让 Trellis2 的帧级注意力在帧间共享信息,同时保持其在罕见情况(如透明物体和内表面)下的预训练质量;(b) 如何在不破坏预训练能力的情况下,将时间信息注入到纯3D位置编码中。针对问题 (a),我们采用了滑动窗口跨帧注意力机制,并以第一帧为锚点。第一帧由基础 Trellis2 模型生成,并注入到我们的模型中,通过跨帧注意力使其继承 Trellis2 在罕见情况下的质量。针对问题 (b),我们提出了一种4D时间编码,将冗余的低频空间 RoPE 频带重新用于时间维,从而在不增加参数的情况下将3D编码扩展为4D。大量实验表明,Helix4D 在 ActionBench 和我们自己构建的具有挑战性的复杂动态数据集上,能够生成高质量的动态网格。
查看原文
查看缓存全文

缓存时间: 2026/05/26 06:42

论文页面 - Helix4D: 复杂四维网格生成

来源:https://huggingface.co/papers/2605.26109

摘要

Helix4D 通过将 Trellis2 的帧局部注意力适配到跨帧共享,并利用 4D 时间信息扩展 3D 位置编码,实现了高质量动态网格生成。

当前的视频到 4D 方法在处理复杂拓扑变化、透明材质、薄结构和内表面时存在困难。我们提出 Helix4D,一个动态网格生成(https://huggingface.co/papers?q=dynamic%20mesh%20generation)框架,继承了 Trellis2(https://huggingface.co/papers?q=Trellis2)富有表现力的表示,并将其从图像到 3D 适配为视频条件驱动的 4D 生成。我们的设计源于两个关键问题:(a) 如何让 Trellis2(https://huggingface.co/papers?q=Trellis2)的帧局部注意力(https://huggingface.co/papers?q=frame-local%20attention)在跨帧共享信息的同时,保留其在透明物体和内表面等罕见案例上的预训练质量;(b) 如何在不断裂预训练能力的前提下,将时间信息注入纯粹的 3D 位置编码(https://huggingface.co/papers?q=positional%20encoding)。我们通过滑动窗口跨帧注意力(https://huggingface.co/papers?q=cross-frame%20attention)并锚定第一帧来解决 (a)。第一帧由基础 Trellis2(https://huggingface.co/papers?q=Trellis2)模型生成,并通过跨帧注意力(https://huggingface.co/papers?q=cross-frame%20attention)注入到我们的模型中,使其继承 Trellis2(https://huggingface.co/papers?q=Trellis2)在罕见案例上的质量。我们通过 4D 时间编码(https://huggingface.co/papers?q=4D%20temporal%20encoding)解决 (b),该编码将冗余的低频空间 RoPE 频带(https://huggingface.co/papers?q=RoPE%20bands)重新用于时间,从而将编码从 3D 扩展,无需增加额外参数。大量实验证明了 Helix4D 在 ActionBench(https://huggingface.co/papers?q=ActionBench)和我们自建的挑战性复杂动态集(https://huggingface.co/papers?q=complex%20dynamics%20set)上实现高质量动态网格生成(https://huggingface.co/papers?q=dynamic%20mesh%20generation)的有效性。

查看 arXiv 页面(https://arxiv.org/abs/2605.26109)查看 PDF(https://arxiv.org/pdf/2605.26109)项目页面(https://snap-research.github.io/helix4d/)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26109)

在你的 agent 中获取此论文:

hf papers read 2605\.26109

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

尚无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.26109 即可从本页面链接。

引用此论文的数据集0

尚无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.26109 即可从本页面链接。

引用此论文的 Spaces0

尚无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.26109 即可从本页面链接。

包含此论文的收藏集0

尚无收藏集包含此论文

将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)中即可从本页面链接。

相似文章

基于时空注意力链的快速4D网格生成

Hugging Face Daily Papers

一种基于时空注意力链的无需训练4D网格生成方法,将创建时间加速至9秒(13倍加速),同时提升时间一致性并扩展到更长的序列,具备零样本追踪和相机估计能力。

Lift4D:协调单视角3D估计用于野外4D重建

Hacker News Top

Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。

超越像素:从视频先验到4D世界

Hugging Face Daily Papers

本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。

4DThinker:利用 4D 意象进行动态空间理解

Hugging Face Daily Papers

4DThinker 是一个新框架,使视觉-语言模型能够利用 4D 潜在心理意象执行动态空间推理。该论文引入了可扩展的数据生成方法以及新颖的微调技术(包括 4D 强化学习),以提升模型在复杂动态任务上的性能。