TriSplat:面向仿真的前馈式三维场景重建

Hugging Face Daily Papers 论文

摘要

TriSplat是一种前馈式三维重建网络,利用有向三角形图元直接从单张图像生成可直接用于仿真的网格,省去了昂贵的后处理步骤。该方法在保持竞争性的新视角渲染质量的同时,实现了几何保真的重建。

稀疏视角的三维重建越来越多地采用前馈式散点网络,这些网络直接从图像预测显式图元。然而,现有方法大多以高斯图元为核心,仅间接暴露表面:要提取可用于下游仿真、物理推理或具身交互的网格,仍然需要进行昂贵的后期处理步骤,这违背了前馈式处理的初衷。这种限制在无位姿设定下尤为突出,因为需要从稀疏观测中联合估计场景结构和相机参数。我们提出TriSplat,一种前馈式重建网络,它以有向三角形图元表示场景,并通过单次前向传播直接导出可用于仿真的网格场景。给定输入图像,网络预测局部三维点图、三角形属性、相机位姿以及可选内参。我们的方法并非将三角形朝向作为无约束隐变量进行回归,而是从预测的点图中构建几何法线,通过图像条件法线头进行细化,并将其转换为用于三角形参数化的稳定局部坐标系。此外,单目法线引导策略进一步稳定了早期训练,而透明度与模糊度策略则逐步锐化学习到的表面表示,以实现直接的网格提取。在RealEstate10K和DL3DV上的实验表明,与基于高斯的前馈基线方法相比,该表示能够产生更几何保真的重建,同时保持竞争性的新视角渲染质量。由于渲染图元本身就是表面三角形,输出可以直接被物理引擎、碰撞检测器和标准渲染管线使用,无需任何转换,从而为前馈式三维场景重建提供了一种实用的、可立即用于仿真的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/05/26 06:43

论文页面 - TriSplat: 面向仿真的前馈式3D场景重建

来源:https://huggingface.co/papers/2605.26115

摘要

TriSplat是一个前馈式3D重建网络,它使用有向三角形图元直接从单张图像生成可直接用于仿真的网格,省去了昂贵的后处理步骤。

稀疏视角的3D重建越来越多地通过前馈式溅射网络(https://huggingface.co/papers?q=splatting%20networks)来解决,这些网络直接从图像中预测显式图元。然而,大多数现有方法仍以高斯图元(https://huggingface.co/papers?q=Gaussian%20primitives)为中心,并且仅间接地暴露表面:要提取可用于下游仿真、物理推理或具身交互的可用网格,仍需进行昂贵的后期处理,这打破了前馈式的承诺。这一限制在无位姿场景中尤为突出,因为场景结构和相机参数必须从稀疏观测中联合估计。我们提出 TriSplat,这是一个前馈式重建(https://huggingface.co/papers?q=feed-forward%20reconstruction)网络,它使用有向三角形图元(https://huggingface.co/papers?q=triangle%20primitives)表示场景,并通过单次前向传播直接导出可直接用于仿真的网格场景(https://huggingface.co/papers?q=mesh%20scenes)。给定输入图像,网络预测局部3D点图(https://huggingface.co/papers?q=3D%20point%20maps)、三角形属性(https://huggingface.co/papers?q=triangle%20attributes)、相机位姿(https://huggingface.co/papers?q=camera%20poses)以及可选的内部参数。我们的方法并非将三角形方向作为无约束隐变量进行回归,而是从预测的点图构建几何法线,通过图像条件的法线头(https://huggingface.co/papers?q=normal%20head)进行精炼,并将其转换为稳定的局部坐标系以进行三角形参数化。单目法线引导(https://huggingface.co/papers?q=mono-normal%20bootstrap)调度进一步稳定了早期训练,而透明度和模糊调度(https://huggingface.co/papers?q=blur%20scheduling)则逐步锐化学习到的表面表示,以实现直接网格提取。在 RealEstate10K 和 DL3DV 上的实验表明,与高斯前馈基线相比,该表示能产生更符合几何结构的重建结果,同时保持具有竞争力的新视角渲染质量。由于渲染图元本身就是表面三角形,输出可以直接被物理引擎(https://huggingface.co/papers?q=physics%20engines)、碰撞检测器(https://huggingface.co/papers?q=collision%20detectors)和标准渲染管线摄取,无需任何转换,从而成为前馈式3D场景重建中实用的面向仿真解决方案。

查看arXiv页面 (https://arxiv.org/abs/2605.26115) 查看PDF (https://arxiv.org/pdf/2605.26115) 项目页面 (https://lhmd.top/trisplat/#interactive) GitHub6 (https://github.com/ziplab/TriSplat) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.26115)

在您的Agent中获取这篇论文:

hf papers read 2605\.26115

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型1

lhmd/TriSplat 图像转3D • 更新于约3小时前 • 1 (https://huggingface.co/lhmd/TriSplat)

引用本论文的数据集1

lhmd/re10k_torch 更新于约3小时前 • 61.4k • 2 (https://huggingface.co/datasets/lhmd/re10k_torch)

引用本论文的Spaces0

没有Space链接本论文

在Space的README.md中引用 arxiv.org/abs/2605.26115 以从本页面链接到它。

包含本论文的收藏0

没有收藏包含本论文

添加本论文到收藏 (https://huggingface.co/new-collection) 以从本页面链接到它。

相似文章

FLAT: 面向几何精确场景生成的前馈潜在三角形溅射

Hugging Face Daily Papers

FLAT提出了一种方法,直接从视频扩散潜在表示中解码显式三角形溅射,用于几何精确的3D场景生成。它引入了以射线为中心的旋转参数化和乘积窗口函数来改善梯度流,实现了比先前前馈方法更好的几何精度,同时支持实时渲染。

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。