TransNormal-2:基于几何的修正流与边缘感知解码以实现精确法线估计

Hugging Face Daily Papers 论文

摘要

TransNormal-2通过几何感知训练损失和轻量级RGB引导细化模块校正VAE重建误差,改善单目法线估计,在最少标注下取得强劲成果。

基于扩散模型的方法支持单目几何估计,但其像素空间精度受限于一个共同且研究不足的误差源:VAE重建退化。VAE编码器-解码器的8倍空间压缩会降低物体边界的表面法线质量;即使编码和解码真实法线,也会引入1.3至8.5度的平均角度误差(MAE),边缘MAE甚至达到全局MAE的2.8倍。我们提出TransNormal-2,一个基于FLUX.2的修正流框架,采用单步确定性推理,从VAE解码器两侧解决这种退化:在训练时如何监督潜在预测,以及在推理时如何校正解码后的法线。首先,几何感知的像素空间损失,包括逆渲染自一致性、von Mises-Fisher角度损失和小波边缘感知正则化,通过在VAE解码后强制球面法线几何和漫反射图像形成线索,补充了潜在MSE。其次,轻量级几何细化模块(GRM)应用RGB引导的残差校正,以减少边界局部的解码误差,而不随意重写粗略预测。在通用场景基准测试中,TransNormal-2在所有八个报告指标上匹配或超越MoGe-2,同时仅使用其1.4%的任务特定法线标注。增益在透明物体上最为明显,在ClearGrasp上MAE降低4.2度,在ClearPose上降低3.1度,超过最强先前基线。代码将在https://longxiang-ai.github.io/TransNormal-2发布。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:32

论文页面 - TransNormal-2:基于几何约束的整流流模型与边缘感知解码实现精确法线估计

来源:https://huggingface.co/papers/2609.06665

摘要

TransNormal-2通过几何感知训练损失与轻量级RGB引导优化模块,修正了VAE重建误差,从而改进了单目法线估计性能。该模型以极少的标注数据达到了优异的估计效果。

基于扩散的模型实现了单目几何估计,但其像素空间精度受限于一个共同且研究不足的误差源:VAE重建(https://huggingface.co/papers?q=VAE%20reconstruction)质量退化。VAE编码器-解码器的空间压缩(8倍)导致物体边界处的表面法线信息退化;即使编码和解码真实法线也会引入1.3°-8.5°的平均角度误差(MAE),边缘MAE甚至达到全局MAE的2.8倍。本文提出TransNormal-2,这是一个基于FLUX.2架构的整流流(https://huggingface.co/papers?q=rectified-flow)框架,采用单步确定性推理。该框架从VAE解码器的两侧解决上述退化问题:训练时如何监督潜在预测,以及推理时如何修正解码后的法线。首先,几何感知的像素空间损失(包括逆渲染自一致性(https://huggingface.co/papers?q=inverse%20rendering%20self-consistency)、von Mises-Fisher角度损失和小波边缘感知正则化(https://huggingface.co/papers?q=wavelet%20edge-aware%20regularization)),在VAE解码后通过强制球面法线几何约束和漫反射成像线索来补充潜在空间MSE损失。其次,轻量级几何优化模块(GRM)(https://huggingface.co/papers?q=Geometric%20Refinement%20Module)采用RGB引导的残差修正(https://huggingface.co/papers?q=RGB-guided%20residual%20correction),在不随意重写粗糙预测结果的前提下,减少解码时产生的边界局部误差。在通用场景基准测试中,TransNormal-2仅使用1.4%的任务特定法线标注数据,就在所有八项评估指标上达到或超越了MoGe-2的性能。在透明物体上的性能提升最为显著:相较于最强的先验基线,TransNormal-2在ClearGrasp基准上将MAE降低了4.2°,在ClearPose基准上降低了3.1°。代码将在 https://longxiang-ai.github.io/TransNormal-2 发布。

查看arXiv页面 (https://arxiv.org/abs/2609.06665) 查看PDF (https://arxiv.org/pdf/2609.06665) 项目页面 (https://longxiang-ai.github.io/TransNormal-2/) GitHub2 (https://github.com/longxiang-ai/TransNormal-2) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.06665)

通过智能助手获取本文:

hf papers read 2609.06665

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

Longxiang-ai/TransNormal-2 于约2小时前更新 • 2 (https://huggingface.co/Longxiang-ai/TransNormal-2)

引用本文的数据集0

暂无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2609.06665 以从此页面链接至该数据集。

引用本文的空间0

暂无空间链接本文

在空间README.md中引用 arxiv.org/abs/2609.06665 以从此页面链接至该空间。

包含本文的合集0

暂无合集包含本文

将本文添加至合集 (https://huggingface.co/new-collection) 以从此页面链接至该合集。

相似文章

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。

迈向一致视频几何估计

Hugging Face Daily Papers

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。

SurGe:点地图中改进的表面几何

Hugging Face Daily Papers

SurGe引入了一个Neighborhood Attention Decoder和一种重新制定的尺度不变梯度匹配损失,以改进前馈式3D重建中的局部表面几何精度,特别是对于薄结构。它在零样本单目几何基准测试中取得了最先进的平均排名,并在局部点图和法线度量方面表现更好。