TransNormal-2:基于几何的修正流与边缘感知解码以实现精确法线估计
摘要
TransNormal-2通过几何感知训练损失和轻量级RGB引导细化模块校正VAE重建误差,改善单目法线估计,在最少标注下取得强劲成果。
查看缓存全文
缓存时间: 2026/09/09 08:32
论文页面 - TransNormal-2:基于几何约束的整流流模型与边缘感知解码实现精确法线估计
来源:https://huggingface.co/papers/2609.06665
摘要
TransNormal-2通过几何感知训练损失与轻量级RGB引导优化模块,修正了VAE重建误差,从而改进了单目法线估计性能。该模型以极少的标注数据达到了优异的估计效果。
基于扩散的模型实现了单目几何估计,但其像素空间精度受限于一个共同且研究不足的误差源:VAE重建(https://huggingface.co/papers?q=VAE%20reconstruction)质量退化。VAE编码器-解码器的空间压缩(8倍)导致物体边界处的表面法线信息退化;即使编码和解码真实法线也会引入1.3°-8.5°的平均角度误差(MAE),边缘MAE甚至达到全局MAE的2.8倍。本文提出TransNormal-2,这是一个基于FLUX.2架构的整流流(https://huggingface.co/papers?q=rectified-flow)框架,采用单步确定性推理。该框架从VAE解码器的两侧解决上述退化问题:训练时如何监督潜在预测,以及推理时如何修正解码后的法线。首先,几何感知的像素空间损失(包括逆渲染自一致性(https://huggingface.co/papers?q=inverse%20rendering%20self-consistency)、von Mises-Fisher角度损失和小波边缘感知正则化(https://huggingface.co/papers?q=wavelet%20edge-aware%20regularization)),在VAE解码后通过强制球面法线几何约束和漫反射成像线索来补充潜在空间MSE损失。其次,轻量级几何优化模块(GRM)(https://huggingface.co/papers?q=Geometric%20Refinement%20Module)采用RGB引导的残差修正(https://huggingface.co/papers?q=RGB-guided%20residual%20correction),在不随意重写粗糙预测结果的前提下,减少解码时产生的边界局部误差。在通用场景基准测试中,TransNormal-2仅使用1.4%的任务特定法线标注数据,就在所有八项评估指标上达到或超越了MoGe-2的性能。在透明物体上的性能提升最为显著:相较于最强的先验基线,TransNormal-2在ClearGrasp基准上将MAE降低了4.2°,在ClearPose基准上降低了3.1°。代码将在 https://longxiang-ai.github.io/TransNormal-2 发布。
查看arXiv页面 (https://arxiv.org/abs/2609.06665) 查看PDF (https://arxiv.org/pdf/2609.06665) 项目页面 (https://longxiang-ai.github.io/TransNormal-2/) GitHub2 (https://github.com/longxiang-ai/TransNormal-2) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.06665)
通过智能助手获取本文:
hf papers read 2609.06665
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
Longxiang-ai/TransNormal-2 于约2小时前更新 • 2 (https://huggingface.co/Longxiang-ai/TransNormal-2)
引用本文的数据集0
暂无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2609.06665 以从此页面链接至该数据集。
引用本文的空间0
暂无空间链接本文
在空间README.md中引用 arxiv.org/abs/2609.06665 以从此页面链接至该空间。
包含本文的合集0
暂无合集包含本文
将本文添加至合集 (https://huggingface.co/new-collection) 以从此页面链接至该合集。
相似文章
PointDiT: 像素空间扩散用于单目几何估计
PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。
迈向一致视频几何估计
ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。
Marigold V2:重新审视扩散变换器在单目深度估计中的应用
Marigold V2通过单步推理和新颖的微调协议,改造扩散变换器用于单目深度估计,实现了更清晰的深度图,并在KITTI和ETH3D等基准测试上取得了显著改进。
SurGe:点地图中改进的表面几何
SurGe引入了一个Neighborhood Attention Decoder和一种重新制定的尺度不变梯度匹配损失,以改进前馈式3D重建中的局部表面几何精度,特别是对于薄结构。它在零样本单目几何基准测试中取得了最先进的平均排名,并在局部点图和法线度量方面表现更好。
VGGT-Edit: 基于残差场预测的前馈原生3D场景编辑
VGGT-Edit 提出了一种基于深度同步文本注入和残差场预测的前馈框架,用于文本驱动的原生3D场景编辑,相较于2D提升方法,实现了更优的质量和效率。