BA-T: 一种用于两视图束调整的迭代Transformer

Hugging Face Daily Papers 论文

摘要

BA-T是一种用于两视图束调整的迭代Transformer架构,通过轻量设计仅使用传统解码器16%的参数,提升3D重建精度和跨视图一致性,性能与更大模型相当甚至更优。

用于三维重建的前馈模型通过深度跨视图注意力在图像间交换信息,取得了强劲性能。然而,这些方法通常依赖于重型解码器堆栈,缺乏几何精化的结构化机制,导致多视图一致性较差。我们通过从经典束调整(BA)中汲取灵感来解决这个问题,BA可被视为姿态与局部几何之间迭代信息传播的过程。受BA启发,我们提出了BA-T,一种迭代Transformer,它在隐式token空间中实现BA风格的结构化更新,作为可重复层。BA-T不依赖深度注意力堆栈,而是通过单个轻量层基于潜在残差精化预测。实验表明,BA-T在迭代过程中逐步提升姿态和重建精度,比传统解码器实现更强的跨视图一致性,并且在使用仅16%解码器参数的情况下,与显著更大的模型性能相当甚至超越。BA-T为深度重型注意力提供了一种紧凑、高效且结构化的替代方案,在轻量架构中实现精确的3D重建。代码将公开发布在 https://github.com/zhangganlin/BA-T。
查看原文
查看缓存全文

缓存时间: 2026/06/03 15:38

论文页面 - BA-T:用于双视图束调整的迭代Transformer

来源:https://huggingface.co/papers/2606.03287

摘要

BA-T是一种迭代式Transformer架构,通过受束调整启发的结构化更新,提高了三维重建的精度和跨视图一致性,其轻量化设计仅需传统解码器参数的16%。

前馈模型(https://huggingface.co/papers?q=Feed-forward%20models)在三维重建(https://huggingface.co/papers?q=3D%20reconstruction)中通过使用深度跨视角注意力(https://huggingface.co/papers?q=deep%20cross-view%20attention)来跨图像交换信息,取得了强劲的性能。然而,这些方法通常依赖厚重的解码器堆栈(https://huggingface.co/papers?q=decoder%20stacks),且缺乏结构化的几何精化(https://huggingface.co/papers?q=geometry%20refinement)机制,导致多视图一致性较差。我们通过借鉴经典束调整(https://huggingface.co/papers?q=bundle%20adjustment)(BA)来应对这一问题,BA可被视为姿态与局部几何之间迭代信息传播的过程。受BA启发,我们提出了BA-T,一种迭代式Transformer(https://huggingface.co/papers?q=iterative%20Transformer),它将BA风格的结构化更新实现为隐式令牌空间(https://huggingface.co/papers?q=implicit%20token%20space)中可重复的层。BA-T不依赖深层注意力堆栈,而是基于潜残差(https://huggingface.co/papers?q=latent%20residual)通过单个轻量级层来精化预测。实验表明,BA-T在迭代过程中逐步提升姿态和重建精度,实现了比传统解码器更强的跨视图一致性(https://huggingface.co/papers?q=cross-view%20consistency),并且在使用仅16%解码器参数的情况下,与远大于自己的模型性能相当或更优。BA-T为深度密集型注意力(https://huggingface.co/papers?q=depth-heavy%20attention)提供了一种紧凑、高效且结构化的替代方案,使得在轻量化架构中也能实现精确的三维重建(https://huggingface.co/papers?q=3D%20reconstruction)。代码将在 https://github.com/zhangganlin/BA-T 公开。

查看 arXiv 页面(https://arxiv.org/abs/2606.03287)查看 PDF(https://arxiv.org/pdf/2606.03287)GitHub5(https://github.com/zhangganlin/BA-T)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03287)

引用该论文的模型0

尚无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.03287,以便从此页面链接。

引用该论文的数据集0

尚无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.03287,以便从此页面链接。

引用该论文的 Spaces0

尚无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.03287,以便从此页面链接。

收录该论文的合集0

尚无合集收录此论文

请将此论文添加至合集(https://huggingface.co/new-collection),以便从此页面链接。

相似文章

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。