BA-T: 一种用于两视图束调整的迭代Transformer
摘要
BA-T是一种用于两视图束调整的迭代Transformer架构,通过轻量设计仅使用传统解码器16%的参数,提升3D重建精度和跨视图一致性,性能与更大模型相当甚至更优。
查看缓存全文
缓存时间: 2026/06/03 15:38
论文页面 - BA-T:用于双视图束调整的迭代Transformer
来源:https://huggingface.co/papers/2606.03287
摘要
BA-T是一种迭代式Transformer架构,通过受束调整启发的结构化更新,提高了三维重建的精度和跨视图一致性,其轻量化设计仅需传统解码器参数的16%。
前馈模型(https://huggingface.co/papers?q=Feed-forward%20models)在三维重建(https://huggingface.co/papers?q=3D%20reconstruction)中通过使用深度跨视角注意力(https://huggingface.co/papers?q=deep%20cross-view%20attention)来跨图像交换信息,取得了强劲的性能。然而,这些方法通常依赖厚重的解码器堆栈(https://huggingface.co/papers?q=decoder%20stacks),且缺乏结构化的几何精化(https://huggingface.co/papers?q=geometry%20refinement)机制,导致多视图一致性较差。我们通过借鉴经典束调整(https://huggingface.co/papers?q=bundle%20adjustment)(BA)来应对这一问题,BA可被视为姿态与局部几何之间迭代信息传播的过程。受BA启发,我们提出了BA-T,一种迭代式Transformer(https://huggingface.co/papers?q=iterative%20Transformer),它将BA风格的结构化更新实现为隐式令牌空间(https://huggingface.co/papers?q=implicit%20token%20space)中可重复的层。BA-T不依赖深层注意力堆栈,而是基于潜残差(https://huggingface.co/papers?q=latent%20residual)通过单个轻量级层来精化预测。实验表明,BA-T在迭代过程中逐步提升姿态和重建精度,实现了比传统解码器更强的跨视图一致性(https://huggingface.co/papers?q=cross-view%20consistency),并且在使用仅16%解码器参数的情况下,与远大于自己的模型性能相当或更优。BA-T为深度密集型注意力(https://huggingface.co/papers?q=depth-heavy%20attention)提供了一种紧凑、高效且结构化的替代方案,使得在轻量化架构中也能实现精确的三维重建(https://huggingface.co/papers?q=3D%20reconstruction)。代码将在 https://github.com/zhangganlin/BA-T 公开。
查看 arXiv 页面(https://arxiv.org/abs/2606.03287)查看 PDF(https://arxiv.org/pdf/2606.03287)GitHub5(https://github.com/zhangganlin/BA-T)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03287)
引用该论文的模型0
尚无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.03287,以便从此页面链接。
引用该论文的数据集0
尚无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.03287,以便从此页面链接。
引用该论文的 Spaces0
尚无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.03287,以便从此页面链接。
收录该论文的合集0
尚无合集收录此论文
请将此论文添加至合集(https://huggingface.co/new-collection),以便从此页面链接。
相似文章
Lite3R:一种高效的模型无关前馈3D重建框架
Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。
ResBM:一种基于Transformer的新型架构,用于低带宽流水线并行训练,实现128倍激活压缩 [R]
ResBM提出了一种基于Transformer的架构,采用残差编码器-解码器瓶颈用于流水线并行训练,在保持收敛的同时实现了128倍激活压缩。该工作通过减少阶段间通信开销,推进了去中心化、互联网级分布式训练的发展。
Track2View:通过配对3D点轨迹实现4D一致的相机控制视频生成
Track2View 通过将视频扩散转换器基于配对3D点轨迹进行条件生成,从视频中生成新的相机视角,实现了最先进的视觉质量,并显著降低了旋转和平移误差。
基于Token的双视角融合与大视觉模型在乳腺癌分类中的适配
本文提出了一种以Token为中心的双视角学习框架,在冻结的视觉Transformer中统一了基于提示的适配和跨视角融合,以改善基于乳腺X线图像的乳腺癌分类,在VinDr-Mammo和CMMD数据集上取得了一致的性能提升。
BP-TTA: 动态场景下基于平衡与原型指导的测试时自适应
提出BP-TTA,一种通过结合批次平衡采样与原型指导约束来处理类别不平衡和持续域偏移的测试时自适应方法,在动态流式场景中实现了最先进的性能。