@vincieye: 高斯查询散落在整个场景中?不再如此。LocusGS 为每个查询锚定一个3D中心+半径,保持高斯的局部性和连贯性。

X AI KOLs Timeline 论文

摘要

LocusGS 通过用3D锚定状态(中心和半径)增强高斯查询,从而改进前馈3D高斯溅射,提升3D场景重建的空间连贯性和渲染质量。

高斯查询散落在整个场景中?不再如此。LocusGS 为每个查询锚定一个3D中心+半径,保持高斯的局部性和连贯性。更智能的3D重建 🚀 📄 https://t.co/3q55da7ub1 🌐 https://t.co/aid8tB8qUb https://t.co/fwVwPspcKg
查看原文
查看缓存全文

缓存时间: 2026/08/17 14:20

高斯查询散布在整个场景中?一去不复返。LocusGS为每个查询锚定一个3D中心+半径,使高斯局部化并保持连贯。更智能的3D重建🚀

📄 https://t.co/3q55da7ub1 🌐 https://t.co/aid8tB8qUb https://t.co/fwVwPspcKg


LocusGS:用于前馈3D高斯溅射的空间锚定标记

来源:https://arxiv.org/html/2608.12825v1 作者:Sidun Liu, Tongrui Hu, Peng Qiao, Yong Dou 机构:国防科技大学(中国长沙) 联系邮箱:{wenyu18, liusidun, tongruihu, pengqiao, yongdou}@nudt.edu.cn

摘要

近期的基于查询的前馈3DGS方法使用可学习查询来表示场景,每个查询聚合多视角证据并解码一组高斯。理想情况下,不同查询应专注于场景的连贯局部区域。然而,我们观察到从同一查询解码的高斯常分散在遥远的场景区域,导致查询级的空间连贯性较弱且与场景结构对齐不佳。我们将此行为归因于现有高斯查询纯粹的隐式表示。为解决此局限,我们引入LocusGS,为每个高斯查询增加一个由中心和支持半径构成的3D锚定状态。该锚定状态在解码器层间逐步精化,并贯穿于查询交互、多视角特征聚合和高斯生成的全过程。具体而言,锚定到射线的几何偏置引导每个查询关注空间相关的图像观测,而以锚定为中心的解码则将其高斯组织在局部区域内。新视角合成基准测试表明,在相同高斯预算下,LocusGS相比基于查询的高斯标记基线提升了渲染质量。进一步分析表明,所学锚定形成连贯的空间布局并导致更结构化的高斯分布,证明显式锚定状态改进了空间组织。我们的项目页面:https://leo-frank.github.io/LocusGS_viewer

1 引言

参考图注图1:空间锚定同时改善了全局高斯组织和标记级局部性。橙色点突出显示从单个代表性标记解码的全部64个高斯。在相同输入和高斯预算下,TokenGS产生弥散的场景结构,一个标记的高斯散布在广阔的空间区域。而LocusGS重建的高斯更好地遵循场景几何结构,其学习的锚定形成了组织局部高斯生成的粗略空间支架。从图像重建3D场景[16, 17, 14]是计算机视觉中的一个基本问题,在机器人、增强现实和具身感知领域有广泛应用。3D高斯溅射[7]已证明场景可由一组高斯基元表示并实现高保真高效渲染。然而,原始高斯溅射流程通常需要对每个新场景进行高成本的迭代拟合。为降低此成本,近期的前馈方法试图直接从输入视角预测3D高斯表示,从而实现更快、更可扩展的3D场景重建。

在前馈3DGS方法中,基于查询的预测已成为密集、像素对齐高斯回归之外的替代方案。与直接从图像网格特征预测高斯基元的密集方法[2, 3, 20]不同,基于查询的方法使用固定集合的可学习查询[15, 4]表示场景。每个查询通过Transformer解码器聚合多视角图像证据,随后被解码为一组3D高斯。如图2所示,此固定查询集将高斯预算与图像分辨率和输入视角数量解耦。然而,移除密集的图像到高斯对应关系也使得每个查询的空间角色变得隐含。

理想情况下,查询标记应表现出清晰的空间专门化。每个标记应在连贯的局部区域内生成紧凑的高斯组,同时不同标记覆盖场景的互补部分。然而,如图1所示,从同一标记解码的高斯常分散在遥远的场景区域,导致空间上弥散的分布且与场景结构对齐不佳。这些观察表明现有仅基于隐式的查询标记缺乏明确的空间责任概念。我们认为此失败源于缺乏显式空间状态:隐式查询未指定其在3D空间中的操作位置或覆盖区域大小。因此,查询聚合的多视角证据或解码的高斯均未显式约束在连贯局部区域内。

为建立这种空间专门化,我们提出LocusGS,为每个高斯标记增加一个由中心和支持半径构成的显式3D锚定状态。中心指定标记当前的3D位置,半径定义其局部支持范围。锚定状态贯穿解码阶段:它引导标记到图像的交叉注意力,为高斯标记之间的交互提供空间线索,并作为高斯生成的局部参考。锚定中心和半径在解码器层间逐步精化,使每个标记能适应输入场景调整其空间位置和支持范围。通过这种方式,LocusGS为空间锚定了每个查询并鼓励其专注于紧凑的局部区域。

新视角合成基准测试表明,在相同标记和高斯预算下,LocusGS相比基于查询的高斯标记基线提升了渲染质量。更重要的是,所提锚定状态导致预测高斯更结构化的3D组织。我们的分析显示LocusGS产生更少的分散标记关联基元,鼓励从同一标记解码的高斯形成空间上紧凑的局部组,并学习在重建场景上形成连贯空间支架的锚定。这些结果表明显式3D锚定状态不仅提供更好的重建精度,还为前馈高斯重建提供更具空间意义的查询表示。

2 相关工作

2.1 前馈3D高斯溅射

前馈3D高斯溅射直接从稀疏输入图像预测场景表示,避免昂贵的逐场景优化。PixelSplat[2]通过极线特征聚合和深度估计预测高斯,而MVSplat[3]引入基于代价体的多视角推理。DepthSplat[20]进一步融入单目深度先验,后续工作将前馈重建扩展到无位姿设置[6, 21]。这些方法主要从密集的图像对齐特征生成高斯,将基元预算与图像分辨率和输入视角数量耦合。

2.2 网格解耦与基于查询的高斯重建

为减少密集高斯预测的冗余,近期方法采用选择性基元生成[19, 9]、特征或标记压缩[18, 25]或跨视角标记融合[8]。其他方法利用预训练3D重建模型的几何先验合并冗余的像素对齐预测[5]或构建稀疏3D锚点[23]。这些方法在减少冗余的同时保留了图像对齐或外部初始化的预测结构。基于查询的方法则将场景表示本身与输入网格解耦。TokenGS[15]引入可学习高斯查询,每个查询聚合多视角图像特征并解码一组高斯基元,使输出预算独立于图像分辨率和视角数量。一些同期方法共享此高层查询公式,但在输入假设、特征骨干、注意力架构和高斯解码策略上有所不同[4, 1]。GlobalSplat[4]采用解耦的几何和外观分支,而C3G[1]使用预训练VGGT编码器并为每个查询解码一个高斯。尽管如此,这些方法主要将每个查询表示为隐式特征。LocusGS则为每个查询配备一个显式3D状态,该状态逐步精化并直接参与特征聚合和高斯解码。此设计在概念上与DAB-DETR[11]相关,后者为对象查询增加动态精化的锚框。虽然DAB-DETR使用此类锚点进行2D对象定位,但LocusGS在3D空间中维护中心和半径状态,以在重建过程中空间锚定场景查询。LocusGS也与Scaffold-GS[13]相关,后者围绕稀疏3D锚点组织局部高斯,而我们的锚点作为查询状态并在前馈框架中从多视角图像特征逐步精化。

参考图注图2:三种前馈3DGS范式的概念比较。(a) 密集视角预测解码多视角图像特征并使用每视角头生成视角依赖的高斯溅射。(b) 固定预算查询生成引入可学习查询以解码一组与图像分辨率和输入视角数量无关的高斯。(c) 我们的空间锚定查询范式进一步为查询配备显式空间锚点,实现锚点感知解码和更结构化的高斯生成。

3 方法

3.1 前提:基于查询的前馈高斯溅射

近期基于查询的前馈高斯溅射将3DGS预测表述为集合到集合的解码问题。给定具有相应相机位姿\mathcal{P}的多视角图像\mathcal{I}=\{I_v\}_{v=1}^V,图像编码器首先提取多视角视觉特征\mathbf{F},作为解码器的记忆。解码器维护N个可学习高斯查询,初始化为 \mathbf{Q}^0=[\mathbf{q}_1^0,\mathbf{q}_2^0,\ldots,\mathbf{q}_N^0]^\top\in\mathbb{R}^{N\times d},其中\mathbf{q}_i^0\in\mathbb{R}^d表示第i个查询的初始特征。这些查询通过Transformer解码器块逐步更新: \mathbf{Q}^{l+1}=D(\mathbf{Q}^l,\mathbf{F})。每个解码器块通常交替执行高斯查询间的自注意力和到编码多视角图像特征的交叉注意力,允许查询从输入视角聚合场景证据。经过L层解码器后,每个最终查询\mathbf{q}_i^L通过高斯预测头映射为包含K个高斯基元的局部组: \mathcal{G}_i=\{(\mathbf{x}_{i,k},\mathbf{s}_{i,k},\mathbf{R}_{i,k},\mathbf{c}^G_{i,k},\alpha_{i,k})\}_{k=1}^K,其中\mathbf{x}\mathbf{s}\mathbf{R}\mathbf{c}^G\alpha分别表示高斯中心、尺度、旋转、颜色和不透明度。所有标记解码的高斯组组合形成场景表示\mathcal{G}=\bigcup_{i=1}^N\mathcal{G}_i

3.1.1 现有查询方法的局限性

尽管固定预算预测效率高,但现有查询方法表现出有限的空间专门化。理想情况下,每个查询应专注于连贯的局部区域,聚合与该区域相关的多视角证据,并解码空间紧凑的高斯组,同时不同查询覆盖场景的互补部分。然而,如图1所示,从单个查询解码的高斯常空间上弥散,可能分散在遥远的场景区域。因此,逐标记的高斯组表现出较弱的空间连贯性,其组织未紧密遵循场景结构。

参考图注图3:从隐式高斯标记到显式锚定标记。左:标准查询方法使用可学习3DGS标记作为隐式嵌入,其中自注意力和图像到3DGS交叉注意力主要由标记和图像特征驱动。右:LocusGS为每个解码器标记增加可学习的3D锚定状态(\mu,r)。锚定状态为标记自注意力提供空间线索,并通过锚定感知交叉注意力引导跨视角特征聚合。跨解码器层,锚定状态逐步精化并用于锚定中心高斯预测,将高斯标记转变为空间锚定的重建查询。

3.2 LocusGS

3.2.1 我们的洞察

我们认为上述观察到的弱空间连贯性源于高斯查询的表示方式。现有方法通常仅将每个查询表示为隐式特征。这种表示未明确指定查询在3D空间中的操作位置应覆盖多大区域。因此,查询聚合的多视角证据和解码的高斯未与连贯的局部区域关联。此观察促使我们为每个查询配备显式3D锚定状态,为特征聚合和局部组织的高斯预测提供空间参考。

3.2.2 概述

给定带位姿的多视角图像,LocusGS在单次前向传播中预测固定预算的3D高斯基元集合。输入图像被编码为多视角图像标记,相机参数由块级Plücker射线表示。LocusGS为每个查询增加显式3D锚定状态,指定其当前3D参考位置和支持半径。解码器使用这些锚点引导跨视角特征聚合,逐步精化锚定状态,并将高斯基元解码为相对于精化锚点的局部偏移。

3.2.3 查询的显式3D锚定状态

在现有基于查询的高斯重建中,每个查询表示为可学习的高维嵌入。此类嵌入在Transformer解码器中充当内容查询。与标准查询方法不同,LocusG

相似文章

GlobalSplat: 通过全局场景标记实现高效的前馈式三维高斯散射

Hugging Face Daily Papers

GlobalSplat 引入了一种高效的前馈框架,用于三维高斯散射,通过全局场景标记实现紧凑且一致的场景重建,将计算开销和推理时间降低至78毫秒以下。该方法采用从粗到细的训练策略,防止表示膨胀,同时以显著更少的高斯原语(16K)达到有竞争力的新视角合成性能,与密集基线相比更为高效。

ZipSplat:更少的高斯,更优的 Splats

Hugging Face Daily Papers

ZipSplat 是一种基于 token 的前馈 3D 高斯溅射模型,利用 k-means 聚类将高斯放置与像素网格解耦,在无需真实位姿或内参的情况下,在 DL3DV 和 RealEstate10K 上实现了约 6 倍的高斯减少,同时设立了新的最佳结果。

高斯点溅射

Hacker News Top

研究人员提出了高斯点溅射(Gaussian Point Splatting),这是一种随机渲染方法,利用像素大小的不透明点和64位GPU原子操作,能够实时渲染数亿个高斯点。该方法已被SIGGRAPH 2026接收,采用层次化剔除与并行编程原语,实现均匀的工作负载分配,与原始高斯溅射相比仅存在轻微的噪声差异。

在Julia中实现更好的高斯溅射

Hacker News Top

GaussianSplatting.jl 2.0版本通过KernelAbstractions.jl带来了多GPU后端支持、多线程UI、MCMC致密化策略,以及用于更好3D重建的深度/几何监督。