HorizonStream: 长视界注意力用于流式三维重建

Hugging Face Daily Papers 论文

摘要

HorizonStream 提出一种用于流式三维重建的长视界注意力机制,该机制通过证据影响核显式建模几何传播,在恒定内存和线性时间复杂度下实现稳定、可扩展的重建,并能泛化到超过10,000帧的序列。

在线三维重建需要在严格的因果性和有限内存约束下估计相机位姿和场景几何。现有方法在长序列上常出现漂移、抖动或崩溃。我们将这些失败归因于一个根本性的不匹配。流式几何本质上是时间异质的,证据涉及从短期对应到持久全局尺度的范围。然而,当前架构施加了统一且病态的影响模式。例如,滑动窗口强制执行硬截止,而无门控循环和因果注意力会导致缓存饱和以及尖峰状的注意力汇聚。为解决此问题,我们将几何传播形式化为证据影响核,并提出HorizonStream,这是一种长视界Transformer,显式分解该核。对于长时域因素,几何线性注意力学习通道级衰减率,以实现有界、多时间尺度的几何证据传播。对于短时域空间因素,基于时空旋转位置编码的几何局部注意力在执行可靠三维匹配的同时抑制注意力汇聚。最后,度量读出令牌直接从持久几何状态恢复稳定尺度和刚体位姿。大量实验表明,仅用48帧片段训练的HorizonStream能在恒定内存和线性时间内稳定泛化到超过10,000帧的序列,实现了最先进的流式三维重建性能。项目页面:https://3dagentworld.github.io/horizonstream/
查看原文
查看缓存全文

缓存时间: 2026/05/26 10:43

论文页面 - HorizonStream:用于流式三维重建的长时域注意力

来源:https://huggingface.co/papers/2605.23889 发布于 5月22日

·

由 https://huggingface.co/NicolasCC 提交

cc (https://huggingface.co/NicolasCC)于 5月26日

作者:

,

,

,

,

,

,

,

,

,

,

摘要

HorizonStream通过证据影响核(evidence influence kernel)对几何传播进行建模,解决了长期三维重建中的挑战,实现了稳定、可扩展的流式重建,具有恒定内存和线性时间复杂度。

在线三维重建要求在严格的因果性和有界内存约束下估计相机位姿和场景几何。现有方法在长序列上常出现漂移、抖动或崩溃。我们将这些失败归因于一个根本性错配:流式几何本质上是时间异构的,证据范围从短时对应关系到持久全局尺度。然而,当前架构施加了统一且病态的影响模式。例如,滑动窗口强制执行硬截断,而无门控循环和因果注意力(https://huggingface.co/papers?q=causal%20attention)会导致缓存饱和(https://huggingface.co/papers?q=cache%20saturation)和尖峰状注意力汇聚(https://huggingface.co/papers?q=attention%20sinks)。为解决此问题,我们将几何传播(https://huggingface.co/papers?q=geometric%20propagation)形式化为证据影响核(https://huggingface.co/papers?q=evidence%20influence%20kernel),并提出HorizonStream(https://huggingface.co/papers?q=HorizonStream),一种显式分解该核的长时域Transformer(https://huggingface.co/papers?q=long-horizon%20Transformer)。对于长程时间因子,几何线性注意力(https://huggingface.co/papers?q=Geometric%20Linear%20Attention)学习逐通道衰减率(https://huggingface.co/papers?q=channel-wise%20decay%20rates),以实现有界、多时间尺度的几何证据传播。对于短程空间因子,带有时空RoPE(https://huggingface.co/papers?q=Spatiotemporal%20RoPE)的几何局部注意力(https://huggingface.co/papers?q=Geometric%20Local%20Attention)在抑制注意力汇聚(https://huggingface.co/papers?q=attention%20sinks)的同时执行可靠的3D匹配。最后,度量读出令牌(https://huggingface.co/papers?q=Metric%20Readout%20Tokens)直接从持久几何状态中恢复稳定尺度和刚体位姿。大量实验表明,仅用48帧片段训练的HorizonStream(https://huggingface.co/papers?q=HorizonStream)能在恒定内存和线性时间内稳定泛化到超过10,000帧的序列,实现最先进的流式三维重建(https://huggingface.co/papers?q=streaming%203D%20reconstruction)性能。项目页面:https://3dagentworld.github.io/horizonstream (https://huggingface.co/papers?q=horizonstream)/

查看 arXiv 页面 (https://arxiv.org/abs/2605.23889)查看 PDF (https://arxiv.org/pdf/2605.23889)项目页面 (https://3dagentworld.github.io/horizonstream/)GitHub5 (https://github.com/3DAgentWorld/HorizonStream)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23889)

在你的智能体中获取此论文:

hf papers read 2605\.23889

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

NicolasCC/HorizonStream 深度估计• 约2小时前更新 (https://huggingface.co/NicolasCC/HorizonStream)

引用此论文的数据集0

无数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2605.23889 以从此页面链接。

引用此论文的 Space0

无 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.23889 以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。

用于流式 3D 重建的几何上下文 Transformer

Papers with Code Trending

介绍了 LingBot-Map,这是一种前馈式 3D 基础模型,采用几何上下文 Transformer 架构用于流式 3D 重建,能够在 20 FPS 的速率下实现稳定的实时性能。

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。