HorizonStream: 长视界注意力用于流式三维重建
摘要
HorizonStream 提出一种用于流式三维重建的长视界注意力机制,该机制通过证据影响核显式建模几何传播,在恒定内存和线性时间复杂度下实现稳定、可扩展的重建,并能泛化到超过10,000帧的序列。
查看缓存全文
缓存时间: 2026/05/26 10:43
论文页面 - HorizonStream:用于流式三维重建的长时域注意力
来源:https://huggingface.co/papers/2605.23889 发布于 5月22日
·
由 https://huggingface.co/NicolasCC 提交
cc (https://huggingface.co/NicolasCC)于 5月26日
作者:
,
,
,
,
,
,
,
,
,
,
摘要
HorizonStream通过证据影响核(evidence influence kernel)对几何传播进行建模,解决了长期三维重建中的挑战,实现了稳定、可扩展的流式重建,具有恒定内存和线性时间复杂度。
在线三维重建要求在严格的因果性和有界内存约束下估计相机位姿和场景几何。现有方法在长序列上常出现漂移、抖动或崩溃。我们将这些失败归因于一个根本性错配:流式几何本质上是时间异构的,证据范围从短时对应关系到持久全局尺度。然而,当前架构施加了统一且病态的影响模式。例如,滑动窗口强制执行硬截断,而无门控循环和因果注意力(https://huggingface.co/papers?q=causal%20attention)会导致缓存饱和(https://huggingface.co/papers?q=cache%20saturation)和尖峰状注意力汇聚(https://huggingface.co/papers?q=attention%20sinks)。为解决此问题,我们将几何传播(https://huggingface.co/papers?q=geometric%20propagation)形式化为证据影响核(https://huggingface.co/papers?q=evidence%20influence%20kernel),并提出HorizonStream(https://huggingface.co/papers?q=HorizonStream),一种显式分解该核的长时域Transformer(https://huggingface.co/papers?q=long-horizon%20Transformer)。对于长程时间因子,几何线性注意力(https://huggingface.co/papers?q=Geometric%20Linear%20Attention)学习逐通道衰减率(https://huggingface.co/papers?q=channel-wise%20decay%20rates),以实现有界、多时间尺度的几何证据传播。对于短程空间因子,带有时空RoPE(https://huggingface.co/papers?q=Spatiotemporal%20RoPE)的几何局部注意力(https://huggingface.co/papers?q=Geometric%20Local%20Attention)在抑制注意力汇聚(https://huggingface.co/papers?q=attention%20sinks)的同时执行可靠的3D匹配。最后,度量读出令牌(https://huggingface.co/papers?q=Metric%20Readout%20Tokens)直接从持久几何状态中恢复稳定尺度和刚体位姿。大量实验表明,仅用48帧片段训练的HorizonStream(https://huggingface.co/papers?q=HorizonStream)能在恒定内存和线性时间内稳定泛化到超过10,000帧的序列,实现最先进的流式三维重建(https://huggingface.co/papers?q=streaming%203D%20reconstruction)性能。项目页面:https://3dagentworld.github.io/horizonstream (https://huggingface.co/papers?q=horizonstream)/
查看 arXiv 页面 (https://arxiv.org/abs/2605.23889)查看 PDF (https://arxiv.org/pdf/2605.23889)项目页面 (https://3dagentworld.github.io/horizonstream/)GitHub5 (https://github.com/3DAgentWorld/HorizonStream)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23889)
在你的智能体中获取此论文:
hf papers read 2605\.23889
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
NicolasCC/HorizonStream 深度估计• 约2小时前更新 (https://huggingface.co/NicolasCC/HorizonStream)
引用此论文的数据集0
无数据集链接此论文
请在数据集的 README.md 中引用 arxiv.org/abs/2605.23889 以从此页面链接。
引用此论文的 Space0
无 Space 链接此论文
请在 Space 的 README.md 中引用 arxiv.org/abs/2605.23889 以从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
用于流式 3D 重建的几何上下文 Transformer
介绍了 LingBot-Map,这是一种前馈式 3D 基础模型,采用几何上下文 Transformer 架构用于流式 3D 重建,能够在 20 FPS 的速率下实现稳定的实时性能。
LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
Lite3R:一种高效的模型无关前馈3D重建框架
Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。