超越检索:渐进式潜在记忆演化用于流式视频理解
摘要
LatentStream 引入了一个渐进式潜在工作记忆框架,该框架内化流式视觉证据以进行连续推理,在视频基准测试中实现了最先进的结果。
查看缓存全文
缓存时间: 2026/09/04 07:57
论文页面 - 超越检索:用于流式视频理解的渐进式潜在记忆演进
来源:https://huggingface.co/papers/2609.04131
摘要
LatentStream 引入了一个渐进式潜在工作记忆框架,该框架将流式视觉证据内化为紧凑的演进词元,以实现持续推理。
流式视频理解(https://huggingface.co/papers?q=Streaming%20video%20understanding)要求多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs) 在严格的因果性和有限内存约束下,处理连续的视觉输入并响应用户查询。现有方法通常将历史观察压缩到外部记忆库中,并检索查询相关的证据作为额外的视觉上下文。虽然有效,但这种“存储-检索”范式将历史证据保持为外部视觉上下文,阻碍了其被内化为能够持续指导流式推理的紧凑、演进的潜在记忆。为了弥合这一差距,我们引入了 LatentStream,这是一个渐进式潜在工作记忆(https://huggingface.co/papers?q=latent%20working%20memory)框架,它将流式记忆从“存储-检索”转变为“检索-内化”。具体来说,LatentStream 包含三个协同组件。首先,查询无关的分层流式记忆(https://huggingface.co/papers?q=Hierarchical%20Streaming%20Memory)通过 Jenks 引导的自适应整合(https://huggingface.co/papers?q=Jenks-guided%20adaptive%20consolidation),在固定的内存预算下,将视觉历史组织为短期、中期和长期级别。一旦查询到达,分层潜在记忆演进会为一组潜在记忆词元(https://huggingface.co/papers?q=latent%20memory%20tokens)配备逐渐扩展的记忆感受野(https://huggingface.co/papers?q=memory%20receptive%20fields),使其能够迭代地从各自的范围检索历史证据,并将其内化为紧凑、固定长度的潜在记忆。最后,渐进式置信度引导的潜在记忆优化基于分组预测熵(https://huggingface.co/papers?q=predictive%20entropy)构建分层渐进奖励,并联合优化潜在记忆词元(https://huggingface.co/papers?q=latent%20memory%20tokens)和检索到的证据,鼓励越来越自信的流式推理。大量实验表明,LatentStream 在现有的在线和离线视频基准测试中取得了新的最先进结果。
查看 arXiv 页面(https://arxiv.org/abs/2609.04131)查看 PDF(https://arxiv.org/pdf/2609.04131)项目页面(https://github.com/quhongyu/LatentStream)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.04131)
在您的代理中获取此论文:
hf papers read 2609\.04131
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.04131 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.04131 以从本页面链接。
引用此论文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2609.04131 以从本页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。
相似文章
GROVE:从流式视频体验中生长与推理的时间分层记忆
GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。
先想象后预测:用于视频事件预测的交错潜在视觉推理
介绍了Future-L1,一种交错潜在视觉推理框架,通过在潜在空间中保持视觉语义来改进视频事件预测。在FutureBench和TwiFF-Bench基准上取得了最先进的结果。
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
StreamArena:迈向连续、交互式且长时程的智能体流式视频理解
StreamArena 是一个用于小时级交互式流式视频理解的基准测试,并配套了一种名为 StreamMind 的两层架构。该架构在实时感知、历史回顾、主动交互和工具使用方面均优于现有的流式基线方法。
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。