超越检索:渐进式潜在记忆演化用于流式视频理解

Hugging Face Daily Papers 论文

摘要

LatentStream 引入了一个渐进式潜在工作记忆框架,该框架内化流式视觉证据以进行连续推理,在视频基准测试中实现了最先进的结果。

流式视频理解要求多模态大语言模型(MLLMs)在严格因果性和有限内存条件下处理连续视觉输入并响应用户查询。现有方法通常将历史观测压缩到外部记忆库中,并检索查询相关证据作为额外的视觉上下文。尽管有效,但这种存储和检索范式将历史证据保持为外部视觉上下文,阻止其内化为紧凑、演化的潜在记忆,从而无法持续引导流式推理。为了弥合这一差距,我们引入了 LatentStream,一个渐进式潜在工作记忆框架,将流式记忆从存储和检索转变为检索和内化。具体而言,LatentStream 包含三个协调组件。首先,查询无关的分层流式记忆通过 Jenks 指导的自适应整合,将视觉历史组织到短期、中期和长期级别,在固定内存预算下进行。一旦查询到达,分层潜在记忆演化为潜在记忆组配备渐进扩展的记忆感受野,使其能够迭代地从相应范围检索历史证据并将其内化到紧凑、固定长度的潜在记忆中。最后,渐进式置信度引导的潜在记忆优化从组级预测熵构建分层进展奖励,并联合优化潜在记忆组和检索证据,鼓励越来越自信的流式推理。大量实验表明,LatentStream 在现有的在线和离线视频基准测试中取得了新的最先进的结果。
查看原文
查看缓存全文

缓存时间: 2026/09/04 07:57

论文页面 - 超越检索:用于流式视频理解的渐进式潜在记忆演进

来源:https://huggingface.co/papers/2609.04131

摘要

LatentStream 引入了一个渐进式潜在工作记忆框架,该框架将流式视觉证据内化为紧凑的演进词元,以实现持续推理。

流式视频理解(https://huggingface.co/papers?q=Streaming%20video%20understanding)要求多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs) 在严格的因果性和有限内存约束下,处理连续的视觉输入并响应用户查询。现有方法通常将历史观察压缩到外部记忆库中,并检索查询相关的证据作为额外的视觉上下文。虽然有效,但这种“存储-检索”范式将历史证据保持为外部视觉上下文,阻碍了其被内化为能够持续指导流式推理的紧凑、演进的潜在记忆。为了弥合这一差距,我们引入了 LatentStream,这是一个渐进式潜在工作记忆(https://huggingface.co/papers?q=latent%20working%20memory)框架,它将流式记忆从“存储-检索”转变为“检索-内化”。具体来说,LatentStream 包含三个协同组件。首先,查询无关的分层流式记忆(https://huggingface.co/papers?q=Hierarchical%20Streaming%20Memory)通过 Jenks 引导的自适应整合(https://huggingface.co/papers?q=Jenks-guided%20adaptive%20consolidation),在固定的内存预算下,将视觉历史组织为短期、中期和长期级别。一旦查询到达,分层潜在记忆演进会为一组潜在记忆词元(https://huggingface.co/papers?q=latent%20memory%20tokens)配备逐渐扩展的记忆感受野(https://huggingface.co/papers?q=memory%20receptive%20fields),使其能够迭代地从各自的范围检索历史证据,并将其内化为紧凑、固定长度的潜在记忆。最后,渐进式置信度引导的潜在记忆优化基于分组预测熵(https://huggingface.co/papers?q=predictive%20entropy)构建分层渐进奖励,并联合优化潜在记忆词元(https://huggingface.co/papers?q=latent%20memory%20tokens)和检索到的证据,鼓励越来越自信的流式推理。大量实验表明,LatentStream 在现有的在线和离线视频基准测试中取得了新的最先进结果。

查看 arXiv 页面(https://arxiv.org/abs/2609.04131)查看 PDF(https://arxiv.org/pdf/2609.04131)项目页面(https://github.com/quhongyu/LatentStream)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.04131)

在您的代理中获取此论文:

hf papers read 2609\.04131

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.04131 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.04131 以从本页面链接。

引用此论文的空间0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.04131 以从本页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页面链接。

相似文章

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。