GROVE:从流式视频体验中生长与推理的时间分层记忆
摘要
GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/05 05:44
论文页面 - GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
Source: https://huggingface.co/papers/2608.02392
摘要
可穿戴助手应当既能回答关于其视觉历史的问题,又能识别该历史在当下情境中是否有用。现有的视频记忆系统主要支持问题条件式回忆,而主动式助手通常使用独立的记忆和控制机制。我们提出了GROVE,一个无需训练的框架,通过一种从连续视频流中因果式生长的记忆来同时支持这两种行为。GROVE保留细粒度的感知证据,并逐步将其整合为带时间戳的时刻、连贯的情节以及重复出现的跨日模式。每一层都与一种适应其尺度的检索技能配对,用于定位观察、回放活动或遍历长期规律。反应式问答和主动式辅助共享这一记忆与访问接口,区别仅在于检索是由用户查询还是当前情境触发。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准测试中,GROVE在对比方法中取得了最佳结果。受控消融实验表明,时间分层及其访问技能是互补的,当证据跨越数天时,模式带来的收益最大。代码将于https://github.com/SitongGong/GROVE 提供。
查看arXiv页面 (https://arxiv.org/abs/2608.02392)查看PDF (https://arxiv.org/pdf/2608.02392)GitHub0 (https://github.com/SitongGong/GROVE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02392)
在您的智能体中获取此论文:
hf papers read 2608.02392
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该数据集。
引用此论文的Spaces0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该Space。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。
相似文章
超越检索:渐进式潜在记忆演化用于流式视频理解
LatentStream 引入了一个渐进式潜在工作记忆框架,该框架内化流式视觉证据以进行连续推理,在视频基准测试中实现了最先进的结果。
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。
TRACE:流式视频理解的时序审计与条件感知评估
TRACE 引入了一个针对流式视频理解的条件感知基准和评估框架,明确考虑了时间有效性、执行条件以及超越准确性的多维度性能指标。
超越时间线:利用 Grounded Entity Biographies 增强长视频记忆
本文介绍了 Grounded Entity Biographies (GEB),一种用于增强长视频记忆以跨事件跟踪实体的框架,在问答基准测试中展示了性能的提升。