GROVE:从流式视频体验中生长与推理的时间分层记忆
摘要
GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/05 05:44
论文页面 - GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
Source: https://huggingface.co/papers/2608.02392
摘要
可穿戴助手应当既能回答关于其视觉历史的问题,又能识别该历史在当下情境中是否有用。现有的视频记忆系统主要支持问题条件式回忆,而主动式助手通常使用独立的记忆和控制机制。我们提出了GROVE,一个无需训练的框架,通过一种从连续视频流中因果式生长的记忆来同时支持这两种行为。GROVE保留细粒度的感知证据,并逐步将其整合为带时间戳的时刻、连贯的情节以及重复出现的跨日模式。每一层都与一种适应其尺度的检索技能配对,用于定位观察、回放活动或遍历长期规律。反应式问答和主动式辅助共享这一记忆与访问接口,区别仅在于检索是由用户查询还是当前情境触发。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准测试中,GROVE在对比方法中取得了最佳结果。受控消融实验表明,时间分层及其访问技能是互补的,当证据跨越数天时,模式带来的收益最大。代码将于https://github.com/SitongGong/GROVE 提供。
查看arXiv页面 (https://arxiv.org/abs/2608.02392)查看PDF (https://arxiv.org/pdf/2608.02392)GitHub0 (https://github.com/SitongGong/GROVE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02392)
在您的智能体中获取此论文:
hf papers read 2608.02392
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该数据集。
引用此论文的Spaces0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该Space。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。
相似文章
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。
Echo-Forcing: 一种用于交互式长视频生成的场景记忆框架
Echo-Forcing 提出了一种用于交互式长视频生成的场景记忆框架,利用分层时间记忆、场景召回帧和差异感知记忆衰减来处理提示切换和长期回忆。该方法无需训练,在 VBench-Long 上取得了强劲的性能。
面向视频世界模型的可寻址记忆
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorld-MM 是一个面向实体的多模态记忆系统,专为开放式视频流设计,采用受人类记忆理论启发的分层长期记忆,在六个基准测试中达到了最先进的准确率。