GROVE:从流式视频体验中生长与推理的时间分层记忆

Hugging Face Daily Papers 论文

摘要

GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。

可穿戴助手既应回答关于其视觉历史的问题,也应识别该历史何时对当前情境有用。现有的视频记忆系统主要支持基于问题的回忆,而主动式助手通常使用独立的记忆和控制机制。我们提出了GROVE,这是一个无需训练的框架,通过从连续视频流中因果生长出的单一记忆来支持这两种行为。GROVE保留细粒度的感知证据,并逐步将其整合为带时间戳的时刻、连贯的情节以及反复出现的跨日模式。每一层都配有一种与尺度相匹配的检索技能,用于定位观察、回放活动或遍历长期规律。反应式问答和主动式辅助共享这一记忆及访问接口,区别仅在于检索是由用户查询发起还是由当前情境发起。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准上,GROVE在所比较的方法中取得了最佳结果。受控消融实验表明,时间各层及其访问技能具有互补性,当证据跨越数天时,模式带来的收益最大。代码将可在 https://github.com/SitongGong/GROVE 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:44

论文页面 - GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

Source: https://huggingface.co/papers/2608.02392

摘要

可穿戴助手应当既能回答关于其视觉历史的问题,又能识别该历史在当下情境中是否有用。现有的视频记忆系统主要支持问题条件式回忆,而主动式助手通常使用独立的记忆和控制机制。我们提出了GROVE,一个无需训练的框架,通过一种从连续视频流中因果式生长的记忆来同时支持这两种行为。GROVE保留细粒度的感知证据,并逐步将其整合为带时间戳的时刻、连贯的情节以及重复出现的跨日模式。每一层都与一种适应其尺度的检索技能配对,用于定位观察、回放活动或遍历长期规律。反应式问答和主动式辅助共享这一记忆与访问接口,区别仅在于检索是由用户查询还是当前情境触发。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准测试中,GROVE在对比方法中取得了最佳结果。受控消融实验表明,时间分层及其访问技能是互补的,当证据跨越数天时,模式带来的收益最大。代码将于https://github.com/SitongGong/GROVE 提供。

查看arXiv页面 (https://arxiv.org/abs/2608.02392)查看PDF (https://arxiv.org/pdf/2608.02392)GitHub0 (https://github.com/SitongGong/GROVE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02392)

在您的智能体中获取此论文:

hf papers read 2608.02392

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该数据集。

引用此论文的Spaces0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该Space。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。

相似文章

Echo-Forcing: 一种用于交互式长视频生成的场景记忆框架

Hugging Face Daily Papers

Echo-Forcing 提出了一种用于交互式长视频生成的场景记忆框架,利用分层时间记忆、场景召回帧和差异感知记忆衰减来处理提示切换和长期回忆。该方法无需训练,在 VBench-Long 上取得了强劲的性能。

面向视频世界模型的可寻址记忆

Hugging Face Daily Papers

本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。