GROVE:从流式视频体验中生长与推理的时间分层记忆

Hugging Face Daily Papers 论文

摘要

GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。

可穿戴助手既应回答关于其视觉历史的问题,也应识别该历史何时对当前情境有用。现有的视频记忆系统主要支持基于问题的回忆,而主动式助手通常使用独立的记忆和控制机制。我们提出了GROVE,这是一个无需训练的框架,通过从连续视频流中因果生长出的单一记忆来支持这两种行为。GROVE保留细粒度的感知证据,并逐步将其整合为带时间戳的时刻、连贯的情节以及反复出现的跨日模式。每一层都配有一种与尺度相匹配的检索技能,用于定位观察、回放活动或遍历长期规律。反应式问答和主动式辅助共享这一记忆及访问接口,区别仅在于检索是由用户查询发起还是由当前情境发起。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准上,GROVE在所比较的方法中取得了最佳结果。受控消融实验表明,时间各层及其访问技能具有互补性,当证据跨越数天时,模式带来的收益最大。代码将可在 https://github.com/SitongGong/GROVE 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:44

论文页面 - GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

Source: https://huggingface.co/papers/2608.02392

摘要

可穿戴助手应当既能回答关于其视觉历史的问题,又能识别该历史在当下情境中是否有用。现有的视频记忆系统主要支持问题条件式回忆,而主动式助手通常使用独立的记忆和控制机制。我们提出了GROVE,一个无需训练的框架,通过一种从连续视频流中因果式生长的记忆来同时支持这两种行为。GROVE保留细粒度的感知证据,并逐步将其整合为带时间戳的时刻、连贯的情节以及重复出现的跨日模式。每一层都与一种适应其尺度的检索技能配对,用于定位观察、回放活动或遍历长期规律。反应式问答和主动式辅助共享这一记忆与访问接口,区别仅在于检索是由用户查询还是当前情境触发。在包括具有挑战性的MM-lifelong和EgoServe在内的多个基准测试中,GROVE在对比方法中取得了最佳结果。受控消融实验表明,时间分层及其访问技能是互补的,当证据跨越数天时,模式带来的收益最大。代码将于https://github.com/SitongGong/GROVE 提供。

查看arXiv页面 (https://arxiv.org/abs/2608.02392)查看PDF (https://arxiv.org/pdf/2608.02392)GitHub0 (https://github.com/SitongGong/GROVE)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.02392)

在您的智能体中获取此论文:

hf papers read 2608.02392

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该数据集。

引用此论文的Spaces0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2608.02392,即可从此页面链接到该Space。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到该收藏。

相似文章