Vinci2:在连续自我中心视频中提供主动辅助

Hugging Face Daily Papers 论文

摘要

Vinci2 提出了一个用于连续自我中心视频的主动辅助系统,引入了一个新的基准 EgoServe 和一个记忆增强型智能体 EgoMemo,该智能体根据时间上下文决定何时进行干预。

智能助手应在何时无需用户询问便主动发言?连续自我中心视频提供了丰富且不断变化的上下文,使得一种新的辅助形式成为可能:主动而非仅仅被动响应。然而,现有方法要么被动等待用户查询,要么将每个检测到的事件都视为需要响应,而不考虑用户的历史、当前活动或辅助是否真正受欢迎。我们将主动辅助重新定义为一种上下文相关决策问题:智能体不仅需要感知正在发生的事情,还需要基于累积的时间上下文进行推理,以确定何时以及是否进行干预。为此,我们提出了 Vinci2,这是一个主动的自我中心辅助系统,将设备上助手 Vinci 从被动响应推向主动。在评估方面,我们提出了 EgoServe,这是第一个用于连续自我中心视频中主动辅助的大规模基准。EgoServe 包含超过 3000 个服务实例,组织在 4 个时间记忆范围内,从即时安全警报到长期习惯辅导,涵盖 10 个服务类别。在建模方面,我们提出了 EgoMemo,一种无需训练的记忆增强型智能体,它维护三种互补的记忆表示:多尺度时间摘要、语义知识图谱和视觉嵌入存档。在每个时间步,EgoMemo 执行检索增强推理以确定是否需要辅助,如果需要,则生成基于上下文的响应。实验表明,EgoMemo 在 EgoServe 上建立了强基线,同时在现有自我中心基准上保持了竞争力。我们的基准测试和代码可在 https://sitonggong.github.io/EgoServe-page/{Vinci2} 公开获取。
查看原文
查看缓存全文

缓存时间: 2026/07/16 05:41

Paper page - Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Source: https://huggingface.co/papers/2607.11523

摘要

当智能助手应该主动发言而无需用户询问?连续的自我中心视频提供了丰富且不断变化的上下文,使得一种新的辅助形式成为可能:这种辅助是主动的,而不仅仅是被动的。然而,现有方法要么被动等待用户查询,要么将每个检测到的事件视为需要响应,而不考虑用户的历史、当前活动或辅助是否真的受欢迎。我们将主动辅助重新定义为依赖于上下文环境的决策问题:智能体不仅需要感知正在发生的事情,还需要在积累的时间上下文中推理,以确定何时以及是否进行干预。为此,我们提出了Vinci2,一种主动的自我中心辅助系统,它将设备端助手Vinci从被动响应推进到主动辅助。在评估方面,我们提出了EgoServe,这是第一个用于连续自我中心视频中主动辅助的大规模基准数据集。EgoServe包含超过3,000个服务实例,按照4个时间记忆跨度组织,从即时安全警报到长期习惯指导,涵盖10个服务类别。在建模方面,我们提出了EgoMemo,一种无需训练、内存增强的智能体,它维护三种互补的记忆表示:多尺度时间摘要、语义知识图谱和视觉嵌入档案。在每个时间步,EgoMemo执行检索增强推理,以确定是否需要辅助,如果需要,则生成上下文相关的响应。实验表明,EgoMemo在EgoServe上建立了强大的基准,同时在现有的自我中心基准上保持竞争力。我们的基准数据集和代码已在 https://sitonggong.github.io/EgoServe-page/{Vinci2} 上公开。

查看arXiv页面 (https://arxiv.org/abs/2607.11523)查看PDF (https://arxiv.org/pdf/2607.11523)项目页面 (https://sitonggong.github.io/EgoServe-page/)GitHub2 (https://github.com/SitongGong/EgoMemo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11523)

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2607.11523以从此页面链接。

引用此论文的数据集1

SitongGong/EgoServe 预览• 更新于1天前 • 154 (https://huggingface.co/datasets/SitongGong/EgoServe)

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2607.11523以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。

LightMem-Ego:您的日常生活AI记忆

Hugging Face Daily Papers

LightMem-Ego是一种轻量级流式多模态记忆系统,用于日常生活辅助,它持续捕捉第一人称视角的视觉和音频流,将其组织成分层记忆,并检索基于事实的答案来回答用户关于过去经历的查询,可部署在智能手机和AI眼镜上。