Vinci2:在连续自我中心视频中提供主动辅助
摘要
Vinci2 提出了一个用于连续自我中心视频的主动辅助系统,引入了一个新的基准 EgoServe 和一个记忆增强型智能体 EgoMemo,该智能体根据时间上下文决定何时进行干预。
查看缓存全文
缓存时间: 2026/07/16 05:41
Paper page - Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
Source: https://huggingface.co/papers/2607.11523
摘要
当智能助手应该主动发言而无需用户询问?连续的自我中心视频提供了丰富且不断变化的上下文,使得一种新的辅助形式成为可能:这种辅助是主动的,而不仅仅是被动的。然而,现有方法要么被动等待用户查询,要么将每个检测到的事件视为需要响应,而不考虑用户的历史、当前活动或辅助是否真的受欢迎。我们将主动辅助重新定义为依赖于上下文环境的决策问题:智能体不仅需要感知正在发生的事情,还需要在积累的时间上下文中推理,以确定何时以及是否进行干预。为此,我们提出了Vinci2,一种主动的自我中心辅助系统,它将设备端助手Vinci从被动响应推进到主动辅助。在评估方面,我们提出了EgoServe,这是第一个用于连续自我中心视频中主动辅助的大规模基准数据集。EgoServe包含超过3,000个服务实例,按照4个时间记忆跨度组织,从即时安全警报到长期习惯指导,涵盖10个服务类别。在建模方面,我们提出了EgoMemo,一种无需训练、内存增强的智能体,它维护三种互补的记忆表示:多尺度时间摘要、语义知识图谱和视觉嵌入档案。在每个时间步,EgoMemo执行检索增强推理,以确定是否需要辅助,如果需要,则生成上下文相关的响应。实验表明,EgoMemo在EgoServe上建立了强大的基准,同时在现有的自我中心基准上保持竞争力。我们的基准数据集和代码已在 https://sitonggong.github.io/EgoServe-page/{Vinci2} 上公开。
查看arXiv页面 (https://arxiv.org/abs/2607.11523)查看PDF (https://arxiv.org/pdf/2607.11523)项目页面 (https://sitonggong.github.io/EgoServe-page/)GitHub2 (https://github.com/SitongGong/EgoMemo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11523)
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.11523以从此页面链接。
引用此论文的数据集1
SitongGong/EgoServe 预览• 更新于1天前 • 154 (https://huggingface.co/datasets/SitongGong/EgoServe)
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.11523以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。
EgoSteer: 从第一人称视频实现可引导灵巧操作的全栈系统
EgoSteer提出一个全栈系统,从第一人称人类视频预训练视觉-语言-动作模型,实现可引导的灵巧操作,在40多个多样化任务上展现鲁棒泛化能力,复杂长时任务成功率超过75%。
VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。
LightMem-Ego:您的日常生活AI记忆
LightMem-Ego是一种轻量级流式多模态记忆系统,用于日常生活辅助,它持续捕捉第一人称视角的视觉和音频流,将其组织成分层记忆,并检索基于事实的答案来回答用户关于过去经历的查询,可部署在智能手机和AI眼镜上。