环境 @ EgoProactive 2026 : 具有视觉基础监督的主动自我中心辅助

Hugging Face Daily Papers 论文

摘要

本文提出了一种使用单令牌分类和视觉基础监督的主动自我中心辅助方法,在ECCV 2026可穿戴人工智能挑战赛的大模型组中排名第一。

我们介绍了提交到ECCV 2026可穿戴人工智能挑战赛EgoProactive赛道的作品,该作品在大模型组中排名第一,在<=2B组中排名第二。任务要求可穿戴助手在每八秒的自我中心视频片段后决定是否干预或保持沉默。我们的方法有两个主要组成部分。首先,我们将干预时机重新表述为单令牌分类。模型不是生成interrupt<utterance>或silent,而是预测yes或no,并从这两个令牌的重新归一化概率中得出决策。这种表述方法比自由形式生成提高了0.249的宏观F1分数和0.30的G均值。其次,由于标记数据仅限于发布的验证集,我们使用一个工具调用的视频代理生成了额外的监督,该代理检查每个片段并分配干预时间戳。一个仅叙述的替代方案规模是其四倍,成本是其十分之一,但转移效果比来自不相关真实语料库的监督更差,这表明对于此任务,视觉基础比标注数量更重要。
查看原文
查看缓存全文

缓存时间: 2026/09/14 18:36

论文页面 - Ambient @ EgoProactive 2026:基于视觉定位监督的主动自我中心辅助

来源:https://huggingface.co/papers/2609.07099

摘要

本方法将干预时机重新定义为单令牌分类问题,并利用视频智能体进行视觉监督,以提升可穿戴助手的决策能力。本文提交至 ECCV 2026 可穿戴人工智能挑战赛的 EgoProactive 赛道,在大规模模型组排名第一,≤2B 规模组排名第二。该任务要求可穿戴助手在每段 8 秒的自我中心视频后判断是否应干预或保持静默。我们的方法包含两个核心组成部分:
首先,我们将干预时机重新定义为单令牌分类(https://huggingface.co/papers?q=single-token%20classification)。模型不再生成“中断”或“静默”指令,而是预测“是”或“否”,并通过这两个令牌的重归一化概率(https://huggingface.co/papers?q=renormalised%20probabilities)推导出最终决策。该策略使宏观 F1(https://huggingface.co/papers?q=macro-F1)提升 0.249,G 均值(https://huggingface.co/papers?q=G-mean)比自由形式生成(https://huggingface.co/papers?q=free-form%20generation)提高 0.30。
其次,由于标注数据仅限于已发布的验证集,我们利用工具调用视频智能体(https://huggingface.co/papers?q=tool-calling%20video%20agent)生成额外监督数据——该智能体可分析每个视频片段并分配干预时间戳。虽然纯叙述替代方案的数据量是其四倍且成本仅为十分之一,但其迁移效果却弱于来自无关真实语料库的监督数据,这表明对于该任务而言,视觉定位(https://huggingface.co/papers?q=visual%20grounding)比标注数据量更为重要。

查看 arXiv 页面(https://arxiv.org/abs/2609.07099)
查看 PDF(https://arxiv.org/pdf/2609.07099)
GitHub0(https://github.com/ambient-intelligence-hq/egoproactive-verbalizer)
添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.07099)

通过智能体获取本文:
hf papers read 2609.07099
尚未安装最新 CLI?运行:
curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型

0
无模型关联本文。
在模型的 README.md 中引用 arxiv.org/abs/2609.07099 即可从本页面链接。

引用本文的数据集

0
无数据集关联本文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.07099 即可从本页面链接。

引用本文的 Spaces

0
无 Space 关联本文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.07099 即可从本页面链接。

包含本文的收藏

0
无收藏包含本文。
将本文添加至收藏(https://huggingface.co/new-collection)即可从本页面链接。

相似文章

Vinci2:在连续自我中心视频中提供主动辅助

Hugging Face Daily Papers

Vinci2 提出了一个用于连续自我中心视频的主动辅助系统,引入了一个新的基准 EgoServe 和一个记忆增强型智能体 EgoMemo,该智能体根据时间上下文决定何时进行干预。