环境 @ EgoProactive 2026 : 具有视觉基础监督的主动自我中心辅助
摘要
本文提出了一种使用单令牌分类和视觉基础监督的主动自我中心辅助方法,在ECCV 2026可穿戴人工智能挑战赛的大模型组中排名第一。
查看缓存全文
缓存时间: 2026/09/14 18:36
论文页面 - Ambient @ EgoProactive 2026:基于视觉定位监督的主动自我中心辅助
来源:https://huggingface.co/papers/2609.07099
摘要
本方法将干预时机重新定义为单令牌分类问题,并利用视频智能体进行视觉监督,以提升可穿戴助手的决策能力。本文提交至 ECCV 2026 可穿戴人工智能挑战赛的 EgoProactive 赛道,在大规模模型组排名第一,≤2B 规模组排名第二。该任务要求可穿戴助手在每段 8 秒的自我中心视频后判断是否应干预或保持静默。我们的方法包含两个核心组成部分:
首先,我们将干预时机重新定义为单令牌分类(https://huggingface.co/papers?q=single-token%20classification)。模型不再生成“中断”或“静默”指令,而是预测“是”或“否”,并通过这两个令牌的重归一化概率(https://huggingface.co/papers?q=renormalised%20probabilities)推导出最终决策。该策略使宏观 F1(https://huggingface.co/papers?q=macro-F1)提升 0.249,G 均值(https://huggingface.co/papers?q=G-mean)比自由形式生成(https://huggingface.co/papers?q=free-form%20generation)提高 0.30。
其次,由于标注数据仅限于已发布的验证集,我们利用工具调用视频智能体(https://huggingface.co/papers?q=tool-calling%20video%20agent)生成额外监督数据——该智能体可分析每个视频片段并分配干预时间戳。虽然纯叙述替代方案的数据量是其四倍且成本仅为十分之一,但其迁移效果却弱于来自无关真实语料库的监督数据,这表明对于该任务而言,视觉定位(https://huggingface.co/papers?q=visual%20grounding)比标注数据量更为重要。
查看 arXiv 页面(https://arxiv.org/abs/2609.07099)
查看 PDF(https://arxiv.org/pdf/2609.07099)
GitHub0(https://github.com/ambient-intelligence-hq/egoproactive-verbalizer)
添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.07099)
通过智能体获取本文:
hf papers read 2609.07099
尚未安装最新 CLI?运行:
curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型
0
无模型关联本文。
在模型的 README.md 中引用 arxiv.org/abs/2609.07099 即可从本页面链接。
引用本文的数据集
0
无数据集关联本文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.07099 即可从本页面链接。
引用本文的 Spaces
0
无 Space 关联本文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.07099 即可从本页面链接。
包含本文的收藏
0
无收藏包含本文。
将本文添加至收藏(https://huggingface.co/new-collection)即可从本页面链接。
相似文章
Vinci2:在连续自我中心视频中提供主动辅助
Vinci2 提出了一个用于连续自我中心视频的主动辅助系统,引入了一个新的基准 EgoServe 和一个记忆增强型智能体 EgoMemo,该智能体根据时间上下文决定何时进行干预。
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
Ambient @ EgoLongQA 2026:将长视频感知蒸馏到小于2B参数的模型中
一个从使用工具的智能体蒸馏而来的2B视觉语言模型,通过剪枝其多语言嵌入表以满足参数限制,在长第一人称视频问答任务中取得了第一名,仅使用1.1%的参数就达到了更大管道89%的准确率。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
EgoSteer: 从第一人称视频实现可引导灵巧操作的全栈系统
EgoSteer提出一个全栈系统,从第一人称人类视频预训练视觉-语言-动作模型,实现可引导的灵巧操作,在40多个多样化任务上展现鲁棒泛化能力,复杂长时任务成功率超过75%。