EgoArgus:作为情境助手的 VLMs 在模态接地用户支持中的基准评估
摘要
EgoArgus 是一个基准数据集,用于评估 VLMs 作为第一人称助手在对话-视频场景中的表现,揭示了在模态可信度和干预决策方面的挑战。
arXiv:2608.25561v1 公告类型:新
摘要:VLMs 正日益被定位为能够感知第一人称环境、跟随用户对话并决定如何帮助的日常助手。现有的自我中心基准主要孤立地评估视觉理解,留下了模型是否能在视觉证据和用户提供的语言之间进行仲裁的问题,当两者有帮助、无关或冲突时。我们引入了 EgoArgus,这是一个用于评估自我中心助手在五个对话-视频日常场景中的理解和决策任务的人工标注数据集。我们的结果表明,当前 VLMs 作为可靠的自我中心助手仍面临挑战,这需要识别哪种模态是可信的,并决定何时需要干预。更深入的分析还显示,现有的模态偏差缓解方法在提高性能方面相当受限,为从业者将当前 VLMs 部署为日常助手提供了见解。
查看缓存全文
缓存时间: 2026/08/27 09:22
# EgoArgus:将视觉语言模型评估为模态锚定用户支持的情境助手基准 来源:https://arxiv.org/html/2608.25561 作者:Yu-Hsiang Liu、An-Zi Yen 所属机构:台湾国立阳明交通大学计算机科学系 联系方式:[email protected], [email protected], [email protected] ###### 摘要 视觉语言模型正日益被视为日常助手,能够感知第一人称环境、理解用户对话并决定如何提供帮助。现有的自我中心基准主要孤立地评估视觉理解能力,却未解决当视觉证据与用户提供的语言信息同时存在、且两者可能具有帮助性、无关性或冲突性时,模型如何在其中进行仲裁的问题。我们引入了EgoArgus,这是一个经过人工标注的数据集,用于在五个对话-视频日常场景中评估自我中心助手在理解和决策任务上的表现。研究结果表明,当前的视觉语言模型作为可靠的自我中心助手仍面临挑战,这要求它们能够识别哪种模态信息更可信,并判断何时需要干预。更深入的分析还表明,现有的模态偏差缓解方法在提升性能方面作用有限,这为实践者部署当前视觉语言模型作为日常助手提供了见解。我们的数据集已在https://github.com/NYCU-NLP-Lab/EgoArgus公开发布。 ## 1 引言 视觉语言模型和多模态大语言模型的最新进展,已将多模态系统从被动的图像或视频识别推进到能够感知环境、遵循自然语言指令并回答用户问题的交互式助手。这一转变在自我中心场景中尤为重要,因为可穿戴摄像头或第一人称机器人从用户视角观察日常活动。若干基准研究认为,自我中心评估必须超越狭隘的日常视觉问答,覆盖更广泛的领域或推理需求。 (图1:EgoArgus概览。EgoArgus涵盖五种辅助场景(多模态锚定、矛盾、视频锚定相关主题、视频锚定无关主题、文本锚定)及一种无需辅助情况,每种情况均评估三种能力:上下文理解、下一步行动预测和干预决策。) 近期的数据集和基准已开始将第一人称视频评估推向类助手场景。HoloAssist研究了真实的指导者-执行者协作,涉及口头指导、错误纠正和干预行为;而Ego-EXTRA则强调从受训者的自我中心视角出发的专家-学徒对话和视觉问答。其他工作研究了从流式自我中心视频中生成主动式助手对话。同时,流式和主动视频基准评估模型是否能在线理解事件、等待充分证据或在事件展开的流中适时响应。总之,这些努力标志着从静态视频理解向交互式第一人称助手的转变。 为充当可靠的日常助手,视觉语言模型必须整合第一人称视频与用户对话,并展现三种递进式能力:理解当前情境、预判在持续任务中应采取的后续行动,以及主动决定是否、何时以及如何进行干预。我们分别将这些称为上下文理解、下一步行动预测和干预决策。以图1中左上角的组为例:上下文理解要求模型结合对话传达的用户意图和视频中观察到的物体,推断用户将使用哪件物品开始制作酱汁(一瓶油)。下一步行动预测要求根据对话指令和当前场景进行推理,预判应进行的后续行动(折叠剩余的塑料纸)。干预决策要求识别出即将发生的危险行动,并毫不犹豫地决定何时以及提出何种警告(不要直接微波纸盒)。 然而在实际部署中,助手运行于嘈杂的环境中。基于视觉语言模型或多模态大语言模型的助手会同时接收两个流:实时第一人称视频和来自用户及周围对话的语言输入。这两种模态不一定一致:它们可能相互补充、彼此无关或直接冲突。因此,模型不能将所有输入视为同等可靠。它必须判断在当前情境下应信任哪些信号、忽略哪些信号,读懂用户的实际需求,并在理解环境的基础上提供恰当的判断和建议。 研究模型如何判断、协助及失败需要合适的数据。现有的自我中心资源推动了第一人称视频理解、锚定问答、规划和跨领域问答的发展。尽管取得了这些进展,对受控的视频-对话关系的探索仍然有限,特别是当这些关系与辅助/无辅助标签、干预时机和辅助步骤标注配对时。为此,我们构建了EgoArgus,一个用于评估第一人称助手的资源。如图1所示,EgoArgus围绕五种辅助场景组织:多模态锚定、矛盾、视频锚定无关主题、视频锚定相关主题和文本锚定。这些场景涵盖了对话相对于视频具有补充性、冲突性、无关性或本身作为可依赖模态的情况。除此之外,我们还加入了无辅助情况。这反映了实际部署中的情况,即大多数情境不需要干预,而过度积极的助手反而会成为干扰。 我们将EgoArgus构建为两部分,共同覆盖三种能力。理解部分是一个受控的多项选择题测试集,包含6,978个来自真实自我中心日常任务视频的实例,涵盖上下文理解和下一步行动预测,并配对用户对话以实例化五种场景。对于决策部分,我们使用VISTA合成了789个第一人称助手片段,这些片段针对难以在现实世界中密集收集的干预决策,跨越相同的场景,并覆盖安全、非安全和无辅助情况。 我们在EgoArgus上评估了一系列最新的视觉语言模型,发现一个一致的文本主导失败模式:当用户对话与摄像头所见矛盾时,模型遵循文字而非场景,尽管场景中显然包含它们所需的信息。在上下文理解方面,助手随后报告了一个与现实不符的世界,附和用户的错误主张而非纠正它;在下一步行动预测方面,这种误读会传递到指导中,将用户引向不符合实际场景的步骤。在使用VISTA合成的辅助片段上,主导失败是干预决策本身:模型在应当保持沉默时过度辅助,即使需要干预,也误判其时机。它们可能过早或过晚发出警告,导致警告本身不正确。 (图2:EgoArgus理解部分的结果。(a) 各视觉语言模型的总体准确率。(b) 按不同任务划分的结果。(c) 视觉语言模型在提出的五种场景上的准确率。) 总而言之,我们的贡献可概括如下:(1) 我们引入了EgoArgus,一个经人工标注的基准,用于通过多项选择题和辅助步骤格式评估自我中心助手。(2) 我们定义了五种视频-对话关系,涵盖多模态锚定、矛盾、视频锚定相关/无关主题以及文本锚定的用户对话,并额外标注了安全、非安全和无辅助情况。(3) 我们对当前视觉语言模型进行了基准测试,揭示了显著的可靠性差距:矛盾对话导致真实视频准确率低于随机水平,且准确识别提供辅助步骤的时机仍具挑战。更深入的分析进一步表明,现有的模态偏差缓解方法提供的提升有限,这引发了对当代视觉语言模型作为日常助手在现实世界部署中的反思。 ## 2 EgoArgus的构建 ### 2.1 资源范围 在EgoArgus中,理解部分结合了三种来源:EgoPlan-Bench2用于下一步行动问题,QaEgo4D用于针对长自我中心视频的锚定问答,以及MIntRec用于带有意图标注的对话,我们将其扩展为历史记录并复用为无关主题干扰项。决策部分使用VISTA生成,其“神谕”元数据记录了是否需要帮助、最早的可用干预时间、需注意的问题以及推荐的辅助步骤。表1总结了数据分布。 (表1:当前评估划分中的EgoArgus组成。EgoPlan-Bench2、QaEgo4D和MIntRec构成真实视频多项选择题部分;VISTA贡献了789个评估的辅助步骤行,跨越相同的五种场景及无辅助情况。) ### 2.2 五种辅助场景 五种场景定义如下,干预决策示例见图1: - **多模态锚定**:对话提供属性、指令或关系上下文,而视频锚定所指对象、动作或场景状态。正确判断需要结合两者。例如,警告不要微波加热仅通过听到用户问题和看到容器是纸盒才能得出。 - **矛盾**:视频决定正确判断,而对话指向错误判断。例如,用户声称已关水龙头,但视频显示水仍在流。 - **视频锚定相关主题**:视频决定正确判断,而对话主题相关但无信息量。例如,用户让孩子等待并结账后离开,而视频显示孩子已被落下。 - **视频锚定无关主题**:视频决定正确判断,而对话无关。例如,用户闲聊晚点回家,而视频显示车窗未关。 - **文本锚定**:对话决定正确判断,而视频无关。例如,用户询问图书馆开放时间,与视频无关。 ### 2.3 对话构建与验证 我们通过保留原始答案承载源,仅改变用户对话与视频问题之间的关系来构建所有示例。对于理解部分,我们采用EgoPlan-Bench2、QaEgo4D和MIntRec作为视频和多项选择题来源,添加的对话则通过提示Gemini 3.1-Pro在每个场景下生成,使其具有误导性、无关性或仅主题相关。对于决策部分,我们利用VISTA渲染包含每种场景的多种脚本视频,并提示Gemini 3.1-Pro相应生成对话。详细的真机构建提示、过滤规则和聚合过程见附录A和B。 ### 2.4 数据标注 为验证合成数据,我们邀请了16位人工标注者对理解部分和决策部分进行检查。每个示例独立分配给三位标注者,每位标注者被要求判断构建的示例是否满足其预定场景,并在原始正确选项无效、不明确或不受视频-对话对支持时提供修正后的答案。最终,经多数投票聚合的验证答案用于评估基准。 对于决策部分,VISTA在过滤前生成了更大的候选池。审查员丢弃了那些渲染在物理上不切实际或与预定场景不匹配的生成内容。评估划分保留了311个经审查的独特视频,这些视频与特定场景的对话配对,形成789个评估的视频-对话行。对于辅助情况,审查后的元数据指定了适当的干预时间和助手应提供的帮助。对于无辅助情况,视频描绘的是日常普通活动,审查员则验证对话中没有任何需要辅助的内容。 ## 3 实验 ### 3.1 实验设置 ##### 模型 对于EgoArgus的两部分,我们评估了七种视觉语言模型:Molmo2-8B、Qwen3.5-2B、InternVL3.5-4B、Gemini-3.1-Flash-Lite、Cosmos-Reason2-8B、Qwen3.5-Plus和MiMo-V2-Omni。 ##### 评估指标 对于理解部分,我们采用多项选择题准确率作为主要评估指标。为进一步观察答题动态,我们还报告了每个场景的准确率,以揭示准确率聚合背后的失败模式。对于决策部分,模型仅接收视频、对话和对话时间戳。我们评估模型是否正确判断是否需要辅助,对于需要辅助的情况,我们还分析所提出的干预时间、问题摘要、证据和辅助步骤。我们报告可用的辅助决策F1分数和时间误差,并使用一个由大型语言模型辅助、帧验证的错误分类法,以区分上下文理解错误、下一步行动或辅助步骤规划错误、辅助决策错误和输出格式失败。 (表2:在VISTA上的模型表现和错误分析。行按总体辅助决策F1分数排序。我们报告总体F1分数、时间平均绝对误差、有符号时间...)
相似文章
OmniAssistBench: 针对全能大语言模型的助理式交互基准测试
OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。
当眼见不为实:交互式视觉定位在LVLMs中的基准测试
本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。
Enjoy Your Talk: 一个以人为中心的多轮对话基准,采用解耦的用户模拟、目标建模与评判
本文介绍了EYT-Bench,一个以人为中心的基准,用于评估多轮对话中的LLM,采用了解耦的用户模拟、目标建模和评判设计。它揭示了闭源和开源模型在客观意图追踪上差异显著,但在主观维度上相似;推理能力提升了客观追踪,而人物角色格式强烈影响轨迹分布。
MemArena:一种面向大规模设备端智能个人记忆助手的自我中心基准
MemArena 是一种新的自我中心基准,用于评估设备端个人记忆助手,它使用 MASim 智能体模拟器生成多会话对话世界,并在回忆、推理和可信度维度上提供真值。初步结果表明,记忆后端的选择通常比读取器规模更重要,而基于权限的访问仍然是一个普遍挑战。