SERUM:面向用户建模的状态提取与细化
摘要
介绍了SERUM,一种多遍框架,通过分层VLM标注从原始自我中心视频中提取用户行为和意图的结构化模型,减少幻觉现象,并生成无需人工标注的可解释过程模型。
arXiv:2607.29181v1 公告类型:新
摘要:能够进行主动、个性化交互的智能体助手需要用户意图和工作流程的结构化模型。然而,从原始、非结构化的屏幕活动中构建这些模型仍然是一个开放挑战。我们提出了SERUM,一种多遍框架,通过分层VLM标注直接从非结构化自我中心视频中提取有限状态行为模型。SERUM通过滑动窗口处理屏幕录制,在活动识别和意图推断遍之间交替进行,每一遍利用累积的先验上下文细化标签,以减少单遍标注中出现的幻觉和时间混淆。然后,通过句子嵌入和人工校准的阈值,将同义状态合并为一个紧凑、连贯的分类体系。我们通过将一阶马尔可夫模型拟合到生成的标签序列(包括动作和意图)上,并与频率基线比较预测准确率,来评估行为结构。在四个领域(编程、烹饪、体育活动和日常生活)的61个自我中心视频中,我们发现:(1)经过多遍迭代,标签细化收敛到一个稳定的状态词汇表,我们称之为图式平衡;(2)与频率基线相比,归一化马尔可夫模型实现了显著更低的困惑度和更高的动作预测准确率,在编程等结构化任务上提升最大;(3)人工标注者认为最终遍的标签准确,且比第一遍标签有显著改进。据我们所知,SERUM是第一个无需人工标注即可从非结构化自我中心屏幕视频生成可解释过程模型的系统,为现实场景中的用户建模和行为理解开辟了一条可扩展的路径。我们的演示、代码和结果均可公开获取。
查看缓存全文
缓存时间: 2026/08/03 07:37
# Serum:用户建模的状态提取与精化
来源:https://arxiv.org/html/2607.29181
Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang
明尼苏达大学自然语言处理实验室
美国明尼苏达州明尼阿波利斯,邮编 55455
{phu00003,moone174,dento019,le000422,dongyeop}@umn.edu
###### 摘要
能够进行主动、个性化交互的智能体助手需要结构化的用户意图与工作流模型。然而,从原始、非结构化的屏幕活动中构建这些模型仍然是一个开放挑战。我们提出 Serum,一个多轮(multi-pass)框架,通过分层 VLM 标注直接从非结构化第一人称视频中提取有限状态行为模型。通过滑动窗口处理屏幕录制,Serum 在活动识别与意图推断轮次之间交替进行,每轮使用累积的先前上下文来精化标签,以减少单轮标注中出现的幻觉和时序混淆。随后,通过句子嵌入和人工校准的阈值将同义状态合并为紧凑、连贯的分类体系。我们通过将一阶马尔可夫模型拟合到所得标签序列(包括动作和意图),并衡量相对于频率基线的预测准确率来评估行为结构。在 61 个第一人称视频中(涵盖编码、烹饪、体育活动与日常生活),我们发现:(1)迭代式标签精化会收敛到一个稳定的状态词汇表,我们称之为**图式平衡**(schematic equilibrium);(2)归一化马尔可夫模型实现了显著更低的困惑度和更高的动作预测准确率,超过频率基线,其中在编码等结构化任务上收益最大;(3)人类标注者认为最终轮标签准确率达 88.3%(α=0.40),并且 82.8% 的情况下偏好最终轮标签而非第一轮标签(α=0.41)。据我们所知,Serum 是首个无需手动标注即可从非结构化第一人称屏幕视频中生成可解释流程模型的系统,为真实场景中的用户建模和行为理解开辟了可扩展路径。我们的演示、代码和结果已公开可用:https://minnesotanlp.github.io/SERUM-web/
## 1 引言
主动式 AI 助手需要结构化的用户行为模型——即对人们如何随时间推进目标导向活动的紧凑表示。在 YouTube 和 Twitch 等平台出现之前,丰富的第一人称视频一直很稀缺。将原始视频转换为结构化的行为模型并非易事。现有的活动识别方法要么依赖固定的手工构建分类体系(Damen 等,2022;Grauman 等,2022),要么需要昂贵的帧级标注。流程挖掘(process mining)可以从事件日志中生成优雅的行为模型(van der Aalst 等,2012;van der Aalst,2016),但它假设活动标签已经存在。这些路径都无法应用于非结构化、开放式视频。
我们不禁要问:*我们能否直接从原始第一人称视频中提取可解释的、结构化的用户行为模型,而无需预定义本体,也无需手动标注?*
图1:(上图)当前标准方法独立处理每一帧,产生孤立的动作描述和粗略的意图估计。(下图)SERUM 的多轮流水线回顾各帧的先前上下文,从而构建包含用户动作和意图的精化用户模型,为更明智的主动建议提供支持。
一种简单的做法是让视觉语言模型(VLM)为每一帧打标签,类似于近期关于通用用户模型的工作(Shaikh 等,2025)。但单轮标注在两方面会失效:VLM 会产生幻觉,并且会遭受*时间混淆*(temporal conflation)——由于缺乏周围上下文,将语义上不同的活动折叠成通用标签。
我们提出 SERUM(State Extraction and Refinement for User Modeling,用户建模的状态提取与精化),一个多轮流水线,通过交替进行活动识别和意图推断来解决这些局限,每一轮都建立在先前轮次累积的上下文之上。SERUM 在两个互补层次上运行:*用户动作*(可直接观察的行为,例如“拉取 git 仓库”)和*用户意图*(中间目标,例如“搭建开发环境”)。一个滑动上下文窗口为每一轮提供周围帧的游程编码(run-length encoding)。标注之后,一个*标签归一化*步骤将同义标签合并为紧凑的词汇表。SERUM 输出以一阶马尔可夫链实现的用户活动模型和意图模型,捕捉用户行为的概率转移结构。
我们将 SERUM 应用于 61 个第一人称 YouTube 视频,涵盖编码、烹饪、体育活动与日常生活。实验表明:(1)提取的标签词汇表在第 8 轮可靠地收敛到稳定的分类体系——我们称之为相似文章
VideoSearch-R1: 通过软查询优化的迭代式视频检索与推理
VideoSearch-R1 引入了一种智能体框架,该框架通过连续潜在空间优化和策略优化,迭代式地检索视频并优化搜索查询,在视频语料库时刻检索和时间定位任务上取得了最先进的性能。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
GROVE:从流式视频体验中生长与推理的时间分层记忆
GROVE是一个无需训练的框架,它从连续视频流中生长出时间分层记忆,同时支持反应式问答和主动式辅助。它在MM-lifelong和EgoServe等基准上取得了最先进的结果。
EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理
EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。
VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。