SCOUT:用于超长自我中心视频推理的自检查与恢复感知工具思维智能体
摘要
SCOUT 提出了一种恢复感知的智能体框架,采用自适应探索-利用策略,用于超长自我中心视频推理。该框架通过 UPS-GRPO 训练,这是一种不确定性优先的强化学习方法,具备回合级优势分解。它在超长自我中心基准上取得了最先进的结果,并在较短的长时间视频场景中保持竞争力。
查看缓存全文
缓存时间: 2026/08/11 08:04
\\correspondingauthor Keyang [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])中山大学广州中国深圳环区研究院深圳中国, Kuo [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])中山大学广州中国, Peng [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])广东欧珀移动通信有限公司OPPO AI中心深圳中国, Quanlong [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])广东欧珀移动通信有限公司OPPO AI中心深圳中国, Junlin [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])香港中文大学(深圳)深圳中国, Zhijia [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])中山大学广州中国, Yanhao [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])广东欧珀移动通信有限公司OPPO AI中心深圳中国, and Guanbin [email protected] (https://arxiv.org/html/2608.07959v1/mailto:[email protected])中山大学广州中国深圳环区研究院深圳中国 \(2026\) ###### 摘要 超长自我中心视频理解需要对分布在数小时或数天内的时序稀疏证据进行推理,这对上下文有限的现有多模态模型以及关键视频片段的定位提出了挑战。尽管工具思维链(CoTT)代理系统支持迭代检索与检查,但由于缺乏恢复机制的刚性放大策略,它们会遭受错误传播。在本工作中,我们通过SCOUT(自检工具思维链,Self-Checking Chain-Of-Tool-thought)应对这些挑战。SCOUT是一种恢复感知的代理框架,引入自适应策略,评估中间工具观察结果,并在利用(放大查看)与探索(区域切换)之间动态权衡,从而在超长时间跨度上实现稳健的多跳推理。然而,训练这类多轮工具使用代理仍具挑战性,因为现有强化学习方法依赖稀疏的结果级奖励,缺乏对扩展决策轨迹的监督,导致长时推理的信用分配欠佳。为此,我们提出了UPS-GRPO,一种不确定性优先的策略优化方法,将探索集中在高不确定性的工具后状态上,同时保持样本效率。我们还引入了轮次级优势分解,将结果奖励与基于工具的时间对齐奖励相结合,以改进信用分配。实验表明,SCOUT在超长自我中心基准上取得了最先进的结果,同时在较短时长的长视频设置上保持竞争力。 超长自我中心视频,多模态,工具思维链,强化学习 ††journalyear:2026††copyright:cc††conference:Proceedings of the 34th ACM International Conference on Multimedia; November 10–14, 2026; Rio de Janeiro, Brazil††booktitle:Proceedings of the 34th ACM International Conference on Multimedia \(MM ’26\), November 10–14, 2026, Rio de Janeiro, Brazil††doi:10.1145/3767308.3835047††isbn:979-8-4007-2213-4/2026/11††ccs:计算方法学 场景理解††ccs:计算方法学 时间推理††ccs:计算方法学 信息抽取 ## 1. 引言 如图1所示。图1:超长视频推理的时序搜索策略对比。顶部:MLLM均匀采样用于初始视觉观察。中间:现有工具代理模型因不可逆的早期承诺和单调放大而导致搜索失败。底部:我们的SCOUT恢复感知方案,动态切换策略以定位答案关键帧。 常开的自我中心记录设备的普及,推动了能够利用用户完整视觉历史提供个性化支持的第一人称AI助手的兴趣增长(Wuet al.,2024 (https://arxiv.org/html/2608.07959#bib.bib1)),同时也促进了以人为中心的视觉识别方面的进展(Xuet al.,2026 (https://arxiv.org/html/2608.07959#bib.bib71); Wuet al.,2026b (https://arxiv.org/html/2608.07959#bib.bib72),2025 (https://arxiv.org/html/2608.07959#bib.bib73))。与短视频问答不同,超长自我中心场景涉及在数小时或数天内持续展开的视觉体验,其中相关证据在时间上稀疏、分布在长时间跨度中,并且通常需要跨远距离事件的多跳聚合(Graumanet al.,2022 (https://arxiv.org/html/2608.07959#bib.bib3); Yanget al.,2025b (https://arxiv.org/html/2608.07959#bib.bib46); Chenet al.,2025 (https://arxiv.org/html/2608.07959#bib.bib4))。这些特性使得现有的多模态大语言模型难以有效运作,因为它们的推理受限于有限的上下文窗口和有损视觉压缩,导致时间覆盖与证据保真度之间存在根本性权衡(Shenet al.,2024 (https://arxiv.org/html/2608.07959#bib.bib58); Shuet al.,2024 (https://arxiv.org/html/2608.07959#bib.bib5))。 打破这种权衡的一个有前景的方法是将长视频理解视为一个智能体搜索问题,而不是纯粹的序列建模问题。近期的工具思维链(CoTT)框架不是单次处理整个视频,而是将推理分解为多个步骤,允许语言模型调用专门的工具进行时间检索、短视频检查和帧级验证(Wanget al.,2024 (https://arxiv.org/html/2608.07959#bib.bib59); Yanget al.,2025c (https://arxiv.org/html/2608.07959#bib.bib37); Liet al.,2026 (https://arxiv.org/html/2608.07959#bib.bib38))。这种层级化工具使用范式对于长视频尤其有吸引力,因为它模仿了人类的搜索方式:首先识别一个合理的粗略时间范围,然后放大到较小的片段,最后验证细粒度的视觉细节。 然而,现有的基于CoTT的代理通常采用刚性由粗到细的策略,存在不可逆的早期承诺限制(Dinget al.,2025a (https://arxiv.org/html/2608.07959#bib.bib57); Panet al.,2025 (https://arxiv.org/html/2608.07959#bib.bib56); Yeet al.,2025 (https://arxiv.org/html/2608.07959#bib.bib6))。一旦选择了初始时间区域,推理通常只会在此区域内细化,导致早期定位错误不断传播,而不会重新评估已检索的证据或探索其他选择(Yeet al.,2025 (https://arxiv.org/html/2608.07959#bib.bib6))。这类失败在超长视频中尤为有害,因为早期错过正确的时间区域可能会永久地将相关证据排除在后续推理之外。因此,我们提出了SCOUT(自检工具思维链,Self-Checking Chain-Of-Tool-thought),一种恢复感知的推理策略,为CoTT增加了显式的自检机制。SCOUT评估工具观察结果的信息量和一致性,并在放大细化与时间区域切换之间动态选择,从而在扩展的时间跨度上实现稳健的多跳推理,如图1所示。 在多轮工具使用场景中,状态分布不仅由模型生成的词元决定,还由外部工具观察结果决定,导致高不确定性和分布偏移,尤其是在工具后决策点(Donget al.,2025 (https://arxiv.org/html/2608.07959#bib.bib39); Yiet al.,2026 (https://arxiv.org/html/2608.07959#bib.bib9); Jianget al.,2025 (https://arxiv.org/html/2608.07959#bib.bib10); Zhonget al.,2026a (https://arxiv.org/html/2608.07959#bib.bib8); Dinget al.,2025b (https://arxiv.org/html/2608.07959#bib.bib7))。我们将工具增强推理形式化为轨迹级优化问题,并提出了UPS-GRPO,一种不确定性优先选择的GRPO变体。UPS-GRPO通过选择性地对高不确定性的延续进行分支扩展,将探索预算重新分配到工具后状态,同时保持恒定的有效组大小,以实现稳定优化和资源节约。 最终答案错误的轨迹可能仍包含有用的检索和定位决策,而最终答案正确的轨迹也可能包含低效或虚假的中间步骤(Lightmanet al.,2023 (https://arxiv.org/html/2608.07959#bib.bib11); Weiet al.,2025 (https://arxiv.org/html/2608.07959#bib.bib13))。在超长视频理解中,这一问题更为突出,因为工具调用对应于显式的时间搜索决策,其质量通常可以独立于最终答案进行评估(Dinget al.,2025b (https://arxiv.org/html/2608.07959#bib.bib7); Wanget al.,2025a (https://arxiv.org/html/2608.07959#bib.bib12); Wuet al.,2026a (https://arxiv.org/html/2608.07959#bib.bib14))。为此,我们引入了基于轮次的工具使用优势半解耦,它在保持最终答案正确性作为全局优化方向的同时,利用基于工具的轮次级信号(如与线索区间的语义对齐和时间重叠)重新缩放轨迹级优势。 训练长视频代理所需要的数据不仅要教授回答什么,还要教授如何搜索。因此,我们构建了一个可扩展的数据合成流水线,生成带有交错推理、工具调用和观察结果的高质量CoTT轨迹,为监督微调和强化学习提供监督。综上所述,我们的贡献如下: - • 我们提出了SCOUT,一个面向超长视频理解的恢复感知工具思维链推理框架,通过自检显式建模搜索不确定性,支持在局部细化与时间重新探索之间动态切换,而不是不可逆的单调放大。 - • 我们引入了UPS-GRPO,一种面向工具增强推理的不确定性优先强化学习策略,以及一种轮次级半解耦优势公式,通过注入基于工具的中间信号改进信用分配,同时保持轨迹级优化一致性。 - • 我们建立了超长视频CoTT轨迹生成流水线,并展示了它如何支持两阶段SFT+RL方案来训练可扩展的长视频代理。 ## 2. 相关工作 ### 2.1 长视频理解 近期关于长时与自我中心视频理解的研究已从直接的全序列编码转向针对小时级或跨天视频流的更具可扩展性的表示。代表性方向包括紧凑视觉压缩、层级化记忆和结构化时间抽象,例如紧凑长视频表示、事件中心记忆、层级化智能体搜索和时间知识图谱(Chenet al.,2026 (https://arxiv.org/html/2608.07959#bib.bib27); Wanget al.,2025b (https://arxiv.org/html/2608.07959#bib.bib77); Wenet al.,2026 (https://arxiv.org/html/2608.07959#bib.bib28); Lianget al.,2026 (https://arxiv.org/html/2608.07959#bib.bib76); Yinet al.,2026a (https://arxiv.org/html/2608.07959#bib.bib19); Sunet al.,2026 (https://arxiv.org/html/2608.07959#bib.bib29))。X-LeBench、HLV-1K、EgoLifeQA和HourVideo等基准进一步表明,超长场景下的成功取决于在长时间间隔中定位稀疏证据,而不仅仅是扩大上下文窗口(Zhouet al.,2025 (https://arxiv.org/html/2608.07959#bib.bib25); Zouet al.,2025 (https://arxiv.org/html/2608.07959#
相似文章
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
This paper presents a unified global-to-local paradigm for video anomaly detection, introducing a training-free framework (GtS) and a tool-augmented agentic reasoning method with reinforcement learning, along with a new benchmark VAGU-T and metric JeAUG.
面向鲁棒视频理解的置信感知工具编排
Robust-TO通过将每帧可信度集成到智能框架中,解决了视频推理中的盲目信任问题,通过校准证据加权和可靠性感知推理,在现实扰动下提高了准确性。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。
VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。