VideoLoop:针对长视频智能体中语义抖动的循环工作记忆

Hugging Face Daily Papers 论文

摘要

该论文提出了VideoLoop,一个具有循环工作记忆的多模态智能体,以解决长视频理解中的语义抖动问题,并在VideoMME等基准测试中展示了性能提升。

长视频理解要求多模态智能体在多个推理步骤中迭代地收集证据。然而,大多数现有的智能体方法都受到语义抖动的困扰:随着只增不删的工作记忆增长,对关键证据的注意力崩溃,智能体失去了对其已发现内容的访问能力。首先,我们提供了一个结构性论证,表明只增不删的记忆可以纳入新观察到的目标证据,但无法移除累积的噪声或防止有序上下文增长,除非有一个重写操作符。其次,基于这一分析,我们提出了VideoLoop,一个具有两个耦合循环的多模态智能体。外部循环对视频进行推理,内部循环在每一步后从过去观察和中间分析的无界文件系统中检索工件,并重写一个有界的工作记忆。大量实验表明了VideoLoop的有效性,它以即插即用的方式改进了四种流行的LVLM骨干网络,在VideoMME(长)上平均提升了4.2个百分点。对工作记忆的进一步分析表明,VideoLoop减轻了语义抖动:在VideoMME(长)中最难的四分之一问题上,仅阅读智能体上下文的盲判正确率为81.1%,而只增不删智能体的正确率为60.9%。使用Gemini 3.1 Pro,VideoLoop在VideoMME(长)上达到88.3%,在VideoMMMU上达到88.8%,在LongVideoBench(长)上达到80.9%。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:16

论文页面 - VideoLoop:针对长视频智能体语义抖动的循环工作记忆

来源:https://huggingface.co/papers/2609.38119
发布于 2024年9月29日

·

由 https://huggingface.co/Jinfa 提交

Huang (https://huggingface.co/Jinfa) 于9月30日提交

摘要

长视频理解需要多模态智能体在许多推理步骤中迭代地收集证据。然而,大多数现有的智能体方法都受到语义抖动的影响:随着仅追加的工作记忆不断增长,对关键证据的注意力会崩溃,智能体将无法访问它已经发现的信息。首先,我们提供了一个结构性论证,表明仅追加的记忆虽然可以纳入新观察到的目标证据,但无法移除累积的噪声或防止有序上下文的增长,除非有重写操作。其次,基于此分析,我们提出了 VideoLoop,一个具有两个耦合循环的多模态智能体。外层循环对视频进行推理,内层循环在每一步之后,从过去观察和中间分析的无限文件系统中检索工件,并重写一个有界的工作记忆。大量实验证明了 VideoLoop 的有效性,它以即插即用的方式改进了四种流行的大型视觉语言模型(LVLM)骨干,在 VideoMME(长视频)基准上平均比基线提高了 4.2 个百分点。对工作记忆的进一步分析表明,VideoLoop 缓解了语义抖动:在 VideoMME(长视频)最难的四分之一问题上,一个仅阅读智能体上下文的盲审法官的正确率为 81.1%,而仅追加智能体的正确率为 60.9%。使用 Gemini 3.1 Pro 时,VideoLoop 在 VideoMME(长视频)上达到 88.3%,在 VideoMMMU 上达到 88.8%,在 LongVideoBench(长视频)上达到 80.9%。

查看 arXiv 页面 (https://arxiv.org/abs/2609.38119) 查看 PDF (https://arxiv.org/pdf/2609.38119) GitHub 仓库 (https://github.com/philipxjm/videoloop) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.38119)

在你的智能体中获取这篇论文:

hf papers read 2609.381119

没有最新的 CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型

0

没有模型链接到本文

在模型的 README.md 中引用 arxiv.org/abs/2609.38119 即可从本页面链接到该模型。

引用本文的数据集

0

没有数据集链接到本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.38119 即可从本页面链接到该数据集。

引用本文的空间

0

没有空间链接到本文

在空间的 README.md 中引用 arxiv.org/abs/2609.38119 即可从本页面链接到该空间。

包含本文的收藏

0

没有收藏包含本文

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接到它。

相似文章

ViSAGE:构建用于长视频理解的自我纠正记忆

arXiv cs.AI

ViSAGE是一个用于长视频理解的多模态智能体记忆框架,通过跨模态绑定、双向记忆精炼和多智能体交叉验证来构建自我纠正、以实体为中心的记忆,相比基线实现了5.9%的准确率提升。