VideoLoop:针对长视频智能体中语义抖动的循环工作记忆
摘要
该论文提出了VideoLoop,一个具有循环工作记忆的多模态智能体,以解决长视频理解中的语义抖动问题,并在VideoMME等基准测试中展示了性能提升。
查看缓存全文
缓存时间: 2026/09/30 04:16
论文页面 - VideoLoop:针对长视频智能体语义抖动的循环工作记忆
来源:https://huggingface.co/papers/2609.38119
发布于 2024年9月29日
·
由 https://huggingface.co/Jinfa 提交
Huang (https://huggingface.co/Jinfa) 于9月30日提交
摘要
长视频理解需要多模态智能体在许多推理步骤中迭代地收集证据。然而,大多数现有的智能体方法都受到语义抖动的影响:随着仅追加的工作记忆不断增长,对关键证据的注意力会崩溃,智能体将无法访问它已经发现的信息。首先,我们提供了一个结构性论证,表明仅追加的记忆虽然可以纳入新观察到的目标证据,但无法移除累积的噪声或防止有序上下文的增长,除非有重写操作。其次,基于此分析,我们提出了 VideoLoop,一个具有两个耦合循环的多模态智能体。外层循环对视频进行推理,内层循环在每一步之后,从过去观察和中间分析的无限文件系统中检索工件,并重写一个有界的工作记忆。大量实验证明了 VideoLoop 的有效性,它以即插即用的方式改进了四种流行的大型视觉语言模型(LVLM)骨干,在 VideoMME(长视频)基准上平均比基线提高了 4.2 个百分点。对工作记忆的进一步分析表明,VideoLoop 缓解了语义抖动:在 VideoMME(长视频)最难的四分之一问题上,一个仅阅读智能体上下文的盲审法官的正确率为 81.1%,而仅追加智能体的正确率为 60.9%。使用 Gemini 3.1 Pro 时,VideoLoop 在 VideoMME(长视频)上达到 88.3%,在 VideoMMMU 上达到 88.8%,在 LongVideoBench(长视频)上达到 80.9%。
查看 arXiv 页面 (https://arxiv.org/abs/2609.38119) 查看 PDF (https://arxiv.org/pdf/2609.38119) GitHub 仓库 (https://github.com/philipxjm/videoloop) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.38119)
在你的智能体中获取这篇论文:
hf papers read 2609.381119
没有最新的 CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型
0
没有模型链接到本文
在模型的 README.md 中引用 arxiv.org/abs/2609.38119 即可从本页面链接到该模型。
引用本文的数据集
0
没有数据集链接到本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.38119 即可从本页面链接到该数据集。
引用本文的空间
0
没有空间链接到本文
在空间的 README.md 中引用 arxiv.org/abs/2609.38119 即可从本页面链接到该空间。
包含本文的收藏
0
没有收藏包含本文
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接到它。
相似文章
SimpleMemVLA:一种简单但有效的视觉-语言-动作模型原生视频记忆
SimpleMemVLA为视觉-语言-动作模型引入了一种简单的记忆机制,通过将完整的时间戳视频历史馈送到预训练的VLM骨干网络中,在长期操作任务中实现了最先进的结果,无需专用记忆模块。
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
MemDreamer:通过分层图记忆与代理检索机制解耦长视频理解中的感知与推理
MemDreamer 通过分层图记忆和代理检索解耦长视频理解中的感知与推理,在降低计算开销的同时实现了最先进的性能。
VideoMM:用于高效视频MLLMs的自适应宏微观推理
VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。
ViSAGE:构建用于长视频理解的自我纠正记忆
ViSAGE是一个用于长视频理解的多模态智能体记忆框架,通过跨模态绑定、双向记忆精炼和多智能体交叉验证来构建自我纠正、以实体为中心的记忆,相比基线实现了5.9%的准确率提升。