ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
摘要
ReflectWorld-MM 是一个面向实体的多模态记忆系统,专为开放式视频流设计,采用受人类记忆理论启发的分层长期记忆,在六个基准测试中达到了最先进的准确率。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - ReflectWorld-MM:面向开放式视频流的实体化多模态记忆系统
来源:https://huggingface.co/papers/2607.09759
摘要
构建能够持续观察世界、记住所见并基于积累的经验进行推理的助手是一个长期目标。近来,配备视频流长期记忆的多模态智能体引起了越来越多的关注。然而,现有系统要么将记忆保留在模型上下文中,要么存放在平面特征存储中,并且围绕帧而非流真正关注的持久性实体来组织记忆,这将其局限在有边界的视频中,削弱了其追踪随时间重新出现的角色和对象的能力。本文提出 ReflectWorld-MM,一个面向实体、专为开放式视频流设计的多模态记忆系统。它由三部分组成:第一部分是感知前端,在有界短期记忆下将音视频流转化为实体级观测;第二部分是一个基于人类记忆理论的分层长期记忆系统,耦合了多尺度情景记忆、演进的以实体为中心的语义记忆和程序性记忆;第三部分是完整的实际运行实现,可摄入任意视频流并接入现成的助手。在六个长视频和终身记忆基准测试中,ReflectWorld-MM 在所有六项上均取得最佳准确率,超越了强大的记忆智能体和前沿模型。
查看 arXiv 页面 (https://arxiv.org/abs/2607.09759) 查看 PDF (https://arxiv.org/pdf/2607.09759) 项目页面 (https://github.com/addxai/ReflectWorld) GitHub68 (https://github.com/addxai/ReflectWorld) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09759)
引用本论文的模型0
暂无关联本论文的模型
请在模型 README.md 中引用 arxiv.org/abs/2607.09759 以在此页面建立链接。
引用本论文的数据集0
暂无关联本论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2607.09759 以在此页面建立链接。
引用本论文的 Space0
暂无关联本论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2607.09759 以在此页面建立链接。
包含本论文的收藏集0
暂无包含本论文的收藏集
请将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
WorldMemArena:通过动作-世界交互评估多模态智能体记忆
WorldMemArena 是一个新的基准测试,包含400个多会话多模态任务,用于评估多模态智能体记忆,比较了长上下文、RAG和基于框架的记忆方法,揭示了更好的记忆写入并不保证更好的性能,并且系统在处理视觉证据方面存在困难。
MBench:面向视频世界模型记忆能力的综合基准
本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。
MemEye:面向多模态智能体记忆的视觉中心评估框架
MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
MemLearner:学习为视频世界模型查询上下文记忆
MemLearner 提出了一种基于学习的自适应上下文查询方法,使用查询令牌来改善视频世界模型中的场景一致性和记忆,特别适用于具有遮挡和动态物体的长序列。