ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
摘要
ReflectWorld-MM 是一个面向实体的多模态记忆系统,专为开放式视频流设计,采用受人类记忆理论启发的分层长期记忆,在六个基准测试中达到了最先进的准确率。
查看缓存全文
缓存时间: 2026/07/21 06:35
论文页面 - ReflectWorld-MM:面向开放式视频流的实体化多模态记忆系统
来源:https://huggingface.co/papers/2607.09759
摘要
构建能够持续观察世界、记住所见并基于积累的经验进行推理的助手是一个长期目标。近来,配备视频流长期记忆的多模态智能体引起了越来越多的关注。然而,现有系统要么将记忆保留在模型上下文中,要么存放在平面特征存储中,并且围绕帧而非流真正关注的持久性实体来组织记忆,这将其局限在有边界的视频中,削弱了其追踪随时间重新出现的角色和对象的能力。本文提出 ReflectWorld-MM,一个面向实体、专为开放式视频流设计的多模态记忆系统。它由三部分组成:第一部分是感知前端,在有界短期记忆下将音视频流转化为实体级观测;第二部分是一个基于人类记忆理论的分层长期记忆系统,耦合了多尺度情景记忆、演进的以实体为中心的语义记忆和程序性记忆;第三部分是完整的实际运行实现,可摄入任意视频流并接入现成的助手。在六个长视频和终身记忆基准测试中,ReflectWorld-MM 在所有六项上均取得最佳准确率,超越了强大的记忆智能体和前沿模型。
查看 arXiv 页面 (https://arxiv.org/abs/2607.09759) 查看 PDF (https://arxiv.org/pdf/2607.09759) 项目页面 (https://github.com/addxai/ReflectWorld) GitHub68 (https://github.com/addxai/ReflectWorld) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09759)
引用本论文的模型0
暂无关联本论文的模型
请在模型 README.md 中引用 arxiv.org/abs/2607.09759 以在此页面建立链接。
引用本论文的数据集0
暂无关联本论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2607.09759 以在此页面建立链接。
引用本论文的 Space0
暂无关联本论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2607.09759 以在此页面建立链接。
包含本论文的收藏集0
暂无包含本论文的收藏集
请将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
ReWorld:一个具有长期记忆的交互式世界模型
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
RRM:经验驱动的反思性检索记忆用于长时程多模态推理
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
WorldMemArena:通过动作-世界交互评估多模态智能体记忆
WorldMemArena 是一个新的基准测试,包含400个多会话多模态任务,用于评估多模态智能体记忆,比较了长上下文、RAG和基于框架的记忆方法,揭示了更好的记忆写入并不保证更好的性能,并且系统在处理视觉证据方面存在困难。
EM^2Mem:面向大语言模型的事件中心多模态记忆
EM^2Mem 提出了一种事件中心的多模态记忆框架,该框架将异构证据绑定到事件锚点,为长视频问答提供紧凑、可生成的记忆,从而提高准确性并降低延迟。
MBench:面向视频世界模型记忆能力的综合基准
本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。