WorldMemArena:通过动作-世界交互评估多模态智能体记忆
摘要
WorldMemArena 是一个新的基准测试,包含400个多会话多模态任务,用于评估多模态智能体记忆,比较了长上下文、RAG和基于框架的记忆方法,揭示了更好的记忆写入并不保证更好的性能,并且系统在处理视觉证据方面存在困难。
查看缓存全文
缓存时间: 2026/05/29 07:01
论文页面 - WorldMemArena:通过动作-世界交互评估多模态智能体记忆
来源:https://huggingface.co/papers/2605.29341 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
多模态大语言模型需要复杂的记忆系统,能够追踪不断变化的环境并在多个会话间动态管理信息,而新的基准测试揭示了当前方法的局限性。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models) 越来越多地被部署为长程智能体 (https://huggingface.co/papers?q=long-horizon%20agents),此时记忆不仅仅需要回忆:它必须追踪一个不断变化的世界,修正过时的信息,并在决策时提供正确的证据。现有的基准测试要么衡量静态对话中的回忆,要么将记忆压缩为单个任务结束时的准确率,或者将视觉观察简化为文字描述,这使我们无法将失败定位到写入、维护、检索或使用等阶段。能够自行管理记忆的智能体框架的出现进一步加剧了这一差距,因为我们缺乏原则性的方法来比较手工设计的管道与自我管理的替代方案。为了弥补这些差距,我们将多模态智能体记忆形式化为一个动作-世界交互循环 (https://huggingface.co/papers?q=Action-World%20Interaction%20Loop),具有可观察的四阶段生命周期,并将其具体化为 WorldMemArena (https://huggingface.co/papers?q=WorldMemArena):包含 400 个多会话多模态任务 (https://huggingface.co/papers?q=multimodal%20tasks),涵盖终身演化 (https://huggingface.co/papers?q=Lifelong%20Evolution)(演化的个人和任务状态)和智能体执行 (https://huggingface.co/papers?q=Agentic%20Execution)(来自真实观察、动作和反馈的记忆),并标注了金标准记忆点、更新、干扰项和证据链,用于阶段级诊断。这实现了首次针对长上下文、手动设计(RAG (https://huggingface.co/papers?q=RAG) 和外部记忆系统 (https://huggingface.co/papers?q=external%20memory%20systems))以及基于框架的记忆智能体 (https://huggingface.co/papers?q=harness-based%20memory%20agents) 的头对头比较。结果表明:(1) 更好的记忆写入 (https://huggingface.co/papers?q=memory%20writing) 和存储 (https://huggingface.co/papers?q=rag) 并不能保证更好的性能;(2) 多模态记忆仍然难以充分利用视觉证据 (https://huggingface.co/papers?q=visual%20evidence);(3) 系统在不同领域间不稳定,且在真实的智能体轨迹 (https://huggingface.co/papers?q=agentic%20trajectories) 上性能下降;(4) 框架记忆更灵活,但成本高昂且可靠性较低。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29341) 查看 PDF (https://arxiv.org/pdf/2605.29341) 项目页面 (https://worldmemarena-mem.github.io/) GitHub2 (https://github.com/UCSB-AI/WorldMemArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29341)
在您的智能体中获取此论文:
hf papers read 2605\.29341
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型:0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.29341 可从此页面链接。
引用此论文的数据集:0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.29341 可从此页面链接。
引用此论文的 Spaces:0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.29341 可从此页面链接。
包含此论文的收藏:0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 可从此页面链接。
相似文章
MemEye:面向多模态智能体记忆的视觉中心评估框架
MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。
RoboMemArena:一个全面且具挑战性的机器人记忆基准测试
RoboMemArena 推出了一项大规模基准测试,旨在通过现实世界验证评估涵盖 26 个复杂任务的机器人记忆能力,并提出了 PrediMem,这是一种利用预测编码优化记忆管理的双系统视觉 - 语言 - 动作模型。
从多模态经验中学会学习
本文介绍了AutoMMemo,一个使多模态智能体能够自动设计记忆机制(可表达为可执行的备忘录程序)以从多模态交互轨迹中学习的框架,在GUI/Web导航和视觉推理基准上优于无记忆和固定记忆基线。
SMMBench:面向源分布的多模态智能体记忆基准测试
提出SMMBench,一个用于评估多模态智能体从独立来源(如对话、表格和文档)中检索、对齐和组合分散证据能力的基准。实验表明,当前系统在此类源分布记忆组合任务上仍存在困难。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。