WorldMemArena:通过动作-世界交互评估多模态智能体记忆

Hugging Face Daily Papers 论文

摘要

WorldMemArena 是一个新的基准测试,包含400个多会话多模态任务,用于评估多模态智能体记忆,比较了长上下文、RAG和基于框架的记忆方法,揭示了更好的记忆写入并不保证更好的性能,并且系统在处理视觉证据方面存在困难。

多模态大语言模型正越来越多地被部署为长期运行的智能体,其记忆不仅要能回忆,还必须跟踪不断变化的世界、更新过时信息、并在决策时提供正确的证据。现有基准测试在静态对话中测量回忆能力,将记忆简化为单一的任务结束准确率,并将视觉观察降级为文字描述,导致我们无法将失败定位到写入、维护、检索或使用环节。智能体框架能够自主管理记忆,这进一步加剧了差距,因为我们缺乏系统的方法来比较手工设计的流水线与自管理方案。为弥补这些不足,我们将多模态智能体记忆形式化为一个具有可观察四阶段生命周期的动作-世界交互循环,并实例化为 WorldMemArena:包含400个多会话多模态任务,涵盖终身演化(不断演化的个人与任务状态)和智能体执行(基于真实观察、动作和反馈的记忆),并配有黄金记忆点、更新、干扰项以及用于阶段诊断的证据链。这实现了长上下文、手工设计(RAG和外部记忆系统)以及基于框架的记忆智能体之间的首次正面比较。结果发现:(1)更好的记忆写入和存储并不能保证更好的性能;(2)多模态记忆在处理视觉证据方面仍有困难;(3)系统在不同领域间不稳定,在真实智能体轨迹上表现下降;(4)框架记忆更为灵活,但成本高且可靠性较低。
查看原文
查看缓存全文

缓存时间: 2026/05/29 07:01

论文页面 - WorldMemArena:通过动作-世界交互评估多模态智能体记忆

来源:https://huggingface.co/papers/2605.29341 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

多模态大语言模型需要复杂的记忆系统,能够追踪不断变化的环境并在多个会话间动态管理信息,而新的基准测试揭示了当前方法的局限性。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models) 越来越多地被部署为长程智能体 (https://huggingface.co/papers?q=long-horizon%20agents),此时记忆不仅仅需要回忆:它必须追踪一个不断变化的世界,修正过时的信息,并在决策时提供正确的证据。现有的基准测试要么衡量静态对话中的回忆,要么将记忆压缩为单个任务结束时的准确率,或者将视觉观察简化为文字描述,这使我们无法将失败定位到写入、维护、检索或使用等阶段。能够自行管理记忆的智能体框架的出现进一步加剧了这一差距,因为我们缺乏原则性的方法来比较手工设计的管道与自我管理的替代方案。为了弥补这些差距,我们将多模态智能体记忆形式化为一个动作-世界交互循环 (https://huggingface.co/papers?q=Action-World%20Interaction%20Loop),具有可观察的四阶段生命周期,并将其具体化为 WorldMemArena (https://huggingface.co/papers?q=WorldMemArena):包含 400 个多会话多模态任务 (https://huggingface.co/papers?q=multimodal%20tasks),涵盖终身演化 (https://huggingface.co/papers?q=Lifelong%20Evolution)(演化的个人和任务状态)和智能体执行 (https://huggingface.co/papers?q=Agentic%20Execution)(来自真实观察、动作和反馈的记忆),并标注了金标准记忆点、更新、干扰项和证据链,用于阶段级诊断。这实现了首次针对长上下文、手动设计(RAG (https://huggingface.co/papers?q=RAG) 和外部记忆系统 (https://huggingface.co/papers?q=external%20memory%20systems))以及基于框架的记忆智能体 (https://huggingface.co/papers?q=harness-based%20memory%20agents) 的头对头比较。结果表明:(1) 更好的记忆写入 (https://huggingface.co/papers?q=memory%20writing) 和存储 (https://huggingface.co/papers?q=rag) 并不能保证更好的性能;(2) 多模态记忆仍然难以充分利用视觉证据 (https://huggingface.co/papers?q=visual%20evidence);(3) 系统在不同领域间不稳定,且在真实的智能体轨迹 (https://huggingface.co/papers?q=agentic%20trajectories) 上性能下降;(4) 框架记忆更灵活,但成本高昂且可靠性较低。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29341) 查看 PDF (https://arxiv.org/pdf/2605.29341) 项目页面 (https://worldmemarena-mem.github.io/) GitHub2 (https://github.com/UCSB-AI/WorldMemArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29341)

在您的智能体中获取此论文:

hf papers read 2605\.29341

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型:0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.29341 可从此页面链接。

引用此论文的数据集:0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.29341 可从此页面链接。

引用此论文的 Spaces:0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.29341 可从此页面链接。

包含此论文的收藏:0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 可从此页面链接。

相似文章

MemEye:面向多模态智能体记忆的视觉中心评估框架

Hugging Face Daily Papers

MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。

从多模态经验中学会学习

arXiv cs.AI

本文介绍了AutoMMemo,一个使多模态智能体能够自动设计记忆机制(可表达为可执行的备忘录程序)以从多模态交互轨迹中学习的框架,在GUI/Web导航和视觉推理基准上优于无记忆和固定记忆基线。