面向多模态代理的任务聚焦记忆
摘要
介绍了TaskMem,一种基于强化学习的多模态代理动态记忆框架,在流式视频基准测试上实现了6.3%、7.0%和5.3%的准确率提升。
查看缓存全文
缓存时间: 2026/06/01 03:17
论文页面 - 面向多模态智能体的任务聚焦记忆
来源: https://huggingface.co/papers/2605.31075
摘要
本文提出了一种名为 TaskMem 的基于强化学习的框架,能够动态决定多模态智能体应在长期记忆中存储哪些信息,从而在流式视频基准测试中提升性能。
长期记忆(https://huggingface.co/papers?q=Long-term%20memory)对于多模态智能体(https://huggingface.co/papers?q=multimodal%20agents)构建连贯的体验、积累世界知识以及实现持续学习(https://huggingface.co/papers?q=continual%20learning)至关重要。然而,构建有效的记忆不仅涉及记忆模块的设计以及准确性、保真度等基本需求;关键挑战在于决定“记住什么”。多模态智能体(https://huggingface.co/papers?q=Multimodal%20agents)(例如具身智能体)持续地感知、推理并在真实或虚拟环境中行动,接收源源不断的多模态观测信息。面对这种信息组合爆炸,智能体必须选择性地保留与其环境角色相关且对未来任务有价值的内容。为弥补这一差距,我们将记忆生成视为一种可学习的记忆策略(https://huggingface.co/papers?q=memorization%20policy),并引入了 TaskMem(任务聚焦记忆策略学习),这是一个基于强化学习的框架,使策略能够动态调整关注点以适应环境中遇到的实际任务需求。TaskMem 采用两阶段训练(https://huggingface.co/papers?q=two-phase%20training)范式:第一阶段学习如何记忆,在基本保真度要求下优化记忆质量(https://huggingface.co/papers?q=memory%20quality);第二阶段在部署后进行,智能体通过在其基础 MLLM 上微调适配器来学习记忆什么,利用最近的环境任务定义奖励模型(https://huggingface.co/papers?q=reward%20model),引导记忆策略(https://huggingface.co/papers?q=memorization%20policy)朝向与任务相关的内容。为评估我们的方法,我们将 VideoMME(https://huggingface.co/papers?q=VideoMME)、EgoLife(https://huggingface.co/papers?q=EgoLife)和 EgoTempo(https://huggingface.co/papers?q=EgoTempo)重新构建为流式基准测试(https://huggingface.co/papers?q=streaming%20benchmarks),模拟了智能体处理流式观测并处理在线到来任务的现实场景。为隔离记忆评估,问题必须仅使用智能体的记忆来回答,而不访问原始视频。基于 Qwen3-VL-30B-A3B(https://huggingface.co/papers?q=Qwen3-VL-30B-A3B),TaskMem 在这些基准测试上的 VQA 准确率(https://huggingface.co/papers?q=VQA%20accuracy)分别提升了 6.3%、7.0% 和 5.3%。
查看 arXiv 页面(https://arxiv.org/abs/2605.31075)查看 PDF(https://arxiv.org/pdf/2605.31075)项目页面(https://taskmem.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.31075)
在你的智能体中获取这篇论文:
hf papers read 2605\.31075
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型关联该论文
在模型 README.md 中引用 arxiv.org/abs/2605.31075 以在此页面链接它。
引用该论文的数据集0
没有数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2605.31075 以在此页面链接它。
引用该论文的 Space0
没有 Space 关联该论文
在 Space README.md 中引用 arxiv.org/abs/2605.31075 以在此页面链接它。
包含该论文的收藏集0
没有收藏集包含该论文
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)以在此页面链接它。
相似文章
Inherent(由DeepMind校友创立)称其AI‘队友’刚刚在复制研究方面超越了Anthropic和OpenAI
Inherent,一家由DeepMind校友创立的初创公司,声称其AI代理Faraday在复制科学研究方面超越了Anthropic和OpenAI模型,使用了一个较小的模型通过强化学习来培养‘研究品味’。
@ChengsongH31219: 我们通过为环境(而非仅仅代理)构建“Harness”革新了环境设计!静态环境限制了...
EnvHarness 是一个可编程的包装器框架,动态适配静态环境以增强LLM代理训练,通过提供更优的优化信号,在多个基准测试中超越现有方法,用于强化学习。
@GoogleDeepMind: 游戏一直是Google DeepMind AI研究的重要测试平台,已持续15年。从精通Atari到在StarCraft II中达到大师级别…
Google DeepMind强调了其15年来通过游戏推动人工智能发展的历史,并宣布与Fenris Creations建立研究合作伙伴关系,以应对持续学习和多智能体动态等开放挑战。
从雅达利到《星战前夜》:基于游戏中15年AI研究的成果
DeepMind回顾了其通过游戏进行AI研究的15年历程,从《雅达利游戏》到《星战前夜》,并宣布新的合作关系以推进这两个领域的发展。
面向文化遗产的包容性轻量级联邦持续学习方法
本文提出FedCurv-DR,一种轻量级的联邦持续学习方法,旨在减少遗忘并平衡性能、公平性和能效,以实现文化遗产应用中的可持续AI。