SAM:面向长程推理智能体的状态自适应记忆

Hugging Face Daily Papers 论文

摘要

本文提出 SAM,一个状态自适应记忆框架,能够动态管理长程智能体推理中的交互历史,实现意图驱动的回忆,而无需重新训练基础模型。它在多个基准测试(如 BrowseComp 和 HLE)上优于强基线方法。

长程智能体推理要求大型语言模型在包含思考、工具调用、观察和部分结论的冗长交互历史中持续行动。挑战不仅在于这些历史会变长,还在于当前决策所需的信息可能分散在遥远步骤中,并且只在后续才变得相关。现有方法通过截断交互历史、将其压缩为更短的替代形式,或检索部分历史进行重用,来应对这一困难,但它们并未明确建模模型对过去历史的访问应如何适应智能体不断演变的状态。相反,我们将长程推理视为一个状态自适应记忆问题。为此,我们提出状态自适应记忆(SAM),这是一个独立的框架,它将持续交互整合为紧凑的记忆线索,同时保留原始轨迹页面以供意图驱动的回忆。这些线索并非用作历史的替代品,而是作为轻量级句柄,使智能体能够根据当前需求重建时间上遥远的信息,而无需重新训练底层骨干模型。我们进一步通过专家引导监督和强化学习优化记忆模块,使其与轨迹级效用对齐。在 BrowseComp、BrowseComp-ZH、WideSearch 和 HLE 上,SAM 在多种智能体骨干模型中持续优于强基线方法。我们的结果表明,显式记忆建模为长程智能体推理提供了简单而有效的基础。
查看原文
查看缓存全文

缓存时间: 2026/05/27 06:48

论文页面 - SAM:面向长时程推理智能体的状态自适应记忆

来源: https://huggingface.co/papers/2605.24468

摘要

长时程智能推理通过一种状态自适应记忆框架得到增强,该框架能动态管理交互历史:创建紧凑的记忆线索,同时保留详细轨迹以供定向检索。

长时程智能推理 (https://huggingface.co/papers?q=Long-horizon%20agentic%20reasoning) 要求大语言模型 (https://huggingface.co/papers?q=large%20language%20models) 在包含思考、工具调用、观察和部分结论的长交互历史中行动。挑战不仅在于这些历史会变长,更在于当前决策所需的信息可能散布在遥远的步骤中,且只在日后才变得相关。现有方法通过截断交互历史 (https://huggingface.co/papers?q=interaction%20history)、将其压缩为较短替代物,或检索并重用其中的选定部分来应对这一难题,但它们并未显式建模对过去交互的访问应如何适应智能体不断变化的状态。相反,我们将长时程推理视为一个状态自适应记忆 (https://huggingface.co/papers?q=state-adaptive%20memory) 问题。为此,我们提出状态自适应记忆 (https://huggingface.co/papers?q=State-Adaptive%20Memory) (SAM),一个独立框架:它将正在进行的交互整合为紧凑的记忆线索 (https://huggingface.co/papers?q=memory%20cues),同时保留原始轨迹页 (https://huggingface.co/papers?q=trajectory%20pages) 以供意图驱动回忆 (https://huggingface.co/papers?q=intent-driven%20recall)。这些线索并不替代历史,而是充当轻量级句柄,使智能体能够根据当前需求重构时间上遥远的信息,而无需重新训练底层骨干。我们进一步通过专家引导监督 (https://huggingface.co/papers?q=expert-guided%20supervision) 和强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) 优化记忆模块,使其与轨迹级效用 (https://huggingface.co/papers?q=trajectory-level%20utility) 对齐。在 BrowseComp、BrowseComp-ZH、WideSearch 和 HLE 上,SAM 在不同智能体骨干上始终优于强基线。我们的结果表明,显式记忆建模为长时程智能推理 (https://huggingface.co/papers?q=long-horizon%20agentic%20reasoning) 提供了一种简单且有效的基础。

查看 arXiv 页面 (https://arxiv.org/abs/2605.24468) 查看 PDF (https://arxiv.org/pdf/2605.24468) GitHub3 (https://github.com/qhjqhj00/cabeza) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.24468)

在您的智能体中获取这篇论文:

hf papers read 2605.24468

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

未找到引用此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.24468 可将其链接到此页面。

引用此论文的数据集 0

未找到引用此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.24468 可将其链接到此页面。

引用此论文的 Spaces 0

未找到引用此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2605.24468 可将其链接到此页面。

包含此论文的收藏集 0

未找到包含此论文的收藏集

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 可将其链接到此页面。

相似文章

AdMem:面向任务求解智能体的高级记忆系统

arXiv cs.AI

本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。

在关键时刻记住:面向长周期代理的前瞻性记忆代理

Hugging Face Daily Papers

本文介绍了一种前瞻性记忆代理,它与动作代理并行运行,以防止长周期任务中的行为状态衰减,在Terminal-Bench2.0和τ^2-Bench上取得了显著提升。作者还使用SFT和GRPO训练了Qwen3.5-27B,作为迈向开放权重记忆策略的初步步骤。

面向长周期智能体的主动记忆(阅读时长16分钟)

TLDR AI

本文介绍了一种主动记忆代理,它与标准行为代理协同工作,在长周期任务中选择性地注入基于记忆的提醒,从而缓解行为状态衰减。在Terminal-Bench和τ²-Bench上的实验显示,pass@1有显著提升,并且该方法在弱和强行为代理上均得到了验证。