标签
MemFuse推出了MemFuseBench,一个用于评估AI智能体中多源记忆融合的基准测试,并提出了MemFuse——一种结构化的记忆系统,可在整合碎片化观察的同时保持来源的可追溯性。
本文介绍了 EpicStar 框架,该框架利用情景记忆和动态检索帮助 LLM 代理在星际争霸 II 等长时程任务中保持战略连贯性,以显著更少的 token 实现更高的胜率。
本文提出了一种确定性的零模型流水线,将被动捕获的屏幕活动编译为结构化的“活动帧”用于代理记忆,将一天的原始捕获压缩为适合提示的上下文块,体积缩小86倍,并达到98.4%的问答准确率。文中还引入了例程开销比率和重复性的测量,用于对代理成本进行建模。
This paper introduces ScrubJay-MEM, an LLM agent memory system inspired by scrub jay episodic memory, which uses type-conditioned temporal decay to manage memory perishability. It also proposes the Temporal Generalization Test (TGT) benchmark and shows improved performance over existing memory systems on temporal reasoning tasks.
UniMem提出了一种自路由框架,结合了情景记忆与参数记忆用于LLM智能体,在无任务标签的边界无关任务流中实现自适应记忆管理。
本文基于一部小说的时序记忆任务,研究长上下文语言模型是否表现出与人类相似的类情节顺序记忆。作者发现模型显示出相同的距离效应,并揭示了一个单独的关注头(attention head)重建时间上下文,支持时间上下文重建作为大语言模型中类情节记忆的机制。
一条推特长线,提供关于构建随使用而改进的自学习智能体的战略建议,涵盖双学习来源、记忆类型和数据所有权。
一位开发者分享了他们使用 Anthropic SDK 和 TypeScript 构建具有记忆功能的 AI 智能体的经验,解释了工作记忆、情景记忆、语义记忆和程序记忆之间的区别,以及为生产环境扩展记忆所面临的挑战。
一位前谷歌工程师在12分钟内解释了AI智能体记忆架构,涵盖工作记忆和三个记忆层(程序性、语义、情景),并使用总结器防止令牌膨胀,类似于Claude所用的。
WISE提出了一种用于Minecraft的长视距智能体框架,通过因果事件图增强低级控制器的情景记忆,使其能够在视角变化下稳健回忆,并通过因果推理实现机会性任务重排序。该框架还采用了多尺度渐进探索策略,在长视距稀疏任务上展示了更高的成功率和效率。
S3Mem 提出了一种用于长周期交互式问答的结构化时空场景事件记忆框架,采用锚点敏感检索和令牌预算感知的证据接口,在多个环境中优于标准 RAG。
一个受情景记忆理论启发的新型内存检索系统,使用Gemini Flash在LongMemEval基准测试中取得了最先进的96.4% top-50准确率,通过将检索质量与模型能力分离,超越了基于Pro的大型基线。
本文表明,使用LLM将过去的经验持续整合到文本记忆中会随着时间的推移降低记忆效用,并且保留原始情景轨迹优于强制整合,这对构建鲁棒的智能体记忆系统具有启示意义。
一项研究发现,在基于LLM的智能体系统中持续更新整合记忆会降低性能,而保留原始情节轨迹更为可靠。在ARC-AGI上的实验显示,即使GPT-5.4在整合后也更容易失败。
该论文介绍了 MemQ,这是一种通过将 Q 学习整合到自演化记忆智能体中来解决情节记忆检索中的信用分配问题的方法,具体做法是利用基于来源有向无环图的资格迹。
这项研究表明,即使基于真实解进行训练,通过蒸馏和巩固循环持续更新 LLM 智能体记忆也会导致性能倒退。研究发现,仅保留情景记忆优于基于文本的巩固,突显了当前自我改进范式的重大缺陷。
本文介绍了 CASCADE,这是一个部署时学习框架,允许大型语言模型通过情境记忆和上下文赌博机优化实现持续自适应,而无需修改模型参数。