标签
CHIME是一种信用感知分层记忆框架,它分离规划和执行记忆库,通过准确归因任务结果来提高长时域代理规划,并优于基线方法。
DiagEvo通过层级错误原因记忆和双重置信度过滤,从内部失败历史中推导训练方向,从而改善语言模型的自进化,其性能优于依赖外部资源的基线方法。
本文介绍了加权记忆树,一种为LLM智能体设计的层次化记忆系统,它能动态保留重要信息,将任务准确率提高9.97%,并将提示词使用量减少32.8%。
RecVerse 是一个基于 GUI 的模拟代理,采用分层记忆和轨迹级强化学习来模拟现实的多轮电子商务购物流程,解决了现有模拟器的记忆和优化挑战。
本文介绍了Agent Memory Distillation(AMD),一种无需训练的框架,通过层级记忆将结构化知识从大型教师智能体迁移到小型学生智能体,在工具使用基准测试上的性能提升达3.4–27.2个百分点。
TRACE是一个面向LLM代理的开源层次化记忆系统,它将对话历史组织成主题树,使用开放权重模型在MemoryAgentBench的EventQA任务上达到了82.5%的F1分数,性能优于Mem0和MemGPT。
HASTE 提出了一种面向机器学习工程的分层多智能体系统,将跨竞赛知识组织为三个层级,在 MLE-Bench Lite 上实现了 77.3% 的获奖率,同时将计算量减少 52%,并证明了结构化知识迁移优于扁平记忆方法。
本文介绍了ContextForge,一种层次化内存架构,将LLM上下文窗口视为可回收工作空间,在长时程任务上实现了显著的令牌和速度改进,同时在拥有2.76亿行的企业基准上保持了准确性。
本文介绍了MemSlides,一种用于个性化幻灯片生成的分层记忆框架,它将长期用户档案、会话约束的工作记忆以及局部编辑的工具记忆分离开来,从而在不完全重新生成的情况下实现多轮修订。
本文提出HORMA,一种分层组织与检索记忆智能体,它将智能体经历组织成类文件系统结构以实现高效检索,在减少token用量的同时提升长周期任务的性能。
PhotoCraft 提出了一种无需训练的层次化记忆系统,用于照片搜索智能体,集成了工作记忆、情景记忆和语义记忆,以维持长期上下文并在任务间迁移知识,在 DISBench 上取得了高达 18.5% 的提升。
CoMIC 是一种面向大语言模型代理的云边框架,通过协作记忆和洞察循环提升长时任务性能,无需参数更新,在多个任务中实现进度率和动作依据的提升。
SHARP 提出了一种受生物学启发的框架,将记忆积累与模式识别分离,在离线睡眠阶段使用加速重放来学习流式环境中的长程非平稳时序模式。它在 text8 和 PG-19 上提升了上下文保持能力,同时保持了计算效率。
TMAS 引入了一种多智能体框架,通过结构化协作与分层记忆系统扩展测试时计算,从而增强大语言模型的推理能力。该方法采用专用智能体、跨轨迹信息流以及混合奖励强化学习,有效提升了模型在复杂推理基准上的迭代扩展性能与稳定性。
SafeHarbor是一个用于LLM代理安全的新型框架,它利用分层记忆和自进化机制来平衡安全性与实用性,在良性任务和恶意任务上均实现了最先进的性能。