跨异构任务的自演化LLM记忆抽取
摘要
研究者推出BEHEMOTH基准与CluE聚类提示优化,使LLM能从多样化任务中抽取并保留异构记忆,相比既往自演化框架提升9%。
查看缓存全文
缓存时间: 2026/04/23 03:35
论文页面 - 跨异构任务的自演化 LLM 记忆抽取
来源:https://huggingface.co/papers/2604.11610
摘要
基于 LLM 的助手需要异构记忆抽取能力,BEHEMOTH 基准对此进行评估,CluE 通过聚类提示优化实现更高性能。
随着基于 LLM 的助手变得持续化、个性化,它们必须从过往对话中抽取并保留有价值的信息作为记忆。然而,值得记忆的信息类型在不同任务间差异巨大。我们将异构记忆抽取任务形式化,并推出 BEHEMOTH 基准,该基准复用 18 个现有数据集,涵盖个性化、问题求解与智能体任务,采用下游效用驱动指标进行系统评估。实验分析证实,没有任何单一静态抽取提示能在所有任务类别中占优;现有自演化提示优化框架原本针对同构分布设计,在训练任务异构时性能下降。为此,我们提出 CluE,一种基于聚类的自演化策略:按抽取场景将训练样本聚类,独立分析各聚类,并综合跨聚类洞见以更新抽取提示。在 BEHEMOTH 上的实验表明,CluE 在异构任务中有效泛化(相对提升 9.04%),持续优于先前的自演化框架。
查看 arXiv 页面 (https://arxiv.org/abs/2604.11610)查看 PDF (https://arxiv.org/pdf/2604.11610)GitHub1 (https://github.com/ayyyq/heterogeneous-memory-extraction)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.11610)
在您的智能体中获取本文:
hf papers read 2604.11610
还没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。
引用本文的数据集 0
暂无数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。
引用本文的 Spaces 0
暂无 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。
收录本文的合集 0
暂无合集收录本文
将本文添加到合集即可在此页面显示链接。
相似文章
EvolveMem: 通过AutoResearch实现LLM智能体的自演化记忆架构
EvolveMem为LLM智能体引入了一种自演化记忆架构,通过LLM驱动的诊断和迭代研究周期来优化检索配置,在LoCoMo和MemBench等基准测试上取得了显著的性能提升。
MemEvoBench:LLM 代理内存误演化基准测试
MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。
通过参数化记忆扩展自进化智能体
来自阿里巴巴/Qwen和北京大学的研究人员提出了TMEM——一种自进化参数化记忆框架。该框架利用在线LoRA权重更新,使LLM智能体能够在单个回合内真正从经验中学习,而非仅依赖提示空间中的记忆。TMEM在多个基准测试(包括LoCoMo、LongMemEval-S和CL-Bench)上均优于基于摘要和基于检索的基线方法。
更少的上下文,更高的准确性:一种用于LLM代理的双时态记忆引擎,其中精简检索的上下文胜过了完整历史
本文介绍了Engram,一个开源的用于LLM代理的双时态记忆引擎,它通过检索一个紧凑的上下文片段(约9.6k token),在LongMemEval上以混合读取路径融合稠密、词汇、图和时间信号,比完整历史基线(79k token)高出10.4个准确率点。
智能体LLM系统的共享选择性持久记忆
本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。