跨异构任务的自演化LLM记忆抽取
摘要
研究者推出BEHEMOTH基准与CluE聚类提示优化,使LLM能从多样化任务中抽取并保留异构记忆,相比既往自演化框架提升9%。
查看缓存全文
缓存时间: 2026/04/23 03:35
论文页面 - 跨异构任务的自演化 LLM 记忆抽取
来源:https://huggingface.co/papers/2604.11610
摘要
基于 LLM 的助手需要异构记忆抽取能力,BEHEMOTH 基准对此进行评估,CluE 通过聚类提示优化实现更高性能。
随着基于 LLM 的助手变得持续化、个性化,它们必须从过往对话中抽取并保留有价值的信息作为记忆。然而,值得记忆的信息类型在不同任务间差异巨大。我们将异构记忆抽取任务形式化,并推出 BEHEMOTH 基准,该基准复用 18 个现有数据集,涵盖个性化、问题求解与智能体任务,采用下游效用驱动指标进行系统评估。实验分析证实,没有任何单一静态抽取提示能在所有任务类别中占优;现有自演化提示优化框架原本针对同构分布设计,在训练任务异构时性能下降。为此,我们提出 CluE,一种基于聚类的自演化策略:按抽取场景将训练样本聚类,独立分析各聚类,并综合跨聚类洞见以更新抽取提示。在 BEHEMOTH 上的实验表明,CluE 在异构任务中有效泛化(相对提升 9.04%),持续优于先前的自演化框架。
查看 arXiv 页面 (https://arxiv.org/abs/2604.11610)查看 PDF (https://arxiv.org/pdf/2604.11610)GitHub1 (https://github.com/ayyyq/heterogeneous-memory-extraction)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.11610)
在您的智能体中获取本文:
hf papers read 2604.11610
还没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。
引用本文的数据集 0
暂无数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。
引用本文的 Spaces 0
暂无 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。
收录本文的合集 0
暂无合集收录本文
将本文添加到合集即可在此页面显示链接。
相似文章
$\varepsilon$-MemEvo:面向LLM程序演化的自适应跨任务记忆迁移
本文介绍了ε-MemEvo,一个用于基于LLM的程序演化中跨任务知识迁移的框架,它将策略记忆存储为自然语言摘要,并使用自适应注入门控。该框架在8个优化基准上均取得了性能提升,计算开销不到1%。
EvolveMem: 通过AutoResearch实现LLM智能体的自演化记忆架构
EvolveMem为LLM智能体引入了一种自演化记忆架构,通过LLM驱动的诊断和迭代研究周期来优化检索配置,在LoCoMo和MemBench等基准测试上取得了显著的性能提升。
HasMem: 用于长期LLM代理的硬起源自适应软化记忆
论文提出了HasMem,一种用于长期LLM代理的自适应记忆压缩方法,该方法在保持冻结的LLM参数的同时调整记忆宽度,在重建和问答基准测试中展示了改进的性能。
MemEvoBench:LLM 代理内存误演化基准测试
MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。
MemTrapBench:LLM内存使用中的认知陷阱基准测试
本文介绍了MemTrapBench,一个用于评估LLM内存使用中认知陷阱的基准测试,并提出了AdaptiveMem,一种在推理时减轻这些陷阱同时保持标准基准性能的方法。