跨异构任务的自演化LLM记忆抽取

Hugging Face Daily Papers 论文

摘要

研究者推出BEHEMOTH基准与CluE聚类提示优化,使LLM能从多样化任务中抽取并保留异构记忆,相比既往自演化框架提升9%。

随着基于LLM的助手持续化、个性化,它们必须从过往对话中提取并保留有用信息作为记忆。然而,值得记忆的信息类型因任务而异。我们将“异构记忆抽取”任务形式化,推出BEHEMOTH基准:整合18个现有数据集,涵盖个性化、问题求解与智能体任务,采用下游效用驱动的指标进行系统评估。实证分析表明,没有任何单一静态抽取提示能在所有任务类别中占优;现有自演化提示优化框架原本面向同质分布,在训练任务异构时性能下降。为此,我们提出CluE——一种基于聚类的自演化策略:按抽取场景将训练样本聚类,独立分析各聚类,并综合跨聚类洞见以更新抽取提示。在BEHEMOTH上的实验显示,CluE在异构任务中有效泛化(相对提升+9.04%),持续超越既往自演化框架。
查看原文
查看缓存全文

缓存时间: 2026/04/23 03:35

论文页面 - 跨异构任务的自演化 LLM 记忆抽取

来源:https://huggingface.co/papers/2604.11610

摘要

基于 LLM 的助手需要异构记忆抽取能力,BEHEMOTH 基准对此进行评估,CluE 通过聚类提示优化实现更高性能。

随着基于 LLM 的助手变得持续化、个性化,它们必须从过往对话中抽取并保留有价值的信息作为记忆。然而,值得记忆的信息类型在不同任务间差异巨大。我们将异构记忆抽取任务形式化,并推出 BEHEMOTH 基准,该基准复用 18 个现有数据集,涵盖个性化、问题求解与智能体任务,采用下游效用驱动指标进行系统评估。实验分析证实,没有任何单一静态抽取提示能在所有任务类别中占优;现有自演化提示优化框架原本针对同构分布设计,在训练任务异构时性能下降。为此,我们提出 CluE,一种基于聚类的自演化策略:按抽取场景将训练样本聚类,独立分析各聚类,并综合跨聚类洞见以更新抽取提示。在 BEHEMOTH 上的实验表明,CluE 在异构任务中有效泛化(相对提升 9.04%),持续优于先前的自演化框架。

查看 arXiv 页面 (https://arxiv.org/abs/2604.11610)查看 PDF (https://arxiv.org/pdf/2604.11610)GitHub1 (https://github.com/ayyyq/heterogeneous-memory-extraction)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.11610)

在您的智能体中获取本文:

hf papers read 2604.11610

还没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型关联本文

在模型 README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。

引用本文的数据集 0

暂无数据集关联本文

在数据集 README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。

引用本文的 Spaces 0

暂无 Space 关联本文

在 Space README.md 中引用 arxiv.org/abs/2604.11610 即可在此页面显示链接。

收录本文的合集 0

暂无合集收录本文

将本文添加到合集即可在此页面显示链接。

相似文章

MemEvoBench:LLM 代理内存误演化基准测试

arXiv cs.CL

MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。

通过参数化记忆扩展自进化智能体

arXiv cs.AI

来自阿里巴巴/Qwen和北京大学的研究人员提出了TMEM——一种自进化参数化记忆框架。该框架利用在线LoRA权重更新,使LLM智能体能够在单个回合内真正从经验中学习,而非仅依赖提示空间中的记忆。TMEM在多个基准测试(包括LoCoMo、LongMemEval-S和CL-Bench)上均优于基于摘要和基于检索的基线方法。

智能体LLM系统的共享选择性持久记忆

arXiv cs.AI

本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。