标签
本文提出了一个基准和一个多智能体系统,旨在通过多轮人类反馈改进科学图表生成,解决了质量漂移和跨修订遗忘等问题。
这篇文章比较了冻结语言模型的离散和连续内存适配器,发现像EPMem这样的二进制掩码方法与连续方法一样容易忘记事实,强调写入/分配规则而非离散性是防止忘记的关键。
ForgetBench 引入了一个基准测试,用于系统地表征大型语言模型在持续知识编辑下的遗忘行为,通过基于概念和场景的问答来衡量时间衰减和保留动态。
该论文介绍了 MoFO,一种动量过滤优化器,通过仅更新具有大动量幅值的参数来缓解 LLM 微调中的遗忘问题,无需额外存储即可保留预训练知识。
斯坦福大学提出AutoMem方法,通过让模型学会管理记忆(选择性遗忘)而非扩大参数,使320亿参数小模型性能翻倍并追平顶级大模型,揭示了记忆管理比模型规模更重要。
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。
本文介绍了Fora(函数空间正交残差适应),一种在微调过程中通过将更新投影到从激活导出的函数空间方向而非权重空间方向来保护现有能力的方法。在Qwen3-1.7B上的实验表明,在保持翻译和数学能力方面,它优于权重空间投影和标准正则化。
本文介绍ReRULE,一种用于LLM强化遗忘的离策略回放方法,在RWKU和MUSE等基准测试中提高了遗忘与保留效率。
提出一种面向LLM代理中代理记忆的认知启发的多因素价值函数,通过学习可解释的权重来决定在记忆约束下编码、遗忘和检索什么。相比仅基于相似性或基于最近性的基线方法,显著提高了黄金证据的保留率。
这篇博客文章介绍了长时域视频生成和世界模型中'Forgetting Wall'的概念,认为主要瓶颈是内存(KV缓存增长)而非计算,并探讨了压缩作为未来模型的关键方向。
提出FoLoRA,一种遗忘感知优化框架,用于微调基础模型,通过广义瑞利商优化平衡任务效用和遗忘惩罚,更好地保留非目标能力。
本文引入了“初始化记忆”的概念,研究深度网络中随机初始化偏差在训练后保留了多少,表明低学习率的SGD能保留初始化,而Adam系列优化器则消除它,并将其与遗忘动力学联系起来。
引入SeqMem-Eval,一种用于序列演化LLM记忆的诊断评估框架,测量超越聚合指标的多个维度,揭示适应性与稳定性之间的权衡。
研究者推出 Memora 基准,衡量大模型在持续数周至数月的对话中保留、更新与遗忘用户长期记忆的能力,发现模型常复用已失效记忆。