标签
本文介绍了MUSE任务,用于评估大型语言模型中的上下文更新,并提出了PLUME,一种无需训练的方法,在顺序演化设置中显著提升了性能,尤其是在MUSE-Bench基准上。
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。