标签
本文提出了一种用于主动检测用户侧Human-LLM对话中隐式冲突的方法,引入了一个基准和合成方法来增强轻量级LLM的性能。
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。