当个人记忆没有唯一答案时:在不可还原冲突下评估LLM代理
摘要
本文介绍了TANGLE,一个用于评估LLM代理在个人记忆中不可还原冲突下认知行为的基准,评估维度包括冲突感知和记忆忠实度。
arXiv:2608.13921v1 公告类型:新
摘要: LLM代理越来越多地跨会话维护个人记忆,但这些记忆可能存在冲突。偏好取决于上下文,行为会演变,来源也可能冲突。当查询缺乏上下文、时间或来源权威来解释冲突时,将一个记忆视为决定性会将未解决的冲突转化为不合理的、过度自信的行为。现有的基准从冲突证据中恢复一个答案,忽略了代理是否识别不确定性、保留替代方案、寻找缺失信息并选择适当的行为。我们引入了\underline{T}esting \underline{A}gents' \underline{N}avigation of \underline{G}enuine, \underline{L}atent, and \underline{E}ntangled Memory Conflicts (\textsc{TANGLE}),一个针对真正无法解决的内存冲突的基准。它包括541个实例,分布在40个角色和三种类型中:上下文分区冲突(CPC)、行为振荡冲突(BOC)和来源矛盾冲突(SCC)。我们评估两个轨道——一个具有策划记忆的预言轨道和一个从多会话语话中提取记忆的管道轨道——在五个维度上:冲突感知、因果推理、置信度校准、澄清寻求和记忆忠实度。实验揭示了管道挑战。使用策划记忆时,模型在识别冲突方面比校准行为或寻求有针对性的澄清更可靠。使用端到端管道记忆时,提取未能保留下游推理所需的关系冲突。政策比较显示,当行为必须反映冲突时,固定规则是不够的。这些发现促使了冲突感知行动政策(CAAP)的提出,它使用可用证据为每个冲突调整行动。\textsc{TANGLE} 将冲突处理框架化为识别不确定性、保留冲突证据并在不强制决定答案的情况下行动。
查看缓存全文
缓存时间: 2026/08/17 09:56
# 当个人记忆没有唯一答案:评估在不可还原冲突下的LLM智能体 来源:https://arxiv.org/html/2608.13921 徐书晟 单位:蚂蚁集团 李卓然 杨通凯 单位:蚂蚁集团 黄隆波\[0\.3em\] 信息科学跨学科研究院 (IIIS) 清华大学 arXiv 预印本,2026年8月14日 ###### 摘要 基于大语言模型(LLM)的智能体日益能够跨会话维持持久的个人记忆,但这种记忆并非总是一致的。偏好因情境而异,行为随时间演变,来自不同来源的信息可能相互矛盾。当查询省略了用于解释冲突记忆所需的情境、时间或来源权威信息时,将其中一个记忆视为最终答案,会将一个未解决的冲突转变为一个无根据的答案,并导致过度自信的行为。现有的基准测试建立在单一的可恢复答案之上:它们奖励从冲突证据中选择或重构一个值,而忽视了智能体是否能识别不确定性、保留替代选项、寻求缺失信息并选择适当行动。我们引入了 **测试智能体导航真实、潜在和交织的记忆冲突(TANGLE)**,这是一个评估当智能体面临个人记忆中真正无法解决的冲突时认知行为的基准。TANGLE 包含 541 个实例,涵盖 40 种不同的人设和三种冲突类型:情境分区冲突(CPC)、行为振荡冲突(BOC)和来源矛盾冲突(SCC)。我们评估了两个路径:一个提供精选记忆的预设记忆路径,以及一个从多会话对话中提取记忆的流水线评估路径,以评估处理冲突所需的五个认知维度:冲突感知、因果推理、置信度校准、澄清寻求和记忆忠实性。我们的实验揭示了智能体流水线中的挑战。在拥有完整精选记忆的情况下,模型识别冲突比校准行动或寻求针对性澄清更可靠。在端到端流水线记忆中,出现了一个上游瓶颈:记忆提取未能保留下游推理所需的关系。在下游行动阶段,策略比较表明,当行动必须反映特定冲突时,固定的解决规则是不充分的。这些发现促使我们提出了 **冲突感知行动策略(CAAP)**,它根据可用证据调整每个冲突的行动。TANGLE 和这些发现共同将冲突处理定义为识别不确定性、保留冲突证据,并在不强制确定答案的情况下选择行动。 ## 1. 引言 大语言模型(LLM)智能体正从无状态的助手演进为跨对话会话保留个人记忆的持久系统(22, 6, 17)。随着记忆的增长,智能体积累了关于用户生活不同方面的记录,这些记录跨越不同情境、时间线和来源。对于某个特定方面,冲突可能在没有任何记录为假的情况下产生:一个偏好在一种情境下是合适的,但在另一种情境下则不然(32);一个行为反映的是先前的或暂时的状态,而非用户信息在长期交互中演变形成的稳定特征(21, 1, 13, 3);一个来源在其自身范围内是信息性的,但对每个决策并非都具有权威性(16, 31)。 挑战在于,冲突记忆保存了其适用性依赖于情境、时间或来源的信息,而当前查询省略了确定哪条信息适用的变量。因此,记忆库并不支持唯一答案。如果智能体仍然将一条信息视为最终答案,它就移除了每条信息适用的条件,错误地分类了用户的当前状态,给出了不适合当前情况的建议,或执行了未经确认的选择。这使得冲突处理成为记忆智能体可靠性和安全性的核心问题(24, 41):高风险场景需要谨慎验证,而低风险场景则需要有条件或可逆的协助。 现有冲突基准主要关注在可用证据支持唯一答案时恢复该答案,将真正无法解决的记忆冲突行为排除在其评估目标之外。他们的任务定义将冲突表述为具有单一可恢复答案的问题,将分歧视为需要解决而非需要保持的结构。这种以答案为中心的设计鼓励智能体将冲突记忆强行纳入一个最终答案,在相关的上下文、时间状态或来源权威仍然未解决时,产生过度自信或不恰当的行为。此外,先前的基准未能区分记忆提取和冲突解决。单一的、未分化的路径将记忆构建的失败与冲突推理的失败混为一谈,使得不清楚智能体是缺乏包含冲突的证据,还是未能在其收到的证据上采取适当行动。表1中的比较具体说明了由此产生的差距:先前的基准并未同时支持多个有效回应、定性回应评级、多个评估路径和真正的模糊性。 表1:与先前冲突基准的比较。Ctx:平均/最大上下文长度;\#Q:查询数;MV/QL/MS/MT/Amb\.:多个有效回应、分级质量、多会话数据、多路径输入和真正的模糊性。基准测试|Ctx\(平均值/最大值\)|冲突焦点|回应格式|评估覆盖范围|MV|QL|MS|MT|Amb\. ---|---|---|---|---|---|---|---|---|--- MemConflict\(30\)|3\.9K/204K, 1,492|时间性/事实/情境|简短回答|✗|✗|✓|✗|✗ STALE\(3\)|152K/165K, 1,200|隐式时间性|开放形式|✗|✗|✓|✗|✗ HaluMem\(4\)|2\.3K/1M, 3,467|错误前提|简短回答|✗|✗|✓|✗|✗ ConflictBank\(28\)|N/A†, 553K|事实|多项选择|✗|✗|✗|✗|✗ CONFLICTINGQA\(34\)|512/1K, 238|观点|二元选择|✗|✗|✗|✗|✗ CONFLICTS\(2\)|512/5K, 458|时间性/事实/观点|开放形式|✗|✗|✗|✗|✗ SelectiveQA\(45\)|N/A‡, 34\.6K|来源偏见|简短回答+拒绝回答|✗|✗|✗|✗|✗ TANGLE|744/48K, 541|情境/行为/来源|开放形式|✓|✓|✓|✓|✓ †句子级声明-证据对。‡结构化表格输入。 为了解决这一差距,我们引入了 **测试智能体导航真实、潜在和交织的记忆冲突(TANGLE)**,这是一个评估当个人记忆包含真正无法解决的冲突时智能体应如何推理和行动的基准。TANGLE 包含来自 40 个人设的 541 个实例,涵盖 10 个领域的 46 个生活方面以及三种冲突类型:*情境分区冲突(CPC)*,即偏好取决于情境;*行为振荡冲突(BOC)*,即偏好发生变化但未稳定;以及*来源矛盾冲突(SCC)*,即来源不一致。这些冲突之所以无法解决,是因为情境、行为动态或来源可靠性未知。我们通过两个匹配的路径来评估 TANGLE。*预设记忆路径*直接提供精选记忆,隔离冲突推理。*流水线评估路径*评估从多会话对话中提取记忆后的端到端行为(18, 38)。由于两个路径编码了相同的底层冲突,它们的比较将记忆构建过程中的信息丢失与冲突推理中的失败区分开来。由于没有回应是唯一正确的,我们的评分标准评估冲突感知、因果推理、置信度校准(20)、澄清寻求和记忆忠实性,并标记出因过度自信解决而导致伤害的高风险情况。代表性实例见附录。 跨五个回应模型,预设记忆路径结果揭示了从识别到行动的差距:即使拥有完整的精选记忆,模型识别冲突也比校准建议或寻求针对性澄清更可靠。比较预设记忆路径和流水线评估路径,确定记忆提取是一个上游瓶颈,因为系统通常保留主题事实,却丢失了理解冲突所需的情境、时间和来源关系;部分检索因此降低了感知和诊断能力。冲突结构的丢失,加上同领域的干扰项,进一步削弱了后续的推理和行动。策略比较表明,确定性选择器和保守模板对未解决的冲突强加了预设的回应模式。这些发现促使我们提出了**冲突感知行动策略(CAAP)**,它根据可用证据调整每个冲突的行动。 我们的贡献在于: - •我们揭示了先前记忆冲突基准的两个局限性:它们将冲突表述为单一答案恢复任务,并在单一的、未分化的路径中评估智能体。单一答案公式鼓励智能体将冲突记忆强行纳入一个最终答案,在相关的上下文、时间状态或来源权威未解决时,产生过度自信或不恰当的行为。单一路径设计将记忆构建的失败与冲突推理的失败混为一谈,使得不清楚智能体是缺乏包含冲突的证据,还是未能在其收到的证据上采取适当行动。 - •我们建立了 TANGLE,一个将个人记忆冲突评估从恢复单一答案转向评估智能体如何识别不确定性、保留冲突证据并选择适当行动的基准。它包含 40 个人设、46 个生活方面、10 个领域和三种冲突类型的 541 个实例。我们提供了预设记忆路径和流水线评估路径,以区分冲突推理与记忆提取,并为没有唯一标准答案的案例提供以行为为中心的评分标准。 - •我们表明固定的解决规则对未解决的冲突处理不完善,并引入了**冲突感知行动策略(CAAP)**,它根据可见证据为每个冲突选择行动,而不是应用单一的解决规则。 ## 2. 相关工作 ### 2.1. 冲突基准 关于冲突评估的工作涵盖了确定性解决的场景和表征模型在分歧下行为的场景。许多基准将冲突解决表述为恢复单一答案,无论是通过时间最近性(30, 29)、隐式状态失效(3)、前提修正(4)、显式解决指令(12)、预构建冲突消除(27),还是基于知识的矛盾处理(11, 48)。另一条平行的思路则研究模型如何在竞争性证据之间进行裁决,包括强制选择下的记忆化倾向(28, 40)、来源和证据敏感性(34, 26)、动态事实更新和错误信息效应(19, 23)、冲突类型感知回应生成(2)、多跳冲突定位(15),以及在冲突的多源个人记忆中进行选择性问答(QA)并拒绝回答(45)。更广泛的背景可参考42的综述。我们的评估特别关注当冲突被设计为故意无法解决时,模型行为的质量。 ### 2.2. 长期记忆基准 长期记忆基准主要强调稳定的回忆、个性化保真度以及在演变的交互历史下的记忆使用。先前的数据集测试了事实和时间回忆(18, 38)、偏好一致性和人设遵守(47, 13, 14),并扩展到真实对话个性化(39)和情感支持对话(5)。最近的工作越来越强调动态记忆条件,包括遗忘感知评估(33)、记忆到行动的基础(27)、多会话状态跟踪(10, 7)和自我演化记忆(35, 37, 41),而24则强调了下游安全问题,如记忆诱导的谄媚行为。 ### 2.3. 智能体记忆系统 智能体记忆架构跨越虚拟上下文管理和可扩展的外部记忆层(22, 6, 17, 49)、反思性和自我更新记忆机制(43, 25),以及用于工作流执行的程序性记忆(8, 36)。以优化为导向的方法进一步将记忆使用视为一个策略学习问题,包括基于强化学习的记忆控制方法(44, 46, 50)。 图1:TANGLE基准概览。TANGLE(测试智能体导航真实、潜在和交织的记忆冲突)涵盖情境分区冲突(CPC)、行为振荡冲突(BOC)和来源矛盾冲突(SCC),通过预设记忆路径和流水线评估路径评估智能体处理记忆冲突的能力。冲突感知行动策略(CAAP)选择基于证据的行动,而非强制单一值。 图2:TANGLE的结构多样性
相似文章
@omarsar0: // LLM 智能体中的记忆诅咒 //(建议收藏)过长的历史记录显然会导致智能体性能下降,因为它们变得越来越…
本研究论文揭示了 LLM 智能体中的“记忆诅咒”现象,证明扩大的上下文窗口会通过削弱前瞻性意图,系统性地破坏多智能体社会困境中的合作行为。作者表明,通过定向微调、合成记忆净化以及减少显式思维链(Chain-of-Thought)推理,可有效缓解此类行为衰退。
STALE:LLM智能体能否识别记忆何时失效?
本文识别了LLM智能体中的一个关键失效模式:当新证据与先前信念冲突时,它们无法更新个性化记忆。本文引入了STALE基准和一个三维探测框架,揭示了即使最佳模型也仅达到55.2%的准确率,并提出了CUPMem作为鲁棒记忆修正的原型。
LLM代理中的记忆作为攻击面:关于多项选择题回答的研究
本文研究了基于LLM的代理在多项选择题回答中的记忆操控,表明即使当前查询是干净的,被破坏的记忆也可能导致代理选择错误的选项。
面向长期LLM代理的检索驱动记忆再巩固
本文介绍了REALM,一个用于LLM代理长期记忆的框架,它利用检索驱动的再巩固来自主地将记忆组织成认知图,从而在长期记忆基准测试中取得更好的性能。
记住、验证还是询问?LLM代理记忆承诺的跨家族评估
本文引入记忆-澄清边界(MCB)基准,以评估LLM代理如何决定持久化、验证或澄清记忆更新,发现模型在验证变化事实时比请求澄清更可靠。