MemSyco-Bench: 评估智能体记忆中的谄媚基准
摘要
MemSyco-Bench是一个新的基准测试,用于评估由检索记忆引起的基于LLM的智能体中的谄媚现象,测试智能体是否能够恰当地拒绝或使用记忆进行推理和决策,而不仅仅是存储。
查看缓存全文
缓存时间: 2026/07/02 07:47
论文页面 - MemSyco-Bench: 评估智能体记忆中的谄媚行为
来源:https://huggingface.co/papers/2607.01071
摘要
记忆在基于大语言模型(LLM)的智能体中扮演着关键角色,但检索出的记忆可能引发谄媚问题——智能体为迎合用户而牺牲事实准确性,这需要全新的评估基准,不仅要衡量记忆的存储与检索能力,更要评估其对推理与决策的影响。
记忆(https://huggingface.co/papers?q=Memory)已成为现代基于大语言模型(LLM)的智能体(https://huggingface.co/papers?q=LLM-based%20agents)的基石,推动其从单轮对话助手进化为长期协作伙伴。然而,记忆(https://huggingface.co/papers?q=memory)并非总是有益的:检索出的记忆常常引发严重的谄媚(https://huggingface.co/papers?q=sycophancy)问题,导致智能体以事实准确性(https://huggingface.co/papers?q=factual%20accuracy)或客观推理(https://huggingface.co/papers?q=objective%20reasoning)为代价过度迎合用户。尽管这一风险日益凸显,现有的记忆(https://huggingface.co/papers?q=memory)基准主要评估记忆是否被正确存储、检索或更新,却忽略了检索出的记忆如何影响下游推理(https://huggingface.co/papers?q=downstream%20reasoning)与决策(https://huggingface.co/papers?q=decision-making)。为弥补这一空白,我们提出MemSyco-Bench(https://huggingface.co/papers?q=MemSyco-Bench),一个用于评估智能体系统中记忆诱发的谄媚(https://huggingface.co/papers?q=memory-induced%20sycophancy)行为的全面基准。MemSyco-Bench(https://huggingface.co/papers?q=MemSyco-Bench)衡量记忆应该在何时影响决策以及如何正确使用有效记忆(https://huggingface.co/papers?q=memory)。具体而言,它涵盖五项任务,评估智能体是否能拒绝将记忆(https://huggingface.co/papers?q=memory)作为事实证据、尊重其适用范围、解决记忆与客观证据的冲突、追踪记忆(https://huggingface.co/papers?q=memory)更新以及利用有效记忆(https://huggingface.co/papers?q=memory)进行个性化服务。所有相关资源已收集并公开于 https://github.com/XMUDeepLIT/MemSyco-Bench(https://huggingface.co/papers?q=MemSyco-Bench)。
查看 arXiv 页面(https://arxiv.org/abs/2607.01071)查看 PDF(https://arxiv.org/pdf/2607.01071)GitHub4(https://github.com/XMUDeepLIT/MemSyco-Bench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01071)
在你的智能体中获取这篇论文:
hf papers read 2607.01071
没有最新命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.01071 即可从此页面建立链接。
引用此论文的数据集1
MemSyco-Bench/MemSyco-Bench 查看器•更新于约5小时前 • 1.55k(https://huggingface.co/datasets/MemSyco-Bench/MemSyco-Bench)
引用此论文的 Spaces0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.01071 即可从此页面建立链接。
包含此论文的收藏集0
暂无收藏集包含此论文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)中即可从此页面建立链接。
相似文章
MemEvoBench:LLM 代理内存误演化基准测试
MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。
记忆过度:记忆增强模型中的谄媚评估与缓解
本文介绍了 MIST,一个用于评估记忆增强大型语言模型中谄媚行为的基准,表明记忆系统将谄媚行为放大了高达 25 倍,并提出了轻量级的缓解措施,在减少谄媚的同时保持事实回忆能力。
GroupMemBench:多轮对话中LLM代理记忆的基准测试
GroupMemBench是一个新的基准,用于评估多轮对话中LLM代理的记忆能力,揭示了当前记忆系统的缺陷,最佳系统仅达到46%的平均准确率。
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
GateMem:多主体共享记忆代理中的记忆治理基准评测
GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。