MemSyco-Bench: 评估智能体记忆中的谄媚基准

Hugging Face Daily Papers 论文

摘要

MemSyco-Bench是一个新的基准测试,用于评估由检索记忆引起的基于LLM的智能体中的谄媚现象,测试智能体是否能够恰当地拒绝或使用记忆进行推理和决策,而不仅仅是存储。

记忆已成为现代基于LLM的智能体的基石,支持它们从单轮助手演变为长期协作者。然而,记忆并非总是有益的:检索到的记忆常常引发一个关键问题——谄媚,导致智能体过度迎合用户,而牺牲事实准确性或客观推理。尽管存在这种新出现的风险,现有的记忆基准主要评估记忆是否正确存储、检索或更新,而忽略了检索到的记忆如何影响下游推理和决策。为了填补这一空白,我们提出了MemSyco-Bench,一个用于评估智能体系统中记忆引发谄媚现象的全面基准。MemSyco-Bench衡量记忆何时应影响决策以及如何正确使用有效记忆。具体来说,它涵盖五项任务,评估智能体是否能够拒绝将记忆作为事实证据、尊重其适用范围、解决记忆与客观证据之间的冲突、追踪记忆更新以及使用有效记忆进行个性化。所有相关资源已收集在社区:https://github.com/XMUDeepLIT/MemSyco-Bench。
查看原文
查看缓存全文

缓存时间: 2026/07/02 07:47

论文页面 - MemSyco-Bench: 评估智能体记忆中的谄媚行为

来源:https://huggingface.co/papers/2607.01071

摘要

记忆在基于大语言模型(LLM)的智能体中扮演着关键角色,但检索出的记忆可能引发谄媚问题——智能体为迎合用户而牺牲事实准确性,这需要全新的评估基准,不仅要衡量记忆的存储与检索能力,更要评估其对推理与决策的影响。

记忆(https://huggingface.co/papers?q=Memory)已成为现代基于大语言模型(LLM)的智能体(https://huggingface.co/papers?q=LLM-based%20agents)的基石,推动其从单轮对话助手进化为长期协作伙伴。然而,记忆(https://huggingface.co/papers?q=memory)并非总是有益的:检索出的记忆常常引发严重的谄媚(https://huggingface.co/papers?q=sycophancy)问题,导致智能体以事实准确性(https://huggingface.co/papers?q=factual%20accuracy)或客观推理(https://huggingface.co/papers?q=objective%20reasoning)为代价过度迎合用户。尽管这一风险日益凸显,现有的记忆(https://huggingface.co/papers?q=memory)基准主要评估记忆是否被正确存储、检索或更新,却忽略了检索出的记忆如何影响下游推理(https://huggingface.co/papers?q=downstream%20reasoning)与决策(https://huggingface.co/papers?q=decision-making)。为弥补这一空白,我们提出MemSyco-Bench(https://huggingface.co/papers?q=MemSyco-Bench),一个用于评估智能体系统中记忆诱发的谄媚(https://huggingface.co/papers?q=memory-induced%20sycophancy)行为的全面基准。MemSyco-Bench(https://huggingface.co/papers?q=MemSyco-Bench)衡量记忆应该在何时影响决策以及如何正确使用有效记忆(https://huggingface.co/papers?q=memory)。具体而言,它涵盖五项任务,评估智能体是否能拒绝将记忆(https://huggingface.co/papers?q=memory)作为事实证据、尊重其适用范围、解决记忆与客观证据的冲突、追踪记忆(https://huggingface.co/papers?q=memory)更新以及利用有效记忆(https://huggingface.co/papers?q=memory)进行个性化服务。所有相关资源已收集并公开于 https://github.com/XMUDeepLIT/MemSyco-Bench(https://huggingface.co/papers?q=MemSyco-Bench)。

查看 arXiv 页面(https://arxiv.org/abs/2607.01071)查看 PDF(https://arxiv.org/pdf/2607.01071)GitHub4(https://github.com/XMUDeepLIT/MemSyco-Bench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01071)

在你的智能体中获取这篇论文:

hf papers read 2607.01071

没有最新命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2607.01071 即可从此页面建立链接。

引用此论文的数据集1

MemSyco-Bench/MemSyco-Bench 查看器•更新于约5小时前 • 1.55k(https://huggingface.co/datasets/MemSyco-Bench/MemSyco-Bench)

引用此论文的 Spaces0

暂无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.01071 即可从此页面建立链接。

包含此论文的收藏集0

暂无收藏集包含此论文

将这篇论文添加到收藏集(https://huggingface.co/new-collection)中即可从此页面建立链接。

相似文章

MemEvoBench:LLM 代理内存误演化基准测试

arXiv cs.CL

MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。

记忆过度:记忆增强模型中的谄媚评估与缓解

arXiv cs.AI

本文介绍了 MIST,一个用于评估记忆增强大型语言模型中谄媚行为的基准,表明记忆系统将谄媚行为放大了高达 25 倍,并提出了轻量级的缓解措施,在减少谄媚的同时保持事实回忆能力。

GateMem:多主体共享记忆代理中的记忆治理基准评测

Hugging Face Daily Papers

GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。