相同检索,不同答案:500个LongMemEval结果中32个翻转

Reddit r/AI_Agents 工具

摘要

本文强调,即使检索结果不变,由于读取器或评判器阶段的差异,Engrava这一记忆层工具的基准分数也可能发生变化,并使用LongMemEval结果来说明这一问题。

披露:我构建了Engrava,因此这些是我的项目自己的结果。如果您根据某人的LongMemEval数字选择记忆层工具,这里有一个故障模式:即使检索本身对某些问题没有变化,检索后也可能出现几个问题的差距。我在自己的发布中遇到了这个问题。Engrava 0.6.0在2026年8月的完整500题LongMemEval-S集合中得分为81.6%。版本0.5.0在7月得分为82.4%。因此,新版本少答对了四个问题,看起来更差,我想知道它在查找方面是否真的变差了。两次运行都存储了检索到的ID,因此我对比了工件,而不是重新运行基准测试。在500个问题中的457个,检索返回了相同顺序的相同ID。在其他43个问题中,检索不同,但没有一个评分结果改变。同时,32个结果确实改变了:18个下降和14个上升,净差正好是四个答案的差距。在这32个问题中,每个问题在两次运行中都有相同顺序的相同检索ID。因此,分数的变化发生在检索之后,在读取器或评判器阶段。即使温度为零,这些模型也可能变化。不过,两次运行确实基于不同的测试框架提交,因此这本身并不能测量读取器和评判器的差异。有两点使得这个差异对比有用。首先,没有生成式LLM决定存储什么或在读取时重新排序结果。在摄取过程中仍然有嵌入调用。其次,运行记录了每个问题的检索ID,按顺序。这是我希望更多公开比较中包含的部分。我无法告诉你分数通常会自行变化多少。每个配置只运行了一次,因此我没有测量到的差异,也不会发明一个置信区间。这也是一个数据集上的一个检索基准,对您的工作负载没有说明。两行数据仍然发布,包括较旧且较高的那个。如果您想重复这个差异对比,工件在仓库中。README中有完整的重现步骤。较新的行固定了提交a45dde9和engrava==0.6.0。完整运行需要清理后的LongMemEval-S拆分和一个OpenAI API密钥。如果您只想检查连接,还有一个免费的离线冒烟运行。我会在评论中放置两个仓库链接,而不是在帖子中。如果您比较记忆层工具,您会对比检索到的上下文,还是只对比最终分数?
查看原文

相似文章

要满足什么条件,你才会信任记忆基准测试的数字?

Reddit r/AI_Agents

作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。

在 LongMemEval-S 上对智能体记忆检索进行基准测试 — Recall@5 达 98%,R@23 实现 100% 召回,仅依赖本地嵌入模型 (all-MiniLM-L6-v2),无需 LLM 与 API Key

Reddit r/AI_Agents

作者分享了用于智能体记忆的 Python 库 memweave 的基准测试结果,该库仅使用本地嵌入且无需调用 LLM,便在 LongMemEval-S 上实现了 98% 的 Recall@5。本文详细介绍了实现方法,并与 mempalace 进行了性能对比,突出了其在不同问题类型上稳定的检索表现。

记忆检索底层存在缺陷。

Reddit r/AI_Agents

PrecisionMemBench 是一个开源基准测试,它将检索精度作为严格的单元测试来检验,结果揭示了诸如 Mem0、Zep 和 Hindsight 等流行的记忆框架精度极低(0.05-0.09),并且依赖 LLM 来弥补。文章主张在生产级记忆基础设施中对精度采取零容忍的硬失败策略。

MemTrace:探究最终准确率在长期记忆中遗漏的内容

arXiv cs.AI

MemTrace 是一个基准,它在知识点层面评估 LLM 代理的记忆,探究事实在不同记忆年龄、问题类型和证据条件下的表现。它揭示出汇总的准确率掩盖了不同的失败模式,并且主要瓶颈是证据的使用而非检索。