有人注意到记忆API的基准测试数据不一致吗?
摘要
这篇文章质疑了像Mem0和Zep这样的记忆API基准测试分数的可靠性,指出在LoCoMo基准测试中,自报数据与第三方数据存在显著差异,暗示这些指标可能更多是营销手段而非准确比较。
最近几天一直在研究代理记忆API(Mem0、Zep、Letta、MemoryLake,整个领域),想通过实际对比而不仅仅是阅读产品页面来比较它们。大家都提到LoCoMo作为他们的基准测试,所以我认为至少有一个数据可以跨供应商比较,但这些数据甚至相互不一致,Mem0在自己的博客上说92.5%,但我找到的第三方对比表显示大约64%;Zep说94.7%,第三方表显示大约85%;完全找不到Letta的自报数据,只有一个第三方数字大约74%;MemoryLake声称94%,但似乎没有人独立验证过。所以,对于同一个产品,取决于谁报告分数,会有20到30个百分点的波动。而且不只是我困惑,Zep确实有一篇博客文章直接质疑Mem0的数字(类似“Mem0真的最先进的吗?”),所以供应商彼此都不信任对方的数字。这让我觉得‘我们在LoCoMo上达到了X%’现在更像是营销话术,而不是真正用来选择它们的依据。测试设置和什么算正确答案可能在每个供应商的运行方式上差异很大,导致数字在跨供应商时失去意义。我做了一个自报数据与第三方数据对比的快速图表,如果有人想看的话,附上了。有人实际运行过自己的对比而不是相信发布的数字吗?好奇在这个领域是否有人真正信任某个基准测试?
相似文章
要满足什么条件,你才会信任记忆基准测试的数字?
作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。
记忆检索底层存在缺陷。
PrecisionMemBench 是一个开源基准测试,它将检索精度作为严格的单元测试来检验,结果揭示了诸如 Mem0、Zep 和 Hindsight 等流行的记忆框架精度极低(0.05-0.09),并且依赖 LLM 来弥补。文章主张在生产级记忆基础设施中对精度采取零容忍的硬失败策略。
所有AI记忆解决方案在真正进行基准测试之前看起来都差不多
对三种开源AI记忆后端(Atomic Memory、Mem0、Zep)的透明对比,涵盖许可证、设置、提供商支持以及AUDN分类等独特功能。
相同检索,不同答案:500个LongMemEval结果中32个翻转
本文强调,即使检索结果不变,由于读取器或评判器阶段的差异,Engrava这一记忆层工具的基准分数也可能发生变化,并使用LongMemEval结果来说明这一问题。
我比较了4款托管记忆工具与Claude Code的内置记忆。最好的一款让同一智能体的准确率提升了43.1%
作者将四款托管记忆工具与Claude Code的内置记忆进行了对比,发现Mitosis Cortex带来的准确率提升最大,达到43.1%;Hyperspell和Mem0几乎持平;Supermemory则远远落后。文章建议使用托管记忆API而非内置记忆,以获得更好的可移植性和性能。