有人注意到记忆API的基准测试数据不一致吗?

Reddit r/AI_Agents 新闻

摘要

这篇文章质疑了像Mem0和Zep这样的记忆API基准测试分数的可靠性,指出在LoCoMo基准测试中,自报数据与第三方数据存在显著差异,暗示这些指标可能更多是营销手段而非准确比较。

最近几天一直在研究代理记忆API(Mem0、Zep、Letta、MemoryLake,整个领域),想通过实际对比而不仅仅是阅读产品页面来比较它们。大家都提到LoCoMo作为他们的基准测试,所以我认为至少有一个数据可以跨供应商比较,但这些数据甚至相互不一致,Mem0在自己的博客上说92.5%,但我找到的第三方对比表显示大约64%;Zep说94.7%,第三方表显示大约85%;完全找不到Letta的自报数据,只有一个第三方数字大约74%;MemoryLake声称94%,但似乎没有人独立验证过。所以,对于同一个产品,取决于谁报告分数,会有20到30个百分点的波动。而且不只是我困惑,Zep确实有一篇博客文章直接质疑Mem0的数字(类似“Mem0真的最先进的吗?”),所以供应商彼此都不信任对方的数字。这让我觉得‘我们在LoCoMo上达到了X%’现在更像是营销话术,而不是真正用来选择它们的依据。测试设置和什么算正确答案可能在每个供应商的运行方式上差异很大,导致数字在跨供应商时失去意义。我做了一个自报数据与第三方数据对比的快速图表,如果有人想看的话,附上了。有人实际运行过自己的对比而不是相信发布的数字吗?好奇在这个领域是否有人真正信任某个基准测试?
查看原文

相似文章

要满足什么条件,你才会信任记忆基准测试的数字?

Reddit r/AI_Agents

作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。

记忆检索底层存在缺陷。

Reddit r/AI_Agents

PrecisionMemBench 是一个开源基准测试,它将检索精度作为严格的单元测试来检验,结果揭示了诸如 Mem0、Zep 和 Hindsight 等流行的记忆框架精度极低(0.05-0.09),并且依赖 LLM 来弥补。文章主张在生产级记忆基础设施中对精度采取零容忍的硬失败策略。