BEAM 基准测试

Reddit r/AI_Agents 新闻

摘要

Midas 在 BEAM 100K 上达到 0.56 recall@k,在 BEAM 500K 上达到 0.51 recall@k,零 LLM 调用、零成本,展示了高效的智能体长期记忆能力。

今天我们首次在 BEAM 上使用 Midas 运行了基准测试,BEAM 是最重要的智能体长期记忆基准之一。Midas 在 BEAM 100K 上达到了 0.56 recall@k,在 BEAM 500K 上达到了 0.51 recall@k,使用了 0 次 LLM 调用、0 美元 API 费用和 0 数据出站。接下来是 1M 和 10M 层级。我的目标是从后见之明和其他项目中学习,不断改进 Midas,同时保持本地优先、零成本。您怎么看?达到这个水平是否可能?
查看原文

相似文章

在 LongMemEval-S 上对智能体记忆检索进行基准测试 — Recall@5 达 98%,R@23 实现 100% 召回,仅依赖本地嵌入模型 (all-MiniLM-L6-v2),无需 LLM 与 API Key

Reddit r/AI_Agents

作者分享了用于智能体记忆的 Python 库 memweave 的基准测试结果,该库仅使用本地嵌入且无需调用 LLM,便在 LongMemEval-S 上实现了 98% 的 Recall@5。本文详细介绍了实现方法,并与 mempalace 进行了性能对比,突出了其在不同问题类型上稳定的检索表现。