BEAM 基准测试
摘要
Midas 在 BEAM 100K 上达到 0.56 recall@k,在 BEAM 500K 上达到 0.51 recall@k,零 LLM 调用、零成本,展示了高效的智能体长期记忆能力。
今天我们首次在 BEAM 上使用 Midas 运行了基准测试,BEAM 是最重要的智能体长期记忆基准之一。Midas 在 BEAM 100K 上达到了 0.56 recall@k,在 BEAM 500K 上达到了 0.51 recall@k,使用了 0 次 LLM 调用、0 美元 API 费用和 0 数据出站。接下来是 1M 和 10M 层级。我的目标是从后见之明和其他项目中学习,不断改进 Midas,同时保持本地优先、零成本。您怎么看?达到这个水平是否可能?
相似文章
Midas: 100%本地智能体记忆——摄入无需LLM,零成本,数据不出设备(MCP + Python SDK)
Midas是一款本地智能体记忆工具,使用嵌入和排序而非LLM调用来完成信息摄入,实现了零成本、离线运行,通过可审计的源轮次获得高召回率。
在 LongMemEval-S 上对智能体记忆检索进行基准测试 — Recall@5 达 98%,R@23 实现 100% 召回,仅依赖本地嵌入模型 (all-MiniLM-L6-v2),无需 LLM 与 API Key
作者分享了用于智能体记忆的 Python 库 memweave 的基准测试结果,该库仅使用本地嵌入且无需调用 LLM,便在 LongMemEval-S 上实现了 98% 的 Recall@5。本文详细介绍了实现方法,并与 mempalace 进行了性能对比,突出了其在不同问题类型上稳定的检索表现。
IFCMemoryBench:评估基于LLM的智能体在BIM信息检索中的长期记忆
本文介绍了IFCMemoryBench,一个经过人工验证的基准测试,用于评估基于LLM的智能体在BIM信息检索中的长期记忆。研究表明,当前的记忆系统仅能达到32.4%的答案准确率,揭示了智能体记忆中的领域迁移差距。
无需调用模型即可在LongMemEval上达到96.4%召回率的智能体记忆系统
Agentlas是一个免费、开源的智能体记忆系统,它使用本地SQLite数据库,结合轻量级嵌入和关键词搜索,无需调用LLM即可在LongMemEval上达到96.4%,性能优于mem0和supermemory等替代方案。
@hyunji_amy_lee: LLM代理与记忆系统在持续更新的环境中运行(Git仓库、不断演变的文档)。它们必须处理…
MINTEval是一个新的基准,用于评估在频繁上下文变化的持续更新环境中LLM代理和记忆系统的表现。它显示当前系统性能不佳,典型系统的平均准确率仅为27.9%。