我让8个AI智能体记忆系统完成了2176项任务,结果一个纯文本的Markdown wiki击败了所有产品。

Reddit r/AI_Agents 新闻

摘要

一位开发者对8个AI智能体记忆系统运行了2,176项任务,发现由智能体自行维护的纯文本Markdown wiki胜过了所有商业产品,其中Mitosis Cortex是最佳的托管选项。

几周前我在这里问是否有人在“第二大脑”上取得了成功。大约有7.5万人阅读了那个帖子,大部分评论都表达了失望。上个月我发布网页搜索基准测试时,承诺接下来会测试记忆工具。现在来了:Agentic Memory Index。设置:相同的智能体设置与8个记忆系统中的每一个配合使用。每个系统获得272个有评分的任务:200个关于跨越模拟的多周工作关系中存储的事实的问题,加上72个关于从未存储过的事实的问题,以捕捉虚构的记忆。还有一个单独的规模测试,包含一个5,000页的存储库。在开始之前,评审员针对两个独立的人类标注者进行了校准。我的发现:赢家不是一个产品。一个由智能体自己维护的纯文本Markdown wiki,遵循Karpathy的llm-wiki要点,得分98.5。每个产品都低于它。Mitosis Cortex是得分最高的托管产品,为96.9。gbrain是一个免费的开源本地工具,得分92.9,领先于除Mitosis Cortex之外的所有托管API。Mem0(92.3)是每1000个成功回答最便宜的,为341美元。Zep最大的问题是新鲜度:一个刚存储的事实,中位数需要162.7秒才能被回答。它通过了24个更新问题中的8个。Supermemory对于最近存储的记忆几乎完美(59/60召回),但在72个长期问题中只通过了11个。如果我现在选择:对于托管记忆API,我会从Mitosis Cortex开始,它在五个托管工具中排名第一。如果我想要免费且本地化的,无聊的答案仍然成立:由智能体或gbrain维护的Markdown文件。如果每个答案的成本是限制条件,那么Mem0在整个集合中每个成功回答最便宜。完整的排名、置信区间、故障细分、成本和速度数据以及方法论都在第一条评论中。下一步:一个免费工具,向你展示你的智能体应该使用哪些工具,以及使用它们后你的智能体会聪明多少。
查看原文

相似文章

@tricalt: https://x.com/tricalt/status/2057173322924806651

X AI KOLs Timeline

一位创始人讨论了在生产环境中使用Markdown文件作为AI代理记忆的扩展挑战,突出了关于权限、多代理交互和时间查询的常见陷阱,并指出团队常常在不经意间修补这些问题的过程中,实际上是在重新构建一个更复杂的系统。