@yoheinakajima: 这个周末运行了我的第一个基准测试(longmemeval),主要是为了测试ActiveGraph,学到了很多! - 这是一个垫脚石…

X AI KOLs Timeline 模型

摘要

Yohei Nakajima 在 ActiveGraph 上运行了 LongMemEval 基准测试,取得了 85.6% 的问答准确率和 86.2% 的回合上下文答案准确率,展示了基于事件的智能体系统在长期记忆方面的有效性。

这个周末运行了我的第一个基准测试(longmemeval),主要是为了测试ActiveGraph,学到了很多! - 这是一个里程碑,展示了基于事件的智能体系统是可行的。 - AI说服我不要从事实/实体的图谱抽取开始。 - 认识到运行基准测试很耗时。 - 更清楚什么是好的基准测试和差的基准测试(我认为这个相当全面)。 - 完全可复现的开源仓库和测试。 - 看起来ActiveGraph非常适合这个,表现扎实,是一个好的开始。
查看原文
查看缓存全文

缓存时间: 2026/05/26 07:05

这个周末跑了我的第一个基准测试(longmemeval),主要是为了测试ActiveGraph,学到了很多!

  • 这是一块垫脚石,证明基于事件的智能体系统是可行的。AI说服了我,让我不要一开始就做事实/实体的图提取
  • 学会了一件事:跑基准测试真的很耗时间
  • 对好基准测试和差基准测试的理解更深了(我觉得这个挺全面的)
  • 全可复现的开源仓库和测试
  • ActiveGraph似乎很适合这个场景,表现很扎实,算是个不错的开头

这里没做提取,只是作为第一次测试做了确定性摄取

目前只是研究阶段,但我也在用 @intelligenceco 测试联合创始人系统,它负责处理网站/Newsletter/博客,给项目加点润色还挺有意思的

Awesome

太酷了,请一定去试试!我只有周末能动这个,所以很希望看到其他人能推得更快一些

相似文章

在 LongMemEval-S 上对智能体记忆检索进行基准测试 — Recall@5 达 98%,R@23 实现 100% 召回,仅依赖本地嵌入模型 (all-MiniLM-L6-v2),无需 LLM 与 API Key

Reddit r/AI_Agents

作者分享了用于智能体记忆的 Python 库 memweave 的基准测试结果,该库仅使用本地嵌入且无需调用 LLM,便在 LongMemEval-S 上实现了 98% 的 Recall@5。本文详细介绍了实现方法,并与 mempalace 进行了性能对比,突出了其在不同问题类型上稳定的检索表现。