@yoheinakajima: 这个周末运行了我的第一个基准测试(longmemeval),主要是为了测试ActiveGraph,学到了很多! - 这是一个垫脚石…
摘要
Yohei Nakajima 在 ActiveGraph 上运行了 LongMemEval 基准测试,取得了 85.6% 的问答准确率和 86.2% 的回合上下文答案准确率,展示了基于事件的智能体系统在长期记忆方面的有效性。
查看缓存全文
缓存时间: 2026/05/26 07:05
这个周末跑了我的第一个基准测试(longmemeval),主要是为了测试ActiveGraph,学到了很多!
- 这是一块垫脚石,证明基于事件的智能体系统是可行的。AI说服了我,让我不要一开始就做事实/实体的图提取
- 学会了一件事:跑基准测试真的很耗时间
- 对好基准测试和差基准测试的理解更深了(我觉得这个挺全面的)
- 全可复现的开源仓库和测试
- ActiveGraph似乎很适合这个场景,表现很扎实,算是个不错的开头
这里没做提取,只是作为第一次测试做了确定性摄取
目前只是研究阶段,但我也在用 @intelligenceco 测试联合创始人系统,它负责处理网站/Newsletter/博客,给项目加点润色还挺有意思的
Awesome
太酷了,请一定去试试!我只有周末能动这个,所以很希望看到其他人能推得更快一些
相似文章
@yoheinakajima: ActiveGraph: 一个月进展: 论文#1: 日志即代理 3个LongMemEval实验 论文#2: 机制、自我改进循环…
ActiveGraph宣布了两篇关于代理记忆(LongMemEval)和自我改进机制的新论文,并提供了参考代理、包模板以及即将在西雅图和旧金山举行的聚会。
在 LongMemEval-S 上对智能体记忆检索进行基准测试 — Recall@5 达 98%,R@23 实现 100% 召回,仅依赖本地嵌入模型 (all-MiniLM-L6-v2),无需 LLM 与 API Key
作者分享了用于智能体记忆的 Python 库 memweave 的基准测试结果,该库仅使用本地嵌入且无需调用 LLM,便在 LongMemEval-S 上实现了 98% 的 Recall@5。本文详细介绍了实现方法,并与 mempalace 进行了性能对比,突出了其在不同问题类型上稳定的检索表现。
LongMemEval-V2:评估长期智能体记忆,迈向经验丰富的同事
本文介绍了 LongMemEval-V2,这是一个用于评估 Web 智能体长期记忆系统的基准,同时提出了两种记忆方法:AgentRunbook-R 和 AgentRunbook-C。
@yoheinakajima: 我知道顺序是反的,但实验#2:
在我们的第二次longmemeval实验中,我们引入了基于ActiveGraph运行时的语义摄取到召回中,通过LLM摄取将平面/智能体检索的召回率从60.6%提升到83.4%/84.8%。
@yoheinakajima: longmemeval 实验架构:1) 确定性摄取/提取(准确率85.6%,检索率86.2%)2) 语义摄取…
该推文分享了 LongMemEval 实验的结果,比较了确定性和语义摄取/提取方法,其中混合方法达到了 87.6% 的准确率和 90.0% 的检索率。