我的内存基准测试接近完成,正在寻找公司和开发者帮助从这里构建它

Reddit r/AI_Agents 工具

摘要

一个名为Glasshouse的接近完成的内存基准测试工具正在开发中,具有公开的规则和结构,寻求社区贡献以构建基准文件并确保公平评估。

之前在这里发布过关于我一直在构建的内存基准测试的内容。快速更新一下,目前基本上接近完成。仓库链接在评论中,名为Glasshouse。目前还没有实际的基准文件,只有到目前为止编写的规则和结构。未来,基准本身将通过这里的PR持续构建。评判标准、提示和每个问题的日志都是公开的,因此没有人必须仅仅相信一个数字,并且有关于提交和更改如何被接受的规则,以保持公平,而不是由一方决定一切。完全公开,我在Wontopos工作,我们构建内存API,所以我在这里也有利益相关。如果有公司想与我们合作构建这个,请留言或私信我。如果你是开发者,提交PR或仅仅表示兴趣都会被感激。
查看原文

相似文章

有人注意到记忆API的基准测试数据不一致吗?

Reddit r/AI_Agents

这篇文章质疑了像Mem0和Zep这样的记忆API基准测试分数的可靠性,指出在LoCoMo基准测试中,自报数据与第三方数据存在显著差异,暗示这些指标可能更多是营销手段而非准确比较。

要满足什么条件,你才会信任记忆基准测试的数字?

Reddit r/AI_Agents

作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。