我的内存基准测试接近完成,正在寻找公司和开发者帮助从这里构建它
摘要
一个名为Glasshouse的接近完成的内存基准测试工具正在开发中,具有公开的规则和结构,寻求社区贡献以构建基准文件并确保公平评估。
之前在这里发布过关于我一直在构建的内存基准测试的内容。快速更新一下,目前基本上接近完成。仓库链接在评论中,名为Glasshouse。目前还没有实际的基准文件,只有到目前为止编写的规则和结构。未来,基准本身将通过这里的PR持续构建。评判标准、提示和每个问题的日志都是公开的,因此没有人必须仅仅相信一个数字,并且有关于提交和更改如何被接受的规则,以保持公平,而不是由一方决定一切。完全公开,我在Wontopos工作,我们构建内存API,所以我在这里也有利益相关。如果有公司想与我们合作构建这个,请留言或私信我。如果你是开发者,提交PR或仅仅表示兴趣都会被感激。
相似文章
屡见内存基准测试的吐槽,我动手做了一个。Glasshouse v0.1 正式推出
Glasshouse v0.1 是一款内存基准测试工具,旨在解决现有 AI 内存基准测试的痛点,支持多语言、多种对话长度,并在多个维度上进行细致评估。
@witcheer: 社区中有人对 Hermes Agent 的七个可自托管记忆提供者进行了真实基准测试,每个都输入了……
一位社区成员对 Hermes Agent 的七个可自托管记忆提供者进行了基准测试,使用 71,060 轮对话和 3,750 个关于随时间变化的事实的问题对每个提供者进行测试;完整结果和 GitHub 仓库见帖内。
我为编码智能体的“记忆”构建了一个基准测试,期待他人来挑战它
开发者创建了一个名为 continuity-benchmarks 的新基准测试,用于测试 AI 编码智能体在活跃开发过程中保持与项目规则一致性的能力,解决了现有记忆基准测试的空白——这些测试侧重于语义回忆而非实时架构一致性和多会话行为。
有人注意到记忆API的基准测试数据不一致吗?
这篇文章质疑了像Mem0和Zep这样的记忆API基准测试分数的可靠性,指出在LoCoMo基准测试中,自报数据与第三方数据存在显著差异,暗示这些指标可能更多是营销手段而非准确比较。
要满足什么条件,你才会信任记忆基准测试的数字?
作者批评了LLM记忆基准测试的可靠性,指出了诸如LoCoMo中错误黄金答案以及评分指标不一致导致巨大分数差距等问题。他们质疑从业者是否信任这些数字,并讨论了最近的改进,如LongMemEval的知识更新问题。