屡见内存基准测试的吐槽,我动手做了一个。Glasshouse v0.1 正式推出
摘要
Glasshouse v0.1 是一款内存基准测试工具,旨在解决现有 AI 内存基准测试的痛点,支持多语言、多种对话长度,并在多个维度上进行细致评估。
我之前在这里发过几次关于我正在构建的内存基准测试的帖子。起因是浏览开发者社区时,我不断看到人们提出内存基准测试的相同问题:厂商公布的数据与其他人测量的结果不符,并且更换评分模型对结果的影响甚至超过了被比较系统之间的差距。上次代码库只有规则和结构,没有实际的基准测试。现在情况已改变。Glasshouse v0.1 现已上线,包含实际文件,链接在评论区。为未看过之前帖子的快速概览:包含 2,847 个问题,对话长达 197 万 token,支持 10 种语言,并配有 50 张图片。对话有四种规模,从 1,882 轮到 103,572 轮,其中答案部分在所有版本中相同,因此分数崩溃的位置能告诉你系统在历史记录累积时是否能保持稳定。每个轴单独报告,没有单一的头条数字,因为一个系统可能在某个轴上表现出色,而在另一个轴上无用。它还超越了简单的回忆。如果事实发生变化而系统找不到新值,说“我不知道”比自信地给出旧值得分更高。如果两个存储的事实不一致且无法确定,说它们不一致是正确答案。如果某事从未被提及,它会检查系统是否正确指出这一点。其中一些直接来自本 sub 的用户,他们在代码库中被具名致谢,同时注明了每条建议的实现成果。提交记录目前为空,我们自己也尚未提交任何内容,因此在此我需要帮助。如果您运行后发现任何问题,请提交 PR 或 issue,个人提交没有门槛。如果您来自公司并希望提交结果或被列入列表,相关说明在代码库中。
相似文章
我的内存基准测试接近完成,正在寻找公司和开发者帮助从这里构建它
一个名为Glasshouse的接近完成的内存基准测试工具正在开发中,具有公开的规则和结构,寻求社区贡献以构建基准文件并确保公平评估。
我为编码智能体的“记忆”构建了一个基准测试,期待他人来挑战它
开发者创建了一个名为 continuity-benchmarks 的新基准测试,用于测试 AI 编码智能体在活跃开发过程中保持与项目规则一致性的能力,解决了现有记忆基准测试的空白——这些测试侧重于语义回忆而非实时架构一致性和多会话行为。
@witcheer: 社区中有人对 Hermes Agent 的七个可自托管记忆提供者进行了真实基准测试,每个都输入了……
一位社区成员对 Hermes Agent 的七个可自托管记忆提供者进行了基准测试,使用 71,060 轮对话和 3,750 个关于随时间变化的事实的问题对每个提供者进行测试;完整结果和 GitHub 仓库见帖内。
AgentMemBench:评估对话式AI智能体长期记忆管理策略的系统性基准
AgentMemBench 是一个系统性基准,在三个数据集上评估对话式 AI 智能体的五种长期记忆管理策略,发现外部键值存储检索在质量上占优,但会带来更大的内存占用。
MemoBench:动态变化环境中世界建模的基准测试
MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。