屡见内存基准测试的吐槽,我动手做了一个。Glasshouse v0.1 正式推出

Reddit r/AI_Agents 工具

摘要

Glasshouse v0.1 是一款内存基准测试工具,旨在解决现有 AI 内存基准测试的痛点,支持多语言、多种对话长度,并在多个维度上进行细致评估。

我之前在这里发过几次关于我正在构建的内存基准测试的帖子。起因是浏览开发者社区时,我不断看到人们提出内存基准测试的相同问题:厂商公布的数据与其他人测量的结果不符,并且更换评分模型对结果的影响甚至超过了被比较系统之间的差距。上次代码库只有规则和结构,没有实际的基准测试。现在情况已改变。Glasshouse v0.1 现已上线,包含实际文件,链接在评论区。为未看过之前帖子的快速概览:包含 2,847 个问题,对话长达 197 万 token,支持 10 种语言,并配有 50 张图片。对话有四种规模,从 1,882 轮到 103,572 轮,其中答案部分在所有版本中相同,因此分数崩溃的位置能告诉你系统在历史记录累积时是否能保持稳定。每个轴单独报告,没有单一的头条数字,因为一个系统可能在某个轴上表现出色,而在另一个轴上无用。它还超越了简单的回忆。如果事实发生变化而系统找不到新值,说“我不知道”比自信地给出旧值得分更高。如果两个存储的事实不一致且无法确定,说它们不一致是正确答案。如果某事从未被提及,它会检查系统是否正确指出这一点。其中一些直接来自本 sub 的用户,他们在代码库中被具名致谢,同时注明了每条建议的实现成果。提交记录目前为空,我们自己也尚未提交任何内容,因此在此我需要帮助。如果您运行后发现任何问题,请提交 PR 或 issue,个人提交没有门槛。如果您来自公司并希望提交结果或被列入列表,相关说明在代码库中。
查看原文

相似文章

MemoBench:动态变化环境中世界建模的基准测试

Hugging Face Daily Papers

MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。