来了:Benchmark-Yourself 应用——与开源 LLM 竞争并获得分数——提供5个基准测试——将结果添加到简历或 LinkedIn(如果你敢的话)...或者直接粘贴到下面接受社区吐槽。
摘要
一个网络应用,允许用户将自己的表现与开源 LLM 在五个基准测试上进行对比,并可以选择将结果添加到简历或 LinkedIn。
[https://benchmark-yourself.streamlit.app/](https://benchmark-yourself.streamlit.app/) BBQ 就是🔥 * 规则4:限制自我推广——这不是自我推广 * 十分之一规则是一个好的指导:自我推广不应超过内容的10%。——我的内容高质量且多样化 * 必须披露关联:严禁刷互动,严禁“我发现了这个..”等。——我与 streamline 或 oMLX 或任何东西无关。
相似文章
Homebench – 基准测试本地LLM的速度、内存和质量
Homebench 是一款零配置终端工具,可对本地运行的LLM进行速度、内存和质量的基准测试,并提供实时排行榜。它支持 Ollama、LM Studio、llama.cpp、vLLM 以及兼容 OpenAI 的服务器。
开源LLM基准测试每4小时运行147个编码任务,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测。好奇大家对这种方法的看法。
一个包含147个编码任务的开源LLM基准测试每4小时运行一次,采用5次试验中位数及95%置信区间,并使用CUSUM进行变点检测,引发了对其方法的讨论。
@ms_aifrontiers: 大多数LLM基准测试得分在运行之前即可预测。MS AI Frontiers团队新作:BenchPress。……
MS AI Frontiers团队推出了BenchPress,该方法利用矩阵补全技术,仅通过五个探针即可预测LLM基准测试得分,表明得分矩阵实际上为秩2。
金融服务业LLM评估的元基准
本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。
移动智能体评估中的 LLM 评判器基准测试
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。