来了:Benchmark-Yourself 应用——与开源 LLM 竞争并获得分数——提供5个基准测试——将结果添加到简历或 LinkedIn(如果你敢的话)...或者直接粘贴到下面接受社区吐槽。

Reddit r/LocalLLaMA 工具

摘要

一个网络应用,允许用户将自己的表现与开源 LLM 在五个基准测试上进行对比,并可以选择将结果添加到简历或 LinkedIn。

[https://benchmark-yourself.streamlit.app/](https://benchmark-yourself.streamlit.app/) BBQ 就是🔥 * 规则4:限制自我推广——这不是自我推广 * 十分之一规则是一个好的指导:自我推广不应超过内容的10%。——我的内容高质量且多样化 * 必须披露关联:严禁刷互动,严禁“我发现了这个..”等。——我与 streamline 或 oMLX 或任何东西无关。
查看原文

相似文章

金融服务业LLM评估的元基准

arXiv cs.AI

本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。

移动智能体评估中的 LLM 评判器基准测试

arXiv cs.AI

本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。