smevals - 一个用于评估模型、提示词和测试框架的小型评估套件
摘要
Simon Willison 介绍了 smevals,这是 Prime Radiant 开发的一个小型评估套件,用于评估模型、提示词和测试框架,提供运行评估、评分结果以及提供静态 HTML 报告的指令。
暂无内容
查看缓存全文
缓存时间: 2026/07/31 21:55
# smevals——一个用于评估模型、提示词和测试工具的小型评估套件
来源:https://simonwillison.net/2026/Jul/31/smevals/
2026年7月31日 - Link Blog
**smevals——一个用于评估模型、提示词和测试工具的小型评估套件(https://primeradiant.com/blog/2026/smevals.html)。** 我一直在与 Jesse Vincent 的 Prime Radiant(https://primeradiant.com/)应用 AI 研究实验室合作,构建这个评估框架,以帮助回答关于不同模型能力的问题。
其成果是 **smevals(https://github.com/prime-radiant-inc/smevals)**,这是一个新工具,用于在不同模型配置上运行小型评估套件并对结果进行评分。
这篇博客文章详细描述了该工具。以下是 10 秒版本:
1. 告诉你的编程智能体运行 `run uvx smevals docs` 来了解该工具(这会输出 README,https://github.com/prime-radiant-inc/smevals/blob/main/README.md)
2. 然后让它为你构建一个评估套件
一旦你创建了一个评估——其形式是一个包含若干 YAML 文件的目录——你就可以像这样针对模型运行它:
```
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6
```
运行与评分操作是分开处理的——你可以使用以下命令根据你定义的检查项对运行结果进行评分:
```
uvx smevals grade path-to-eval/
```
然后你可以运行一个 localhost Web 服务器来查看结果:
```
uvx smevals serve path-to-eval/
```
或者运行 `smevals build` 命令,将该报告构建为静态 HTML,之后你可以将其托管在任何地方。这里有一个示例(https://static.simonwillison.net/static/2026/smevals-haiku-build/#/haiku),展示了我构建的一个用于评估模型俳句写作能力的评估套件。
这是一个俳句写作基准的评估仪表盘截图,测试模型能否用恰好三行非空内容进行回复。顶部标题描述了该评估,下方面板显示了一个按分数排名的三位 GPT 模型排行榜、最近运行和最近评分的列表、标签通过率、两个被测试的俳句提示词,以及所用评分器的详细信息(通过阈值为 0.8)。
多年来,我一直在尝试找到一种我喜欢的评估方法。`smevals` 是我对这个想法的第三次迭代,对我来说感觉恰到好处。我期待未来进一步扩展它,并将其用到我自己的一些项目上。
相似文章
olmo-eval:模型开发循环的评估工作台
olmo-eval 是 AI2 推出的开源评估工作台,基于 OLMES 构建,支持迭代式模型开发循环,提供灵活的基准配置、代理评估和统计分析工具。
Every Eval Ever:统一AI评估结果的架构与社区存储库
介绍 Every Eval Ever,一个用于标准化AI评估结果的共享架构和社区众包存储库,提供自动转换器和托管数据库,涵盖超过22,000个模型和2,200个基准。
迈向评估工程:对现实环境中机器学习评估框架的实证研究
本文对57个机器学习评估框架进行了实证研究,识别了五个工作阶段中常见的操作挑战及其根本原因,并主张将评估工程作为一个独立的软件工程关注点。
超越评分准则:面向奖励建模的探索引导评估技能
Eval-Skill 是一种探索引导方法,可合成为奖励建模的可复用评估技能,在 RewardBench 2 上相比现有骨干模型取得了显著提升。
在Hugging Face模型页面上展示Every Eval Ever的所有结果
Every Eval Ever (EEE) 与 Hugging Face Community Evals 现已互操作,允许将 AI 评估结果标准化地交叉发布到模型页面,提升信任度和可比性。