smevals - 一个用于评估模型、提示词和测试框架的小型评估套件

Simon Willison's Blog 工具

摘要

Simon Willison 介绍了 smevals,这是 Prime Radiant 开发的一个小型评估套件,用于评估模型、提示词和测试框架,提供运行评估、评分结果以及提供静态 HTML 报告的指令。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/31 21:55

# smevals——一个用于评估模型、提示词和测试工具的小型评估套件 来源:https://simonwillison.net/2026/Jul/31/smevals/ 2026年7月31日 - Link Blog **smevals——一个用于评估模型、提示词和测试工具的小型评估套件(https://primeradiant.com/blog/2026/smevals.html)。** 我一直在与 Jesse Vincent 的 Prime Radiant(https://primeradiant.com/)应用 AI 研究实验室合作,构建这个评估框架,以帮助回答关于不同模型能力的问题。 其成果是 **smevals(https://github.com/prime-radiant-inc/smevals)**,这是一个新工具,用于在不同模型配置上运行小型评估套件并对结果进行评分。 这篇博客文章详细描述了该工具。以下是 10 秒版本: 1. 告诉你的编程智能体运行 `run uvx smevals docs` 来了解该工具(这会输出 README,https://github.com/prime-radiant-inc/smevals/blob/main/README.md) 2. 然后让它为你构建一个评估套件 一旦你创建了一个评估——其形式是一个包含若干 YAML 文件的目录——你就可以像这样针对模型运行它: ``` uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6 ``` 运行与评分操作是分开处理的——你可以使用以下命令根据你定义的检查项对运行结果进行评分: ``` uvx smevals grade path-to-eval/ ``` 然后你可以运行一个 localhost Web 服务器来查看结果: ``` uvx smevals serve path-to-eval/ ``` 或者运行 `smevals build` 命令,将该报告构建为静态 HTML,之后你可以将其托管在任何地方。这里有一个示例(https://static.simonwillison.net/static/2026/smevals-haiku-build/#/haiku),展示了我构建的一个用于评估模型俳句写作能力的评估套件。 这是一个俳句写作基准的评估仪表盘截图,测试模型能否用恰好三行非空内容进行回复。顶部标题描述了该评估,下方面板显示了一个按分数排名的三位 GPT 模型排行榜、最近运行和最近评分的列表、标签通过率、两个被测试的俳句提示词,以及所用评分器的详细信息(通过阈值为 0.8)。 多年来,我一直在尝试找到一种我喜欢的评估方法。`smevals` 是我对这个想法的第三次迭代,对我来说感觉恰到好处。我期待未来进一步扩展它,并将其用到我自己的一些项目上。

相似文章

olmo-eval:模型开发循环的评估工作台

Hugging Face Blog

olmo-eval 是 AI2 推出的开源评估工作台,基于 OLMES 构建,支持迭代式模型开发循环,提供灵活的基准配置、代理评估和统计分析工具。