Revalvo
摘要
Revalvo 是一个本地优先的工作台,用于提示工程和大语言模型评估,它允许并行运行多个模型的提示,对响应进行评分,对提示进行版本控制,并批量测试数据集。
<p>
同时在所有模型上运行提示。评分。版本控制。发布。
</p>
<p>
<a href="https://www.producthunt.com/products/revalvo?utm_campaign=producthunt-atom-posts-feed&utm_medium=rss-feed&utm_source=producthunt-atom-posts-feed">讨论</a>
|
<a href="https://www.producthunt.com/r/p/1234626?app_id=339">链接</a>
</p>
查看缓存全文
缓存时间: 2026/08/28 07:35
# Revalvo:一次性运行所有模型提示词,评分、版本管理、一键部署 | Product Hunt
来源:https://www.producthunt.com/products/revalvo
Revalvo 是一个本地优先的提示词工程与大语言模型评估工作台。你可以在同一环境中并行测试所有模型的响应效果,使用40种内置评估器进行打分,像管理代码一样版本化提示词,并在真实数据集上进行批量测试——所有流程均在部署前完成。无需账户,无需云端数据库:你的API密钥始终保留在浏览器中。
相似文章
smevals (GitHub Repo)
smevals is an open-source framework for running evals against small and large models, with a structured vocabulary for tasks, configs, runs, and graders, plus a CLI for execution and grading.
@kapicode: 我一直在使用 Claude 作为“人类”来提示 @opencode 以重建参考项目,在同一测试平台上评估了四款 LLM…
一项针对四款大语言模型(Qwen、MiniMax、GLM)的评估显示,当使用 Claude 作为 Opencode 智能体工具的提示器时,一个较小的本地模型(运行在 3090 显卡上的 Qwen 27B)在代码质量与可靠性方面表现优于更大的剪枝模型。
smevals - 一个用于评估模型、提示词和测试框架的小型评估套件
Simon Willison 介绍了 smevals,这是 Prime Radiant 开发的一个小型评估套件,用于评估模型、提示词和测试框架,提供运行评估、评分结果以及提供静态 HTML 报告的指令。
RECAP:面向提示持续适应性的回归评估基准
介绍了RECAP,一个用于在主动适应场景下评估提示持续学习能力的基准。结果表明,现有提示优化方法在该场景下表现不佳,亟需新方法。
我们构建了一个用于智能体提示词的自动化QA/评估引擎。来帮我们测试一下吧!
构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。