我们构建了一个用于智能体提示词的自动化QA/评估引擎。来帮我们测试一下吧!

Reddit r/AI_Agents 工具

摘要

构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。

还有人困在“猜测循环”里吗?你改了一个词,读了几条回复,然后祈祷它有效。但没有数字,没有证据,也没有办法知道你是否在不知不觉中降低了其他十几个任务的输出质量。我厌倦了这一点,所以我的团队构建了Baseline。它基本上把你的AI智能体提示词当作需要真正回归测试的软件,但不需要任何代码或工程师的时间。以下是附加视频中它的工作原理分解:定义什么是“好”。你编写一个简单语言的评分标准,按对你的智能体最重要的部分(比如准确性、语气和解决方案)加权。优化引擎:Baseline为你调整提示词。它会自动在你的评估数据集上运行你的提示词,评分,重写指令,并重新评分,直到找到获胜版本。质量有据可查:引擎可以在你喝咖啡的时间里将输出分数从0.62的基线一路提升到0.94的优化状态。我们现在正在进行有限公测,以从那些正在积极构建和突破AI智能体的人那里获取反馈。查看评论区链接。如果你想测试它,私信我,我会给你发送一个解锁30天免费试用的访问码。我们需要其他人和测试者的参与。欢迎任何反馈!
查看原文

相似文章

团队如何大规模处理提示词质量保障?

Reddit r/AI_Agents

一位处理约4万次对话/月的公司从业者描述了手动提示词质量保障的瓶颈,并询问团队如何利用自动化系统在生产中检测回归问题和用户挫败感。

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。