我们构建了一个用于智能体提示词的自动化QA/评估引擎。来帮我们测试一下吧!
摘要
构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。
还有人困在“猜测循环”里吗?你改了一个词,读了几条回复,然后祈祷它有效。但没有数字,没有证据,也没有办法知道你是否在不知不觉中降低了其他十几个任务的输出质量。我厌倦了这一点,所以我的团队构建了Baseline。它基本上把你的AI智能体提示词当作需要真正回归测试的软件,但不需要任何代码或工程师的时间。以下是附加视频中它的工作原理分解:定义什么是“好”。你编写一个简单语言的评分标准,按对你的智能体最重要的部分(比如准确性、语气和解决方案)加权。优化引擎:Baseline为你调整提示词。它会自动在你的评估数据集上运行你的提示词,评分,重写指令,并重新评分,直到找到获胜版本。质量有据可查:引擎可以在你喝咖啡的时间里将输出分数从0.62的基线一路提升到0.94的优化状态。我们现在正在进行有限公测,以从那些正在积极构建和突破AI智能体的人那里获取反馈。查看评论区链接。如果你想测试它,私信我,我会给你发送一个解锁30天免费试用的访问码。我们需要其他人和测试者的参与。欢迎任何反馈!
相似文章
@Sumanth_077:别再手动测试和重写提示词了!大多数团队运行评估、查看失败、猜测问题、重写提示词……
DeepEval引入了一种使用遗传算法对提示词进行进化优化的方法,允许基于评估反馈和多目标优化自动重写。
团队如何大规模处理提示词质量保障?
一位处理约4万次对话/月的公司从业者描述了手动提示词质量保障的瓶颈,并询问团队如何利用自动化系统在生产中检测回归问题和用户挫败感。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
你的AI智能体只需一个糟糕的提示就能毁掉你的品牌(以及为什么传统QA毫无用处)
文章认为传统的聊天机器人QA是有缺陷的,因为它只测试了理想路径(happy path),并提出使用AI驱动的用户模拟器,通过多样化的角色和边缘案例来攻击机器人,在部署前发现漏洞。
测试一个智能体技能:将提示转化为音频课程并发布到Spotify
作者描述了测试一个智能体工作流程,该流程将提示转化为音频课程以发布到Spotify,潜在用途包括会议简报、团队更新和学习笔记。