标签
一场讨论,比较了用于修复提示失败的LLM评估和可观测性工具(LangSmith、Weave、Phoenix、Braintrust、Galileo、Opik),并介绍了一个开源平台,该平台在单个跟踪上整合了从评估到修复的完整循环。
构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。
作者询问开发者如何对AI智能体工作流进行回归测试,指出了常见的故障模式,并分享了他们在Runme中添加评估支持的工作,用于记录任务、对轨迹进行评分以及与基准进行比较。
本文讨论了使基于LLM的代理更具确定性的各种技术,例如黄金数据集、护栏、共识机制、回归测试、编码逻辑和超参数调优,并询问其他成功的方法。
本文介绍了针对LLM代理的层隔离评估方法,将生产级代理分解为架构层,每层使用确定性无LLM测试框架进行测试。它展示了逐切片基线测试能够定位聚合指标所掩盖的性能回归,并通过跨多个租户的受控回归注入进行了验证。
replayd 是一个开源Python工具,它捕获失败的AI代理运行,并将其作为回归测试重放,以防止变更后回归再次出现。
一个名为Agent Fail Museum的档案库记录了反复出现的AI失败模式,并为提交的失败案例提供回归测试草案,旨在防止重复事故。
TesterArmy 是一个跨浏览器和设备测试网站和移动应用的QA工具,能够捕捉回归问题并从自然语言生成测试用例。