regression-testing

标签

Cards List
#regression-testing

你们是如何在评估失败后,得到一个能在生产环境中保持稳定的提示修复的?

Reddit r/AI_Agents · 2026-07-20

一场讨论,比较了用于修复提示失败的LLM评估和可观测性工具(LangSmith、Weave、Phoenix、Braintrust、Galileo、Opik),并介绍了一个开源平台,该平台在单个跟踪上整合了从评估到修复的完整循环。

0 人收藏 0 人点赞
#regression-testing

我们构建了一个用于智能体提示词的自动化QA/评估引擎。来帮我们测试一下吧!

Reddit r/AI_Agents · 2026-07-10

构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。

0 人收藏 0 人点赞
#regression-testing

在用户发现故障之前,你如何对智能体工作流进行回归测试?

Reddit r/AI_Agents · 2026-07-06

作者询问开发者如何对AI智能体工作流进行回归测试,指出了常见的故障模式,并分享了他们在Runme中添加评估支持的工作,用于记录任务、对轨迹进行评分以及与基准进行比较。

0 人收藏 0 人点赞
#regression-testing

尽可能使代理具有确定性的最佳尝试

Reddit r/AI_Agents · 2026-06-29

本文讨论了使基于LLM的代理更具确定性的各种技术,例如黄金数据集、护栏、共识机制、回归测试、编码逻辑和超参数调优,并询问其他成功的方法。

0 人收藏 0 人点赞
#regression-testing

层隔离评估:基于无LLM、回归锁定的测试框架对生产级LLM代理的确定性骨架进行门控

arXiv cs.CL · 2026-06-11 缓存

本文介绍了针对LLM代理的层隔离评估方法,将生产级代理分解为架构层,每层使用确定性无LLM测试框架进行测试。它展示了逐切片基线测试能够定位聚合指标所掩盖的性能回归,并通过跨多个租户的受控回归注入进行了验证。

0 人收藏 0 人点赞
#regression-testing

构建了一个小型开源工具,防止AI代理在变更后出现回归

Reddit r/artificial · 2026-05-31 缓存

replayd 是一个开源Python工具,它捕获失败的AI代理运行,并将其作为回归测试重放,以防止变更后回归再次出现。

0 人收藏 0 人点赞
#regression-testing

我们构建了一个公开的AI失败模式档案。那些在变更后反复重现的模式。

Reddit r/artificial · 2026-05-29

一个名为Agent Fail Museum的档案库记录了反复出现的AI失败模式,并为提交的失败案例提供回归测试草案,旨在防止重复事故。

0 人收藏 0 人点赞
#regression-testing

@ycombinator: TesterArmy 是最简单的对网站或移动应用进行质量保证的方式。它跨浏览器和设备运行真实测试,捕获…

X AI KOLs Following · 2026-05-26 缓存

TesterArmy 是一个跨浏览器和设备测试网站和移动应用的QA工具,能够捕捉回归问题并从自然语言生成测试用例。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈