agent-testing

标签

Cards List
#agent-testing

在发布变更之前,你是如何测试智能体的?

Reddit r/AI_Agents ↗ · 2026-09-08

作者介绍了一种智能体回归测试工具,帮助开发人员在代码变更后验证工具调用及工作流执行结果。

0 人收藏 0 人点赞
#agent-testing

观察到智能体在生产环境实时Webhook中静默失败后,我们构建了自己的工具

Reddit r/AI_Agents ↗ · 2026-09-01

文章描述了构建FetchSandbox,这是一个为AI智能体提供真实测试环境的工具,通过模拟实际服务提供商的响应来防止实时生产环境中的失败。

0 人收藏 0 人点赞
#agent-testing

在智能体获得真实权限之前,你实际的上线/不上线标准是什么?

Reddit r/AI_Agents ↗ · 2026-08-05

对AI智能体获得真实生产权限后上线标准的分析,提出绿/黄/红状态系统,并认为无论平均成功率如何,严重失败都应阻止发布。

0 人收藏 0 人点赞
#agent-testing

发布了一个针对其他模型拒绝执行的代理测试工作进行调优的模型。AgentDojo 实用率 97.5%。

Reddit r/AI_Agents ↗ · 2026-07-25

基于 GLM-5.2 的微调模型,经过 abliterated 处理,专门用于代理测试和 red teaming,在 AgentDojo 上实现了 97.5% 的正常实用率,并在强大的编码基准测试中表现优异。

0 人收藏 0 人点赞
#agent-testing

不可能测试自己的智能体。我试过了,失败了。

Reddit r/AI_Agents ↗ · 2026-07-22

一位开发者亲身讲述客观评估自己AI智能体性能的困难,强调了自我测试的陷阱以及意外真实世界基准的价值。

0 人收藏 0 人点赞
#agent-testing

@bnicholehopkins: 今天上午我们的A轮融资公告获得了巨大支持,令我非常感动,包括Chris Metinko的精彩报道……

X AI KOLs Following ↗ · 2026-06-24 缓存

Coval宣布完成A轮融资,旨在构建用于测试和部署企业对话式AI代理的基础设施,其灵感来自自动驾驶测试的严谨性。

0 人收藏 0 人点赞
#agent-testing

在部署之前,你们是如何测试智能体的?还是大家都在生产环境中凭感觉检查?

Reddit r/AI_Agents ↗ · 2026-06-24

关于测试非确定性AI智能体挑战的讨论,质疑开发者如何在没有传统测试模式的情况下验证工具使用、行为和多步骤工作流。

0 人收藏 0 人点赞
#agent-testing

当智能体框架一半是非确定性的,你如何实际测试它?

Reddit r/AI_Agents ↗ · 2026-06-16

关于测试包含非确定性组件的AI智能体框架所面临的挑战的讨论,探讨了黄金输出差异比较和使用LLM作为评判者等方法,同时质疑这些方法的有效性。

0 人收藏 0 人点赞
#agent-testing

我需要一个容易陷入循环的模型。

Reddit r/LocalLLaMA ↗ · 2026-06-14

一位开发者寻找一个经常陷入循环的模型(如GLM Flash),以测试智能体的循环检测与恢复功能,旨在开发启发式算法来评估循环概率并实现回溯。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈