@_philschmid: 在 @aiDotEngineer 世界博览会上,我做了一个演讲,主题是为什么凭感觉评估代理技能在生产中会失效,以及如何构建可靠的自动评估……
摘要
在 AI Engineer 世界博览会上,Phil Schmid 做了演讲,阐述了为什么凭感觉评估代理技能在生产中会失效,以及如何使用负面测试用例、技能限制和消融测试构建可靠的自动评估。
在 @aiDotEngineer 世界博览会上,我做了一个演讲,主题是为什么凭感觉评估代理技能在生产中会失效,以及如何在用户发现漏洞之前构建可靠的自动评估。我谈到了:
- 为什么模糊的描述会导致技能失败,以及如何添加负面测试用例来防止无关提示的关键词劫持
- 为什么超过500行的技能文件会降低模型推理能力
- 如何使用简单、毫秒级的正则表达式断言,在10到20个生产提示上验证结果
- 如何运行消融测试(有技能与无技能对比),以了解模型何时已经跟上,从而可以淘汰技能
查看下方完整演讲和资源:
查看缓存全文
缓存时间: 2026/07/20 21:37
在 @aiDotEngineer 世界博览会上,我发表了一场演讲,主题是关于为什么凭感觉检查代理技能在生产中会失效,以及如何在用户发现错误之前构建可靠的自动化评估。我谈到了以下内容:
- 为什么模糊的描述会导致技能失效,以及如何通过添加负面测试用例来防止无关提示的关键词劫持
- 为什么超过 500 行的技能文件会降低模型的推理能力
- 如何通过简单、毫秒级的正则表达式断言,针对 10 到 20 个生产提示来验证结果
- 如何运行消融测试(有技能 vs 无技能),以了解模型何时已跟上进度,从而可以淘汰技能
观看完整演讲和资源见下方:
相似文章
@_philschmid:本周在 @aiDotEngineer。我将谈论智能体和评估!你可以在 @GoogleDeepMind 展台或我的演讲中找到我。
Philipp Schmid 宣布他将参加 aiDotEngineer 大会,届时会讨论智能体和评估,并可以在 GoogleDeepMind 展台或演讲中找到他。
在部署之前,你们是如何测试智能体的?还是大家都在生产环境中凭感觉检查?
关于测试非确定性AI智能体挑战的讨论,质疑开发者如何在没有传统测试模式的情况下验证工具使用、行为和多步骤工作流。
@aiDotEngineer: !!!!
Paul Bakaus将在下周的@aiDotEngineer世界博览会上就高级代理技能工程发表两场演讲。
@ArizePhoenix:免费的两个小时评估工作坊!在AI Engineer: Europe会议上,开发者关系主管Laurie Voss主持了这场工作坊…
Arize Phoenix宣布在AI Engineer: Europe会议上举办免费的两小时评估工作坊,由开发者关系主管Laurie Voss主讲,内容包括手动数据检查以及内置与自定义评估。
停止让工程师对您的 AI Agent 进行“感觉测试”
作者介绍了一款开源的无代码工具,旨在让医疗和法律领域的非技术型主题专家能够评估 AI Agent,从而超越以开发者为中心的测试方法。