如何在模型版本更新时捕捉到悄无声息失效的提示词?

Reddit r/AI_Agents 新闻

摘要

本文讨论了识别模型更新后提示词退化的技术,例如使用固定的评估案例和模型测试矩阵,并询问了评估生产环境中AI代理的最佳实践。

我们的持续集成检查确保每个提示词模板在结构上是有效的:模式、变量以及一组必须失败的故障测试用例。但它无法捕捉到那些仍然通过但在新模型上悄无声息地产生更差输出的模板。我倾向于的方法是:为每个模板固定几个评估案例,建立一个每个模板实际测试过的模型矩阵,并在分数低于固定阈值时设置失败检查。对于在生产环境中运行代理的人:- 你是为每个提示词固定评估案例,还是评估整个代理运行?- 你如何评分自由文本输出而不让LLM评判者发生漂移?- 你在每次模型更新时重新运行评估,还是按计划进行?
查看原文

相似文章

AI代理从演示到生产会遇到哪些问题?

Reddit r/AI_Agents

本文讨论了AI代理从演示过渡到生产时面临的挑战,重点在于需要操作控制平面,提供幂等性、审批追踪和操作可解释性,而不仅仅是模型推理。