代理评估延迟使CI增加了18分钟。你们是如何在不破坏开发效率的情况下运行它的?

Reddit r/AI_Agents 新闻

摘要

讨论将全面代理评估集成到CI中的挑战,其中评估调用的延迟将构建时间从6分钟增加到24分钟,并考虑了并行化、缓存和异步评估等潜在解决方案。

代理 + langgraph + ~7个工具。将全面评估作为阻塞门禁添加到CI中。p99构建时间从6分钟跃升至24分钟。评估调用占主导地位(约200个场景 × 2个样本)。工程师们批量提交变更以绕过门禁。完全破坏了持续交付。尝试过:并行化评估调用(5倍加速,存在429风险);对未变更场景进行语义缓存(约60%命中率,缓存失效问题);PR上轻量评估,夜间全量评估;部署后异步评估搭配金丝雀回滚。倾向于方案4,但担心执行动作的代理短暂发布故障状态。人们是如何组织这个流程的?
查看原文

相似文章