为AI代理构建性能分析引导优化
摘要
作者正在开发Agent-PGO,这是一个工具,可以分析AI代理的执行,动态地为不太关键的任务替换更便宜的模型,同时通过评估基准保持质量。
在代理系统中,我经常看到一个模式,即模型选择大多是静态的。你为代理选择一个强大的模型,可能手动降低几个步骤,并希望成本/质量权衡在生产中保持。我正在围绕不同的方法构建Agent-PGO。它在节点级别分析实际执行,测量成本和延迟实际发生在哪里,然后针对评估套件测试更便宜的模型替换。只有保持在明确的质量范围内,替换才能保留。所以,像格式化器或提取器这样的东西可能会转向更便宜的模型,而推理密集型节点则保留在更强大的模型上。有趣的部分不是找到最便宜的模型,而是找到仍然通过工作负载的最便宜的执行计划。着陆页和优化工作室现在正在工作。后端V1目前正在构建中。当它变得可用时,我将分享分析/优化器设计和真实基准测试结果。
相似文章
Go 中的性能剖析引导优化
Daniel Lemire 对 Go 中的性能剖析引导优化(PGO)进行了基准测试,显示在解析 JSON 时速度提升约为 2-5%,当训练 profile 与工作负载匹配时效果最佳。
PGPO:面向多轮智能体任务的势引导策略优化
PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2069064122218717387
本文探讨了AI代理如何利用微软研究院的SkillOpt等技术自动编写和优化其技能文件,该技术将技能文档视为可训练状态,并带来显著的性能提升。文章还解决了手动技能调优的挑战,并介绍了GEPA和EvoSkill等进化方法的框架。
CP-Agent:一种用于反馈驱动型竞赛编程的校准风险控制代理
CP-Agent 提出了一种借助大型语言模型的校准风险控制方法,用于反馈驱动型竞赛编程,无需参数更新即可在基准测试上取得显著改进。
将生产级AI代理迁移至GPT-5.6:速度提升2.2倍,成本降低27%
Ploy的生产级AI代理从Claude Opus迁移到了OpenAI的GPT-5.6 Sol,实现了2.2倍的执行速度提升和27%的成本降低,同时保持质量,详细介绍了迁移过程和评估修复。