@ds3638: 评估已死。更准确地说:传统的评估驱动开发无法扩展。静态评估在…时是有用的
摘要
传统的评估驱动开发不适合长期运行的自主代理。可观测性驱动开发——结合严格的防护栏、生产轨迹收集和行为聚类——正在成为生产就绪AI系统的基础。
评估已死。更准确地说:传统的评估驱动开发无法扩展。静态评估在代理生命周期短、范围受限时曾有用,但一旦代理运行数小时、执行数千次动作并自主操作时,仅靠评估就不够了。此时,通过/失败过于粗糙。模拟无法覆盖生产环境中发生的许多情况,模型能力的迭代速度也超过了评估基础设施的跟进速度。我们转而采用:可观测性驱动开发。
- 部署时带严格的防护栏
- 收集生产轨迹
- 对行为进行聚类以发现模式+故障模式
- 将工作器专门化用于更窄的任务
- 调整阈值直到行为可靠地处于边界内
你能看到你的代理正在做什么吗?你能在漂移造成损害之前检测到它吗?这是我们构建AI系统的一个重要转变。评估仍然重要,但可观测性正在成为生产就绪代理的基础。感谢 Sunny Bakhda (@honeyhiveai 创始工程师) 在 @aicouncilconf 上的精彩演讲。
相似文章
为什么评估初创公司会失败(2025)
本文探讨了为何独立的人工智能评估初创公司很少能成功,原因包括人才流向技术栈中更有利可图的部分、客户群体狭窄,以及优化压力削弱了评估的效用。
@levie: 几乎所有AI模型和智能体的进步都源自评估。针对特定领域的开放权重后训练是……
几乎所有AI模型和智能体的进步都依赖于评估(evals)。通过评估理解工作流程和智能体性能将成为企业推动自动化的核心能力。
@OpenAI: 我们来聊聊评估。我们一直在寻找更好的方法来衡量和预测模型的进展,尤其是在基准测试...
OpenAI讨论了评估(evals)的重要性,用于衡量和预测模型进展,尤其是在基准测试变得饱和或被操纵的情况下,并邀请了Tejal Patwardhan和Andrew Mayne分享见解。
为何通过所有评估的智能体在真实生产流量下仍会漂移
AI智能体在通过评估后常因分布偏移和上游变更在生产环境中漂移;持续评估和实时监控可缓解此问题。
@djfarrelly: https://x.com/djfarrelly/status/2052779234234380479
本文主张,AI Agent 的开发应基于稳定的执行原语,而非会随新兴编排模式频繁更迭的僵化框架。文章强调,采用持久化步骤、持久状态、并行协调、事件驱动流程以及可观测性设计,可有效避免因最佳实践不断演进而付出的高昂重写代价。