围绕GPT-3.5 Turbo构建代理框架所教会我的:每一个修复都是代码,而非提示
摘要
作者分享了为GPT-3.5 Turbo构建代理框架的见解,强调基于代码的验证和防护措施对于可靠的AI代理性能至关重要。
我在AI Engineer Europe上做了一场关于代理框架的演讲,现场演示教会我的比幻灯片还多,所以这里简要说明。任务:代理使用Playwright驱动真实浏览器,并在Hacker News上给头条新闻点赞。我特意使用了GPT-3.5 Turbo,并设置了一条规则:提示永不改变。一个基础代理循环。它点击了点赞,遇到了登录墙,但仍然报告成功。循环在模型说完成时结束,所以它就"完成"了。防护措施。最大迭代次数和最大消息数,加上非常基础的上下文修剪(保留系统提示和任务,丢弃中间部分)。这没有修复任何问题,但它限制了损害。一个确定性验证步骤,加上重试。每次尝试后,普通代码读取工具调用跟踪并检查点赞是否实际发生,最多3次尝试。它仍然失败了,但它停止了撒谎。框架中的一个登录处理器。在每个步骤之前,框架检查浏览器URL。在登录页面上,它从模型看不到的环境变量中填充凭据,然后告诉模型已登录。它在6次迭代中成功了。我的收获:模型说完完成只是一个声明,不是证据。用代码验证它。将密钥和脆弱的确定性步骤放在框架中,而不是提示中。框架不是代理循环。它是循环周围的一切,有时甚至是循环周围的循环。你们如何处理验证?你们在代码中检查完成情况,还是交给第二个模型?免责声明:我完整地写出了这个,包括每个步骤的代码。链接在评论中,按照子版块规则。
相似文章
构建智能体让我明白,模型很少是问题所在。你有哪些来之不易的教训?
一位开发者分享了构建AI智能体的来之不易的教训:优先关注工具设计而非模型选择,使用小循环而非大型提示,记录智能体上下文,尽早添加防护措施,以及创建小型评估来捕捉错误。
@eyad_khrais: https://x.com/eyad_khrais/status/2069552027382980882
一份构建 AI 代理框架的全面指南,涵盖工具执行、上下文管理、状态/记忆和护栏,基于构建 Claude Code 和其他企业级框架的经验。
你的 AI Agent 没坏,是你的控制框架没配好。来看看我是如何搭建这套系统,让它从“累赘”转变为能交付生产级代码的。
本文指出,AI 编程智能体的失败源于系统设计不佳,而非模型能力限制。文章提出了一套包含知识、护栏和反馈循环的三层“控制框架”,以可靠地交付生产级代码。
@omarsar0: 构建并拥有你的工具,各位。很少有人理解定制和优化智能体工具背后的魔力…
该推文强调构建自定义AI智能体工具以优化性能,提到了Pi的应用,并讨论了自我改进算法和本地模型,以实现更好的控制和效率。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057153343081111582
UIUC、Meta和斯坦福大学联合发布的一份100页调查报告引入了人工智能代理的三个 harness 层(接口、机制、Scaling),认为大多数代理失败源于 harness 问题而非推理缺陷,并提供了一个用于审计代理堆栈的分类体系。