批评循环 vs 零样本
摘要
作者认为,在一个使用18个代理和Claude 5.0 Opus构建的Three.JS项目中,使用多个代理而不采用批评循环可能比批评循环更高效,同时指出令牌预算问题。
是的,这完全是纯Three.JS,没有外部资产。这主要是零样本工作,但我确实做了一个小修正提示(它留下了一些大的建筑物空隙,并且一条路径被阻塞了)。编辑:实际上我更正一下,这是一个'单次通过',不是'零样本'。我在想这个:人们是否可能在'批评循环'上浪费时间和金钱,而实际上,代理就是你需要的一切。这是用18个代理完成的,每个代理都处理非常具体的任务。零批评循环。如果Claude只用3-4个代理尝试这个,我猜它会产生差得多的结果,然后QA代理会给出一些不完美的推荐,可能不会像我这里得到的这么好。但最重要的是,QA代理永远不会打败真正的人类测试员。所以,对我来说,让人类来做批评循环感觉更优化。另一个问题是,18个代理运行24小时会烧掉任何人的令牌预算哈哈。这是用Claude 5.0 Opus完成的。
相似文章
你的智能体可能不需要更好的模型,它需要一个更好的循环。
使用Claude Opus 4.8比较智能体运行时的实验表明,运行时效率对性能和成本的影响大于模型本身,强调了AI智能体中更好循环的必要性。TrueForge被突出为一个有用的开源工具,用于检查和优化运行时。
编程代理的最佳编程语言是什么?
Dan Luu 对现有基准测试提出批评,这些测试声称动态语言对编程代理的 token 效率更高。他认为,琐碎的问题和有缺陷的评估使这些结论不可靠。
@ItsRoboki: /loop 和 /goal 并不验证你的工作。它们只会放大你给予它们的验证。真正的问题在于:智能体……
对 AI 智能体循环持续运行而不进行推理的批评,建议智能体应定期暂停,分析失败原因并提出理论后再重试。
我不再根据这些AI代理在演示中的表现来评判它们,而是开始统计它们帮我关闭了多少未闭合的循环。
作者认为,衡量AI代理实用性的真正标准是它自主关闭了多少未闭合的循环,而不是演示性能或集成数量,并引用Runner作为一个桌面工具,通过跨应用上下文有效关闭这些循环。
"在什么情况下添加另一个代理实际上会损害您的系统?问这个是因为我的6代理流水线比旧的2代理流水线更慢且更不可靠"
一位开发者分享了使用AI编排框架(LangGraph, CrewAI, AutoGen)的真实体验,指出了原型设计便捷性与生产可靠性之间的权衡,并向社区询问如何处理失败、人机协同和Token成本问题。