批评循环 vs 零样本

Reddit r/singularity 新闻

摘要

作者认为,在一个使用18个代理和Claude 5.0 Opus构建的Three.JS项目中,使用多个代理而不采用批评循环可能比批评循环更高效,同时指出令牌预算问题。

是的,这完全是纯Three.JS,没有外部资产。这主要是零样本工作,但我确实做了一个小修正提示(它留下了一些大的建筑物空隙,并且一条路径被阻塞了)。编辑:实际上我更正一下,这是一个'单次通过',不是'零样本'。我在想这个:人们是否可能在'批评循环'上浪费时间和金钱,而实际上,代理就是你需要的一切。这是用18个代理完成的,每个代理都处理非常具体的任务。零批评循环。如果Claude只用3-4个代理尝试这个,我猜它会产生差得多的结果,然后QA代理会给出一些不完美的推荐,可能不会像我这里得到的这么好。但最重要的是,QA代理永远不会打败真正的人类测试员。所以,对我来说,让人类来做批评循环感觉更优化。另一个问题是,18个代理运行24小时会烧掉任何人的令牌预算哈哈。这是用Claude 5.0 Opus完成的。
查看原文

相似文章

编程代理的最佳编程语言是什么?

Hacker News Top

Dan Luu 对现有基准测试提出批评,这些测试声称动态语言对编程代理的 token 效率更高。他认为,琐碎的问题和有缺陷的评估使这些结论不可靠。