AI编程工具印钞了。其他所有AI代理用例都远远落后。原因简单得离谱。
摘要
文章认为,像Cursor这样的AI编程工具之所以成功,是因为代码可以自动验证,而其他AI代理用例失败则是因为缺乏廉价、自动化的验证手段。核心洞见是:对于AI代理而言,护城河不是模型本身,而是验证器。
差距确实惊人。Cursor从几乎零收入到年收入数十亿美元,仅用了一年左右,成为有史以来增长最快的软件产品,据传SpaceX同意以600亿美元收购它。而其他地方:95%的企业AI试点项目没有带来可衡量的价值,大多数代理试点从未投产,一些公司正在放弃代理相关计划。同样的模型。同样的资金。结果却截然不同。那么,真正的变量是什么?我认为不是模型。我认为是这个:代码可以自我评分。运行它,通过或失败,瞬间完成,且完全免费。这意味着你可以在数百万次自动检查的尝试上训练它,没有任何人为瓶颈。Karpathy基本上说过:AI只有在能够自动验证输出的领域才能快速达到超人类水平。反面的最佳例子:有一个客户服务基准测试,同一任务运行8次,顶级模型在全部8次中都正确的概率不到25%。这不是产品,这是老虎机。不是因为模型笨,而是因为“好的支持”没有一键变绿的测试。企业失败报告也证实了这一点:项目死于“无法定义成功”和“输出不一致”,而不是模型质量。所以我的看法:每一个“AI代理用于X领域”的初创公司,都在暗中押注X是否可以验证,而大多数公司没有意识到这一点。护城河不是模型。验证器才是。编程获胜不是因为开发者是早期采用者,而是因为软件是唯一一个真相免费的工作。编程之外的出路不是更好的模型。而是构建一个原本不存在的反馈循环。网友们!来爆料吧……哪个工作现在看起来不可验证,但暗中其实有一个没人建造的廉价评分器?
相似文章
验证前沿:编码智能体奖励并无银弹
本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。
外部验证一直是我编码代理运行中缺失的关键环节
作者指出,在有效使用 AI 编码代理时,外部验证是一个关键缺失的组成部分。
@garrytan: 重点不在于 AI 让你写代码更快。很多人已经注意到了这一点。真正在于的是,AI 让你能够在以前因成本过高而无法持续的层级上进行验证……
该帖认为,AI 在编程中的核心价值不仅在于更快地编写代码,更在于实现可持续的高层级验证和测试,而这在过去需要耗费过高的人力成本。
AI编码代理是否遇到了瓶颈,还是我们衡量它们的方式出了问题?
本文探讨了AI编码代理的炒作与现实之间的差距,认为它们对于加速工作流程的某些部分有效,但在架构、调试和审查方面仍需人工监督,并质疑当前基准测试是否衡量了正确的东西。
编码代理的真正障碍不是代码质量——而是你是否能围绕它们构建一个可靠的循环
文章认为,AI编码代理的主要挑战不是代码生成质量,而是用户能否围绕它们构建可靠的循环,这将采用的障碍从模型能力转移到了工作流设计。