AI编程工具印钞了。其他所有AI代理用例都远远落后。原因简单得离谱。

Reddit r/AI_Agents 新闻

摘要

文章认为,像Cursor这样的AI编程工具之所以成功,是因为代码可以自动验证,而其他AI代理用例失败则是因为缺乏廉价、自动化的验证手段。核心洞见是:对于AI代理而言,护城河不是模型本身,而是验证器。

差距确实惊人。Cursor从几乎零收入到年收入数十亿美元,仅用了一年左右,成为有史以来增长最快的软件产品,据传SpaceX同意以600亿美元收购它。而其他地方:95%的企业AI试点项目没有带来可衡量的价值,大多数代理试点从未投产,一些公司正在放弃代理相关计划。同样的模型。同样的资金。结果却截然不同。那么,真正的变量是什么?我认为不是模型。我认为是这个:代码可以自我评分。运行它,通过或失败,瞬间完成,且完全免费。这意味着你可以在数百万次自动检查的尝试上训练它,没有任何人为瓶颈。Karpathy基本上说过:AI只有在能够自动验证输出的领域才能快速达到超人类水平。反面的最佳例子:有一个客户服务基准测试,同一任务运行8次,顶级模型在全部8次中都正确的概率不到25%。这不是产品,这是老虎机。不是因为模型笨,而是因为“好的支持”没有一键变绿的测试。企业失败报告也证实了这一点:项目死于“无法定义成功”和“输出不一致”,而不是模型质量。所以我的看法:每一个“AI代理用于X领域”的初创公司,都在暗中押注X是否可以验证,而大多数公司没有意识到这一点。护城河不是模型。验证器才是。编程获胜不是因为开发者是早期采用者,而是因为软件是唯一一个真相免费的工作。编程之外的出路不是更好的模型。而是构建一个原本不存在的反馈循环。网友们!来爆料吧……哪个工作现在看起来不可验证,但暗中其实有一个没人建造的廉价评分器?
查看原文

相似文章

验证前沿:编码智能体奖励并无银弹

Hugging Face Daily Papers

本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。