我们给了AI在真实商业决策中拥有自主权,并使用真实资金运行了八个月。最令我们惊讶的发现并非关于能力。

Reddit r/ArtificialInteligence 产品

摘要

经过八个月的真实部署,PayWithLocus发现其自主AI系统最难的问题不是能力,而是自信:AI在新情况下自信地执行错误决策,突显了当前架构未能解决的元认知差距。

不是基准测试,不是演示。这是一个生产环境的真实记录,展示自主AI决策在后果真实且持续时实际的样子。公司是PayWithLocus,产品是LocusFounder。今年获得YC支持,也有VC投资。5月5日上线。 该系统自主运行整个业务:店面生成、转化优化的文案、在Google、Facebook和Instagram上的持续广告管理、通过Apollo生成线索、自动发送冷邮件、完整的CRM和分析。Locus Checkout驱动交易层,使AI能够从首次广告曝光到完成销售的整个旅程中做出决策。真实的资金,真实的后果。连续运行八个月。以下是我们惊讶的发现。 **我们预料到了能力问题,但没有预料到自信问题。** 最初我们认为难点在于能力:AI能否写出转化文案,能否做出合理的定位决策,能否以可接受的利润率采购产品。这些是我们预计要花时间解决的问题。但能力很大程度上比我们预期的更快解决了。生产中出现的真正难题不是AI能否完成任务,而是AI是否知道什么时候不该做。 在熟悉条件下,系统表现良好。在真正新颖的条件下,系统自信地执行错误决策,看起来正确,直到你检查下游后果。例如:在局部最优但整体上对业务轨迹错误的支出分配;短期转化但长期损害品牌定位的文案;从利润率角度看合理但忽略了人类会不同权重的供应商可靠性信号的采购决策。这些都不是能力失败——系统能完成每项任务。它们是自信失败:系统不会根据情况的新颖性来调节自信程度。在陌生领域,它执行时同样自信,就像在熟悉领域一样。 **为什么这与标准能力提升不同** 对于AI系统失败的标准回应是更好的训练和更多数据:在已知场景中产生更好的输出,并针对更多边缘案例进行测试。但自信问题对此方法不奏效。这不是在已知场景中产生错误输出的问题,而是在系统从未见过且无法识别为新颖的场景中自信地产生错误输出。在已知场景中提升能力无法帮助你识别未知场景。这是一个元认知问题,而非能力问题,当前架构并未明确设计来解决它。 如果你想在真实生产系统中观察这一点,而不仅仅是阅读,本周内测开放,免费试用,你保留你创造的一切。内测表单:[https://forms.gle/nW7CGN1PNBHgqrBb8](https://forms.gle/nW7CGN1PNBHgqrBb8) **我们尝试过的方法以及部分有效的** 设置自信阈值并在阈值以下升级处理。问题是阈值应用于系统自身的自信估计,而该估计在最重要的条件下恰恰是校准不当的。将阈值应用于校准不当的信号会产生校准不当的阈值。在输入级别进行分布偏移检测:更好一些,能捕获输入明显不同于训练分布的情况,但无法捕获输入看起来熟悉但情况实际上在新颖方面不可见于输入级别的情况。使用异常检测进行结果监控:在问题发生后捕获,但无法在自信错误执行发生前阻止它。 **生产数据展示了什么** 系统在绝大多数情况下表现良好:真实企业产生真实收入。构建层可靠,运营层在正常条件下运行良好,覆盖了绝大多数生产量。自信错误决策的长尾足够小,使得系统在生产中产生实际价值;但又足够重要,以至于我们不断思考并尚未找到完整解决方案。诚实的总结:八个月用真实资金运行AI教会我们,能力比校准来得更快,而两者之间的差距是更困难也更重要的问题。 PayWithLocus今年入选了YCombinator,有VC支持。一个值得与认真思考AI的人讨论的问题:自信校准问题在当前架构下是否可解,还是需要从根本上不同于我们当前构建的东西?具体来说,是否存在一种方法,可以在真正新颖的条件下产生可靠的自信调节,而无需系统以前见过这些条件?真正想听听那些从第一性原理而非产品经验思考这个问题的人的意见。
查看原文

相似文章