我查阅了396家金融科技公司的公开AI声明,只有143家能展示真正执行操作的智能体

Reddit r/AI_Agents 新闻

摘要

对396家欧洲金融科技公司公开AI声明的分析发现,只有36%的公司展示了在生产环境中采取真实行动的智能体证据,其余都是Copilot。文章指出,关于生产智能体错误操作的事故处理机制几乎没有公开信息。

我一直在做市场调研,最后把396家欧洲金融科技和金融服务公司的公开AI声明都翻了一遍。产品页面、发布公告、会议演讲、新闻稿。我在找一样特定的东西:这家公司是否有公开证据表明其AI系统在生产环境中真正采取了实际动作?不是起草邮件,不是建议下一步,也不是总结案件档案。而是真正写入某个记录系统:转账、记账、结案、批准或拒绝信贷额度。396家中只有143家,约占36%。另外64%其实是在运行Copilot,却把它们称为智能体。要说明的是,这并非要抓谁的小辫子。一个能帮分析师节省20分钟的Copilot确实是好产品,我自己也会发布。但“智能体”这个词在这段差距里承载了太多东西,而且这两类系统的失败模式完全不同。如果你的系统只做建议、由人来确认,最坏的情况只是浪费时间。如果你的系统直接执行、人只做事后审核,最坏的情况是一个错误的不可逆操作已经躺在生产环境里,其他系统还在依赖它。让我卡住的是:几乎没有人公开说明当第二种系统出错时会发生什么。关于准确率和评估的材料非常多,但关于“智能体做了某件事、这件事做错了、我们如何发现并如何处理”的内容几乎没有。也许只是因为没人愿意公开自己的事故。但这让我怀疑,针对这种情况的工具是否已经存在,还是说大家都在默默手工对账、不愿声张。如果你在运行会写入生产环境的智能体,当其中一个做错事时,你是怎么处理的?我真的很想知道,这是否是个我还没了解到的已解决问题,还是每个人都在即兴发挥。
查看原文

相似文章

金融科技正成为AI代理的早期测试案例

Reddit r/ArtificialInteligence

金融科技正逐渐成为AI代理的早期测试领域,企业正在部署自主AI系统用于客户服务和欺诈检测等任务,这预示着AI采用的更广泛趋势。