我查阅了396家金融科技公司的公开AI声明,只有143家能展示真正执行操作的智能体
摘要
对396家欧洲金融科技公司公开AI声明的分析发现,只有36%的公司展示了在生产环境中采取真实行动的智能体证据,其余都是Copilot。文章指出,关于生产智能体错误操作的事故处理机制几乎没有公开信息。
我一直在做市场调研,最后把396家欧洲金融科技和金融服务公司的公开AI声明都翻了一遍。产品页面、发布公告、会议演讲、新闻稿。我在找一样特定的东西:这家公司是否有公开证据表明其AI系统在生产环境中真正采取了实际动作?不是起草邮件,不是建议下一步,也不是总结案件档案。而是真正写入某个记录系统:转账、记账、结案、批准或拒绝信贷额度。396家中只有143家,约占36%。另外64%其实是在运行Copilot,却把它们称为智能体。要说明的是,这并非要抓谁的小辫子。一个能帮分析师节省20分钟的Copilot确实是好产品,我自己也会发布。但“智能体”这个词在这段差距里承载了太多东西,而且这两类系统的失败模式完全不同。如果你的系统只做建议、由人来确认,最坏的情况只是浪费时间。如果你的系统直接执行、人只做事后审核,最坏的情况是一个错误的不可逆操作已经躺在生产环境里,其他系统还在依赖它。让我卡住的是:几乎没有人公开说明当第二种系统出错时会发生什么。关于准确率和评估的材料非常多,但关于“智能体做了某件事、这件事做错了、我们如何发现并如何处理”的内容几乎没有。也许只是因为没人愿意公开自己的事故。但这让我怀疑,针对这种情况的工具是否已经存在,还是说大家都在默默手工对账、不愿声张。如果你在运行会写入生产环境的智能体,当其中一个做错事时,你是怎么处理的?我真的很想知道,这是否是个我还没了解到的已解决问题,还是每个人都在即兴发挥。
相似文章
我追踪了1200个AI Agent的发布,为期30天。大多数“AI初创公司”实际上已经消亡
一次为期30天的AI Agent生态系统深度剖析显示,大多数所谓的初创公司不过是提示链或API封装器,而开源工具让独立开发者能够与风投支持的公司抗衡。下一批赢家将专注于记忆、可靠性和执行,从而在18个月内推动自主工作流和‘AI员工’的崛起。
今天我看到一条消息:74%的公司部署AI代理后又撤回了。显然,我们并没有从新闻中听到这一点。
一项研究显示,74%的公司已将AI代理从生产环境中撤下,而那些拥有成熟AI治理的公司回滚率甚至更高。核心问题不在于AI模型本身,而在于它们所依赖的混乱、割裂的基础设施和数据。
金融科技正成为AI代理的早期测试案例
金融科技正逐渐成为AI代理的早期测试领域,企业正在部署自主AI系统用于客户服务和欺诈检测等任务,这预示着AI采用的更广泛趋势。
金融AI代理发展超预期,审计追踪讨论滞后。
金融AI代理正快速采用交易和信贷决策等自主任务,但用于问责与合规的审计追踪基础设施未能同步发展,给高风险交易带来重大风险。
MIT的研究人员记录了各大实验室正在部署的30个AI智能体。其中只有4个有公开文档说明该智能体的功能、不能做什么以及发生故障时的处理方式。
MIT研究人员编制了2025年AI Agent Index,记录了来自主要实验室的30个已部署的AI智能体,然而只有4个提供了公开文档,解释智能体的功能、局限性及故障模式,揭示了重大的透明度缺口。