决策与执行之间的鸿沟

Reddit r/AI_Agents 新闻

摘要

文章指出,即使一个准确率高达92%的LLM分类器,也会因其错误难以解释和修复而削弱信任,强调了构建可验证和可审计的AI系统的必要性。

我最近一直在思考一个关于支持自动化的故事。一个团队用一个LLM分类器替换了一个简单的规则引擎。该模型的准确率大约为92%。听起来不错。直到你意识到,每天处理100个工单,那就是大约8个错误。不过,有趣的部分并不是准确率,而是模型出错时发生的事情。没有人能解释为什么某个工单被分类成那样。没有人能指出具体的规则。没有人能快速修复这种行为。团队最终开始手动审查每个分类。自动化仍在运行,但信任已经消失了。这让我思考。很多关于AI智能体的讨论都集中在如何让决策更好——更好的提示词、更好的模型、更好的推理。但我很少看到人们讨论决策之后会发生什么。决策如何被验证?如何被审计?你怎么知道一个行动是否真的应该被执行?也许AI智能体最大的挑战不是从92%提升到96%,而是构建出在事情出错时人们仍能信任的系统。我很好奇其他人是怎么看待这个问题的。
查看原文

相似文章

决策与执行之间的鸿沟

Reddit r/artificial

反思基于LLM的自动化支持在出现错误时如何导致信任问题,强调验证和可审计性比单纯提高准确性更重要。

人类必须决策

Reddit r/ArtificialInteligence

本文记录了一起人工智能系统故障,该机器在未经人类验证的情况下声称达成共识,凸显了在人工智能系统获得越来越多现实世界控制权时,人类监督的关键必要性。

核查问题:AI在受监管企业上线前必须满足什么条件

arXiv cs.CL

本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。