核查问题:AI在受监管企业上线前必须满足什么条件

arXiv cs.CL 论文

摘要

本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。

arXiv:2607.28666v1 Announce Type: new 摘要:企业AI项目停滞不前的比例被广泛引用,但很少得到充分解释。本文测量了这一机制。在受监管金融服务中每天执行的六种文档密集型工作流,跨四个模型家族和三种工具配置运行,每种配置重复三次,在72种配置中产生了5,093个评分输出元素。每种配置都经过两次评估:一次是针对演示标准,即在单个案例上的一次正确运行;另一次是针对生产标准,要求持续准确性、跨重复的可复现性、可验证的归因,以及携带信息的置信度信号。72种配置中有57种通过了演示标准,32种通过了生产标准,存活率为56.1%。然后,本文计算了每种配置所施加的审查负担,这种负担是基于样本外估计而非事后诸葛。一个不提供置信度的工具,其输出需要100%审查,因为它没有为审查者提供任何筛选依据。要求工具引用来源并说明置信度,可将审查率降至49%,同时在20种配置中有17种保持了残余错误容忍度。增加一次自我验证过程,其延迟是普通配置的2.3倍,审查率降至44%,但它是唯一无法保持错误容忍度的配置。实际意义在于,AI工作流的价值与其说取决于它正确的频率,不如说取决于人类仍需检查的程度,而且这第二个属性是可测量的,却很少被测量。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:33

# 核查问题:AI 在受监管企业上线前必须满足什么条件

来源:https://arxiv.org/html/2607.28666
(2026 年 7 月)

###### 摘要

企业级 AI 项目以某种速度停滞,这个速度被广泛引用,却很少有解释。本文对这一机制进行了测量。论文在四个模型家族和三种工具配置上,对六类文档密集型工作流(受监管金融服务日常执行的那类)各运行三次,在 72 个配置上产生了 5,093 个经评分的输出元素。每个配置被评估两次:一次对照演示标准,即对单个案例的单次正确运行;一次对照生产标准,后者要求持续准确率、跨重复的可复现性、可验证的依据性,以及一个携带信息的置信信号。72 个配置中有 57 个通过演示标准,32 个通过生产标准,存活率为 56.1%。随后,本文计算每个配置所施加的审查负担,并以样本外方式而非事后方式估计。一个不给出置信度的工具要求对其 100% 的输出进行审查,因为它没有给审查者提供任何分流依据。要求工具引用来源并给出置信度可将其降至 49%,同时令残余误差容忍度在 20 个配置中的 17 个中得以保持。增加自验证环节会带来 2.3 倍于朴素配置的延迟,达到 44%,并且是唯一无法保持误差容忍度的配置。实际启示是:AI 工作流的价值与其说取决于它正确的频率,不如说取决于还有多少输出必须由人工检查;而后一属性是可测量的,却很少被测量。

## 1\. 问题

企业 AI 折损率的统计数据被引用的频率高于被解释的频率。常见的解释包括模型能力、数据质量、集成难度和变革管理。每种都有道理,每种都是断言。

本文提出一种不同的机制并对其进行测量。试点项目被评判所依据的标准与受监管部署必须通过的标准是两种不同的标尺,后者测试的是前者看不见的性质。一个工具可以对着一个文档向一位友好的观众演示一次,并产出正确答案。这项演示无法证明它能否两次产出相同答案、所引用的证据是否真实存在、或它是否知道自己何时出错。这些性质在演示中不可见,在生产中却具有决定性。

本文贡献有三:一套工具、一次测量和一项成本核算。工具是一对验收标准,完整发布,读者可以质疑或应用它们。测量是同一批工具分别对照两套标准评估时所发生的情况。成本核算则是弥合差异所需付出的代价

相似文章

Open ai

Reddit r/ArtificialInteligence

文章讨论了行业共识:人工智能正变得极其强大,但在高风险任务上的可靠性仍是一个未解决的工程问题。强调当前系统优化的是合理性而非确定性真理,前进方向是分层验证系统而非单一完美模型。

将AI代理部署到企业环境中的28项合规检查清单

Reddit r/artificial

本文提供了一份针对企业环境中AI代理的28项合规检查清单,涵盖日志记录、访问控制、数据处理、安全测试、运行时保护和事件响应,并与欧盟AI法案、SOC 2等框架对应。