高验证精度可能隐藏生产风险:使用SHAP在运行时暴露和阻止代理偏差[P]

Reddit r/MachineLearning 论文

摘要

本文展示了高验证精度如何可能隐藏AI模型中的代理偏差,并使用SHAP进行可解释性分析,以及通过运行时治理包装器执行公平性政策,防止生产环境中的偏差决策。

为了展示仅凭准确率的模型验证经常忽略的问题,以下是一个合成招聘筛选管道的分解,其中模型欺骗了指标,以及如何在运行时物理拦截该失败。使用三个特征训练了一个逻辑回归模型:技术评估分数、工作经验年限和一个合成的邮政编码指标。模型达到了94.2%的验证准确率。没有特征级分析,它很容易通过仅基于准确率的部署门槛。但训练标签被故意污染了。它们直接从邮政编码字段构建,模拟了一个历史选择过程,其中地理位置决定了谁能够晋级。使用shap.LinearExplainer检查一个建议的推断,特征归因数组暴露了捷径:``text technical_score: -0.0007 years_experience: -0.0680 postcode: 3.5031 ``。模型并未衡量候选人的适合度。它准确地复制了一个有偏见的历史决策规则。解释使问题可见,但并未强制执行后续操作。为了解决这个问题,估计器被一个L2语义执行边界(ramen-mlflow-guard)包装。对于受治理的请求,应用程序将特征负载和计算出的SHAP证据传递给包装器(RamenGovernedModel)。在委托给内部模型的predict()方法之前,包装器根据配置的代理偏差策略评估该证据。该策略拒绝了请求。包装器抛出一个GovernanceDeniedException`,底层估计器不执行受治理的预测。应用程序收到修复指导、相关法定锚点(例如欧盟AI法案)以及一个与配置策略绑定的本地验证的Ed25519收据。仅凭准确率判断时,模型看起来可靠。运行时治理防止了代理驱动的决策产生受治理的预测。
查看原文

相似文章

核查问题:AI在受监管企业上线前必须满足什么条件

arXiv cs.CL

本文分析了企业AI在受监管企业中的部署为何停滞不前,提出了一个包含准确性、可复现性、有据可依性和可检测性的生产标准。文章测量了不同模型和工具配置下的人工审查负担,表明置信度信号和来源引用可将审查率从100%降至49%,但自我验证增加了延迟,却没有提高错误容忍度。

具有随时有效保证的 AI 系统自适应审计

arXiv cs.AI

本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。