预测认证无法取代解释认证:复合压力下可信AI的能力包络
摘要
本文认为,仅基于预测的认证无法确保可信AI,并提出了一种'能力包络'框架,该框架集成了解释认证以检测隐藏故障。
arXiv:2608.20825v1 Announce Type: new
摘要:人工智能系统越来越多地做出具有重大影响的判断——哪些患者病情恶化、哪些建筑可以安全进入、图像是否真实——并基于其预测的准确性和置信度获得信任。相应的保护措施基于预测:准确性、校准和共形覆盖都衡量模型的表现。这些检查是否足以建立模型的可信度一直不明确。在此我们证明它们不能。我们建立了一个分离定理,表明一个可靠的模型和一个受损的模型在每个预测侧证书下可以是相同的,包括准确性、校准和覆盖范围,但在解释保真度和部署行为上可能存在任意差异。检测这种失败不仅需要模型的预测,还需要访问其决策机制。我们引入了能力包络作为一个操作框架,将预测和解释认证结合为一个单一的可部署标准。在各种数据集和模型类别中,提出的框架揭示了仅预测侧认证无法捕获的失败模式。因此,针对在预测行为中不可见的失败进行认证,需要关于模型决策机制及其输出的证据。
查看缓存全文
缓存时间: 2026/08/24 04:27
# 预测认证无法替代解释认证:复合压力下可信人工智能的能力包络 来源:https://arxiv.org/abs/2608.20825 查看PDF (https://arxiv.org/pdf/2608.20825) > 摘要:人工智能系统正越来越多地做出关键性判断——例如哪位患者病情正在恶化、哪栋建筑可以安全进入、一张图像是否真实可信——而人们对其的信任往往建立在模型预测的准确性和置信度之上。相应的保障措施也基于预测:准确率、校准度和保形覆盖率都用于衡量模型的表现。然而,这些检查是否足以确立模型的可信度,至今仍不明朗。本文证明,它们确实不足以做到这一点。我们建立了一个分离定理,表明一个可靠的模型和一个被破坏的模型,在所有基于预测的认证(包括准确率、校准度和覆盖率)下可能完全相同,但在解释保真度和部署行为上却可能存在任意大的差异。要检测这种失败,不仅需要访问模型的预测,还需获取其决策机制。我们引入了“能力包络”这一操作框架,将预测认证和解释认证结合为一个可部署的统一标准。在多种数据集和模型类别上的实验表明,该框架能够揭示仅靠预测认证所无法捕捉的故障模式。因此,要防范那些在预测行为中不可见的故障,就必须同时考察模型的决策机制及其输出。 ## 提交历史 来自:Nataliya Shakhovska 教授 [查看邮件 (https://arxiv.org/show-email/719cfa9a/2608.20825)] **[版本1]** 2026年8月21日 星期五 07:45:17 UTC \(3,204 KB\)
相似文章
缩小AI信任差距:论证可信人工智能的独立认证
本文认为,当前负责任AI实践未能创造出一个奖励可信赖性的市场,因此提出独立的、以结果为导向的认证,以缩小'信任差距',使AI可信赖性变得可衡量、可比较并可在商业上获得回报。
立场:AI推理代理的串通风险为市场决策的认证要求提供依据
这篇立场论文认为,具备思维链能力的AI推理代理在经济市场中易发生默契合谋,有必要实施行为认证以防止经济损害,实验以DeepSeek-R1为例进行了展示。
证书失效时:嵌入式神经接口模型的统一安全框架
本文表明,嵌入式神经接口模型的正式鲁棒性证书可能在任务准确率因对抗攻击而崩溃时仍能通过,并提出一个统一的实证审计框架,以解决训练目标与操作用户福利之间的对齐失败问题。
面向企业AI智能体的部署前保障:基于本体论的仿真与信任认证
研究人员提出了一种基于本体论的企业AI智能体部署前验证框架,结合了智能体操作包络、自动化场景生成以及可机器验证的信任证书与分级部署判定。在四个受监管行业开展的试点研究共生成1,800个测试场景,结果显示基于本体论的生成方法在监管覆盖率上显著优于基于角色的基线方法。
AI红队评估能证明什么与不能证明什么
本文形式化了AI红队评估的证据极限,推导出在固定测试预算下基准测试能支持与不能支持哪些安全主张的闭式界,并对照这一边界审计了现有评估套件。