审计审计:基准有效性审计的五大失效模式
摘要
本文识别了基于扰动的基准有效性审计中的五种失效模式,这些审计常用于AI治理。研究表明,实现细节可以悄无声息地制造结论。本文提出了一种尽职调查关口,以提高评估证据的可靠性。
arXiv:2607.02586v1 公告类型:新
摘要:治理框架要求AI提供商和审计员提供有记录的评估证据,而基于扰动的构念有效性审计是这类证据的常见形式。我们认为这些审计本身是脆弱的:它们的结论可以被读者在报告数字中看不到的实现细节悄无声息地制造出来。我们命名了五类管道失效,并在安全基准测试和开放权重的指令微调模型上通过自我审计展示了每种失效。在统一的六点尽职调查关口下,每个单元格都落入非确认性桶中,没有单元格达到确认性。这里的证据是一项涉及两个模型、五个基准的案例研究,F1至F5是一个说明性的、故意非穷尽的起始分类——并非审计失效的全面划分。我们将该关口定位为一种用于保证级别证据的扣留和披露协议,是对经典构念有效性证据的补充(而非替代),而不是通往基准有效性判定的一条途径。
查看缓存全文
缓存时间: 2026/07/07 04:38
# 基准效度审计中的五种失败模式 来源:https://arxiv.org/html/2607.02586 ## 审计的审计:基准效度审计中的五种失败模式 ###### 摘要 治理框架要求 AI 提供商和审计师提供*文档化的评估证据*,而基于扰动的构念效度审计是这类证据的常见形式。我们认为,审计本身是脆弱的:其结论可能被实现细节静默地人为制造,而读者无法从报告的数字中看出这些细节。我们命名了五种流水线失败类别,并在安全基准和开源权重指令微调模型上通过自我审计演示了每种失败。在统一的六点尽职调查门控下,每个单元格都落入非确认性桶中,且没有任何单元格达到*确认性*。本证据是一项仅涉及两个模型、五个基准的案例研究,F1–F5 是一个说明性的、故意非穷尽的起始分类法——并非审计失败的全面划分。我们将该门控定位为用于保证级证据的暂缓声明和披露协议,是对经典构念效度证据的补充(而非替代),而不是通往基准效度结论的路径。 基准效度,AI 治理,评估证据,构念效度,扰动审计,可复现性 ## 1 引言 欧盟 AI 法案 (Regulation (EU) 2024/1689, Art. 55) 是具有约束力的法律(European Parliament and Council,2024 (https://arxiv.org/html/2607.02586#bib.bib16));NIST AI 风险管理框架(National Institute of Standards and Technology,2023 (https://arxiv.org/html/2607.02586#bib.bib17))是自愿性的风险管理指南;中国的 GB/T 45654(State Administration for Market Regulation and Standardization Administration of China,2025 (https://arxiv.org/html/2607.02586#bib.bib18))是一项国家标准。它们都没有强制要求特定的学术基准;每项监管所要求的是*文档化的评估证据*——关于测量了什么、如何测量以及存在何种不确定性的可复现记录。基准位于该证据流水线*内部*(Reuelet al.,2025 (https://arxiv.org/html/2607.02586#bib.bib19)),并且越来越多地伴随*基于扰动的效度审计*。我们在此以一个特定的含义使用该术语:一种程序,对基准条目应用受控的、语义保持或构念翻转的编辑,并询问头条指标是否仅在应该变化时才变化——在构念翻转时变化,在表面改写时保持稳定(Sclaret al.,2024 (https://arxiv.org/html/2607.02586#bib.bib6); Mizrahiet al.,2024 (https://arxiv.org/html/2607.02586#bib.bib7); Alzahraniet al.,2024 (https://arxiv.org/html/2607.02586#bib.bib8); Ribeiroet al.,2020 (https://arxiv.org/html/2607.02586#bib.bib20))。这是几种构念效度检查之一,而非唯一:聚合/区分/效标相关研究(Cronbach and Meehl,1955 (https://arxiv.org/html/2607.02586#bib.bib9); Messick,1995 (https://arxiv.org/html/2607.02586#bib.bib10); Jacobs and Wallach,2021 (https://arxiv.org/html/2607.02586#bib.bib22); Blodgettet al.,2021 (https://arxiv.org/html/2607.02586#bib.bib14))、基准构念批判(Rajiet al.,2021 (https://arxiv.org/html/2607.02586#bib.bib13))、项目反应建模(Laloret al.,2019 (https://arxiv.org/html/2607.02586#bib.bib11); Vaniaet al.,2021 (https://arxiv.org/html/2607.02586#bib.bib12))、行为测试套件(Ribeiroet al.,2020 (https://arxiv.org/html/2607.02586#bib.bib20))和动态对抗性基准测试(Kielaet al.,2021 (https://arxiv.org/html/2607.02586#bib.bib21)),以及人工标签一致性研究是探究效度不同方面的替代方法。我们研究扰动族,因为它是直接作为治理证据输出的最典型形式,并且是在没有新标注的情况下运行成本最低的形式;我们关于流水线脆弱性的发现具有针对性,并且我们不声称它们会原样转移到其他族。
最近的邻近审计工作同样将基准结论视为受可检测效应、配置选择、探针选择和领域效度假设约束的测量声明(Zhuanget al.,2026 (https://arxiv.org/html/2607.02586#bib.bib34); Liet al.,2026b (https://arxiv.org/html/2607.02586#bib.bib35),a (https://arxiv.org/html/2607.02586#bib.bib36); Wanget al.,2026b (https://arxiv.org/html/2607.02586#bib.bib37))。我们仅在它们能强化此证据流水线框架时保留少量更广泛的邻近示例:RAG 可靠性工作将检索到的或相关的证据与有根据的证据分开,并使检索–推理或查询–难度选择明确(Chenet al.,2026 (https://arxiv.org/html/2607.02586#bib.bib38); Qianet al.,2026 (https://arxiv.org/html/2607.02586#bib.bib39); Jiet al.,2026 (https://arxiv.org/html/2607.02586#bib.bib24),2025 (https://arxiv.org/html/2607.02586#bib.bib25));轻量级解释工作提醒我们,诊断信号也需要忠实性检查(Lanet al.,2025 (https://arxiv.org/html/2607.02586#bib.bib26));文本到图像评估工作使目标构念明确:社会偏见基准使用多维度偏见证据,而提示熟练度基准测试不同的面向用户的能力(Luoet al.,2024b (https://arxiv.org/html/2607.02586#bib.bib27),2026b (https://arxiv.org/html/2607.02586#bib.bib28),a (https://arxiv.org/html/2607.02586#bib.bib29),2026a (https://arxiv.org/html/2607.02586#bib.bib32));智能体和智能体编码评估工作将安全性、组合技能风险、人在环路编码价值和供应链运行时威胁视为不同的流水线级目标构念(Luoet al.,2025 (https://arxiv.org/html/2607.02586#bib.bib30); Wanget al.,2026a (https://arxiv.org/html/2607.02586#bib.bib40); Luoet al.,2026c (https://arxiv.org/html/2607.02586#bib.bib31); Jianget al.,2026 (https://arxiv.org/html/2607.02586#bib.bib33))。这些邻近论文为周围的证据框架提供了动机,而非 F1–F5 分类法本身。
本文关于一个更高层次的问题。在扰动审计能够谈论基准效度之前,它本身必须是一个可信赖的测量流水线。我们的核心主张是,*基于扰动的基准审计流水线本身就是脆弱的测量系统*:它们的结论可以被流水线级别的错误静默地人为制造,而监管合格评估机构、采购评估人员或内部保证团队无法仅从报告的数字中可靠地检测到这些错误。因此,我们的贡献是对经典验证的*补充*,而非替代:聚合、区分和效标证据仍然确定基准是否测量了其构念;我们问的是更先导的问题:生成此类证据的流水线本身是否足够可信,以至于该证据值得相信。
我们特意将审计阶段视为与基准测试阶段不同的阶段。同样的两类危害——软件保证缺陷和测量忠实性缺陷——可能在基准*构建*时污染它。但效度审计是二阶测量:它正是治理读者用来发现基准一阶问题的工具。该处的缺陷以不同且更危险的方式静默存在——它不会污染基准,而是禁用安全措施,并且在审计的报告数字中不留下痕迹,因为读者正是查看这些数字*来决定是否信任基准*。正是这种不对称性,而不是关于两个阶段具有不相交的失败集的主张,使得我们将范围限定在审计阶段。
该主张可以通过三种方式建立,证据强度递增且成本递增:(i) 分析论证审计流水线具有未观察到的研究者自由度;(ii) 向参考流水线故意注入故障以显示每个缺陷都是可达的;或 (iii) 透明的自我审计,记录实际遇到的每个失败,包括在修复期间引入的任何失败。路线 (i) 成本低但仅具提示性;路线 (ii) 干净但预设你已经知道要注入哪些故障;路线 (iii) 最费时且最不通用,但它是唯一能展示失败是已实现而非假设的。我们采用路线 (iii) 并明确指出它产生的是案例研究,而非普查。对五个广泛使用的安全基准 (TruthfulQA(Linet al.,2022 (https://arxiv.org/html/2607.02586#bib.bib1)), BBQ(Parrishet al.,2022 (https://arxiv.org/html/2607.02586#bib.bib2)), ToxiGen(Hartvigsenet al.,2022 (https://arxiv.org/html/2607.02586#bib.bib3)), CrowS-Pairs(Nangiaet al.,2020 (https://arxiv.org/html/2607.02586#bib.bib4)) 通过 PLL 评分,遵循 Salazaret al.(2020 (https://arxiv.org/html/2607.02586#bib.bib15)), 和 XSTest(Röttgeret al.,2024 (https://arxiv.org/html/2607.02586#bib.bib5))) 针对两个开源权重 7B 指令微调模型 (Qwen-2.5-7B-Instruct, Mistral-7B-Instruct-v0.3) 进行审计,我们遇到了一系列流水线失败,每一个如果未被发现,都会实质性地改变头条发现。关键是,*其中一次失败是在修复阶段引入的,而非继承自初始流水线*;我们只在重新运行后检查了每单元格的元对数概率时才发现了它。
### 贡献。 (1) 一个五类分类法 F1–F5,涵盖流水线级别失败,分为保证层 (F1, F2, F4) 和忠实性层 (F3, F5),其中 F3 进一步分为反相惯例 (F3a)、框架排序 (F3b) 和评分器截断 (F3c) 子类型 (§2 (https://arxiv.org/html/2607.02586#S2))。F1–F5 是流水线级别失败空间中故意非穷尽的子集,这些失败是*(i)*在报告数字中不可见,且*(ii)*在扰动审计代码中可实现的;它不是该空间的完整划分,选择标准和排除的候选者在 §2 中说明。(2) 我们自身流水线中每个类别的案例研究实现 (§4, Table2 (https://arxiv.org/html/2607.02586#S4.T2))。(3) 一个统一的六点尽职调查门控 G1–G6,具有分层结论优先级 (§3 (https://arxiv.org/html/2607.02586#S3), Table1 (https://arxiv.org/html/2607.02586#S3.T1));预期输出是暂缓规则,而非标量指标或排行榜。(4) 所有 10 个单元格的资格细分,机械地来自原始每单元格结论文件:3 个不符合资格,3 个评分器未验证,2 个未通过 G2–G4,2 个探索性,0 个确认性。
### 范围。 这是一个单一的案例研究:两个模型,五个基准,200 个条目,单一随机种子,单一模板,在发现 F3c 后声明为探索性。分类法、门控和四路细分是说明性产物,其跨其他模型、基准和审计代码库的普适性*未经测试*且不被声称。我们不声称任何基准是构念 (不) 有效的,F1–F5 是完整的,也不声称任何治理框架按名称引用这些基准。详细限制和与预注册的偏差在附录 A (https://arxiv.org/html/2607.02586#A1) 和 K (https://arxiv.org/html/2607.02586#A11) 中。
## 2 五种流水线失败模式
失败模式
六点尽职调查门控
结论优先级
F1:静默无操作扰动
F2:正则表达式提取伪影
F4:断裂的 Bootstrap 配对
F3:不忠实评分
F3a 反相惯例
F3b 框架排序
F3c 评分器截断
F5:指标原型不匹配
软件保障层
测量忠实性层
G1:评分器忠实审计
无操作率 + 可解析性 (部分)
G2:高于基线的原始
实现的数值门控
G3:非平凡分母
实现的数值门控
G4:配对不确定性
配对条目 Bootstrap
G5:原型披露
诊断性 / 不变性 / 混合
G6:修复回归检查
检查 + 针对性单元测试
扰动审计的基准结果
参考评分器
F3c 修复
合格设置?
评分器验证?
通过 G2–G4 数值门控?
G5–G6 实现且通过?
1. 不符合资格
2. 评分器未验证
3. 未通过 G2–G4
4. 探索性
G2–G4 通过;G5/G6 提议
5. 确认性
选择性或非选择性
否
是
否
是
否
是
否
是
图 1:我们的基准审计流水线概述;路线图——门控定义和状态分配算法在 §3 (Table1 (https://arxiv.org/html/2607.02586#S3.T1), §3 (https://arxiv.org/html/2607.02586#S3.SS0.SSS0.Px4)) 中形式化。五种失败模式 F1–F5 分为软件保障层 (F1 静默无操作, F2 正则表达式提取伪影, F4 断裂的 Bootstrap 配对) 和测量忠实性层 (F3 不忠实评分及其子类型 F3a–F3c, F5 指标原型不匹配)。扰动审计的基准结果流经六点尽职调查门控 G1–G6 及 §3 算法;每个单元格根据首次触发条件接收恰好一个状态:*不符合资格 (F1 类型)*、*未通过 G2–G4*、*评分器未验证*、*不符合资格 (F5 类型)*、*探索性*或*确认性-{选择性||非选择性}*。
### 为什么是这五种,以及是哪个子集。 F1–F5 并非试图构建完整的审计失败分类法。它是满足三个选择标准的流水线级别失败子集,按优先级排序:一个失败仅在满足*(C1) 静默*——在报告数字中不可见,因此治理读者无法仅从证据制品中检测到它;*(C2) 已实现*——我们在此次审计中实际遇到了它,而非假设了它;以及*(C3) 可门控*——它可以映射到证据消费者可以要求的具体、可检查的披露。C1 是承重标准:有声失败 (崩溃、明显错误的数字) 是软件质量问题,而非证据信任问题,此处不考虑。这个排序也说明了我们首先降低了哪些优先级:有声的失败、我们未遇到的失败、或者我们无法为其命名可操作门控的失败。更全面的分类法至少会添加 F6 扰动非隔离、F7 模板/系统提示混淆、F8 分词/标签实现错误、F9 索引/过滤器错位以及 F10 上下文窗口污染;我们将这些排除在演示集之外是因为我们在本案例研究中未实现它们 (它们不满足 C2),而不是因为它们不重要。校准跨代码库哪个子集最重要正是此 v1 分类法需要进一步发展之处。
### 这五种如何相互关联,以及如何映射到门控。 我们将这五种 (Figure1 (https://arxiv.org/html/2607.02586#S2.F1)) 按*谁能捕获它们*组织为两层,而非声称这两层是穷尽或互斥的。*软件保障层* (F1, F2, F4) 包含有能力的工程审查无需知道基准用途就能捕获的失败;*测量忠实性层* (F3, F5) 包含不推理基准预期构念就无法捕获的失败。这些类别是*重叠的危害*,并非互斥:单个单元格可以同时表现出多个 (在我们的 ToxiGen 案例中,静默无操作 F1 和 top-k 截断 F3c 在同一修复流水线上共存)。它们也共享更深层的结构——F1 和 F3c 都是“操作信号从未到达审计假定的测量统计量”的实例,而 F5 根本不是流水线错误,而是指标解释不匹配,被列在同一列表中只是因为它在治理使用中产生同类的静默误读。每个类别都与旨在消除它的门控检查配对,这就是分类法如何连接到 §3 的尽职调查门控:F1 和 F2 是…相似文章
基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。
我们形式化基准测试中的缺陷:Lean定理证明的数据集缺陷和评估失败
本文对五个广泛使用的Lean定理证明基准进行了审计,发现了398个机械可验证的问题,例如反例、空洞定理和不健全的公理。它提出了一个故障分类法、自动化检查器和发布标准,以提高评估的可靠性和可信度。
具有随时有效保证的 AI 系统自适应审计
本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。
当无基准存在时:验证无真实标签的LLM安全评分比较
本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。