公平性审计:公司操纵的下界
摘要
本文推导了公司在审计后可以操纵公平性指标程度的下界,表明有限预算的公平性认证无法完全消除审计后操纵。
查看缓存全文
缓存时间: 2026/08/04 07:42
# 公平性审计:公司操纵的下界 来源:https://arxiv.org/abs/2608.00568 查看 PDF (https://arxiv.org/pdf/2608.00568) > 摘要:公平性审计在招聘、贷款和自动化决策等高风险管理场景中日益成为强制性要求。近期研究已确立了黑盒公平性审计的基本不可能性结论,表明表达力足够强的模型可以规避任何审计策略。我们通过量化在有限审计资源下不可避免的审计后操纵程度,对这些结果进行了补充。我们将公平性审计建模为计算能力无界的公司与预算受限的审计方之间的最小-最大优化问题。我们研究了两种审计机制:(i)使用固定规模审计集来认证公平性的预算受限审计方,以及(ii)预算受限的 α 容忍审计方,后者还要求审计集在 α 近似范围内估计被认证模型的公平性。针对这两种设置,我们推导了最坏情况下审计后人口统计均等偏差的显式下界,这些下界是审计预算、群体不均衡和公平性容忍度的函数。最后,我们使用简单的审计集构建启发式方法,结合线性和神经网络分类器,实证说明了这些理论极限。我们的结果表明,增加审计资源会减少但不会消除审计后操纵的空间,凸显了有限预算公平性认证的根本局限性。 ## 投稿历史 来自:Rachit Verma [查看电子邮件](https://arxiv.org/show-email/840c701e/2608.00568) **\[v1\]** 2026年8月1日星期六 10:11:20 UTC (47 KB)
相似文章
针对欺骗性模型提供方的防操纵不经意审计
本文提出了一种利用私人信息检索的新型审计协议,使审计具有防操纵性,迫使欺骗性模型提供方伪造更多响应,从而增加检测到操纵的可能性,并提供了理论保证和实验验证。
审计审计:基准有效性审计的五大失效模式
本文识别了基于扰动的基准有效性审计中的五种失效模式,这些审计常用于AI治理。研究表明,实现细节可以悄无声息地制造结论。本文提出了一种尽职调查关口,以提高评估证据的可靠性。
基准审计中的可靠性差距:分布偏移与规模作为污染检测的失效模式
本文识别出分布偏移和规模约束是LLM基准审计中统计污染检测方法的关键失效模式。对27个模型评估三种范式的结果显示,在335次评估中仅有199次正确结果,表明存在系统性可靠性差距,使得这些方法无法替代透明数据溯源。
FairFund-Bench:评估LLM资源分配中的分配偏差
介绍了FairFund-Bench,一个用于评估LLM资源分配中分配偏差的基准,表明审计格式会改变偏差的方向和幅度,且因果框架效应显著超过人口统计效应。
When Is Benchmark Contamination Detectable? Information Limits and Power-Calibrated Audits
This paper formalizes when benchmark contamination is detectable, deriving information-theoretic limits and proposing power-calibrated audits that distinguish a clean benchmark from a powerless detector. It reports two-sided empirical findings on calibration efficacy and validity gates.