针对欺骗性模型提供方的防操纵不经意审计
摘要
本文提出了一种利用私人信息检索的新型审计协议,使审计具有防操纵性,迫使欺骗性模型提供方伪造更多响应,从而增加检测到操纵的可能性,并提供了理论保证和实验验证。
arXiv:2608.04365v1 公告类型:新
摘要:审计已成为算法治理的关键工具,为机器学习模型的外部审查和治理提供了一种机制。然而,确保此类评估的完整性仍然是一个具有挑战性的问题。例如,在监管情境中,审计通常是公开声明或容易被察觉的,从而使模型提供方能够有意或无意地操纵审计过程。这一脆弱性在公平性评估中尤为严重,因为提供方通常可以推断出敏感属性,并策略性地均衡不同群体之间的分配率,以满足公平性指标。
本文提出了一种新型审计协议,通过使审计方能够以不经意的方式查询模型,显著提高此类操纵在审计后被检测到的可能性。我们的方法利用私人信息检索机制,要求提供方对大量实例进行标注,同时防止其知道哪些子集最终将用于审计。该协议高效,对审计方带来的开销极小,并且无需修改被审计模型、其训练过程或其推理流程。我们提供了理论保证,表明在该协议下,试图隐藏不公平性的提供方必须伪造显著更多的响应,从而增加了操纵的难度和被检测到的可能性。在代表性审计场景中的实验结果证实了我们方法的有效性和实用性。
查看缓存全文
缓存时间: 2026/08/06 07:49
# 防操纵的隐匿审计:应对欺骗性模型提供商 来源:https://arxiv.org/html/2608.04365 ###### 摘要 审计已成为算法治理的关键工具,为机器学习模型的外部审查和治理提供了一种机制。然而,确保此类评估的完整性仍然是一个具有挑战性的问题。例如,在监管环境中,审计通常是公开声明或容易被发现的,从而使模型提供商能够有意或无意地操纵审计过程。这一漏洞在公平性评估中尤为严重,因为提供商通常可以推断出敏感属性,并策略性地均衡不同群体之间的分配率以满足公平性指标。在本文中,我们提出了一种新颖的审计协议,旨在通过使审计员能够以隐匿方式查询模型,显著提高此类操纵在审计后被发现的可能性。我们的方法利用私有信息检索机制,要求提供商标注大量实例,同时防止其知道最终哪些子集将用于审计。该协议高效,对审计员施加的开销极小,并且无需修改被审计的模型、其训练过程或其推理流水线。我们提供了理论保证,表明在该协议下,试图隐藏不公平性的提供商必须伪造显著更多的响应,从而增加操纵的难度和被检测的可能性。跨代表性审计场景的实验结果证实了我们方法的有效性和实用性。代码——github.com/sofianeazogagh/oblivious_audit ## 1 引言 随着机器学习(ML)系统日益成为获取基本资源和公共话语的媒介,稳健的ML治理已成为确保这些系统公平运行并遵守法律和道德标准的必要条件(chandrasekaranSoKMachineLearning2021)。这种治理的核心支柱之一是算法审计,它允许独立评估者审查模型行为(metaxaAuditingAlgorithmsUnderstanding2021; costanza2022audits)。然而,有效的外部审计目前受到严重的权力不对称的阻碍:模型提供商严格控制着系统访问、训练数据和使用统计(birhaneAIAuditingBroken2024)。尽管有几种机制试图弥合这种透明度差距——例如专门的研究API(entrena2025tiktok)、学术合作伙伴关系(socialScienceOneStatement2019)和法律规定的数据访问——但它们往往面临实际限制,并且容易受到提供商干预(bourreeRelevanceAPIsFacing2023)。最近的一个例子凸显了这种脆弱性:Meta广告库,一个旨在帮助监管机构和研究人员通过关键词搜索追踪欺诈广告的工具。2025年路透社的一份报告显示,Meta积极监控了日本监管机构调查诈骗广告时使用的特定关键词和名人姓名(horwitzMetaCreatedPlaybook2025)。随后,该公司反复执行这些精确搜索,以抢先删除日本的定向广告。通过选择性清除监管机构查询所暴露的特定数据,而不是部署系统性的诈骗过滤,该提供商能够避免监管打击,同时避免了系统性广告验证的成本。这种被动式的内容筛选制造了合规的假象,表明当审计查询对被审计方可见时,当前的透明度机制多么容易被提供商操纵(fukuchiFakingFairnessStealthily2020; garciabourreeRobustMLAuditing2025)。 在本工作中,我们考虑一个通用的监管设置,它捕捉了广告库示例所展示的动态。监管机构希望审计一家提供预测服务的公司,无论是预测API还是作为更大系统一部分的模型。我们假设监管机构可以对提供商施加审计协议,前提是计算成本合理。提供商被建模为*恶意*对手:它不想承担真正改进其系统的成本,而是试图通过对抗性地翻转一些预测来通过审计,而不修改其部署的模型。实际上,这种设置(监管机构主导的审计,需要提供商配合)的核心挑战在于,被审计的提供商在回答审计查询时可能会策略性地修改其输出,偏离其向真实用户提供的输出。这种类型的操纵不仅难以检测(garciabourreeRobustMLAuditing2025),而且对审计集输出的一点点修改就可能对审计结论产生巨大影响(参见命题1)。为了解决这个问题,我们提出了一种严格的审计框架,为审计结论提供正式的理论保证,并限制提供商可以进行的策略性操纵的程度。虽然我们提出的框架与模型和指标无关,但为了简洁,我们将展示限制在审计二分类器中的人口统计均等性,并在第6.1节中讨论它如何扩展到其他设置。我们的主要贡献如下: - •我们引入了respir,一种旨在减轻审计操纵的审计协议。其核心思想是将实际审计集SS隐藏在一个更大的候选集CC中,从而可证明地使欺骗性提供商的操纵更加困难。该协议的唯一先决条件是被审计的提供商必须标注一个比实际审计集SS更大的候选集CC。 - •我们证明了respir迫使欺骗性提供商修改候选集CC中数量多得多的数据点,才能伪造相同水平的人口统计均等性(定理1)。这导致审计员检测到操纵的概率增加。 - •我们刻画了候选集CC相对于审计集SS需要多大,才能达到期望的操纵检测水平,同时证明该协议不会带来过高的计算开销,使其适合实际部署。 ##### 大纲。首先,在第2节中,我们回顾了关于审计、使其稳健的尝试以及私有信息检索的背景,私有信息检索是我们方法的核心构建块。接下来,在第3节中,我们描述了本工作所依赖的审计框架,并解释了为什么标准的黑盒公平性审计可能容易受到操纵。为了解决这个问题,我们在第4节中介绍了一种基于PIR的隐匿审计协议,称为respir。然后,我们在操纵难度和可检测性方面建立了该协议的理论保证,并在第5节中对其进行了实验评估。最后,我们在第6节中通过讨论我们框架的适用性、隐藏审计集协议的主要设计原则以及未来工作的方向来总结。 ## 2 背景与相关工作 ### 2.1 审计与操纵 *审计与监管。*独立审计是追究模型提供商责任和培育更健康算法生态系统的关键机制(metaxaAuditingAlgorithmsUnderstanding2021; vecchione2021algorithmic; costanza2022audits)。这一观点已被最近的法规所采纳:欧盟人工智能法案(RegulationEU20242024)、数字服务法案(RegulationEU20222022)、数字市场法案(RegulationEU20222022a)及相关框架越来越多地要求对高风险AI系统进行外部评估,使算法审计不仅成为研究关注点,也成为法律要求。 *审计的实际挑战。*若干事件凸显了进行可信审计的实际困难。在某些情况下,所研究的算法在研究过程中未经通知就发生了变化,例如2020年的Facebook两极分化研究(ribeiroFacebookStandardAlgorithm2024)。在其他情况下,承诺(或要求)的数据访问被一再延迟(socialScienceOneStatement2019),或者根本没有提供(EuropeanCommission2025)。最后,当数据或模型最终被共享时,它们可能包含损害已发表学术工作的错误(timberg_facebook_2021),或者无法反映用户所经历的现实(entrena2025tiktok; pearson_beyond_2025)。 *审计目标的可操纵性。*除了实际障碍之外,越来越多的研究表明,ML系统的许多组件都可以被策略性地操纵。训练数据和采样过程可能被偏置以伪造公平性(fukuchiFakingFairnessStealthily2020)。模型解释可能被“公平清洗”以隐藏歧视性行为(aivodjiFairwashingRiskRationalization2019; andersFairwashingExplanationsManifold2020; shamsabadiWashingUnwashableImpossibility2022; fokkemaAttributionbasedExplanationsThat2023)。模型输出本身可以被选择性地改变以欺骗黑盒审计员(bourreeRelevanceAPIsFacing2023; garciabourreeRobustMLAuditing2025)。更广泛地说,当提供商能够预见评估程序时,公平性指标容易受到博弈(hutchinson2022evaluation; thomas2022reliance)。 ### 2.2 稳健审计的相关工作 现有的使审计对操纵更稳健的工作可以分为三大类。 *(1)基于数据和先验的方法。*几项工作提出了利用先验知识或精心设计的查询来限制操纵的审计协议。yanActiveFairnessAuditing2022研究了主动公平性审计,审计员自适应地选择查询以高效估计公平性违规。yadavXAuditTheoreticalLook2023为带解释的审计提供了理论框架。与我们工作最相关的是,garciabourreeRobustMLAuditing2025正式研究了防操纵审计,并表明对真实情况有先验知识的审计员可以检测操纵,前提是提供商不知道他们使用的确切先验。作为这些方法的补充,我们的方法允许通过加密方式隐藏审计员的查询来放松私有先验假设。 *(2)密码学方法。*第二条工作线使用密码学工具来提供可验证的保证。shamsabadiConfidentialPROFITTConfidentialPROof2023提出了决策树公平训练的知识证明。waiwitlikhitTrustlessAuditsRevealing2024设计了一种基于零知识证明的协议,可以在不揭示模型或数据的情况下实现无需信任的审计。franzese_secure_2025通过一种可扩展的零知识证明协议引入了在线公平性证书,该协议验证了相对于部署期间接收到的数据的公平性。pentyalaPrivFairLibraryPrivacyPreserving2022使用安全计算开发了隐私保护的公平性审计。这些方法提供了强有力的保证,但通常需要提供商在运行密码学协议方面积极合作,并且可能带来显著的计算开销。相比之下,我们提出的框架依赖于轻量级的PIR原语,仅带来可忽略不计的开销。 *(3)安全硬件。*第三类依赖于可信执行环境或安全硬件来确保审计完整性(park2022fairness)。虽然这些方法很有前景,但它们需要信任硬件制造商和物理部署约束,这限制了它们在许多监管环境中的适用性。 ### 2.3 私有信息检索 私有信息检索(PIR)是一种密码学原语,它使客户端能够从数据库中检索一个项目,而无需向服务器透露正在访问哪个项目(ChorKGS98)。大量工作根据信任和部署假设提出了不同的PIR构造。一种方法将数据库分布在多个不串通的服务器上,以获得信息论隐私保证(OlumofinG11)。其他方法依赖于可信硬件(SmithS01),但最有前景的是基于格问题的同态加密方案,例如带误差学习(LWE)(xpir16; sealpir18; mulpir21; fastpir21; onionpir21; spiral22; frodopir23; simplepir23)。在这些基于同态加密的计算PIR中,客户端通常将其查询编码为加密的选择向量,概念上对应于指示所需记录索引的独热向量。之后,服务器将加密查询与数据库内容(通常表示为矩阵)进行同态结合,这意味着回答一个查询本质上简化为一次加密的矩阵-向量乘法。得到的密文解密后即为所请求的记录,而服务器对查询索引一无所知。然而,这种方法通常每次查询需要与数据库大小呈线性的计算成本,这严重限制了其在大规模数据库上的实用性。为了克服这一限制,最近的一系列工作引入了所谓的*有状态PIR*方案,其中相当一部分计算和通信被转移到离线的预处理阶段(corrigan2020private; kogan2021private; shi2021puncturable; onionpir21; corrigan22single)。在这种有状态PIR中,服务器首先计算并发送给客户端一个公共或半公共的提示(或*摘要*),该提示仅取决于数据库,并且可以在多次查询中重复使用。一旦完成这个预处理步骤,每个单独的查询就可以以显著降低的通信复杂度来回答,并且服务器端的成本变为数据库大小的次线性。除了实现次线性的渐近成本外,有状态PIR技术还被利用——不一定是为了实现次线性成本——而是为了使每次查询的线性成本显著更高(simplepir23; frodopir23)。一个突出的例子是SimplePIR(simplepir23),它依赖于Regev基于LWE的加密方案(regev2009lattices)。SimplePIR的关键见解是利用Regev加密的线性结构,在离线阶段预先计算与数据库相关的大部分昂贵矩阵运算。因此,在线查询阶段只需要依赖于加密查询的轻量级计算,而大部分矩阵-向量乘法是提前完成的,并且仅取决于数据库。这一特性使SimplePIR特别适合我们的设置,其中提供商被提前告知即将进行的审计,并与审计员共同商定审计集。一旦达成协议,提供商可以相应地标注审计集,并将相应的摘要发送给审计员(详见第4节)。此外,De Castro和Lee(verisimplepir24)引入了VeriSimplePIR,这是SimplePIR的一个扩展,确保可验证性。更准确地说,它允许客户端(*即*,在我们的情况中的审计员)验证被查询的数据库正是用于生成服务器(*即*,在我们的设置中的提供商)发送的摘要的那个数据库,而无需披露数据库的内容。这种可验证性在不增加额外在线成本的情况下实现,可用于防止提供商在审计期间更改标签。 ## 3 黑盒审计博弈 在本节中,我们首先描述本文所考虑的典型黑盒公平性审计设置。然后,我们从理论上量化其脆弱性。
相似文章
DECOR:基于信息操纵理论审计LLM欺骗行为
介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。
公平性审计:公司操纵的下界
本文推导了公司在审计后可以操纵公平性指标程度的下界,表明有限预算的公平性认证无法完全消除审计后操纵。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
信任但验证:通过事后对抗性审计和多智能体反馈循环减轻医疗幻觉
本文提出了一种多智能体‘信任但验证’系统,旨在减少大语言模型中的医疗幻觉。该系统在关于违禁药物的临床问题上测试了三种开放获取模型,实现了53%的幻觉错误率降低。
有限记忆语言模型中的遗忘审计
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。