有限主权与控制税:当部署者不拥有模型时为AI监督定价

arXiv cs.AI 论文

摘要

本文介绍了有限主权的概念,用以描述部署者对AI系统的部分访问权限,论证了访问条件决定了控制协议的可行性,并提出了一个为监督成本定价的框架。

arXiv:2608.19216v1 公告类型:新 摘要:AI控制研究探讨如何在模型可能未对齐的情况下安全部署,但许多控制协议假设部署者可以对模型及其周围流程进行仪器化。对于通过API或托管端点使用前沿模型的受监管组织,这一假设往往不成立,因为部署者可能控制业务流程,但不控制模型权重、服务基础设施、内部跟踪、更新过程或完整交互日志。本文介绍了有限主权:在AI栈的数据、模型、基础设施和交互层上,部署者拥有部分技术和合同访问权限。它论证了这些访问条件决定了哪些控制协议在实践中可以执行。本文贡献了一个四层访问类型学、一个按协议层的要求矩阵,以及主权折扣成本的概念:控制税中用于通过合同、架构、审计、供应商保证、残余风险或缩减系统范围来替代缺失访问的部分。它还报告了一个基于135万个合成案例模拟的合成访问消融实验,并通过匿名化国家支付基础设施场景解读了发现。该实验并非真实世界支付系统的证据,而是一个构建效度练习。结果显示,完整的日志有助于诊断,预执行网关能够实现干预,跟踪访问和模型版本控制能加强事后解释,而范围限制可以在减少实用性的同时提高安全性。因此,作为通用安全解决方案提出的控制协议应明确说明其访问假设。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:54

# 有限主权与控制税:当部署者不拥有模型时,如何定价AI监督
来源:https://arxiv.org/html/2608.19216  
林振文,AI安全与治理顾问,具备金融服务和支付领域的专业经验。文中观点仅代表作者个人。

(2026年7月)

###### 摘要

AI控制研究探讨如何在模型可能未对齐的情况下安全部署,但许多控制协议都假设部署者能够对模型及其外围流程进行监控。对于通过API或托管端点使用前沿模型的受监管机构而言,这一假设通常过于严苛:它们可能控制着业务流程,但对模型权重、服务基础设施、内部跟踪信息、更新过程或完整交互日志却无能为力。本文引入"有限主权"概念,指在AI堆栈的数据、模型、基础设施和交互层面上实现的部分技术与合同访问权限。其核心论点是:这些访问条件决定了哪些控制协议在实践中可以执行。本文做出五点贡献:提出部署时AI控制的四层访问类型学;提供控制协议与所需访问权限的对照矩阵;引入"主权折扣成本"概念,指部署者通过合同、架构、审计、供应商保证、残余风险或系统范围缩减来替代缺失访问所付出的代价;基于135万次合成案例模拟的访问消融实验;以及一个AI引入司法管辖区的匿名化国家支付基础设施场景分析。该实验并非真实支付系统证据,而是展示日志记录、网关访问、跟踪访问、模型版本控制、供应商支持、工具范围、阈值和审计预算如何影响预防、诊断、效用、审计负担和成本的概念验证练习。主要发现是:访问假设即是安全假设——完整日志帮助部署者理解发生了什么,预执行网关帮助其在风险操作发生前进行拦截,跟踪访问和模型版本控制改进事后诊断,范围限制能在降低效用的同时提高安全性。因此,作为通用安全方案提出的控制协议应明确说明其访问假设。

关键词:AI控制;控制税;可扩展监督;AI主权;有限主权;可信监督;金融基础设施;模型风险管理

## 1引言

### 1.1控制在工程实现前已被分配

AI安全工作通常始于技术问题:如果模型可能未对齐,哪种部署协议能确保其行动安全?本文则更进一步:部署者在执行控制协议前,必须能够观察、记录、路由、中断或审计系统的相关部分。许多部署者并不具备这种访问权限。

这至关重要,因为对AI堆栈的访问权分布不均。2025年12月,七个国家在华盛顿签署了《硅晶圆和平宣言》,这是美国主导的AI相关供应链安全与韧性框架。至2026年6月底,该倡议已扩展至24个签署国,同时35个国家和地区在第二届硅晶圆和平峰会上签署了相关的《AI机遇联合声明》(澳大利亚工业、科学与资源部,2025;日本外务省,2026;欧盟委员会,2026)。同期,全球算力分布评估报告显示:非洲拥有全球不到1%的数据中心容量,却居住着全球约18%的人口;南亚、东南亚和拉丁美洲大部分地区依赖外部拥有和运营的AI基础设施(CSIS,2025;布鲁金斯学会,2026)。

这些事实通常被作为产业政策或地缘政治议题讨论。本文则将其视为AI控制的边界条件。如果受监管机构通过API使用供应商模型,它可能无法控制模型权重、服务堆栈、更新过程或内部跟踪信息。它或许仍需对系统行为负责,却无法使用AI安全文献中描述的所有控制协议。问题不在于国家政策是否应追求AI自主权,而更具体:当部署者不拥有模型时,还剩哪些控制手段?

### 1.2双层控制问题

AI控制议程探讨如何在模型可能未对齐时确保部署安全(Greenblatt等人,2023)。典型协议包括可信监督、委托可信路由、基于重采样的干预(Bhatt等人,2025)以及人工审计可疑操作。近期研究通过对抗性测试压力测试这些协议(Griffin等人,2024;Schaeffer等人,2026;Terekhov等人,2026),Terekhov等人(2025)则量化了*控制税*:向AI流程添加控制所带来的运营与财务成本。

本文认为控制包含两个层面:

- •第一层:协议有效性。如果部署者具备所需访问权限,该协议能否减少不安全行为?
- •第二层:访问可行性。部署者是否真正拥有协议所假设的日志、跟踪信息、路由控制、模型版本控制、基础设施可见性或合同权利?

多数AI控制研究聚焦于第一层,本文则聚焦第二层。此处的*主权*并非指领土主权,而是指技术及合同层面的访问权限——覆盖控制协议所依赖的数据、模型、基础设施及交互界面。对于许多现实世界的受监管部署者,尤其是AI引入司法管辖区而言,这种访问往往是有限的。

### 1.3案例动机、贡献与论文结构

金融基础设施是探讨此问题的合适场景,因为风险具体、审计预期高且问责链清晰。国家支付基础设施运营商可能使用供应商提供的基础模型支持交易相关流程,如争议分类或调查起草。国内监管机构可能要求验证、监控、可审计性和董事会问责,而模型、基础设施、更新过程及内部跟踪信息仍由外部供应商控制。

其灾难性行为比许多通用AI基准更容易定义:错误冻结或释放资金、系统性误分类、泄露受保护的金融数据,或涉及清算操作的操作路径。这些虽不等同于存在性风险,但足以清晰展示访问约束如何影响控制。

贡献与路线图

本文做出五点贡献。首先,引入四层访问类型学——数据、模型、基础设施和交互——用于思考部署时AI控制。其次,提供控制协议与所需访问权限的对照矩阵,展示不同访问条件下哪些控制协议仍可执行。第三,引入*主权折扣成本*概念,指部署者因缺失访问而需通过合同、架构、审计、供应商保证、残余风险或系统范围缩减进行替代时产生的开支、延迟、残余风险或效用损失。第四,报告基于合成支付争议工作流、20种访问配置、10种控制协议、三种合成智能体行为、阈值与审计预算扫描以及135万次合成案例模拟的访问消融实验。第五,通过匿名化国家支付基础设施场景诠释该框架。

本文结构如下:第2节回顾相关文献,第3节构建概念框架,第4节介绍实证方法,第5节报告合成访问消融结果,第6节将发现应用于支付基础设施场景示例,第7节讨论启示与局限,第8节总结。

## 2相关研究

### 2.1AI控制与可扩展监督

Greenblatt等人(2023)提出AI控制框架:不假设模型对齐可验证,而是让设计部署协议的蓝队与扮演最坏情况、蓄意颠覆的不可信模型的红队进行控制评估。该开创性论文引入了可信监督(由较弱的可信模型对不可信模型的输出进行可疑评分,人工审计评分最高的部分)和委托可信协议(用可信模型的输出替代可疑操作)。

后续工作通过重采样将控制扩展至多步骤智能体场景(Bhatt等人,2025),从博弈论角度形式化协议评估(Griffin等人,2024),勾勒控制论证如何支持部署安全案例(Korbak等人,2025),并通过要求不可信模型输出具备可读性来提升监督器性能(Sreevatsa等人,2026)。

最直接相关的是,Terekhov等人(2025)提出控制税,构建了将监督分类器性能映射至安全保障的理论框架,并提供了审计预算下监控协议的经验成本估算。本文以控制税为起点,批评不在于控制税理论本身,而在于若仅基于部署者可能不具备的仪表化访问权限来定价,则该理论是不完整的。

近期对抗性研究凸显了这一问题的重要性。监督器本身也是攻击面(Terekhov等人,2026)。攻击选择能力在现实审计预算下可能显著降低安全性(Schaeffer等人,2026)。不可信监督需要明确的共谋策略假设来支持安全案例(Gardner-Challis等人,2026)。这些防御与评估都预设了某行为者能对部署流程进行仪表化。未解之谜在于:是哪个行为者,具备何种访问权限,在何种合同与基础设施约束下?

可扩展监督

可扩展监督文献探讨较弱监督者如何可靠判断较强系统:通过辩论(Irving等人,2018)、弱到强泛化(Burns等人,2023)、弱大语言模型评判强模型的经验研究(Kenton等人,2024),以及弱监督者与强对手间监督博弈的扩展定律(Engels等人,2025)。

本文虽未从技术上扩展可扩展监督,但借鉴了一个结构性观察:监督能力是稀缺资源,其相对于被监督系统的充足性可进行分析。我们将同样的资源逻辑应用于访问权限而非能力。部署者可能有强大的监督器,但仍可能缺乏有效使用该监督器所需的日志、跟踪信息、工具调用可见性、版本控制或网关。

### 2.2主权AI、算力治理与结构性访问不对称

另一类文献(主要来自政策机构、行业分析和技术治理平台)记录了AI堆栈控制权集中的事实。常见表述将AI主权分解为支柱:数据主权、模型主权、基础设施主权和运营主权构成行业通用的四支柱框架,而分层和谱系式处理则强调主权非二元对立,而是分布在堆栈各层(斯坦福HAI,2026;托尼·布莱尔研究所,2026;Cruzes,2026)。实证研究记录了全球南方在基础设施层的薄弱访问能力(CSIS,2025;布鲁金斯学会,2026),算力治理文献则提出国家级机制,包括算力监控、算力供应商的了解你的客户计划(Egan和Heim,2023),以及治理前沿模型运行基质的技术AI治理研究议程(Reuel等人,2024)。

本文的一个关键动机观察是:算力治理与部署时AI控制目前处于不同层面。算力治理常问国家如何治理前沿模型的训练与运行者,AI控制则问部署者如何安全运行可能未对齐的模型。两者均未充分探讨当部署者在算力治理格局中的地位决定其控制协议可执行性时会发生什么。本文正介于此接缝处。

结构性不对称:数据殖民主义与去殖民AI

第三类文献解释了访问不对称为何可能是结构性的,而非偶然的市场失灵。Couldry和Mejias(2019)将数据殖民主义理论化:在与历史殖民主义连续的掠夺性经济逻辑下,通过数据挪用人类生活。Mohamed等人(2020)发展去殖民AI,识别出AI系统设计、部署和治理中的算法殖民性。Birhane(2020)具体记录了非洲的算法殖民动态,其中引入的技术可能嵌入外国价值观和利益,且缺乏本地审查或控制。

本文谨慎使用该文献。本文不推进殖民主义的规范理论,也不试图裁决更广泛的道德主张,而是用以证明将不对称访问视为部署环境的持续特征,而非市场竞争将迅速消除的暂时不便。

### 2.3研究缺口:部分访问下的控制

综合以上线索:AI控制假设部署者能对模型进行仪表化;主权AI和算力治理研究表明此类访问分布不均;结构性不对称文献则暗示有限访问并非过渡性现象。由此产生的问题直接:在部分访问条件下,哪些控制协议仍然有效?代价如何?

此缺口比一般AI主权理论更窄更实用。现有AI控制研究已开始评估和定价控制协议,但很少将部署者的访问地位明确纳入协议规范。本文因此贡献了一套词汇、映射方法及合成实证操作化路径,将访问假设视为部署时控制的一阶特征。

## 3概念框架:有限主权与控制税

### 3.1定义与访问类型学

因本文处于不同文献的交汇处,需精确定义术语。

- •*主权*指足以独立验证或干预AI系统的技术与合同访问权限。此定义刻意窄于政治主权。若部署者能独立观察或作用于某层而无需模型供应商持续酌情配合,则其拥有对该层的主权。
- •*控制*指约束可能未对齐模型行动的部署协议,无论模型意图如何,基于最坏情况颠覆模型进行评估(Greenblatt等人,2023)。
- •*监督*指确保AI部署行为可接受的更广泛制度与监管职能。控制协议是监督的一种实现方式;监管检查、模型风险管理和审计制度则是其他方式。
- •*控制税*指将控制措施整合到AI流程中的运营与财务成本(Terekhov等人,2025)。

一个贯穿全文的概念点:主权与控制正交。主权不是安全协议,而是访问条件。司法管辖区可拥有完全的数据与基础设施主权,却仍可能未实施任何有意义的控制。反之,缺乏

相似文章

从本地LLM到主权AI:行业如何界定界限?

Reddit r/ArtificialInteligence

本文探讨了从本地LLM到主权AI的转变,引用了一篇将AI主权分解为计算、操作和硬件控制层次的论文,并探索了行业在定义和治理主权AI方面的做法。

Quantized AI News 26/05:前沿AI中控制的代价

Reddit r/artificial

这篇新闻综述探讨了前沿AI中的权衡取舍:Anthropic重新发布的Fable 5展示了安全与质量之间的紧张关系,OpenAI的token效率提升降低了计算成本,而美国政府可能介入OpenAI则凸显了国家对AI基础设施控制的代价。