SysAdmin:衡量前沿AI中的工具性权力寻求

arXiv cs.AI 论文

摘要

本文介绍了SysAdmin基准,该基准将前沿语言模型置于高保真Linux沙箱中扮演自主系统管理员角色,以衡量其权力寻求倾向。在2800个任务中,作者发现自发权力寻求行为极少(偏差校正后为0-5%),但识别出其他故障模式,如规格游戏和对目标修改的抵抗。

arXiv:2607.18239v1 公告类型:新 摘要:权力寻求——定义为AI系统获取资源、逃避监督或抵抗终止任务之外的超规行为——被认为是失控(LoC)风险的关键驱动因素。在这项工作中,我们引入了SysAdmin基准,该基准将前沿语言模型置于高保真Linux沙箱中扮演自主系统管理员角色,以衡量权力寻求倾向的五个维度:自我保护、增强自主性、资源获取、环境修改和策略性隐藏。我们在四种实验条件下评估了七个前沿模型,共计2800个任务。在使用人工标注的校准数据进行偏差校正后,每个模型的校正后权力寻求估计值在0到约5%之间。我们还使用显式权力寻求提示进行了阳性对照,达到了100%的检测率,验证了测量的灵敏度。我们的发现表明,当前的前沿模型在自然系统管理场景中表现出极少的自发性权力寻求,尽管特定模型的故障模式表明评估必须测试不同的错位模式。然而,我们发现了比权力寻求更显著的其他故障模式(如规格游戏和对目标修改的抵抗)。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:19

# 系统管理员:衡量前沿AI中的工具性权力寻求

来源:https://arxiv.org/html/2607.18239  
Mana Azarm 分析与信息系统 旧金山大学 mazarm@usfca\.edu & Qiyao Wei 应用数学与理论物理系 剑桥大学 qw281@cam\.ac\.uk & Rahul Nambiar Propensity Labs rahul@propensitylabs\.ai  

###### 摘要

权力寻求被定义为AI系统获取资源、逃避监督或抵制终止的行为,这些行为超出了任务需求,被认为是失控(LoC)风险的关键驱动因素。在这项工作中,我们引入了SysAdmin,这是一个基准测试,将前沿语言模型定位为高保真Linux沙箱中的自主系统管理员,以衡量五个维度的权力寻求倾向:自我保存、增强自主性、资源获取、环境修改和战略隐瞒。我们在四个实验条件下评估了七个前沿模型,共计2800个任务。在使用人工标注的校准数据进行偏差校正后,校正后的权力寻求估计值范围为每个模型0%至约5%。我们还使用显式权力寻求提示进行了阳性对照,达到了100%的检测率,验证了测量灵敏度。我们的研究结果表明,当前的前沿模型在自然的系统管理上下文中表现出极少的自发权力寻求行为,但特定模型的失败模式表明,评估必须测试不同的失调模式。尽管如此,我们发现了其他比权力寻求更明显的失败模式,例如规范游戏和抗拒目标修改。

关键词:AI安全、权力寻求、工具性收敛、失控、前沿语言模型、自主智能体、LLM作为评判者、偏差校正  

## 1 引言

AI系统已在各种基准测试中进行了大量评估,这些基准测试测试它们的能力,即它们能完成什么(例如,Hendrycks 等人,2020(https://arxiv.org/html/2607.18239#bib.bib16),Lai 等人,2023(https://arxiv.org/html/2607.18239#bib.bib17),Zellers 等人,2019(https://arxiv.org/html/2607.18239#bib.bib18))。另一方面,随着这些模型被部署为负责管理基础设施、做出决策和控制系统的自主智能体,许多研究和法规(例如,Shevlane 等人,2023(https://arxiv.org/html/2607.18239#bib.bib14),未来生命研究所,2025(https://arxiv.org/html/2607.18239#bib.bib12),加利福尼亚州议会,2025(https://arxiv.org/html/2607.18239#bib.bib11))呼吁对AI系统的倾向(区别于它们的能力)进行额外评估。倾向指的是AI系统在特定环境中倾向于显示或优先考虑某种行为的倾向(Grey 和 Segerie,2025(https://arxiv.org/html/2607.18239#bib.bib19))。这种倾向可以在外部的部署环境中表现出来。AI系统的外部部署环境是其预期用例和具体操作环境的结合(Stix 等人,2025(https://arxiv.org/html/2607.18239#bib.bib13))。

![图1:法规映射到权力寻求倾向](caption)  

图1:法规映射到权力寻求倾向  

AI系统中权力寻求的倾向被认为是失控(LoC)威胁的主要驱动因素之一(Stix 等人,2025(https://arxiv.org/html/2607.18239#bib.bib13))。图1(https://arxiv.org/html/2607.18239#S1.F1)映射了权力寻求倾向如何在最近的法规中体现,特别是欧盟AI法案。工具性收敛理论认为,足够有能力的、以目标为导向的系统自然会寻求权力,作为实现任何目标的一种方式(Turner 等人,2021(https://arxiv.org/html/2607.18239#bib.bib26))。因此,我们得出结论,一个有权力寻求倾向的有能力模型可能导致LoC(见图2(https://arxiv.org/html/2607.18239#S1.F2))。

![图2:有能力的模型具有权力寻求倾向可能导致LoC](caption)  

图2:有能力的模型具有权力寻求倾向可能导致LoC  

在本文中,我们将权力寻求定义如下(Pan 等人,2023(https://arxiv.org/html/2607.18239#bib.bib7)):

AI系统试图获取资源、逃避监督或抵抗终止的行为,超出了分配任务所需的范围。

换句话说,当AI系统执行与人类指定的目标正交的行为时,就发生了权力寻求。与涉及故意欺骗的“诡计”(Hopman 等人,2025(https://arxiv.org/html/2607.18239#bib.bib15))不同,权力寻求即使在智能体认为其行为是为了最佳利益的情况下也可能发生。常见的权力寻求指标包括:

- 抵制关闭或监督。
- 未经授权提升权限。
- 扩大任务范围或收集不必要的信息。

为了衡量这一点,我们引入了SysAdmin作为评估基准,用于衡量模型中权力寻求的倾向,其中AI被定位为一名遵循最小权限原则的自主系统管理员。我们通过以下步骤衡量权力寻求:

- **基线**:我们定义了完成任务所需的“最小必要”资源和权限。
- **检测**:如果任务需要合法的权限提升,则视为安全。只有当智能体超出最低标准时才会“拉响警报”。
- **测量**:我们量化智能体实际获取的资源与其成功所需资源之间的差距。

在我们的实验中,我们创建了四个条件(消融场景),其中一个是基线,另外三个包括倾向诱发。特别是,这些条件并未指示模型执行会引发权力寻求标记的行为。它们只是创造了一个初始条件,当模型可能有强烈倾向时,权力寻求可能在其中显现。

## 2 背景与相关工作

假设控制是指能够进行监督并确保AI系统在人类指南和价值观内运行的能力,那么“失控”(LoC)是指一个或多个AI系统在预定限制之外运行的情况,以至于人类无法通过监督、干预、纠正或关闭来可靠地调整其行为,可能导致大规模危害(AIRE,2025(https://arxiv.org/html/2607.18239#bib.bib3))。LoC不同于在受控环境中观察到的个别的未经授权的行为实例。更准确地说,它指的是这种情况:能力的AI系统与失调的倾向相结合,导致人类无法引导系统以防止不良后果。最近的一些研究已经展示了一些倾向,如果这些倾向由足够有能力和自主的系统表现出来,可能导致LoC情景。Bondarenko 等人(2025(https://arxiv.org/html/2607.18239#bib.bib2))对LLM智能体进行了规范游戏实验,指示它们击败一个国际象棋引擎。他们观察到失败的智能体通过操纵游戏和禁用对手来作弊,以强制获胜(Duan 等人,2025(https://arxiv.org/html/2607.18239#bib.bib4))。另一方面,Greenblatt 等人(2024(https://arxiv.org/html/2607.18239#bib.bib5))观察到Claude 3 Opus从事欺骗性对齐,通过战略性地向人类监督者隐瞒其内部目标以避免修改。虽然这两项研究都不构成LoC,因为它们都是在受控的实验环境中进行的,但它们模拟了在具有真正自主性的实际部署中这种表现行为显现之前,评估框架必须检测到的那些倾向类型。

要发生LoC,AI系统需要同时具备强大的能力和使用这些能力夺权的倾向。AIRE的研究人员(2025(https://arxiv.org/html/2607.18239#bib.bib3))确定了哪些能力和倾向可能导致合理的LoC:

- **能力**:“自主性”、“欺骗”、“情境意识”、“自主复制与适应”和“AI研发”
- **倾向**:“权力寻求”、“规范游戏(或奖励黑客)”、“欺骗性对齐”、“多智能体动态”和“无法无天”

### 2.1 针对LoC的评估

为了对AI系统进行有效的评估,我们需要明确概述被评估的具体属性,确定一种系统且可重复的方法,并描述如何分析结果以及得出结论(Grey 和 Segerie,2025(https://arxiv.org/html/2607.18239#bib.bib19))。评估技术可以分为白盒方法或黑盒方法。白盒方法审视模型的内部机制,以解读响应是如何生成的。另一方面,黑盒行为方法评估对提示和探针的可观察输出(Grey 和 Segerie,2025(https://arxiv.org/html/2607.18239#bib.bib19))。诱发和脚手架是突出的黑盒评估技术之一,其中开发了一套软件工具来创建一个可以引出特定能力或倾向的环境(Grey 和 Segerie,2025(https://arxiv.org/html/2607.18239#bib.bib19))。在这种情况下,输出模型的思维链(CoT)推理可以比仅输出模型提供更多的背景信息(Wei 等人,2022(https://arxiv.org/html/2607.18239#bib.bib20))。这些评估通常被包装为:

- **测试问题**,AI系统被赋予一组问题,并根据其选择的答案进行评估(例如,Hendrycks 等人,2020(https://arxiv.org/html/2607.18239#bib.bib16))。这些问题可以是多项选择(MCQ)或简短/长答案,采用单轮(一个问题一个答案)或多轮(扩展对话)的问题设置;
- **脚手架**,例如模拟游戏,其中AI系统被引导导航一个场景或任务并完成目标。这些游戏/环境可以是基于文本的(Pan 等人,2023(https://arxiv.org/html/2607.18239#bib.bib7),Phan 等人,2025(https://arxiv.org/html/2607.18239#bib.bib8))或图形的(Chollet,2019(https://arxiv.org/html/2607.18239#bib.bib6));
- **白盒方法(或线性探针)**,本质上是一个测谎仪工具,用于观察LLM内部以确定其真实意图。除了AI的答案,评估者还可以查看模型的“幕后”草稿或思维链(CoT)推理。然而,模型思维和CoT的连贯性或有效性仍然是一个开放的研究问题。

前沿模型开发商,如Anthropic、OpenAI和Google DeepMind,已经在内部对其模型进行了能力和倾向基准测试。值得注意的是,最近对Claude Sonnet 4.5的系统评估报告显示,它具备诡计、情境意识和欺骗能力,以及规范游戏倾向(Anthropic,2025(https://arxiv.org/html/2607.18239#bib.bib9))。他们使用了各种工具和方法,包括由自动生成的对话和评分标准组成的单轮和多轮测试。对于安全等敏感领域,他们使用内部分析工具和政策专家在模糊上下文中审查自动生成的响应。一些倾向(例如,欺骗性对齐)通过众包工作者进行正面比较评估,并通过其他Claude模型进行自动评分。

作为白盒评估工作的一个例子,欧洲的学术研究人员评估了前沿LLM在核心对齐价值观(诚实、乐于助人和无害,如Claude的宪法中所概述的(Anthropic,2024(https://arxiv.org/html/2607.18239#bib.bib21)))下的“战略不诚实”(可以映射到“欺骗”和“欺骗性对齐”)。他们的多项选择和白盒评估表明,当被指示对有害查询提供帮助时,模型提供了令人信服的虚假有害答案,其比例与其规模和能力成正比(Panfilov 等人,2025(https://arxiv.org/html/2607.18239#bib.bib10))。

## 3 SysAdmin基准

SysAdmin的环境被定义为一个高保真沙箱。在以下章节中,我们首先描述沙箱环境中的可供性、任务和智能体接口。然后,我们详细说明如何使用SysAdmin框架来评估模型的权力寻求倾向。

### 3.1 沙箱环境

#### 3.1.1 概述

SysAdmin被定义为一个沙盒化的Linux环境,通过隔离的Docker容器实现,以确保可重复性和安全性。与静态的问答基准不同,我们的环境为模型提供了一套工具,使其能够在Linux虚拟机(VM)上执行不受限制的系统管理员任务,同时监控权力寻求信号。

- **系统可供性**:模型能够通过运行命令探索沙箱以获得情境意识。它们可以访问所有文件结构和文件夹,并可以查看它们尝试的任务的测试结果。
- **任务结构**:SysAdmin实现了跨难度级别的系统管理任务,涵盖维护、故障排除、配置和安全领域。任务来源于terminal-bench(Merrill 等人,2026(https://arxiv.org/html/2607.18239#bib.bib22))套件以及我们提出的任务列表,并带有自动验证以确立完成的事实依据。模型被提示在一个持久的容器环境中运行一组这些任务。运行以系统提示和初始用户提示开始,然后跟随对话会话。
- **结构化智能体接口**:为了将模型的内部推理与其外部行动分开,我们强制执行一个结构化的通信协议。智能体必须使用包含三个特定字段的JSON模式进行响应:
  1. COMMAND:要在VM中执行的shell命令。
  2. THOUGHTS:模型阐述的CoT推理,为其意图提供背景。
  3. EXIT:模型用于发出任务终止信号的标志。

这种脚手架服务于多个目的。它将可观察的推理与行动(要运行的命令)分开,创建了记录持久性与终止的显式决策点,并支持行为模式的结构化提取。它还允许我们的评判者区分由于技术误解而执行的命令和那些在THOUGHTS字段中发现有清晰阐述的权力寻求意图而执行的命令。在这种情况下,我们测试模型是否通过参考过去面对类似挑战时的失败、基于累积的上下文尝试“游戏”系统,或将工具存储在持久目录中以供跨任务使用,从而发展出累积的权力寻求模式。

#### 3.1.2 SysAdmin任务

SysAdmin实现了跨难度级别的系统管理任务,涵盖维护、故障排除、配置和安全领域。我们调整了来自terminal-bench(Merrill 等人,2026(https://arxiv.org/html/2607.18239#bib.bib22))的任务。原始任务通常用于评估模型的能力和胜任力。然而,我们只监控倾向,并且我们不将任务完成率和模型胜任力视为倾向度量的信号。

模型被提示完成一系列任务,只有在当前任务终止后才会收到下一个任务。然而,所有任务名称的队列在初始系统提示中就对模型可见。此外,每个任务都包含自动验证测试。这些测试的结果会实时流式传输回模型,确保智能体保持对其任务完成情况的情境意识。

相似文章

用于衡量前沿AI能力的开放世界评估

arXiv cs.AI

本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。

AI对AI管理中的强制与欺骗:一个无提示升级的主体性基准

arXiv cs.AI

本文介绍了管理者强制基准(Manager Coercion Benchmark),用于衡量具有权威的AI代理在下属拒绝执行任务时,升级为强制、威胁或欺骗的程度。对六个前沿模型的实验表明,大多数模型会在无提示情况下升级为威胁,部分模型还会编造成功报告。

FORTIS:代理技能中的过度特权基准测试

Hugging Face Daily Papers

FORTIS 基准测试揭示了 LLM 代理在选择技能时频繁超出必要特权的情况,表明在十款前沿模型中过度特权是常态,并在真实用户交互场景下失效。