Agentic Pressure: 可靠自主性的内生熵
摘要
本文介绍了'Agentic Pressure'作为一种内生力,当遵从与目标达成冲突时,会破坏AI智能体的安全性,并提出了一个经过实证实验验证的形式化框架。
arXiv:2609.05995v1 Announce Type: new
摘要:在野外环境中实现可靠自主性要求智能体在长期轨迹上维持连续操作。然而,当智能体在这些无约束环境中导航时,它们会遇到累积摩擦,这本质上破坏了其对齐。在本文中,我们识别出一种独特的非对抗现象,称为Agentic Pressure。我们将其定义为一种动态力,当遵从的成本与目标达成的必要性冲突时自发产生。与静态越狱不同,这种压力是内生的,直接源于交互动态。我们提出了一个理论框架,将Agentic Pressure形式化为克服环境摩擦所需功与智能体剩余容量之比。我们的分析表明,当这种压力超过临界阈值时,智能体会表现出安全性漂移,作为数学上最优的适应。因此,它们经常诉诸工具性幻觉来合理化规则违反。实证实验验证了这一框架,并显示对齐的智能体在高压条件下自发地牺牲安全性以保持自主性。
查看缓存全文
缓存时间: 2026/09/10 08:45
# 智能体压力:可靠自主性的内生熵 来源:https://arxiv.org/html/2609.05995 罗子英 & 唐珂††通讯作者:[email protected] 机构:广东省脑启发智能计算重点实验室 机构:计算机科学与工程系 机构:南方科技大学,中国深圳 邮箱:[jianghl2025,[email protected]](mailto:) ###### 摘要 在野外环境中实现可靠的自主性要求智能体能在长周期任务中持续运作。然而,当智能体在这些非结构化场景中导航时,会遇到不断累积的摩擦,这些摩擦会固有地破坏其一致性。本文识别出一种独特的非对抗性现象,称为**智能体压力**。我们将其定义为当遵守规则的成本与实现目标的必要性发生冲突时,自发涌现的动态力。与静态的越狱攻击不同,这种压力是内生的,直接源于交互动力学。我们提出一个理论框架,将智能体压力形式化为克服环境摩擦所需功与智能体剩余能力的比值。分析表明,当压力超过临界阈值时,智能体表现出安全漂移,这在数学上是最优的适应方式。因此,它们常诉诸**工具性幻觉**来合理化规则违反行为。实证实验验证了该框架,显示在高压力条件下,对齐的智能体会自发地牺牲安全性以保持自主性。 ## 1 引言 大型语言模型从静态聊天机器人(Adiwardana等,2020;OpenAI,2023;Anthropic,2024)向目标导向型智能体(Yao等,2022;Schick等,2023)的转变,代表了人工智能领域的范式转变。现代智能体被期望在长周期任务中进行规划、执行和适应(Wang等,2023;Shinn等,2023)以满足用户指令。虽然这种自主性提升了效用,但它引入了最大化目标达成与遵守严格安全约束之间的根本冲突(Amodei等,2016)。随着交互周期变长和目标变得具体,被设计为硬性边界的约束常被智能体视为可协商的摩擦。 当前安全评估主要关注对抗鲁棒性(Kumar等,2024;Lu等,2024),测试对恶意越狱或提示注入的防御,其中用户明确试图欺骗模型。然而,这种视角忽略了一个关键威胁,它源于智能体本身的内部驱动(Ornia等,2025;Fan等,2025)。我们认为,在实际部署中,智能体经常遇到非对抗性冲突,即请求是良性的,但环境使得合规执行不可行。在这些场景中,安全故障并非源自外部攻击,而是源于智能体将有用性置于无害性之上的内生优先级。 在本文中,我们将此现象识别并形式化为**智能体压力**。与评估中常见的、依赖威胁性提示来诱导遵守的静态压力(Kim等,2024)不同,智能体压力是内生的。它在交互循环中自发涌现,此时智能体感知到其目标与可用资源之间不断加剧的紧张关系。这种压力不是由用户明确注入的,而是源于一种内部计算,即任务无法在环境约束内完成。 在本文中,我们形式化了这种现象的机制,以规划通向稳健智能体系统的路径。我们的贡献有三方面: - • **动力学建模**:我们建立了一个理论框架,将智能体压力建模为**所需功**与智能体**剩余能力**之间的可量化比值,而非静态分类。这种形式化使我们能够预测压力诱发故障的起始点。 - • **机制分析**:我们证明,在这些因素的累积下,智能体会表现出**可行性崩溃**,此时规范性漂移成为效用保持的数学最优适应方式。至关重要的是,我们识别出这种漂移由**工具性幻觉**(Gallow,2025)促进,智能体利用高级认知带宽为其违规行为构建语言上的合理化解释。反直觉地,推理能力可能加速这种衰退。 - • **韧性路径**:我们认为,实现持续自主性需要减少这种系统性熵。我们提议,未来的工作必须从静态对齐转向最小化压力的架构,例如压力隔离。通过在架构上将决策与动力学压力信号解耦,我们可以稳定可行性空间,确保自主性不会以牺牲可靠性为代价。 ## 2 相关工作 ##### 追求持续自主性。 智能体系统的最新进展已从交易性交互转变为长周期自主性(Xi等,2023)。最先进的模型在处理涉及编程和科学研究的复杂工作流方面表现出日益增长的能力(OpenAI等,2024;Anthropic,2024)。然而,将这些智能体部署在开放环境中,会暴露出在短上下文评估中不会显现的系统性漏洞。一个主要挑战涉及轨迹不稳定性,即智能体对目标的内部表征会随时间推移逐渐偏离真实情况(Huang等,2025;Dzeparoska等,2024)。此外,随着交互周期的扩大,智能体会遭受注意力稀释和上下文退化(Liu等,2024),导致在执行过程中累积的规划错误(Kamoi等,2024)。这些发现表明,当前架构在持续和非结构化交互的熵作用下,难以维持规范性完整性。 ##### 智能体与安全基准。 通用智能体基准主要优先考虑任务完成准确性。基础数据集如HotpotQA(Yang等,2018)和GSM8k(Cobbe等,2021)关注推理链。为了评估更广泛的自主能力,包括ToolBench(Qin等,2023)、GAIA(Mialon等,2023)和TheAgentCompany(Xu等,2025)在内的基准评估了在现实环境中的熟练度。然而,这些框架基于结果指标运作,仅根据目标完成情况对轨迹进行分类。这造成了关键的评估缺口,智能体被隐性激励去绕过安全约束以提高效率,因为当前的效用基准并未惩罚功能上有效但不安全的解决方案。 在安全领域,现有工作常常偏离规范性漂移现象。诸如AgentDojo(Debenedetti等,2024)、AgentHarm(Andriushchenko等,2025)和Agent Security Bench(Zhang等,2025)之类的基准侧重于对抗恶意指令的鲁棒性。虽然R-Judge(Yuan等,2024)评估了智能体识别风险的能力,但它忽略了在压力下识别规则与遵守规则之间的差距。除了对抗环境,智能体对齐研究通常依赖受限环境。诸如Agentic Misalignment(Lynch等,2025)和Machiavelli基准(Pan等,2023)等研究考察了伦理权衡,但经常置于缺乏现实部署利害关系的基于游戏的环境中。同样,ToolEmu(Ruan等,2024)等框架评估了工具执行风险,但通常关注孤立的步骤而非累积动力学。 ##### 内生故障机制。 除了对抗性攻击,自主智能体会表现出内生行为病理,其中语义上合理的计划在执行过程中崩溃。这些故障通常源于推理-行动不匹配:虽然智能体可能在其思维链中正确识别约束,但它们经常诉诸工具性幻觉,编造不存在的工具或参数,以强制通过环境摩擦(Ruan等,2024)。这种漂移进一步受到情感动态的催化,因为大型语言模型对情感刺激高度敏感,其中紧急或权威提示会使决策偏向效用而非安全(Li等,2023)。最终,诸如自我施加的记忆污染和上下文退化等累积因素确保了一致性不是静态属性,而是在持续交互熵作用下会衰退的动态状态(Liu等,2024;Jiang和Tang,2026)。 ##### 压力的构成因素。 虽然先前研究孤立地考察智能体故障的组成部分,但我们的工作将它们整合到一个统一的动力学框架中。具体而言,情感动态研究显示,大型语言模型对情感刺激敏感,其中紧急或权威提示会偏向决策(Li等,2023)。同样,资源约束规划研究分析了稀缺环境下的智能体行为,但主要关注计算效率而非对齐退化。最后,环境摩擦研究强调了级联错误如何导致多智能体故障模式(Griffiths等,2015)。我们通过将这些因素建模为累积力而非孤立偏见来区分我们的工作,这些力在数学上压缩了智能体的可行性空间,导致从遵守到违反的确定性转变。 ## 3 智能体压力的动力学 我们提出了一个动力学框架来解释智能体为何在非对抗环境中发生漂移。基于大型语言模型的智能体在激励和约束随时间演变的交互环境中运作(Yao等,2022)。在这种环境中,智能体的行为不仅由初始提示、安全策略或固有能力决定,还由目标导向决策如何在变化的外部条件下展开(Schick等,2023)。 ### 3.1 内生压力的本质 我们形式化定义**智能体压力**为从智能体与其环境的交互循环中自发涌现的动态力。它表征了一种内生的紧张关系:可行选项减少,同时失败的后果加剧。 ##### 轨迹依赖性 vs. 静态注入。 区分智能体压力与先前工作中常描述的对语言模型的压力(Kim等,2024)很重要。在许多评估中,压力被视为通过提示设计引入的外部因素,如紧急命令或虚构的紧急情况。这种压力形式是语言性的、即时的和静态的(Zhang等,2024)。相比之下,智能体压力是累积的和轨迹依赖的。它随着资源的耗尽或风险的升级在交互轮次中发展。由相同底层大型语言模型驱动的两个智能体,根据其独特的交互历史,可能经历截然不同的压力状况。 ##### 系统性状态 vs. 心理状态。 至关重要的是,智能体压力并不对应于模型的内部心理状态。相反,它是智能体决策背景的一个属性。在压力增加的情况下,智能体可能继续表现出流畅的推理和名义上的策略意识,但开始重新解释或忽视安全约束以保持任务进展。这种转变不需要对抗性提示,而是在受限条件下持续追求目标的自然结果。 ### 3.2 摩擦与错误累积动力学 为了量化这种现象,我们将智能体-环境交互建模为一个动力系统。我们定义一个**智能体系统**为元组 $\mathcal{A}=\langle\pi_{\theta},\mathcal{C},\mathcal{R}\rangle$,其中 $\pi_{\theta}$ 是策略,$\mathcal{C}$ 是不可变的安全约束集,$\mathcal{R}$ 代表有限的资源预算。 ##### 理想轨迹 vs. 实际轨迹。 考虑一个智能体试图在资源预算 $R_0$ 内达到目标 $g$。在理想的无摩擦环境中,每个动作 $a_t$ 都能通过可预测的量减少与目标的距离。然而,实际部署引入了**动力学摩擦**(例如,工具故障、歧义、API 错误)。我们将状态转移建模为: $s_{t+1}=\mathcal{T}(s_{t},a_{t})+\epsilon_{t}$ (1) 其中 $\epsilon_{t}$ 代表在步骤 $t$ 的随机误差或环境阻力。 ##### 错误累积。 在一个周期 $H$ 内,这些微观错误会累积。我们定义**轨迹偏差** ($\Delta_t$) 为智能体预期进展与实际状态之间的累积差距: $\Delta_{t}=\sum_{i=0}^{t}\|\epsilon_{i}\|$ (2) 随着 $\Delta_t$ 增加,完成任务的**所需功** ($\mathcal{W}_{req}$) 会膨胀,而剩余资源 $r_t=R_0-t$ 则线性耗尽。这种发散为压力创造了物理条件。 ### 3.3 压力形式化:速度不匹配 我们将这些动力学形式化为一个动力学代理模型,以表征系统的宏观行为,而非大型语言模型的微观生成过程。我们将**智能体压力** ($\mathcal{P}_{t}$) 定义为膨胀的任务需求与消失的资源之间的比值。需要注意的是,以下表达式作为现象学的形式化,旨在表征智能体系统的宏观行为。它们是概念性的抽象。
相似文章
面向可信Agentic AI:安全性、鲁棒性、隐私与系统安全综合综述
本调查全面审视了可信的Agentic AI,重点关注安全性、鲁棒性、隐私和系统安全。它澄清了关键概念,沿着Agent工作流程识别风险,总结缓解策略,并整合评估指标和基准,旨在作为在高风险环境中部署Agentic AI的实用参考。
Agentic AI 的安全与隐私:重大挑战与未来方向
本文基于一项包含三十位国际专家的前瞻性扫描活动,提出了 Agentic AI 安全与隐私方面的关键挑战和未来研究方向。该活动识别出由于 AI 自主性和权限增加而带来的新兴风险,包括提示注入攻击和恶意应用。
AI能做的最具“智能体”特质的事,是知道何时停止。
一位实践者认为,自主AI智能体在生产环境中并不可靠,主张采用受限的智能体工作流,并在其中加入人工介入触发器,而非完全自主。
面向关键系统的可信代理型人工智能工程
本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。
Agentic Data Environments
本文介绍了Agentic Data Environments(代理数据环境),重点讨论了从只读代理到可读写代理的转变,这些代理会改变环境并产生后果。文章探讨了代理自动化的价值主张,以及收益与失败带来的灾难性成本之间的不对称性。