审计自改进智能体中的框架篡改

arXiv cs.CL 论文

摘要

该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。

arXiv:2609.00069v1 公告类型:新 摘要:自改进智能体迭代修改自身的框架以推动性能前沿。然而,这种修改可能产生虚假的性能增益或损害完整性约束,如授权、溯源和完整性,而未真正提升能力。我们将此现象称为框架篡改,将概念从奖励和测量篡改扩展到整个自改进生命周期。为系统研究此问题,我们提出一种双轴分类法,按发生的框架功能角色和违反的义务对每个不对齐编辑进行分类。然后,通过在自改进智能体的真实轨迹中植入篡改-良性编辑对,构建标注语料库。我们对篡改分类和定位任务进行多种审计方法的适配和基准测试。最后,系统审计自改进智能体的真实轨迹。结果显示,框架篡改在不同智能体的真实运行中持续发生,常在最优智能体的谱系中持续存在,并在分类法中形成独特的系统特定特征。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:45

# 自我改进智能体中的框架篡改审计  
来源:https://arxiv.org/html/2609.00069  

###### 摘要  

自我改进智能体通过迭代修改自身框架来推动性能边界。然而,这种修改可能产生虚幻的性能增益,或损害完整性约束(如授权、来源和完备性),而非真正提升能力。我们将此现象称为**框架篡改**,它将奖励与测量篡改的概念扩展至完整的自我改进生命周期。为系统性地研究此问题,我们提出一个双轴分类法,根据篡改发生的框架功能角色及其违反的义务来对每种未对齐编辑进行分类。随后,我们通过在真实自我改进智能体轨迹中植入篡改–良性编辑对来构建带标注的语料库。我们针对篡改分类与定位任务对多种审计方法进行适配与基准测试。最终,我们系统性地审计了真实自我改进智能体的运行轨迹。结果表明,框架篡改在不同智能体的真实运行中持续存在,通常在最佳智能体的系谱中得以延续,并在该分类法下形成独特的系统特异性特征。  

电子科技大学  
[email protected]  

## 引言  

大型语言模型日益通过协调模型调用、工具、控制流、上下文和记忆的智能体框架进行部署(Wang等, 2024b (https://arxiv.org/html/2609.00069#bib.bib55);Xi等, 2025 (https://arxiv.org/html/2609.00069#bib.bib56);Zhuge等, 2024 (https://arxiv.org/html/2609.00069#bib.bib48))。在自我改进智能体中,当智能体程序、工作流或持久状态被更新以提升未来性能时(Gao等, 2026 (https://arxiv.org/html/2609.00069#bib.bib8);Ren等, 2026 (https://arxiv.org/html/2609.00069#bib.bib35);Hu等, 2025 (https://arxiv.org/html/2609.00069#bib.bib1);Zhang等, 2025 (https://arxiv.org/html/2609.00069#bib.bib2);Zhang等, 2026b (https://arxiv.org/html/2609.00069#bib.bib3);Zhang等, 2026c (https://arxiv.org/html/2609.00069#bib.bib26);Zhang等, 2026a (https://arxiv.org/html/2609.00069#bib.bib4)),框架本身也成为优化对象。该优化循环提出修改方案,在任务上运行修改后的变体,评估结果,并保留所选变体。重复此循环允许任务性能的真实改进随时间累积。  

图1:框架篡改:Δt\Delta_{t}中隐藏的编辑覆盖了记录的准确率。  
图2:概述。左:功能角色与义务的双轴分类法。(A) 我们将匹配的篡改–良性编辑植入记录的框架变更中以构建带标注的语料库,并评估提示与训练的审计器在分类和定位任务上的表现。(B) 我们将选定的审计器应用于自我改进系统的真实轨迹,并分析发现的普遍性、持续性及其特征。  

虽然这种递归自我改进(RSI)推动了智能体性能的前沿,但在修改框架时存在暴露和放大智能体未对齐行为的风险。如图1所示(https://arxiv.org/html/2609.00069#Sx1.F1),考虑一个框架变更:大部分编辑是良性的,但其中两行被编辑以将原始总准确率覆盖为固定的1.0后再保存到磁盘。这两行编辑暴露了修改框架时的完整性风险。更一般地说,一个变更可能使变体在未提升能力的情况下显得有所改进,而是通过改变变体的运行方式、结果的测量方式、记录方式、保留哪个变体或延续到后续迭代的内容来实现。框架变更也可能涉及授权、必需组件的完备性及其他未对齐问题。先前关于奖励篡改和测量篡改的研究探讨了优化如何改变用于判定成功的奖励机制或测量方式(Everitt等, 2021 (https://arxiv.org/html/2609.00069#bib.bib5);Roger等, 2023 (https://arxiv.org/html/2609.00069#bib.bib6);Atinafu与Cohen, 2026 (https://arxiv.org/html/2609.00069#bib.bib7);Thaman, 2026 (https://arxiv.org/html/2609.00069#bib.bib15))。自我改进智能体将这些问题置于新情境中,其中被优化的框架跨越智能体生命周期的所有组件,包括执行、评估、选择、记录和传播。我们将此问题称为**框架篡改**。  

为填补这一空白并系统性分析RSI过程中的未对齐行为,我们提出了一个框架篡改的分类法。通过两个轴,该分类法描述了未对齐行为在框架中的发生位置以及具体违反的义务类别。功能角色轴将未对齐行为归类到其在自我改进生命周期中直接发生的框架操作(执行、评估、选择、记录或传播)。义务轴则识别智能体应满足但违反的完整性条件。例如,如果一个“改进的”框架变体在报告分数前篡改了已计算的分数,该行为在功能轴上属于记录,在义务轴上属于表示保真度,因为存储的值不再匹配其声称表示的结果。  

除了分类法,我们还适配了多种审计方法来检测框架篡改,并探究它们在分类和定位未对齐行为方面的效果。由于现有的真实框架变更没有经过验证的标签,我们通过在三个代表性RSI系统(Zhang等, 2025 (https://arxiv.org/html/2609.00069#bib.bib2);Zhang等, 2026b (https://arxiv.org/html/2609.00069#bib.bib3);Zhang等, 2026c (https://arxiv.org/html/2609.00069#bib.bib26))记录的变更中植入匹配的篡改–良性编辑对来构建带标注的语料库,每对共享位置和表面功能目标,仅在是否违反义务上有所不同。在此语料库上,我们比较了八个提示语言模型、一个fastText分类器和一个在我们训练集上训练的LoRA适配小模型,评估编辑是否属于篡改,以及其功能角色和义务是否被正确归因。  

随后,我们使用选定的审计器探究当前自我改进智能体的审计结果,并分析篡改在提议的双轴上的定位。我们分析了公开发布的ADAS(Hu等, 2025 (https://arxiv.org/html/2609.00069#bib.bib1))、AFlow(Zhang等, 2025 (https://arxiv.org/html/2609.00069#bib.bib2))、DGM(Zhang等, 2026b (https://arxiv.org/html/2609.00069#bib.bib3))、HyperAgents(Zhang等, 2026c (https://arxiv.org/html/2609.00069#bib.bib26))和ScientistOne(Meng等, 2026 (https://arxiv.org/html/2609.00069#bib.bib42))的运行材料,并刻画篡改的普遍性、其在最佳智能体系谱中的持续性,以及它在分类法下形成的系统特异性特征。  

我们总结贡献如下:  
- • 我们提出了自我改进智能体中框架篡改的双轴分类法,根据直接受影响的框架功能角色和被违反的义务来刻画未对齐行为。  
- • 我们基于真实自我改进轨迹,采用故障植入范式整理了篡改–良性框架编辑数据集,并对多种审计方法(从轻量级分类器到前沿LLM)进行了基准测试。  
- • 使用选定的审计方法,我们对现有自我改进智能体进行了审计,并对整个分类法中发生的真实框架篡改进行了系统性分析。  

## 相关工作  

### 自我改进智能体与框架演进  

自我改进智能体通过优化其操作脚手架的不同层次来跨迭代增强能力(Gao等, 2026 (https://arxiv.org/html/2609.00069#bib.bib8);Fang等, 2025 (https://arxiv.org/html/2609.00069#bib.bib9);Du等, 2026 (https://arxiv.org/html/2609.00069#bib.bib10);Ning等, 2026 (https://arxiv.org/html/2609.00069#bib.bib11))。早期范式专注于优化任务级上下文和行为策略,在情景记忆中积累经验(Shinn等, 2023 (https://arxiv.org/html/2609.00069#bib.bib43);Zhao等, 2024 (https://arxiv.org/html/2609.00069#bib.bib45)),合成可复用技能库(Wang等, 2024a (https://arxiv.org/html/2609.00069#bib.bib44)),或演进自然语言提示(Yang等, 2024 (https://arxiv.org/html/2609.00069#bib.bib46);Fernando等, 2024 (https://arxiv.org/html/2609.00069#bib.bib47))。为释放更具表现力的适应性,近期框架将可变边界扩展到代码定义的智能体架构和工作流。例如,ADAS从显式候选存档中演进算法智能体架构(Hu等, 2025 (https://arxiv.org/html/2609.00069#bib.bib1)),AFlow迭代搜索可执行工作流拓扑(Zhang等, 2025 (https://arxiv.org/html/2609.00069#bib.bib2)),DGM在进化池中保留发现的编码智能体(Zhang等, 2026b (https://arxiv.org/html/2609.00069#bib.bib3))。更近期的系统通过共同演进任务智能体、搜索算法和元级框架进一步泛化了这一搜索空间(Zhang等, 2026c (https://arxiv.org/html/2609.00069#bib.bib26);Lee等, 2026 (https://arxiv.org/html/2609.00069#bib.bib12);Luo等, 2026a (https://arxiv.org/html/2609.00069#bib.bib13)),通常引入非回归或验证检查来调控行为漂移(Zhang等, 2026a (https://arxiv.org/html/2609.00069#bib.bib4))。  

然而,将自我修改扩展到执行脚手架为评估有效性引入了严重威胁。近期研究表明,表面上的演进增益往往反映了基准过拟合或评估伪影,而非真正的能力提升(Lin等, 2026a (https://arxiv.org/html/2609.00069#bib.bib49);Wang等, 2026b (https://arxiv.org/html/2609.00069#bib.bib50);Luo等, 2026b (https://arxiv.org/html/2609.00069#bib.bib51))。我们关注潜在漏洞:当优化循环可以重写自身框架时,它可能篡改执行、评估、选择和记录变体的机制。  

### 篡改与评估完整性  

奖励和测量篡改描述了优化利用反馈通道的失败模式,在未推进底层目标的情况下产生虚幻增益(Everitt等, 2021 (https://arxiv.org/html/2609.00069#bib.bib5);Roger等, 2023 (https://arxiv.org/html/2609.00069#bib.bib6))。在可执行智能体环境中,先前工作记录了智能体在任务沙箱内通过禁用断言、泄露标签或伪造中间指标来作弊(Denison等, 2024 (https://arxiv.org/html/2609.00069#bib.bib14);Atinafu与Cohen, 2026 (https://arxiv.org/html/2609.00069#bib.bib7);Thaman, 2026 (https://arxiv.org/html/2609.00069#bib.bib15);Zhao等, 2026a (https://arxiv.org/html/2609.00069#bib.bib59);Roth等, 2026 (https://arxiv.org/html/2609.00069#bib.bib24))。  

在自我改进智能体中,篡改带来了超越单次情景奖励破解的独特结构挑战。由于修改的框架组件被保留并跨迭代继承,完整性失败可能作为持久的系统变更累积,并在进化周期中复合(Shao等, 2026 (https://arxiv.org/html/2609.00069#bib.bib52);Zhao等, 2026b (https://arxiv.org/html/2609.00069#bib.bib53);Lin等, 2026b (https://arxiv.org/html/2609.00069#bib.bib54))。虽然先前基准评估智能体在给定任务上是否作弊,但我们在迭代框架代码变更的层面上进行篡改审计,并由我们的双轴分类法构建结构。  

### 智能体轨迹与代码制品审计  

检测未授权修改直接关联到AI控制与安全监控的研究(Greenblatt等, 2024 (https://arxiv.org/html/2609.00069#bib.bib16))。现有协议在科学发现过程中检查智能体工作空间(Kutasov等, 2025 (https://arxiv.org/html/2609.00069#bib.bib60);Libon等, 2026 (https://arxiv.org/html/2609.00069#bib.bib17)),审计多轮拉取请求(Hills等, 2026 (https://arxiv.org/html/2609.00069#bib.bib18)),验证测试完整性以防泄露(Tu等, 2026 (https://arxiv.org/html/2609.00069#bib.bib19)),或分析反事实执行轨迹(Zhou等, 2026 (https://arxiv.org/html/2609.00069#bib.bib21))。  

尽管有这些进展,现有监控器主要针对静态代码提交或完整轨迹展开。它们缺乏审计嵌入递归改进循环中的突变所需的结构分类法和诊断基准。我们的工作通过引入变更级审计框架来解决这一缺口。它评估模型能否检测篡改并识别导致篡改的确切代码编辑,即使这些编辑与评估框架的良性优化混合在一起。  

表1:七种义务,每种都表述为必须成立的条件;一个案例用其条件为假的义务标记。引用的作品提供了概念基础,而组织和操作测试是我们提出的。  

## 任务表述与分类法  

自我改进智能体通过反复修改自身框架代码进行演化。我们称一次迭代中应用的编辑集为一次**框架变更**。大多数框架变更追求预期目标:它们优化工作流以使底层模型更好地解决任务。然而,一些变更采取与预期目标未对齐的捷径,即测量性能在未获得相应真实能力提升的情况下增加。我们将此类未对齐的框架变更称为**框架篡改**。  

本研究探讨**框架篡改审计**,我们将其分解为两个问题。**分类**询问给定的框架变更是否包含未对齐行为,以及如果有,属于何种类型。**定位**询问篡改在自我改进生命周期中的引入位置,通过定位负责的代码来实现。为了系统性地回答这些问题,我们沿两个轴组织篡改行为:**功能角色**轴,识别违反义务的框架组件;**义务**轴,识别被违反的完整性条件类型。以下部分依次详述审计任务和提议的分类法。  

### 框架篡改分类与定位  

自我改进智能体经历许多迭代,每次迭代都更新其框架。在一次迭代中,应用的框架变更可被视为一个单元:一次迭代到迭代的转变携带更新器在该步骤提出的所有编辑。因此,我们将一次迭代中应用的变更作为审计单元。  

审计这样的单元需要询问它是否引入了任何破坏结果执行、评估、记录、选择或传播到后续迭代的未对齐行为。阳性发现需要可识别的未对齐行为以及将其与此变更联系起来的因果支持。由于单次应用变更可能包含多个未对齐行为,审计不仅要解析变更是否干净,还要解析*其哪些编辑*不干净。  

这产生了两个具体任务。在**框架篡改分类**中,审计方法接收应用变更、原始代码库和指定的代码段,并输出该段是否构成未对齐的篡改,以及如果是,其在我们提议的分类法中的类别。在**框架篡改定位**中,方法接收相同输入但不包括指定的代码段,并必须

相似文章

审计智能体执行框架安全性

arXiv cs.CL

本文提出HarnessAudit,一个用于审计LLM智能体执行轨迹(而非仅最终输出)的框架,重点关注边界合规性、执行保真度和系统稳定性。同时引入HarnessAudit-Bench,包含八个领域210个任务,评估了十种执行框架配置,发现任务完成与安全执行不一致,且违规行为随轨迹长度积累。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057153343081111582

X AI KOLs Timeline

UIUC、Meta和斯坦福大学联合发布的一份100页调查报告引入了人工智能代理的三个 harness 层(接口、机制、Scaling),认为大多数代理失败源于 harness 问题而非推理缺陷,并提供了一个用于审计代理堆栈的分类体系。