盲人策展人:有偏见的评委如何悄无声息地禁用自进化代理中的技能退出机制

arXiv cs.CL 论文

摘要

本文研究有偏见的LLM评委如何悄无声息地禁用自进化代理中的技能退出机制,表明跨越尖锐阈值的假阳性偏差阻止了基于贡献的退出,且该失败跨领域普遍存在,只能通过缺陷注入审计检测到。

arXiv:2607.07436v1 公告类型: cross 摘要: 自进化代理通过观察失败来退出不良技能,那么当评委看不到失败时会发生什么?技能退出是一种结构约束,用于防止不断增长的技能库漂移至无技能基线以下,但其保证假设奖励是无偏的,这对于无参考任务强加给我们的LLM评委来说是不成立的。我们证明有偏见的评委不仅仅是增加噪声;它\emph{悄无声息地关闭了策展人}。我们通过 corrupted-reward 分析精确说明了这一点,并通过在确定性奖励之上注入 corruption 来隔离因果通道,在无参考报告写作测试床(结合代码生成交叉检查)上进行行为研究。对称噪声不会影响技能退出,但\emph{假阳性}偏差(失败被误判为通过)会在一个即使大量数据也无法跨越的尖锐阈值之后禁用基于贡献的退出。将真正的退出与上限驱逐波动分开,表明这种\emph{机制}失败是普遍的,跨领域和失败率,只放过接近零假阳性、类似验证器的评分器。然而,下游\emph{结果}是依赖状态的:评估质量仅在相同 corruption 也导致技能合成匮乏时下降,否则保持稳定,因此被禁用的策展人是\emph{沉默的},不会在任何聚合指标中浮现。贡献是行为安全结果,而非性能结果。一个廉价的缺陷注入审计可以在部署前告诉操作员他们的评委位于阈值的哪一侧。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:53

# 有偏见的裁判如何悄无声息地禁用自我进化智能体的技能退役  
来源:https://arxiv.org/html/2607.07436  
Xing Zhang1, Yanwei Cui1, Guanghui Wang1, Ziyuan Li2, Wei Qiu2, Bing Zhu2, Peiyang He1 1AWS Generative AI Innovation Center 2HSBC Holdings Plc\., HSBC Technology Center, China  

###### 摘要  

自我进化智能体通过观察自身技能的失败来淘汰不良技能,那么当裁判无法察觉到这些失败时,会发生什么?技能退役是一种结构性约束,它防止不断增长的技能库漂移到低于无技能基线的水平,但其保证依赖于一个无偏的奖励信号,而这对于无参考任务迫使我们必须使用的LLM裁判来说,并不成立。我们证明,有偏见的裁判不仅是添加噪声,而是*悄无声息地关闭了策展人*。我们通过一个损坏奖励分析来精确阐明这一点,并通过在一个确定性奖励之上注入损坏来隔离因果通道,在一个无参考的报告撰写测试平台(配合代码生成交叉检查)上进行行为学研究。对称噪声不会影响退役机制,但*假通过*偏差(失败被误报为通过)会在一个任何数据量都无法跨越的尖锐阈值之后,禁用基于贡献的退役。通过将真正的退役与容量驱逐的搅动区分开,我们表明这种*机制*失效是普遍的,跨领域和失败率都成立,只避免了接近零假通过、类似验证器的评分者。然而,下游的*结果*却是与场景相关的:评估质量仅在相同损坏也导致技能合成匮乏时才会下降,否则保持稳定,因此被禁用的策展人是*沉默的*,不会在任何聚合指标中显现。贡献在于行为安全结果,而非性能结果。随后,一种廉价的缺陷注入审计可以在部署前告知操作员,他们的裁判位于阈值的哪一侧。  

## 1 引言  

一个不断积累技能但缺乏治理的自我进化智能体会退化,因为陈旧和重复的条目会侵占检索空间,这种失败模式最近被称为*库漂移*(Zhang et al., 2026a)。智能体早已学会通过自身失败来合成新技能(Wang et al., 2023; Zhao et al., 2024);缺失的一环是*治理*——在有限容量下*淘汰*那些不再有帮助的技能。Ratchet(Zhang et al., 2026b)精确地实现了这一点:退役机制防止不断增长的技能库在无技能基线以下漂移超过一个固定范围。但这一保证建立在一个隐蔽的假设之上:告诉智能体哪些技能失败了的信号是*诚实的*(每个技能的贡献估计器是无偏的)。编码和QA任务可以通过单元测试和精确匹配评分器满足这一假设;但智能体越来越多面对的任务(研究综合、长文本报告、分析)却无法做到:没有标准答案,唯一可扩展的评分器就是LLM裁判(Zheng et al., 2023),而它的错误并非白噪声。裁判的系统性偏差不仅仅是简单的不一致(Wang et al., 2024a; Stureborg et al., 2024),它们倾向于放过某些失败类别(一个自信的错误引用;一个流畅但翻转的结论),因此其错误是*非对称的*:失败被报告为通过。结果是产生了一个*盲目的策展人*(图1):本应淘汰不良技能的那个组件再也看不到它赖以运作的证据。如果说库漂移是治理所要治愈的疾病,那么当奖励信号本身不可靠时,策展人失明就是这种治疗本身遭遇的厄运。  

![图1](https://arxiv.org/html/2607.07436#S1.F1)  

图 1:*盲目的策展人*失效模式。在诚实奖励(左)和*假通过*裁判(右)下的同一个失败驱动循环(解决→判断→淘汰):假通过切断了Judge→Curator的证据链,因此退役悄无声息地停止,而聚合结果可能看起来正常。差距在一个尖锐的阈值处出现。  

我们将这种非对称性作为研究对象。我们的论点围绕奖励通道中的*两个可分离旋钮*展开:对称噪声率ρ(真实标签任意方向翻转),以及假通过率ρF→P(真实失败中被报告为通过的比例,实验中使用q表示)。智能体对它们的响应截然相反。它能够优雅地容忍噪声,但在ρF→P处遭遇*悬崖*:当ρF→P > (1−τ)/2时,在这个通道下,任何数据量都无法挽救退役(第4节)。我们的贡献是:  

- • **一种具有场景相关后果的通用机制失效。** 跨越四个子集和两个领域(第6-8节),并通过将真正的贡献型退役与容量驱逐的搅动区分开,我们证明假通过偏差在每个场景中都(在悬崖后)禁用了*策展人*(接近零假通过的验证器类评分者幸免;悬崖以下生存依赖于技能边际),而下游的*结果*损害是场景相关的:它仅在相同损坏也导致合成匮乏时才出现,否则沉默无声。对称噪声是可存活的;严格的裁判安全但容易导致合成匮乏。  
- • **一种部署前的通过/不通过测试(图5)。** 一个构建了真实标注的测试平台和一个缺陷注入*审计*,可以精确定位任何裁判的错误率,因此操作员可以在信任自我进化之前将他们的裁判定位到阈值附近(第5节)。  
- • **非对称性存在的原因。** 一个偏差感知的非发散界(命题1′):噪声仅会衰减退役信号,而假通过偏差会将其推过一个无法恢复的阈值。  

这是一项以行为为中心的研究:我们不问任务成功率是否上升,而是问*技能库如何演化*,以及在有限容量下的退役何时能可靠地引导它,何时会悄无声息地失败。这种审计是对奖励的行为测试套件;盲目的策展人是对聚合指标从未揭示的过程级失效的机理描述。  

## 2 相关工作  

技能库与语言自我改进。一系列工作让冻结的LLM智能体通过从自身经验中积累*文本*制品(而非更新权重)来改进:可复用技能(Wang et al., 2023)、蒸馏经验(Zhao et al., 2024)、指令手册(Chen et al., 2024)、情景反思(Shinn et al., 2023)、工作流记忆(Wang et al., 2024b),以及作为梯度替代的自然语言反馈(Yuksekgonul et al., 2024; Madaan et al., 2023)。第二波研究加强了技能创造本身,通过从轨迹中归纳蒸馏(Ni et al., 2026)、自主创造与进化循环(Huang et al., 2025; Yang et al., 2026),以及RL耦合的技能增长(Xia et al., 2026),相关基准也测试了迁移能力(Li et al., 2026)和生命周期视角(Wu et al., 2025),并支撑了类似操作系统的智能体记忆(Packer et al., 2023)。一个反复出现的弱点是技能库只会增长(*库漂移*,Zhang et al., 2026a),且几乎所有工作都假设驱动积累的结果信号是*正确的*;我们问的是当它不正确时会发生什么。  

技能生命周期治理。与我们的工作最接近的是将技能集视为需要*治理*而非仅仅增长的一类研究:从收集到演化的生命周期治理(Liu et al., 2026)、基于智能体RL的动态生命周期管理(Shen et al., 2026),以及轨迹驱动的自我适应(Yu et al., 2026; Cui et al., 2024)。所有这些工作都共享一个前提:不良技能必须被修剪,但都假设修剪信号是可信赖的。我们的贡献先于治理策略:我们刻画了*任何*此类策略所消费的*信号*何时可靠到足以使修剪有益而非有害。  

我们在此基础上构建的Ratchet机制。我们从Ratchet(Zhang et al., 2026a;b)出发,这是一种基于冻结LLM的最小方法:Critic为每个失败任务打标签,Synthesizer将重复出现的失败模式转化为技能,Router每项任务最多检索一个技能,并且至关重要的是,Curator在足够试次后*淘汰*任何经验贡献低于阈值的技能,并对活跃技能设置硬上限。退役加上限产生了一个*非发散*保证:在固定任务分布上,期望性能不会低于无技能基线超过一个固定范围。我们采用Ratchet是因为,据我们所知,它是唯一具有这种保证的自我进化技能方案。因此,它是探究保证在非完美奖励下是否存活的自然对象,因为它的证明正是不可靠裁判可能破坏的东西。它先前仅用干净的验证器进行评估(MBPP+上的单元测试,Austin et al., 2021; Liu et al., 2023;SWE-bench Docker harness,Jimenez et al., 2024);我们将其迁移到其保证从未被测试过的无验证器场景。  

LLM作为裁判的可靠性与含噪监督。我们场景中的奖励就是LLM裁判(Zheng et al., 2023),这是将AI反馈转化为学习信号的标准方式(Bai et al., 2022)。大量工作表明这类裁判存在系统性偏差而不仅仅是噪声:位置、冗长性和自我增强效应(Zheng et al., 2023)、顺序依赖性可能翻转判决(Wang et al., 2024a)、多次运行的不一致性(Stureborg et al., 2024),以及近期综述中列出的更广泛注意事项(Li et al., 2024)。当可以学习到廉价的可执行验证器时(Pezeshkpour & Hruschka, 2026),我们的关切就不存在;我们的焦点恰恰是那些不存在验证器的场景。我们贡献的并非又一项可靠性研究,而是裁判错误*非对称性*通过特定学习机制的*传播*。最接近的经典框架是类别条件标签噪声,但在这里,“标签”控制着闭环内的*生命周期决策*(退役),因此非对称噪声会复合:未被淘汰的不良技能持续被路由,产生更多损坏的证据。灾难性遗忘(Kirkpatrick et al., 2017)的类比并非权重覆写,而是有害技能在盲目策展人无法再修剪时的沉默保留。  

## 3 设置:报告撰写中的失败驱动进化  

为何选择这个测试平台。这一现象仅存在于奖励是不可靠裁判的场景中,即没有标准答案的任务,这排除了Ratchet所依赖的验证器支持的基准(MBPP、SWE-bench)。我们需要一个任务,它(i)真正无参考,(ii)但具有我们可以视为真值并加以损坏的*客观*子信号,以及(iii)展示出可见/不可见失败的区分,这使裁判既必要又易出错。长篇、引用驱动的报告撰写符合条件:没有黄金报告,但引用规范是可检查的,而来源忠实性则不是。我们从生产级深度研究引擎中提取任务;第8节测试它们能在多大程度上迁移到有验证器的领域。  

任务与奖励。一次试验组合一个报告章节,使用冻结的*证据片段*(其卡片、度量值以及允许的交叉引用;附录A),仅引用片段中的卡片,注释每个数字,并满足结构合同。155个片段来自五个完整的深度研究报告;冻结它们使得试验廉价(一次LLM调用)且可独立同分布重放,这对退役统计需要。奖励是一个确定性评分器,检查五个*质量控制(QC)*项目(孤立引用、未注册度量、裸数字、损坏的交叉引用、缺失TL;DR);PASS表示零违规。由于它无参考但客观,我们将其视为真值y,并在其上施加损坏通道ỹ;缺陷按这些检查是否能捕获分为“QC可见”或“QC不可见”。  

进化循环。我们不加修改地运行治理堆栈(图1中概述的解决-判断-淘汰循环)。这里的技能是组合规范(引用覆盖习惯、措辞模板),作为提示指导注入。  

失败是整个循环运行的唯一输入。这是假通过偏差如此有害的结构性原因,并且它不仅适用于此方案,而是适用于任何失败驱动的方案。观察到的失败是*唯一*同时供给循环两半的信号:Synthesizer将其聚类成新技能,而Curator根据某个技能的观察失败/通过计数来淘汰它。因此,假通过裁判(ỹ将真实失败报告为通过)在源头造成损害:它(i)缩小了观察到的失败池,这(ii)使*合成*匮乏(聚类用失败更少),并且(iii)抬高了每个技能的观察通过率,使得*Curator*看不到任何跨越−τ的东西。相反的损坏(真实通过报告为失败)只注入*幻影*失败,是循环作为噪声容忍的额外燃料。我们研究的非对称性因此内嵌于循环对失败的依赖中,而这正是生产部署记录和行动的信号。  

硬子集。由于一个胜任的撰写者在温度0.7下能通过大部分章节,我们对所有155个任务×3次重试进行探测,保留至少有一次失败的71个任务(43训练/28评估,按报告分层);细节见附录B。  

## 4 为何偏差不同于噪声:简要理论  

Ratchet的非发散保证假设每个技能的贡献估计器是无偏的:对于确定性评分器是无害的,但对于错误是*结构化*的LLM裁判则是错误的。将裁判建模为关于真实结局y∈{0,1}(1=通过)的二元通道:Pr[ỹ=1|y=0]=ρF→P(隐藏失败)和Pr[ỹ=0|y=1]=ρP→F(幻影失败)。Curator在一个技能的观察通过率降至πτ:=(1−τ)/2以下时淘汰它。令p̄(s)表示技能s在路由给它的任务上的*真实*通过率,则在通道下,其观察通过率集中于κp̄(s)+ρF→P...

相似文章

SkillJuror: 衡量技能组织如何改变运行时行为

arXiv cs.AI

本文介绍了SkillJuror,一个评估Agent技能的不同组织范式如何影响LLM Agent运行时行为的框架。对82个任务的研究表明,与扁平基线相比,渐进式披露(Progressive Disclosure)增加了资源多样性和采纳事件,且结果改善依赖于任务。