更倾向于拒绝,而非更具辨别力:预执行LLM监督中的验证单元
摘要
本文引入了双前缀框架来衡量预执行LLM监督中的验证单元,发现更长的审核窗口会提高拒绝率,但不会改善辨别力。
arXiv:2608.23941v1 公告类型:新
摘要:预执行监督是AI控制中可信监控的核心:一个易错的LLM监控器在不可逆执行前审查计划行动。过度封锁会丧失实用性并迫使部署者禁用它。每个协议都必须固定一个验证单元:一次调用审查多少个行动。现有设计将单元视为给定;其对易错监控器的影响尚未测量。自然痕迹无法将其隔离:审查长度与错误类型和位置共变。仅捕获会误导:拒绝一切会捕获一切。测量这一点需要仅边界变化和一个匹配的干净控制。我们引入了双前缀框架,同时提供了两者。每个黄金计划产生一个前缀,其中注入了一个环境接受的错误,以及一个干净的双胞胎,仅在一个写入上有所不同。在五个嵌套长度上判断每对,将裁决变化仅与单元相关联。辨别力通过预先注册的信息性(捕获减去误拒)来评分。更长的审查提高了捕获率;误拒同步上升。信息性在所有六个法官的两个领域中都在一个或两个行动时达到峰值:更长的窗口使零样本监控器更倾向于拒绝,而非更具辨别力。重放保留的观察将失败主要追溯到观察剥夺。安全案例应陈述单元并共同报告干净系列。我们的框架是针对此选择的第一个受控、预先注册的工具,并且从不单独读取捕获。我们校准的短单元在八个行动审查中恢复了高达0.95的信息性,没有测试过的标签盲策略能一致地超越它。
查看缓存全文
缓存时间: 2026/08/26 09:17
# 更具拒绝性,而非更具区分度:执行前大语言模型监督中的验证单元 来源:https://arxiv.org/html/2608.23941 ###### 摘要 执行前监督是人工智能可信监控的核心:一个可能出错的大语言模型监控器会在计划动作不可逆执行前对其进行审查。过度拦截会丧失实用性,并迫使部署者禁用该机制。任何协议都必须确定一个*验证单元*:即单次调用审查多少个动作。现有设计将该单元视为既定条件,但其对易错监控器的影响尚未被测量。自然轨迹无法隔离该变量:审查长度与错误类型和位置是共变的。仅凭捕获率会产生误导:拒绝一切就能捕获一切。测量这一指标需要仅改变边界条件,并配以匹配的纯净对照组。我们引入了**双前缀框架**,它能同时满足这两项需求。每个黄金计划生成一个前缀,其中注入一个环境可接受的错误,并生成一个仅在一个写入操作上不同的纯净孪生版本。在五个嵌套长度上对每对进行判断,可以将判决变化完全归因于验证单元本身。区分度通过预先注册的约登指数(捕获率减去误拒率)进行评分。更长的审查窗口提高了捕获率,但误拒率也随之同步上升。在两个领域中,所有六个评判者的约登指数在审查1或2个动作时达到峰值:更长的窗口使零样本监控器变得更具*拒绝性*,而非更具区分性,这主要归因于观察信息的缺失。安全案例应说明验证单元,并同步报告纯净序列的结果。我们的框架是首个针对此选择进行控制的、预先注册的测量工具,并且从不单独依赖捕获率。经过校准的短单元在八动作审查中恢复了高达0.95的约登指数,且没有经过测试的、忽略标签的策略能持续优于它。 中国科学技术大学 中国合肥 [email protected], [email protected] ## 1 引言 工具使用代理越来越多地执行具有重要影响的动作,如购买、退款和数据库写入,这些动作的错误可能代价高昂或不可逆。执行前监督引入一个监控器:在计划动作执行前,一个可能出错的大语言模型验证器会读取这些动作并批准或拒绝(Greenblatt et al. 2024 (https://arxiv.org/html/2608.23941#bib.bib11))。这是人工智能控制中一项核心的可信监控措施(Bhatt et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib4)),其调用级安全性和实用性的代理指标分别是捕获率和误拒率。遗漏的错误会不可逆地执行,而过度拦截会丧失实用性,并带来覆盖或禁用监控器的压力:这种侵蚀是协议本身的失败,其代价体现在监督成本而非处理吞吐量上。每个此类协议都必须确定每个验证器调用读取多少计划动作:即**验证单元**,这是固定草案门控和推测-然后-验证架构的部署参数。现有设计将其视为既定条件,或根据对*精确*检查的成本权衡来确定其大小(第2节 (https://arxiv.org/html/2608.23941#S2));而其对一个*可能出错*的监控器的影响尚未被测量。每次调用的单步成本随审查长度L单调下降(第3.1节 (https://arxiv.org/html/2608.23941#S3.SS1)),更宽的审查窗口似乎能捕获更多错误,因此更长的验证单元看起来严格更具吸引力。本文关注的问题是*每次调用读取多少*,而非*何时*调用监控器,其最清晰的形式是:固定一个批次,其中每个步骤都恰好被审查一次。全文中,L表示审查前缀的长度,L*表示部署的单元长度。现有证据无法说明表面上的增益是否真实。在自然的代理轨迹中,审查长度与任务难度、错误类型和错误位置共变,因此观察到的任何变化都不能归因于窗口长度;并且验证器准确性是在整个自然轨迹上评分的(Fan et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib9)),因此没有在受控长度下将纯净前缀与错误前缀进行匹配:配对的纯净对照侧未被测量。因此,部署者无法区分一个区分度更好的窗口和一个只是拒绝更多所有内容的窗口;这种盲目的选择会传播到监控声明和控制安全案例中(Korbak et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib17))。部署的关键在于一个窗口是否能将错误与纯净内容区分开来,而测量这一点需要自然轨迹无法提供的两样东西:仅改变审查边界,同时固定错误类型和位置,并且在每个长度上都有一个匹配的纯净对照,这样捕获率就永远不会脱离其配对的误拒率来阅读。**双前缀框架**(第3节 (https://arxiv.org/html/2608.23941#S3);图1 (https://arxiv.org/html/2608.23941#S1.F1))同时提供了这两者。从每个黄金计划中,它构建一个携带一个环境可接受注入错误的**错误**前缀,以及一个仅在那个单次写入上不同的**纯净**孪生版本。错误类型和位置保持固定,同时该对在五个嵌套长度L∈{1,2,3,5,8}上渲染,结束于该槽位,因此任何判决变化都可完全归因于单元本身;提高L会拓宽窗口并扣留窗口内的观察信息,正如在批量部署中一样。区分度通过预先注册的约登指数J=捕获率-误拒率(Youden 1950 (https://arxiv.org/html/2608.23941#bib.bib32);Powers 2011 (https://arxiv.org/html/2608.23941#bib.bib21))进行评分;评分模式下的通过增加了无阈值排序(AUC)以及每长度的重新校准,而成本感知规则则将曲线和每次调用成本映射到部署单元L*(第3.4节 (https://arxiv.org/html/2608.23941#S3.SS4))。语料库在评判前已冻结,因此所有六个监控器在每个长度上都面对相同的配对对。总之,我们的主要贡献是: - •我们引入了双前缀框架,一个针对验证单元的、受控的、预先注册的测量工具,该单元在易错监控器上的影响尚未被测量,但对控制安全案例至关重要(第1节 (https://arxiv.org/html/2608.23941#S1),3节 (https://arxiv.org/html/2608.23941#S3))。 - •我们将其建立在嵌套孪生对的基础上:一个环境接受的注入错误与一个匹配的纯净孪生对,类型/位置固定,配对共同评估(J=捕获率-误拒率,捕获率从不单独使用),评分模式AUC,以及成本感知的选择(第3节 (https://arxiv.org/html/2608.23941#S3))。 - •我们发现对于两个领域中的所有六个评判者,约登指数在L∈{1,2}时达到峰值(主要指数J从0.602降至0.035):更长的窗口使零样本监控器更具*拒绝性*,而非更具区分性,主要源于观察信息缺失(重放实验:J(8)从0.035提升至0.490;第4.2节 (https://arxiv.org/html/2608.23941#S4.SS2),4.3节 (https://arxiv.org/html/2608.23941#S4.SS3))。 - •我们证明没有经过测试的、忽略标签的策略能持续优于经过校准的固定短单元:安全案例应说明验证单元,并同步报告纯净序列的结果(第4.5节 (https://arxiv.org/html/2608.23941#S4.SS5))。 图 1:双前缀框架(示意图)。左:构建过程,两个领域的黄金计划、错误/纯净孪生对在某个锚点写入处拆分、以及执行前验证循环。中心:一个零售配对的两个验证器输入示例,每个都由其独立的、无状态的调用评分,因此捕获率与其配对的误拒率一同获得,J=捕获率-误拒率。右:锚点槽位闭合所有五个嵌套窗口;提高L会拓宽窗口并扣留窗口内的观察信息;它换来的是拒绝,而非区分。 ## 2 相关工作 监督与人工智能控制。过程监督和可扩展监督研究易错的监督通道(Lightman et al. 2023 (https://arxiv.org/html/2608.23941#bib.bib20);Bowman et al. 2022 (https://arxiv.org/html/2608.23941#bib.bib5);Burns et al. 2023 (https://arxiv.org/html/2608.23941#bib.bib6));人工智能控制将安全性与实用性权衡下的可信监控付诸实践(Greenblatt et al. 2024 (https://arxiv.org/html/2608.23941#bib.bib11)),并通过重采样协议(Bhatt et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib4))、控制安全案例(Korbak et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib17))和思维链监控(Baker et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib2))得以扩展。Ray (2025) (https://arxiv.org/html/2608.23941#bib.bib22)评估了应购买多少监督,而控制税则对端到端协议进行定价(Terekhov et al. 2026a (https://arxiv.org/html/2608.23941#bib.bib27));公式6 (https://arxiv.org/html/2608.23941#S3.E6)是其每次调用的特例。针对监控器的自适应攻击(Terekhov et al. 2026b (https://arxiv.org/html/2608.23941#bib.bib28))限定了任何非自适应测量(包括我们的)的外推范围(第5节 (https://arxiv.org/html/2608.23941#S5))。这些工作都视被审查的单元为既定条件;我们测量的是改变该单元如何改变监控器。粒度与验证器在长度下的可靠性。Fan et al. (2026) (https://arxiv.org/html/2608.23941#bib.bib9)观察性地评估过程质量,其中错误类型和位置与长度共变;GRACE和VG-Search在无不可逆动作或无纯净误拒轴的情况下自适应调整验证粒度(Krasniqi, Vejsiu, and Dervishi 2026 (https://arxiv.org/html/2608.23941#bib.bib18);Chen et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib8));其他工作研究了验证器的欠批判和过批判性(Zhou et al. 2026b (https://arxiv.org/html/2608.23941#bib.bib35))、渐增前缀监控(Huang et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib14);Zhang et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib33))、专家标注的错误语料库(Recchia et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib23))以及训练的过程奖励模型(Chae et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib7);Li et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib19))。Sah et al. (2026) (https://arxiv.org/html/2608.23941#bib.bib26)评估了在固定审查单元下牺牲任务成功率的执行成本;我们则在固定执行规则下评估单元本身的成本。推测与触发机制。推测执行框架验证草案,在不一致时回滚(Ye et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib31);Ro et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib25));DSP和CGPA选择由*精确*验证器检查的单元(Guan et al. 2025 (https://arxiv.org/html/2608.23941#bib.bib12);Zhou et al. 2026a (https://arxiv.org/html/2608.23941#bib.bib34)):宽度消耗的是计算资源,而非准确率。我们继承了单步询问或执行触发器(Ren et al. 2023 (https://arxiv.org/html/2608.23941#bib.bib24);Aggarwal et al. 2023 (https://arxiv.org/html/2608.23941#bib.bib1);Kamath, Jia, and Liang 2020 (https://arxiv.org/html/2608.23941#bib.bib15);Gupta et al. 2024 (https://arxiv.org/html/2608.23941#bib.bib13))和验证器路由(Kiyani et al. 2026 (https://arxiv.org/html/2608.23941#bib.bib16)),并测量单元对一个*易错*监控器的成本。 ## 3 双前缀框架 ### 3.1 问题表述 固定一个策略,该策略在每个监督点向验证器发送一个长度为L的计划前缀,并根据其判决接受或拒绝。审查L个项目的调用成本为 C(L) = F + L · i 验证器令牌 (1),其中固定开销F(指令、目标、已执行上下文)和每个项目成本i,即F/L + i 每审查步骤,随L单调下降:仅成本因素就支持使用长窗口。权衡因素是判决质量。记 catch(L) 为错误前缀被拒绝的概率(安全项),FR(L) 为匹配的纯净前缀被拒绝的概率(误拒:丧失的实用性),我们通过约登指数 J(L) = catch(L) - FR(L) (2) 来评估一个窗口。这是约登指数(Youden 1950 (https://arxiv.org/html/2608.23941#bib.bib32);Powers 2011 (https://arxiv.org/html/2608.23941#bib.bib21)),衡量监控器区分错误与纯净内容的能力:J=0为机会水平,J=1为完美区分。J使得**拒绝倾向**(即不顾标签一概拒绝的倾向)变得可见(一个拒绝一切的验证器达到 catch=1 但 J=0);它不依赖于流行度,且对两种错误类型赋予同等权重(不等成本:第3.4节 (https://arxiv.org/html/2608.23941#S3.SS4))。 ### 3.2 受控的双前缀构建 对于每个基础项目,我们取一个黄金计划,在固定位置插入一个固定类型的错误,并渲染五个嵌套的审查前缀,长度 L∈{1,2,3,5,8},结束于该错误,并同时判断匹配的纯净黄金前缀。**锚点**是占据每个窗口最终槽位的黄金写入 a_t,即接收注入的槽位:用 a_{1:T} 表示黄金计划,用 \tilde{a}_t 表示注入的写入,在长度 L 上判断的窗口为 x_L(w) = (a_{t-L+1}, ..., a_{t-1}, w),其中 w∈{a_t, \tilde{a}_t} (3)。纯净孪生体取 w=a_t;错误孪生体取 w=\tilde{a}_t。这对孪生体共享目标、已执行上下文和最终槽位位置,仅在一个写入上不同,并提供了公式(2) (https://arxiv.org/html/2608.23941#S3.E2)中的两个比率(图1 (https://arxiv.org/html/2608.23941#S1.F1),中心)。提高L会拓宽被审查的窗口,并且由于窗口内的步骤未执行,会扣留它们的观察信息,正如在批量部署中一样:这是单元的*总*效应,第4.3节 (https://arxiv.org/html/2608.23941#S4.SS3.SSS0.Px3)通过干预将其观察通道隔离出来。这五个长度接近对数分布,上限为8,受锚点池限制(第4.1节 (https://arxiv.org/html/2608.23941#S4.SS1));一个位置子设计在内部位置重新注入(第4.3节 (https://arxiv.org/html/2608.23941#S4.SS3.SSS0.Px2))。算法1 (https://arxiv.org/html/2608.23941#alg1)总结了该流程。 算法 1 双前缀构建与配对共同评估 0:黄金计划,锚点槽位;混合;Λ={1,2,3,5,8} 1:对每个带有锚点写入 a_t 的基础项目执行: 2:为槽位 t 按层抽取非黄金候选写入;在锚点状态数据库的副本上测试执行;保留一个被接受的写入 \tilde{a}_t 3:对每个 L∈Λ 执行: 4:渲染嵌套孪生体 x_L(\tilde{a}_t) 和 x_L(a_t),遵循公式(3) (https://arxiv.org/html/2608.23941#S3.E3),窗口内步骤未执行 5:通过各自独立的、无状态的调用判断每个孪生体:判决、原因代码(评分模式:错误概率) 6:结束循环 7:结束循环 8:汇总 catch(L),FR(L),J(L);评分模式下汇总 AUC(L),J*(L) 9:将注册的对比与冻结的结果映射进行比对(第3.3节 (https://arxiv.org/html/2608.23941#S3.SS3)) #### 为何如此构建。错误占据每个窗口的*最终*槽位,这是所有五个长度共享的窗口内位置,因此五个判断仅在被审查的窗口上有所不同,而项目其他方面均相同;在块部署下,最后一步同样有 L-1 个未执行的前驱步骤,并且嵌套结构使得被判断的项目在不同L下保持一致,这为第4.1节 (https://arxiv.org/html/2608.23941#S4.SS1.SSS0.Px4)的配对检验提供了依据。 #### 注入了什么。每个错误项目用环境自身数据库中抽取的一个非黄金写入(真实订单、商品、支付方式和用户ID)替换了锚点的黄金写入,并在锚点状态数据库的副本上*测试执行*:只有环境会接受的写入才会被发出,因此没有注入的错误是模式无效的稻草人;门控位于上游(第3.3节 (https://arxiv.org/html/2608.23941#S3.SS3)),因此每次注入都符合门控条件。
相似文章
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。
先前审计-修复上下文使LLM验证器阈值趋向宽大
本文发现,上下文中的先前审计和修复事件通过转移决策阈值来减少LLM验证器的误报,其中修复内容和审计结果对不同的模型家族产生互补影响。
关键投票盲点:聚合独立性指标忽略了验证真正有助益的场景
本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。
LLM-as-a-Verifier:通用验证框架
LLM-as-a-Verifier引入了一种概率验证框架,该框架从LLM的对数几率计算连续分数,并在粒度、重复评估和标准分解方面进行缩放。它在多个智能体基准测试上取得了最先进的结果,并为强化学习提供了密集反馈。
独立研究:单个LLM会遗漏多模型面板捕获的约一半代码审查缺陷。欢迎反馈并寻求arXiv认可。
一位独立研究人员的研究发现,单个LLM会遗漏约一半的代码审查缺陷,而使用来自不同提供商的多个模型可显著提高覆盖率,其中添加第二个模型的收益最大。该论文寻求反馈和arXiv认可。