当验证停止学习时:审计持续实体代理的更新准入

arXiv cs.AI 论文

摘要

本文提出了一种用于持续实体代理更新准入的审计协议,强调需要在错误控制与保留学习机会之间取得平衡,以防止有害更新并促进有用学习。

arXiv:2609.10873v1 公告类型:新 摘要:独立评估可以拒绝有害的策略更新,但也会阻止有用的持续学习。我们认为,更新准入必须通过错误控制和在指定交互预算下的保留学习机会来评估。我们识别出一个具体故障:基于范围的置信度门控无法在其他方面充足的预算内认证旧行为任务行为不变。标准的配对二项式构造在结果分歧较少时减轻了这一负担。我们还指定了认证的历史参考提升和一轮级别的错失机会指标。在一个构建的32个种子单步推诊断中,新鲜配对检查在每阶段2000个回合中允许31.6%的常见更新流通过,而基于范围的门控为零;然而,在闭环运行中,无条件重放学习效果更好。一个单独的学习动态压力测试区分了模型偏差和反馈选择误差。贡献是带有分析和合成证据的准入审计协议;物理机器人和VLA验证仍然开放。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:21

# 当验证停止学习时:持续具身代理的更新准入审计
来源:https://arxiv.org/html/2609.10873  
作者:Ruihai Wu  
所属机构:加州大学伯克利分校  
邮箱:[[email protected]](mailto:)

###### 摘要
独立评估可能拒绝有害的策略更新,但也可能阻碍有用的持续学习。我们认为,更新准入必须在给定交互预算下,通过误差控制和保留学习机会两方面进行评估。我们指出一个具体问题:基于范围的置信门控无法在实质性的预算范围内,保证旧行为模式未发生改变。当结果分歧罕见时,标准的成对二项式构造能减轻此负担。我们还提出了经过验证的历史参考晋升机制以及一个轮次级别的机会损失指标。在一个包含32个初始种子、单步推动任务的诊断测试中,若每个阶段使用2000次交互,新的成对检查能接纳31.6%的常规更新流,而基于范围的门控接纳率为零;但在闭环运行中,无条件回放仍能学习得更好。一个独立的学习动态压力测试能区分模型偏差与反馈选择误差。本研究贡献了包含分析与合成证据的准入审计协议;物理机器人与视觉-语言-动作模型的验证仍待进一步探索。

## 1立场:同时审计机会与已接受的更新
基于示范和校正进行更新的策略可能遗忘早期技能,或利用不准确的评估器。独立检查能解决其中一部分问题。然而,一个不接受任何更新的门控虽然能报告未观察到有害的准入,但其学习器也将毫无进展。我们的立场是:持续学习的评估必须衡量在准入过程中幸存下来的有用更新机会,同时记录误差以及获取证据的完整成本。我们研究策略更新;世界模型负责筛选候选策略,多智能体架构可选用于软件组织。

### 与先前工作的关系
回放方法如CLEAR能缓解学习过程中的遗忘问题[Rolnick et al., 2019];LIBERO使序列化的机器人迁移任务可度量化[Liu et al., 2023]。高置信策略改进已支持基于置信度的增量式策略选择[Thomas et al., 2015],非平稳环境下的安全改进也有相关研究[Chandak et al., 2020]。我们并非引入这些概念。WorldEval通过生成的结果评估策略[Li et al., 2025];近期理论刻画了模型利用行为[Bhamidipaty et al., 2026]。我们关注的是提案筛选后的准入过程,而非声称首次发现代理误差。自适应留出理论[Dwork et al., 2015]和演化智能体系统[Zhang et al., 2025]进一步论证了将开发反馈与决策证据分离的必要性。风险-覆盖分析在选择性预测中已是成熟方法[Geifman and El-Yaniv, 2017];此处分析单元是具有历史约束的策略更新池。我们的贡献在于:针对特定规则的可行性分析、揭示其学习后果的可执行诊断,以及不将常规候选选择视为误差的机会审计。更紧的标准区间可作为参考修复。因此得出的负面发现具有重要意义:观察到的违规减少并不等同于更好的持续学习能力。

图1:证据流。提案与筛选可能复用开发反馈。准入环节使用提交后的全新环境配对;所有候选者的审计结果对学习循环保持不可访问。

## 2可在预算内验证的准入契约
任务条件策略$\pi_\theta$在连续到达的任务批次中保持参数不变,但受限于示范回放与历史参考。因此适应过程可能改变先前行为;该过程属于持续策略学习而非重复提示。对于尝试轮次$t$,提交候选策略$\pi'$、当前策略$\pi$、任务/重置分布$P_j$、二元成功指标$S$以及所需比较次数$m$。设定$g_j = \mathbb{E}_{P_j}[S(\pi') - S(b_j)]$,$q_0 = \eta > 0$,$q_j = -\epsilon_j (j > 0)$,要求$g_j \geq q_j \forall j$。其中$b_0 = \pi$,历史策略$b_j$为存储的策略。误差容限、覆盖范围和样本数量在检验前固定。模型评分可对候选池排序,但绝不作为独立的环境结果。不同智能体或全新的*模型生成*种子无法消除共享的模型偏差。

### 有效规则可能冻结学习
若每次比较使用$n$个全新配对,$X = S(\pi') - S(b_j) \in \{-1,0,1\}$。分配$\alpha_t = 6\delta/(\pi^2 t^2)$。同步霍夫丁区间的半径为$r_H = \sqrt{2\log(2m/\alpha_t)/n}$ [Hoeffding, 1963]。即使所有旧任务配对$X=0$,若$r_H > \epsilon$则保留检验必然失败。当$m=3$,$t=1$,$\delta=\epsilon=0.05$时,每次比较需要4229个配对。均等分配需25374次交互,超过20000次的上限。这是该规则的局限性而非信息论下界。

### 利用成对分歧而非结果范围
设$p_+ = \mathbb{P}(X=1)$,$p_- = \mathbb{P}(X=-1)$,则$g = p_+ - p_-$。对二项计数获得普通Clopper-Pearson区间$[\ell_+, u_+]$和$[\ell_-, u_-]$,每侧尾部分配$\beta = \alpha_t/(4m)$ [Clopper and Pearson, 1934]。定义$L_j = \ell_+ - u_-$,$U_j = u_+ - \ell_-$。若所有$L_j \geq q_j$则接受;若存在$U_j < q_j$则拒绝。

相似文章

具有随时有效保证的 AI 系统自适应审计

arXiv cs.AI

本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。

Homeostatic Continual Learning

arXiv cs.AI

本文提出了Homeostatic Continual Learning,一种使AI代理在变化环境中持续学习而不发生灾难性遗忘的方法,通过检测离群点并逐步扩展世界模型来实现。

审计自改进智能体中的框架篡改

arXiv cs.CL

该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。