扩展前的证据:终身专家池中的重用、生成或推迟
摘要
本文介绍了一种为持续学习系统设计的统计决策层,允许专家池根据累积证据决定是重用现有模型、生成新模型还是推迟,具有管理非平稳数据流的理论保证和系统贡献。
arXiv:2608.19888v1 公告类型:新
摘要:流式系统维护一个专家模型池,必须反复决定是为到达的数据重用现有专家、生成新专家还是推迟。我们提出一个决策层,使这三种结果在统计上有意义。重用和生成被表述为单侧序贯假设,基于条件(机制级)差异,由无差异区分隔;推迟正是两个下注e-过程都未累积足够证据的状态。我们证明可观察代理差异的有限时间随时有效性,以及对总体量的无条件单侧转移,其中每侧的松弛是单个判别器的超额风险;经验观察到的向下偏差规律性使得生成侧完全保守。通过重启e-检测器获得不牺牲保证的近期性:一个无窗口下注超鞅库,在几何间隔的重启时间(O(log t)内存),误差预算在重启实例上分配,保留生命周期随时有效性;在专家创建顺序上分配同样控制无限多专家的多重性。在合成多概念流、Electricity、Covertype和高复现性INSECTS基准上,实例计数的重启库在切换后实现零假生成和零假重用,并匹配或超过退役的窗口启发式(INSECTS复现精度0.675),使部署的算法和保证的算法完全相同。
查看缓存全文
缓存时间: 2026/08/21 10:29
# 扩展前的证据:终身专家池中的复用、生成或延迟 来源:https://arxiv.org/html/2608.19888 小野健太郎 | 单位:鹿儿岛大学信息管理中心 | 邮箱:[[email protected]](mailto:) ###### 摘要 持续学习系统通常将处理新数据批次时的不确定性视为需立即解决的麻烦;本文将“暂不决策”定义为一种统计学意义上的行动。*延迟*并非启发式规则:它是复用证据积累与生成证据积累之间的精确边界区域。维护非平稳数据流的专家模型池的系统必须反复决策:即将到来的数据批次应由现有专家吸收、生成新专家,还是等待更多证据。我们提出一个完整的决策层,基于双轴任务比较(条件Jensen-Shannon差异及其协变量伴随项),并包含三项系统贡献。(1)*决策语义*:复用/生成检验被构建为由无差异区间\[τ,3τ\]分隔的单边序贯假设;*延迟*状态指两个投注e-过程均未积累足够证据,从而赋予中止行为精确的统计含义。(2)*序贯证据*:每个专家在每个数据点上基于损失差值增量维护的投注e-过程,由*可预测*(使用前冻结)的判别器评分,以控制决策;我们证明可预测判别器序列的*可观察*代理差异具有有限时间全程有效性,并证明其向总体量的*无条件*单边转移(每边松弛量对应单个判别器的超额风险;文中观察到的向下偏差正则性使生成侧恰好保守);部署的证据过程是一个*重启e-检测器*:由无窗口超鞅组成的银行,具有几何间隔重启,且在重启*实例*上消耗水平,从而在单生命周期全程有效性保证内实现有界内存的近期性(单个无窗口过程在概念切换后错误复用率为0.5,重启银行降至0.00,在重复流上具有最佳准确性)。(3)*系统机制*:基于近期每块损失界限的专家短名单控制每块成本;小批量测试后训练路由消除了否则主导准确性差异的切换延迟;合并为重复概念形成闭环。在四状态合成流上,批处理门实现零错误生成和零遗漏概念(理想专家数);默认流配置(重启e-检测器+消耗)保持错误生成0.00、错误复用0.00;在INSECTS(记录漂移)数据集上利用重复性维持13个专家,而基于交换的决策维持18–52个;在covertype上正确维持1–2个专家。我们表征了专家池有效的场景(离散、重复概念)和无效的场景(连续漂移),并发布所有代码。 ## 1引言 自适应系统通过三种基本动作之一应对非平稳性:调整现有模型、创建新模型或等待。现有标准将决策简化为标量触发器——输入新颖性(AGE/SEMA风格)、损失跳变(DDM风格)或模型交换遗憾(CLS风格)——每种至少混淆三种潜在情况中的两种(协变量偏移、机制变化、证据不足)。本文将决策层本身视为设计和评估对象。 我们基于条件Jensen-Shannon差异(CJSD)构建,该差异将任务差异精确分解为协变量轴Ix和功能轴DCJS,两者均通过两个判别器估计;配套论文开发其理论。此处我们贡献*系统*:序贯决策语义、流式有效性以及使该层以流速率运行的机制,连同跨四种流状态和七种决策策略的基准测试。 ## 2决策层 延迟积累证据 复用吸收到专家k 生成新专家,预算αc 不可比较Ix > I_x > 上限:无复用主张 Ereuse(k) ≥ thr 证据DCJS < 3τ 所有 Espawn(k) ≥ thr 证据DCJS > τ 可比较门 重置证据 新监控器 图1:决策层状态机。每个数据块起始于延迟;两个投注e-过程必须*赢得*转换(阈值Kmax/α或αc消耗计划),无差异区间\[τ,3τ\]分隔两个出口,可比较门在支撑重叠极少时阻止复用主张。 ### 设置 数据块(Xt,yt)到达;专家池{Ek}各自维护训练库、留出库和模型。序贯准确性在学习前测量。图1(https://arxiv.org/html/2608.19888#S2.F1)总结该层。 ### 双轴门 对于候选数据块和专家k,估计(Ix(k),DCJS(k))及其置信区间。若Ix(k)超过可比较界限,则该对是空洞的(功能轴在重叠外真实为零),无法证明复用合理。批处理门和序贯门检验*相同*两个假设:H0sp: DCJS ≤ τ(对抗生成)和H0re: DCJS ≥ 3τ(对抗复用),由无差异区间\[τ,3τ\]分隔;批处理门是其单次查看版本:当所有可比较专家均有L(DCJS) > τ时生成,当某专家有U(DCJS) < 3τ时复用——我们的实现使用更严格裁剪U(DCJS) ≤ τ,这*更严格*地拒绝H0re并仅使复用更保守——否则延迟。 ### 无差异区间与e-过程 序贯上,复用和生成是单边检验:H0sp: DCJS ≤ τ 和 H0re: DCJS ≥ 3τ。每个专家维护两个投注e-过程,基于每个点的增量ui,由数据块到达前冻结的判别器评分(可预测评分规则;增量本身是新随机性):Espawn向上投注,Ereuse向下投注;在阈值Kmax/α触发动作,其中Kmax是*声明的*对同时监控专家数的设计容量,由合并/修剪层强制(我们使用Kmax=16;观察池保持低于此值)。联合界必须基于Kmax而非数据相关池大小:随每次生成增长的阈值无法控制无限创建专家时的族水平。两个注意事项界定Kmax/α的作用:它约束*同时*监控器,因此若专家无限修剪替换,测试假设的生命周期族可超过Kmax。对于无限生命周期,我们实现*α消耗*变体:第c个创建的专家获得αc = 6α/(π²c²)(使∑cαc = α),分配给其两个单边过程,在无容量限制下对*任意多*创建事件提供有效的族-wise控制。在消耗下重新运行完整流基准,生命周期有效性实际上无可测量代价:决策质量不变(错误生成0.02 vs 0.01,错误复用0.00),池可比(INSECTS重复流6.3→7.0专家),序贯准确性相等或略高(合成流0.86→0.88,Covertype 0.77→0.79)——早期专家面临*低于*Kmax/α的阈值,且二次增长的晚期阈值在这些流诱导的池规模下从未绑定。因此我们建议当专家生命周期无限时默认使用消耗;结合下段重启e-检测器,整个部署配置——近期性、多重性和无限生命周期——现置于有效性保证内。 ### 灵敏度(退役窗口化变体消融) 在合成流上,W×τ网格(W∈{4,8,16,32},τ∈{0.01,0.03,0.05,0.10},3个种子)将灵敏度完全定位在τ:τ=0.01时系统保持错误生成+错误复用于0.01,平均1.3个专家,而τ≥0.03拓宽无差异区间\[τ,3τ\]超出概念间隙,在半数运行中错误复用新概念(合并错误0.50,单专家崩溃)。窗口长度在整个\[4,32\]范围内*惰性*(三位小数相同):此处决定性证据在≤4块内积累,因此W仅通过第3节的切换后近期机制约束。实践指导:将τ设为低于值得反应的最小漂移质量;W非调优负担。区间\[τ,3τ\]使复用侧检验适定(无此区间则复用边界统计上不可达)。*延迟正是两个过程均未跨越的状态。* ### e-过程实际检验什么 增量由*学习到的*判别器计算,因此保证必须针对可观察分数陈述,而非假设为总体量。评分数据块t的对(T1,t,T2,t)是*可预测的*:仅在数据块间更新,数据块到达前冻结,因此存活多个数据块的e-过程由可预测、可能时变的对序列评分(增量判别器被覆盖;每个数据块内对固定)。定义对评分数据块t的代理差异 D~t = E[l1(T1,t,X,Z) - l2(T2,t,X,Y,Z) | Gt-1] = DCJS + ε1,t - ε2,t, 即对评分数据块t实现的*条件*总体对数损失差,其中Gt-1是数据块t前观测到的所有内容的σ-域(固定(T1,t,T2,t)),εj,t ≥ 0是该对的(条件)超额风险。令Fi-1是点i前观测到的所有内容(包括评分i的对及投注)生成的σ-域。判别器和λi是Fi-1可测(可预测);增量ui = ((l1,i - l2,i) + B)/2B∈[0,1]是新观测量,零假设给出条件均值不等式E[ui|Fi-1] ≤ m0(生成侧;≥m0为复用侧)。全文τ表示*归一化*阈值,因此代理零假设读作D~t/ln2 ≤ τ,m0sp = (τ ln2 + B)/2B维度一致(复用侧用m0re = (3τ ln2 + B)/2B)。 ###### 命题1(可观察分数的有限时间有效性) 在裁剪(有界损失)下,对任何λi为Fi-1可测、λi ≥ 0且满足资本约束1+λiσ(ui - m0) ≥ 0(负λi会颠倒定义不等式)的投注策略,过程En = ∏i≤n(1+λiσ(ui - m0))是非负超鞅,关于(Fi)当代理零假设*逐点过程生命周期*成立时——即对生成侧,每个增量进入乘积的数据块t,D~t/ln2 ≤ τ且m0sp = (τ ln2 + B)/2B,σ=+1;对复用侧,D~t/ln2 ≥ 3τ且m0re = (3τ ln2 + B)/2B,σ=-1(可预测对序列上的复合零假设)——Ville不等式给出Pr[supnEn ≥ Kmax/α] ≤ α/Kmax在任何停止时间。该保证是无条件且有限时间的——但其零假设是D~t而非DCJS。 ###### 命题2(向总体量的单边转移) 无条件地——对任何冻结对,无论错配如何——超额风险各自限定一个方向:DCJS - ε2,t ≤ D~t ≤ DCJS + ε1,t(配套论文,单边错配控制)。因此生成侧拒绝D~t/ln2 ≤ τ证明DCJS/ln2 > τ - ε1,t/ln2,*无需*对T2的条件;复用侧拒绝证明DCJS/ln2 < 3τ + ε2,t/ln2,*无需*对T1的条件。此外,若对满足向下偏差正则性ε1,t ≤ ε2,t(即D~t ≤ DCJS),则生成松弛消失——拒绝直接证明DCJS/ln2 > τ——且复用松弛锐化为(ε2,t - ε1,t)/ln2。 无条件部分转移了需控制的内容:生成侧的松弛感知总体转移仅涉及ε1,t——*简单*x判别器的超额风险,该量已被留出模型选择最小化,且允许标准近似加复杂度界限(配套论文命题4)——而非两个判别器间的符号比较。精确水平-τ总体保守性通过以下方式之一获得:通过ε1,t/ln2的有效高概率上界膨胀代理生成阈值(在其1-δ事件上;序贯水平α与该界限的δ可加性复合),或作为零松弛特例,在向下偏差正则性下获得。该正则性是经验精炼:它在本文报告的每个生命周期基准中成立(配套论文展示了证明松弛内的工程化错配边际例外),且它锐化松弛但不再承载有效性声明。复用侧松弛ε2,t在实践中受可比较门进一步限制,该门排除低重叠比较——ε2,t增长的一个重要区间。一句话:代理级序贯有效性精确;总体CJSD决策无条件继承单边、判别器特定松弛,精确零松弛保守性是通过阈值校正或正则性获得的特例。
相似文章
UniPool:一种用于混合专家模型的全球共享专家池
UniPool 为混合专家(MoE)模型引入了一种共享专家池架构,在降低参数随深度增长的同时,相较于标准 MoE 基线提高了效率和性能。
重新思考自我进化语言模型智能体中的经验利用
本文介绍了 ExpWeaver 框架,该框架优化了自我进化语言模型智能体在运行时决策过程中如何利用过往经验。研究表明,基于推理不确定性选择性调用经验,能在多种环境和模型中提升性能。
长期任务代理的递归经验-工作记忆进化
论文介绍了Recuris,一种递归记忆架构,通过跟踪进度和指导技能选择来提升长期任务代理的成功率,采用本地化的、验证门控的更新机制。
漂移与依赖:基于回放的持续学习的逐层信息论界
本文提出了一个针对基于回放的持续学习的逐层信息论框架,将泛化差距分解为回放引起的表示漂移项和优化依赖项,并通过Wasserstein松弛与SGLD实例化对其进行了细化。
大型语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行
一篇关于LLM中混合专家架构的技术综述,沿着专家粒度、拓扑、路由、负载均衡和执行来组织演进,并提出了架构里程碑和控制平面的互补视角。