用于储备计算零 rollout 超参数选择的自由概率核
摘要
本文提出了一种基于自由概率核的储备计算确定性超参数选择方法,该方法消除了对资源密集型 rollout 的需求,并以显著更低的成本实现了与穷举搜索相似的性能。
arXiv:2608.20998v1 公告类型:新
摘要:储备计算(RC)将固定的递归动态系统与训练好的轻量级读出层相结合,但这种效率在超参数选择过程中部分丧失:递归增益、输入尺度和泄漏率决定了储备的稳定性和时间处理机制,通常通过多次 rollout 进行调优。我们引入了一种确定性的、基于试点信息的选择器,用于泄漏线性储备,随后是坐标级非线性特征。自由概率提供了跨滞后传播系数,总结了储备如何混合过去的输入。在大宽度极限下,这些系数定义了一个确定性的时间核,近似于有限储备的特征几何。因此,在短的标记试点序列上进行核岭回归,可以在不实例化或 rollout 储备的情况下对候选操作机制进行排名,并且所选配置可在不同宽度间转移。在十个合成时间基准测试中,零 rollout 选择获得了平均部署分数 $0.772$,而基于穷举模拟的搜索为 $0.774$,同时避免了 $156\,600$ 次选择 rollout。在小 rollout 预算下,所提出的排名在每个测试预算中提供了最强的平均性能,并仅使用其 rollout 成本的 $4.8\%$ 达到了穷举参考。在四个公开的电力变压器温度(ETT)预测数据集中,五个保留的候选在三个数据集上恢复了穷举操作点。在多元蜂窝流量预测中,每个单元 15 次 rollout 达到了 462 次 rollout 的穷举参考,并在低预算下优于随机搜索和贝叶斯优化。这些结果将自由概率核定位为当验证 rollout 稀缺时选择储备操作机制的确定性代理。
查看缓存全文
缓存时间: 2026/08/24 04:35
# 基于自由概率核的水库计算零rollout超参数选择方法 来源:https://arxiv.org/html/2608.20998 Sara Malacarne1, Andrea Ceni2, C. Gallicchio2 单位:1挪威奥斯陆Telenor研发与创新中心 2意大利比萨大学计算机科学系 ###### 摘要 水库计算(RC)将固定的循环动力学系统与训练好的轻量级读出层耦合,但其效率在超参数选择过程中部分丧失:循环增益、输入尺度和泄漏率决定了水库的稳定性和时间处理机制,通常需要通过大量rollout进行调优。我们提出了一种针对泄漏线性水库后接坐标非线性特征的确定性、先导数据驱动选择器。自由概率理论提供了交叉滞后传播系数,用以概括水库如何混合历史输入。在大宽度极限下,这些系数定义了一个确定性时间核,用于近似有限水库的特征几何结构。因此,在短标记先导序列上的核岭回归无需实例化或运行水库即可对候选运行机制进行排序,且所选配置可跨宽度转移。在十项合成时间序列基准测试中,零rollout选择获得的平均部署得分为0.772,而基于穷举模拟搜索的得分为0.774,同时避免了156,600次选择rollout。在有限rollout预算下,所提出的排序方法在每个测试预算下均表现出最强的平均性能,并仅用穷举参考成本的4.8%即可达到穷举搜索效果。在四个公开的变压器温度(ETT)预测数据集中,五个保留的候选配置在三个数据集上复现了穷举操作点。在多元蜂窝流量预测任务中,每个蜂窝仅需15次rollout即可达到462次rollout的穷举参考水平,并在低预算下优于随机搜索和贝叶斯优化。这些结果表明,自由概率核可作为验证rollout有限时选择水库运行机制的确定性代理模型。 ###### 索引词:水库计算,回声状态网络,自由概率,核方法,超参数选择 ## I 引言 水库计算(RC)为时序学习提供了高效框架:固定的循环系统将输入历史映射为高维表征,仅需训练轻量级读出层[21,32]。其经典实现是回声状态网络(ESN)[17]。尽管读出层训练成本低,但性能强烈依赖于控制循环动态的超参数,特别是循环增益、输入尺度和泄漏率。这些参数控制稳定性、记忆能力以及近期与远期输入的相对影响,其最优值可能随任务和时间尺度显著变化。在标准实践中,这些超参数通过反复实例化有限宽度水库、生成状态轨迹、拟合读出层并评估验证误差来选择。因此,搜索成本随候选网格、水库宽度和随机实现次数增加。所选配置还可能依赖于搜索时使用的宽度,导致部署宽度变化时可能需要重新选择。 我们采用确定性、任务驱动的选择器解决此瓶颈,该方法在候选排序期间无需有限水库rollout。给定来自下游任务的短标记输入-输出序列,方法通过确定性大宽度核评估每个候选配置。先导序列描述预测任务,而非通过运行候选水库获得。所得排序可直接作为零rollout选择器,或作为预筛选工具,在少量任务导向的有限水库评估前缩减候选网格。 我们研究泄漏线性递归后接坐标非线性读出特征的架构。对于此架构,非线性特征Gram矩阵在大水库宽度下收敛于确定性时间核。其协方差由递归矩阵的混合交叉滞后传播矩控制,我们使用自由概率(FP)计算。对于每个运行点θ=(σᵣ,σᵢₙ,α),所得核近似相同参数有限水库的特征几何。因此,先导序列上的核岭回归可对候选运行点排序,随后将所选参数转移到用于部署的有限水库。 现有水库核主要用于描述大宽度水库行为或直接作为预测器。我们的用法不同:对于每个候选θ=(σᵣ,σᵢₙ,α),确定性核近似相同参数有限水库的特征Gram矩阵。我们利用此近似在标记先导数据上对候选进行排序,然后在有限水库中部署所选θ*。主要分析难点在于同一递归矩阵随时间重复应用,导致不同滞后到达的输入效应不独立。我们的推导捕获这些跨时间依赖性,并表明在大宽度下,所得非线性特征相似性收敛于确定性核。据我们所知,这是首个利用此类核进行有限水库超参数选择的确定性零rollout方法。 主要贡献如下: 1. 我们推导泄漏线性水库的大宽度后非线性确定性核。分析计算了重复使用同一递归矩阵产生的混合交叉滞后传播矩,并建立了非线性特征映射所需的坐标级自平均性质。我们还获得受控的完整历史扩展及若干结构化递归集成的具体核表达式。 2. 我们将此核用作有限水库超参数选择的任务驱动代理模型。基于标记先导数据排序候选值(σᵣ,σᵢₙ,α),无需实例化任何候选水库。若确定性验证分数存在唯一最优候选,则足够宽的有限水库将以高概率选择相同候选。 3. 我们在合成时间序列基准、公开ETT预测数据集[37]和实际蜂窝流量预测任务上评估零rollout选择和基于FP的预筛选。在匹配的有限水库rollout预算下,与穷举任务导向选择、基于记忆的代理、非线性ESN选择、随机搜索[3]和使用树形Parzen估计器(TPE)的贝叶斯优化[2]进行对比。完整证明、替代递归随机矩阵的具体核目录及额外实验结果见附录A–G。 ## II 背景与问题形式化 现有水库超参数选择方法可分为基于任务的搜索和动态代理。基于任务的方法根据下游验证性能评估候选配置。最简单的例子是网格搜索和随机搜索[3],更自适应的策略包括水库参数贝叶斯优化[24]、基于梯度优化[33]和进化方法[26]。更高效的验证方案减少或重用部分评估[29,22]。尽管搜索策略不同,这些方法具有相同基础成本:评估新候选需实例化有限水库、生成状态轨迹、拟合读出层并评估预测。 另一种策略是利用水库内部动态特性选择或适应水库。回声状态属性条件和谱半径准则识别稳定运行区域[17,36,23],而记忆容量和基于雅可比矩阵的指标量化时间处理方面[35]。水库动态也可通过内在可塑性[30]等无标签方式适应。这些标准提供关于稳定性、记忆或动态机制的有用信息,但并非设计为直接根据标记下游验证目标对候选排序。当依赖实现状态时,它们仍需实例化并运行有限水库。 大宽度水库理论提供第三视角:用确定性极限描述替换随机有限系统。Hermans和Schrauwen将无限宽度ESN表述为循环核机[14]。Couillet等使用随机矩阵理论表征大型线性ESN的训练和测试行为[7],而Dong等推导非线性循环核并直接用于预测[8]。相关循环核构建随后发展用于泄漏、稀疏和深层水库拓扑[9]。Gonon、Grigoryeva和Ortega[10]则构建无限维Volterra水库,其核定义通用时间预测模型。这些工作表明大型水库行为通常可由确定性核表示。然而,其主要目的是表征水库或直接将极限核用作预测模型。 我们解决不同问题:此类核能否在超参数选择期间替代有限水库rollout?对于每个候选θ=(σᵣ,σᵢₙ,α),我们构建对应相同参数有限水库的大宽度核。其在标记先导数据上的性能用于对候选排序,随后将所选θ*转移回用于部署的有限水库。 现在引入推导此对应关系的水库族。考虑泄漏线性递归: xₜ₊₁ = Axₜ + αWᵢₙuₜ, A = (1−α)Iₙ + αWᵣ (1) 配备坐标非线性读出特征: zₜ = ψ(xₜ), ŷₜ = Wₒᵤₜᵀzₜ (2) 其中uₜ∈ℝᵈⁱⁿ, xₜ,zₜ∈ℝⁿ, ŷₜ,yₜ∈ℝᵈᵒᵘᵗ分别表示输入、线性状态、非线性特征向量、预测和目标。递归矩阵Wᵣ∈ℝⁿˣⁿ和输入矩阵Wᵢₙ∈ℝⁿˣᵈⁱⁿ随机初始化并保持固定,仅Wₒᵤₜ∈ℝⁿˣᵈᵒᵘᵗ被训练。泄漏率α∈(0,1],水库初始化x₀=0,ψ坐标式作用。实验中使用ψ=tanh。 Wᵣ和Wᵢₙ的缩放引入循环增益σᵣ和输入尺度σᵢₙ,详见第III节。将非线性置于递归后可将时间记忆与非线性处理分离。相关线性转换设计也见于现代状态空间序列模型如S4和LRU[13,28]。线性递归动态本身不意味着有限时间建模能力:配备足够表达性多项式或神经网络读出的稳定线性水库构成广泛衰减记忆滤波器的通用逼近族[11,12]。在此类架构中,线性递归表示并传播输入历史,而读出提供非线性逼近能力。 我们的模型使用轻量特征映射zₜ=tanh(xₜ)后接训练线性输出层。此坐标式读出虽未被通用性定理直接涵盖,但最近已证明在一系列时间任务上可与全非线性ESN竞争[18]。更重要的是,将非线性置于递归环外使状态保持对传播输入历史的线性依赖。实际上,从x₀=0展开(1)得: xₜ = α∑ₖ₌₀ᵗ⁻¹AᵏWᵢₙuₜ₋₁₋ₖ (3) 因同一递归矩阵随时间重复应用,状态间协方差依赖于混合归一化矩(1/n)Tr(Aᵏ(Aˡ)ᵀ)。这些矩构成水库的交叉滞后传播剖面:对角项测量延迟回声的平均平方增益,非对角项测量其重叠。与谱半径不同,此剖面还保留跨时间耦合和非正态放大。下一节推导这些混合矩的大宽度极限,用其构建非线性特征核,并应用于零rollout候选排序。 ## III 用于时间模型选择的自由概率核 第III-A和III-B节明确水库族并引入经验核符号。新理论结果始于第III-C节,推导固定上下文长度的大宽度确定性核;第III-D和III-E节将此构建扩展至完整洗出历史并用于超参数选择。本节中θ=(σᵣ,σᵢₙ,α)表示固定候选配置。为避免符号过载,我们省略对θ在A、Wᵣ、Wᵢₙ和水库中...
相似文章
面向理解高维贝叶斯优化的自动化核发现
论文介绍了Kernel Discovery,这是一个LLM驱动的进化框架,用于高维贝叶斯优化,它搜索更广泛的核空间并在基准测试上取得了最先进的结果。
真实世界强化学习中的离线超参数选择动力学模型
本文首次将校准模型应用于真实工业场景中的离线超参数选择,以市政水处理厂为例,展示了这些模型能够生成逼真的轨迹并恢复超参数敏感性趋势。
逐步扩展:大规模 Mixture-of-Experts 的计算高效超参数迁移
本文提出了一种计算高效的两步超参数迁移框架,用于预测大型 Mixture-of-Experts 模型的最优学习率,从而无需昂贵的超参数搜索即可实现高效预训练。
Prof-K: Probabilistic One-Pass Filtering for Efficient Top-k Selection
Prof-K is a probabilistic one-pass filtering algorithm for fast, scalable top-k selection with correctness guarantees, achieving 1.5x–10x speedups over PyTorch topk and RadiK, especially in large-scale small-k regimes.
低成本标签,可靠选择:用于作业车间调度的Rollout校准超启发式算法
本文提出了一种用于作业车间调度的门控超启发式算法,该算法使用遗憾归一化的滚动标签和上下文KNN不确定性估计,以降低标签生成成本,并避免在预测改进不可信时切换出强默认规则。实验表明,该门控选择器实现了较低的均值相对百分比偏差,同时显著降低了计算成本。