Variation Brownian Kernel Ladders
摘要
本文介绍了Variation Brownian Kernel Ladders(VBKL),这是一种用于递归字典构建的路径原子函数空间框架,并分析了统计学习理论中的Hölder正则性、紧致性和泛化界。
arXiv:2608.13882v1 公告类型:新
摘要:关于深度的益处的声称取决于分配给表示的复杂性。我们引入了\emph{Variation Brownian Kernel Ladder}(VBKL),一种路径原子函数空间框架,将非线性递归字典构建与线性变分叠加分离。从线性投影开始,每个原子递归地从布朗再生核希尔伯特空间组合单位球轮廓;完整的VBKL空间则是完成字典的带符号测度变分包络。我们将每个递归字典识别为布朗拉回RKHS球的并集,并建立在局部非退化条件下受变分控制的H\"older正则性、紧致性和可达性,以及随深度的严格增长,该条件的迹位于输入测度的支撑中。对于相关的有限低支撑架构,我们通过布朗二次混沌、带符号阈值迹和VC熵推导Rademacher界和泛化界。我们还通过离散化外部度量和选定的外部布朗轮廓构建两阶段逼近器,获得$M^{-1/2}+m^{-1/2}$误差界、一个尖锐的插值常数$\sqrt{A/2}$,以及每次评估最多$2M$个活跃外部轮廓基贡献。受控实验说明了逼近机制,并表明在有限数据下精度与复杂度之间有良好的权衡。
查看缓存全文
缓存时间: 2026/08/17 10:15
# 变分布朗核梯度
来源:https://arxiv.org/html/2608.13882
马赫迪·穆罕默迪戈哈里
马赫迪\.穆罕默迪戈哈里@gmail\.com
所属机构:工程学院,自由大学博尔扎诺-南蒂罗尔
地址:Bruno Buozzi 1, Bolzano, 39100, Italy
###### 摘要
关于深度的益处的断言取决于分配给表示的复杂度。我们引入了**变分布朗核梯度**(VBKL),一种路径原子函数空间框架,它将非线性递归字典构建与线性变分叠加分离。从线性投影开始,每个原子通过布朗再生核希尔伯特空间递归地复合单位球剖面;完整的VBKL空间则是完备字典的带符号测度变分凸包。我们识别出每个递归字典是布朗回拉再生核希尔伯特空间单位球的并集,并建立了在局部非退化条件下(其迹位于输入测度的支撑中)的变分控制的Hölder正则性、紧致性、可达性以及随深度的严格增长。对于相关的有限支撑架构,我们通过布朗二次混沌、带符号阈值迹和VC熵推导出Rademacher复杂度和泛化界。我们还通过离散化外部测度和选定的外部布朗剖面构造了两阶段近似,得到了$M^{-1/2}+m^{-1/2}$的误差界,一个尖锐的插值常数$\sqrt{A/2}$,以及每次评估最多$2M$个活跃的外部剖面基函数贡献。受控实验阐明了近似机制,并表明在有限数据情况下,精度与复杂度之间存在有利的权衡。
††简短标题:变分布朗核梯度 / 穆罕默迪戈哈里
††首页:1
###### 关键词
递归函数空间、变分空间、布朗核、统计学习理论、构造性逼近
## 1 引言
任何关于深度的表征益处的断言都是相对于某种复杂度概念而言的。一个函数在复杂度以宽度或参数数量衡量时可能成本低廉,而以权重大小、路径变差或内禀函数空间范数衡量时则可能成本高昂。这种区分对于过参数化模型尤为重要,因为其中一个有限实现的大小可能无法揭示学习所偏好的函数类的全貌。因此,经典的和现代的容量分析通过权重大小和基于范数的表示成本来控制神经函数类,通常独立于宽度 [5, 20, 14, 3]。相应的函数空间视角将预测器与其表示的函数相关联,而非与其特定的参数化相关联,并询问哪些函数位于范数或 Gauge 有界类中。通过Barron空间、测度生成的变分空间、样条表示和再生核Banach空间,一个丰富的理论已为浅层网络发展起来 [4, 2, 22, 27, 23, 24, 17, 29, 30, 6]。这些构造通过内禀函数空间几何将逼近、正则化、统计复杂度和表示定理联系起来。
将这一视角扩展到深度导致了几种不同的递归模型。组合性和递归再生核希尔伯特空间理论通过核或函数组合构建希尔伯特空间层次结构 [8, 15]。递归再生核Banach空间和Banach空间构造则强调向量值测度、逐层变分结构和表示定理 [10, 7]。深度变分空间和神经树模型则迭代地构造原子、测度或组合的浅层空间构造 [25, 28, 19, 21]。所得理论的不同之处不仅在于激活函数或核的选择,还在于线性叠加被引入的位置。这一设计决定了所研究的递归对象。如果在每一层都应用凸化或测度叠加,那么非线性特征生成和线性组合将共同演化。如果叠加被推迟,人们可以首先研究各个组合路径的几何形状,然后才询问需要多少线性变差来组合它们。这些操作不一定可交换,它们可能导致关于正则性、表达能力、统计复杂度和有限可实现性的不同结论。这激发了本文的核心问题:**在线性叠加在递归函数空间构造中的位置如何影响所得深度函数类的几何、学习复杂度和构造性实现?**
我们通过**变分布朗核梯度**(VBKL)来回答这个问题。该构造从线性投影开始,并递归地构建非线性路径字典。在每个后续级别,选择一个低级原子并将其与布朗再生核希尔伯特空间中的一个单位球函数复合。因此,一个深度$L$的原子包含一个支撑路径和恰好$L-1$个归一化的布朗剖面。在中间级别不取凸包或变分凸包。只有在深度$L$字典被构造完成后,我们才通过积分其原子与有限带符号测度来引入线性叠加。所有此类表示的下确界总变差定义了内禀的VBKL复杂度。这种构造顺序将递归原子的几何、其外部线性组合的成本以及用于计算的有限实现的复杂度分离开来。
##### 为何选择布朗再生核希尔伯特空间?
布朗核不仅用作方便的非线性激活函数。其再生核希尔伯特空间是具有平方可积导数的绝对连续函数的显式锚定Sobolev-Cameron-Martin空间。布朗回拉允许精确的再生核希尔伯特空间描述,而布朗核度量通过递归组合传播平方根正则性。核的带符号阈值表示将有限布朗变差类与二次混沌和VC熵联系起来。最后,一维剖面几何允许具有尖锐常数的分段线性近似。这些性质使得在同一个递归模型中可以发展解析的、统计的和构造性的理论。
##### 布朗和递归核谱系。
[12]中的浅层布朗投影模型将预测器表示为学习投影上一维Sobolev函数的期望,并识别出相关的布朗投影核。布朗核梯度[18]递归平均布朗回拉核以构建积分再生核希尔伯特空间层次结构。VBKL以不同的方式使用相同的布朗函数生成机制:它跟踪单个组合支撑以构建路径字典,并仅在最外层放置带符号测度叠加。因此,这三种构造通过布朗核相关,但在投影测度、递归核测度还是外部原子测度作为主要表示变量方面有所不同。
##### 与深度神经变分空间的关系。
最接近的深度变分空间框架是[19]。概略地说,其深度$l$单位球和VBKL深度$l$字典分别构建为
$\mathcal{B}_{l}^{\mathrm{DNVS}}=\overline{\operatorname{aconv}}\left(\left\{\sigma_{s}\circ f:s>0,\;f\in\mathcal{B}_{l-1}^{\mathrm{DNVS}}\right\}\right),$
$\mathcal{U}_{l}=\left\{g\circ u:u\in\mathcal{U}_{l-1},\;g\in\mathcal{H}_{k^{(\mathrm{B})}},\;\left\|g\right\|_{\mathcal{H}_{k^{(\mathrm{B})}}}\leq 1\right\}.$
因此,深度神经变分空间在每个级别交替进行非线性激活和闭绝对凸化,而VBKL递归地仅构建非线性字典,并在达到所需深度后才取其变分凸包。第二个区别是:前者基于一个预定义的激活函数变化一个归一化族,而每个VBKL剖面则在布朗再生核希尔伯特空间的整个单位球上变化。由于非线性组合和绝对凸化通常不可交换,VBKL并非仅仅通过将该框架专门应用于布朗激活族而获得,我们也不在所得空间之间做出一般的包含或等价断言。这两个理论还揭示了互补的深度现象。深度神经变分空间证明了范数控制的单变量ReLU类的深度饱和性,而下面的布朗路径构造在局部非退化条件下沿着输入测度的支撑产生了严格的层次结构。它们的有限表示结果也是互补的:前者证明了范数惩罚数据拟合的表示定理,而VBKL给出了其完整无限维空间中每个元素的两阶段近似。
##### 深度分离与逼近。
经典的深度分离结果通过宽度、参数数量或相关的表示成本比较有限网络 [31, 11, 34, 33, 26]。我们的严格层次结构结果解决了一个不同的问题:相邻的内禀的、潜在的无限宽、范数受控的函数空间是否包含真正不同的函数。构造性理论也与非线性、贪婪和可变基逼近相关 [9, 32, 16, 30]。这里两种逼近资源具有不同的数学含义:原子数量控制外部带符号测度的离散化,而剖面分辨率控制每个选定布朗非线性的实现。
##### 结果的范围。
完整的路径原子VBKL空间和相关的有限混合架构扮演不同的角色。我们的分析性和构造性结果涉及由路径字典上的带符号测度生成的完整无限维空间。统计保证则涉及一个显式参数化的有限布朗变差类,其底层架构可能包括中间线性混合。该架构的纯路径特化是完整VBKL空间的一个子类,但未对一般混合架构提出此类包含关系。明确说明这一区别可以防止将有限参数复杂度归因于不受限的无限维变分球。主要贡献如下:
1. **路径原子递归变分空间。** 我们引入一个递归布朗字典,其中每个新原子是一个低级原子与一个归一化布朗再生核希尔伯特空间剖面的复合。我们精确地识别出每个字典是布朗回拉再生核希尔伯特空间单位球的并集,并将深度$L$的VBKL空间定义为它的有限带符号测度变分凸包。这给出了一个显式的无限维表示,同时使非线性递归和线性叠加在数学上保持独立。
2. **全空间几何。** 我们建立了变分复杂度的良定义性和非退化性。在输入集和方向集紧致的情况下,递归字典是紧致的,并且最小总变差表示是可达的。变分复杂度控制点态幅度和$2^{-(L-1)}$-Hölder正则性。当输入测度具有全支撑时,所得表示是唯一的并产生连续的Hölder嵌入。在局部非退化条件下(其迹位于输入测度的支撑中),这些空间随深度形成严格的层次结构。
3. **依赖架构的统计保证。** 对于具有分段线性布朗剖面、归一化混合和参数计数$P_{L-1,m,G}$的显式有限底层架构,我们推导出经验和期望Rademacher界以及一个高概率泛化保证。证明过程从再生核希尔伯特空间的并集表示转向布朗二次混沌,通过带符号阈值迹表示该混沌,并通过VC理论控制迹熵。该界分离了外部变差半径、递归布朗范围、有限架构大小和样本大小。
4. **具有分离资源的构造性逼近。** 完整VBKL空间中的每个函数首先由最多$M$个递归原子近似,误差为$M^{-1/2}$量级。然后,选定的外部布朗剖面被分段线性插值替代,产生额外的$m^{-1/2}$误差。平衡细化产生$O\left(N^{-1/2}\right)$的近似,具有有限的外部原子支撑和离散化的外部剖面。插值常数$\sqrt{A/2}$是最优的,并且评估所得模型最多使用$2M$个活跃的外部剖面基函数贡献,与$m$无关。
5. **理论导向的实验。** 受控实验分离了带符号测度离散化、剖面离散化和平衡细化,归一化帐篷构造精确达到了最坏情况插值界。监督学习研究比较了经验证选择的VBKL实现与深度神经变分空间和核基线。它们表明VBKL在有限数据情况下表现最强,并且存在有利的精度-参数权衡,而非普遍的预测主导地位。其他实验验证了有限差分方向估计器、蒙特卡洛方向平均带来的方差减少以及有限模型的实用可实现性。
论文的其余部分组织如下。第2节[2]介绍递归布朗字典、相关的VBKL空间和有限底层架构。第3节[3]建立完整VBKL空间的解析性质以及相关有限布朗变差类的依赖架构的统计保证。第4节[4]发展了两阶段构造性逼近理论。第5节[5]展示了关于逼近、统计学习、参数效率和优化的理论导向实验。相似文章
有趣的 BDH 之问:如果 LLM 的记忆驻留在网络权重中,而非不断膨胀的 KV cache 里,会怎样?
本文分析了 Jan Chorowski 提出的 BDH 架构方案,该方案探讨了一种替代传统 KV cache 的思路:利用稀疏高维 key-query 空间,将 LLM 的记忆直接嵌入到网络权重中。
超越神经网络的数据驱动变分基学习:一种用于自适应基发现的非神经网络框架
本文介绍了数据驱动变分基学习(DVBL),这是一种非神经网络框架,通过变分优化直接从数据中学习基函数,与神经网络相比,具有可解释性和数学透明性。
面向理解高维贝叶斯优化的自动化核发现
论文介绍了Kernel Discovery,这是一个LLM驱动的进化框架,用于高维贝叶斯优化,它搜索更广泛的核空间并在基准测试上取得了最先进的结果。
BODHI:LLM是否会分支并发现异质推理?
本文研究了经过RLVR训练的LLM是否会分支以发现异质推理,通过迷宫求解实验和BODHI-Trees表明,策略熵坍缩伴随着语义分支熵的减少,从而限制了展开(rollout)的多样性。
ALAS: 可加可学习 Alpha-Stable 核用于灵活贝叶斯优化
本文介绍了 ALAS,一种灵活的 Gaussian Process 核族,它从数据中学习稳定性参数以适应平滑度,同时捕捉平滑趋势和尖锐不规则性,具有适用于高维的可分离变体以及关于信息增益的理论保证。