基于对数得分的核密度估计摊销带宽学习
摘要
本文提出了一种摊销框架,用于在对数得分下学习核密度估计中的带宽选择,并在多种采样场景中显示出相较于经典方法的一致性能提升。
arXiv:2608.20445v1 公告类型:新
摘要:核密度估计将有限样本转换为概率密度,但其性能关键取决于带宽选择。经典选择器通过分析或渐近方式规定样本到带宽的规则,或为每个样本求解新的优化问题。本文提出了一种摊销框架,通过优化对数得分,跨密度估计任务分布学习这一映射。截断并重新归一化的有界支撑公式实现了跨异构任务的稳定学习,而仿射标准化使得在单一参考区间上训练的选择器能够跨有界区间迁移。在Gaussian采样、多族基准测试和随机化Gaussian混合训练下的实验表明,摊销选择器一致且显著地优于Silverman's rule、Sheather-Jones selector和least-squares cross-validation,在小型和异构样本中尤其有较大提升。有限Gaussian混合提供了一种通用的训练机制,其$L^1$近似特性支持了这一点。以这种方式训练的选择器在不同密度结构上具有很强的泛化能力,允许相同的训练选择器直接应用于来自未知密度的有限样本,而无需指定或拟合分布族。这种广泛的适用性和强大的经验性能的组合使得该框架在需要将有限样本或集成转换为连续概率密度的各种应用中具有吸引力。
查看缓存全文
缓存时间: 2026/08/24 04:29
# 1引言 来源:https://arxiv.org/html/2608.20445 核密度估计下的对数分数与摊销带宽学习 Junyi Liang1 Hailiang Du2,1,3,\* 1华东理工大学数学学院,中国上海,200237 2达勒姆大学数学科学系;灾害、风险与韧性研究所,英国达勒姆,DH1 3LE 3伦敦政治经济学院数据科学研究所;全球可持续发展学院,英国伦敦,WC2A 2AE \*通讯作者:[hailiang\.du@durham\.ac\.uk](mailto:[email protected]) 摘要 核密度估计将有限样本转化为概率密度,但其性能关键取决于带宽的选择。经典选择器通过解析或渐近方式规定样本与带宽的规则,或针对每个样本求解新的优化问题。本文提出一种摊销框架,该框架通过在密度估计任务分布中优化对数分数来学习这一映射。一种截断并重新归一化的有界支撑公式使在异构任务中进行稳定学习成为可能,而仿射标准化则允许在一个参考区间上训练的选择器能够迁移到其他有界区间。在高斯采样、多族基准测试和随机高斯混合训练下的实验表明,该摊销选择器持续且显著优于Silverman规则、Sheather-Jones选择器和最小二乘交叉验证,在小型和异构样本中增益尤为明显。有限高斯混合提供了通用的训练机制,这得益于其L1L^\{1\}近似特性。以这种方式训练的选择器能很好地泛化到不同的密度结构,允许同一个训练好的选择器无需指定或拟合分布族即可直接应用于来自未知密度的有限样本。这种广泛的适用性与强大的实证性能相结合,使得该框架在众多需要将有限样本或集合转换为连续概率密度的应用中极具吸引力。 关键词:摊销学习;带宽选择;高斯混合模型;核密度估计;对数分数 ## 1引言 在许多应用中,我们只能从底层分布获取有限样本或有限集合,而推理、评估或决策最终需要的是连续概率密度。例如概率预测、基于模拟的不确定性量化以及其他主要关注尾部概率、预测似然或校准分布摘要的场景。核密度估计(KDE)是一种经典的非参数方法,用于将此类有限样本转换为密度估计[1 (https://arxiv.org/html/2608.20445#bib.bib1); 2 (https://arxiv.org/html/2608.20445#bib.bib2)]。在核密度估计中,核心的实际困难是带宽选择,因为带宽控制着平滑程度,从而对估计质量产生决定性影响。本研究聚焦于广泛使用的高斯核设置。尽管方法学是在此背景下开发和评估的,但学习可重复使用的带宽规则的基本思想并不限于高斯核,可以扩展到其他核族。 大量文献已为核密度估计开发了经典带宽选择器,包括经验法则方法[1 (https://arxiv.org/html/2608.20445#bib.bib1); 2 (https://arxiv.org/html/2608.20445#bib.bib2)]、插入式方法[6 (https://arxiv.org/html/2608.20445#bib.bib6); 7 (https://arxiv.org/html/2608.20445#bib.bib7)]和交叉验证方法[3 (https://arxiv.org/html/2608.20445#bib.bib3); 4 (https://arxiv.org/html/2608.20445#bib.bib4); 5 (https://arxiv.org/html/2608.20445#bib.bib5)]。经验法则选择器(如Silverman规则)基于正态参考假设和样本的全局尺度摘要,提供简单的闭式解[1 (https://arxiv.org/html/2608.20445#bib.bib1)],但这种简单性以依赖于固定参考结构为代价,该结构可能与偏斜、重尾、受污染或多峰密度匹配不佳。插入式方法更灵活,因为它们通常从估计准则的渐近近似开始,并用基于数据的估计替换由此产生的未知总体量,例如与曲率相关的泛函[6 (https://arxiv.org/html/2608.20445#bib.bib6); 7 (https://arxiv.org/html/2608.20445#bib.bib7)],但它们仍然依赖于渐近近似和对高阶量的可靠估计,这在小到中等样本中可能不稳定。交叉验证方法较少依赖于明确的参考模型,而是通过在候选值上优化基于样本的准则来选择带宽[3 (https://arxiv.org/html/2608.20445#bib.bib3); 4 (https://arxiv.org/html/2608.20445#bib.bib4); 5 (https://arxiv.org/html/2608.20445#bib.bib5)]。这些方法在带宽计算方式上有所不同。经验法则和插入式程序定义了可重复使用的样本到带宽算法,其结构由解析或渐近方式规定;而交叉验证程序通常为每个观测样本求解一个新的优化问题。它们通常不做的是从一组相关的密度估计任务分布中估计带宽选择映射本身。因此,它们无法直接利用跨任务的系统性变化来学习哪些样本特征在指定评估准则下能预测良好的带宽选择。这激发了一种不同的公式化方法,其中带宽规则是通过跨任务学习得到的。所提出的方法并非断言经典选择器在新样本上不可用;而是用一个映射(其参数从一组密度估计问题中估计得出)来替代解析规定或反复优化的选择器。由此产生的映射仍然能适应观测到的样本,同时融入了在训练任务分布中识别出的规律性。 核密度估计中的经典带宽选择主要是在集成平方误差准则下发展起来的,特别是MISE及其渐近近似[1 (https://arxiv.org/html/2608.20445#bib.bib1); 2 (https://arxiv.org/html/2608.20445#bib.bib2); 7 (https://arxiv.org/html/2608.20445#bib.bib7)]。这些准则在数学上很方便,但KDE最终产生的是概率密度,因此带宽质量自然被视为概率评估问题。仅仅严格的恰当性并不能决定如何比较不完美的密度估计,因为不同的严格恰当评分规则可能对它们的排序不同。局部性提供了另一个原则:对于连续密度,对数分数是唯一恰当的局部评分规则,直接依赖于分配给实现结果的密度[8 (https://arxiv.org/html/2608.20445#bib.bib8); 9 (https://arxiv.org/html/2608.20445#bib.bib9)]。相比之下,非局部分数可能奖励实现结果之外的报告密度特征,并可能产生不利的评估。对数分数在概率和信息比特方面也有直接的解释,而相对对数分数比较对于变量的平滑一一变换是不变的[10 (https://arxiv.org/html/2608.20445#bib.bib10)]。基于这些原因,所提出的框架直接在对数分数下学习带宽规则。 这些考虑表明了KDE带宽问题的另一种表述。本研究不是通过解析或渐近规定固定选择器的函数形式,也不是为每个观测到的样本求解新的带宽优化问题,而是从密度估计任务分布中学习样本到带宽的映射。核心思想是学习一个共享的样本到带宽映射,该映射从每个样本中提取结构信息,并输出适应于该任务的带宽。由此产生的映射,称为摊销带宽选择器,在相同的操作意义上是可重复使用的,但其函数行为是从跨任务数据中估计的,而非预先规定。由于估计的对象是概率密度,因此摊销选择器是在对数分数而非集成平方误差准则下训练和评估的。为了防止在对数分数评估下,位于遥远低密度区域的罕见实现值将带宽驱动到过大值,该框架采用基于截断和重新归一化的有界支撑公式化。这将目标密度和KDE都限制在一个共同的区间内,使得学习目标集中在实际感兴趣的区域,而不是受到外部行为的影响。通过这种方式,带宽选择不再被视为固定的解析规定,而是作为直接从任务变化中学习的可重复使用的规则。 最终框架从三个互补的角度进行评估。首先使用高斯基准测试,检验摊销选择器是否能在最透明的情况下捕捉KDE带宽的基本有限样本和缩放行为。然后引入一个有界多族基准测试,评估单个摊销选择器在密度族之间存在显著结构变化时是否仍然有效。最后,高斯混合模型(GMM)基准测试检查灵活的高斯混合生成器是否能替代设计的多族分布,作为学习摊销选择器的任务来源。这些实验共同检验了摊销选择器相对于经典选择器是否能改善实证性能,并且在多样化的密度估计任务中是否保持有效。 论文其余部分组织如下。第2节介绍了提出的带宽学习框架,包括摊销的样本到带宽映射、对数分数目标、有界支撑公式化以及用于跨区间迁移的区间标准化规则。第3节展示了实验结果。第4节总结了主要发现,并讨论了局限性和未来方向。 ## 2带宽学习框架 所提出的框架保留KDE作为最终的密度估计器,仅学习带宽选择规则。每个观测到的样本由一组置换不变的特征表示。神经网络将这些特征映射到一个带宽,然后用于构建KDE。与经典带宽选择器不同,样本到带宽的映射是跨密度估计任务联合学习的,然后无需针对特定任务重新优化即可用于新样本。该框架分三部分开发。首先将带宽选择表述为一个摊销学习问题,其中共享预测器跨相关任务将样本特征映射到带宽。然后将训练准则指定为对数分数,使选择器与用于评估密度估计的概率目标保持一致。最后,引入截断并重新归一化的有界支撑公式化以及仿射标准化,该标准化将有界任务域映射到一个共同的参考区间,并通过带宽缩放实现跨区间迁移。 ### 2.1摊销带宽预测 本小节形式化学习的对象。令f表示未知密度在R上,S=(x1,...,xn)∼fn S=(x\_\{1\},\\dots,x\_\{n\})\\sim f^\{n\}(1)是一个观测到的独立同分布样本,大小为n。对于带宽h>0,相关的高斯核密度估计器是 qh(x;S)=1nh∑i=1nφ(x−xih),φ(u)=(2π)−1/2e−u2/2。q\_\{h\}(x;S)=\\frac\{1\}\{nh\\}\\sum\_\{i=1\\}^\{n\\}\\phi\\\!\\left(\\frac\{x\-x\_\{i\}\\}\\{h\\}\\right),\\qquad\\phi(u)=(2\\pi)^\{\-1/2\\}e^\{\-u^\{2\\}/2\\}。(2)摊销选择器将样本到带宽的关系视为一个需要跨密度估计任务学习的未知映射。一旦训练完成,它可以应用于新样本,无需针对特定任务重新优化。带宽规则写为 hθ(S)=Fθ(feat(S)),h\_\{\\theta\\}(S)=F\_\{\\theta\\}(\\mathrm\\{feat\\}(S)),(3)其中feat(S) \\mathrm\\{feat\\}(S)是有限维的置换不变样本特征向量,Fθ F\_\{\\theta\\}是一个输出为正的参数化映射,θ表示其可训练参数。在当前的概念验证实现中,Fθ F\_\{\\theta\\}由一个简单的多层感知机实现,特征映射由样本大小、样本均值、样本标准差、样本偏度和样本峰度组成:feat(S)=(n,mean(S),sd(S),skew(S),kurt(S))。\\mathrm\\{feat\\}(S)=\\bigl(n,\\mathrm\\{mean\\}(S),\\mathrm\\{sd\\}(S),\\mathrm\\{skew\\}(S),\\mathrm\\{kurt\\}(S)\\bigr\\)。(4)这些特征捕捉了样本大小、位置、尺度、不对称性和尾部行为的基本信息,同时保持低维和可解释性。对于下面的高斯诊断基准测试,使用了一个简化的特例,其中网络仅学习一个作为样本大小函数的无量纲带宽比。 ### 2.2对数分数准则 训练准则取自恰当评分规则框架。评分规则为报告的概率密度和观测到的结果分配一个数值损失,较低的值表示更好的概率性能。严格恰当性确保报告数据生成分布在期望上是最优的[11 (https://arxiv.org/html/2608.20445#bib.bib11); 12 (https://arxiv.org/html/2608.20445#bib.bib12); 9 (https://arxiv.org/html/2608.20445#bib.bib9)]。这一性质至关重要,但它并不能唯一确定如何比较不完美的密度估计:不同的严格恰当评分规则可能对其排序不同[10 (https://arxiv.org/html/2608.20445#bib.bib10)]。局部性提供了进一步的区分。局部评分规则仅依赖于分配给实现结果的密度。对于连续密度,对数分数在仿射等价意义上是唯一恰当的局部评分规则[8 (https://arxiv.org/html/2608.20445#bib.bib8); 9 (https://arxiv.org/html/2608.20445#bib.bib9); 13 (https://arxiv.org/html/2608.20445#bib.bib13)]。这一性质与带宽选择特别相关,因为非局部分数可能奖励实现结果之外的估计密度特征,因此可能产生“不幸”的评估[10 (https://arxiv.org/html/2608.20445#bib.bib10)]。它们在变量进行平滑变换时也可能改变其偏好。相比之下,对数分数直接评估分配给实现值的密度,并在概率和信息比特方面具有直接解释[14 (https://arxiv.org/html/2608.20445#bib.bib14); 15 (https://arxiv.org/html/2608.20445#bib.bib15)]。它的样本平均值等于每个观测的负对数似然,而其期望值是交叉熵。这些考虑促使使用对数分数作为带宽选择的训练和评估准则。对于一个独立实现X∼f X\\sim f,特定任务的对数分
相似文章
基于自适应谱带宽控制的几何感知图构建
本文提出了一种用于核化图构建的自适应谱带宽控制方法,旨在使核谱性质与内在流形维度对齐,展示了在CIFAR-100上的自监督学习嵌入任务中的改进。
使用 Weak-form Kernel Ridge Regression 从噪声数据学习动力系统
介绍了用于从噪声测量中学习动力系统的 Weak-form Kernel Ridge Regression (WKRR) 方法,该方法结合弱形式与核岭回归以滤除噪声并提高精度。该方法在高达64维的混沌基准测试以及15000维的真实流体数据上优于基线方法。
面向理解高维贝叶斯优化的自动化核发现
论文介绍了Kernel Discovery,这是一个LLM驱动的进化框架,用于高维贝叶斯优化,它搜索更广泛的核空间并在基准测试上取得了最先进的结果。
Score Broadcast and Decorrelation: 一种基于广播的信用分配通用框架
介绍了Score Broadcast and Decorrelation (SBD),一种原则性的基于广播的信用分配框架,该框架可推广到包括交叉熵、Bregman散度和适当评分规则在内的可微损失族。该工作为三因子学习规则提供了理论基础,并在CIFAR-10和Tiny ImageNet上展示了相较于现有广播方法的性能提升。
分数匹配学习的有限样本界
本文首次为使用分数匹配学习多项式指数族提供了非渐近样本复杂度界,显示出对模型维度的多项式依赖。