树结构原型网络的双曲潜在几何:局部与全局的权衡
摘要
本文研究了在原型网络中使用双曲与欧几里得潜在几何对树结构正则化器的影响,表明双曲原型在WikiArt的层级分类中显著提高了局部拓扑保持。
arXiv:2608.25199v1 公告类型:新
摘要:我们研究了一个层级分类模型中类原型布局的树结构正则化器,并探讨原型潜在流形的选择(欧几里得 R^d 与 Poincare ball B^d_c)是否会影响该正则化器在不扭曲数据似然的情况下的满足程度。这两个流形仅在体积增长上有所不同:双曲空间随半径呈指数增长,并且能够以比匹配维度的 R^d 更低的失真度嵌入树结构,因此结构化正则化器在 B^d_c 上应该更容易满足。在WikiArt(27种风格,81,446幅画作,冻结的CLIP ViT-B/16特征)上,跨嵌入维度、曲率和正则化强度进行了150次种子复制的正则化最大似然拟合,我们发现了一个稳健的效果:Poincare原型在潜在空间中保持最近邻图的拓扑结构明显优于匹配的欧几里得原型(兄弟recall@5 +8.7 pp,堂兄弟recall +15.2 pp;配对t检验 p < 10^-4,符号一致性0.94),并且这一差距在三个参考树定义(手工构建的谱系、CLIP衍生的和DINOv2衍生的)中均成立。在分类任务中,欧几里得原型与原始编码器特征上的逻辑回归表现相当,表明潜在几何没有可检测的贡献;只有双曲拟合在k-NN编码器基线上改进了局部检索。全局树保真度比较在不同参考树之间不稳定,我们不声称有胜者。这些结果在一个真实的层级分类问题上,为类结构正则化器的两种自然潜在几何提供了经验分离。
查看缓存全文
缓存时间: 2026/08/27 09:36
# 基于双曲潜几何的树形结构原型网络:局部与全局的权衡 来源:https://arxiv.org/html/2608.25199 Peter Flo 机构:哈佛大学,美国马萨诸塞州剑桥市 联系邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 我们研究了层次分类模型中类别原型布局的树形结构正则化器,并探究原型所在的潜在流形选择(欧氏空间 $\mathbb{R}^d$ 与庞加莱球 $\mathbb{B}^d_c$)如何影响该正则化器在不扭曲数据似然度情况下的满足程度。两种流形的唯一区别在于体积增长特性:双曲空间随半径呈指数级增长,并能以更低的失真将树形结构嵌入相同维度的 $\mathbb{R}^d$ 中,因此在 $\mathbb{B}^d_c$ 上满足结构化正则化器的成本理论上更低。通过在 WikiArt 数据集(27 种风格,81,446 幅画作,冻结的 CLIP ViT-B/16 特征)上进行 150 次种子重复的正则化最大似然拟合实验,我们覆盖了嵌入维度、曲率和正则化强度,发现一个稳健的效应:庞加莱原型在潜在空间中保持最近邻图拓扑结构的能力显著优于匹配的欧氏原型(兄弟节点召回率@5 +8.7 pp,堂兄弟节点召回率 +15.2 pp;配对 t 检验 $p < 10^{-4}$,符号一致性 0.94),且该差距在三种参考树定义(人工构建的谱系树、基于 CLIP 的树、基于 DINOv2 的树)下均成立。在分类任务中,欧氏原型与原始编码器特征的逻辑回归表现相当,表明潜在几何未带来可检测的贡献;仅双曲拟合在局部检索任务上优于 k-NN 编码器基线。全局树保真度比较在不同参考树间不稳定,我们不宣称存在明确优势。实验结果在真实层次分类问题上,为类结构正则化器的两种自然潜在几何提供了实证区分。 ###### 关键词: 双曲几何、结构化正则化、层次分类、原型网络、庞加莱球 ## 1 引言 许多现实世界的分类问题带有外部指定的类标签层次结构:艺术风格流派相互分枝(Tan 等人, 2019),生物分类群嵌套为演化支,产品、疾病和文档的本体结构组织为树形。将这种层次结构融入概率分类模型的自然方式是为类条件参数的布局添加树形结构正则化器。我们研究其最简版本:一个原型分类器,其类条件似然是基于到原型距离的 softmax,同时对原型成对距离矩阵施加正则化,使其趋近树距离矩阵。最终拟合的分类器平衡了类似然项(风格 $k$ 的画作应靠近原型 $\mathbf{p}_k$)和树形项(原型本身应遵循层次结构)。 本文研究的正是原型所在潜在流形的选择。将具有指数级叶节点增长的树结构强行嵌入球体积仅随半径多项式增长的欧氏空间 $\mathbb{R}^d$,会导致成对距离不可避免的失真;这种失真已被解析刻画,并表明在自身具有指数体积增长以匹配树结构的庞加莱球 $\mathbb{B}^d_c$ 上会显著降低(Nickel 和 Kiela, 2017;Sala 等人, 2018)。在我们的模型中,树形结构正则化器是成对原型距离的函数,因此在双曲流形上满足它的成本应低于欧氏流形,且不会扭曲类条件似然。我们测试的正是这种几何优势能否在真实层次分类问题的实践中实现。 我们在 WikiArt-Refined(Tan 等人, 2019)上实例化这一问题,这是一个包含 27 种风格、81,446 幅画作的语料库,其类层次结构(文艺复兴分枝为巴洛克,巴洛克分枝为洛可可,洛可可分枝为浪漫主义,进而进入印象派和立体主义)是领域知识的一部分,并基于标准艺术史文献手工构建。冻结的 CLIP ViT-B/16 特征(Radford 等人, 2021)输入 MLP 头和原型分类器;分类器输出的流形是欧氏与双曲运行之间唯一变化的设计选择。相同的树形结构正则化器(对原型距离矩阵的归一化平方误差约束)在两种几何中均适用。 我们扫描了 150 次种子重复配置的正则化最大似然拟合,覆盖嵌入维度 $d \in \{2,4,8,16,32,64\}$、曲率 $c \in \{0.1,0.3,1,3\}$、正则化强度 $\lambda \in \{0,0.1,0.3,1,3\}$ 以及三种参考树变体(默认谱系树、按年代分组树、扁平零树)。三个经验发现如下: #### 局部层次结构 双曲原型恢复局部树结构的能力显著优于匹配的欧氏原型。在默认树上,$d=8$ 时兄弟节点召回率@5 为 0.195(欧氏)vs. 0.149(双曲);在 18 对种子配置的聚合结果中,兄弟节点召回率平均差为 +8.7 pp,堂兄弟节点召回率为 +15.2 pp,符号一致性 0.94,配对 t 检验 $p < 10^{-4}$。该效应在使用 CLIP 或 DINOv2 特征构建的数据驱动经验树重新定义兄弟集合时依然保持,且在整个正则化强度扫描中稳定。 #### 校准性 基于原始 CLIP 特征的逻辑回归基线达到 64.1% 的 top-1 准确率,与欧氏拟合的 64.3% 统计上无显著差异。相同特征上的 k-NN 基线达到 0.160 的兄弟节点召回率@5,与欧氏拟合的 0.149 统计无显著差异,但比双曲拟合的 0.195 低 3.5 pp。参照这些基线,双曲拟合是唯一在局部层次上提升编码器性能的模型;欧氏拟合在分类上与编码器相当,但未增加可检测的结构价值。 #### 全局树保真度 相对于默认树的平均树失真显著偏向欧氏,但原型树与树结构的 Spearman 相关系数在全扫描中未显著偏离零($p=0.68$),且出现的微小效应在基于 CLIP 和 DINOv2 特征质心的经验参考树之间符号反转。因此,我们不宣称在全局树保真度上存在几何优势。 实验支持的清晰结论比“几何全局重要”更窄:双曲潜在结构在局部检索价值上优于编码器,而欧氏潜在结构则未带来提升,且该局部优势在定义“局部”的三种参考树中均稳健。 #### 相关工作 双曲原型嵌入是处理树形数据的成熟工具(Nickel 和 Kiela, 2017;Sala 等人, 2018;Ganea 等人, 2018)。Khrulkov 等人(2020)在小样本基准测试中报告了类似的不对称性(有助于邻域结构,但 top-1 指标不变);我们在手工构建的分类体系及树感知正则化器下证实了该模式,并通过线性及 k-NN 校准基线对其进行量化,而此前关于该不对称性的报告未包含这些基线。双曲层次聚类中隐式使用了基于可学习点的树距离矩阵惩罚(Chami 等人, 2020);而我们将其用作显式、可调的正则化器。 ## 2 数据与参考树 我们使用 WikiArt-Refined(Tan 等人, 2019),包含约 81,446 幅标记为 27 种风格的画作,并采用其提供的 70/30 训练/验证划分。该语料库类别严重不平衡(印象派 13,060 例 vs. 分析立体主义 77 例,比例达 133.3 倍;完整分布见附录 B)。基于此有两个设计选择:原型分类器无类别偏置(仅几何距离影响 logits),同时我们报告平衡准确率及 top-1 准确率。 #### 参考树 WikiArt 未提供层次结构,艺术史也存在多种合理分类体系,因此我们使用三种树。*默认*树(附录 A)遵循标准艺术史谱系。*年代*树将风格分为六个时代桶(文艺复兴、巴洛克–洛可可、19 世纪、20 世纪早期、现代战后、非西方)。*扁平*树将所有风格作为根节点的直接子节点,作为刻意设计的零树,其非对角线成对距离恒定。对于叶子节点 $u,v$ 的树 $T$,树距离定义为无权重最短路径边数 $d_T(u,v) = \text{depth}(u) + \text{depth}(v) - 2\text{depth}(\text{LCA}(u,v))$。我们还通过凝聚聚类(第 4.2 节)基于类均值编码器特征构建了两种*经验*参考树:分别来自 CLIP 和 DINOv2,仅用于评估。 ## 3 模型与估计 #### 似然模型 令 $\phi$ 为冻结的 CLIP ViT-B/16 编码器(Radford 等人, 2021),$g_\theta: \mathbb{R}^{512} \to \mathcal{M}$ 为带 GELU 和 dropout 的两层 MLP,其中潜在流形 $\mathcal{M}$ 为欧氏空间 $\mathbb{R}^d$ 或曲率 $c>0$ 的庞加莱球 $\mathbb{B}^d_c$。对于风格 $y \in \{1,...,K\}$ 的图像 $x$,令 $z = g_\theta(\phi(x))$,并令 $\{\mathbf{p}_k\}_{k=1}^K \subset \mathcal{M}$ 为可学习的类原型。类条件似然是基于 $\mathcal{M}$ 上到原型距离的 softmax: $$p(y=k \mid z; \{\mathbf{p}_k\}) \propto \exp\!\bigl(-d_\mathcal{M}(z,\mathbf{p}_k)\bigr).$$ 编码器在两种几何中以相同方式馈入头模块;切换几何仅改变两件事:头的最终变换($\mathbb{R}^d$ 用恒等映射;球面用 $\exp_0^c(u) = \tanh(\sqrt{c}\|u\|) u/(\sqrt{c}\|u\|)$)和分类器使用的度量: $$d^c(x,y) = \frac{1}{\sqrt{c}} \operatorname{arcosh}\!\Bigl(1 + \frac{2c\|x-y\|^2}{(1-c\|x\|^2)(1-c\|y\|^2)}\Bigr).$$ 骨干网络、MLP 宽度、dropout、批大小、优化器和调度计划保持一致。 #### 树形结构正则化器 我们对原型布局添加树形结构正则化器。令 $D_{ij} = d_\mathcal{M}(\mathbf{p}_i,\mathbf{p}_j)$ 为 $\mathcal{M}$ 上的成对原型距离矩阵,$T_{ij} = d_T(i,j)$ 为参考树 $T$ 上的树距离矩阵。正则化器惩罚这两个距离矩阵*形状*之间的偏差: $$\mathcal{R}(\{\mathbf{p}_k\}) = \frac{\lambda}{|\mathcal{P}|} \sum_{(i,j) \in \mathcal{P}} \Bigl(\frac{D_{ij}}{\bar{D}} - \frac{T_{ij}}{\bar{T}}\Bigr)^{\!2},$$ 其中 $\mathcal{P}$ 为 $\binom{K}{2}$ 个非对角对的集合,$\bar{D},\bar{T}$ 为 $D,T$ 的均值,$\lambda$ 控制正则化强度。对每对距离在差值前进行均值归一化,使正则化器对 $\mathcal{M}$ 上距离的绝对尺度不变:几何可自由选择似然所需的尺度,而正则化器仅约束原型距离矩阵的相对结构。$\lambda=0$ 回退到先前双曲图像工作(Khrulkov 等人, 2020)中使用的交叉熵基线。我们将 $\mathcal{R}$ 视为惩罚项而非贝叶斯对数先验:$\mathcal{R}$ 不是 $\mathcal{M}^K$ 上归一化密度的对数(它在每次评估时均值重缩放),因此不具备恰当先验的解释,我们报告的是正则化最大似然估计而非后验的 MAP 估计。 #### 估计 我们通过随机梯度下降最小化正则化负对数似然 $\mathcal{L}(\theta,\{\mathbf{p}_k\}) = \mathcal{L}_{\text{CE}}(\theta,\{\mathbf{p}_k\}) + \mathcal{R}(\{\mathbf{p}_k\})$。Adam 优化 MLP 头;来自 geoopt(Kochurov 等人, 2020)的黎曼 Adam 优化双曲原型,每次更新后投影回流形。正则化器在每个梯度步上对 $\binom{27}{2}=351$ 个非对角风格对计算一次,相比每批次的似然项成本可忽略。该框架明确表明:正则化器是对几何量(原型距离矩阵)的结构化惩罚,而潜在流形的选择控制着将该惩罚驱动至零的成本。 #### 失真界 正则化器是成对原型距离的函数,因此在任何树距离矩阵 $T$ 允许低失真等距嵌入的潜在几何中,最优解处的正则化器成本很小。Sala 等人给出 $\mathbb{B}^d_c$ 的失真界约为 $1/d$,而固定 $d$ 时 $\mathbb{R}^d$ 具有常数下界(Sala 等人, 2018)。经验问题是:该渐进结论是否能在适中 $d$ 下的真实数据集、真实分类似然和有限样本拟合(而非等距嵌入目标)中显现。 #### 训练细节 共 150 次运行;批大小 4096;头模块学习率 $\eta=10^{-3}$,原型学习率 $10^{-2}$;权重衰减 $10^{-4}$;dropout 0.1;梯度范数裁剪至 1.0;30 个 epoch。CLIP 特征预缓存为 float16 张量,使每次运行在单个 Apple M 系列 GPU 上低于 10 秒,完整扫描在半小时内完成。每个标题配置在三个种子上重复;报告的误差条为种子标准差。跨种子显著性比较使用维度扫描的 18 对(维度,种子)配对 t 检验,双曲配置按每对最佳曲率选择。 #### 评估 有用的风格嵌入可在三个正交轴上发挥作用,我们为每个轴报告指标。*分类*为 top-1、top-5 和平衡准确率。*全局树保真度*为学习到的原型距离矩阵与树距离矩阵的 Spearman 相关系数,加上平均和最坏情况乘性失真。*局部树保持*为每个验证嵌入的 $k$ 近邻中兄弟节点和堂兄弟节点的召回率@k,$k \in \{5,10\}$。兄弟/堂兄弟集合从参考树导出;
相似文章
设计驱动的Neural Collapse: 超球面上的类别原型学习
本文表明,交叉熵和监督对比学习都是超球面上的原型学习形式,并提出了归一化损失函数(NTCE和NONL),这些损失函数通过设计实现Neural Collapse,性能优于标准方法。
Topological Simplification in Predictive Coding Networks
The paper studies the topology of learned representations in predictive coding networks using persistent homology, finding that smaller models simplify topology earlier than larger ones and that earlier simplification correlates with worse reconstruction performance.
拓扑增强的大语言模型对齐:轨迹拓扑损失与拓扑偏好优化
本文介绍了一种用于大语言模型的拓扑增强对齐框架,利用基于持续同调的轨迹拓扑损失和拓扑偏好优化,对隐藏空间中的语义轨迹进行正则化。
语义空间的几何结构:离散与连续模型的比较研究
本文比较了深度学习向量嵌入(CamemBERT)和词汇共现图模型在法语“大国民辩论”语料库上引发的几何结构,发现局部拓扑相似但全局组织截然不同,凸显了两种方法的互补性。
基于霍奇分解的拓扑保持神经算子学习
本文提出了一种基于霍奇分解的拓扑保持神经算子学习方法,用于分离拓扑和几何分量,在几何网格上提高了准确性和效率。