H$^2$EDL: 用于层次分类的超证据深度学习

arXiv cs.LG 论文

摘要

本文提出H2EDL,一种用于层次分类的超证据深度学习模型,它能捕捉标签层次结构中多层次的不确定性,减少校准误差,并在细粒度识别任务中提高粗粒度类别的保留率。

arXiv:2608.18185v1 Announce Type: new 摘要:细粒度识别通常涉及层次化的标签空间,模型可能对粗语义概念有信心,但在其子类之间保持不确定性。这种结构化模糊性需要能同时捕捉细粒度类别和中间概念的不确定性表示。然而,现有的工具各只能捕捉一半:扁平证据分类器在叶子框架上使用单一空洞来量化完全无知,而层次分类器传播点概率而无证据概念。超意见本可以统一两者,但其一般形式在标签数量上呈指数级增长,现有的超证据网络要么要求在训练数据中提供复合标签,要么从非结构化权重模式中读取它们,缺乏哪些复合应该获得质量的原则性概念。我们观察到分类法本身就是缺失的超域。其子树和叶子单例形成线性大小的焦点家族,并且每个分支节点的局部狄利克雷意见以闭式形式诱导每个复合质量。由此产生的模型H$^2$EDL可以用同一组参数从两个互补的角度解释。从预测角度,它作为一个层次分类器,保持标签树不同层次的一致性。从概率角度,它定义了一个有效的树结构超意见,其中分配给每个节点的质量代表到达该节点的信念,但未提供足够信心进一步细化为其后代。在FGVC-Aircraft和DERM12345上,H$^2$EDL将校准误差相比交叉熵基线减少约一半,改进在更深层次和更大训练预算下更为显著。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:21

# H2EDL:面向层次分类的超证据深度学习
来源:https://arxiv.org/html/2608.18185

###### 摘要

细粒度识别通常涉及分层标签空间,模型可能对粗粒度语义概念有把握,但在其子类之间却不确定。这种结构化的模糊性需要一种不确定性表示,既能捕捉细粒度类别,又能捕捉中间概念。然而,现有工具只能捕捉其中一个方面:扁平证据分类器仅通过叶节点框架上的单一空虚度来量化完全的无知;层次分类器则通过点概率传播而没有证据的概念。超意见可以将两者统一起来,但其通用形式会随标签数量呈指数增长,现有的超证据网络要么需要在训练数据中提供组合标签,要么从无序的权重模式中读取它们,对于哪些组合应获得质量分配缺乏原则性考量。我们观察到,分类法本身就是缺失的超域。其子树和叶节点单例构成了线性大小的焦点族,每个分支节点上的一个局部狄利克雷意见就能以闭式形式诱导出所有组合质量。由此产生的模型 H2EDL 可以使用同一组参数从两个互补的视角进行解读。从预测视角看,它作为一个层次分类器,能保持标签树不同层次之间的一致性。从概率视角看,它定义了一个有效的树形结构超意见,分配给每个节点的质量代表到达该节点的信念,但尚未提供足够的置信度进一步细化为其后代类别。在 FGVC-Aircraft 和 DERM12345 数据集上,H2EDL 与交叉熵基线相比,校准误差降低了约一半,并且在更深的层次级别和更大的训练预算下,这种改进更为显著。尽管在叶级别准确率相似,但在犯细粒度错误时,它保留正确粗粒度类别的频率高出 19%。代码将会发布。

## 引言

不确定性感知分类要求模型不仅报告标签,还要说明其预测的可信度。大量文献通过校准、贝叶斯近似或证据参数化来提供这一数字。然而,当标签空间是一个层次结构时,单个数字无法传递该信息。考虑一个将概率 0.4 分配给波音 737-800 的飞机分类模型(图 1)。它可能处于两种截然不同的状态:它可能已经确定该飞机是 737 系列,仅在 -700、-800 和 -900 变体之间犹豫不决;或者它可能将剩余的质量分散到不相关的制造商中。置信度是相同的;但两种预测并不相同。区分开它们的不是模型持有多少不确定性,而是不确定性所在的位置。

参见图注图 1:标签层次上的不确定性具有位置性。H2EDL 在每个分支决策处携带一个局部意见,因此它对每个层次报告一个单独的空虚度:证据对制造商已相当确定(u1=0.2),对系列已较为稀薄(u2=0.5),而在 737 变体间则几乎耗尽(u3=0.7),而扁平证据模型对整个叶级别只有一个空虚度。扁平证据深度学习(EDL)可以估计不确定性,但它仅附着于叶级别,在那里一个全局标量无法描绘层次。层次分类器将标签树纳入预测,但通常仍然依赖于局部决策内的扁平概率归一化。主观逻辑提供了可以统一它们的对象——超意见,它为组合子集分配质量。其通用形式最多允许 2^L - 1 个焦点集。现有的超证据网络依赖于必须在训练集中手动指定的组合标签,尽管缺乏内在结构来定义此类标签;或者让组合从网络自身的权重结构中产生。两者都在扁平框架上操作,无法提供原则性的方式来判断哪些组合应获得质量。

分类法自然提供了所需的超域。与内部节点相关的后代叶节点集合,连同叶节点单例,定义了一个大小至多为 L + |B| 的焦点族,其大小随树结构线性增长,而非随标签数量指数增长。此外,该族中的每个元素都对应一个已在分类法中表示的有意义概念。此外,每个分支节点上的一个局部狄利克雷意见就能以闭式形式确定完整的超意见。标准的叶节点监督自然地训练这些局部意见,因为预测一个叶标签等价于沿着树做出一系列决策。因此,分类法同时提供了超域、参数化以及监督信号。不需要额外的标签构建、辅助预测网络或事后校准程序。

具体而言,H2EDL 在每个分支节点放置一个证据头部,并通过沿着从根到叶路径乘以条件均值来计算叶概率。相同的浓度参数允许两种互补的解读。从预测角度,它们定义了一个归一化且层次一致的叶分类器,从中可以直接获得任何粗粒度级别的预测。从不确定性角度,它们诱导出一个树形结构的超意见,其中节点 v 处的质量代表到达 v 但缺乏足够证据进一步下降的信念。

我们证明了这种质量分配是有效的,预测分布在每个叶节点子集的诱导超意见的信念-似然界内,并且非特定质量可以沿层次深度精确分解。因此,模型可以在没有额外推理程序的情况下识别沿每条预测路径证据不足的位置。

与一次比较所有 L 个叶类的扁平模型不同,H2EDL 进行一系列局部决策。每个决策都使用其子树中的所有样本进行训练,因此不确定性应随着层次加深而逐渐增加。祖先决策也限制了可能的错误区域,鼓励错误保留在附近的子树内。我们通过实验评估了这两个特性。我们首先考察现有基准是否能区分层次分类器,并发现它们的叶准确率通常由单个粗粒度决策主导,这可能会掩盖细粒度层次建模带来的增益。

贡献:
(i) 一个可处理的超证据形式化,其中分类法提供了一个线性大小的焦点族,组合信念在该族上被诱导而非预测。这消除了以往超证据网络局限于规定标签组的组合标签要求。
(ii) 一个操作性的分类器,其构造即具有层次一致性,并在每个单独的决策处暴露一个空虚度。
(iii) 连接两种解读的理论:诱导超意见的有效性(命题 1)、预测器包含在其信念集中(命题 2),以及非特定质量的精确深度分解(命题 3)。
(iv) 与问题相匹配的评估。在确立了叶准确率衡量所有方法共有的一个粗粒度决策之后,我们对每个层次进行评分,发现 H2EDL 在 DERM12345 的所有中间层次上都领先于所有基线。

## 相关工作

#### 层次分类。

标签分类法通过在损失函数或嵌入几何中编码树结构;或者事后在一个不变的概率向量上最小化层次风险;或者将预测向上对冲到祖先节点来利用。所有这些都作用于点概率。树约束或重新评分的分布不包含证据的概念,因此局限于一个子树内的歧义与分布在整个框架上的歧义仍然是同一对象。我们的目标是给预测一个结构化的不确定性,这种不确定性由树结构变得既有意义又低成本。

#### 证据深度学习。

EDL 预测狄利克雷浓度,并在单次前向传递中获得闭式认知不确定性。先验网络、18 综述的一系列方法,以及放宽先验权重和方差项或按 Fisher 信息重新加权的改进方法,都共享这一设计,并且都保持扁平框架,对整个标签集只有一个空虚度。最接近我们的是 HENN,它通过在规定组合标签集上进行分组狄利克雷来达到超意见,这些组合标签必须在训练数据中给出;HEDL 则相反,让组合从最终线性层的符号模式中产生,然后将超意见投影回扁平的多项式意见用于训练和预测。两种方法都在无结构的类框架上操作,其中没有机制确定哪些组合假设应获得质量。因此,组合质量仅反映对任意类别子集的不确定性,而不揭示这些子集代表什么。

## 方法

H2EDL 为分类法的每个分支节点分配一个关于其子节点的局部狄利克雷意见,并将这些意见沿着从根到叶的路径相乘。一组参数随后支持两种解读:一个层次无法矛盾的操作性分类器,以及一个组合质量被诱导而非预测的树形结构超意见。在固定符号之后,我们依次展开这两种解读。

### 符号与证据背景

我们在一个给定为有根树 T 的标签层次上进行分类,根节点为 r。叶节点 L(|L|=L)是细粒度目标;内部节点是更粗粒度的概念。节点 v 有子节点集合 C(v),K_v = |C(v)|;如果 K_v ≥ 2 则为*分支*节点,如果 K_v = 1 则为*穿透*节点,B 表示分支节点。每个叶节点 l 有唯一的从根到叶的路径 π(l),该路径诱导出一组*分支决策* D(l) = {(v, c_v) : v ∈ B ∩ π(l)},其中 c_v 是路径上 v 的子节点的索引;穿透节点不携带决策。

证据深度学习将 K 路预测视为单纯形上的狄利克雷分布:网络输出非负证据 e ∈ R_{≥0}^K,并形成 α = e + W a,其中先验权重 W > 0,基率 a ∈ Δ^{K-1},强度 S = Σ_k α_k。在主观逻辑中,这是一个*意见* (b, u, a),其中
b_k = e_k / S, u = W / S ∈ (0, 1], \hat{p}_k = α_k / S = b_k + a_k u, (1)
且 Σ_k b_k + u = 1。当总证据较小时,空虚度 u 较大:模型“不知道”。Sensoy EDL 是 W = K, a_k = 1/K 的情况。我们利用每个节点的空虚度来推理粒度。

### 操作性层次分类器

H2EDL 并非对 L 个叶节点建立一个狄利克雷分布,而是在每个分支节点附加一个轻量级证据头部。从共享主干特征 f = φ(x) 出发,每个头部产生关于其 K_v 个子节点的局部意见,
e_v = softplus(W_v^T f + b_v), α_v = e_v + W a_v, (2)
其中 b_{v,k}, u_v, \hat{p}_{v,k} 遵循公式 (1)。关键是将 \hat{p}_v 解读为条件概率 P(child | v, x)。设置 a_v = (1/K_v) 1, W = K_v 恢复标准 EDL 先验。对于不平衡的子节点,我们也允许一个*温度化逆频率*基率,a_{v,k} ∝ (n_{v,k} + s)^{-τ},基于训练计数 n_{v,k},带平滑 s,温度 τ ∈ [0, 1](τ=0 为均匀分布),以及 W = w_scale K_v:更稀有的子节点从更高的基线信念开始,因此预测它们需要较少的证据。这是一个不添加参数的固定缓冲区;我们将其称为*基率*变体。穿透节点既不接收头部也不接收损失。局部意见通过沿每条路径乘以投影均值来组合成叶分布,
P(l | x) = ∏_{(v,c) ∈ D(l)} \hat{p}_{v,c} = ∏_{(v,c) ∈ D(l)} α_{v,c} / S_v, (3)
任何内部概念的概率可以通过望远镜部分乘积精确恢复,
P(v | x) = ∑_{l ∈ leaves(v)} P(l | x) = ∏_{(u,c) ∈ D(v)} \hat{p}_{u,c}. (4)
命题 0(归一化与一致性)。对于任何局部均值 \hat{p}_v ∈ Δ^{K_v-1}:(i) Σ_l P(l | x) = 1;(ii) 粗粒度概率等于公式 (4);(iii) 如果 v 是 v' 的祖先,则 P(v' | x) ≤ P(v | x)。

因此,粗粒度评估不需要单独的头部,并且该模型构造上即具有层次一致性。接下来我们证明 {α_v} 比公式 (3) 的点分布携带更丰富的结构。

### 诱导的树形结构超意见

超意见为框架的单例和组合子集分配质量;一个叶框架允许 2^L - 1 个这样的子集,参数化或监督起来不切实际。H2EDL 转而让分类法选择焦点族
F_T = { {l} : l ∈ L } ∪ { leaves(v) : v ∈ B }, (5)
因此 |F_T| ≤ L + |B|,其大小随树线性增长,且每个焦点集都是一个有名称的概念。先验证据...

相似文章

证据深度学习的变分推断

arXiv cs.LG

提出了一种数学上严格的框架——变分推断的深度证据学习(VI-EDL),通过变分推断重新表述传统深度证据学习,推导出证据下界,建立泛化界,并在视觉和医学数据集上实现了最先进的性能,以解决传统深度证据学习的局限性。

面向LLM推理的统一数据选择

arXiv cs.CL

本文提出高熵总和(HES),这是一种无需训练的度量方法,用于为LLM训练选择高质量推理数据,并在SFT、RFT和RL等范式中得到验证。

DHRCL:训练代码LLM的密集分层奖励与课程学习

arXiv cs.LG

DHRCL提出了一种结合密集分层奖励与课程学习的强化学习框架,用于训练代码LLM。该框架在三个阶段的课程中,利用语法验证、执行成功、单元测试通过率和AST结构相似性作为反馈信号。