Aitchison单纯形的树结构正交归一分解

arXiv cs.LG 论文

摘要

本文介绍了PolyILR,一种与任意树拓扑对齐的Aitchison切空间的正交归一分解,为诸如微生物组和单细胞谱等成分数据提供了稳定且可解释的特征。

arXiv:2606.11646v1 公告类型:新 摘要:成分数据——编码相对比例的向量——出现在生态学、地球化学和基因组学等多个科学领域。这些数据中的特征通常具有已知的层次结构(例如分类学、系统发育、本体论),但现有方法要么忽略这种结构,要么丢弃内在的Aitchison几何,要么专为二叉树设计,要么产生不完整的坐标系。我们描述了PolyILR,一种与任意树拓扑对齐的Aitchison切空间的正交归一分解。我们的构造在每个内部节点定义了一个加权局部几何,捕获完整的分支结构,然后将它们提升为一个全局正交基,其中每个坐标对应一个特定的树位置。在微生物组和单细胞基准测试中,PolyILR提供了稳定且可解释的特征,并支持多尺度树分辨率下的推理。我们还建立了与softmax分类器的新理论联系,暗示了在概率建模中的可能应用。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:50

# 树结构正交分解下的艾奇逊单纯形 来源: https://arxiv.org/html/2606.11646 张启军, Travis Pence, Barbara B\. Bendlin, Federico Rey, Vikas Singh

###### 摘要

组合数据——编码相对比例的向量——出现在多个科学领域,包括生态学、地球化学和基因组学。这些数据的特征通常具有已知的层次结构(例如,分类学、系统发育、本体论),然而现有方法要么忽略这种结构,要么丢弃内在的艾奇逊几何,要么专为二叉树设计,要么生成不完整的坐标系。我们描述了 *PolyILR*,一种与任意树拓扑对齐的艾奇逊切空间的正交规范分解。我们的构造在每个内部节点处定义了一个加权的局部几何,捕获完整的分支结构,然后将这些提升为一个全局正交基,其中每个坐标对应一个特定的树位置。在微生物组和单细胞基准测试中,PolyILR 提供了稳定、可解释的特征,并支持多尺度树分辨率下的推断。我们还建立了与 softmax 分类器的新理论联系,指出了在概率建模中的潜在应用。

机器学习, ICML

## 1 引言

*组合数据*——总和无内在意义的非负向量(或分量)——出现在科学和统计学的多种场景中,包括微生物组谱、细胞类型比例、生态计数和概率模型输出 (Gloore 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib13); Billheimer 等, 2001 (https://arxiv.org/html/2606.11646#bib.bib11); Buettner 等, 2021 (https://arxiv.org/html/2606.11646#bib.bib24))。这些数据位于单纯形上,其推断基于*相对*值而非绝对值。通常,各分量并非可互换,而是按照反映进化、功能或语义关系的领域层次结构组织 (Silverman 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib4); Harmon, 2019 (https://arxiv.org/html/2606.11646#bib.bib16))。这些树描述了哪些分量间的比较有意义以及以何种分辨率进行比较。

组合数据分析(CoDA)中的标准工具是*艾奇逊几何* (Aitchison, 1982 (https://arxiv.org/html/2606.11646#bib.bib9)),它形式化了只有比值才包含信息这一观点。这通过将组合数据等距对数比(ILR)嵌入到欧几里得空间来实现 (Egozcue 等, 2003 (https://arxiv.org/html/2606.11646#bib.bib1))。这里,各分量被*对称*对待,部分反映了该方法的起源领域(通常假设无外部结构)(Egozcue and Pawlowsky-Glahn, 2005 (https://arxiv.org/html/2606.11646#bib.bib6); Mandal 等, 2015 (https://arxiv.org/html/2606.11646#bib.bib20))。但在许多应用中,已知领域特定的层次结构:树指定了哪些比较有意义以及它们之间的关联。为弥补这一差距,文献提供了整合树结构的策略,例如基于树的平衡和系统发育感知坐标。这样做提高了可解释性和下游分析的效果。然而,现有方法通常针对特定场景(例如,系统发育重建中的二叉树,选定的对比) (Silverman 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib4); Washburne 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib5); Morton 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib22)),或依赖于几何外部的构造选择 (Lozupone and Knight, 2005 (https://arxiv.org/html/2606.11646#bib.bib39); Mao and Ma, 2022 (https://arxiv.org/html/2606.11646#bib.bib40))。例如,一个多叉节点不存在规范二叉分解,而二叉树方法强加了一个任意选择(图 1 (https://arxiv.org/html/2606.11646#S2.F1))。因此,我们研究的关键问题是:层次结构能否以一般化、几何上原理性且对任意树规范的方式加以整合。

**主要难点。**核心问题在于结构不兼容。艾奇逊几何将组合数据识别到*全局*缩放:一个 $(d-1)$ 维欧几里得切空间,ILR 坐标位于其中。但树施加了*局部*和*嵌套*约束:区分在进化枝(即子树)内才有意义,且比较发生在多个分辨率上。对齐这两者需要*分解*艾奇逊切空间以尊重每个内部节点的分支结构。二叉树通过将每个节点简化为单一对比来回避这个问题(图 1 (https://arxiv.org/html/2606.11646#S2.F1))。对于多分支(即*多叉*)层次结构,不存在规范构造。

**本文。**我们询问:是否存在一种艾奇逊切空间的正交分解,能够兼容任意树结构和单纯形不变性——同时不牺牲等距性或引入任意选择。这样的分解将为每个内部节点提供一个几何上合理的签名,并为单纯形值数据提供一个多尺度坐标系,使其与标准 ILR 方法处于同等地位 (Pawlowsky-Glahn and Egozcue, 2001 (https://arxiv.org/html/2606.11646#bib.bib10)),同时将分析牢固地建立在树结构之上。这种坐标系的缺失不仅限于传统 CoDA,也延伸到概率模型表示。Softmax 输出是单纯形值,但通常以平坦概率坐标表示,而结果上的结构日益明确:类别分类法、语义层次结构、语法、树结构搜索空间 (Silla Jr and Freitas, 2011 (https://arxiv.org/html/2606.11646#bib.bib59))。缺乏超越启发式方法的规范树对齐坐标系,限制了对概率质量、误差或学习信号集中位置的分析。

**贡献。**我们 (1) 构建了 *PolyILR*(多叉 ILR),一种与任意树对齐的艾奇逊切空间的正交规范分解,肯定地回答了上述问题;(2) 展示了它在 CoDA 中的实用性:在标准微生物组和单细胞数据集中进行稳定的特征选择和树级别推断;(3) 通过共享不变性结构,建立了与 softmax 分类器的新理论联系。我们的目标是表示本身的可解释性,而非下游性能:每个坐标对应一个特定的树位置(即节点-对比对),从而产生一致、基于树的分析和推断(见表 1 (https://arxiv.org/html/2606.11646#S5.T1))。

代码可在 https://github.com/vsingh-group/polyilr 获取。

**利益冲突披露。**作者声明与本工作无财务利益冲突。

## 2 背景

原始树 $\mathcal{T}$
1
2
3
4
$k=3$
$V \in \mathbb{R}^{4 \times 3}$
二叉化树 $\mathcal{T}_b$
1
2
3
4
人工节点
$V_b \in \mathbb{R}^{4 \times 3}$

图 1:*多叉树与二叉化树。*(左)根节点为多叉 ($k=3$) 的 $\mathcal{T}$。PolyILR 为根节点分配 $k-1=2$ 个基向量($V$ 的列,红色)。(右)PhILR 所需的二叉化 $\mathcal{T}_b$(*每个节点一个坐标*)引入了一个人工节点(黄色),编码了叶子 1 和 2 的任意分组——这一选择在原始 $\mathcal{T}$ 中并无依据。

我们介绍组合数据的几何,并形式化树对齐问题(参见 Aitchison (1982 (https://arxiv.org/html/2606.11646#bib.bib9)))。

### 2.1 艾奇逊几何

**组合数据。**组合数据是非负向量,其总和无信息,只有相对比例才重要,例如微生物丰度(具有不同测序深度的计数)或化学浓度(混合物的组成部分) (Gloore 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib13); Jackson, 1997 (https://arxiv.org/html/2606.11646#bib.bib14))。我们将其归一化到单位总和,将数据置于开放单纯形中:

$$\Delta^{d-1} = \left\{ x \in \mathbb{R}^d_{>0}: \sum_{i=1}^d x_i = 1 \right\}. \tag{1}$$

关键约束是只有比值 $x_i/x_j$ 携带信息,而非绝对值。

**几何是固定的。**艾奇逊几何 (Aitchison, 1982 (https://arxiv.org/html/2606.11646#bib.bib9)) 通过给集合 $\Delta^{d-1}$ 配备扰动运算 $x \oplus y = \mathcal{C}(x_1 y_1, \ldots, x_d y_d)$ 和幂运算 $\alpha \odot x = \mathcal{C}(x_1^\alpha, \ldots, x_d^\alpha)$ 来形式化这一点,其中 $\mathcal{C}(\cdot)$ 是闭包运算。在这些运算下,$(\Delta^{d-1}, \oplus, \odot)$ 形成了一个 $(d-1)$ 维希尔伯特空间,内积为:

$$\langle x, y \rangle_A = \frac{1}{d} \sum_{i=1}^d \sum_{j=1}^d \log \frac{x_i}{x_j} \log \frac{y_i}{y_j}.$$

诱导的艾奇逊距离 $d_A(x, y) = \| x \ominus y \|_A$ 是扰动不变的:$d_A(x \oplus z, y \oplus z) = d_A(x, y)$。注意,这种几何*不是建模选择*——它是尊重组合不变性的唯一结构。

### 2.2 ILR 基

**基是一种选择。**中心化对数比 (CLR) 变换将 $x \in \Delta^{d-1}$(在艾奇逊几何下)等距映射到 CLR 超平面(即*艾奇逊切空间*)

$$\mathcal{H} = \{ z \in \mathbb{R}^d: \mathbf{1}^\top z = 0 \} \tag{2}$$

通过 $\text{clr}(x) = (\log x_1 / g(x), \ldots, \log x_d / g(x))$,其中 $g(x) = (\prod_i x_i)^{1/d}$ 是几何均值。任何矩阵 $V \in \mathbb{R}^{d \times d-1}$,其*列构成 $\mathcal{H}$ 的一组标准正交基*,都会产生等距对数比 (ILR) 坐标,并允许一个等距双射

$$\varphi(x) = V^\top \log x, \tag{3}$$

从 $(\Delta^{d-1}, \langle \cdot, \cdot \rangle_A)$ 到 $(\mathbb{R}^{d-1}, \langle \cdot, \cdot \rangle_2)$ (Egozcue 等, 2003 (https://arxiv.org/html/2606.11646#bib.bib1))。所有这样的基 $V$ 通过正交变换相关联。也就是说,它们诱导相同的几何,但对单纯形进行不同的分解。因此问题不在于是否使用 ILR 基,而在于*选择哪个基*,这一选择在很大程度上决定了可解释性。

**基的选择控制可解释性。**这与经典信号处理相似:傅里叶基从平移对称性得到频率分量 (Brigham, 1988 (https://arxiv.org/html/2606.11646#bib.bib25));小波基从二叉划分得到尺度局部分量 (Mallat, 2002 (https://arxiv.org/html/2606.11646#bib.bib26))。将基与领域结构对齐可产生可解释的坐标。

## 3 问题设定

**组合数据附带有树。**组合数据的 $d$ 个分量通常由一棵已知的有根树 $\mathcal{T}$ 组织,例如生态学中的系统发育树或分类树,基因组学中的基因本体 (Ashburner 等, 2000 (https://arxiv.org/html/2606.11646#bib.bib41); Lozupone and Knight, 2005 (https://arxiv.org/html/2606.11646#bib.bib39))。该树编码了领域结构:哪些比较有意义以及以何种分辨率进行。因此,我们寻求一个与 $\mathcal{T}$ 对齐的基 $V$。

**二叉树。**当 $\mathcal{T}$ 是二叉树时,每个内部节点 $u$ 恰好有两个子节点,这产生一个*对比*:两个后代进化枝的几何均值的对数比。这是顺序二叉划分 (SBP) 的特例 (Egozcue and Pawlowsky-Glahn, 2005 (https://arxiv.org/html/2606.11646#bib.bib6)),Silverman 等 (2017 (https://arxiv.org/html/2606.11646#bib.bib4)) 将其应用于系统发育并称为 *PhILR*。PhILR 非常适用于该场景,因为系统发育通常被推断为二分叉的,且这里正交性直接成立:不相交节点上的对比具有不相交的支持,嵌套节点上的对比是正交的,因为内部对比在每个子进化枝上求和为零。这种构造之所以有效,是因为二叉分支施加了极小的局部结构:每个节点恰好需要一个对比,从而在内部节点和基向量之间建立一一对应关系。要求局部对比组合成叶子上的标准正交基的全局一致性问题,简化为验证*成对*正交性,这通过支持结构和零和约束成立。

**多叉树时会发生什么?**对于一般树 $\mathcal{T}$,上述简单性被打破(图 1 (https://arxiv.org/html/2606.11646#S2.F1))。考虑一个节点 $u$,有 $k_u>2$ 个子节点。比较 $k_u$ 个进化枝需要 $k_u-1$ 个正交对比——这是一个子空间,而非单一向量。出现若干挑战:(i) 在 $u$ 处定义规范的局部对比,(ii) 将其扩展到叶子上的全局向量,以及 (iii) 确保所有节点间的正交性。标准方法会失败,因为不同大小的子树对内积的贡献不相等,稍后详述。

**多叉树在实践中很常见。**多叉树在系统发育中既以硬多叉形式出现(例如快速辐射),也以软多叉形式出现(例如低支持节点折叠)(Maddison, 1989 (https://arxiv.org/html/2606.11646#bib.bib62))。NCBI 分类数据库中约 64% 的分类分支点具有三个或更多子节点 (Lin 等, 2011 (https://arxiv.org/html/2606.11646#bib.bib29)),生物医学本体通常编码多路分组,例如细胞本体 (Diehl 等, 2016 (https://arxiv.org/html/2606.11646#bib.bib63))。这些精心构建的树通常携带*有意义的内部结构*(例如,独立命名的内部节点),可为下游表示提供信息。然而,在实践中,人们通常*任意地*将其细化为二叉树 (Lin 等, 2011 (https://arxiv.org/html/2606.11646#bib.bib29))。这引入了原始层次结构中*不存在*的额外内部节点和分裂,使得最终的坐标和解释依赖于二叉化。替代方法旨在通过对数对比回归、贪婪平衡选择 (Rivera-Pinto 等, 2018 (https://arxiv.org/html/2606.11646#bib.bib21))、成对对数比检验 (Mandal 等, 2015 (https://arxiv.org/html/2606.11646#bib.bib20)) 或通过边选择进行系统发育引导的 ILR 因子 (Washburne 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib5)) 来识别预测性对数比特征。但这些方法产生的是孤立的对比,而不是一个完整的、按节点分组的、规范地绑定到给定多叉树的标准正交坐标系。现有方法无法为一般树提供一种规范的、完整的正交分解,同时定义局部对比、全局扩展并确保一致性。在不牺牲等距性或引入任意选择的情况下获得这样的分解是我们的目标。

## 4 PolyILR

$u_1$
1
$u_2$
2
3
$u_3$
4
5
6
$k_1=3$
$k_2=2$
$k_3=3$

*PolyILR*
$u_1$
$u_2$
$u_3$
$v_1$
$v_2$
$v_3$
$v_4$
$v_5$
1
2
3
4
5
6

图 2:*PolyILR* 从 $d=6$ 个叶子的 $\mathcal{T}$ 到 $V \in \mathbb{R}^{d \times (d-1)}$。颜色表示生成节点;白色条目为零。

我们在 §4.1 中描述高层次思路,在 §4.2 中给出形式构造,在 §4.3 中讨论性质。

### 4.1 从层次结构到几何

**目标。**我们寻求 $\mathcal{H}$ 的一个正交分解,以反映完整的树结构。现有方法要么

(原文在此处截断,但根据论文结构,接下来应继续。由于用户提供的输入到此结束,我的翻译也在此结束。但用户要求翻译“整个给定的 markdown 文章内容”,因此我应翻译到输入结束处。注意,用户输入在“反映完整的树结构。现有方法要么”后中断,但这是原文可能的截断?实际上原输入在“senting the full”后以“$\mathcal{T}$ reflecting the ful”结束,这看起来是句子的中断。但根据上下文,用户可能只想翻译给出的部分。我将翻译到给定的结束位置。)

注意:原输入在“Goal\.We seek an orthonormal decomposition of $\mathcal{H}$ reflecting the ful”处结束。这显然是截断的。但用户提供了完整的英文文章片段,最后一句是“Goal\.We seek an orthonormal decomposition of $\mathcal{H}$ reflecting the ful”。我应忠实翻译这部分。由于它不完整,我保留其不完整性。

但为了流畅,我可以根据常见论文结构推断,但作为翻译,应忠实于输入。我将在翻译中保留原样。

从上文看,Goal 句以“reflecting the ful”结束,可能意为“reflecting the full tree structure”。我将翻译为“反映完整树结构的”并保持未完成状态。但更合理的做法是,由于用户提供的文本到此处结束,我翻译到此处即可。

最终输出应为翻译后的 markdown。# 树结构正交分解下的艾奇逊单纯形 来源: https://arxiv.org/html/2606.11646 张启军, Travis Pence, Barbara B\. Bendlin, Federico Rey, Vikas Singh

###### 摘要

组合数据——编码相对比例的向量——出现在多个科学领域,包括生态学、地球化学和基因组学。这些数据的特征通常具有已知的层次结构(例如,分类学、系统发育、本体论),然而现有方法要么忽略这种结构,要么丢弃内在的艾奇逊几何,要么专为二叉树设计,要么生成不完整的坐标系。我们描述了 *PolyILR*,一种与任意树拓扑对齐的艾奇逊切空间的正交规范分解。我们的构造在每个内部节点处定义了一个加权的局部几何,捕获完整的分支结构,然后将这些提升为一个全局正交基,其中每个坐标对应一个特定的树位置。在微生物组和单细胞基准测试中,PolyILR 提供了稳定、可解释的特征,并支持多尺度树分辨率下的推断。我们还建立了与 softmax 分类器的新理论联系,指出了在概率建模中的潜在应用。

机器学习, ICML

## 1 引言

*组合数据*——总和无内在意义的非负向量(或分量)——出现在科学和统计学的多种场景中,包括微生物组谱、细胞类型比例、生态计数和概率模型输出 (Gloore 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib13); Billheimer 等, 2001 (https://arxiv.org/html/2606.11646#bib.bib11); Buettner 等, 2021 (https://arxiv.org/html/2606.11646#bib.bib24))。这些数据位于单纯形上,其推断基于*相对*值而非绝对值。通常,各分量并非可互换,而是按照反映进化、功能或语义关系的领域层次结构组织 (Silverman 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib4); Harmon, 2019 (https://arxiv.org/html/2606.11646#bib.bib16))。这些树描述了哪些分量间的比较有意义以及以何种分辨率进行比较。

组合数据分析(CoDA)中的标准工具是*艾奇逊几何* (Aitchison, 1982 (https://arxiv.org/html/2606.11646#bib.bib9)),它形式化了只有比值才包含信息这一观点。这通过将组合数据等距对数比(ILR)嵌入到欧几里得空间来实现 (Egozcue 等, 2003 (https://arxiv.org/html/2606.11646#bib.bib1))。这里,各分量被*对称*对待,部分反映了该方法的起源领域(通常假设无外部结构)(Egozcue and Pawlowsky-Glahn, 2005 (https://arxiv.org/html/2606.11646#bib.bib6); Mandal 等, 2015 (https://arxiv.org/html/2606.11646#bib.bib20))。但在许多应用中,已知领域特定的层次结构:树指定了哪些比较有意义以及它们之间的关联。为弥补这一差距,文献提供了整合树结构的策略,例如基于树的平衡和系统发育感知坐标。这样做提高了可解释性和下游分析的效果。然而,现有方法通常针对特定场景(例如,系统发育重建中的二叉树,选定的对比) (Silverman 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib4); Washburne 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib5); Morton 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib22)),或依赖于几何外部的构造选择 (Lozupone and Knight, 2005 (https://arxiv.org/html/2606.11646#bib.bib39); Mao and Ma, 2022 (https://arxiv.org/html/2606.11646#bib.bib40))。例如,一个多叉节点不存在规范二叉分解,而二叉树方法强加了一个任意选择(图 1 (https://arxiv.org/html/2606.11646#S2.F1))。因此,我们研究的关键问题是:层次结构能否以一般化、几何上原理性且对任意树规范的方式加以整合。

**主要难点。**核心问题在于结构不兼容。艾奇逊几何将组合数据识别到*全局*缩放:一个 $(d-1)$ 维欧几里得切空间,ILR 坐标位于其中。但树施加了*局部*和*嵌套*约束:区分在进化枝(即子树)内才有意义,且比较发生在多个分辨率上。对齐这两者需要*分解*艾奇逊切空间以尊重每个内部节点的分支结构。二叉树通过将每个节点简化为单一对比来回避这个问题(图 1 (https://arxiv.org/html/2606.11646#S2.F1))。对于多分支(即*多叉*)层次结构,不存在规范构造。

**本文。**我们询问:是否存在一种艾奇逊切空间的正交分解,能够兼容任意树结构和单纯形不变性——同时不牺牲等距性或引入任意选择。这样的分解将为每个内部节点提供一个几何上合理的签名,并为单纯形值数据提供一个多尺度坐标系,使其与标准 ILR 方法处于同等地位 (Pawlowsky-Glahn and Egozcue, 2001 (https://arxiv.org/html/2606.11646#bib.bib10)),同时将分析牢固地建立在树结构之上。这种坐标系的缺失不仅限于传统 CoDA,也延伸到概率模型表示。Softmax 输出是单纯形值,但通常以平坦概率坐标表示,而结果上的结构日益明确:类别分类法、语义层次结构、语法、树结构搜索空间 (Silla Jr and Freitas, 2011 (https://arxiv.org/html/2606.11646#bib.bib59))。缺乏超越启发式方法的规范树对齐坐标系,限制了对概率质量、误差或学习信号集中位置的分析。

**贡献。**我们 (1) 构建了 *PolyILR*(多叉 ILR),一种与任意树对齐的艾奇逊切空间的正交规范分解,肯定地回答了上述问题;(2) 展示了它在 CoDA 中的实用性:在标准微生物组和单细胞数据集中进行稳定的特征选择和树级别推断;(3) 通过共享不变性结构,建立了与 softmax 分类器的新理论联系。我们的目标是表示本身的可解释性,而非下游性能:每个坐标对应一个特定的树位置(即节点-对比对),从而产生一致、基于树的分析和推断(见表 1 (https://arxiv.org/html/2606.11646#S5.T1))。

代码可在 https://github.com/vsingh-group/polyilr 获取。

**利益冲突披露。**作者声明与本工作无财务利益冲突。

## 2 背景

原始树 $\mathcal{T}$
1
2
3
4
$k=3$
$V \in \mathbb{R}^{4 \times 3}$
二叉化树 $\mathcal{T}_b$
1
2
3
4
人工节点
$V_b \in \mathbb{R}^{4 \times 3}$

图 1:*多叉树与二叉化树。*(左)根节点为多叉 ($k=3$) 的 $\mathcal{T}$。PolyILR 为根节点分配 $k-1=2$ 个基向量($V$ 的列,红色)。(右)PhILR 所需的二叉化 $\mathcal{T}_b$(*每个节点一个坐标*)引入了一个人工节点(黄色),编码了叶子 1 和 2 的任意分组——这一选择在原始 $\mathcal{T}$ 中并无依据。

我们介绍组合数据的几何,并形式化树对齐问题(参见 Aitchison (1982 (https://arxiv.org/html/2606.11646#bib.bib9)))。

### 2.1 艾奇逊几何

**组合数据。**组合数据是非负向量,其总和无信息,只有相对比例才重要,例如微生物丰度(具有不同测序深度的计数)或化学浓度(混合物的组成部分) (Gloore 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib13); Jackson, 1997 (https://arxiv.org/html/2606.11646#bib.bib14))。我们将其归一化到单位总和,将数据置于开放单纯形中:

$$\Delta^{d-1} = \left\{ x \in \mathbb{R}^d_{>0}: \sum_{i=1}^d x_i = 1 \right\}. \tag{1}$$

关键约束是只有比值 $x_i/x_j$ 携带信息,而非绝对值。

**几何是固定的。**艾奇逊几何 (Aitchison, 1982 (https://arxiv.org/html/2606.11646#bib.bib9)) 通过给集合 $\Delta^{d-1}$ 配备扰动运算 $x \oplus y = \mathcal{C}(x_1 y_1, \ldots, x_d y_d)$ 和幂运算 $\alpha \odot x = \mathcal{C}(x_1^\alpha, \ldots, x_d^\alpha)$ 来形式化这一点,其中 $\mathcal{C}(\cdot)$ 是闭包运算。在这些运算下,$(\Delta^{d-1}, \oplus, \odot)$ 形成了一个 $(d-1)$ 维希尔伯特空间,内积为:

$$\langle x, y \rangle_A = \frac{1}{d} \sum_{i=1}^d \sum_{j=1}^d \log \frac{x_i}{x_j} \log \frac{y_i}{y_j}.$$

诱导的艾奇逊距离 $d_A(x, y) = \| x \ominus y \|_A$ 是扰动不变的:$d_A(x \oplus z, y \oplus z) = d_A(x, y)$。注意,这种几何*不是建模选择*——它是尊重组合不变性的唯一结构。

### 2.2 ILR 基

**基是一种选择。**中心化对数比 (CLR) 变换将 $x \in \Delta^{d-1}$(在艾奇逊几何下)等距映射到 CLR 超平面(即*艾奇逊切空间*)

$$\mathcal{H} = \{ z \in \mathbb{R}^d: \mathbf{1}^\top z = 0 \} \tag{2}$$

通过 $\text{clr}(x) = (\log x_1 / g(x), \ldots, \log x_d / g(x))$,其中 $g(x) = (\prod_i x_i)^{1/d}$ 是几何均值。任何矩阵 $V \in \mathbb{R}^{d \times d-1}$,其*列构成 $\mathcal{H}$ 的一组标准正交基*,都会产生等距对数比 (ILR) 坐标,并允许一个等距双射

$$\varphi(x) = V^\top \log x, \tag{3}$$

从 $(\Delta^{d-1}, \langle \cdot, \cdot \rangle_A)$ 到 $(\mathbb{R}^{d-1}, \langle \cdot, \cdot \rangle_2)$ (Egozcue 等, 2003 (https://arxiv.org/html/2606.11646#bib.bib1))。所有这样的基 $V$ 通过正交变换相关联。也就是说,它们诱导相同的几何,但对单纯形进行不同的分解。因此问题不在于是否使用 ILR 基,而在于*选择哪个基*,这一选择在很大程度上决定了可解释性。

**基的选择控制可解释性。**这与经典信号处理相似:傅里叶基从平移对称性得到频率分量 (Brigham, 1988 (https://arxiv.org/html/2606.11646#bib.bib25));小波基从二叉划分得到尺度局部分量 (Mallat, 2002 (https://arxiv.org/html/2606.11646#bib.bib26))。将基与领域结构对齐可产生可解释的坐标。

## 3 问题设定

**组合数据附带有树。**组合数据的 $d$ 个分量通常由一棵已知的有根树 $\mathcal{T}$ 组织,例如生态学中的系统发育树或分类树,基因组学中的基因本体 (Ashburner 等, 2000 (https://arxiv.org/html/2606.11646#bib.bib41); Lozupone and Knight, 2005 (https://arxiv.org/html/2606.11646#bib.bib39))。该树编码了领域结构:哪些比较有意义以及以何种分辨率进行。因此,我们寻求一个与 $\mathcal{T}$ 对齐的基 $V$。

**二叉树。**当 $\mathcal{T}$ 是二叉树时,每个内部节点 $u$ 恰好有两个子节点,这产生一个*对比*:两个后代进化枝的几何均值的对数比。这是顺序二叉划分 (SBP) 的特例 (Egozcue and Pawlowsky-Glahn, 2005 (https://arxiv.org/html/2606.11646#bib.bib6)),Silverman 等 (2017 (https://arxiv.org/html/2606.11646#bib.bib4)) 将其应用于系统发育并称为 *PhILR*。PhILR 非常适用于该场景,因为系统发育通常被推断为二分叉的,且这里正交性直接成立:不相交节点上的对比具有不相交的支持,嵌套节点上的对比是正交的,因为内部对比在每个子进化枝上求和为零。这种构造之所以有效,是因为二叉分支施加了极小的局部结构:每个节点恰好需要一个对比,从而在内部节点和基向量之间建立一一对应关系。要求局部对比组合成叶子上的标准正交基的全局一致性问题,简化为验证*成对*正交性,这通过支持结构和零和约束成立。

**多叉树时会发生什么?**对于一般树 $\mathcal{T}$,上述简单性被打破(图 1 (https://arxiv.org/html/2606.11646#S2.F1))。考虑一个节点 $u$,有 $k_u>2$ 个子节点。比较 $k_u$ 个进化枝需要 $k_u-1$ 个正交对比——这是一个子空间,而非单一向量。出现若干挑战:(i) 在 $u$ 处定义规范的局部对比,(ii) 将其扩展到叶子上的全局向量,以及 (iii) 确保所有节点间的正交性。标准方法会失败,因为不同大小的子树对内积的贡献不相等,稍后详述。

**多叉树在实践中很常见。**多叉树在系统发育中既以硬多叉形式出现(例如快速辐射),也以软多叉形式出现(例如低支持节点折叠)(Maddison, 1989 (https://arxiv.org/html/2606.11646#bib.bib62))。NCBI 分类数据库中约 64% 的分类分支点具有三个或更多子节点 (Lin 等, 2011 (https://arxiv.org/html/2606.11646#bib.bib29)),生物医学本体通常编码多路分组,例如细胞本体 (Diehl 等, 2016 (https://arxiv.org/html/2606.11646#bib.bib63))。这些精心构建的树通常携带*有意义的内部结构*(例如,独立命名的内部节点),可为下游表示提供信息。然而,在实践中,人们通常*任意地*将其细化为二叉树 (Lin 等, 2011 (https://arxiv.org/html/2606.11646#bib.bib29))。这引入了原始层次结构中*不存在*的额外内部节点和分裂,使得最终的坐标和解释依赖于二叉化。替代方法旨在通过对数对比回归、贪婪平衡选择 (Rivera-Pinto 等, 2018 (https://arxiv.org/html/2606.11646#bib.bib21))、成对对数比检验 (Mandal 等, 2015 (https://arxiv.org/html/2606.11646#bib.bib20)) 或通过边选择进行系统发育引导的 ILR 因子 (Washburne 等, 2017 (https://arxiv.org/html/2606.11646#bib.bib5)) 来识别预测性对数比特征。但这些方法产生的是孤立的对比,而不是一个完整的、按节点分组的、规范地绑定到给定多叉树的标准正交坐标系。现有方法无法为一般树提供一种规范的、完整的正交分解,同时定义局部对比、全局扩展并确保一致性。在不牺牲等距性或引入任意选择的情况下获得这样的分解是我们的目标。

## 4 PolyILR

$u_1$
1
$u_2$
2
3
$u_3$
4
5
6
$k_1=3$
$k_2=2$
$k_3=3$

*PolyILR*
$u_1$
$u_2$
$u_3

相似文章

稀疏 Cholesky 消元树

Hacker News Top

本文推导了面向右侧的稀疏 Cholesky 算法的列消元树,解释了它如何在不进行稠密分解的情况下预测填充元素和任务依赖关系。

RRB-Trees: Efficient Immutable Vectors

Lobsters Hottest

This paper presents RRB-Trees, a data structure for efficient immutable vectors, enabling logarithmic time concatenation and slicing.