LDARNet:用于基因组建模的具有可学习分词的DNA自适应表示网络
摘要
LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。
arXiv:2606.04552v1 公告类型:新论文
摘要:基因组基础模型越来越多地采用大语言模型架构,但几乎无一例外地依赖固定的分词方案,如 $k$-mer、BPE 或单核苷酸。这些方案强加了任意的序列边界,可能掩盖具有生物学意义的结构信息。我们提出了 LDARNet——一个拥有1.2亿参数的层次化基因组基础模型,将 H-Net 风格的动态分块从自回归生成迁移至掩码语言建模,结合 BiMamba-2 状态空间层、局部注意力机制、双向路由以及基于比例的正则化器,在无监督条件下诱导产生自适应分词边界。在 Nucleotide Transformer 和 Genomic Benchmarks 测试套件的27项任务上进行微调后,LDARNet 在紧凑型模型(参数量 $<$300M)中赢得11/18项任务,并在5项组蛋白修饰任务上取得最先进的结果,超越了参数量多达其20$\times$的模型。FLOPs 匹配的对照实验将这些性能提升归因于可学习路由机制:在相同计算量下,可学习边界在组蛋白任务上比固定网格边界高出最多14个百分点。核苷酸分辨率分析进一步表明,学习到的边界在无监督条件下与典型启动子motif和剪接位点高度吻合,为基因组基础模型中的自适应分词提供了生物学解释。
查看缓存全文
缓存时间: 2026/06/05 02:15
# LDARNet:用于基因组建模的可学习分词DNA自适应表示网络
来源:https://arxiv.org/html/2606.04552
###### 摘要
基因组基础模型越来越多地采用大语言模型架构,但几乎无一例外地依赖固定分词方案,如 $k$-mer、BPE 或单核苷酸,这些方案强加了任意的序列边界,可能掩盖生物学上的相关结构。我们提出 LDARNet,一个1.2亿参数的层次化基因组基础模型,将 H-Net 风格的动态分块从自回归生成适配到掩码语言建模,结合 BiMamba-2 状态空间层与局部注意力、双向路由以及基于比率的正则化器,在无监督条件下诱导自适应词元边界。在 Nucleotide Transformer 和 Genomic Benchmarks 套件的27个任务上进行微调后,LDARNet 在紧凑型模型(<300M 参数)中取得11/18的胜绩,并在5个组蛋白修饰任务上达到最优结果,超越了参数量多达20倍的模型。一项 FLOPs 匹配的对照实验将可学习路由隔离为这些收益的来源:在相同计算量下,学习边界在组蛋白任务上比固定网格边界高出多达14个百分点。核苷酸分辨率分析进一步表明,学习到的边界在无监督情况下与典型的启动子基序和剪接位点对齐,为基因组基础模型中的自适应分词提供了生物学解释。
机器学习,ICML
## 1 引言
大语言模型(LLM)的成功推动了基因组学基础模型的发展,大规模预训练可以迁移到多种预测任务。近期模型如 DNABERT 和 Nucleotide Transformer(Ji et al., 2021 (https://arxiv.org/html/2606.04552#bib.bib14); Lopez et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib4))表明,预训练编码器能有效泛化到启动子、增强子和剪接位点。然而,大多数方法依赖于**固定分词**,如 $k$-mer 或字节对编码(BPE)。这些方案虽然对文本有效,但对基因组数据强加了任意边界,缺乏明确的生物学依据,由此引发了一个问题:自适应分词能否更忠实地捕获功能信号。
近期有一系列工作开始着手解决这一问题。H-Net(Hwang et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib13))在自回归(AR)设置中引入了动态层次化分词,证明了自适应分割在 DNA 大规模应用上的可行性(通过降低困惑度体现)。然而,H-Net 并未在下游分类基准上进行评估,因此在掩码语言建模(MLM)范式下,自适应分词是否能产生与已有基因组基础模型相竞争的嵌入仍是一个开放问题。
我们通过 **LDARNet**(**L**earnable **D**NA **A**daptive **R**epresentation **Net**work)来弥补这一空白,这是一个层次化模型,将 H-Net 架构适配到 MLM 预训练。我们的主要贡献如下:
- 我们将 H-Net 动态分词架构(Hwang et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib13))从自回归生成适配到掩码语言建模。代码和模型权重将发布于 https://github.com/darlednik/ICML-LDARNet。
- 我们证明了带动态边界预测的层次化压缩使一个紧凑的1.2亿参数模型能够匹敌或超越参数量4–20倍的基线,通过对27个多样化基因组任务的全面微调评估,在5个组蛋白修饰任务上对抗25亿参数竞争者取得最佳整体表现。
- 我们确立了通过可学习多尺度压缩实现的架构通用性保留了跨物种迁移能力,而领域专用优化则牺牲了这一能力:在 Nucleotide Transformer(NT)基准套件(Dalla-Torre et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib16))上,LDARNet 取得11/18的胜绩,而同等规模的人类基因组专用替代方案仅取得1–2胜,同时在以人类为中心的 Genomic Benchmarks(GB)套件(Grešová et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib3))上保持竞争力。
- 我们提供了直接的因果证据,证明**可学习**路由——而非仅仅是层次化框架——驱动了这些收益:在匹配 FLOPs 的条件下,学习边界在组蛋白任务上比固定网格边界高出多达14.3个百分点,核苷酸分辨率分析表明它们在无监督情况下落在典型的启动子基序和剪接位点上。
##### 利益冲突声明。
作者声明不存在财务利益冲突。LDARNet 仅在由独立研究机构维护的公开基准(Nucleotide Transformer 任务、Genomic Benchmarks)上进行评估,本文中比较的所有基线模型均非由作者所在单位开发。
## 2 相关工作
### 2.1 技术基础
基因组学及其他非语言领域的基础模型面临的核心挑战之一在于分词。Transformer(Vaswani et al., 2017 (https://arxiv.org/html/2606.04552#bib.bib29))通过操作子词词汇表在 NLP 中取得了卓越成功,但这一设计预设了语义上有意义且人类可解释的单元(如单词)的存在。对于 DNA 和原始字节序列,不存在这样的分割,分词仍是一个开放问题:固定方案如 $k$-mer 引入了任意边界,而字节级编码则大幅增加序列长度。
多项工作尝试通过同质字节级建模绕过分词问题。MambaByte(Wang et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib32))将 Mamba-2 层直接应用于字符,而 LlamaByte 将 Transformer 扩展到原始序列。尽管这些方法消除了外部预处理,但平坦字节级模型通常表现不如同等规模的分词对应方法,表明仍需要有意义的中间单元。SpaceByte(Slagle, 2024 (https://arxiv.org/html/2606.04552#bib.bib33))通过引入手工设计的边界启发式规则(如空格分隔符)来形成块,部分解决了这一问题,但此类策略仍然是领域专用且缺乏灵活性的。
H-Net 框架(Hwang et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib13))将分词重新定义为一个可学习问题,引入了动态分块,在多级层次结构中联合优化边界检测和表示学习。通过以端到端架构替代传统的分词—语言模型—去分词流程,H-Net 证明了自适应分块能在同等规模下超越分词 Transformer,并在分词启发式规则薄弱或任意的设置中提高数据效率。这些进展表明,分词不仅仅是一个预处理选择,而是核心建模挑战,推动了能够直接从原始序列中学习生物学有意义单元的架构发展。
### 2.2 DNA 基础模型
大规模自监督预训练已在基因组学中被迅速采用,催生了一系列 DNA 基础模型。早期贡献如 DNABERT(Ji et al., 2021 (https://arxiv.org/html/2606.04552#bib.bib14))证明了使用固定 $k$-mer 分词对基因组数据进行 BERT 风格掩码语言建模的实用性,为基于序列的预测任务建立了强力基线。后续工作如 Nucleotide Transformer(NT)(Lopez et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib4))及其后继版本 NTv2(Dalla-Torre et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib16))将 Transformer 编码器从数亿参数扩展到数十亿参数,在多物种基因组上进行训练,展示了基因组嵌入的强迁移性,但面临注意力机制固有的二次方上下文长度瓶颈。
为缓解这一限制,多项工作整合了更高效的序列架构。GENA-LM(Fishman et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib15))采用稀疏注意力扩展感受野,而 Caduceus(Schiff et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib12))引入了具有权重共享的 BiMamba 块,利用状态空间递归进行高效长上下文建模。HyenaDNA(Nguyen et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib11))提出了隐式长卷积,支持大幅更长的上下文,而 JanusDNA(Duan et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib10))在混合 Mamba–Attention 专家混合设计中结合了 AR 效率与掩码建模的双向性,支持在百万碱基序列上进行预训练。这些架构共同展示了容量、效率与上下文长度之间的权衡,这一权衡持续塑造着基因组基础模型的设计。
### 2.3 基因组模型中的分词
分词仍是基因组建模中的核心开放问题,因为 DNA 序列缺乏自然语言中存在的显式分割线索。固定 $k$-mer 方法(Ji et al., 2021 (https://arxiv.org/html/2606.04552#bib.bib14); Lopez et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib4))建立了强力早期基线,但其强加的边界并未明确具有生物学依据。字节级模型(Nguyen et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib11); Schiff et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib12); Duan et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib10))保留了核苷酸级分辨率,但增加了有效序列长度和计算成本,同时将高阶组合单元留给模型隐式推断。基于 BPE 的子词策略(Zhou et al., 2023 (https://arxiv.org/html/2606.04552#bib.bib9); Fishman et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib15))引入了可变长度单元,但其词汇表是从统计共现模式中归纳出来的,并未明确约束为对应生物学单元。
近期工作开始探索基因组序列的自适应分词。MxDNA(Qiao et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib8))通过专家混合卷积设计学习不连续和重叠单元,而 VQDNA(Li et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib7))使用向量量化来诱导层次化基因组词汇表。这两个模型均未包含在我们的下游基线中:对于 MxDNA,将发布的架构适配到 Generator(Wu et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib22))微调协议需要未指定的实现选择,而 VQDNA 在撰写本文时未提供完整实现以支持匹配评估。这些方法表明,学习分词可以提升下游性能并捕获生物学相关模式。然而,它们并未将分词形式化为显式的边界放置问题:MxDNA 分析专家混合分配和词元嵌入,VQDNA 分析码本结构,但两者均未根据典型基因组标志验证边界位置。LDARNet 通过将 H-Net 风格的层次化分块适配到掩码语言建模,并使学习到的边界本身成为生物学分析的对象,来填补这一空白。
## 3 LDARNet 架构
我们介绍 LDARNet,一个用于基因组序列的层次化基础模型,它在 H-Net 设计(Hwang et al., 2025 (https://arxiv.org/html/2606.04552#bib.bib13))基础上进行了若干架构创新。H-Net 最初是为 AR 语言建模开发的,我们的修改将该框架适配到 MLM,并引入了与 DNA 双向特性更契合的双向机制。
从整体上看,LDARNet 保留了 H-Net 的层次化编码器—主干—解码器组织结构,但融入了四项主要改变:(i)Mamba 层替换为具有权重共享的 **BiMamba-2** 块,将 Caduceus(Schiff et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib12))的 BiMamba 设计扩展到 Mamba-2;(ii)所有注意力机制均为非因果的;(iii)编码器额外包含一个局部注意力层以进行细粒度模式识别,而主干和解码器完全由 BiMamba-2 块实例化;(iv)路由器和去分块模块均扩展为双向变体。该设计在保持 H-Net 效率的同时提升了基因组建模的表达能力和稳定性。
参见图 1:**模型概览**。左图:LDARNet 架构,包含 BiMamba-2 外层和在压缩潜在空间中运行的 BiMamba-2 主干;编码器额外包含一个局部注意力层用于细粒度模式识别。右图:网络中使用的 BiMamba-2 块的内部结构。
### 3.1 概览
与 H-Net 类似,LDARNet 由堆叠的编码器、中央主干和解码器各阶段组成,如图 1 所示。每个阶段通过可学习的、内容感知的**分块**操作(第3.3节)压缩序列,在降低分辨率下进行处理,并通过**去分块**恢复细粒度信息。对于 $S$ 级层次结构,我们将编码器和解码器记为 $\mathcal{E}^s$ 和 $\mathcal{D}^s$($1 \leq s \leq S$),中央主干记为 $\mathcal{M}$。每个阶段 $s$ 的整体前向过程为:
$$\hat{x}^{s+1} = \mathcal{E}^s(x^s), \quad x^{s+1} = \mathsf{Chunk}(\hat{x}^{s+1}),\tag{1}$$
随后在最内层阶段进行主干处理 $\hat{z}^S = \mathcal{M}(x^S)$,以及在返回过程中进行重建:
$$z^s = \mathsf{Dechunk}(\hat{z}^s), \quad \hat{z}^{s-1} = \mathcal{D}^s(z^s),\tag{2}$$
$\mathsf{Chunk}$ 和 $\mathsf{Dechunk}$ 模块在第3.3节中定义。与 H-Net 不同,LDARNet 中的所有层均使用双向(非因果)上下文,这是 MLM 目标所要求的。
### 3.2 序列处理块
#### 3.2.1 编码器和解码器块:BiMamba-2
我们将 H-Net 外层网络中的因果 Mamba 层替换为 Mamba-2 的**双向**非因果变体,我们称之为 **BiMamba-2**,将 Caduceus(Schiff et al., 2024 (https://arxiv.org/html/2606.04552#bib.bib12))的 BiMamba 设计扩展到 Mamba-2。该设计在保持状态空间模型线性时间递归的同时,支持全上下文条件,这对于 MLM 和其他非自回归目标至关重要。
##### Mamba-2 作为选择性状态空间层。
Mamba-2(Dao and Gu, 2024 (https://arxiv.org/html/2606.04552#bib.bib6))实例化了一个**选择性**状态空间层,其动态由输入条件决定。该模型同时支持线性递归公式和通过结构化半可分(SS)矩阵的二次对偶表示,这一特性被称为 SSD 对偶性。对于输入 $x_t \in \mathbb{R}^D$ 和隐状态 $h_t \in \mathbb{R}^N$:
$$h_{t+1} = \bar{A}_t h_t + \bar{B}_t x_t, \quad y_t = C_t h_t + D x_t,\tag{3}$$
$$\bar{A}_t, \;\bar{B}_t = \mathrm{discretize}\!\big(A,\,B_t,\,\Delta_t\big),\tag{4}$$
$$B_t = W_B x_t, \mkern9mu C_t = W_C x_t, \mkern9mu \Delta_t = \mathrm{softplus}(W_\Delta x_t)$$相似文章
@razoralign: ENCODE GRAMMAR:一种用于解码人类基因组中调控元件DNA序列逻辑的深度学习模型资源…
ENCODE GRAMMAR 是一种用于解码人类基因组中调控元件DNA序列逻辑的深度学习模型资源,附带一系列博客文章,涵盖模型访问、解释和应用。
Code2LoRA:超网络生成的适配器,用于软件演进中的代码语言模型
Code2LoRA 引入了一个超网络,该超网络能够从代码仓库中一次性前向传播生成 LoRA 适配器,使得冻结的代码大语言模型无需额外 token 即可适应仓库上下文,并高效支持不断演进的代码库。此外,它还提供了 RepoPeftBench,一个用于仓库条件代码建模的基准测试。
Carbon:解码生命语言
Hugging Face 发布了 Carbon,一个开放的 DNA 基础模型系列,在匹配 Evo2-7B 最先进性能的同时,速度快 275 倍,采用 6-mer 分词、分解损失和精选的基因组数据。
基于同族架构引导的LLM驱动神经网络生成:迁移与适应的解耦
本文提出一种源引导协议,其中LLM利用更强的同族源模型为弱目标模型生成候选修改方案,在CIFAR-10和SVHN基准测试上实现了显著的精度提升,同时解耦了迁移效应与适应效应。
面向脑功能连接表征学习的网络感知双线性分词方法
NERVE提出了一种网络感知的双线性分词方法,用于基于掩码自编码器的脑功能连接矩阵自监督学习,改善跨发育队列的表征学习。