TheBioCollection: 统一的生物学预训练规模大语言模型语料库

arXiv cs.AI 论文

摘要

TheBioCollection是一个526亿令牌的生物学预训练语料库,它将异构资源整合为统一格式以训练大型语言模型,并包含配套的评估套件。在该语料库上训练,生物学基准测试的整体得分提高了一倍以上,同时保持通用语言能力几乎不变。

arXiv:2607.08803v1 Announce Type: cross 摘要:对生物学大型语言模型(BioLM)的推动,产生了对能够赋予模型真正生物学理解的训练语料库的需求。然而,现有的生物学资源,如分子数据库、蛋白质库、基因组注释、单细胞图谱和通路数据库,分散在异构格式中,尚未组织成用于语言模型训练的连贯语料库。我们提出TheBioCollection,这是一个526亿令牌的预训练规模语料库,将这些分散的资源转换为统一、可训练的格式,涵盖小分子、蛋白质、基因组序列、细胞和通路。除了整合现有数据外,TheBioCollection还通过工具计算的生物学属性丰富了每条记录,并引入了当前语料库几乎未能覆盖的新指令任务能力。我们为该语料库配套提供了TheBioCollection-Eval,这是一个配套的评估套件,在分子、蛋白质、基因组、细胞和跨域设置中测试识别、生成和预测能力。在保持基础Gravity-16B-A3B架构不变的情况下,使用TheBioCollection进行训练,其在TheBioCollection-Eval上的整体得分提高了一倍以上,且在每一个领域均有所提升,同时几乎不影响通用语言能力。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:56

# 统一预训练规模的生物学大语言模型语料库

来源:https://arxiv.org/html/2607.08803

Hyeon Hwang1,∗ Gyubok Lee2 Jay Shin1 Jimin Park3 Taesoo Kim4 Sanghoon Lee5 Hongjoon Ahn1,‡ Sungjun Han1,‡ Sangwon Jung1,‡

1Trillion Labs
2KAIST
3SK Biopharmaceuticals Co., Ltd.
4Lunit Inc.
5AIGEN Sciences Inc.

∗第一作者 ‡项目负责人

###### 摘要

推动生物大语言模型(BioLM)的发展,需要能够赋予模型真正生物学理解的训练语料库。然而,现有的生物学资源,如分子数据库、蛋白质存储库、基因组注释、单细胞图谱和通路数据库,散布在异构格式中,尚未组织成统一的语料库用于语言模型训练。我们提出 \system,一个包含 526 亿 token 的预训练规模语料库,将这些分散的资源转化为统一、可直接用于训练的形式,涵盖小分子、蛋白质、基因组序列、细胞和通路。除了整合现有数据外,\system 还使用工具计算的生物学特性丰富了每条记录,并引入了当前语料库几乎未覆盖的新指令任务。我们为该语料库配套发布了 \evalsuite,一个匹配的评估套件,涵盖分子、蛋白质、基因组、细胞和跨域场景下的识别、生成和预测任务。在固定基础架构 Gravity-16B-A3B 的情况下,基于 \system 进行训练使其在 \evalsuite 上的总体得分提高了一倍以上,且每个领域均有提升,同时通用语言能力几乎保持不变。

![[未加标题的图片]](https://arxiv.org/html/2607.08803v1/x1.png)
训练语料库:\system (https://huggingface.co/datasets/trillionlabs/TheBioCollection)

![[未加标题的图片]](https://arxiv.org/html/2607.08803v1/x2.png)
评估数据集:\evalsuite (https://huggingface.co/datasets/trillionlabs/TheBioCollection-Eval)

![[未加标题的图片]](https://arxiv.org/html/2607.08803v1/x3.png)
模型:Gravity-bio-16B-A3B (https://huggingface.co/trillionlabs/Gravity-bio-16B-A3B)

## 1 引言

用于生物学的大型语言模型(BioLM)[naturelm,scireasoner,txgemma,jang2026towards,logos] 旨在将 LLM 从通用文本理解扩展到生物系统的表示与推理以及生物实体的生成。与针对单一模态或生物学端点训练的任务特定预测器[esm2,scgpt,dnabert2]不同,BioLM 试图处理多种生物实体和过程,包括小分子、蛋白质、基因组序列、细胞状态和通路。理解这一更广泛的谱系至关重要,因为许多生物学问题不仅涉及识别孤立实体,还涉及理解它们在不同生物背景下的属性、功能、相互作用和影响[primer,mazein2024graph,mohamed2021biological]。实现这一愿景需要一个大规模的生物学训练语料库,使模型能够接触到生物学的广度和结构。该领域已经产生了许多有用的资源,包括分子数据库、蛋白质存储库、基因组注释、单细胞图谱、通路数据库和计算生物学工具。然而,这些资源很少被组织成大规模、适合 LLM 训练的生物学数据语料库用于 BioLM;相反,它们散布在异构格式中,如表格、序列文件、图边、结构化注释或孤立的指令模式[smolinstruct,mollangbench,vibeproteinbench,proteinlmbench,chatnt,tabulasapiens]。尽管如此,之前没有工作将这些资源整合成一个大规模的预训练语料库,来教授 BioLM 涵盖分子、蛋白质、基因组、细胞及其跨域关系的广泛生物学知识。

为了填补这一空白,我们引入了 \system,一个包含 526 亿 token 的生物学预训练规模语料库,将异构的生物资源转化为适合 LLM 训练的数据。\system 通过一个构建流程来构建,该流程收集跨生物领域的资源,通过去重、实体标注和实体增强进行精炼,用工具计算的生物学特性进行丰富,并将其渲染为带有程序化可验证答案的指令形式数据。这一流程使得最终语料库既具有广泛的生物学覆盖范围,又可直接用于训练 BioLM。为了在训练后系统评估生物学能力,我们还发布了 \evalsuite,一个与 \system 广度相匹配的独立评估套件。该套件涵盖分子、蛋白质、基因组、细胞和跨域场景下的识别、生成和预测任务。

参考图注:
图 1:\system 的构建流程。我们首先整合分散的生物资源并将其精炼为结构化文本。随后,我们使用计算工具丰富自由文本流中的生物信息。最后,我们为语料库中代表性不足的领域构建新的指令数据集。

为了隔离语料库的效果,我们固定 Gravity-16B-A3B[gravity-moe-2026] 的基础架构,并在 \system 上训练它,将结果与基础模型进行比较。我们使用 \evalsuite 进行的评估显示,使用我们语料库训练的模型在没有专门架构或额外训练技巧的情况下,提升了生物学任务性能。具体来说,在 \system 上训练使基础模型在总体得分上提高了一倍以上,并且每个生物领域都有一致的提升。此外,在我们的消融研究中,使用我们语料库训练的模型在生物学能力上优于仅使用网页文本进一步训练的模型,同时保持了通用语言能力,退化最小。这些结果表明,生物学能力和通用语言能力并非互斥,可以共同学习而不会相互干扰。总结来说,我们的贡献如下:

- • **\system 语料库**。我们引入 \system,一个包含 526 亿 token 的生物学语料库,将分散的公共数据集转化为 LLM 可直接使用的训练数据,涵盖小分子、蛋白质、基因组序列、细胞和通路,并将工具计算的生物学属性直接暴露在文本中。我们进一步为现有语料库覆盖较差的领域构建了新的指令数据集,包括蛋白质结合和基因组特征定位。
- • **\evalsuite**。我们发布 \evalsuite,一个匹配的评估套件,涵盖分子、蛋白质、基因组、细胞和跨域场景下的识别、生成和预测任务,覆盖广泛的生物学应用。
- • **语料库效果的受控证据**。在固定基础 LLM 架构的情况下,我们展示了在 \system 上训练可以在不依赖额外训练技巧的情况下提升广泛的生物学任务性能,同时通过在训练语料库中仅包含有限数量的网页文本来维持通用语言性能。

参考图注:
图 2:\system 的 token 统计。左图:包含 526 亿 token 的语料库分为小分子、蛋白质、基因组序列以及细胞和通路。右图:同一语料库分为自由文本流和指令流。token 计数不包括训练中使用的科学文献。

## 2 数据集构建

\system 是一个包含 526 亿 token 的语料库,将小分子、蛋白质、基因组序列、细胞、通路和跨域关系置于一个共享的语言接口下。其组成总结在图 2 (https://arxiv.org/html/2607.08803#S1.F2) 中。我们通过收集所有五个领域(第 2.1 节 (https://arxiv.org/html/2607.08803#S2.SS1))中公开且可商业使用的资源,并通过三个互补步骤将其转化为适合 LLM 训练的数据来构建语料库:将数据库记录精炼为自包含的描述(第 2.2 节 (https://arxiv.org/html/2607.08803#S2.SS2)),用工具计算的生物学特征丰富它们(第 2.3 节 (https://arxiv.org/html/2607.08803#S2.SS3)),以及从现有资源和尚未被任何现有指令微调语料库覆盖的新生成数据集中构建指令数据集(第 2.4 节 (https://arxiv.org/html/2607.08803#S2.SS4))。为了衡量这些数据是否能转化为生物学理解,我们为该语料库配套发布了 \evalsuite,一个匹配的评估套件,涵盖相同的领域以及跨域推理(第 2.5 节 (https://arxiv.org/html/2607.08803#S2.SS5))。

表 1:用于构建 \system 中自由文本流的外部资源,按生物领域分组。

| 领域 | 源数据集 |
|------|----------|
| 小分子 | PubChem[pubchem]; DrugBank[drugbank]; BindingDB[bindingdb]; ChEMBL[chembl]; USPTO-50K[uspto50k]. |
| 蛋白质 | UniProt Knowledgebase[uniprot]; AlphaFoldDB[afdb]; Protein Data Bank (PDB)[pdb]. |
| 基因组序列 | GENCODE[gencode]; ENCODE[encode]; RNAcentral[rnacentral]; Rfam[rfam]. |
| 细胞/通路 | L1000[lincs_l1000]; Human Protein Atlas (HPA) 单细胞类型数据[humanproteinatlas]; GeneRIF[generif]; NCBI Gene[ncbi_gene]; Gene Ontology / GOA human[go]; Cell Ontology[cell_ontology]; CELLxGENE 论文[cellxgene]; JUMP Cell Painting[jumpcellpainting]; HuBMAP[hubmap]. |
| 跨域知识图谱 | Hetionet[hetionet]; DRKG[drkg]; DGIdb[dgidb]; STRING[string]; OmniPath[omnipath]; Reactome[reactome]. |
| 广泛科学文献 | PubMed; bioRxiv; medRxiv. |

### 2.1 数据收集

我们仅使用允许商业使用的公共资源构建 \system,并保留每个实体的来源标识符,以便每条记录都可追溯到其原始来源。收集的资源涵盖语料库定位的五个领域,包括小分子、蛋白质、基因组序列、细胞/通路以及跨域关系。如表 1 (https://arxiv.org/html/2607.08803#S2.T1) 所总结,这些来源提供互补的生物信号,范围从分子特征到蛋白质序列和功能、基因组和转录组注释、细胞身份和扰动响应,以及跨生物实体的知识图谱链接关系。最后,为了保留结构化数据本身无法提供的通用科学和语言能力,我们包含了来自 PubMed¹¹¹https://pubmed.ncbi.nlm.nih.gov/、bioRxiv²²²https://www.biorxiv.org/ 和 medRxiv³³³https://www.medrxiv.org/ 的广泛科学文献。这些科学来源包含在训练中,但排除在 \system 报告的 token 计数之外。接下来的子章节描述了我们如何将这些资源转化为适合 LLM 训练的数据,并使用超出公共资源范围的额外生物信号进行丰富。

### 2.2 数据精炼

精选的生物数据库包含丰富的生物学知识,但通常采用语言模型无法直接消费的格式 [lincs_l1000,pubchem,bindingdb,uspto50k,chembl]。因此,我们将每条数据库记录转换为自包含的自然语言描述,将实体的关键属性整合到单个文本记录中。根据模态的不同,这些描述可能包括物理化学性质、扰动谱、结构信息或功能注释。然后,我们为每个值提供一个简洁的陈述,说明其含义。符号标识符,包括 SMILES 字符串以及蛋白质、DNA 或 RNA 序列,被放置在文本中并用专门的标记 token(例如,...)包裹,使其与周围的文本区分开来,遵循 naturelm,scireasoner 的做法。由此产生的记录将实体的序列、属性和解释保持在单个上下文中,将结构化数据库条目转化为模型可以学习的语言。

除了单实体描述,我们还将跨域的实体链接起来,将来自多个数据库的关于同一实体的证据收集到一条记录中。知识图谱作为骨架,源数据库作为载荷:我们使用跨域知识图谱(Hetionet[hetionet], DRKG[drkg], STRING[string], OmniPath[omnipath])通过类型化关系(例如化合物-靶标结合、基因-通路参与、蛋白质-蛋白质相互作用、转录因子-靶标调控)来决定哪些实体属于一起,然后用底层数据库中已有的记录填充每个链接的实体。因此,一条记录读起来像一条机制链,而不是孤立的事实:例如,一个蛋白质锚点携带其功能和通路成员身份,与其结合的化合物及其测得的亲和力,以及这些扰动在特定细胞系中诱导的转录响应,这样分子、蛋白质、通路和细胞领域的证据都出现在一个上下文窗口中。

### 2.3 工具计算的特征叙述

我们将存在于数据库和计算工具中而非文本中的生物信号进行言语化。我们在源记录上运行标准的计算生物学工具,并将其输出转化为带有明确来源的自然语言叙述,揭示结构化、工具可计算的信号,而这些信号是公共自由文本中很少包含的。我们在不同模态上应用相同的方案;完整的特征集和提取管道见附录 B (https://arxiv.org/html/2607.08803#A2)。

#### 小分子。

我们使用 RDKit 计算的描述符 [rdkit] 来丰富第 2.2 节 (https://arxiv.org/html/2607.08803#S2.SS2) 中产生的精炼 PubChem 分子叙述。在解析和规范化之后,我们推导出确定性特征,如环系统组成、骨架和复杂度度量、立体化学、官能团和结构警报匹配以及指纹摘要,并将其融入到相应的叙述中。

#### 蛋白质。

我们通过将 UniProt 序列链接到 AlphaFold 数据库和蛋白质数据银行 (PDB) 结构来构建蛋白质结构/功能叙述。这些记录结合了使用 Biopython[biopython] 和 DSSP[dssp] 从结构中推导出的确定性特征,如物理化学性质、二级结构、折叠拓扑和溶剂暴露性,以及来自 UniProt 知识库的注释,如结构域、InterPro/Pfam 家族、跨膜区域、GO 术语和亚细胞定位[uniprot]。

#### 基因组序列。

我们将调控 DNA 间隔和 RNA 转录本表示为结构化的生物实体。对于 DNA,我们使用基于索引 FASTA 访问 (pyfaidx[pyfaidx])、Biopython 解析和确定性 GTF/BED 间隔处理的 Python 处理管道,将来自 GENCODE[gencode] 和 ENCODE[encode] 的基因组序列与坐标和组装元数据、调控证据以及序列衍生特征(如 GC 含量、CpG 统计、熵、同聚物长度和基因组特征重叠)关联起来。对于 RNA,我们从 GENCODE 和 RNA 资源(包括 RNAcentral[rnacentral] 和 Rfam[rfam])构建转录本级别的叙述。这些叙述结合了基于 Biopython FASTA 和 GenBank 解析[genbank]、密码子和 ORF 分析以及序列基序分析的特征。

#### 细胞谱。

我们将细胞谱转化为捕捉四种信号的语言:表达、扰动响应、空间背景和形态。单细胞记录描述来自标记基因和组织背景的细胞状态[humanproteinatlas,cell_ontology]。扰动记录将 CRISPRa/CRISPRi 干预与其诱导的差异表达特征链接起来[perturbench,norman,replogle]。来自 HuBMAP[hubmap] 的空间记录将每个测量的点置于背景中,报告其组织、坐标、局部邻域和点局部转录特征。我们基于 AnnData/H5AD 输入[anndata]构建它们,并使用 SciPy KD-tree 半径查询[scipy]恢复每个邻域。JUMP

相似文章

RedBench:大型语言模型综合红队测试通用数据集

arXiv cs.CL

RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。

MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据

arXiv cs.CL

本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。