@razoralign: ENCODE GRAMMAR:一种用于解码人类基因组中调控元件DNA序列逻辑的深度学习模型资源…

X AI KOLs Timeline 模型

摘要

ENCODE GRAMMAR 是一种用于解码人类基因组中调控元件DNA序列逻辑的深度学习模型资源,附带一系列博客文章,涵盖模型访问、解释和应用。

ENCODE GRAMMAR:一种用于解码人类基因组中调控元件DNA序列逻辑的深度学习模型资源 https://t.co/NNgfws5E4d https://t.co/6qt0PMCDUe
查看原文
查看缓存全文

缓存时间: 2026/08/06 06:35

ENCODE GRAMMAR:用于解码人类基因组调控元件DNA序列逻辑的深度学习模型资源

来源:https://genomicsxai.github.io/blogs/2026-012/ 题图:ENCODE GRAMMAR:用于解码人类基因组调控元件DNA序列逻辑的深度学习模型资源 (https://genomicsxai.github.io/blogs/2026-012/main.png) 发布于 2026年8月4日·最后更新于 2026年8月4日

标签EncodeGenomicsDeep-LearningSeq2funcTranscription-FactorChromatin-AccessibilityTranscription-InitiationReporter-AssayChIP-SeqDNase-SeqATAC-SeqPRO-CapMPRA·阅读时长:23分钟

这是ENCODE GRAMMAR系列的第一篇文章。该系列将涵盖:

  1. ENCODE GRAMMAR:用于解码基因组调控元件DNA序列逻辑的ENCODE深度学习模型资源(本文)
  2. 获取和使用ENCODE GRAMMAR集合:快速入门指南
  3. 用深度学习模型解读调控DNA
  4. 转录因子结合GRAMMAR资源
  5. 染色质可及性GRAMMAR资源
  6. 预测非编码遗传变异的影响
  7. MotifCompendium——调控序列基序的统一词典
  8. 跨检测和细胞类型对比调控序列代码
  9. 在学术环境中构建生产级模型图谱

基因组编码了一套调控控制系统

人类基因组是以DNA编码的完整指令集,由体内几乎每个细胞携带。它包含约32亿个DNA碱基对,由A、C、G、T四个核苷酸碱基构成。尽管人类基因组高度相似,但不同个体间的DNA序列在数百万个位点上存在差异。这些差异被称为遗传变异,它们造就了人类的多样性,并可能影响性状和疾病风险。

人体包含数百种不同的细胞类型——包括神经元、肝细胞和免疫细胞——它们具有截然不同的形态和功能。然而,同一个体中的几乎所有细胞都含有基本相同的基因组。相同的DNA序列如何产生如此显著的细胞多样性?

基因是包含产生RNA分子指令的DNA片段,其中一些RNA会被翻译成蛋白质。基因向RNA的转录受到严格调控:不同基因在不同细胞类型、不同时间以不同水平表达。这些不同的基因表达模式使得拥有相同基因组的细胞获得不同身份并执行特化功能。因此,基因表达的精确调控对发育、正常细胞功能和环境应答至关重要。

这种控制的很大一部分编码在调控元件中——即帮助决定基因何时、何地以及以多强程度表达的DNA区域。启动子是位于基因转录起始位点或其附近的调控元件,帮助招募产生RNA的分子机器。其他调控元件,例如远端的增强子,可以跨越数百千碱基发挥作用,通过与靶基因启动子在基因组三维折叠中发生的接触来增强其转录。

DNA与蛋白质一起包装成染色质,这影响了基因组不同区域对细胞机器的可及性。被称为转录因子(TF)的调控蛋白能够识别并结合调控元件内特定的短DNA序列模式,即基序,并通过招募或阻断执行转录的机器来增加或减少基因表达。染色质可及性与TF结合相互影响:暴露的DNA更容易被调控蛋白触及,而某些蛋白也能打开或重塑染色质。

不同细胞类型表达不同的TF组合,并在基因组上维持不同的染色质状态。因此,尽管含有基本相同的基因组DNA序列,不同细胞类型会动用不同的调控元件组合,从而产生不同的基因表达模式。调控元件内的遗传变异可以改变转录因子结合或其他调控活性,可能在某些特定细胞环境中改变基因表达。这一调控系统的破坏会干扰发育和细胞功能,并可能导致疾病。

图:基因组调控简介 (https://genomicsxai.github.io/blogs/2026-012/intro.png)相同的基因组如何产生多样的细胞类型和基因表达程序?(点击图片查看详细图例)

因此,要理解基因组如何编码基因调控,我们需要:

  • 绘制候选调控元件在基因组中的位置;
  • 测量它们的生化活性(如转录因子结合和染色质状态),以及在不同细胞类型和条件下的相关基因表达;
  • 确定调控元件中哪些DNA碱基是重要的,以及它们的组合和排列如何在不同细胞类型中控制不同类型的生化活性;以及
  • 确定遗传变异如何在不同细胞环境中改变生化活性。

ENCODE:涵盖数千种细胞类型的DNA元件百科全书

在过去二十年中,DNA元件百科全书ENCODE)联盟(https://www.encodeproject.org/)在前两个目标上取得了重大进展。通过使用广泛的基因组规模功能基因组学实验,ENCODE绘制了人类和小鼠基因组中数百万个候选调控元件,表征了它们在不同细胞类型、组织、发育阶段和条件下的生化活性。

这些实验测量了基因调控的互补层次,包括TF在何处结合DNA、哪些染色质区域是可及的、转录从哪里起始以及哪些基因被表达。它们共同提供了调控活性发生在何处以及在不同细胞环境中如何变化的详细图谱。下面我们简要介绍一些关键实验检测。

转录因子ChIP-seq(转录因子染色质免疫沉淀后测序)绘制特定TF在特定细胞类型中与基因组结合的位置。细胞经过处理使蛋白质保持与其占据的DNA结合,DNA被片段化,然后用抗体分离被目标TF结合的片段。这些片段在高通量测序仪上测序并比对到基因组,以确定它们可能的位置,从而在富集该TF结合的基因组区域产生读段浓度,即。TF ChIP-seq峰区域通常在统计学上富集于反复出现的短DNA序列模式(称为基序),这些基序通常介导TF与DNA的结合。然而,每个TF ChIP-seq实验只分析一个TF在一个细胞环境中的情况。要系统性地测量约2000个人类TF在所有细胞类型和条件下的结合,将非常费力且昂贵。

图:TF ChIP-seq (https://genomicsxai.github.io/blogs/2026-012/TFChIP.gif)转录因子ChIP-seq实验。(点击图片查看详细图例)

DNase-seqATAC-seq实验部分解决了这一局限,它们提供了可及染色质区域的基因组规模图谱,这些区域通常是被多种TF和其他调控蛋白占据的调控元件。因此,单次可及性实验就能突出显示在特定细胞环境中被许多因子结合的调控元件,尽管它不能直接识别哪些蛋白质被结合。DNase-seq使用DNase I酶切割暴露的DNA,而ATAC-seq使用Tn5转座酶将测序接头插入可及的DNA中。产生的DNA片段被测序并比对到基因组。含有许多比对片段的区域表现为染色质可及性峰。DNase I和Tn5对特定DNA序列也有偏好,因此观察到的信号谱既反映真实的染色质可及性,也反映检测特有的序列偏差。在单碱基分辨率下解读信号时,区分这些组分尤为重要。

图:DNase-seq、ATAC-seq (https://genomicsxai.github.io/blogs/2026-012/ChromatinAccessibility.gif)DNase-seq和ATAC-seq染色质可及性实验。(点击图片查看详细图例)

然而,TF结合和染色质可及性并不一定导致有效的下游调控效应,如转录。因此,还需要其他检测来测量转录从哪里起始,以及候选DNA序列是否能够直接驱动调控活性。

PRO-cap实验绘制了基因组中转录起始的精确位置。它富集并测序新合成RNA的加帽5′端,产生碱基分辨率、链特异性的活跃转录起始图谱。PRO-cap可以识别基因启动子和转录增强子处的起始,而某个位点起始的读段数量则提供了其相对起始活性的度量。

**大规模平行报告基因检测(MPRA)**并行直接测试数千条DNA序列的调控潜力。每个候选序列与报告基因一起置于合成构建体中,通常还带有识别它的序列条形码。构建体导入细胞后,调控活性通常通过比较报告RNA中每个条形码的丰度与其在输入DNA文库中的丰度来测量。产生更多报告RNA的序列在该检测和细胞环境中具有更大的调控活性。由于这些序列通常在其天然基因组位置之外进行测试,因此MPRA测量的是报告系统中的调控潜力,而不是完全重现其内源功能。

这些检测共同测量了基因调控的互补层次。TF ChIP-seq识别单个TF的结合位置;DNase-seq和ATAC-seq揭示可及的调控DNA;PRO-cap精确定位活跃转录起始的位点;MPRA则直接测试特定DNA序列是否能够驱动调控活性。

ENCODE已经完成并发布了超过16,000个基因组规模检测,覆盖数千个生物样本,包括细胞系、原代细胞、组织、分化细胞以及来自人类和小鼠的实验扰动样本。这些数据通过标准化流程处理,并通过ENCODE门户网站(https://encodeproject.org/)公开发布。

通过整合来自这些以及许多其他检测的证据,ENCODE已绘制了人类基因组中超过500万个可及染色质元件。其中约240万个被归类为候选顺式调控元件(cCREs)(https://screen.wenglab.org/),因为它们还得到其他调控活性生化特征的支持。ENCODE联盟最近发布了一篇预印本,描述了二十年来开发的整个数据资源,包括第四阶段即项目最终阶段产生的许多新数据集和衍生分析产品ENCODE 4(https://www.biorxiv.org/content/10.64898/2026.07.06.731365v1)。

图:ENCODE数据立方体 (https://genomicsxai.github.io/blogs/2026-012/ENCODE_cube.png)ENCODE数据立方体。(点击图片查看详细图例)

这些实验共同解决了两个基础目标:绘制全基因组调控元件图谱,以及表征它们在不同细胞环境中的生化活性和属性。然而,这些图谱并不能解释DNA序列如何介导全基因组中不同类型的生化活性及其细胞类型特异性。仍然存在一些重要问题:

  • 调控元件中哪些单个DNA碱基和序列基序会影响特定细胞类型中不同类型的生化活性(如TF结合、可及性)?
  • 这些模式的组合和排列如何决定生化活性?
  • 同一个调控元件在不同细胞类型中如何表现不同?
  • 遗传变异如何在特定细胞环境中改变生化活性?

回答这些问题需要超越绘制调控元件图谱,进一步解码支配其活性的序列规则。

BPNet深度学习模型家族:从调控图谱到可预测的序列规则

我们开发了BPNet家族的深度学习模型来回答这些问题。这些神经网络使用多层扩张残差卷积层来学习序列特征,包括TF基序及其高阶组合和排列(称为调控语法),从而可以基于约2千碱基的局部DNA序列上下文预测每个实验在每一个碱基处的生化活性。BPNet模型不是简单地将区域分类为有活性或无活性,而是以碱基对分辨率同时预测总活性量和实验信号的形状。将模型限制为仅使用局部上下文的刻意选择使其计算高效,并适合稳健的序列级解释。尽管其架构紧凑且序列上下文受限,但这些模型与使用更长基因组序列的更大模型相比,具有相当强的竞争力(https://doi.org/10.1101/2024.12.25.630221)。

ENCODE GRAMMAR模型资源包含四个相关模型家族:

  • **BPNet(https://github.com/kundajelab/bpnet):**2,339个TF ChIP-seq模型集合(https://www.encodeproject.org/search/?searchTerm=BPNet&type=Annotation&annotation_type=BPNet-model&status=released&assay_term_name=ChIP-seq),覆盖788个转录因子靶标。
  • **ChromBPNet(https://github.com/kundajelab/chrombpnet):**1,512个DNase-seq和ATAC-seq模型集合(https://www.encodeproject.org/search/?searchTerm=ChromBPNet&type=Annotation&annotation_type=ChromBPNet-model&organism.scientific_name=Homo+sapiens&status=released),覆盖408个生物样本。
  • **ProCapNet(https://github.com/kundajelab/procapnet):**6个PRO-cap模型集合(https://www.encodeproject.org/search/?searchTerm=ProCapNet&type=Annotation),用于预测转录起始图谱。
  • **ReporterNet(https://github.com/kundajelab/reporternet):**8个模型集合(https://www.encodeproject.org/search/?searchTerm=ReporterNet&type=Annotation&status=released),在高通量报告基因检测数据上训练。与上述三个模型不同,ReporterNet以实验中测试的候选序列的分辨率进行预测。

这些模型合在一起构成了3,865个实验特异性模型集合(https://www.encodeproject.org/search/?type=Annotation&annotation_type=BPNet-model&annotation_type=Ch

相似文章

LDARNet:用于基因组建模的具有可学习分词的DNA自适应表示网络

arXiv cs.CL

LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。

AlphaGenome:用于更好地理解基因组的人工智能

Google DeepMind Blog

DeepMind 推出 AlphaGenome,这是一个能够预测 DNA 序列变异如何影响基因调控和生物过程的 AI 模型,可应用于多种细胞类型和组织。该模型可处理多达 100 万个碱基对,通过 API 向非商业研究提供,完整论文已在《自然》杂志上发表。

Carbon:解码生命语言

Reddit r/LocalLLaMA

Hugging Face 发布了 Carbon,一个开放的 DNA 基础模型系列,在匹配 Evo2-7B 最先进性能的同时,速度快 275 倍,采用 6-mer 分词、分解损失和精选的基因组数据。

用 OpenAI o1 解码遗传学

OpenAI Blog

# 用 OpenAI o1 解码遗传学 来源: [https://openai.com/index/o1-genetics/](https://openai.com/index/o1-genetics/) 2024年9月12日 ChatGPT ## Catherine Brownstein: OpenAI o1 与遗传学 认识一下 OpenAI o1——新系列 AI 模型,设计用于在响应前花更多时间思考。这个新系列 AI 模型能够推理复杂任务,并在科学、编码和数学方面解决比之前模型更难的问题。