面向工程师的基因组学导论
摘要
为工程师和计算机科学家编写的基因组学入门指南,使用面包店类比讲解细胞、染色体、DNA和基因。
暂无内容
查看缓存全文
缓存时间: 2026/07/06 11:02
# 细胞、染色体与基因组 | 面向工程师的基因组学导论
来源:https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/
## 引言 (https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/#introduction)
免责声明
本指南专门面向计算机科学家和工程师编写。癌症基因组学背后的基础生物学极其复杂,需要多年研究。为了让内容易于理解,我们围绕这些概念进行了抽象概括。本指南应视为对该领域的入门介绍,以“粗线条”的方式向读者传授相关材料。如果您觉得我们忽略了你特别关注的癌症基因组学细节,还请多多包涵。此外,指南中的所有内容均基于研究背景呈现,不可用于患者决策。如果你认为其中任何表述有误,可前往 Github 仓库提交 issue。更多信息请参阅 LICENSE.md (https://github.com/stjude/learngenomics.dev/blob/main/LICENSE.md)。
info
本指南中的所有内容均涉及真核分子生物学,即研究 DNA 被包裹在细胞核内的生物体。大致来说,大多数我们熟悉的物种都是真核生物,但细菌除外——细菌的 DNA 遍布整个细胞。在某些部分,本文档会特别针对人类细胞测序。
**细胞**是生命的最小单位,是构成生物体的基本单元,从单细胞细菌到构成人体的数万亿个细胞 (https://journals.plos.org/plosbiology/article?id=10.1371/journal.pbio.1002533) 概莫能外。细胞是结构复杂的有组织结构,呈现出多种形式,构成组织和器官,并完成人体的各项功能。
几乎每个细胞内都含有一个**基因组**。基因组是一套完整的遗传指令,用于产生、运行和维持一个活细胞或生物体。这些信息以物理方式编码在一种名为脱氧核糖核酸(**DNA**)的分子中。除其他功能外,DNA 包含了组装成千上万种不同分子产物的指令。这些指令(或称为“配方”)被称为**基因**,而基因编码的物理分子产物则称为**蛋白质**。细胞不断读取和解读 DNA 中存储的基因,以组装出各种蛋白质。体内每种细胞类型都会产生一个复杂的蛋白质生态系统,维持细胞存活并执行其特定功能。
### 面包店比喻 (https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/#bakery-analogy)
为了说明这一现象,可以把细胞想象成一家制作多种蛋糕的面包店。在这个比喻中,存储在 DNA 中的基因组就是一本包含超过 20000 种蛋糕配方(基因)的配方总书。根据这些配方制作出来的实体蛋糕就是蛋白质。值得注意的是,每种配方/基因的副本数量是有限的(人类正常情况是两个副本),但你可以用这些配方制作出数千个甚至更多的实体蛋糕。根据细胞类型的不同,不同蛋糕口味(即蛋白质)的组合、数量以及它们之间的相互作用也会有所差异。
tip
请留意这个比喻——在后续指南中,我们会多次引用并在此基础上进行扩展。
## DNA 的心智模型 (https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/#a-mental-model-for-dna)
从概念上讲,你可以把长度约 30 亿个字符、只有 'A'、'C'、'T' 和 'G' 组成的字符串看作是首尾相连的 DNA。这个字符串及其包含的任何子串通常被称为基因组**序列**。这些字符分别代表物理上的腺嘌呤、鸟嘌呤、胸腺嘧啶和胞嘧啶**碱基**(或**核苷酸**)。
重要的是,虽然将 DNA 简单理解为一个很长的字符串很容易,但实际情况要复杂得多。DNA 由两条互补序列(称为**链**)组成。每个碱基实际上是一对**碱基对**中的一员,其中核苷酸以独特的方式互补——'A' 只与 'T' 配对,'G' 只与 'C' 配对。从近处看,这种结构类似于下图所示的螺旋楼梯。
展示 DNA 计算模型和物理螺旋的图
当细胞分裂时,螺旋解开;每个碱基对分开;分子被分成两条链,每条链都包含复制原始 DNA 结构所需的信息。正常健康的细胞随后会非常准确地复制遗传密码,很少引入变异。
### 物理结构 (https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/#physical-structure)
在植物和动物中,DNA 被分割成多个大片段序列,称为**染色体**,并折叠在细胞核内。染色体通常成对出现(一条来自父亲,一条来自母亲),并缠绕在称为**组蛋白**的蛋白质上。这些组蛋白使 DNA 链保持紧密包裹状态,并有助于控制特定细胞中产生哪些基因产物。对于人类来说,正常情况下有 22 对**常染色体**(两性共有的染色体)和一对性染色体(女性为 XX,男性为 XY),总共 23 对染色体。常染色体根据大小从 1 到 22 编号,按从大到小排列。全套染色体构成了基因组。
## 结论 (https://learngenomics.dev/docs/biological-foundations/cells-genomes-dna-chromosomes/#conclusion)
基因组是生物学问题的巨大搜索空间。每个基因组都是一个生化数据库,如果被正确访问,就能告诉我们身体如何运作。基因组解释了个体间的自然差异,定义了家族特征,并区分了组织和器官中细胞的差异。当基因组获得有害突变时,癌症以及其他遗传疾病就可能发生。通过考察物理性状(如血压或肿瘤的发展)与基因组之间的关系——即所谓的**基因型-表型关系**——临床医生可以根据个体的基因构成制定个性化的医疗方案。
相似文章
GENEB:为何基因组模型难以相互比较
GENEB 是一个大规模诊断基准,在统一的探测协议下,跨 13 个功能类别的 100 项任务对 40 个基因组基础模型进行评估。研究结果揭示了综合排行榜的不稳定性,以及架构匹配度往往比模型规模更具决定性影响。该工作旨在解决基因组机器学习领域评估体系碎片化的问题,类似于 MTEB 在 NLP 领域所做的工作。
AlphaGenome:用于更好地理解基因组的人工智能
DeepMind 推出 AlphaGenome,这是一个能够预测 DNA 序列变异如何影响基因调控和生物过程的 AI 模型,可应用于多种细胞类型和组织。该模型可处理多达 100 万个碱基对,通过 API 向非商业研究提供,完整论文已在《自然》杂志上发表。
深入解读GeneBench-Pro
GeneBench-Pro 是 OpenAI 推出的一项全面基准测试,旨在评估人工智能模型在复杂基因组学任务上的表现,包括体细胞肿瘤学、功能基因组学以及临床携带者筛查。
如何在家自行测序DNA
一份实用指南,介绍如何使用Oxford Nanopore MinION在家测序自己的基因组,涵盖硬件、协议步骤和分析工具。
@KirkDBorne:嘿,程序员和计算科学家们!如果你从未在你的模拟、参数搜索……
一条推广Eyal Wirsansky所著《Hands-On Genetic Algorithms with Python》的推文,该书教授如何使用Python库实现遗传算法以解决AI和机器学习问题。