二十世纪的遗传学在方法上是一门“逐基因”的学科:研究者自表型出发,经由突变筛选与连锁分析锁定单个位点,再以分子手段克隆并表征该基因。这条路线成就卓著,却内含一个结构性约束——观察与解释都被限定在事先选定的对象之上。二十世纪八十年代中期,随着大规模 DNA 测序与基因组作图技术的成熟,一种先获得物种全部遗传物质、再行提问的研究纲领成为可能。本节讨论这一纲领的概念基础:何谓基因组(genome)、何谓基因组学(genomics)、它所跨越的尺度与分支,以及它给生物学的认识论带来的变化(Gibson & Muse, 2009)。
1.1.1 基因组与基因组学的操作性定义
“基因组”一词最早由德国植物学家 Hans Winkler 于 1920 年提出,原指配子中一套染色体所携带的遗传物质总体(转引自 Brown, 2006)。今天的教科书定义与此一脉相承:基因组是一个细胞或一个病毒颗粒所携带的全部遗传物质之总和。对真核生物而言,如不加说明,通常指一套单倍体染色体组中的 DNA 序列(核基因组);线粒体与叶绿体基因组体量小,一般另行单列(Alberts et al., 2008)。
基因组(genome)与 C 值(C-value):基因组指一个细胞或病毒颗粒所携带的全部遗传物质;在真核生物中,衡量其大小的 C 值特指单倍体细胞核 DNA 的总量,以碱基对(bp)计。C 为 constancy(恒定)之意——同一物种的体细胞无论转录活性如何,核内 DNA 含量倍数关系恒定,故 C 值是物种属性而非细胞状态属性。
就研究实践而言,基因组之所以能被当作一个“整体”来研究,依赖三件可操作的事实:其一,基因组 DNA 可以被完整提取并被机械力或限制酶分割;其二,分割后的片段可以被克隆、扩增并逐段测定序列;其三,测序所得片段可以按其在染色体上的真实次序重新装配,使每个碱基获得一个坐标。换言之,基因组不是概念上“全部基因”的抽象集合,而是一个有边界、有坐标、可逐碱基索引的物理实体(Brown, 2006)。这一操作性视角贯穿本书:后续的遗传图谱(第 1.2 节)与物理图谱(第 1.3 节),本质都是为这个实体建立坐标系的不同方案。
在此有必要把基因组与三个相邻概念区分开。第一,基因组不等于基因的总和。人类基因组中编码蛋白质的序列仅约占 1%–2%(Lander et al., 2001),其余为内含子、调控元件、重复序列以及大量功能尚待澄清的 DNA;基因组还包含非编码 RNA 基因、端粒与着丝粒等结构元件。“基因”是基因组上有功能界定的一段区位,是总体的下位概念而非同义语。第二,基因组是相对常量,转录组(transcriptome)与蛋白质组(proteome)则是条件变量。同一个体的每个有核细胞都携带同一套基因组序列(体细胞突变与重排除外),而特定细胞在特定时刻转录出的全部 RNA 集合(转录组)与翻译出的全部蛋白质集合(蛋白质组),随细胞类型、发育阶段和环境条件而变(Alberts et al., 2008)。第三,三者构成信息流的层级:基因组存储信息,转录组是条件依赖的读出,蛋白质组是功能的执行。基因组学的独特立场在于以最底层、最稳定的层级为出发点,自下而上地解释其余两个层级。
“基因组学”一词出现较晚:1986 年,遗传学家 Thomas Roderick 为一份新创刊的期刊铸造了 genomics 一词(转引自 Gibson & Muse, 2009)。今天它被普遍界定为:对生物体基因组进行整体性测定、组装、注释与功能解析的学科。Gibson 与 Muse(2009)给出的表述颇具启发性:基因组序列既是该物种的部件清单(parts list)——列出全部基因与非编码元件,又是一部操作手册(instruction manual)——记录这些部件在何时、何地以何种方式协同工作。据此,基因组学的一阶任务是完整而准确地抄写清单,二阶任务才是研读手册。
依任务性质,习惯上将基因组学分为两大分支:其一回答“是什么、在哪里”,其二回答“如何工作”。
结构基因组学
遗传作图、物理作图、全基因组序列测定与基因注释。产出是结构信息:序列、坐标与元件目录,为一切后续分析提供公用底座——本书第 1–2 章的主题。
功能基因组学
基因何时何地表达、变异如何改变表型、元件之间如何互作。方法是全局测量:变异全景、转录谱、蛋白质谱与交互网络——本书第 3–5 章的主题。
上文分别引出的结构基因组学(structural genomics)与功能基因组学(functional genomics)并非先后割裂的两段,而是互相供给的循环:功能实验依赖结构基因组学提供的序列、克隆与注释;功能数据又反过来校验并修正结构注释——一段被转录谱反复覆盖的“基因间区”,常常意味着注释的遗漏(Hieter & Boguski, 1997)。因此,“结构在前、功能在后”只是逻辑上的展开次序,而非研究价值的排序。
1.1.2 基因组大小的数量级跨越
基因组学方法之所以能覆盖从病毒到哺乳类的广阔生命形式,一个朴素的原因是:基因组虽大小悬殊,化学本质却同为核酸,可以被同一套工具——测序、文库、标记与数据库——所处理。表 1.1-1 列出六个在教学与历史上都具代表性的物种,它们的基因组大小横跨近五个数量级。
| 物种 | 类群 | 基因组大小(bp) | 蛋白质编码基因(约) | 全序列完成 |
|---|---|---|---|---|
| λ 噬菌体(Enterobacteria phage λ) | 双链 DNA 噬菌体 | ≈4.85×10⁴ | ≈70 | 1982 |
| 大肠杆菌 K-12(Escherichia coli) | 细菌 | 4.64×10⁶ | ≈4 400 | 1997 |
| 酿酒酵母(Saccharomyces cerevisiae) | 单细胞真核生物 | ≈1.21×10⁷ | ≈6 000 | 1996 |
| 秀丽隐杆线虫(Caenorhabditis elegans) | 多细胞动物 | ≈1.0×10⁸ | ≈19 000 | 1998 |
| 黑腹果蝇(Drosophila melanogaster) | 多细胞动物(昆虫) | ≈1.4×10⁸ | ≈13 600 | 2000 |
| 人(Homo sapiens) | 哺乳动物 | ≈3.1×10⁹ | ≈2×10⁴ | 2001 草图 / 2003 完成 |
注:果蝇数值为常染色质区间的常用估计(含异染色质约 1.8×10⁸ bp);人类蛋白质编码基因数在 2001 年两篇草图中估计为 2.6 万–4 万,此后经更完整的注释与比较分析修订为约 2 万(原书出版于 2009 年,本表数值已按当前共识标注)。数据综合自 Gibson & Muse(2009)、Brown(2006)及各物种原初测序论文。
表中数据揭示的第一个事实是:基因组大小与生物复杂度之间不存在简单的比例关系。线虫(约 1.0×10⁸ bp)的基因数多于基因组更大的果蝇(约 1.4×10⁸ bp);而在表外,某些变形虫与某些植物的 C 值可达人类的数十倍乃至百倍以上。一个直觉的推论——生物越复杂,基因组越大,基因越多——在种内小尺度上尚可成立,在跨类群比较时即告失效。
C 值悖论(C-value paradox):单倍体基因组大小(C 值)与生物体形态、发育复杂度不成比例的现象(Thomas, 1971)。一个物种的基因组可以远大于其复杂度“所需”,多出的部分主要为非编码的重复序列。悖论之“悖”,在于以基因数目直觉估计基因组大小时会系统性失准;当代文献常以“C 值之谜(C-value enigma)”指称其后续问题——这些非编码 DNA 为何积累、又通过何种机制与代价被保留。
第二个事实可以从基因密度(gene density)定量地看到。定义单位基因组长度内的基因数为:
换算成直观说法:大肠杆菌约每 1 kb 就有一个基因,酿酒酵母约每 2 kb 一个,而人类平均每 10⁵ bp 以上才有一个。从大肠杆菌到人类,基因组增大约 670 倍,基因数仅增约 4–5 倍——基因组每增大一个数量级,增加的主要不是基因,而是非编码序列。人类基因组中各类转座元件及其残迹约占一半,加上内含子与基因间区,非编码比例超过 98%(Lander et al., 2001;Venter et al., 2001)。在相当程度上,“大基因组”是“稀疏基因组”:调控逻辑、染色质结构与转座子的进化历史占据了主要篇幅。这也提示初学者:拿到一个新测序的基因组,“它有多大”与“它有多少基因”必须分开提问。
这一尺度格局直接塑造了研究策略的分层。对 10⁴–10⁷ bp 的小基因组,可以直接整体随机测序、一次装配(第 2 章);而对 10⁹ bp 级的人类基因组,随机碎片数以千万计,必须先建立遗传与物理两种坐标系以锚定装配与分工(第 1.2、1.3 节),再分级测定(第 1.4 节)。尺度还与成本、组织方式互相作用——这正是“基因组计划”作为一类科学组织形态出现的原因:当单一实验室无法吞下 3×10⁹ bp 时,学科需要的是路线图、数据标准与国际分工(Collins 等 2003 年的总结对此有精要回顾,见本章参考文献)。
1.1.3 全基因组范式:从候选基因到无偏全景
经典分子遗传学的推理链条是:由表型出发提出候选基因,或经突变筛选获得线索,再逐一对特定基因做克隆、敲除与表达验证。这种假说驱动(hypothesis-driven)模式的长处在深度——一次一个基因,机制可以推进到分子细节;短处在覆盖——结论天然受制于研究者的先验选择,无法回答“在全部基因中还有谁参与”。其认识论局限常被概括为一句话:你只能找到你正在寻找的东西。
基因组学提供了另一条路径:不预先挑选对象,而以无偏(unbiased)的方式测量全部对象——全基因组序列、全基因组突变集合、全基因组表达谱。所谓无偏,指测量框架本身不包含“哪些位点重要”的先验假设:对象是穷举的,而非抽样的。由此,意外结果获得了进入数据的机会。酵母全基因组敲除文库使“敲除后表型正常”的基因同样被系统记录,人们才得以讨论遗传冗余的规模;人类基因组草图则把蛋白质编码基因数从流行一时的约 10 万估计压至 2.6 万–4 万区间(最终修订为约 2 万),并揭示重复序列约占全基因组一半、数百个基因曾被疑为细菌水平转移(该结论随后受到质疑与修正)——这些结论没有一项处于测序之前的预期清单之内(Lander et al., 2001;Venter et al., 2001)。
范式之辨:假说驱动与发现驱动互补而非对立。全基因组范式常被称为发现驱动(discovery-driven)科学。需要澄清的是,发现驱动并非“没有假设”,而是把假设的提出与检验置于数据采集之后:先建立完整的观察面,让模式从数据中显形,再以传统实验逐条验证。两种模式各有所长——假说驱动提供机制深度与因果检验,发现驱动提供全景与意外的可能;当代基因组学的标准工作流恰是“发现式筛选 → 候选提炼 → 定向验证”的循环。一个克制的类比:假说驱动像按目录查阅一本书,发现驱动像通读全书之后再编制索引——两种读法各有其时,读基因组这部大书尤其如此。
范式转换同样重塑了学科的统计纪律。当检验对象从少数候选基因扩展到全基因组数十万乃至数百万个标记时,仅凭单点显著性将产生大量假阳性,多重假设检验的校正(如 Bonferroni 校正与错误发现率控制)因此成为方法学标配——无偏的收益,须以更严格的统计门槛来兑现。第 3 章讨论全基因组关联分析时,这一纪律将再次出现。与此并行,全基因组数据的公共归档与统一坐标(第 1.6 节)使不同实验室的测量可以互相叠加,学科的重心由“获得数据”逐步移向“解释数据”。
1.1.4 基因组学的主要分支与全书结构
在结构—功能二分的基础上,基因组学已分化出若干相对成熟的分支。结构基因组学涵盖作图、测序与注释,回答序列“是什么、在哪里”;序列在手之后,比较基因组学(comparative genomics)以跨物种的序列对照识别被自然选择保留的编码区与调控元件,是“哪些序列在发挥作用”的直接读法;变异基因组学研究种内个体间的序列差异——SNP、插入缺失与结构变异——及其与表型的统计关联,构成基因型—表型关系的入口;功能基因组学的主体则是转录组学与蛋白质组学,分别测量读出层与执行层的状态。最终,各层数据在系统层面汇合,形成整合基因组学。这五个方向连同支撑它们的数据库资源,恰好构成原书与本书的六章结构。
图 1.1-2 概括了本书的知识路径:第 1–2 章解决“序列从哪里来、坐标如何建立、注释如何产生”;第 3–5 章把静态序列依次放入变异、表达与蛋白质三个层级加以考察;第 6 章再把多层数据整合为对生物系统的解释。沿着这条路径,读者应能始终区分两类问题——关于结构的问题(序列与坐标)与关于功能的问题(作用与后果)——并在每一章辨认出当前工作处于信息流的哪一层。本节之后,第 1.2 节即从第一块基石——遗传图谱——开始。
习题 1.1-1
试从 (a) 信息层级、(b) 时间与条件稳定性、(c) 主要研究工具三个方面,比较基因组、转录组与蛋白质组,并说明为何基因组学以基因组而非转录组作为学科的组织基点。
参考解答(a) 基因组(DNA)存储遗传信息,转录组与蛋白质组分别是条件依赖的读出层与执行层;(b) 基因组在同一个体有核细胞间基本恒定,是物种属性,而转录组与蛋白质组随细胞类型、发育阶段与环境条件改变,是状态属性;(c) 基因组研究以测序、作图与装配为核心工具,后两者分别依赖杂交/测序计数与质谱等技术。以基因组为基点,是因为它在层级上最靠底、在时间上最稳定,且其序列坐标可被其余两层数据反复引用——先有坐标系,才能定位动态过程,这正是本书先讲作图与测序、后讲表达与蛋白的原因。
习题 1.1-2
利用表 1.1-1 与式 (1.1-1):(1) 计算从 λ 噬菌体到人类的基因组大小之比,并以数量级表述;(2) 分别计算大肠杆菌与人类的基因密度,并说明二者差异的主要生物学来源;(3) 解释为何这一现象支持“C 值悖论”的提法。
参考解答(1) 3.1×10⁹ ÷ 4.85×10⁴ ≈ 6.4×10⁴,即人类基因组比 λ 噬菌体高约 4–5 个数量级。(2) 大肠杆菌 ρ ≈ 4 400/4 600 ≈ 0.96 个/kb,即约每 1 kb 一个基因;人类 ρ ≈ 2×10⁴/3.1×10⁶ ≈ 0.006 个/kb,平均每 10⁵ bp 以上才有一个,二者相差百余倍。差异主要来自非编码序列比例的升高:内含子、调控元件以及约占一半的重复元件(转座子残迹)稀释了基因密度。(3) 从大肠杆菌到人类,基因组增大约 670 倍而基因数仅增约 4–5 倍,说明基因组大小不能由基因数目或复杂度直觉外推——跨类群比较时“大”不等于“基因多”,这正是 C 值悖论的核心内容。
关键术语
- 基因组 (genome)
- 一个细胞或病毒颗粒携带的全部遗传物质;真核生物通常指一套单倍体染色体 DNA 之总和。
- 基因组学 (genomics)
- 对基因组进行整体性测定、组装、注释与功能解析的学科。
- 结构基因组学 (structural genomics)
- 以获得基因组结构信息(序列、坐标、元件目录)为目标的分支,含作图、测序与注释。
- 功能基因组学 (functional genomics)
- 以全局测量考察基因表达、变异效应与互作的分支,方法上依赖结构基因组学的产出。
- 转录组 (transcriptome)
- 特定细胞在特定条件下转录出的全部 RNA 分子集合,是条件依赖的状态量。
- 蛋白质组 (proteome)
- 特定细胞在特定条件下表达的全体蛋白质集合,位于信息流执行层。
- C 值悖论 (C-value paradox)
- 单倍体基因组大小与生物复杂度不成比例的现象,多出部分主要为非编码重复序列。
- 基因密度 (gene density)
- 单位基因组长度内的基因数,随基因组增大而显著下降。
- 比较基因组学 (comparative genomics)
- 以跨物种或跨个体的序列对照识别保守元件与进化机制的分支。
- 发现驱动科学 (discovery-driven science)
- 以系统性、无偏的数据采集为起点,先建立全景再提炼并检验假设的研究模式。
参考文献与延伸阅读
- Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 1)
- Lander ES, Linton LM, Birren B, et al. (International Human Genome Sequencing Consortium). 2001. Initial sequencing and analysis of the human genome. Nature 409: 860–921.
- Venter JC, Adams MD, Myers EW, et al. 2001. The sequence of the human genome. Science 291: 1304–1351.
- Alberts B, Johnson A, Lewis J, Raff M, Roberts K, Walter P. 2008. Molecular Biology of the Cell, 5th ed. New York: Garland Science.
- Brown TA. 2006. Genomes 3, 3rd ed. Oxford: Wiley-Liss.
- Thomas CA Jr. 1971. The genetic organization of chromosomes. Annual Review of Genetics 5: 237–256.
- Hieter P, Boguski M. 1997. Functional genomics: it's all how you read it. Science 278: 601–602.
- Collins FS, Morgan M, Patrinos A. 2003. The Human Genome Project: lessons from large-scale analysis of biology. Science 300: 286–290.