第四章 · 4.3

4.3 实验流程与设计

Experimental Workflow and Design of Microarray Studies

本节摘要 本节自样本而数据地梳理微阵列研究全流程:组织采集与 RNA 完整性质检、T7 线性扩增与荧光标记、杂交扫描与图像定量,以及以 MIAME 为规范的数据交付;继而以实验设计为核心,讨论生物学与技术重复的方差分解、随机化与区组、染料交换与样本量直觉,归纳常见设计错误,并以贯穿质控点的端到端流程图收束。

上一节比较了两大微阵列平台的结构差异;本节转向如何把这些平台变成可信的数据。微阵列实验是一条"湿实验—仪器—统计"的接力链:组织采集、RNA 提取与质检、扩增与标记、杂交与扫描、图像分析与定量,最终产出一张"基因 × 样本"的强度矩阵。链条上任何一环的系统偏差都会沉淀进数据;其中最昂贵、也最无法事后补救的失误,往往不在操作而在设计。本节按流程顺序讨论各环节的技术要点与质控标准(4.3.1–4.3.3),随后以更大篇幅讨论实验设计原理与常见错误(4.3.4–4.3.5),并以端到端流程图收束(4.3.6);归一化与差异表达的统计方法留待下一节(Gibson & Muse, 2009)。

4.3.1 样本与 RNA 质量

流程的第一环在试管之外。RNA 酶(RNase)广泛存在于皮肤、唾液与实验环境中,热稳定且几乎不失活,而 mRNA 的半衰期本身只有数分钟到数小时,因此取材与提取的首要纪律是速度与低温:组织离体后立即液氮速冻或投入 RNA 稳定试剂,器械与溶液以焦碳酸二乙酯(DEPC)处理并高压灭菌,操作全程佩戴手套、在冰上完成。提取多采用胍盐–酚法(如 TRIzol 一类试剂)或硅胶柱法:前者得率高,适合大块组织;后者流程快,便于批量处理。与教学实验不同,临床或现场样本还必须记录缺血时间、保存时长与冻融次数——这些元数据既是 4.3.3 节 MIAME 规范的要求,也是事后排查批次异常的线索。

提取产物须通过三重质检。其一,分光光度法:纯 RNA 的 A260/A280 应接近 2.0,明显偏低提示蛋白污染,A260/A230 异常提示有机溶剂或盐残留。其二,毛细管电泳:完整哺乳动物总 RNA 的 28S 与 18S rRNA 荧光比约为 2:1,降解时比值下降、条带弥散。其三,把电泳图谱交给算法统一打分——RNA 完整性数值(RNA integrity number, RIN)是一个 1–10 的尺度,10 表示完全完整,1 表示严重降解;表达谱实验常用的入围门槛是 RIN 不低于 7,更严格的应用常要求 8 以上(Imbeaud et al., 2005)。设门槛的根据在于降解并非随机:核酸酶自末端啃噬,使信号系统性偏向探针覆盖的 3′ 区域;若两组样本降解程度不同,"降解梯度"会伪装成"表达差异",且无法靠归一化修复。

质检合格只说明 RNA 完好,不说明它代表了想研究的细胞。一块组织的匀浆是多种细胞的加权平均:目标细胞占比从 60% 滑落到 30%,真实的二倍差异会衰弱为约 1.5 倍,而浸润细胞比例的变化还能制造纯粹的假象。处理异质性有两极:组织解离把样本分散为单细胞悬液以便流式或磁珠分选,通量高,但解离过程本身会诱发应激基因表达;激光捕获显微切割(laser capture microdissection, LCM)在显微镜下以激光直接圈取目标细胞群,纯度最高,但产量常仅纳克级,必须依赖后续扩增,从而把 4.3.2 节讨论的扩增偏倚引入数据,且操作耗时、样本长时间暴露于降解风险。实践中的选择是明码的权衡:目标细胞丰富、占比稳定的体系用匀浆;稀有或界限不清的细胞群用分选或 LCM 并接受扩增代价。无论哪条路线,细胞构成本身都应作为协变量记录在案。

4.3.2 标记与杂交

一张芯片的杂交通常需要微克级的标记核酸,而一份 LCM 样本或细针穿刺物可能只有纳克级总 RNA,扩增因此常是必经步骤。主流方案是体外转录(in vitro transcription, IVT)线性扩增:以带 T7 启动子的寡聚(dT)引物反转录 mRNA,合成双链 cDNA 后用 T7 RNA 聚合酶转录出大量反义 RNA(aRNA)(Van Gelder et al., 1990)。线性扩增的保真性来自其动力学:每个模板分子以近似恒定的速率产生产物,分子间的相对比例基本保持;相比之下,PCR 的指数扩增会把模板间微小的效率差(GC 含量、二级结构、片段长度)按循环数复利放大——起始比例相同的两个转录本,可能在三十个循环后相差数倍。因此除非样本量极端受限,微阵列流程优先线性扩增。

方法

T7 线性扩增的操作逻辑与保真边界。一轮"反转录—第二链合成—体外转录"可将约 10 ng 总 RNA 增殖至 10–100 μg aRNA;仍不足时进行第二轮,但每加一轮都会加深 3′ 偏置、压低覆盖均一性(Van Gelder et al., 1990)。两条操作纪律:同一研究中所有样本使用相同的扩增轮数与试剂批号;扩增产物一律经电泳确认长度分布——这既是流程质控点,也是 4.3.6 节流程图中该步骤旗标的来源。底线是:扩增可以把少量 RNA"抬"到可杂交的量,但抬升必须对所有样本等比例,否则增量就兑换成了系统偏倚。

标记化学分直接与间接两路。直接标记在反转录时掺入荧光核苷酸(如 Cy3-或 Cy5-dUTP):染料分子体积大,聚合酶掺入效率低且随序列上下文波动,两种染料的掺入率也不相等——这正是染料偏倚的化学根源。间接标记(indirect labeling)先用氨基烯丙基-dUTP(带活性氨基的小修饰碱基)参与反转录,纯化后再以 NHS 酯化学把 Cy 染料偶联上去:小碱基掺入均匀,偶联独立于酶学进行,标记重现性显著更好,代价是多一步纯化。Affymetrix 单色平台则用生物素标记 cRNA,杂交后以链霉亲和素—藻红素染色显色。

标记方案至此与平台合流为两条支线。双色平台把两个样本分别标成 Cy3 与 Cy5、等量混合后在同一张片上竞争杂交同一批探针,直接读出比值,因此必须管理染料分配的平衡(见 4.3.4 节);单色平台一样本一片,比较在芯片之间进行,因此必须管理芯片间归一化(见 4.4 节)。杂交在含封闭剂(鲑精 DNA、Cot-1 DNA,用于封闭重复序列与黏性片段)的缓冲液中进行,45–65 °C 孵育 12–16 小时,让数千个点上的结合—解离同时逼近平衡;随后以逐渐提高严谨性(降低盐浓度、提高温度)的梯度洗涤去除非特异结合,进入扫描。共聚焦激光扫描仪以 532 nm 与 635 nm 分别激发 Cy3 与 Cy5,光电倍增管(PMT)逐通道采集 16 位灰度图像。PMT 增益是一个两难旋钮:调高可救回弱信号,却会把强信号推入饱和——饱和点的真实强度被截断,比值随即失真,因此两通道都应保留饱和裕量。

4.3.3 图像分析与原始数据

扫描的原始产物是两幅(单色平台为一幅)16 位 TIFF 图像,还不是数字。图像分析软件首先按点样布局定位网格(以角标记点或整版布局文件对齐每个光斑的预期位置),随后对每个光斑做分割:区分前景信号区与环绕其外的背景区,常用光斑周边环形邻域的中位数估计局部背景(local background),再从前景中值中扣减,得到该点的净强度。几何形态异常(拉丝、空心环、尘埃贴邻)、信号接近背景或读数饱和的光斑会被打上质量旗标,在下游分析中按旗过滤或降权——保留坏点比剔除坏点更能毁掉一张热图。背景扣减看似简单,实为噪声放大器:低强度点上小小的背景估计误差会被放大成负值或发散的比值,这正是 4.4 节背景校正方法学的起点。

方法

MIAME:微阵列数据的报告规范。MIAME(minimum information about a microarray experiment)规定一篇报告应提供足以让他人重现分析的最小信息,涵盖六个部分:实验设计(分组、重复、杂交方案)、样本来源与处理、核酸提取与标记、杂交与洗涤参数、测量数据(原始图像与定量表)、阵列设计(探针内容与布局)(Brazma et al., 2001)。多数主流期刊以 MIAME 合规并把原始数据存入公共库(GEO、ArrayExpress)为发表条件。规范的本意不是文书负担,而是把"数据能否被独立检验"制度化——对实验者自己,规范的记录也是在给数月之后排查批次问题时留下后路。

一张合格的数据表必须连同它的来龙去脉一起交付。GEO(Edgar et al., 2002)与 ArrayExpress 接受原始图像、定量表与元数据的结构化存档,构成微阵列时代"可重复性的基础设施"。这一制度的红利远超合规本身:公共数据使独立的二次分析、平台间比对与跨研究荟萃分析成为可能,也让"原始数据见补充材料"式的模糊交代无处遁形。从本节的角度看,存档是流程的最后一道质控——连自己都说不清来路的数据,不会因为进了数据库就变得可信。

4.3.4 实验设计原理

微阵列研究中最昂贵的失败不是杂交失误,而是设计先天无法回答所提的问题。Churchill(2002)、Kerr 与 Churchill(2001)及 Yang 与 Speed(2002)在双色阵列时代确立的设计原理,至今仍是转录组实验的通用语法,其支柱是重复、随机化与区组、染料平衡和样本量。先说重复。任何一次测量都可分解为层层叠加的波动:

yij = μ + ai + εij, σ²y = σ²bio + σ²tech (4.3-1) μ:条件均值;ai:第 i 个独立个体的效应(方差 σ²bio);εij:该个体第 j 次测量的技术波动(提取、标记、杂交与扫描之和,记 σ²tech)。推断的目标几乎总是"该条件下的群体",而群体方差正是 σ²bio——只有跨独立个体的取样能触及它。

据此定义两类重复:技术重复(technical replicate)固定个体、重复测量,只暴露 σ²tech生物学重复(biological replicate)更换独立个体,同时承受两类方差。技术重复把 p 值做小的办法是假装 σ²bio 不存在——那是自欺而非推断;反之,生物学重复充足时,技术重复的信息可以并入混合效应模型,不必单独占用芯片。预算的优先序因此明确:先加个体,再加测量(图 4.3-1)。

重复的方差结构:从群体真值到单次测量 两个方差分量决定结论能外推到哪里 群体均值 μ(真值) + 个体间效应 σ²bio 个体 i 的状态 μ + aᵢ + 提取与保存 σ²prep 提取后的 RNA + 标记与杂交 σ²lab 荧光图像 + 扫描与定量 σ²scan 定量观察值 y 生物学方差:仅独立个体可估,决定外推范围 技术方差:固定个体重复即可估计(三项之和) Var(y) = σ²bio + σ²tech —— 推断的样本量按独立个体计数 两种重复方案:同样 3 张芯片,不同的"有效样本量" A 生物学重复:三个独立个体 三个独立个体:每只动物各自提取 RNA、各自杂交一张芯片 个体1 个体2 个体3 每张芯片承载一个独立个体:估计 σ²bio 与 σ²tech 之和 芯片 1 芯片 2 芯片 3 推断单位 = 独立个体;同时估计 σ²bio 与 σ²tech, 结论可外推到群体(有效 n = 3)。 B 技术重复:同一个体的三次测量 个体 1 同一份 RNA 均分三份 三张芯片来自同一份 RNA:只刻画测量噪声,不提供个体间方差 推断单位 = 该个体; 只估计 σ²tech, 有效 n = 1。
图 4.3-1 重复类型的方差结构。左:单次测量可分解为个体间效应(σ²bio,绿色)与三项技术波动(σ²tech,灰色)之和,见式 (4.3-1);前者只有跨独立个体取样才能估计。右:同样消耗三张芯片,方案 A 的三个生物学重复支撑群体推断,方案 B 的三个技术重复只刻画测量噪声——把 B 当作 A 使用即伪重复(4.3.5 节)。悬停图形元素可查看说明。
注记

一个关于重复的类比。想判断一家餐馆的汤是否普遍偏咸:把同一锅汤舀出三碗分别测量,评价的是盐度计的稳定性(技术重复);把不同日期熬的三锅汤各测一次,才能回答"这家店的汤"是否偏咸(生物学重复)。推断的单位是独立批次,而不是测量次数——高通量实验同理,只是"锅"换成了个体、动物或独立培养物。

表 4.3-1微阵列实验设计要素一览(据 Churchill, 2002;Yang & Speed, 2002 整理)
设计要素回答的问题关键操作常见失误
生物学重复个体间方差多大?结论能否外推到群体每组不少于 3 个独立个体或培养物以技术重复冒充
技术重复测量环节本身的噪声多大同一样本重复标记、杂交、扫描生物学重复不足时过度投入
随机化批次、位置、操作者是否与分组无关随机安排提取、标记、杂交与扫描顺序按组顺次操作造成混杂
区组把已知无关变异源锁进区组内部配对样本同批处理、同批芯片区组内缺少完整条件组合
染料交换如何抵消 Cy3/Cy5 标记偏倚配对互换染料或跨样本染料平衡全部样本同向标记
样本量检验功效是否足够事前功效分析,见式 (4.3-3)事后补救(不可能)

随机化(randomization)针对的是没有写进式 (4.3-1) 的第三类因素:批次、操作者、试剂批号、杂交炉位、扫描顺序与芯片上的打印位置。微阵列的批次效应之大,常超过研究条件本身的效应;若对照组恰好都在周一处理、实验组都在周五,表达谱里"星期几"的印记便无法与处理效应区分。随机化不消除批次效应,而是把它与分组解耦:偏倚仍进入数据,但以随机噪声而非系统差的形式存在,统计上可被吸收。区组(blocking)是随机化的补充:当某个变异源无法随机化时(芯片分两批到货、两台扫描仪轮流使用),就把一个完整的条件组合锁进同一个区组——例如同一批次、同一天同时处理一对"处理/对照",配对差值便只携带区组内噪声。随机化打散不可控因素,区组收拢已知因素,二者常配合使用。

双色平台还有一类特有偏倚来自染料本身:Cy3 与 Cy5 的掺入效率、量子产额与检测响应互不相同,"被标成哪种颜色"平均带来一个系统的对数偏移 d,且 d 随强度缓慢变化(其强度依赖形态将在 4.4 节的 M-A 图中直观呈现)。对同一对样本做染料交换(dye swap)——第二张芯片对调两种染料——可让偏倚在代数上对消(图 4.3-2):

Δ̂ = (M1 − M2) / 2, d̂ = (M1 + M2) / 2 (4.3-2) M1、M2:交换前后两张芯片的 log₂(Cy5/Cy3);Δ:真实 log₂(条件 A / 条件 B) 差异;d:两片中近似相同的染料偏倚项。交换设计把 d 移入可估计、可扣除的位置,把 Δ 从染料效应中剥离出来。
2×2 染料交换矩阵(一对样本 · 两张芯片) 芯片 Cy5:红色通道,635 nm 激发 Cy5(红通道) Cy3:绿色通道,532 nm 激发 Cy3(绿通道) 芯片 1 样本 A 样本 B 芯片 2 样本 B 样本 A M₁ = Δ + d (A 在 Cy5:信号被染料偏倚抬高) M₂ = −Δ + d (B 在 Cy5:真实差异反向、偏倚同向) Δ̂ = (M₁ − M₂)/2 —— 染料偏倚 d 对消,只余真实差异 M = log₂(Cy5/Cy3);d 假定在两张芯片间近似不变 扩展:4 对样本的染料平衡(每样本一张芯片) 配对 Cy5 通道 Cy3 通道 芯片 1芯片 2芯片 3芯片 4 A1 · Cy5 B1 · Cy3 B2 · Cy5 A2 · Cy3 A3 · Cy5 B3 · Cy3 B4 · Cy5 A4 · Cy3 A 条件两红两绿,B 条件亦然——染料与条件正交, 偏倚在组间对消(Yang & Speed, 2002);芯片充裕时 对每对完整交换(8 张),兼得配对与消偏。
图 4.3-2 染料交换与染料平衡。左:2×2 交换矩阵——同一对样本 A/B 在两张芯片上互换染料,按式 (4.3-2) 取两张芯片对数比值之差的一半即真实差异 Δ,染料偏倚 d 对消。右:多对样本时不需每对都交换,一半正向、一半反向即可使染料与条件正交。染料偏倚的强度依赖分量须配合 4.4 节的 LOWESS 校正处理。
习题 4.3-1

在双色点样平台上比较条件 A 与条件 B,各有 4 个生物学重复(A1–A4、B1–B4),共可用 8 张芯片。请给出一个把每对配对样本做完整染料交换的方案(用类似图 4.3-2 的矩阵表示:每张芯片上哪个样本、用哪种染料),说明交换如何同时保留配对结构与消除染料偏倚;再与"公共参考设计"(每张芯片上样本对抗同一份参考 RNA)比较,指出后者的芯片数与优缺点。

参考解答

配对交换方案:芯片 1:A1-Cy5/B1-Cy3;芯片 2:A1-Cy3/B1-Cy5;芯片 3–4、5–6、7–8 对 (A2,B2)、(A3,B3)、(A4,B4) 依同样方式正反各一张。每对得到两个 M 值,按式 (4.3-2) 取 (M₁−M₂)/2 得配对差异估计——配对结构使个体间方差进入差值后大幅抵消,交换使染料偏倚 d 代数对消。公共参考设计需要 8 张芯片(8 个样本各一张,均对抗同一参考),优点是任意样本之间都可间接比较、便于后续增补样本,缺点是感兴趣的比较是"隔芯片"的间接比较,有效方差更大、功效低于直接配对;且参考 RNA 的稳定性成为全局风险点(见 4.3.5 节)。

样本量的直觉可用双样本检验的粗略功效公式建立:

n ≈ 2 (z1−α/2 + z1−β)2 σ2 / Δ2 (4.3-3) n:每组生物学重复数;σ:个体间标准差(log₂ 刻度);Δ:目标效应(如 log₂FC = 1 对应两倍变化);z 为标准正态分位数。该式为单基因双侧检验、每组等数的量级近似,未计多重检验与方差估计的不确定性。

取 α = 0.05、功效 80%,系数 2(1.96 + 0.84)² ≈ 15.7。以两倍变化(Δ = 1)为目标:若 σ ≈ 0.5(细胞系或近交系动物的典型水平),每组约需 4 个生物学重复;σ ≈ 0.7(原代组织、临床样本的常见水平)则约需 8 个。这组数字支撑了领域的经验量级:每组 3–5 为最低可辩护线,5–8 更稳健——是经验量级而非定理,具体研究应代入自身方差估计,并在全基因组多重检验校正后(4.4 节)预期功效进一步缩水,故取值宜靠近上限。当研究本身含两个因素(如药物处理 × 时间点),宜采用 2×2 因素设计:四格各配重复,一次实验同时估计两个主效应与交互作用,芯片利用效率高于把因素拆开分别实验。

习题 4.3-2

某基因在细胞系中的 log₂ 表达值个体间标准差约 0.5,目标检出 log₂FC = 1 的变化,α = 0.05、期望功效 80%。用式 (4.3-3) 估算每组所需生物学重复数;若改用原代培养(σ ≈ 0.7),需要多少?据此说明"每组 3–5 起步、5–8 更稳"这一经验量级的来源与适用边界。

参考解答

n ≈ 15.7 × σ²/Δ²。σ = 0.5 时 n ≈ 3.9,即每组约 4 个独立生物学重复;σ = 0.7 时 n ≈ 7.7,即约 8 个。方差较小的体系落在区间下端(3–5),异质性较大的体系落在上端(5–8),这就是经验量级的算术来源。边界有三:其一,该式针对单个基因的单次检验,全基因组约上万个基因经 FDR 校正后,同样重复数下的有效功效明显下降;其二,σ 因基因而异,应按中位或较保守的方差代入;其三,n 必须落在独立生物学单位上——若把同一培养瓶的分装当重复,公式给出的只是数字幻觉(见习题 4.3-3)。

4.3.5 常见设计错误清单

伪重复(pseudoreplication)位列错误清单之首:把同一生物学单位的多次测量当作独立样本参与推断。典型形态如:每只动物取三个脑区分别杂交,再把"处理组 9 张芯片对对照组 9 张芯片"做 t 检验——9 次测量只来自 3 只动物,个体间方差被低估约三倍,p 值随之虚低。判别只需一问:结论要外推到什么单位,重复就必须落在什么单位上。同一单位的多次测量应先平均、或以混合效应模型显式建模个体项,但不能冒充独立证据。

第二是批次与研究条件完全混杂。批次效应是微阵列数据中最大的技术方差分量之一;当所有对照集中在一批、所有处理集中在另一批,"批间差"与"组间差"在数学上是同一个量,任何统计方法都无力回天。预防成本极低:按区组交错安排处理与对照,把分组写进随机化表,并在分析模型中保留批次项。事后唯一诚实的处置是承认无法区分,回到实验台补齐交错批次——数据再漂亮也一样。

第三类错误更隐蔽:参考 RNA 桥接的设计风险。跨批次或多平台比较常以一份公共参考 RNA 把各批样本"桥"到同一标尺(公共参考设计即每张芯片都对抗同一参考)。桥的稳定性就是整个研究的标尺:参考 RNA 应一次大批量制备、混匀后分装为单次用量、避免反复冻融,并以同一批号贯穿研究始终;每张芯片固定搭载桥样,用其信号漂移监控批次。若桥本身随时间降解或中途更换批号,所有批次都在用一把会变形的尺子丈量——这种错误事后几乎不可检出,只能靠规程预防。

警示

混杂与伪重复:微阵列时代的经典教训。微阵列的批次效应之大常超过研究条件本身的效应,早期不少在小样本、批次与条件完全混杂的设计上报告的分类标志物,事后无法在独立队列中重复(Kerr & Churchill, 2001;Churchill, 2002)。两条纪律由此确立:其一,研究条件必须在批次、芯片位置与操作者之间随机平衡;其二,重复必须落在独立生物学单位上。二者之一失守,数据即不具备回答所提问题的能力——这与操作是否熟练、仪器是否先进均无关。

习题 4.3-3

某团队检验药物对小鼠肝脏表达谱的影响:3 只处理鼠与 3 只对照鼠,每只取肝一份、提取 RNA 后每份 RNA 在两张不同芯片上各杂交一次,共 12 张芯片;分析时把每组的 6 张芯片当作 6 个独立样本做 t 检验,得到大量 p < 0.01 的基因。请指出该设计中的生物学重复与技术重复各是多少,判断分析是否犯了伪重复错误并说明后果,给出正确做法。

参考解答

生物学重复每组 3(独立动物),技术重复每样本 2。把每组的 6 张芯片当独立样本,即以技术重复冒充生物学重复,属伪重复:误差项只含技术方差而漏掉个体间方差 σ²bio,标准误被低估约 √2 倍以上,p 值系统性虚低,"大量显著"不可信。正确做法:先把每个体两张芯片的读数平均(或以个体为随机效应的混合模型),以每组 3 只动物为独立单位检验;更优的资源分配是把重复杂交的经费改用于增加动物数——按式 (4.3-3),个体数才是功效的杠杆。

4.3.6 全流程与质控点

图 4.3-3 把本节内容合并为一张端到端路线图:从组织到统计推断共八步,每一步都内嵌一个质控判据——取材的防降解纪律、RNA 的 RIN 门槛、扩增的轮数一致与染料平衡、杂交的温育锁定、扫描的饱和裕量、图像分析的旗标过滤、数据矩阵的 MIAME 交付与统计端的 FDR 校正。质控点分布的规律是:越靠上游的错误越难在下游察觉,因此对 4.3.1 与 4.3.2 的投入回报最高;而设计(横贯全图的横幅)不属于任何一步,却决定每一步的产出能否被解释。

实验设计先于操作:生物学重复 · 随机化 · 区组 · 染料平衡 第 1 步:组织采集。质控:防 RNase、统一流程 ① 组织采集 快速取材 · 液氮速冻 分组与重复先于操作 质控:防 RNase 第 2 步:RNA 提取与质检。质控:RIN 不低于 7 为常用门槛 ② RNA 提取与质检 胍盐–酚法或硅胶柱 RIN 与 28S/18S 评估 质控:RIN ≥ 7(常用) 第 3 步:扩增与标记。质控:各样本轮数一致、染料平衡 ③ 扩增与标记 T7 体外转录线性扩增 Cy3/Cy5 或生物素标记 质控:染料平衡设计 第 4 步:杂交过夜。质控:锁定温度与时间 ④ 杂交过夜 45–65 °C 孵育过夜 12–16 h · 梯度洗涤 质控:温度时间锁定 第 5 步:洗涤与扫描。质控:两通道均不饱和 ⑤ 洗涤与扫描 双激光 532/635 nm PMT 逐通道采集 质控:留饱和裕量 第 6 步:图像分析。质控:旗标光斑过滤 ⑥ 图像分析 网格定位 · 前景背景 逐点定量与旗标 质控:坏点旗标过滤 第 7 步:数据矩阵。质控:MIAME 元数据与公共存档 ⑦ 数据矩阵 基因 × 样本强度表 MIAME 元数据随行 质控:MIAME 存档 第 8 步:统计与推断。质控:报 FDR 与效应量 ⑧ 统计与推断 线性模型与重复检验 多重检验 · FDR 校正 质控:报 FDR 效应量 失败模式:伪重复、批次与条件全混杂、染料全部同向—— 设计错误无法靠下游统计挽救。 经验量级:每组生物学重复 3–5 起步、5–8 更稳健; 技术重复用于刻画测量噪声,不支撑外推。 框内虚线下为该步质控点;流程据 Gibson & Muse (2009) 第 4 章整理。悬停各框可查看说明。
图 4.3-3 微阵列实验端到端流程与质控点。湿实验部分(①–⑤)决定数据质量的上限,图像分析与统计部分(⑥–⑧)决定信号能否从噪声中恢复;每步框内虚线下标注该步的质控判据,顶部横幅提醒设计要素贯穿全程。统计端的方法细节(归一化、差异检验、FDR)在 4.4 节展开。

本节可以浓缩为两条铁律:推断的单位是独立生物学个体;研究条件必须与一切无关因素解耦——用随机化打散,用区组收拢,用染料交换抵消,用参考桥校准。满足这两条,原始强度矩阵才配进入下一节的统计流水线。

关键术语

RNA 完整性数值 (RNA integrity number, RIN)
对总 RNA 完整性的 1–10 打分,10 为完全完整,表达实验常用门槛为不低于 7。
激光捕获显微切割 (laser capture microdissection, LCM)
显微镜下以激光圈取目标细胞群以富集组织的方法,纯度高但产量低。
体外转录扩增 (in vitro transcription amplification)
T7 启动子驱动的线性 RNA 扩增,近似保持分子间相对丰度。
间接标记 (indirect labeling)
先掺入氨基烯丙基-dUTP、再偶联染料的标记策略,掺入比直接标记均匀。
局部背景 (local background)
以光斑周边邻域估计的非特异荧光,从前景强度中扣除得净信号。
MIAME (minimum information about a microarray experiment)
描述与重现一次微阵列实验所需的最小信息规范。
生物学重复 (biological replicate)
落在独立生物学单位上的重复,估计个体间方差并支撑群体推断。
技术重复 (technical replicate)
同一生物样品的重复测量,刻画提取、标记、杂交与扫描的技术噪声。
染料交换 (dye swap)
同一对样本互换染料重杂交,以对消 Cy3/Cy5 标记偏倚的双色设计。
随机化 (randomization)
把批次、位置、操作者等无关因素与研究分组解耦的安排顺序原则。
区组 (blocking)
把已知无关变异源限制在区组内部、令比较在区组内完成的设计手段。
伪重复 (pseudoreplication)
把同一生物学单位的多次测量当作独立样本参与推断的统计错误。

参考文献与延伸阅读

  1. Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 4)
  2. Schena M, Shalon D, Davis RW, Brown PO. 1995. Quantitative monitoring of gene expression patterns with a complementary DNA microarray. Science 270: 467–470.
  3. Van Gelder RN, von Zastrow ME, Yool A, Dement WC, Barchas JD, Eberwine JH. 1990. Amplified RNA synthesized from limited quantities of heterogeneous cDNA. Proceedings of the National Academy of Sciences USA 87: 1663–1667.
  4. Imbeaud S, Graudens E, Boulanger V, et al. 2005. Towards standardization of RNA quality assessment using user-independent classifiers of microcapillary electrophoresis traces. Nucleic Acids Research 33: e56.
  5. Brazma A, Hingamp P, Quackenbush J, et al. 2001. Minimum information about a microarray experiment (MIAME)—toward standards for microarray data. Nature Genetics 29: 365–371.
  6. Kerr MK, Churchill GA. 2001. Experimental design for gene expression microarrays. Biostatistics 2: 183–201.
  7. Churchill GA. 2002. Fundamentals of experimental design for cDNA microarrays. Nature Genetics 32 (Suppl): 490–495.
  8. Yang YH, Speed T. 2002. Design issues for cDNA microarray experiments. Nature Reviews Genetics 3: 579–588.
  9. Edgar R, Domrachev M, Lash AE. 2002. Gene Expression Omnibus: NCBI gene expression and hybridization array data repository. Nucleic Acids Research 30: 207–210.