上一节解决了「有谁」:数据库检索把肽段质量还原为蛋白质身份。但蛋白质组学的多数问题落在「有多少」上——药物处理后哪些蛋白增减、肿瘤与癌旁差在何处、两条信号通路谁的激活更强(Gibson & Muse, 2009)。定量因此是蛋白质组学从「清单」走向「机制」的关键一步;而它遇到的第一个障碍,不在样品,而在质谱测量本身的性质。
5.5.1 定量问题的特殊性
质谱对肽段的响应并无跨肽的一致性。肽段 i 在样品 s 中产生的信号(色谱峰面积)可以写作
由式 (5.5-1) 立刻得到两条纪律。其一,峰面积不可跨肽比较:蛋白 A 的肽段甲面积大于蛋白 B 的肽段乙,丝毫不能说明 A 更丰富——两者乘的是不同的 k。其二,同一肽段的面积可以跨样品比较,前提是两份样品中该肽的化学环境一致、仪器状态一致。第二条前提恰恰脆弱:两次独立进样之间存在电离波动、保留时间漂移与采样随机性(5.3 节的数据依赖采集还受「谁被选中碎裂」的随机性支配)。直接把两张谱图的峰面积相除,比值里混入了大量与样品无关的噪声。
稳定同位素标记的对策由此而来:用化学性质几乎完全相同的轻、重同位素(或总质量相同的同量异位试剂)分别标记两份样品,尽早混合、一次进样——「跨样品的比较」被内化为「同一次扫描内的比较」,ki 与仪器波动在比值中同时相消。无标记路线则放弃这一内化:让每份样品独立进样,以多次重复加统计校正来估计比值。两类策略的分野,全部源于式 (5.5-1) 中 ki 是否可比;经验法则也随之确立——样品混合得越早,后续操作引入的差异越少,定量越可靠(图 5.5-2)。
「绝对定量幻觉」。把峰面积当作浓度读数,是定量蛋白质组学最常见的误读。即便采用同位素比值,得到的也只是相对丰度:iTRAQ 全称中的 "absolute"(绝对)一词曾长期引起误解——没有已知量的标准物校准,任何流程都不输出摩尔浓度。真正的绝对定量需向样品掺入已知量的合成重标肽,以其峰面积建立校准(AQUA 策略,Gerber et al., 2003)。常规比较实验报告的「1.8 倍上调」是比值,不是浓度。
5.5.2 ICAT:同位素亲和标签的先行者
第一个规模化解决方案由 Gygi 等提出(Gygi et al., 1999)。同位素编码亲和标签(isotope-coded affinity tag, ICAT)由三个模块组成:与半胱氨酸(Cys)巯基特异性反应的基团(碘乙酰胺型)、可轻可重的同位素连接区(初版为氘代 D₀/D₈,相差 8 Da),以及生物素亲和标签。流程是:两份样品分别以轻、重试剂标记,混合并酶切后过亲和素柱——只有含 Cys 的肽段被「钓」住,洗脱后进入 LC-MS/MS。同一肽段的轻、重形式在一级谱中表现为相距 8 Da 的峰对,峰面积之比即两份样品的丰度比(图 5.5-1 底部左)。
ICAT 一举完成两件事:比较与简化。Cys 在氨基酸组成中仅占约 2%,只保留含 Cys 肽段使混合物复杂度约降一个数量级,缓解了 5.1 节所述的动态范围压力;代价同样明显——不含 Cys 的肽段(以及个别完全没有 Cys 的蛋白)被整体丢弃,序列覆盖与修饰信息随之损失;氘代标签在反相色谱中与轻标签保留时间略有错位,影响峰对的精确配对(后续版本将连接区改用 ¹²C/¹³C,使轻、重形式共洗出);且只有两重,通量有限。ICAT 的历史价值在于确立「同位素稀释 + 亲和富集」的范式,此后所有方法都可视为对它的改造。
ICAT 的首演(1999)。Gygi 等将 ICAT 应用于酵母裂解物这一真实的复杂混合物,对两份样品中的蛋白实现了规模化的同位素比值定量,证明「不跑凝胶、直接在酶切产物上比较丰度」的路线可行(Gygi et al., 1999)。它与同期酵母 mRNA–蛋白丰度的对照研究(5.1 节)出自同一课题组前后脚,共同把蛋白质组学推入定量时代。
5.5.3 iTRAQ 与 TMT:同量异位的报告离子
ICAT 只覆盖 Cys 肽、只能两重。同量异位标签(isobaric tag)家族——iTRAQ(isobaric tags for relative and absolute quantitation,Ross et al., 2004)与 串联质量标签(tandem mass tag, TMT)(Thompson et al., 2003)——把反应基团换成对胺特异的 NHS 酯:与每条肽段的 N 端 α-氨基和 Lys ε-氨基反应,覆盖几乎全部肽段。试剂同样三段式(报告基团 + 平衡基团 + 胺反应基团),但设计精髓在「同量异位」四字:各重试剂的报告基团质量不同(4 重为 m/z 114–117),平衡基团按差值精确补齐,整套试剂的总质量严格相同。
同量异位的后果深且实用。四份样品分别标记后等量混合,同一肽段的四种标记版本具有完全相同的 m/z,在一级谱中融合为同一个母离子峰、被一同选出碎裂——不分彼此。碎裂的一瞬间,标签断开:高质量区的 b/y 离子承担「鉴定」,低质量区则出现 114、115、116、117 四个报告离子(reporter ion),其峰面积之比就是四份样品的相对丰度(图 5.5-1)。定量与鉴定在同一次扫描中解耦完成、互不挤占——这与 ICAT/SILAC 在一级谱上读峰对形成鲜明对照,也使每份样品都不必为「分峰」付出灵敏度代价。
iTRAQ 后扩展至 8 重(113–119 与 121),TMT 常用 6 重(126–131),近年更高重数的 TMTpro 可达 16 重以上(原书出版于 2009 年,此为后续进展)。多重比较是实打实的通量红利:8 份样品一次运行同时比较,仪器时间摊薄到八分之一——代价是试剂昂贵,且共洗出的无关肽段会一并碎裂、污染报告离子,使实测比值向 1 收缩(比值压缩效应),需要更精细的色谱分离与母离子纯度阈值控制来缓解。
习题 5.5-1
某 iTRAQ 4 重实验中,一肽段的报告离子峰面积分别为:114(对照)4800、115(药物 A)12000、116(药物 B)2400、117(药物 C)7200。(1) 以对照为基准计算三种药物处理的相对丰度比;(2) 求各自的 log₂ 倍变(fold change);(3) 若改用「四通道总和归一化」(各通道除以总和 26400)后再取两两之比,结果会否改变?为什么?
参考解答(1) A : 对照 = 12000/4800 = 2.5;B : 对照 = 2400/4800 = 0.5;C : 对照 = 7200/4800 = 1.5。(2) log₂2.5 ≈ +1.32(上调);log₂0.5 = −1(下调 2 倍);log₂1.5 ≈ +0.58(轻度上调)。(3) 不会改变。总和归一化对每个通道乘的是同一常数因子 1/26400,任何两通道之比中该因子在分子分母同时出现而相消——归一化只改变数值的「标尺」,不改变比值本身;这正是式 (5.5-1) 中 ki 相消逻辑的又一次体现。
5.5.4 SILAC:把标签喂进细胞
化学标记无论多巧,混合总发生在裂解与酶切之后——此前的操作波动并未被抵消。细胞培养中氨基酸稳定同位素标记(stable isotope labeling by amino acids in cell culture, SILAC)(Ong et al., 2002)把标记时机推到最早:在培养基中直接以重同位素必需氨基酸(如 ¹³C₆-Lys、¹³C₆-Arg)替换天然「轻」氨基酸,细胞每分裂一代就把重氨基酸掺入新合成的蛋白,经约 5–6 代倍增后掺入率可超过 95%。这种代谢标记(metabolic labeling)使轻、重两群细胞「天生携带标签」:计数后按蛋白量等比混合、立即共同裂解——此后酶切、除盐、色谱、电离的一切波动都同步作用于两者,比值的重复间变异系数常低于约 10%,精度居各法之首。
选择 Lys 与 Arg 并非任意:胰蛋白酶恰在 K/R 的 C 端切割(5.4 节),于是除每条蛋白的 C 端肽外,每条肽段携带且仅携带一个重氨基酸——质量偏移恒定(¹³C₆ 约 +6.02 Da)、可预测,标记覆盖几乎全部肽段。标记完全性必须验证:掺入不足会把真实比值向 1 拉偏;精氨酸还会经精氨酸酶代谢转换为脯氨酸(Arg→Pro 转换),使含 Pro 肽段出现「多余的」重峰,须校正或规避(Bantscheff et al., 2007)。
SILAC 实验的三个检查点。其一,掺入率:对只培养于重培养基的细胞取肽段谱图估算未标记残基比例,通常要求高于 95% 方可开展比较。其二,Arg→Pro 转换:重精氨酸代谢生成的重脯氨酸会混入含 Pro 肽段的重峰;对策包括降低培养基精氨酸浓度、仅以 Lys 为标记氨基酸,或在计算中剔除含 Pro 肽段。其三,混合比例:按蛋白量而非体积等比混合;混合失准是一个全局乘性偏差,可用中位数归一化部分纠正(见 5.5.6 节)。
SILAC 的边界同样清晰:标签只能随代谢进入细胞,原则上只适用于可培养细胞,组织、血浆等临床样品无缘受益。为把代谢标记延伸到整体动物,可用 ¹⁵N 饲料或含重氨基酸的饮食饲养小鼠实现体内标记(SILAC 小鼠,Krüger et al., 2008),但成本与周期都高;一个实用折衷是把重标细胞系制成通用内标,与任意来源的样品混合比较,精度略降而适用面大增(原书出版于 2009 年,此为同期及后续发展)。
5.5.5 无标记定量:谱图计数与峰强度
标记并非必需。无标记定量(label-free quantitation)让每份样品独立进样,靠「同一肽段跨运行比较」重建丰度。第一条路线是谱图计数(spectral counting):数据依赖采集下,丰度越高的蛋白被碎裂的次数越多,其鉴定谱图条数近似正比于丰度。Liu 等证明谱图数与已知蛋白丰度在线性区间内相关系数约 0.9、跨越约两个数量级(Liu et al., 2004)。计数是整数、是抽样——其统计模型与 RNA-seq 的读段计数同型:泊松分布是起点,生物学重复间的过散(方差大于均值)逼出负二项分布(4.7 节的 RNA-seq 用的正是同一套模型)。谱图计数简单、稳健、零试剂成本,但动态范围有限——低丰度蛋白的计数在 0 与 1 之间无从分辨。
第二条路线是峰强度法:对每个肽段离子,在每次运行中提取其色谱峰面积——提取离子色谱图(extracted ion chromatogram, XIC)下的面积——再跨运行比较。困难在于「对齐」:两次运行的保留时间有漂移,m/z 有微差,必须先确认两个峰属于「同一个」肽段,比较才有意义;信号饱和、缺失检测与共洗出干扰还会制造缺失值与异常值。因此峰强度法依赖保留时间对齐算法、强度归一化与较重的统计后处理,精度上限通常低于同位素标记,但样本数完全不受标签重数限制。
| 方法 | 比较原理 | 一次可比样品数 | 相对精度 | 成本与通量 | 适用样本 |
|---|---|---|---|---|---|
| ICAT(1999) | 生物素亲和富集含 Cys 肽,MS¹ 轻/重同位素峰对面积比 | 2 | 较高 | 中;亲和富集简化复杂度 | 任意样品,但丢失无 Cys 肽段与蛋白 |
| iTRAQ / TMT | 同量异位标签,MS² 报告离子(114–117 等)面积比 | 4–8(TMT 更多) | 中–高(受共分离比值压缩影响) | 试剂昂贵;多重比较摊薄仪器时间 | 组织、细胞、体液等任意样品 |
| SILAC(2002) | 重氨基酸代谢掺入,MS¹ 轻/重峰对面积比 | 2–3 | 最高(重复间 CV 常低于约 10%) | 试剂廉价;需数代培养 | 仅限可培养细胞(体内标记可及动物) |
| 无标记·谱图计数 | 鉴定谱图条数近似正比于丰度 | 不限 | 半定量(动态范围有限) | 零标记成本,通量最高 | 大队列、任意样品 |
| 无标记·峰强度 | 提取离子色谱峰面积跨运行比较 | 不限 | 中(依赖对齐与归一化) | 零标记成本,通量最高 | 大队列、任意样品 |
习题 5.5-2
为下列四个研究任务各选一种最合适的定量策略,并各用一句话说明理由:(a) 两种可传代培养的细胞系,药物处理与对照,追求最高定量精度;(b) 手术切除的 4 例肿瘤与配对癌旁组织,希望在一次质谱运行内同时比较;(c) 100 例临床血浆样本的生物标志物初筛队列;(d) 研究对象是一个不含任何 Cys 残基的小蛋白。
参考解答(a) SILAC——培养细胞可在裂解前等比混合,操作波动全部同步相消,精度最高。(b) iTRAQ/TMT(4 重)——组织无法代谢标记,而报告离子设计恰使四份样品同次运行、同峰碎裂、直接成比。(c) 无标记(峰强度或谱图计数)——样品数远超任何标签重数,标记成本与通量都不允许,宁可依赖对齐与统计校正换取「样本数不限」。(d) 避开 ICAT(不含 Cys 的肽段被亲和步骤整体丢弃),选 iTRAQ/TMT、SILAC 或无标记——凡不依赖 Cys 反应性的方法均可。方法没有「最好」,只有与样本类型、比较结构与精度需求的匹配。
5.5.6 统计与报告:组学的共同收尾
无论哪条技术路线,定量结果的下游处理遵循同一套统计纪律。4.3 节的重复设计原则在此完全通用:生物学重复估计的是「总体」,技术重复估计的是「流程」——差异检验必须以生物学重复为单位;随机化与平衡分组用以抵抗批次效应,对 iTRAQ 这类把样品「绑定」在同一组通道内的多重设计,尤其要预先筹划通道分配(例如把配对的肿瘤与癌旁分入同一组标签,使比较不受组间运行差异污染)。
比值的分布需要变换。原始比值右偏、方差随强度改变;取对数后分布近似对称、方差趋于稳定——这一方差稳定变换(variance-stabilizing transformation)与微阵列的 log 变换同宗:
多重检验必须控制。一次实验要比较数千种蛋白,即做数千次检验——其中若干「显著」结果纯属运气;Benjamini–Hochberg 程序控制假发现率(FDR),阈值习惯取 0.05 或 0.01,做法与 4.4 节微阵列差异表达分析逐字相同。报告时同时给出效应量(log₂ 倍变)与检验统计量,「火山图」(横轴 log₂ 倍变、纵轴 −log₁₀ p 值)是呈现二者联合的标准图形;谱图计数数据则按计数分布(泊松/负二项)选择检验,与 RNA-seq 的分析惯例一致。
组学共同的方法论脊柱。把 4.4 节(微阵列)与本节(定量质谱)并排看,统计骨架完全同构:设计(重复、随机化、平衡)→ 归一化(扣除全局偏差)→ 变换(稳定方差)→ 检验(逐分子比较)→ 多重检验控制(FDR)→ 报告(效应量 + 检验统计量)。变化的只是测量平台与噪声模型:荧光强度、谱图计数、报告离子面积在不同尺度上服从不同分布。掌握这套流程一次,即可在转录组、蛋白质组乃至代谢组之间迁移。
最后,差异蛋白清单只是起点:它需要与 4.5 节的模式发现、5.6 节的相互作用网络分析衔接,才能从「谁变了」走向「哪条通路、哪个复合体变了」——这正是下一节的任务。
习题 5.5-3
谱图计数实验:蛋白 P 在野生型的 3 次生物学重复中分别获得 2、3、4 张鉴定谱图,在敲除其旁系基因后获得 12、10、14 张。(1) 计算两种条件的平均计数与计数比;(2) 有人直接把「3 对 12」代入泊松检验得到极显著的 p 值,这一做法有何不妥?(3) 给出正确的处理原则。
参考解答(1) 均值分别为 3 与 12,计数比 4(约相当于 +2 个 log₂ 单位)。(2) 泊松分布假设方差等于均值,而这里把生物学重复当作重复测量——生物学重复间的变异(过散)远大于泊松抽样噪声,直接检验会严重高估显著性。(3) 以生物学重复为统计单位,采用容许过散的模型(负二项分布或经验贝叶斯方法,与 RNA-seq 相同),再经 FDR 校正多重检验,并同时报告效应量(log₂ 计数比)与不确定性——而不是只报一个 p 值。
关键术语
- 响应因子 (response factor)
- 肽段单位摩尔量产生的质谱信号,由离子化与检测效率共同决定;因肽而异,跨肽可差数个数量级。
- 同位素编码亲和标签 (isotope-coded affinity tag, ICAT)
- 生物素亲和标签 + 轻/重同位素连接区 + Cys 巯基反应基团的三段式试剂;富集含 Cys 肽并实现两重比较。
- 同量异位标签 (isobaric tag)
- 各重总质量相同而报告基团质量不同的标记试剂(iTRAQ/TMT);标记肽段在 MS¹ 同峰,碎裂后按报告离子定比。
- 报告离子 (reporter ion)
- 同量异位标签碎裂后释放的低质量区特征离子(如 m/z 114–117),其峰面积之比即各样品相对丰度。
- 串联质量标签 (tandem mass tag, TMT)
- 与 iTRAQ 同理的胺反应同量异位试剂;常用 6 重,后续版本重数更高。
- 代谢标记 (metabolic labeling)
- 在培养(或饲养)过程中掺入重同位素氨基酸的标记方式;标签随生物合成进入蛋白,混合可早至裂解前。
- 细胞培养中氨基酸稳定同位素标记 (SILAC)
- 以 ¹³C₆-Lys/Arg 饲喂细胞的代谢标记;掺入完全后轻、重细胞等比混合,定量精度居各法之首。
- 谱图计数 (spectral counting)
- 以蛋白获得的 MS/MS 鉴定谱图条数近似其丰度的无标记方法;计数统计与 RNA-seq 读段同型。
- 提取离子色谱图 (extracted ion chromatogram, XIC)
- 按特定 m/z(窗口)从色谱-质谱数据中提取的信号-时间曲线,其峰面积用于无标记跨运行定量。
- 方差稳定变换 (variance-stabilizing transformation)
- 使方差不随强度改变的变换(如取对数);使比值分布对称、下游检验的假设近似成立。
- 比值压缩 (ratio compression)
- 共分离无关肽段污染报告离子信号,使 iTRAQ/TMT 实测比值向 1 收缩的现象。
参考文献与延伸阅读
- Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 5)
- Gygi SP, Rist B, Gerber SA, Turecek F, Gelb MH, Aebersold R. 1999. Quantitative analysis of complex protein mixtures using isotope-coded affinity tags. Nature Biotechnology 17: 994–999.
- Thompson A, Schäfer J, Kuhn K, et al. 2003. Tandem mass tags: a novel quantification strategy for comparative analysis of complex protein mixtures by MS/MS. Analytical Chemistry 75: 1895–1904.
- Ross PL, Huang YN, Marchese JN, et al. 2004. Multiplexed protein quantitation in Saccharomyces cerevisiae using amine-reactive isobaric tagging reagents. Molecular & Cellular Proteomics 3: 1154–1169.
- Ong SE, Blagoev B, Kratchmarova I, et al. 2002. Stable isotope labeling by amino acids in cell culture, SILAC, as a simple and accurate approach to expression proteomics. Molecular & Cellular Proteomics 1: 376–386.
- Liu H, Sadygov RG, Yates JR 3rd. 2004. A model for random sampling and estimation of relative protein abundance in shotgun proteomics. Analytical Chemistry 76: 4193–4201.
- Gerber SA, Rush J, Stemman O, Kirschner MW, Gygi SP. 2003. Absolute quantification of proteins and phosphoproteins from cell lysates by tandem MS. Proceedings of the National Academy of Sciences USA 100: 6940–6945.
- Bantscheff J, Schirle M, Sweetman G, Rick J, Kuster B. 2007. Quantitative mass spectrometry in proteomics: a critical review. Analytical and Bioanalytical Chemistry 389: 1017–1031.
- Krüger M, Moser M, Ussar S, et al. 2008. SILAC mouse for quantitative proteomics uncovers kindlin-3 as an essential factor for red blood cell function. Cell 134: 353–364.