第五章 · 5.6

5.6 蛋白质相互作用与生物网络

Protein Interactions and Biological Networks

本节摘要 蛋白质很少孤立执行功能:复合体、信号级联与骨架组装赋予其情境性。本节界定相互作用组的两种互作本体与方法分野,阐述酵母双杂交的转录重建原理、假阳性控制与全基因组筛查的教训,亲和纯化—质谱的串联纯化与统计过滤,以及蛋白质芯片、FRET 等方法谱系;继而以图论语言刻画网络的度分布、无标度与小世界性质,讨论鲁棒与脆弱并存、疾病模块与药物靶点含义,并预告第 6 章的多组学网络整合。

本章前五节依次解决了蛋白质组的「分离」(5.2 节)、「称重」(5.3 节)、「鉴定」(5.4 节)与「定量」(5.5 节)问题,得到的是一份按丰度排序的分子清单。但清单回答不了细胞如何工作:代谢酶组成多酶机器,信号沿激酶级联逐级传递,转录因子须与辅因子组装成复合体才能调控基因——蛋白质的功能几乎总在与其他分子的相互作用中实现。本节讨论如何系统地测量这些相互作用,得到相互作用组(interactome);再把成千上万对相互作用组织成生物网络(biological network),用图论的语言分析其结构规律与生物学含义(Gibson & Muse, 2009)。

5.6.1 相互作用组:概念、两种本体与方法分野

相互作用组指一个细胞(或生物体)在给定状态下全部蛋白质间相互作用的集合。它是蛋白质组的「关系层」:蛋白质组回答「有哪些蛋白、各有多少」,相互作用组回答「谁与谁结合、组成什么结构」。蛋白质执行的情境性至少体现在三种组织形式上:其一,稳定复合体——蛋白酶体、核糖体、剪接体、RNA 聚合酶全酶等「分子机器」,成员以化学计量关系长期共存;其二,瞬时调控性相互作用——激酶与底物、小 GTP 酶与效应器、适配分子间的接触,往往只持续毫秒到秒级,却决定信号的通断;其三,骨架组装——支架蛋白同时结合多个组分,把通路「锚」在特定的亚细胞位置上。同一蛋白可以同时身处多种情境,功能随情境改变。

由此引出一个容易被忽视的概念区分:「相互作用」一词其实混合了两种不同的本体。

定义

二元相互作用(binary interaction):两个蛋白质之间发生的直接物理接触,如 A 与 B 直接结合。复合体成员关系(co-complex association):两个蛋白质同属一个复合物,它们可能直接接触,也可能仅经由第三者间接相连。前者是「点」,后者是「集合的归属」;把复合体成员拆成两两组合,会得到大量从未真正接触过的「互作对」。两者不是同一物理量的两次测量,而是互作世界的两种本体,混用将导致网络分析中的系统性偏差。

这一本体论区分直接对应实验方法的分野。二元方法以酵母双杂交(5.6.2 节)、蛋白片段互补、体外结合实验为代表,直接回答「A 与 B 能否直接结合」;复合体方法以亲和纯化—质谱(5.6.3 节)、共沉降、密度梯度为代表,回答「谁与 A 同在一个复合物里」。前者像逐一询问「谁与谁握过手」,后者像清点「哪些人同处一室」。理解了这条分野,才能解释后文一个看似矛盾的经典观察:两类方法的实验结果交集很小,却各自可信。

5.6.2 酵母双杂交:以转录重建筛查二元相互作用

酵母双杂交(yeast two-hybrid, Y2H)由 Fields 与 Song 于 1989 年设计(Fields & Song, 1989),其巧妙之处在于把分子识别转化为可选择的细胞表型。酵母转录因子 GAL4 由两个功能独立的模块组成:DNA 结合域(binding domain, BD)识别报告基因上游的 UAS 序列,激活域(activation domain, AD)招募 RNA 聚合酶 II 及转录机器。两个模块被拆开后彼此并无亲和力,单独存在都不能激活转录。将待测蛋白 X(诱饵(bait))融合于 BD、蛋白 Y(猎物(prey))融合于 AD:若 X 与 Y 发生物理相互作用,AD 即被「拖」回启动子近旁,与 BD 重新拼合成功能完整的转录因子,下游报告基因表达(图 5.6-1)。常用报告基因包括 HIS3(组氨酸营养缺陷选择)、ADE2 与 lacZ(X-gal 蓝斑),使阳性克隆表现为「能在缺陷培养基上生长」或「菌落变蓝」。

A 原理:转录因子的拆分与重建(Fields & Song, 1989) UAS TATA 报告基因 HIS3 / lacZ BD 诱饵 Bait 猎物 Prey AD AD 招募 RNA 聚合酶 II 报告基因表达 缺陷培养基长菌落 / X-gal 蓝斑 读出的逻辑 互作 → BD 与 AD 重新拼合    → 报告基因表达 不互作 → AD 游离于启动子外     → 报告基因沉默 检测本体:核内条件下能够 直接结合的二元相互作用 GAL4 的 BD 与 AD 本无亲和力,互作对提供「桥」——分子识别由此转化为可选择、可计数的表型。 B 筛库流程与可靠性控制 1 构建 BD-诱饵 自激活预检:诱饵单独转入 报告菌株;若仍生长或变蓝, 须截短或更换构建 平行设 BD 空载体、已知互 作对等阳性和阴性对照 2 引入 AD-猎物文库 cDNA 文库或全基因组 ORF 阵列(克隆数可达 10 的 6 次 方量级),经酵母接合导入 同一菌株,两质粒共存 3 选择性培养基筛选 缺 His(可加 3-AT 抑制渗漏) 等条件下,只有互作对重建 转录因子的克隆得以生长 菌落 = 候选 互作对 4 测序与再验证 测序鉴定互作对;重新克隆 后独立再检;HIS3、ADE2、 lacZ 等多报告系统(不同启 动子)一致,重复筛查重现, 方列为高置信互作 可靠性工程而非单次读出 两次全基因组筛查(Uetz et al., 2000;Ito et al., 2001)的交集仅约 10–20% 量级——单一筛查远非穷尽,候选互作须分层评定置信度。
图 5.6-1 酵母双杂交的原理与筛库流程。A:GAL4 拆分为 BD(结合 UAS)与 AD(招募 RNA 聚合酶 II)两个模块;诱饵融合 BD、猎物融合 AD,二者发生物理相互作用时 AD 被拉回启动子近旁,报告基因表达,以缺陷培养基上的生长或 X-gal 蓝斑读出;不互作则报告基因沉默。B:从自激活预检、文库导入、选择性筛选到测序再验证的四步流程——多报告系统与重复筛查是控制假阳性的关键环节。

理解 Y2H 的误差结构,须分别审视假阳性与假阴性两端。假阳性的主要来源包括:(1)自主激活(auto-activation)——诱饵自身或猎物自带转录激活活性,无需真实互作即可点亮报告基因;(2)过表达强迫——文库中高表达的猎物浓度远超生理水平,低亲和力的非特异结合被放大为信号;(3)非核环境——酵母细胞核缺少原细胞中的翻译后修饰、亚细胞定位与伴侣系统,两个原本永不相遇的蛋白被强制「同居」于同一隔室。假阴性则源于:膜蛋白与分泌蛋白不能正确折叠入核;互作依赖特定修饰或辅因子而酵母无法提供;融合位点的位阻破坏了互作界面;信号强度低于报告系统的检出阈值。因此,现代 Y2H 流程包含一整套「可靠性工程」:诱饵先做自激活预检,阳性克隆经重新克隆后独立再检,采用不同启动子驱动的多报告系统(如 HIS3、ADE2、lacZ 组合)交叉确认,并以重复筛查的一致性作为纳入标准。

大规模应用的标志性事件是酵母全基因组双杂交筛查:Uetz 等(2000)以约 6 000 个开放读码框的猎物阵列为对象筛查并辅以文库筛选,报告约 1 000 对互作;Ito 等(2001)以「全对全」矩阵策略覆盖数千个读码框的两两组合,报告 4 549 对互作、涉及约 3 300 种蛋白。耐人寻味的是,两套数据的交集仅约 10–20% 量级(不同统计口径下有所浮动)。这一经典观察的教训是定性的:其一,任何单一筛查对互作空间的覆盖都远非穷尽,「未检出」不等于「不存在」;其二,阈值设定、文库深度与筛选条件的小差异即可显著改变结果集;其三,互作数据必须携带证据等级使用,而非视为非黑即白的清单。

警示

互作数据的信噪比。对早期大规模互作集的多方评估提示,假阳性比例可观(不同口径下可达两位数百分比;具体数值随数据集与判据而异)。使用 BioGRID、DIP、IntAct 等互作数据库时,应注意条目的证据层级:多方法独立命中、重复出现、与共表达及功能注释一致的互作方可作为高置信集合;单次筛查的孤证只能视为待验证假设。互作网络的许多拓扑异常(如异常多的 hub),部分正是未被清除的系统性假阳性所致。

5.6.3 亲和纯化—质谱:在近生理条件下捕获复合物

与双杂交「在酵母核内提问」相反,亲和纯化—质谱(affinity purification–mass spectrometry, AP-MS)选择「抓现行」:给目标蛋白(诱饵)带上纯化标签,在尽量温和、接近生理的条件下裂解细胞,用亲和柱把诱饵连同其结合伙伴一并拉下,洗脱物经 5.3 节的 LC-MS/MS 与 5.4 节的数据库检索鉴定,得到一份「谁与诱饵同在」的名单。经典方案是串联亲和纯化(tandem affinity purification, TAP)标签(Rigaut et al., 1999;Puig et al., 2001):蛋白 A—TEV 蛋白酶切位点—钙调素结合肽(CBP)三段串联。第一步以 IgG 介质结合蛋白 A,用 TEV 蛋白酶在近生理条件下酶切洗脱(避免变性剂);第二步以钙调素柱经 Ca2+ 依赖结合 CBP。两步正交的亲和反应把高丰度污染蛋白(热激蛋白、细胞骨架蛋白、代谢酶等「常客」)大幅稀释,而温和条件又保全了脆弱的复合物;代价则是流程长、得率低,极弱或瞬时的互作在两步之间已然丢失。

2002 年,Gavin 等(2002)与 Ho 等(2002)几乎同时用 TAP-MS 系统扫描芽殖酵母,分别鉴定出数百个蛋白复合物,给出了当时最大规模的「细胞机器」清单——AP-MS 从此成为复合体方法的主力。从诱饵—猎物名单到复合物模型还需要两步计算:先以统计过滤剔除污染,如 SAINT 一类方法用一系列对照纯化估计每对 bait–prey 的背景分布,从而给出置信得分(Choi et al., 2011 的思想);再对通过过滤的互作图做聚类或图分割,把共享成员的诱饵实验归并为连贯的复合物核心与附件模块。

AP-MS 与 Y2H 的关系提供了一个定量视角的互补性案例:两类数据集的交集很小,但各自内部的一致性与外部验证率都不低——二者并非一对一错,而是各自有效。Hart 等(2006)对此给出常被引用的定性解释:Y2H 倾向捕获瞬时、直接的调控性二元互作,AP-MS 倾向捕获稳定复合物的组成(且常含间接成员),两者覆盖的是互作空间中不同的生理子集;交集小主要反映覆盖面的错位与各自覆盖率不足,而非证据质量的互相否定。实践中的通行策略是以 AP-MS 定「复合物骨架」、以 Y2H 补「直接连线」,再以低通量实验抽检两端。

针对 AP-MS 对瞬时弱互作的盲区,方法谱系在 2009 年原书出版前后继续扩展。交联质谱(XL-MS)以可裂解交联剂把瞬时的接触「固定」下来,还能提供残基间距离约束辅助结构建模;邻近标记(proximity labeling)则以 BioID 为代表(2010 年代兴起):将突变生物素连接酶 BirA* 融合于诱饵,对其约 10 nm 范围内的蛋白共价添加生物素标签,再以链霉亲和素富集、质谱鉴定。邻近标记不要求结合持续到裂解那一刻,因而能捕捉弱、瞬时乃至「擦肩而过」的邻近关系,特别适合大分子集合体(如核孔、核纤层)与传统 AP-MS 难以处理的体系;其代价是读出为「邻近」而非「结合」,解释时须谨慎。(原书出版于 2009 年;BioID/APEX 等邻近标记方法为其后的发展,此处据以补充。)

习题 5.6-1

大规模数据显示:酵母双杂交与 AP-MS 各自报告的互作集合交集很小,但两个集合内部的重复一致性、以及与独立文献证据的符合率都不低。请解释:为什么「交集小」与「各自可信」可以并存?这一现象对使用互作数据库有何启示?

参考解答

两个方法检测的本体与条件不同。Y2H 在酵母核内以强制共表达检测「能够直接结合」的二元相互作用,偏向瞬时、直接的调控性接触;AP-MS 在近生理裂解条件下检测「确实同处一个复合物」的成员关系,偏向稳定结合,且天然包含经由第三者的间接联系(Hart et al., 2006)。因此两者覆盖互作空间的不同生理子集:交集小主要反映覆盖面错位与各自覆盖率不足,而非证据互相矛盾。对数据库使用的启示是:应按证据类型分层——以 AP-MS 结果构建复合物骨架、以 Y2H 结果标注直接连线,标注每条互作的证据来源与置信等级;对仅见于单一方法、且无重复或功能旁证的条目,只能作为待验证假设,不可直接当作「细胞内确实发生」的事实。

5.6.4 方法谱系:蛋白质芯片、FRET 与生物物理验证

蛋白质芯片(protein microarray)把微阵列思想移植到蛋白质层面,分两类。检测芯片以抗体或适配体为探针,点样后与血清等样品孵育,读出的是目标蛋白的丰度谱,是生物标志物筛选的常用工具;功能芯片点样的是重组蛋白,可在高度受控的条件下并行筛查互作伙伴、激酶底物谱与小分子结合。瓶颈同样明确:抗体的交叉反应决定检测芯片的特异性上限,而蛋白质固定于固相表面后可能失去折叠与活性——离开溶液环境的「互作」,须与细胞内证据互相印证。

活细胞内的动态互作主要依赖荧光方法。荧光共振能量转移(fluorescence resonance energy transfer, FRET)以一个荧光团为供体、另一个为受体,当两个融合蛋白彼此靠近至纳米级时,供体的激发能量以无辐射方式转移给受体;转移效率随距离急剧衰减,因而只有「贴身」的互作才能产生信号,且可在活细胞中随时间记录。双分子荧光互补(BiFC)则把荧光蛋白拆成两半分别融合待测蛋白,互作使两半重组成完整荧光蛋白——灵敏且直观,但互补后不可逆,可能把瞬态接触「锁」成稳定假象。

方法

FRET 的距离依赖。能量转移效率 E = 1 / (1 + (r/R0)6),其中 r 为供受体间距,R0(Förster 半径)约 4–7 nm,取决于荧光团与取向。E 对 r 的六次方反比极为敏感:有效检测窗口大致为 1–10 nm,恰与蛋白复合物的尺度匹配。这使 FRET 把「是否相互作用」转译为「纳米尺度的距离测量」;但也须记得,FRET 阳性证明的是「邻近」,不必然是直接结合——相距 8 nm 而经由第三者相连的两个融合蛋白同样可能产生信号。

在通量谱系的另一端是低通量、高分辨的生物物理方法:免疫共沉淀与共沉降(甘油梯度、密度梯度)给出「同上一样品」的中等证据;表面等离子共振(SPR)、等温滴定量热(ITC)可在体外测定结合亲和力(解离常数 KD)与动力学参数;X 射线晶体学与冷冻电镜则提供复合物的原子级结构,是互作证据链的顶端。于是方法体系构成一座金字塔:塔基是高通量、低单位可信度的筛查方法(Y2H、AP-MS、芯片),负责「发现」;塔尖是低通量、高可信度的验证与结构方法,负责「确证」。各层方法的定位对比见表 5.6-1。

表 5.6-1蛋白质相互作用检测方法对比
方法检测本体通量主要噪声与失真独到贡献
酵母双杂交(Y2H)直接二元互作(核内条件)高(基因组级)自主激活、过表达强迫、非核环境、膜蛋白假阴性不依赖复合物稳定存在,可筛全库,给出「直接」连线
亲和纯化—质谱(TAP/AP-MS)复合体成员(含间接)高(诱饵级)黏性污染蛋白、两步纯化丢失弱互作近生理条件,衔接质谱鉴定链,给出复合物组成
邻近标记(BioID 等)约 10 nm 邻近关系中—高读出为邻近而非结合,标记半径模糊捕获瞬时、弱互作与大分子集合体(2010 年代兴起)
蛋白质芯片体外二元结合 / 酶—底物抗体交叉反应、固相固定致失活条件高度可控,可并行筛小分子与底物谱
FRET / BiFC活细胞内纳米级邻近荧光标签干扰、BiFC 不可逆锁定活细胞动态与时空分辨
共沉降 / 免疫共沉淀复合体成员低—中裂解后重构假象、洗脱强度两难设备普及,常规验证的门槛方法
SPR / ITC / 结构生物学直接结合,定量 KD 至原子结构极低需纯化组分,脱离细胞语境定量亲和力、动力学与结构,证据链顶端

5.6.5 网络的图论描述:度分布、无标度与小世界

无论来自哪种方法,成千上万对相互作用最终都被组织成网络:以节点(node)表示蛋白质,以(edge)表示一对互作,得到图 G = (V, E)。最基本的节点属性是(degree) k——一个蛋白拥有的互作伙伴数;网络整体的连接结构由度分布(degree distribution) P(k) 刻画,即度为 k 的节点所占的比例。

两类参照模型界定了 P(k) 的可能形态。在随机图(Erdős–Rényi 模型)中,节点对之间以固定概率独立连边,度分布近似泊松分布:呈钟形,峰值位于平均度附近,度远超均值的节点概率按指数衰减——「典型节点」存在,且极端节点几乎不可能出现。而在酵母等物种的蛋白质互作网络中,实测度分布更好地服从幂律

P(k) ∝ k−γ, γ ≈ 2–3 (5.6-1) P(k):度为 k 的节点比例;γ:幂指数。γ 在 2 与 3 之间时,网络不存在特征尺度——均值与方差都不足以概括连接结构,大量节点仅有极少伙伴,而少数枢纽节点(hub)的连接数可比均值高出数倍到一个数量级。在 k 与 P(k) 的双对数坐标上,幂律呈一条直线,这是判别无标度性质的常用图示。

度分布服从幂律的网络称为无标度网络(scale-free network)。Barabási 与 Albert(1999)指出,这类结构可由两条简单规则生成——网络持续生长,且新节点倾向于连接已有大量连接的节点(优先连接(preferential attachment),「富者愈富」)。在生物语境中,一个简化的对应机制是基因重复与分化:重复产生的新蛋白继承母拷贝的互作伙伴,已拥有众多伙伴的蛋白也更易被新伙伴招募,hub 由此滚雪球式长大(定性简化模型,真实演化远为复杂)。

互作网络的第二个普遍性质是小世界性质(small-world property)(Watts & Strogatz, 1998):与同规模的随机图相比,网络同时具有更高的聚类系数(邻居之间也彼此相连,反映模块与复合物)与相差不大的短平均路径(任意两蛋白之间平均只需少数几步互作即可连通)。生物学含义直观:功能上互相关联的蛋白聚集成模块(大体对应复合物与通路),而模块之间经由少数「接头」快速连通,信号得以在几步之内从细胞膜传到细胞核。hub 内部还可区分:party hub 常驻于同一复合物、同时与多伙伴共存;date hub 则在不同时间或亚细胞位置与不同模块的伙伴分别结合——前者像机器的底盘,后者像轮换的总调度。

交互:悬停或点击任一节点,高亮其全部邻边与邻居;左右两网可对照比较节点的度。 随机网络:度彼此相近(泊松型) 节点 r1:度 2 节点 r2:度 4 节点 r3:度 3 节点 r4:度 3 节点 r5:度 3 节点 r6:度 4 节点 r7:度 4 节点 r8:度 4 节点 r9:度 4 节点 r10:度 2 节点 r11:度 3 节点 r12:度 2 最大度约 4,多数节点度 2–3——存在「典型连接数」 12345 泊松型度分布:钟形,峰值在平均度附近(横轴为度 k) 随机失效多落在外围节点——连通性大体保持(鲁棒) 无标度网络:少数 hub 连接多数节点(幂律型) hub(高度节点) 普通节点 节点 l1:度 1 节点 l2:度 1 节点 l3:度 2 节点 l4:度 2 节点 l5:度 1 节点 l6:度 1 节点 l7:度 1 节点 l8:度 3 节点 l10:度 1 节点 l11:度 1 节点 l12:度 1 节点 l13:度 1 枢纽 h1:度 9hub 枢纽 h2:度 5hub hub 的度可达外围节点的数倍以上,多数节点度仅为 1–2 log k log P(k) 幂律度分布:双对数坐标下近直线(P(k) ∝ k−γ,γ 约 2–3) 定向攻击 hub(叉号所示)——网络迅速碎片化(脆弱)
悬停任一节点可临时高亮其邻边与邻居;点击可固定选择,便于逐一比较不同节点的度。左网为随机连接的对照(12 节点、19 边),右网为无标度结构示意(15 节点、15 边,两个 hub 的度分别为 9 与 5)。
图 5.6-2 随机网络与无标度网络对照(交互)。:随机连接的网络度数彼此相近,度分布呈钟形(泊松型),存在「典型连接数」,随机移除少量节点后网络大体保持连通。:无标度网络的度分布服从幂律——大量度仅为 1–2 的外围节点与少数连接数极高的 hub 并存;对 hub 的定向攻击(叉号)会使网络迅速碎片化。悬停或点击任一节点可高亮其全部邻边与邻居,直观感受 hub 与外围节点连接数的悬殊差距。

酵母互作网络为无标度结构提供了最早的系统实证之一,也带来了一个著名的生物学发现。

案例

中心性与致死性(Jeong et al., 2001)。将芽殖酵母的基因删除数据叠加到互作网络上可见:蛋白的度越高,其编码基因属于必需基因(删除即致死)的比例越高——度最高的蛋白组中必需基因的比例,显著超过度最低的组。这一「中心性—致死性」相关是定性的统计趋势而非因果定律:并非「连接多所以必需」必然成立,且互作数据本身的研究偏倚(hub 更常被研究)也可能放大相关。但它与「hub 参与多条通路、扰动牵连面广」的直觉一致,为下节的鲁棒—脆弱二重性提供了酵母层面的注脚。

习题 5.6-2

某蛋白质互作网络含 500 个节点。统计发现:多数节点度仅 1–3,少数节点度超过 50;在度与度分布的双对数坐标上,数据点近似排成一条下降直线。请判断该网络属于随机图还是无标度网络,说明依据,并给出一种可能的生成机制。

参考解答

该网络是无标度网络。依据有二:其一,度分布极不均匀——「多数低度 + 少数极高度(hub)」的形态与随机图不符;随机图中每个节点以固定概率独立连边,度分布近似泊松(钟形),峰值在平均度附近,度超过均值数倍的节点概率按指数衰减,出现度超过 50 的 hub 几乎不可能。其二,双对数坐标下 P(k) 对 k 近似为直线,正是幂律 P(k) ∝ k−γ(式 5.6-1)的特征图示;随机图的度分布在双对数坐标下则明显下弯(指数截尾)。生成机制可用 Barabási–Albert 优先连接模型刻画:网络不断加入新节点,而新节点更倾向连接已有连接数多的旧节点(「富者愈富」),度分布遂收敛为幂律;在蛋白网络语境中,基因重复后新蛋白继承母拷贝的互作伙伴并被逐步招募,是与其对应的一种简化生物学机制。

5.6.6 网络的生物学与医药含义

无标度拓扑的第一个含义是对随机错误的鲁棒性。幂律分布意味着绝大多数节点处于外围:随机发生的突变或错误折叠砸中的大多是低度蛋白,其功能可由旁路或冗余补偿,网络整体的连通性几乎不受影响——这为细胞在持续损伤下的稳定表现提供了结构性解释。与之对偶的是对定向攻击的脆弱性:少数 hub 承担着不成比例的连接,按度从高到低移除节点,网络的平均路径长度骤增、模块间迅速失连,网络碎片化的速度远快于随机移除。鲁棒与脆弱是同一枚拓扑硬币的两面:它使细胞既耐受漫射的随机故障,又在关键节点失守时表现出剧烈表型。

这直接投射到药物研发的双刃逻辑上。hub 是诱人的靶点:抑制致病通路上的汇聚点,可能同时切断疾病的多个分支,效力可观;网络药理学「多靶点温和调制」的思路也常以模块与 hub 的分析为起点。但 hub 同时多为正常生理依赖的必需蛋白,抑制它极易波及无辜组织,毒性窗口狭窄——hub 靶点候选因此更依赖组织选择性、变构调控与剂量设计的精细权衡。附带的研究偏倚也值得警惕:hub 更受关注、注释更完整,以度排序的「靶点清单」部分反映了研究热度而非纯粹的生物学重要性。

网络视角同样重塑了疾病观。致病基因的产物并非在网络上随机散布,而倾向于聚集在同一功能邻域——同一疾病或相关表型的基因富集于相同的模块,构成「疾病模块」;不同疾病的模块可部分重叠,对应临床共病现象(Barabási & Oltvai, 2004)。由此得到一条实用的研究策略:对致病基因已知、新基因未明的疾病,可优先在网络邻域内搜索候选基因,再用实验验证——网络成为从「一个基因」走向「一组基因」的导航图。

最后应当指出,蛋白质互作网络只是细胞众多网络中的一张。基因调控网络(转录因子—靶基因)、代谢网络(酶—代谢物)、信号网络彼此交叠,蛋白质互作为它们提供了物质基础:转录因子须互作才能组装调控复合体,代谢酶常以多酶复合体形式接力底物。把多张网络整合起来、与第 4 章的表达数据和本章的蛋白质组数据互相校准,正是第 6 章「整合基因组学」的主题。届时,「相互作用组」将从一张静态快照,走向随时间、条件与扰动演化的动态系统模型。

习题 5.6-3

某致病信号通路的汇聚点蛋白 P 是一个度很高的 hub,同时也是一个在其他组织中广泛表达的必需基因产物。请从网络拓扑的角度讨论:以 P 为药物靶点各有什么收益与风险?可提出哪些降低风险的策略?

参考解答

收益:P 是多条下游分支的汇聚点(高中心性),抑制 P 可能一次切断疾病的多个分支,表型效应强、实验信号清晰;网络分析也便于由 P 出发定位整个疾病模块,发现协同靶点。风险:无标度网络对定向攻击 hub 高度脆弱——但这里的「脆弱」对药物是双刃剑:P 同时是正常组织依赖的必需蛋白,抑制 P 会令其参与的所有通路同时受累,产生广泛毒性;且 hub 的丧失会使网络碎片化,副作用往往不是「一处」而是「一片」。降低风险的策略包括:(1)靶向 P 与疾病特异性伙伴的互作界面(蛋白—蛋白互作抑制剂、肽类或变构调节剂),避免全盘抑制 P 的活性;(2)利用疾病组织中特异的表达或修饰状态(如肿瘤特异突变)获得选择性;(3)控制剂量窗口,以部分抑制取代完全敲除;(4)采用网络药理学思路,同时温和调制模块内多个低度节点,以组合达到疗效而把单点毒性控制在阈值之下。

关键术语

相互作用组 (interactome)
一个细胞或生物体在给定状态下全部蛋白质相互作用的集合,是蛋白质组的关系层。
二元相互作用 (binary interaction)
两个蛋白质之间的直接物理结合,区别于经由第三者相连的复合体成员关系。
酵母双杂交 (yeast two-hybrid, Y2H)
以 GAL4 的 BD/AD 拆分与重建为开关、以报告基因读出的二元互作高通量筛查方法。
自主激活 (auto-activation)
诱饵或猎物无需真实互作即激活报告基因的现象,是双杂交假阳性的首要来源。
亲和纯化—质谱 (affinity purification–mass spectrometry, AP-MS)
以标签诱饵拉下细胞内复合物并用质谱鉴定成员的复合体方法。
串联亲和纯化 (tandem affinity purification, TAP)
蛋白 A—TEV 位点—CBP 双重亲和标签的两步温和纯化方案,用以降低污染。
邻近标记 (proximity labeling)
以 BioID 等酶对诱饵约 10 nm 内的蛋白共价加标签再富集鉴定的策略。
(degree)
网络中一个节点拥有边的数目,即蛋白质的互作伙伴数。
度分布 (degree distribution)
度为 k 的节点所占比例 P(k),是刻画网络连接结构的基本统计量。
无标度网络 (scale-free network)
度分布服从幂律的网络:大量低度节点与少数 hub 并存,无特征尺度。
枢纽节点 (hub)
度远超网络均值的节点;其编码基因更常为必需基因,也是疾病与药物研究的焦点。
小世界性质 (small-world property)
高聚类系数与短平均路径并存的网络性质,对应模块化组织与快速连通。

参考文献与延伸阅读

  1. Gibson G, Muse SV. 2009. A Primer of Genome Science, 3rd ed. Sunderland (MA): Sinauer Associates. (Chapter 5)
  2. Fields S, Song O. 1989. A novel genetic system to detect protein–protein interactions. Nature 340: 245–246.
  3. Uetz P, Giot L, Cagney G, et al. 2000. A comprehensive analysis of protein–protein interactions in Saccharomyces cerevisiae. Nature 403: 623–627.
  4. Ito T, Chiba T, Ozawa R, Yoshida M, Hattori M, Sakaki Y. 2001. A comprehensive two-hybrid analysis to explore the yeast protein interactome. Proceedings of the National Academy of Sciences USA 98: 4569–4574.
  5. Rigaut G, Shevchenko A, Rutz B, Wilm M, Mann M, Séraphin B. 1999. A generic protein purification method for protein complex identification and characterization. Journal of Biological Chemistry 274: 21963–21966.
  6. Puig O, Caspary F, Rigaut G, et al. 2001. The tandem affinity purification (TAP) method: a general procedure of protein complex purification. Methods 24: 218–229.
  7. Gavin AC, Bösche M, Krause R, et al. 2002. Functional organization of the yeast proteome by systematic analysis of protein complexes. Nature 415: 141–147.
  8. Ho Y, Gruhler A, Heilbut A, et al. 2002. Systematic identification of protein complexes in Saccharomyces cerevisiae by mass spectrometry. Nature 415: 180–183.
  9. Hart GT, Ramani AK, Marcotte EM. 2006. How complete are current yeast and human protein-interaction networks? Genome Biology 7: 120.
  10. Watts DJ, Strogatz SH. 1998. Collective dynamics of 'small-world' networks. Nature 393: 440–442.
  11. Barabási AL, Albert R. 1999. Emergence of scaling in random networks. Science 286: 509–512.
  12. Jeong H, Mason SP, Barabási AL, Oltvai ZN. 2001. Lethality and centrality in protein networks. Nature 411: 41–42.
  13. Barabási AL, Oltvai ZN. 2004. Network biology: understanding the cell's functional organization. Nature Reviews Genetics 5: 101–113.