第 6 章 · 联合分布的随机变量

6.2 独立随机变量

Independent Random Variables
学习目标
  • 用分布函数、分布列、密度三种等价方式叙述两个随机变量相互独立的定义,并说明它与事件独立性(3.4 节)的联系;
  • 熟练运用支撑集判别法:由非矩形支撑迅速否定独立性,由矩形支撑上的可分离密度证明独立性;
  • 在联合分布表上逐格验证 \(p(x,y)=p_X(x)\,p_Y(y)\),并能解释单独一格不符意味着什么;
  • 说明独立性的传递性质:\(g(X)\) 与 \(h(Y)\) 独立、\(\min/\max\) 的概率公式;
  • 理解独立同分布(iid)样本的概念,说明它为何是统计推断的基石。

1. 独立性的定义

6.1 节的结论是:边缘分布由联合分布决定,但仅凭边缘一般无法还原联合——联合中"多出来"的信息,正是两个随机变量之间的相依结构。本节研究最重要的特殊情形:独立随机变量(independent random variables)。此时联合分布完全分解为边缘分布的乘积,"多出来的信息"为零。这个概念直接来源于 3.4 节事件的独立性:两个事件独立,指一个事件发生与否不改变另一事件的概率;两个随机变量独立,则要求这一性质对它们的一切取值事件同时成立。

定义 1 随机变量的独立性

设 \(X\)、\(Y\) 为随机变量,联合分布函数(joint distribution function)为 \(F(x,y)\),边缘分布函数(marginal distribution function)分别为 \(F_X\)、\(F_Y\)。若对一切实数 \(x,\,y\) 都有 \[ F(x,y)=F_X(x)\,F_Y(y), \] 则称 \(X\) 与 \(Y\) 相互独立(independent)。

按分布函数的定义,\(F(x,y)=P(X\le x,\;Y\le y)\),\(F_X(x)F_Y(y)=P(X\le x)\,P(Y\le y)\)。因此定义 1 就是说:事件 \(\{X\le x\}\) 与 \(\{Y\le y\}\) 对一切 \(x,y\) 独立——\(X\) 落在何处这一"观测事实",丝毫不改变 \(Y\) 的概率规律。

实际验证时,几乎从不直接使用分布函数。下述定理把独立性翻译成分布列或密度的"逐点乘积"形式,这才是日常工作中的判别工具。

定理 1 独立性的等价刻画

下列条件等价:

(1) \(X\) 与 \(Y\) 独立:\(F(x,y)=F_X(x)F_Y(y)\) 对一切 \(x,y\) 成立;

(2) 对任意区间 \(A,\,B\):\(P(X\in A,\;Y\in B)=P(X\in A)\,P(Y\in B)\);

(3) 离散型:对一切 \(x,\,y\),\(p(x,y)=p_X(x)\,p_Y(y)\);连续型:在密度的连续点处,\(f(x,y)=f_X(x)\,f_Y(y)\)。

证明(2)⇒(1):取 \(A=(-\infty,x]\)、\(B=(-\infty,y]\) 即得。(1)⇒(3):离散型对 \(\{X\le x\}\) 型事件作差分,\(p(x,y)=F(x,y)-F(x^-,y)-F(x,y^-)+F(x^-,y^-)\),把乘积分解代入并对 \(F_X\)、\(F_Y\) 作同样的差分,即得 \(p(x,y)=p_X(x)p_Y(y)\);连续型在密度连续点对 \(F\) 求混合偏导 \(\partial^2F/\partial x\,\partial y\),右边分解为 \(f_X(x)f_Y(y)\)。(3)⇒(2):对格点求和或对区域积分即得。证毕。

2. 连续型判别:支撑与可分离性

回忆 6.1 节支撑集(support)概念:使密度 \(f(x,y)>0\) 的点集。对连续型随机变量,判定独立与否有一条极其高效的"看图"路线:先看支撑的形状,再看密度能否分离变量

定理 2 快速判别法(支撑 + 可分离性)

设 \((X,Y)\) 为连续型,密度为 \(f\),支撑集为 \(S=\{(x,y):f(x,y)>0\}\)。

(i) 若 \(X\) 与 \(Y\) 独立,则 \(S\) 必为直积(矩形)形式:存在数集 \(A\)、\(B\) 使 \(S=A\times B\)。等价的逆否命题:支撑不是矩形(如三角形、圆盘、L 形),则 \(X\)、\(Y\) 必不独立

(ii) 反之,若 \(S=A\times B\) 为矩形,且在 \(S\) 上密度可分离(separable / factorizable):\(f(x,y)=g(x)\,h(y)\),则 \(X\) 与 \(Y\) 独立,且边缘密度与 \(g\)、\(h\) 成比例:\(f_X(x)=g(x)\big/\int_A g\),\(f_Y(y)=h(y)\big/\int_B h\)。

证明(i):设独立,则 \(f(x,y)=f_X(x)f_Y(y)\)。记 \(A=\{x:f_X(x)>0\}\)、\(B=\{y:f_Y(y)>0\}\)。乘积在 \(A\times B\) 上恒为正,在其余各处为零,故 \(S=A\times B\)(严格论证需考虑零测集,此处按直观支撑集叙述)。三角形、圆盘等形状显然无法写成两集合的直积,故必不独立。

(ii):记 \(c_X=\int_A g(x)\,dx\),\(c_Y=\int_B h(y)\,dy\)。由规范性 \(1=\iint f=c_Xc_Y\)。于是 \(f_X(x)=\int_B g(x)h(y)\,dy=g(x)c_Y\)(\(x\in A\)),同理 \(f_Y(y)=h(y)c_X\),从而 \(f_X(x)f_Y(y)=g(x)h(y)\,c_Xc_Y=g(x)h(y)=f(x,y)\)。由定理 1(3),\(X\) 与 \(Y\) 独立。证毕。

注意两个方向合起来的含义:矩形支撑只是必要条件,并非充分。例如 \(f(x,y)=x+y\)(\(0<x,y<1\)),支撑是整个单位正方形,但 \(f_X(x)f_Y(y)=(x+\tfrac12)(y+\tfrac12)\not\equiv x+y\)(在 \((0,0)\) 处左边为 \(\tfrac14\),右边为 \(0\)),密度不可分离,仍不独立。"先看形状、再看分离"两步都要走完。

例 1 可分离密度:\(f(x,y)=e^{-(x+y)}\)

设 \(X\)、\(Y\) 的联合密度为 \(f(x,y)=e^{-(x+y)}\),\(x>0,\;y>0\)(即 6.1 节例 2 中的密度)。判断 \(X\) 与 \(Y\) 是否独立。

支撑为 \(S=(0,\infty)\times(0,\infty)\),是矩形;且密度可分离: \[ f(x,y)=e^{-x}\cdot e^{-y}=g(x)\,h(y),\qquad g(x)=e^{-x},\;h(y)=e^{-y}. \] 由定理 2(ii),\(X\) 与 \(Y\) 独立。顺带重得 6.1 例 2 的边缘:\(\int_0^\infty e^{-y}\,dy=1\),故 \(f_X(x)=e^{-x}\)、\(f_Y(y)=e^{-y}\),即 \(X\)、\(Y\) 独立且同服从指数分布 \(\mathrm{Exp}(1)\)。验证:\(f_X(x)f_Y(y)=e^{-x}e^{-y}=f(x,y)\),与定理 1(3) 一致。同理,6.1 节例 3 的 \(f(x,y)=4xy=(2x)(2y)\)(\(0<x,y<1\))也可分离,故独立(见图 1(a))。
例 2 三角域上的均匀分布必不独立

设 \((X,Y)\) 在三角形区域 \(D=\{(x,y):0<y<x<1\}\) 上均匀分布,密度 \(f(x,y)=2\)(6.1 节例 4)。判断 \(X\) 与 \(Y\) 是否独立。

支撑为三角形,不是任何直积 \(A\times B\)——例如 \((0.9,\,0.1)\in D\) 而 \((0.1,\,0.9)\notin D\),若支撑是矩形,两者应同时属于。由定理 2(i) 的逆否命题,\(X\) 与 \(Y\) 不独立。也可直接核验:6.1 节已算得 \(f_X(x)=2x\)、\(f_Y(y)=2(1-y)\)(\(0<x,y<1\)),于是 \[ f_X(x)\,f_Y(y)=4x(1-y), \] 在 \(D\) 上它不恒等于 \(2\)(如 \(x=y=\tfrac12\) 时为 \(1\ne 2\)),故由定理 1(3) 不独立。一般规律:非矩形区域上的均匀分布永不独立——均匀虽无"密度牵制",支撑本身已构成牵制。
(a) 矩形支撑 ⇒ 独立 (b) 三角支撑 ⇒ 不独立 (c) 圆盘支撑 ⇒ 不独立 0 1 1 x y f = (2x)(2y) = 4xy 可分离 等高线由外至内: 0.2, 0.4, 0.6, 0.8 0 1 1 x y y = x f = 2 0 < y < x < 1 上 f = 2 支撑非矩形 ⇒ 必不独立 −1 1 1 −1 x y f = 1/π 单位圆盘上均匀, f = 1/π 方形四角越出支撑 ⇒ 不独立
图 1:独立与不独立的几何对比。(a) 支撑为整个单位正方形且密度可分离 \(f(x,y)=4xy=(2x)(2y)\),等高线 \(xy=\) 常数为双曲线,\(X\) 与 \(Y\) 独立;(b) 三角形支撑 \(0<y<x<1\):点 \((0.9,0.1)\) 在支撑内而交换坐标后越出支撑,必不独立;(c) 单位圆盘上的均匀分布同理,虚线方形的四个角均落在支撑之外。
注记 为什么"看支撑"有效

独立性要求联合规律等于两个一维规律的乘积。一维规律各自的"活动范围"是 \(A\) 与 \(B\),两者相乘只能得到矩形 \(A\times B\)。三角形、圆盘这类区域边界互相牵制——例如在 \(0<y<x<1\) 上,知道 \(X\) 接近 \(0\) 就迫使 \(Y\) 也接近 \(0\)——这种牵制本身就是相依。因此支撑非矩形是一票否决;而矩形支撑(如本节的 \(e^{-(x+y)}\)、\(4xy\))只需再检查密度是否可分离即可。

3. 离散型判别:联合表逐格验证

离散情形没有"支撑形状"的几何直观可借力,判别法就是定理 1(3) 的字面执行:在联合分布表上,每一个格子都必须等于对应边缘的乘积;只要有一格不符,独立性即被否定。

例 3 联合表的逐格检验

某车险数据库中,记 \(X\) 为保单持有人是否为新手驾驶员(\(0\)=熟练,\(1\)=新手),\(Y\) 为其过去一年内的索赔次数(\(0,1,2\) 次),联合分布列如表 1。问:\(X\) 与 \(Y\) 是否独立?

先求边缘(表 1 的最右列与最下行):\(p_X(0)=0.70\),\(p_X(1)=0.30\);\(p_Y(0)=0.60\),\(p_Y(1)=0.30\),\(p_Y(2)=0.10\)。检验第一个格子: \[ p_X(0)\,p_Y(0)=0.70\times 0.60=0.42\;\ne\;0.50=p(0,0). \] 一格不符,即已否定独立性。逐格对照见表 2:六个格子的联合概率与边缘乘积无一相等(差异最大处达 \(0.08\)),\(X\) 与 \(Y\) 显著不独立。其含义清晰可读: \[ P(Y\ge 1\mid X=1)=\frac{0.15+0.05}{0.30}=\frac23,\qquad P(Y\ge 1\mid X=0)=\frac{0.15+0.05}{0.70}=\frac27, \] 即新手驾驶员发生索赔的可能性约为熟练驾驶员的 \(2.3\) 倍——"驾驶经验"的信息恰恰藏在联合分布与边缘乘积的偏差之中(条件分布的系统方法见 6.4 节)。
表 1:\(X\)(是否新手)与 \(Y\)(年索赔次数)的联合分布表
\(X\backslash Y\)\(Y=0\)\(Y=1\)\(Y=2\)\(p_X(x)\)
\(X=0\)0.500.150.050.70
\(X=1\)0.100.150.050.30
\(p_Y(y)\)0.600.300.101.00
表 2:边缘乘积 \(p_X(x)\,p_Y(y)\) 对照表(独立时应与表 1 逐格相同)
\(X\backslash Y\)\(Y=0\)\(Y=1\)\(Y=2\)
\(X=0\)0.420.210.07
\(X=1\)0.180.090.03
注记 边缘相同,联合可以不同

把表 1 的九个边际数字抄下来:表 1 与表 2 的边缘分布完全相同,但二者的联合结构不同——表 2 是独立的,表 1 不是。这就为 6.1 节"边缘不能决定联合"的论断提供了一个具体的数字实例:联合表比边缘多出的信息,正是变量间的相依结构;独立性假设是否成立,必须诉诸数据或机理,而不能从边缘"看"出来。

4. 独立性的性质与 iid 样本

独立性一旦成立,就可以"批量生产":对独立变量各自施加变换,得到的仍是独立变量。这条性质使用频率极高。

定理 3 独立性对函数变换保持

设 \(X\) 与 \(Y\) 独立,\(g\)、\(h\) 为两个(取值良好的)一元函数,则 \(g(X)\) 与 \(h(Y)\) 也独立。

证明对任意集合 \(A\)、\(B\),事件 \(\{g(X)\in A\}=\{X\in g^{-1}(A)\}\> 只依赖 \(X\),同理 \(\{h(Y)\in B\}\) 只依赖 \(Y\)。由定理 1 中 (1) 与 (2) 的等价性(独立性意味着一切"只看 \(X\)"的事件与一切"只看 \(Y\)"的事件独立),得 \[ P\big(g(X)\in A,\;h(Y)\in B\big)=P\big(g(X)\in A\big)\,P\big(h(Y)\in B\big), \] 故 \(g(X)\) 与 \(h(Y)\) 独立。证毕。

例如:\(X^2\) 与 \(|Y|\)、\(e^X\) 与 \(Y^3\) 都各自独立。一个重要应用是极值:由 \(\{\min(X,Y)>t\}=\{X>t\}\cap\{Y>t\}\) 与 \(\{\max(X,Y)\le t\}=\{X\le t\}\cap\{Y\le t\}\),独立性立即给出 \[ P\big(\min(X,Y)>t\big)=\big(1-F_X(t)\big)\big(1-F_Y(t)\big),\qquad P\big(\max(X,Y)\le t\big)=F_X(t)\,F_Y(t), \] 这正是 6.6 节顺序统计量理论的出发点。独立的另一个常用推论——独立蕴含协方差为零(从而期望可乘)——将在练习 3 中证明,并在 7.3 节系统展开。

定义 2 \(n\) 个随机变量的独立;iid 样本

称 \(X_1,\dots,X_n\) 相互独立,若其联合分布函数等于各边缘分布函数之积: \[ F(x_1,\dots,x_n)=F_{X_1}(x_1)\cdots F_{X_n}(x_n)\quad\text{对一切 }x_1,\dots,x_n. \] 若 \(X_1,\dots,X_n\) 相互独立且服从同一分布 \(F\),则称它们是来自 \(F\) 的独立同分布样本(independent and identically distributed sample, 简记 iid 样本),记作 \(X_1,\dots,X_n\;\overset{\text{iid}}{\sim}\;F\)。

定义 1 是 \(n=2\) 的特例;可以证明,\(n\) 个变量相互独立蕴含其中任意子组(从而任意"分组各自的函数")相互独立。

iid 样本是统计学的基石。重复试验、简单随机抽样的理想化模型正是"同一个分布 \(F\) 的独立重复观测":\(n\) 次独立重复伯努利试验的指示变量 \(1_1,\dots,1_n\) 是 iid 的 \(\mathrm{B}(1,p)\),由此产生第 4 章的二项分布;第 8 章大数定律研究的是 iid 样本均值 \(\frac1n\sum_{i=1}^n X_i\) 的稳定行为——"频率趋于概率"的全部合法性都建立在观测的独立同分布之上。图 2 给出 iid 样本的两个直观形象。

(a) 一维 iid 样本:同一分布的独立观测 f(x) = exp(−x) 0 1 2 3 4 1 x y n = 18 个独立观测,密集于密度高处 (b) iid 观测对 (Xi, Yi) 的散点 x+y=1 x+y=2 x+y=3 1 2 3 0 1 2 3 x y 散点仅在原点附近更密集 虚线: 密度等高线 x+y = 1, 2, 3
图 2:iid 样本的两张面孔。(a) 来自同一分布 \(\mathrm{Exp}(1)\) 的 \(n=18\) 次独立观测:观测值密集成堆之处正是密度高处;(b) \(40\) 个 iid 观测对 \((X_i,Y_i)\)(\(X_i,Y_i\) 独立同 \(\mathrm{Exp}(1)\),联合密度 \(e^{-x}e^{-y}\))的散点:点的疏密只随乘积密度的等高线(虚线 \(x+y=\) 常数)变化,不呈现任何结构性牵制——这正是独立性的"无结构"特征。
注记 两个常见误区

其一,"独立"与"不相关"不是一回事:独立必蕴含协方差为零(练习 3,详见 7.3 节),反之不然——练习 2 的圆盘均匀分布中 \(X\)、\(Y\) 不独立,但由对称性 \(\mathrm{Cov}(X,Y)=0\)。其二,独立性是"全或无"的判定:联合与边缘乘积必须逐点(逐格)相等,任何一处不符即可否定(例 3 只用了一个格子);而要证明独立,则必须对一切 \((x,y)\) 建立等式,此时定理 2 的可分离性是最顺手的路径。

5. 本节小结

要点回顾
  • 定义:\(X\)、\(Y\) 独立 \(\iff\) 对一切 \(x,y\),\(F(x,y)=F_X(x)F_Y(y)\);等价于联合分布列(密度)逐点等于边缘乘积 \(p=p_Xp_Y\)(\(f=f_Xf_Y\))。
  • 快速判别:支撑非矩形(三角形、圆盘等)⇒ 必不独立;矩形支撑上密度可分离 \(f=g(x)h(y)\) ⇒ 独立(此时边缘与 \(g\)、\(h\) 成比例)。离散情形在联合表上逐格验证。
  • 性质:独立变量的函数 \(g(X)\) 与 \(h(Y)\) 仍独立;\(\min/\max\) 的概率公式是 6.6 节顺序统计量的起点。
  • iid 样本:独立且同分布的 \(X_1,\dots,X_n\) 是重复试验的理想模型,统计推断与大数定律的基石。
  • 伏笔:独立 ⇒ \(\mathrm{Cov}(X,Y)=0\),反之不然(本节练习 2、3,系统讨论见 7.3 节)。

练习

练习 6-2-1

设 \(f(x,y)=c\,e^{-2x-3y}\)(\(x>0,\;y>0\))。求常数 \(c\),判断 \(X\) 与 \(Y\) 是否独立;若独立,写出两个边缘密度。

答案与提示

规范性 \(1=c\int_0^\infty e^{-2x}dx\int_0^\infty e^{-3y}dy=c\cdot\frac12\cdot\frac13=\frac c6\),故 \(c=6\)。支撑是矩形 \((0,\infty)^2\) 且密度可分离 \(6\,e^{-2x}\,e^{-3y}\),由定理 2 独立;边缘 \(f_X(x)=2e^{-2x}\)(\(\mathrm{Exp}(2)\)),\(f_Y(y)=3e^{-3y}\)(\(\mathrm{Exp}(3)\)),乘积恰为 \(6e^{-2x-3y}=f\)。

练习 6-2-2

设 \((X,Y)\) 在单位圆盘 \(D=\{(x,y):x^2+y^2\le 1\}\) 上均匀分布。证明 \(X\) 与 \(Y\) 不独立,并说明尽管如此仍有 \(E[XY]=E[X]E[Y]=0\)。

答案与提示

支撑为圆盘,非矩形,由定理 2(i) 必不独立。也可计算:\(f_X(x)=\frac1\pi\cdot 2\sqrt{1-x^2}=\frac2\pi\sqrt{1-x^2}\)(\(|x|<1\)),若独立则应有 \(f_X(0)f_Y(0)=\frac4{\pi^2}\) 等于 \(f(0,0)=\frac1\pi\),矛盾。而 \((X,Y)\) 与 \((X,-Y)\) 同分布(对称性),故 \(E[XY]=-E[XY]\),即 \(E[XY]=0=E[X]E[Y]\):不相关却不独立,为 7.3 节的反例。

练习 6-2-3

设 \(X\)、\(Y\) 独立且二阶矩有限。证明 \(\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y]=0\)。(连续型写出把二重积分拆成两个一重积分之积的过程;离散型将双重求和拆开。)

答案与提示

以连续型为例,\(f=f_Xf_Y\) 使积分可分离变量:\[ E[XY]=\iint xy\,f_X(x)f_Y(y)\,dx\,dy=\Big(\int x f_X(x)\,dx\Big)\Big(\int y f_Y(y)\,dy\Big)=E[X]\,E[Y], \] 故协方差为零。注意逆命题不成立(练习 2);反之由 \(\mathrm{Cov}=0\) 只能得出"线性无关",推不出密度可分离。

练习 6-2-4

设 \(X\)、\(Y\) 独立,分布函数分别为 \(F_X\)、\(F_Y\)。证明 \(P(\min(X,Y)>t)=(1-F_X(t))(1-F_Y(t))\),\(P(\max(X,Y)\le t)=F_X(t)F_Y(t)\)。

答案与提示

\(\{\min>t\}=\{X>t\}\cap\{Y>t\}\),\(\{\max\le t\}=\{X\le t\}\cap\{Y\le t\}\);由独立性(定理 1(2))交的概率等于概率之积,即得两式。这是 6.6 节顺序统计量(最小值、最大值分布)的出发点。