第 6 章 · 联合分布的随机变量

6.1 联合分布函数

Joint Distribution Functions
学习目标
  • 写出联合分布函数 \(F(x,y)=P(X\le x,\,Y\le y)\) 的定义,并用矩形公式计算 \(P(a<X\le b,\ c<Y\le d)\);
  • 由联合分布列(离散)或联合密度(连续)求指定事件的概率:正确求和、正确画域定限;
  • 由联合分布求边缘分布(对某个变量求和或积分),并说明"边缘由联合决定,反之不可";
  • 说明支撑集与二维均匀分布的含义,会在给定区域上写出均匀密度并计算概率;
  • 通过反例辨析"边缘分布相同而联合分布不同",为 6.2 节的独立性概念做好铺垫。

1. 从一维到二维:联合分布函数

第 4、5 章一次只研究一个随机变量:分布列与分布函数刻画单个 \(X\) 的取值规律(4.1 节),密度函数刻画连续型 \(X\) 落入区间的概率(5.1 节)。然而现实问题常常需要同时用多个数值来描述一次随机试验:一名新生儿的体重与身高、一台系统两条支路的寿命、一场保险事故中索赔次数与索赔总额。要回答"\(|X-Y|\) 超过 1 的概率是多少"这类问题,仅知道 \(X\) 与 \(Y\) 各自的分布是不够的——我们还必须知道二者如何联动。本章把概率"装载"到随机向量(random vector) \((X,Y)\) 上,研究其联合分布(joint distribution)。作为开篇,本节先建立最一般的刻画工具:联合分布函数、联合分布列与联合密度,并引出边缘分布与支撑集两个基本概念。

定义 1 联合分布函数

设 \(X\) 与 \(Y\) 是定义在同一样本空间上的两个随机变量。对任意实数 \(x,y\),称二元函数 \[ F(x,y) \;=\; P(X\le x,\; Y\le y) \] 为 \((X,Y)\) 的联合分布函数(joint distribution function),简称联合 CDF。

直观上,\(F(x,y)\) 是随机点 \((X,Y)\) 落入以 \((x,y)\) 为右上角、向左下方无限延伸的无穷矩形区域内的概率;一维分布函数 \(F(x)=P(X\le x)\)(4.1 节)是其退化情形。与一维类似,联合 CDF 具有如下基本性质:对每个变元单调不减、右连续;\(F(x,-\infty)=F(-\infty,y)=0\);\(F(+\infty,+\infty)=1\)。此外,在联合 CDF 中令 \(y\to+\infty\)(事件 \(\{Y\le y\}\) 单调扩大趋于全空间),即得 \(X\) 自身的分布函数 \(F_X(x)=P(X\le x)\)——这预示了本节稍后"边缘分布"的概念。

联合 CDF 对任意二维事件的计算并不方便,真正常用的是下面这个"挖矩形"公式,它是把平面事件拆成四个角点函数值的关键工具。

定理 1 矩形公式

若 \(a<b\),\(c<d\),则 \[ P(a<X\le b,\; c<Y\le d) \;=\; F(b,d)-F(a,d)-F(b,c)+F(a,c). \]

证明记 \(A=\{X\le b, Y\le d\}\),\(B=\{X\le a, Y\le d\}\),\(C=\{X\le b, Y\le c\}\),则 \(B\subset A\),\(C\subset A\),且 \(B\cap C=\{X\le a,\,Y\le c\}\)。所求事件恰为 \(A\) 中同时挖去 \(B\) 与 \(C\) 后剩下的部分:\(B\) 与 \(C\) 的公共部分被挖去了两次,应补回一次(2.3 节的容斥原理)。于是 \[ P(a<X\le b,\,c<Y\le d)=P(A)-P(B)-P(C)+P(B\cap C), \] 即所证。顺便指出:左端非负,故右端对任意 \(a<b,\ c<d\) 必须 \(\ge 0\)——这是联合 CDF 特有的"二维单调性"约束,也是判断一个二元函数能否充当联合 CDF 的必要条件。

2. 离散情形:联合分布列与边缘分布列

若 \((X,Y)\) 只取有限多或可数多对值,则称其为离散随机向量。此时最自然的刻画工具是把概率直接挂在每个格点上。

定义 2 联合分布列

称 \[ p(x,y) \;=\; P(X=x,\; Y=y) \] 为 \((X,Y)\) 的联合分布列(joint probability mass function,联合 pmf)。它满足 \(p(x,y)\ge 0\) 且 \(\displaystyle\sum_x\sum_y p(x,y)=1\);对任意 \(A\subset\mathbb{R}^2\), \[ P\bigl((X,Y)\in A\bigr) \;=\; \sum_{(x,y)\in A} p(x,y). \]

定义 3 边缘分布列

由联合分布列对某个变量求和,得 \[ p_X(x) \;=\; \sum_y p(x,y), \qquad p_Y(y) \;=\; \sum_x p(x,y), \] 分别称为 \(X\) 与 \(Y\) 的边缘分布列(marginal probability mass function)。

"边缘"(marginal)一词源于传统记法:把联合概率排成矩阵,行和与列和写在表格的边缘(margin)上——这正是定义中求和的几何含义。

例 1 掷三枚硬币:联合表与边缘

将一枚均匀硬币独立地掷 3 次。以 \(X\) 记正面总数,\(Y\) 记反面总数。写出 \((X,Y)\) 的联合分布列与两个边缘分布列。

样本空间含 \(2^3=8\) 个等可能结果。由于每次投掷要么正要么反,恒有 \(X+Y=3\),因此联合分布列的非零格点只能落在反对角线 \(x+y=3\) 上:例如 \(P(X=1,Y=2)=\binom{3}{1}/8=3/8\)(三个位置中恰一个正面),而 \(P(X=1,Y=1)=0\)(与 \(1+1\ne 3\) 矛盾)。全部结果见表 1。
表 1:\(X\)(正面数)与 \(Y\)(反面数)的联合分布列与边缘分布列
\(p(x,y)\)\(x=0\)\(x=1\)\(x=2\)\(x=3\)边缘 \(p_Y\)
\(y=3\)\(1/8\)000\(1/8\)
\(y=2\)0\(3/8\)00\(3/8\)
\(y=1\)00\(3/8\)0\(3/8\)
\(y=0\)000\(1/8\)\(1/8\)
边缘 \(p_X\)\(1/8\)\(3/8\)\(3/8\)\(1/8\)\(1\)

边缘分布列由行和、列和得到:\(p_X(0)=p_X(3)=1/8\),\(p_X(1)=p_X(2)=3/8\),\(Y\) 完全对称——两者都是 \(B(3,\tfrac12)\) 二项分布(4.6 节)。但请注意:从这两条边缘上完全看不出 \(X+Y\equiv 3\) 这一刚性关系;若 \(X\) 与 \(Y\) 真的"各自独立地"服从 \(B(3,\tfrac12)\),16 个格子都会有正概率。这一现象背后的道理将在第 5 小节严格剖析。图 1 用颜色深浅把表 1 画成"热力表":支撑的反对角线结构与边缘行列一目了然。

掷 3 枚硬币:联合分布列 p(x, y) 热力表 3/8 1/8 0 X = 正面数(列) Y = 反面数(行) y \ x 0 1 2 3 p_Y(y) 3 2 1 0 1/8 0 0 0 0 3/8 0 0 0 0 3/8 0 0 0 0 1/8 1/8 3/8 3/8 1/8 p_X(x) 1/8 3/8 3/8 1/8 1 支撑位于反对角线 x + y = 3 上(金色虚线) 边缘分布:右列=行和 p_Y,下行=列和 p_X(粗边框单元格)
图 1:掷 3 枚硬币的联合分布列热力表(对应表 1)。单元格颜色深浅与概率大小成正比:3/8 为深色、1/8 为浅色、0 为空白;右列与下行为边缘分布(粗边框),右下角核验总质量为 1。

3. 连续情形:联合密度函数与边缘密度

当 \((X,Y)\) 的可能取值充满平面区域时,概率像"质量"一样连续地铺在平面上,刻画工具由求和换为积分。

定义 4 联合密度函数

若存在非负函数 \(f(x,y)\),使得对(可测)区域 \(R\subset\mathbb{R}^2\) 都有 \[ P\bigl((X,Y)\in R\bigr) \;=\; \iint_R f(x,y)\,dx\,dy, \qquad \iint_{\mathbb{R}^2} f(x,y)\,dx\,dy = 1, \] 则称 \(f\) 为 \((X,Y)\) 的联合密度函数(joint probability density function,联合 pdf)。

与一维情形(5.1 节)相同,\(f(x,y)\) 本身不是概率,而是单位面积上的概率质量:\(P(x<X\le x+dx,\ y<Y\le y+dy)\approx f(x,y)\,dx\,dy\)。求事件的概率,就是把密度在事件区域上积分——画域、定限因此成为本节最重要的计算技能(见第 4 小节)。

定义 5 边缘密度函数

由联合密度对某个变量积分,得 \[ f_X(x) \;=\; \int_{-\infty}^{+\infty} f(x,y)\,dy, \qquad f_Y(y) \;=\; \int_{-\infty}^{+\infty} f(x,y)\,dx, \] 分别称为 \(X\) 与 \(Y\) 的边缘密度函数(marginal probability density function)。

理由与离散情形平行的"求和"完全一致:竖直细条 \(\{X\in(x,x+dx]\}\) 上的概率等于把该条内一切 \(y\) 处的质量积分起来,故 \(P(X\in(x,x+dx])\approx f_X(x)\,dx\)。几何上,\(f_X\) 就是把整个平面沿 \(y\) 方向"压扁"后得到的线密度。

例 2 f(x, y) = e−(x+y):验证规范性与边缘

设 \(f(x,y)=e^{-(x+y)}\)(\(x>0,\ y>0\);其余处为 0)。验证它是合法的联合密度,并求两个边缘密度。

规范性:积分可以分离, \[ \int_0^{+\infty}\!\!\int_0^{+\infty} e^{-(x+y)}\,dy\,dx \;=\; \Bigl(\int_0^{+\infty} e^{-x}\,dx\Bigr)\Bigl(\int_0^{+\infty} e^{-y}\,dy\Bigr) \;=\; 1\times 1 \;=\; 1. \] 边缘:对固定的 \(x>0\), \[ f_X(x) \;=\; \int_0^{+\infty} e^{-(x+y)}\,dy \;=\; e^{-x}\int_0^{+\infty} e^{-y}\,dy \;=\; e^{-x}, \] 同理 \(f_Y(y)=e^{-y}\)(\(y>0\))。即 \(X\) 与 \(Y\) 都服从指数分布 \(\mathrm{Exp}(1)\)(5.5 节)。细心的读者会注意到此处恰好有 \(f(x,y)=f_X(x)\,f_Y(y)\)——联合密度等于两个边缘密度的乘积。这不是巧合:它正是 6.2 节"独立性"的解析特征。
例 3 f(x, y) = cxy:先定常数,再求边缘

设 \(f(x,y)=c\,xy\)(\(0<x<1,\ 0<y<1\);其余处为 0)。求常数 \(c\) 与两个边缘密度。

由规范性, \[ 1=\int_0^1\!\!\int_0^1 c\,xy\,dy\,dx \;=\; c\Bigl(\int_0^1 x\,dx\Bigr)\Bigl(\int_0^1 y\,dy\Bigr) \;=\; c\cdot\frac12\cdot\frac12 \;=\; \frac{c}{4}, \] 故 \(c=4\)。边缘密度:对 \(0<x<1\), \[ f_X(x) \;=\; \int_0^1 4xy\,dy \;=\; 4x\cdot\frac12 \;=\; 2x, \] 同理 \(f_Y(y)=2y\)(\(0<y<1\))。校验:\(\int_0^1 2x\,dx=1\),确为合法密度。注意此处恰好有 \(f(x,y)=4xy=2x\cdot 2y=f_X(x)\,f_Y(y)\)——联合密度等于边缘密度的乘积,与例 2 相同;原因在于密度本身具有乘积形式 \(c\,xy=g(x)\,h(y)\),"恰可分离"。但这并非普遍规律:下一小节例 4 的三角域上,边缘乘积 \(2x\cdot 2(1-y)\) 与真实联合 \(f\equiv 2\) 截然不同。系统性的判别准则留待 6.2 节。

4. 支撑集与二维均匀分布

前面几例中,密度取正值的区域各不相同:例 2 是整个第一象限,例 3 是单位正方形,例 4 将是单位三角形。这个"可能落入的区域"值得命名。

定义 6 支撑集与区域上的均匀分布

使联合分布列取正值的所有格点(离散情形),或联合密度取正值的区域(连续情形),称为 \((X,Y)\) 的支撑集(support)。若 \((X,Y)\) 在面积为 \(\mathrm{Area}(D)\) 的区域 \(D\) 上均匀分布(uniform distribution on a region),则 \[ f(x,y) \;=\; \begin{cases} \dfrac{1}{\mathrm{Area}(D)}, & (x,y)\in D, \\[.4em] 0, & \text{其余}. \end{cases} \]

二维均匀是几何概型(2.5 节)的随机变量语言:概率与面积成正比,\(P((X,Y)\in A)=\mathrm{Area}(A\cap D)/\mathrm{Area}(D)\)。支撑集的形状往往是解题的第一线索:先画出支撑与事件区域的交,再据此确定累次积分的上下限。

例 4 三角域上的均匀分布:画域定限

设 \((X,Y)\) 在三角形区域 \(D=\{0<y<x<1\}\) 上均匀分布。(a) 写出联合密度;(b) 求 \(P(Y<\tfrac12)\);(c) 求两个边缘密度。

(a) \(D\) 是两条直角边长为 1 的直角三角形(图 2 左),\(\mathrm{Area}(D)=\tfrac12\),故 \[ f(x,y)=2 \quad (0<y<x<1), \qquad \text{其余处为 } 0. \] (b) 画域:事件 \(\{Y<\tfrac12\}\) 与 \(D\) 的交是四边形 \(\{0<y<\tfrac12,\ y<x<1\}\)。对固定的 \(y\in(0,\tfrac12)\) 作水平细条(图 2 左金色条),条内 \(x\) 从 \(y\) 变到 \(1\),于是 \[ P\Bigl(Y<\frac12\Bigr) \;=\; \int_0^{1/2}\!\!\int_y^1 2\,dx\,dy \;=\; \int_0^{1/2} 2(1-y)\,dy \;=\; \Bigl[2y-y^2\Bigr]_0^{1/2} \;=\; 1-\frac14 \;=\; \frac34. \] 取补验证:\(P(Y\ge\tfrac12)=\int_{1/2}^1 2(1-y)\,dy=\tfrac14\),\(1-\tfrac14=\tfrac34\),吻合。 (c) 边缘:对 \(0<y<1\),\(f_Y(y)=\int_y^1 2\,dx=2(1-y)\);对 \(0<x<1\),\(f_X(x)=\int_0^x 2\,dy=2x\)(沿竖直细条积分,\(y\) 从 \(0\) 到 \(x\))。观察:这里的 \(f_X(x)=2x\) 与例 3 的边缘完全相同——同一个边缘密度可以来自面貌迥异的两张联合密度(正方形上的 \(4xy\) 与三角形上的 \(2\)),这正是下小节主题的又一实证。
三角支撑 D = {0 < y < x < 1} 面积 = 1/2,故均匀密度 f(x, y) = 2 y = 1/2 P(Y<1/2) 区域 D y = x 固定 y x: y → 1 0 1 1 x y 矩形支撑 R = (0, 1)² 面积 = 1,均匀密度 f ≡ 1 R y: 0 → 1 x 固定 0 1 1 x y 左:例 4 的三角支撑(深色部分为 P(Y < 1/2) 的积分区域);右:矩形支撑(例 3;例 2 的第一象限支撑可视为无穷的矩形)
图 2:两类典型支撑域。左:三角域 \(D=\{0<y<x<1\}\),金色水平细条示意求边缘 \(f_Y\) 或概率时"对固定的 \(y\),\(x\) 从 \(y\) 积到 \(1\)";右:单位正方形(矩形支撑),竖直细条示意"对固定的 \(x\),\(y\) 从 \(0\) 积到 \(1\)"。

5. 联合决定边缘,边缘不能决定联合

把第 2、3 小节的计算方向捋清楚,可以得到本节最重要的结构性结论。

定理 2 联合与边缘的信息不对等

(i) \((X,Y)\) 的联合分布唯一决定 \(X\) 与 \(Y\) 的边缘分布;
(ii) 反之, \(X\) 与 \(Y\) 的边缘分布一般不能决定联合分布。

证明(i) 离散情形:对每个固定的 \(x\),联合分布列给出整列数 \(\{p(x,y)\}_y\),逐项相加即得 \(p_X(x)\)——求和的结果由被加项唯一确定。连续情形同理:\(f_X(x)=\int f(x,y)\,dy\) 的被积函数由联合密度唯一给出。也可从 CDF 看:\(F_X(x)=\lim_{y\to+\infty}F(x,y)\)(事件 \(\{Y\le y\}\) 单调升趋于全空间,由概率的连续性即得)。
(ii) 反例:例 1 中 \(X\) 与 \(Y\) 的边缘均为 \(B(3,\tfrac12)\)。现修改试验:掷 3 枚硬币记正面数 \(X\),再独立地另掷 3 枚硬币记反面数 \(Y^{*}\)。则 \((X,Y^{*})\) 的两个边缘与 \((X,Y)\) 的逐点相同,但联合分布不同: \[ P(X=3,\,Y=3)=0 \quad\text{(因 } 3+3\ne 3\text{)}, \qquad P(X=3,\,Y^{*}=3)=\frac18\times\frac18=\frac{1}{64}. \] 同样的边缘,不同的联合,故边缘不能决定联合。

这一不对等可以打个比方:把联合分布想成一张照片,边缘分布只是它向两条坐标轴的投影。每个投影都由照片唯一决定,但两条投影一般还原不出照片——因为投影丢掉了"像素如何搭配"的信息。用概率的语言说:联合分布 = 边缘分布 + 相依结构(dependence structure);求边缘的"求和/积分"是一趟有去无回的降维旅行。补全缺失信息的两条正道将在本章展开:6.2 节假设相依结构最简单(联合等于边缘之乘积,即独立性);6.46.5 节则用条件分布直接刻画 \(X\) 与 \(Y\) 的联动方式。

注记 常见误区:会加还得会搭

初学者最易犯的错误是"由边缘拼联合"——比如把例 4 的边缘 \(2x\) 与 \(2(1-y)\) 相乘当作联合密度(得到的 \(4x(1-y)\) 与真实联合 \(f\equiv 2\) 截然不同),或把例 1 的两条二项边缘填满全部 16 个格子。除非附加独立性假设(6.2 节),边缘永远只提供"各自如何取值",不提供"如何一起取值"。统计学中刻画"边缘 + 相依结构"如何搭配成合法联合的数学工具称为连接函数(copula),其思想与本节反例一脉相承;而在本教程中,请牢记操作守则:联合 → 边缘,随时可算;边缘 → 联合,必须额外假设。

6. 本节小结

要点回顾
  • 联合分布函数 \(F(x,y)=P(X\le x,\,Y\le y)\) 完整刻画 \((X,Y)\) 的规律;矩形公式 \(P(a<X\le b,\,c<Y\le d)=F(b,d)-F(a,d)-F(b,c)+F(a,c)\) 把平面事件化为四个角点值。
  • 离散用联合分布列 \(p(x,y)\)(非负、总和为 1),事件概率对格点求和;连续用联合密度 \(f(x,y)\)(非负、积分为 1),事件概率对区域积分——先画域、再定限。
  • 边缘分布由联合"压扁"得到:离散对行/列求和,连续对某个变量积分;支撑集是概率真正"生活"的区域,其形状是解题的第一线索。
  • 区域 \(D\) 上的二维均匀分布:\(f=1/\mathrm{Area}(D)\),概率化为面积比(例 4:三角域上 \(f=2\),\(P(Y<\tfrac12)=\tfrac34\))。
  • 联合唯一决定边缘,边缘不能决定联合(反例见定理 2);缺失的相依结构需靠独立性(6.2)或条件分布(6.4、6.5)补全。

练习

练习 6-1-1

设 \((X,Y)\) 的联合分布列为 \(p(1,1)=0.10\)、\(p(2,1)=0.20\)、\(p(3,1)=0.30\)、\(p(1,2)=0.15\)、\(p(2,2)=0.10\)、\(p(3,2)=0.15\)(\(x=1,2,3\);\(y=1,2\))。求 (a) 两个边缘分布列;(b) \(P(X\ge Y)\);(c) \(P(X+Y=4)\)。

答案与提示

(a) 行和给 \(p_Y(1)=0.60,\ p_Y(2)=0.40\);列和给 \(p_X(1)=0.25,\ p_X(2)=0.30,\ p_X(3)=0.45\)。(b) 满足 \(x<y\) 的格只有 \((1,2)\),故 \(P(X\ge Y)=1-0.15=0.85\)。(c) \(x+y=4\) 的格为 \((2,2)\) 与 \((3,1)\):\(P=0.10+0.30=0.40\)。

练习 6-1-2

设 \(f(x,y)=c\,xy\)(\(x>0,\ y>0,\ x+y<1\);其余处为 0)。求常数 \(c\) 与两个边缘密度。

答案与提示

画域定限(对固定 \(x\in(0,1)\),\(y\) 从 \(0\) 到 \(1-x\)):\(\int_0^1\!\!\int_0^{1-x} xy\,dy\,dx=\int_0^1 \tfrac{x(1-x)^2}{2}\,dx=\tfrac1{24}\),故 \(c=24\)。边缘:\(f_X(x)=\int_0^{1-x}24xy\,dy=12x(1-x)^2\)(\(0<x<1\));由 \(x,y\) 的对称性,\(f_Y(y)=12y(1-y)^2\) 同型。校验:\(\int_0^1 12x(1-x)^2\,dx=12\cdot\tfrac1{12}=1\)。

练习 6-1-3

概念题:已知 \(X\) 与 \(Y\) 的边缘分布,能否确定联合分布?构造两张联合表,使边缘同为 \(P(X=0)=P(X=1)=P(Y=0)=P(Y=1)=\tfrac12\) 而联合不同,并结合例 1 说明这对数据分析的启示。

答案与提示

不能。表 A:四格均为 \(\tfrac14\)(\(X,Y\) 独立);表 B:\(p(0,0)=p(1,1)=\tfrac12\),其余为 0(完全正相关)。两者边缘逐点相同,联合却截然不同。例 1 同理:\(X,Y\) 的边缘均为 \(B(3,\tfrac12)\),但支撑被压缩到反对角线 \(x+y=3\) 上;若二者独立,16 个格子都应有正概率。启示:只看各变量的"单变量摘要"会完全丢失变量间的联动信息,必须回到联合(或条件)层面。

练习 6-1-4

在例 4 的密度(\(f=2\),\(0<y<x<1\))下,计算 \(F(\tfrac12,\tfrac12)=P(X\le\tfrac12,\ Y\le\tfrac12)\) 与 \(P(X+Y\le 1)\)。

答案与提示

两问都要画域。(a) 区域为 \(\{0<y<x<\tfrac12\}\):\(\int_0^{1/2}\!\!\int_0^{x} 2\,dy\,dx=\int_0^{1/2}2x\,dx=\tfrac14\)。(b) 注意在 \(D\) 内恒有 \(y<x\),且需 \(y<1-x\),即 \(y<\min(x,1-x)\):\(\int_0^{1/2}2x\,dx+\int_{1/2}^{1}2(1-x)\,dx=\tfrac14+\tfrac14=\tfrac12\)。可对照图 2 左检验积分限。