- 写出二元正态分布的联合密度,说明五个参数的含义,并了解其边际分布与条件分布都是正态;
- 证明二元正态情形下「\(\rho=0\) 当且仅当 \(X\) 与 \(Y\) 独立」,并解释这是正态家族独有的性质;
- 用矩母函数证明独立正态随机变量的线性组合仍服从正态分布;
- 陈述正态样本的三大定理:\(\bar X\sim N(\mu,\sigma^2/n)\)、\(\bar X\) 与 \(S^2\) 独立、\((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\),并据此计算概率;
- 说明 \(\chi^2_n\) 分布与 \(\Gamma\) 分布的关系(\(E=n\),\(\mathrm{Var}=2n\)),会查 \(\chi^2\) 分位数表。
1. 二元正态分布
正态分布之所以在概率论与统计学中占据中心地位,不仅因为它常见——8.3 节的中心极限定理将解释原因——更因为它拥有一族「独家」的优良性质:不相关即独立、线性组合保持正态、样本均值与样本方差彼此独立。本节把这些性质整理成一套完整的工具箱,它们是整个统计推断的地基。我们先从两个正态随机变量如何「联合」起来说起。
若随机向量 \((X,Y)\) 的联合密度为
\[ f(x,y)=\frac{1}{2\pi\sigma_X\sigma_Y\sqrt{1-\rho^2}}\, \exp\left\{-\frac{1}{2(1-\rho^2)}\left[ \left(\frac{x-\mu_X}{\sigma_X}\right)^2 -2\rho\,\frac{(x-\mu_X)(y-\mu_Y)}{\sigma_X\sigma_Y} +\left(\frac{y-\mu_Y}{\sigma_Y}\right)^2 \right]\right\}, \qquad (x,y)\in\mathbb{R}^2, \]
其中 \(\sigma_X,\sigma_Y>0\),\(-1<\rho<1\),则称 \((X,Y)\) 服从二元正态分布(bivariate normal distribution)。该分布完全由五个参数 \(\mu_X,\mu_Y,\sigma_X,\sigma_Y,\rho\) 决定。
密度的等高线是一族倾斜的椭圆:\(\mu_X,\mu_Y\) 定中心,\(\sigma_X,\sigma_Y\) 定两个方向的伸展,而 \(\rho\) 控制椭圆的倾向——\(\rho>0\) 时点云沿「左下—右上」方向伸展,\(\rho<0\) 时沿「右下—左上」方向伸展,\(|\rho|\) 越大椭圆越扁。
设 \((X,Y)\) 服从定义 1 的二元正态分布,则 \(X\sim N(\mu_X,\sigma_X^2)\),\(Y\sim N(\mu_Y,\sigma_Y^2)\),\(\mathrm{Corr}(X,Y)=\rho\);且在 \(Y=y\) 的条件下,\(X\) 仍服从正态分布:
\[ X\,|\,Y=y\;\sim\; N\!\left(\mu_X+\rho\,\frac{\sigma_X}{\sigma_Y}(y-\mu_Y),\; \sigma_X^2(1-\rho^2)\right). \]
定理 1 中的条件均值 \(E[X\,|\,Y=y]=\mu_X+\rho\frac{\sigma_X}{\sigma_Y}(y-\mu_Y)\) 恰好是 \(y\) 的线性函数——这正是 7.5 节所说「二元正态时,最佳预测与最佳线性预测重合」的原因:对正态家族,用直线逼近条件期望不会有任何损失。
设 \((X,Y)\) 服从二元正态分布,则 \(\rho=0\) 的充要条件是 \(X\) 与 \(Y\) 相互独立。
\[ f(x,y)=\frac{e^{-\frac{(x-\mu_X)^2}{2\sigma_X^2}}}{\sqrt{2\pi}\,\sigma_X}\cdot \frac{e^{-\frac{(y-\mu_Y)^2}{2\sigma_Y^2}}}{\sqrt{2\pi}\,\sigma_Y} =f_X(x)\,f_Y(y), \]
联合密度处处等于两个边际密度的乘积,故 \(X\) 与 \(Y\) 独立。
对一般的随机变量,「不相关(uncorrelated)」远弱于「独立」:7.3 节的反例 \(X\sim N(0,1)\)、\(Y=X^2\) 中,\(\mathrm{Cov}(X,Y)=E[X^3]-E[X]E[X^2]=0\)(奇函数的期望为零),但 \(Y\) 完全由 \(X\) 决定。定理 2 说明:只要 \((X,Y)\) 是联合正态的,「相关系数为零」就一跃成为「独立」——这是正态家族的招牌性质。请留意其中的差别:\((X, X^2)\) 中 \(Y=X^2\) 的边际分布根本不是正态,「联合正态」是比「两个边际都是正态」强得多的条件(见下节反例)。
2. 独立正态变量的线性组合
正态家族的另一条「独家」性质是对线性运算封闭:独立正态变量任意加权相加,结果仍是正态。证明工具正是 7.6 节建立的矩母函数(moment generating function, MGF)——一次相乘,一步到位。
设 \(X\sim N(\mu_X,\sigma_X^2)\) 与 \(Y\sim N(\mu_Y,\sigma_Y^2)\) 相互独立,\(a,b\) 为不全为零的常数,则
\[ aX+bY\;\sim\;N\!\left(a\mu_X+b\mu_Y,\; a^2\sigma_X^2+b^2\sigma_Y^2\right). \]
\[ M_{aX+bY}(t)=M_X(at)\,M_Y(bt) =e^{(a\mu_X+b\mu_Y)t+\frac{(a^2\sigma_X^2+b^2\sigma_Y^2)t^2}{2}}, \]
这恰好是正态分布 \(N(a\mu_X+b\mu_Y,\,a^2\sigma_X^2+b^2\sigma_Y^2)\) 的 MGF。由 MGF 的唯一性(7.6 节性质 2),结论成立。用归纳法可推广到任意有限个独立正态变量:\(X_1,\dots,X_n\) 相互独立、\(X_i\sim N(\mu_i,\sigma_i^2)\) 时,\(\sum_i a_iX_i\sim N(\sum_i a_i\mu_i,\ \sum_i a_i^2\sigma_i^2)\)。
反例:设 \(X\sim N(0,1)\),\(\varepsilon\) 与 \(X\) 独立且等可能取 \(\pm1\),令 \(Y=\varepsilon X\)。对称性保证 \(Y\sim N(0,1)\),且 \(\mathrm{Cov}(X,Y)=E[\varepsilon]E[X^2]=0\)。但 \(X+Y=(1+\varepsilon)X\) 以概率 \(1/2\) 恒等于 \(0\)、以概率 \(1/2\) 等于 \(2X\)——分布在 \(0\) 处有原子,连连续型都不是,更谈不上正态。可见「两个边际都正态」远远不够;事实上若 \((X,Y)\) 联合正态(允许不独立),则 \(aX+bY\) 仍正态,且经可逆线性变换后联合分布仍是二元正态。
为提高测量精度,对同一零件独立测量两次并取平均。设单次测量误差 \(X_i\sim N(0,\sigma^2)\)。(a) 求平均误差 \(\bar X_2=\frac{X_1+X_2}{2}\) 的分布;(b) 比较「单次误差不超过 \(\sigma/2\)」与「平均误差不超过 \(\sigma/2\)」的概率。
(b) 单次测量:\(P(|X_1|\le\sigma/2)=P(|Z|\le0.5)=2\Phi(0.5)-1=2\times0.6915-1\approx0.383\)。两次平均:\[ P\big(|\bar X_2|\le\tfrac{\sigma}{2}\big)=P\!\left(|Z|\le\frac{\sigma/2}{\sigma/\sqrt2}\right)=P(|Z|\le0.707)\approx2\times0.760-1\approx0.520, \] 概率从 \(38.3\%\) 提升到 \(52.0\%\)。多花一倍工作量,精度按平方根速率改善——这一「收益递减」规律将在例 4 中定量展开。
3. 卡方分布
独立正态变量的和仍是正态;那么它们的平方和呢?答案就是统计推断中仅次于正态分布的第二主角——卡方分布(chi-square distribution)。
设 \(Z_1,\dots,Z_n\) 相互独立且均服从 \(N(0,1)\),则称随机变量
\[ \chi^2_n=Z_1^2+Z_2^2+\cdots+Z_n^2 \]
的分布为自由度(degrees of freedom) \(n\) 的卡方分布,记作 \(\chi^2_n\)。自由度即独立平方项的个数。
\(\chi^2_n\) 的密度为
\[ f(x)=\frac{1}{2^{\,n/2}\,\Gamma(n/2)}\,x^{\,n/2-1}e^{-x/2},\qquad x>0 \]
(其余处为零),即 \(\chi^2_n=\Gamma(n/2,\,1/2)\)(形状参数 \(\alpha=n/2\)、速率参数 \(\lambda=1/2\) 的 \(\Gamma\) 分布)。并且
\[ E[\chi^2_n]=n,\qquad \mathrm{Var}(\chi^2_n)=2n. \]
特别地,\(n=1\) 时 \(\chi^2_1=\Gamma(1/2,\,1/2)\)。5.7 节例 4 曾用随机变量函数的密度公式求出 \(Y=Z^2\)(\(Z\sim N(0,1)\))的密度 \(f_Y(y)=\frac{1}{\sqrt{2\pi y}}\,e^{-y/2}\)(\(y>0\)),它与定理 4 在 \(n=1\) 时的表达式完全一致(利用 \(\Gamma(1/2)=\sqrt{\pi}\),对照细节见练习 1)。于是
\[ Z^2\sim\chi^2_1 . \]
另一个极端 \(n=2\):密度 \(f(x)=\frac12 e^{-x/2}\) 正是速率 \(1/2\) 的指数分布(5.5 节)。
若 \(X\sim\chi^2_m\) 与 \(Y\sim\chi^2_n\) 相互独立,则 \(X+Y\sim\chi^2_{m+n}\)。
统计应用中经常需要「多大的平方和才算罕见」的门槛,这就是 \(\chi^2\) 分位数表。记 \(\chi^2_{\alpha,k}\) 为满足 \(P(\chi^2_k>\chi^2_{\alpha,k})=\alpha\) 的上侧 \(\alpha\) 分位数。
| 自由度 \(k\) | 上 5% 分位数 \(\chi^2_{0.05,k}\) | 上 1% 分位数 \(\chi^2_{0.01,k}\) |
|---|---|---|
| 1 | 3.841 | 6.635 |
| 2 | 5.991 | 9.210 |
| 3 | 7.815 | 11.345 |
| 4 | 9.488 | 13.277 |
| 5 | 11.070 | 15.086 |
| 6 | 12.592 | 16.812 |
| 7 | 14.067 | 18.475 |
| 8 | 15.507 | 20.090 |
| 9 | 16.919 | 21.666 |
| 10 | 18.307 | 23.209 |
\(\sum_{i=1}^n\big(\frac{X_i-\mu}{\sigma}\big)^2\) 中 \(n\) 个平方项可以自由变动,故服从 \(\chi^2_n\)。但若 \(\mu\) 未知、只能用样本均值 \(\bar X\) 顶替,数据就得先「花掉」一个自由度去估计 \(\mu\),独立变动的平方项只剩 \(n-1\) 个——这正是下一小节 \((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\) 中「损失一个自由度」的由来。
4. 正态样本的三大基石定理
现在把前两节的工具合龙。设 \(X_1,\dots,X_n\) 是来自正态总体 \(N(\mu,\sigma^2)\) 的简单随机样本(独立同分布),定义两个最重要的统计量。
\[ \bar X=\frac{1}{n}\sum_{i=1}^{n}X_i,\qquad S^2=\frac{1}{n-1}\sum_{i=1}^{n}(X_i-\bar X)^2 , \]
分别称为样本均值(sample mean)与样本方差(sample variance)。\(S^2\) 中除以 \(n-1\) 而非 \(n\) 的理由,在定理 6 之后会自然显现(\(E[S^2]=\sigma^2\))。
设 \(X_1,\dots,X_n\) 独立同分布于 \(N(\mu,\sigma^2)\),则:
\[ \text{(i)}\ \ \bar X\sim N\!\left(\mu,\ \frac{\sigma^2}{n}\right);\qquad \text{(ii)}\ \ \bar X \text{ 与 } S^2 \text{ 相互独立};\qquad \text{(iii)}\ \ \frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}. \]
(ii) 与 (iii) 的完整证明需要多维变量替换技巧,超出本书范围;但下面的恒等式能说明它们为何「自洽」,并解释自由度的损失。对每个 \(i\) 展开 \(X_i-\mu=(X_i-\bar X)+(\bar X-\mu)\),交叉项求和恰为零,得费希尔分解(Fisher decomposition):\[ \sum_{i=1}^{n}(X_i-\mu)^2=\sum_{i=1}^{n}(X_i-\bar X)^2+n(\bar X-\mu)^2 . \] 两边同除 \(\sigma^2\):左端 \(=\sum\big(\frac{X_i-\mu}{\sigma}\big)^2\sim\chi^2_n\);右端第二项 \(=\Big(\frac{\sqrt n(\bar X-\mu)}{\sigma}\Big)^2\sim\chi^2_1\)(由 (i),括号内是标准正态)。于是右端成为「\(\chi^2_{n-1}\) 加独立的 \(\chi^2_1\)」,由定理 5 相加恰为 \(\chi^2_n\),与左端吻合。直观地说:\(n\) 个观测中,估计 \(\bar X\) 消耗了一个自由度,散布 \(S^2\) 只剩 \(n-1\) 个独立成分。
由定理 6(iii) 立得两个常用结果:\(E[S^2]=\sigma^2\)(因 \(E[\chi^2_{n-1}]=n-1\),这正是定义 3 中除以 \(n-1\) 的理由),以及 \(\mathrm{Var}(S^2)=\dfrac{2\sigma^4}{n-1}\)(因 \(\mathrm{Var}(\chi^2_{n-1})=2(n-1)\))。
定理 6 的三条合在一起威力惊人。当 \(\sigma\) 未知时,用 \(S\) 替换 (i) 中的 \(\sigma\),得统计量 \(T=\dfrac{\sqrt n\,(\bar X-\mu)}{S}\)。由 (ii)(iii) 可导出 \(T\) 服从自由度 \(n-1\) 的 t 分布(Student's t distribution)——小样本区间估计与假设检验的主力,数理统计课程将从这里出发。还要强调:(ii) 与 (iii) 是正态总体的「专利」,一般总体的 \(\bar X\) 与 \(S^2\) 通常相依;而对一般总体,\(\bar X\) 仅在 \(n\) 大时近似正态(8.3 节中心极限定理),正态总体下 (i) 对任何 \(n\) 都是精确成立的。
某机床加工的轴径 \(X\sim N(\mu,\sigma^2)\),从中独立抽取 \(n=10\) 根。求 \(P(\bar X>\mu+0.5\sigma)\)。
同样取 \(n=10\),求 \(P(S^2/\sigma^2>2)\),即样本方差超过真实方差两倍的概率。
\(\bar X\sim N(\mu,\sigma^2/n)\) 的标准差 \(\sigma/\sqrt n\) 称为标准误(standard error)。(a) 列表观察 \(\sigma/\sqrt n\) 与 \(P(|\bar X-\mu|<0.1\sigma)\) 随 \(n\) 的变化;(b) 要使该概率至少达到 0.95 与 0.99,各需多大样本?
(b) 要求 \(2\Phi(0.1\sqrt n)-1\ge0.95\),即 \(0.1\sqrt n\ge1.96\),得 \(n\ge(19.6)^2=384.2\),故 \(n=385\)。要求达到 0.99:\(0.1\sqrt n\ge2.576\),得 \(n\ge663.6\),故 \(n=664\)。规律清晰而残酷:样本量翻两番(\(\times4\)),精度只翻一番(\(\times2\));想把误差限再压低一个数量级,样本量要扩大百倍——这就是「平方根定律」的收益递减。
| \(n\) | 标准误 \(\sigma/\sqrt n\) | \(P(|\bar X-\mu|<0.1\sigma)\) |
|---|---|---|
| 1 | 1.000\(\sigma\) | 0.0797 |
| 4 | 0.500\(\sigma\) | 0.1585 |
| 16 | 0.250\(\sigma\) | 0.3108 |
| 100 | 0.100\(\sigma\) | 0.6827 |
| 400 | 0.050\(\sigma\) | 0.9545 |
5. 本节小结
- 二元正态分布由 \((\mu_X,\mu_Y,\sigma_X,\sigma_Y,\rho)\) 完全决定;边际分布与条件分布都是正态;\(\rho=0\iff\) 独立是正态家族独有的性质。
- 独立(或联合)正态变量的线性组合仍正态:\(N(\mu_X,\sigma_X^2)+N(\mu_Y,\sigma_Y^2)=N(\mu_X+\mu_Y,\sigma_X^2+\sigma_Y^2)\)——MGF 一行证明;但「两个边际正态」不足以保证结论(\(Y=\varepsilon X\) 反例)。
- \(\chi^2_n=\Gamma(n/2,1/2)\):\(E=n\),\(\mathrm{Var}=2n\);\(Z^2\sim\chi^2_1\)(与 5.7 节、6.7 节呼应);独立卡方相加,自由度相加。
- 正态样本三大定理:\(\bar X\sim N(\mu,\sigma^2/n)\)、\(\bar X\) 与 \(S^2\) 独立、\((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\)——统计推断的基石,t 分布的起点(费希尔分解解释了自由度的损失)。
- 精度按 \(\sigma/\sqrt n\) 收缩:样本量 ×4,精度只 ×2;\(n=10\) 时 \(P(\bar X>\mu+0.5\sigma)\approx0.0569\),而 \(P(S^2/\sigma^2>2)=P(\chi^2_9>18)\approx0.035\)。
练习
练习 7-7-1
证明 \(Z^2\sim\chi^2_1\):用 5.7 节的 \(Y=X^2\) 密度公式与 \(\Gamma(1/2,1/2)\) 对照。
答案与提示设 \(Z\sim N(0,1)\)、\(Y=Z^2\)。由 5.7 节例 4 的变换公式 \(f_Y(y)=\dfrac{f_Z(\sqrt y)+f_Z(-\sqrt y)}{2\sqrt y}\)(\(y>0\)),得\[ f_Y(y)=\frac{\varphi(\sqrt y)}{\sqrt y}=\frac{1}{\sqrt{2\pi}}\,y^{-1/2}e^{-y/2},\qquad y>0 . \] 另一方面,\(\Gamma(1/2,1/2)\)(即 \(\chi^2_1\))的密度为 \(\dfrac{(1/2)^{1/2}}{\Gamma(1/2)}y^{-1/2}e^{-y/2}\);利用 \(\Gamma(1/2)=\sqrt\pi\),系数化为 \(\dfrac{1}{\sqrt2\cdot\sqrt\pi}=\dfrac{1}{\sqrt{2\pi}}\),与 \(f_Y\) 完全一致。故 \(Z^2\sim\chi^2_1\)。
练习 7-7-2
查 χ² 表计算:(a) \(P(\chi^2_{10}>18.307)\);(b) 求满足 \(P(\chi^2_4>c)=0.01\) 的 \(c\);(c) 正态样本 \(n=8\) 时,用表 1 判断 \(P(S^2/\sigma^2>2)\) 的大致大小。
答案与提示(a) 由表 1 定义直接读出 \(0.05\)。(b) \(c=\chi^2_{0.01,4}=13.277\)。(c) \(7S^2/\sigma^2\sim\chi^2_7\),故 \(P(S^2/\sigma^2>2)=P(\chi^2_7>14)\);因 \(\chi^2_{0.05,7}=14.067\) 与 14 几乎重合,该概率略大于 \(0.05\)(按密度 \(f_7(14)\approx0.018\) 修正约 \(0.051\))。
练习 7-7-3
\(n\) 与 \(P(|\bar X-\mu|<0.1\sigma)\) 的关系:求 \(n=25\) 时的概率;要使概率达到 0.99,样本量至少多大?
答案与提示\(P(|\bar X-\mu|<0.1\sigma)=2\Phi(0.1\sqrt n)-1\)。\(n=25\):\(0.1\sqrt{25}=0.5\),概率 \(=2\Phi(0.5)-1\approx0.383\)。要达 0.99:需 \(0.1\sqrt n\ge2.576\),即 \(n\ge(25.76)^2\approx663.6\),至少 \(n=664\)。对照表 2 可见 \(n\) 从 25 到 664(约 27 倍),概率才从 0.38 升到 0.99——平方根定律意味着精度提升的代价急速攀升。
练习 7-7-4(选学)
设 \((X,Y)\) 二元正态且 \(\sigma_X=\sigma_Y=\sigma\)(\(\mu_X,\mu_Y,\rho\) 任意)。证明 \(X+Y\) 与 \(X-Y\) 相互独立。
答案与提示二维可逆线性变换保持联合正态,故 \((X+Y,\,X-Y)\) 仍是二元正态。计算协方差:\(\mathrm{Cov}(X+Y,\,X-Y)=\mathrm{Var}(X)-\mathrm{Cov}(X,Y)+\mathrm{Cov}(Y,X)-\mathrm{Var}(Y)=\sigma^2-\sigma^2=0\)(\(\rho\) 项相消)。联合正态 + 相关系数为零,由定理 2 立得独立。若 \(\sigma_X\ne\sigma_Y\),则协方差为 \(\sigma_X^2-\sigma_Y^2\ne0\),二者线性相关,不再独立。