第 5 章 · 连续型随机变量

5.4 正态随机变量

Normal Random Variables
学习目标
  • 写出正态分布的概率密度函数,说明参数 \(\mu\)(位置)与 \(\sigma\)(尺度)分别如何决定曲线的位置与胖瘦;
  • 用标准化变换 \(Z=(X-\mu)/\sigma\) 把任意正态随机变量的概率计算归结为标准正态分布函数 \(\Phi\) 的查表;
  • 熟练运用对称性 \(\Phi(-z)=1-\Phi(z)\) 与线性内插完成正反两个方向的查表;
  • 陈述 68-95-99.7 经验法则,并解释 1.28、1.645、1.96 等常用临界值的由来;
  • 了解正态分布从 de Moivre 到 Laplace、Gauss 的历史脉络,以及它作为二项分布近似(第 8 章中心极限定理的先声)的角色。

1. 正态密度:一条钟形曲线与两个参数

测量一台仪器的读数误差、一场考试的成绩、某地区成年男性的身高、加工零件的直径偏差——把大量这类数据的直方图画出来,它们几乎都呈现出同一种形状:中间高、两边低、左右对称的"钟形"。刻画这类现象的模型,就是本教程中最重要的连续型分布。正态随机变量(normal random variable)又称高斯随机变量(Gaussian random variable),若 \(X\) 服从正态分布,记作 \(X\sim N(\mu,\sigma^2)\),其密度由 \(\mu\) 与 \(\sigma\) 两个参数完全确定。

定义 1 正态随机变量

\[ f(x)=\frac{1}{\sqrt{2\pi}\,\sigma}\,\exp\!\left\{-\frac{(x-\mu)^2}{2\sigma^2}\right\},\qquad -\infty<x<\infty, \]

其中 \(\mu\) 为任意实数,\(\sigma>0\)。以这一密度为概率密度函数(probability density function)的随机变量称为正态随机变量,记作 \(X\sim N(\mu,\sigma^2)\)。特别地,\(\mu=0,\ \sigma=1\) 时称为标准正态分布(standard normal distribution),其密度专用小写希腊字母 \(\varphi\) 表示(见定义 2)。

密度中的指数项 \((x-\mu)^2\) 保证了曲线关于直线 \(x=\mu\) 对称:\(\mu\) 是位置参数(location parameter),决定钟形中心落在数轴何处;\(\sigma\) 则是尺度参数(scale parameter),决定数据围绕 \(\mu\) 分散的程度。曲线在 \(x=\mu\) 处达到峰值 \(f(\mu)=\dfrac{1}{\sigma\sqrt{2\pi}}\)(\(\sigma=1\) 时约为 \(0.3989\)),在 \(x=\mu\pm\sigma\) 处各有一个拐点——钟形正是由此"顶部圆、两肩折"构成的。\(\sigma\) 越小,峰值越高、曲线越瘦陡;\(\sigma\) 越大,峰值越低、曲线越宽平。图 1 按真实比例画出了同一 \(\mu\) 下 \(\sigma=1,\,1.5,\,2\) 的三条曲线。

−6 −4 −2 μ 2 4 6 0.4 0.2 0.399 0.266 0.199 f(x) x σ = 1 σ = 1.5 σ = 2 三条曲线与 x 轴所夹面积均为 1:σ 越大,峰值越低,曲线越宽越平
图 1:同一 \(\mu\) 下 \(\sigma=1,\,1.5,\,2\) 的正态密度(按真实比例绘制)。峰值 \(1/(\sigma\sqrt{2\pi})\) 分别为 0.399、0.266、0.199;σ=1 的峰恰与纵轴刻度 0.4 相齐,σ=2 的峰与 0.2 相齐。曲线变宽必然变矮,因为每条曲线下的总面积都必须等于 1。
定理 1 正态分布的期望与方差

若 \(X\sim N(\mu,\sigma^2)\),则 \[ E[X]=\mu,\qquad \mathrm{Var}(X)=\sigma^2. \]

证明记 \(\varphi(t)=\dfrac{1}{\sqrt{2\pi}}e^{-t^2/2}\),则 \(f(x)=\dfrac{1}{\sigma}\varphi\!\left(\dfrac{x-\mu}{\sigma}\right)\)。作代换 \(x=\mu+\sigma t\)(\(\mathrm{d}x=\sigma\,\mathrm{d}t\)):\[ E[X]=\int_{-\infty}^{\infty}x\,f(x)\,\mathrm{d}x=\int_{-\infty}^{\infty}(\mu+\sigma t)\,\varphi(t)\,\mathrm{d}t =\mu\underbrace{\int_{-\infty}^{\infty}\varphi(t)\,\mathrm{d}t}_{=1}+\sigma\underbrace{\int_{-\infty}^{\infty}t\,\varphi(t)\,\mathrm{d}t}_{=0}=\mu, \] 第二个积分为零是因为 \(t\varphi(t)\) 是奇函数。同理 \[ E[(X-\mu)^2]=\int_{-\infty}^{\infty}(x-\mu)^2 f(x)\,\mathrm{d}x=\sigma^2\int_{-\infty}^{\infty}t^2\varphi(t)\,\mathrm{d}t. \] 由 \(\varphi'(t)=-t\,\varphi(t)\) 得 \(t\,\varphi(t)=-\varphi'(t)\),分部积分:\[ \int_{-\infty}^{\infty}t^2\varphi(t)\,\mathrm{d}t =-\int_{-\infty}^{\infty}t\,\varphi'(t)\,\mathrm{d}t =-\bigl[t\,\varphi(t)\bigr]_{-\infty}^{\infty}+\int_{-\infty}^{\infty}\varphi(t)\,\mathrm{d}t=0+1=1, \] 其中边界项为零是因为 \(t\varphi(t)\to 0\)。故 \(\mathrm{Var}(X)=\sigma^2\)。

这一定理使两个参数有了直接的概率含义:\(\mu\) 既是密度的对称中心,也是均值(由 5.2 节关于对称密度的结论同样可知 \(E[X]=\mu\));\(\sigma\) 就是标准差,衡量观测值围绕 \(\mu\) 的典型偏离。因此 "\(X\sim N(65,10^2)\)" 应读作:均值 65、标准差 10 的正态分布——第二个参数写的是方差 \(\sigma^2\)。

2. 标准化与 \(\Phi\) 函数:一张表算所有正态概率

正态分布有无穷多对 \((\mu,\sigma)\),难道每种组合都要一张概率表?所幸所有正态分布彼此只差一个线性变换,只需研究 \(\mu=0,\sigma=1\) 的那一个。把任意 \(X\sim N(\mu,\sigma^2)\) 减去均值、除以标准差,就得到标准化(standardization)变量 \(Z=(X-\mu)/\sigma\)。这一技巧在 5.7 节将作为随机变量函数分布的一般例子再次出现。

定义 2 标准正态密度与分布函数 \(\Phi\)

\[ \varphi(z)=\frac{1}{\sqrt{2\pi}}\,e^{-z^2/2},\qquad \Phi(z)=P(Z\le z)=\int_{-\infty}^{z}\varphi(t)\,\mathrm{d}t, \]

其中 \(Z\sim N(0,1)\) 为标准正态随机变量。\(\Phi(z)\) 就是标准正态曲线下从 \(-\infty\) 到 \(z\) 的面积,它从 0 单调上升到 1,且 \(\Phi(0)=0.5\)(密度关于 0 对称,中位数为 0)。

定理 2 标准化定理

若 \(X\sim N(\mu,\sigma^2)\),则 \[ Z=\frac{X-\mu}{\sigma}\sim N(0,1),\qquad P(X\le a)=\Phi\!\left(\frac{a-\mu}{\sigma}\right). \]

证明记 \(Z\) 的分布函数为 \(F_Z\)。对任意 \(z\),\[ F_Z(z)=P\!\left(\frac{X-\mu}{\sigma}\le z\right)=P(X\le\mu+\sigma z)=F_X(\mu+\sigma z). \] 两边对 \(z\) 求导(链式法则):\[ F_Z'(z)=F_X'(\mu+\sigma z)\cdot\sigma=f(\mu+\sigma z)\,\sigma=\frac{\sigma}{\sigma\sqrt{2\pi}}\,e^{-z^2/2}=\varphi(z), \] 即 \(Z\) 的密度恰为标准正态密度,故 \(Z\sim N(0,1)\)。再由 \(P(X\le a)=P\!\left(Z\le\dfrac{a-\mu}{\sigma}\right)\) 即得第二式。直观地说:把 \(x\) 轴的度量原点移到 \(\mu\)、单位放大 \(\sigma\) 倍,任何正态曲线都变成同一条标准钟形曲线。
定理 3 \(\Phi\) 的对称性

对一切 \(z\),\[ \Phi(-z)=1-\Phi(z),\qquad\text{从而}\quad P(-z<Z<z)=2\Phi(z)-1. \]

证明\(\varphi\) 是偶函数(\(\varphi(-t)=\varphi(t)\)。在 \(\Phi(-z)=\displaystyle\int_{-\infty}^{-z}\varphi(t)\,\mathrm{d}t\) 中令 \(u=-t\):\[ \Phi(-z)=\int_{\infty}^{z}\varphi(-u)(-\mathrm{d}u)=\int_{z}^{\infty}\varphi(u)\,\mathrm{d}u=1-\Phi(z). \] 几何上,这是钟形曲线左右对称的直接推论:左尾 \(-\infty\) 到 \(-z\) 的面积等于右尾 \(z\) 到 \(\infty\) 的面积。用它可把一切负 \(z\) 的查表化为正 \(z\) 的查表。
−4 −3 −2 −1 0 1 2 3 4 −1.96 1.96 z φ(z) P(−3<Z<3) = 0.9987 P(−1.96<Z<1.96) = 0.95 Φ(1) = 0.8413
图 2:标准正态密度与三块典型面积。绛红色区域为 \(\Phi(1)=0.8413\)(\(z\le 1\) 的全部面积);金色对称区间 \((-1.96,\,1.96)\) 内面积为 \(0.95\);最外层 \((-3,\,3)\) 内面积 \(0.9987\)。三块区域逐层嵌套,颜色叠加表示包含关系。

3. 查表、内插与综合例题

有了定理 2 与定理 3,任何正态概率都化为 \(\Phi\) 在正数处的取值。表 1 给出一张常用数值简表(书末附有更细的完整 \(\Phi\) 表)。

表 1:标准正态分布函数 \(\Phi(z)\) 简表(负值由 \(\Phi(-z)=1-\Phi(z)\) 得到)
\(z\)\(\Phi(z)\)\(z\)\(\Phi(z)\)
00.50001.6450.9500
0.50.69151.960.9750
10.841320.9772
1.280.89972.50.9938
1.50.933230.9987

查表的四种基本操作(设 \(X\sim N(\mu,\sigma^2)\),先标准化再查表):

  1. 左尾概率:\(P(X\le a)=\Phi\!\left(\dfrac{a-\mu}{\sigma}\right)\);
  2. 右尾概率:\(P(X>a)=1-\Phi\!\left(\dfrac{a-\mu}{\sigma}\right)\);
  3. 区间概率:\(P(a<X<b)=\Phi\!\left(\dfrac{b-\mu}{\sigma}\right)-\Phi\!\left(\dfrac{a-\mu}{\sigma}\right)\);
  4. 反查分位数(percentile):由概率值定出 \(z\),再由 \(x=\mu+\sigma z\) 还原到原变量。

若所需的 \(z\) 介于表中两行之间,可用线性内插(linear interpolation)。例如求 \(\Phi(1.2)\):它介于 \(\Phi(1)=0.8413\) 与 \(\Phi(1.28)=0.8997\) 之间,按比例 \[ \Phi(1.2)\approx 0.8413+\frac{1.2-1}{1.28-1}\times(0.8997-0.8413)=0.8413+0.0417=0.8830, \] 精确值为 \(0.8849\)。由于 \(\Phi\) 的曲线在 \(z>0\) 处向上凸,弦在曲线下方,线性内插总是略微偏低,但误差通常不超过千分之二。表中还藏着三个日后统计学反复使用的临界值:\(\Phi(1.28)=0.8997\)(第 90 百分位点)、\(\Phi(1.645)=0.95\)(第 95 百分位点)与 \(\Phi(1.96)=0.975\)(双侧 95% 的临界点)。

例 1 考试成绩(Ross 原书例题)

某次考试的成绩 \(X\) 近似服从 \(N(65,10^2)\)(均值 65 分,标准差 10 分)。求:(a) \(P(X>85)\);(b) \(P(55<X<75)\);(c) 前 10% 的分数线定为多少分(即求 \(x_0\) 使 \(P(X>x_0)=0.10\))?

标准化:\(Z=\dfrac{X-65}{10}\sim N(0,1)\)。
(a) \(P(X>85)=P\!\left(Z>\dfrac{85-65}{10}\right)=P(Z>2)=1-\Phi(2)=1-0.9772=0.0228\)。超过 85 分的约为全班 \(2.28\%\)。
(b) \(P(55<X<75)=P\!\left(-1<Z<1\right)=\Phi(1)-\Phi(-1)=2\Phi(1)-1\approx 2\times 0.8413-1\approx 0.6827\)(用四位表值算得 0.6826,由更精确的 \(\Phi(1)=0.84134\) 得 0.68269,即约 \(68.3\%\)——这正是 68-95-99.7 法则中的"68")。
(c) 设 \(P(X>x_0)=0.10\),即 \(1-\Phi\!\left(\dfrac{x_0-65}{10}\right)=0.10\),故 \(\Phi\!\left(\dfrac{x_0-65}{10}\right)=0.90\)。查表知 \(\Phi(1.28)=0.8997\approx 0.90\),于是 \(\dfrac{x_0-65}{10}=1.28\),\(x_0=65+10\times 1.28=77.8\)。分数线应定为 77.8 分:恰好有 10% 的学生成绩超过它。

4. 68-95-99.7 经验法则

把表 1 代入定理 3 的 \(2\Phi(z)-1\),得到三个最好记的数字:\[ P(|Z|<1)=2\Phi(1)-1\approx 0.6827,\qquad P(|Z|<2)\approx 0.9544,\qquad P(|Z|<3)\approx 0.9974. \] 换回一般的 \(X\sim N(\mu,\sigma^2)\),就是68-95-99.7 法则(empirical rule):约 68% 的概率落在 \(\mu\pm\sigma\) 内,约 95% 落在 \(\mu\pm 2\sigma\) 内,约 99.7% 落在 \(\mu\pm 3\sigma\) 内(图 3)。它给出正态数据离散程度的快速心算尺:三倍标准差之外的事件概率不足千分之三,通常视为"异常值"的信号。注意精确的 95% 中央区间边界不是 \(2\sigma\) 而是 \(1.96\sigma\)——这就是数理统计中无处不在的 1.96 的来源。

以 σ 为尺度的分层概率带(68-95-99.7 法则) μ±3σ 99.7% μ±2σ 95% μ±1σ 68.3% −4σ −3σ −2σ −1σ μ 由内到外逐层新增概率:68.3% → 27.2% → 4.3%(合计约 99.7%)
图 3:68-95-99.7 经验法则的分层色带。横轴以 \(\sigma\) 的倍数记:\(\mu\pm\sigma\) 内约 68.3%,\(\mu\pm 2\sigma\) 内约 95%(精确 95% 需 \(\mu\pm 1.96\sigma\)),\(\mu\pm 3\sigma\) 内约 99.7%。每向外扩一层,新增的概率急剧减少。
例 2 著名的 1.96:95% 中央区间

设 \(X\sim N(\mu,\sigma^2)\),证明 \(P(|X-\mu|<1.96\,\sigma)=0.95\),并说明区间 \((\mu-1.96\sigma,\ \mu+1.96\sigma)\) 的含义。

标准化后 \(Z=\dfrac{X-\mu}{\sigma}\sim N(0,1)\),且 \(|X-\mu|<1.96\sigma\) 等价于 \(|Z|<1.96\)。由定理 3,\[ P(|X-\mu|<1.96\sigma)=P(-1.96<Z<1.96)=2\Phi(1.96)-1=2\times 0.9750-1=0.95. \] 即任何正态随机变量都以 95% 的概率落入其均值左右 \(1.96\sigma\) 的范围内;等价地说,一次观测落在 \(\mu\pm1.96\sigma\) 之外的概率只有 5%。由于正态密度关于 \(\mu\) 对称且在两侧单调下降,这个对称区间还是容纳 95% 概率的最短区间。1.96 这个数字来自 \(\Phi(1.96)=0.975\) 恰好等于 \(1-0.05/2\),它是统计推断中"双侧 5% 显著性水平"的门槛(第 8 章之后各章将反复出现)。若嫌 1.96 繁琐,用 \(\mu\pm 2\sigma\) 得 \(0.9544\),作为粗估亦无不可。

5. 应用预告:二项分布的正态近似与历史注记

正态分布之所以"normal",还因为它是许多其他分布在大样本下的极限形状。最早被发现的情形是二项分布:当 \(n\) 很大时,\(B(n,p)\) 的直方图轮廓趋近于一条同均值、同方差的正态曲线(其理论保证是 8.3 节的中心极限定理,历史上称为 de Moivre–Laplace 定理)。先看一个预告性的计算。

例 3 二项分布的正态近似(8.3 节的先声)

掷一枚均匀硬币 100 次,\(X\) 为正面次数,\(X\sim B(100,\,0.5)\)。用正态近似计算 \(P(X\le 45)\)。

二项分布的均值与标准差为 \(\mu=np=100\times 0.5=50\),\(\sigma=\sqrt{np(1-p)}=\sqrt{25}=5\)。用 \(N(50,5^2)\) 近似 \(X\)。由于二项是离散型而正态是连续型,把整数点 45 "撑开"为区间 \((-\infty,\,45.5]\) 再标准化(这一步称为连续性修正(continuity correction)):\[ P(X\le 45)\approx P\!\left(Z<\frac{45.5-50}{5}\right)=P(Z<-0.9)=\Phi(-0.9)=1-\Phi(0.9)\approx 1-0.8159=0.1841, \] 其中 \(\Phi(0.9)=0.8159\) 取自更细的 \(\Phi\) 表(用表 1 在 0.5 与 1 之间内插得 0.811,略偏低)。直接求和二项概率的真值约为 0.1841——近似精度惊人。若不做连续性修正,则得 \(\Phi(-1)=0.1587\),偏差明显变大,可见修正的必要性。这一方法将在 8.3 节系统展开。
注记 从赌桌到星空:正态曲线的三位推手

正态曲线最早由亚伯拉罕·棣莫弗(Abraham de Moivre)于 1733 年在伦敦求得:他在研究二项分布 \(B(n,\tfrac12)\) 的近似时,发现了这条曲线——正是例 3 的源头,也是历史上第一个中心极限定理的雏形。拉普拉斯(Laplace)在 1812 年《概率的分析理论》中把棣莫弗的结果推广到一般 \(p\) 并发展为严格的极限定理。高斯(Gauss)则在 1809 年研究天文观测的误差理论(theory of errors)时,从"多个小误差叠加"的模型再次导出这条曲线,并用它奠定了最小二乘法的根基——从此天文学、大地测量学界称它为"高斯分布"。后来 K. 皮尔逊(Pearson)为其取名 "normal",既表示"常规、标准",也提醒人们:许多本来不是正态的量,在叠加与平均之下也会趋向它(第 8 章中心极限定理)。三种出身——赌金计算、极限定理、测量误差——同归一曲线,这正是它在概率统计中核心地位的来源。

6. 本节小结

要点回顾
  • 正态密度 \(f(x)=\dfrac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/(2\sigma^2)}\) 关于 \(\mu\) 对称;\(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2\);峰值 \(1/(\sigma\sqrt{2\pi})\) 在 \(x=\mu\) 处。
  • 标准化 \(Z=\dfrac{X-\mu}{\sigma}\sim N(0,1)\):一切正态概率归结为 \(\Phi\) 的查表,\(P(X\le a)=\Phi\!\left(\frac{a-\mu}{\sigma}\right)\)。
  • 对称性 \(\Phi(-z)=1-\Phi(z)\) 使负值免查;区间概率 \(P(a<X<b)=\Phi(z_b)-\Phi(z_a)\);表间数值用线性内插(略偏低)。
  • 68-95-99.7 法则:\(\mu\pm\sigma\)、\(\mu\pm2\sigma\)、\(\mu\pm3\sigma\) 分别含约 68.3%、95%、99.7% 的概率;精确的 95% 边界是 \(1.96\sigma\)。
  • 由百分位反解:\(\Phi(1.28)\approx0.90\)、\(\Phi(1.645)=0.95\)、\(\Phi(1.96)=0.975\);分数线类问题即 \(x_0=\mu+\sigma z\)。
  • 正态曲线源自 de Moivre(1733) 对二项的近似,经 Laplace 推广、Gauss 用于误差理论;二项 \(B(n,p)\) 在大 \(n\) 时可用 \(N(np,\,np(1-p))\) 近似(含连续性修正),详见 8.3 节。

练习

练习 5-4-1

查表计算:智商得分 \(X\sim N(100,15^2)\)。求 (a) \(P(X>130)\);(b) \(P(85<X<115)\);(c) \(P(X<100)\)。

答案与提示

(a) \(1-\Phi(2)=1-0.9772=0.0228\);(b) \(2\Phi(1)-1\approx0.6827\);(c) \(\Phi(0)=0.5\)——正态分布的中位数与均值相同,一半人在均值之下。

练习 5-4-2

对称区间:设 \(Z\sim N(0,1)\)。求 (a) \(P(-0.5<Z<2)\);(b) \(P(|Z|<1.645)\);(c) \(P(|Z|>2.5)\)。

答案与提示

(a) \(\Phi(2)-\Phi(-0.5)=\Phi(2)-[1-\Phi(0.5)]=0.9772-0.3085=0.6687\);(b) \(2\Phi(1.645)-1=2\times0.95-1=0.90\);(c) \(2[1-\Phi(2.5)]=2\times0.0062=0.0124\)。注意 (a) 是非对称区间,不能套用 \(2\Phi-1\)。

练习 5-4-3

反查分位数:利用表 1 求常数 \(c\):(a) \(P(Z\le c)=0.90\);(b) \(P(Z>c)=0.025\);(c) \(P(|Z|\le c)=0.95\)。

答案与提示

(a) \(c=1.28\)(因 \(\Phi(1.28)=0.8997\approx0.90\),即第 90 百分位点 \(z_{0.10}\));(b) \(c=1.96\)(因 \(\Phi(1.96)=0.975=1-0.025\));(c) \(c=1.96\)(\(2\Phi(c)-1=0.95\Rightarrow\Phi(c)=0.975\))。(b) 与 (c) 是同一分位点的"单侧/双侧"两种表述。

练习 5-4-4

由百分位反解 \(\mu,\sigma\):某地区成年男性身高 \(X\sim N(\mu,\sigma^2)\)。已知 \(P(X<165)=0.3085\),且 \(P(X>180)=0.0228\)。求 \(\mu\) 与 \(\sigma\)。

答案与提示

由 \(\Phi(0.5)=0.6915\) 得 \(0.3085=\Phi(-0.5)\),故 \((165-\mu)/\sigma=-0.5\);由 \(0.0228=1-\Phi(2)\) 得 \((180-\mu)/\sigma=2\)。两式联立:\(\mu=165+0.5\sigma\),代入第二式 \((180-165-0.5\sigma)/\sigma=2\Rightarrow 15=2.5\sigma\Rightarrow\sigma=6\),\(\mu=168\)(厘米)。验证:\((165-168)/6=-0.5\),\((180-168)/6=2\),均与已知吻合。

练习 5-4-5

概念辨析:例 1(c) 把分数线定在 77.8 分,但 \(P(X=77.8)=0\)(正态是连续型分布)。这是否意味着"前 10%"的说法自相矛盾?

答案与提示

不矛盾。连续型随机变量取任何单点概率为 0(5.1 节),但"前 10%"由尾部面积 \(P(X>77.8)=0.10\) 定义,与单点概率无关。分数线是一个阈值而非必须取得的分数;实际登记成绩经四舍五入离散化后,"高于 77.8"的近似比例仍约为 10%。