- 写出正态分布的概率密度函数,说明参数 \(\mu\)(位置)与 \(\sigma\)(尺度)分别如何决定曲线的位置与胖瘦;
- 用标准化变换 \(Z=(X-\mu)/\sigma\) 把任意正态随机变量的概率计算归结为标准正态分布函数 \(\Phi\) 的查表;
- 熟练运用对称性 \(\Phi(-z)=1-\Phi(z)\) 与线性内插完成正反两个方向的查表;
- 陈述 68-95-99.7 经验法则,并解释 1.28、1.645、1.96 等常用临界值的由来;
- 了解正态分布从 de Moivre 到 Laplace、Gauss 的历史脉络,以及它作为二项分布近似(第 8 章中心极限定理的先声)的角色。
1. 正态密度:一条钟形曲线与两个参数
测量一台仪器的读数误差、一场考试的成绩、某地区成年男性的身高、加工零件的直径偏差——把大量这类数据的直方图画出来,它们几乎都呈现出同一种形状:中间高、两边低、左右对称的"钟形"。刻画这类现象的模型,就是本教程中最重要的连续型分布。正态随机变量(normal random variable)又称高斯随机变量(Gaussian random variable),若 \(X\) 服从正态分布,记作 \(X\sim N(\mu,\sigma^2)\),其密度由 \(\mu\) 与 \(\sigma\) 两个参数完全确定。
\[ f(x)=\frac{1}{\sqrt{2\pi}\,\sigma}\,\exp\!\left\{-\frac{(x-\mu)^2}{2\sigma^2}\right\},\qquad -\infty<x<\infty, \]
其中 \(\mu\) 为任意实数,\(\sigma>0\)。以这一密度为概率密度函数(probability density function)的随机变量称为正态随机变量,记作 \(X\sim N(\mu,\sigma^2)\)。特别地,\(\mu=0,\ \sigma=1\) 时称为标准正态分布(standard normal distribution),其密度专用小写希腊字母 \(\varphi\) 表示(见定义 2)。
密度中的指数项 \((x-\mu)^2\) 保证了曲线关于直线 \(x=\mu\) 对称:\(\mu\) 是位置参数(location parameter),决定钟形中心落在数轴何处;\(\sigma\) 则是尺度参数(scale parameter),决定数据围绕 \(\mu\) 分散的程度。曲线在 \(x=\mu\) 处达到峰值 \(f(\mu)=\dfrac{1}{\sigma\sqrt{2\pi}}\)(\(\sigma=1\) 时约为 \(0.3989\)),在 \(x=\mu\pm\sigma\) 处各有一个拐点——钟形正是由此"顶部圆、两肩折"构成的。\(\sigma\) 越小,峰值越高、曲线越瘦陡;\(\sigma\) 越大,峰值越低、曲线越宽平。图 1 按真实比例画出了同一 \(\mu\) 下 \(\sigma=1,\,1.5,\,2\) 的三条曲线。
若 \(X\sim N(\mu,\sigma^2)\),则 \[ E[X]=\mu,\qquad \mathrm{Var}(X)=\sigma^2. \]
这一定理使两个参数有了直接的概率含义:\(\mu\) 既是密度的对称中心,也是均值(由 5.2 节关于对称密度的结论同样可知 \(E[X]=\mu\));\(\sigma\) 就是标准差,衡量观测值围绕 \(\mu\) 的典型偏离。因此 "\(X\sim N(65,10^2)\)" 应读作:均值 65、标准差 10 的正态分布——第二个参数写的是方差 \(\sigma^2\)。
2. 标准化与 \(\Phi\) 函数:一张表算所有正态概率
正态分布有无穷多对 \((\mu,\sigma)\),难道每种组合都要一张概率表?所幸所有正态分布彼此只差一个线性变换,只需研究 \(\mu=0,\sigma=1\) 的那一个。把任意 \(X\sim N(\mu,\sigma^2)\) 减去均值、除以标准差,就得到标准化(standardization)变量 \(Z=(X-\mu)/\sigma\)。这一技巧在 5.7 节将作为随机变量函数分布的一般例子再次出现。
\[ \varphi(z)=\frac{1}{\sqrt{2\pi}}\,e^{-z^2/2},\qquad \Phi(z)=P(Z\le z)=\int_{-\infty}^{z}\varphi(t)\,\mathrm{d}t, \]
其中 \(Z\sim N(0,1)\) 为标准正态随机变量。\(\Phi(z)\) 就是标准正态曲线下从 \(-\infty\) 到 \(z\) 的面积,它从 0 单调上升到 1,且 \(\Phi(0)=0.5\)(密度关于 0 对称,中位数为 0)。
若 \(X\sim N(\mu,\sigma^2)\),则 \[ Z=\frac{X-\mu}{\sigma}\sim N(0,1),\qquad P(X\le a)=\Phi\!\left(\frac{a-\mu}{\sigma}\right). \]
对一切 \(z\),\[ \Phi(-z)=1-\Phi(z),\qquad\text{从而}\quad P(-z<Z<z)=2\Phi(z)-1. \]
3. 查表、内插与综合例题
有了定理 2 与定理 3,任何正态概率都化为 \(\Phi\) 在正数处的取值。表 1 给出一张常用数值简表(书末附有更细的完整 \(\Phi\) 表)。
| \(z\) | \(\Phi(z)\) | \(z\) | \(\Phi(z)\) |
|---|---|---|---|
| 0 | 0.5000 | 1.645 | 0.9500 |
| 0.5 | 0.6915 | 1.96 | 0.9750 |
| 1 | 0.8413 | 2 | 0.9772 |
| 1.28 | 0.8997 | 2.5 | 0.9938 |
| 1.5 | 0.9332 | 3 | 0.9987 |
查表的四种基本操作(设 \(X\sim N(\mu,\sigma^2)\),先标准化再查表):
- 左尾概率:\(P(X\le a)=\Phi\!\left(\dfrac{a-\mu}{\sigma}\right)\);
- 右尾概率:\(P(X>a)=1-\Phi\!\left(\dfrac{a-\mu}{\sigma}\right)\);
- 区间概率:\(P(a<X<b)=\Phi\!\left(\dfrac{b-\mu}{\sigma}\right)-\Phi\!\left(\dfrac{a-\mu}{\sigma}\right)\);
- 反查分位数(percentile):由概率值定出 \(z\),再由 \(x=\mu+\sigma z\) 还原到原变量。
若所需的 \(z\) 介于表中两行之间,可用线性内插(linear interpolation)。例如求 \(\Phi(1.2)\):它介于 \(\Phi(1)=0.8413\) 与 \(\Phi(1.28)=0.8997\) 之间,按比例 \[ \Phi(1.2)\approx 0.8413+\frac{1.2-1}{1.28-1}\times(0.8997-0.8413)=0.8413+0.0417=0.8830, \] 精确值为 \(0.8849\)。由于 \(\Phi\) 的曲线在 \(z>0\) 处向上凸,弦在曲线下方,线性内插总是略微偏低,但误差通常不超过千分之二。表中还藏着三个日后统计学反复使用的临界值:\(\Phi(1.28)=0.8997\)(第 90 百分位点)、\(\Phi(1.645)=0.95\)(第 95 百分位点)与 \(\Phi(1.96)=0.975\)(双侧 95% 的临界点)。
某次考试的成绩 \(X\) 近似服从 \(N(65,10^2)\)(均值 65 分,标准差 10 分)。求:(a) \(P(X>85)\);(b) \(P(55<X<75)\);(c) 前 10% 的分数线定为多少分(即求 \(x_0\) 使 \(P(X>x_0)=0.10\))?
(a) \(P(X>85)=P\!\left(Z>\dfrac{85-65}{10}\right)=P(Z>2)=1-\Phi(2)=1-0.9772=0.0228\)。超过 85 分的约为全班 \(2.28\%\)。
(b) \(P(55<X<75)=P\!\left(-1<Z<1\right)=\Phi(1)-\Phi(-1)=2\Phi(1)-1\approx 2\times 0.8413-1\approx 0.6827\)(用四位表值算得 0.6826,由更精确的 \(\Phi(1)=0.84134\) 得 0.68269,即约 \(68.3\%\)——这正是 68-95-99.7 法则中的"68")。
(c) 设 \(P(X>x_0)=0.10\),即 \(1-\Phi\!\left(\dfrac{x_0-65}{10}\right)=0.10\),故 \(\Phi\!\left(\dfrac{x_0-65}{10}\right)=0.90\)。查表知 \(\Phi(1.28)=0.8997\approx 0.90\),于是 \(\dfrac{x_0-65}{10}=1.28\),\(x_0=65+10\times 1.28=77.8\)。分数线应定为 77.8 分:恰好有 10% 的学生成绩超过它。
4. 68-95-99.7 经验法则
把表 1 代入定理 3 的 \(2\Phi(z)-1\),得到三个最好记的数字:\[ P(|Z|<1)=2\Phi(1)-1\approx 0.6827,\qquad P(|Z|<2)\approx 0.9544,\qquad P(|Z|<3)\approx 0.9974. \] 换回一般的 \(X\sim N(\mu,\sigma^2)\),就是68-95-99.7 法则(empirical rule):约 68% 的概率落在 \(\mu\pm\sigma\) 内,约 95% 落在 \(\mu\pm 2\sigma\) 内,约 99.7% 落在 \(\mu\pm 3\sigma\) 内(图 3)。它给出正态数据离散程度的快速心算尺:三倍标准差之外的事件概率不足千分之三,通常视为"异常值"的信号。注意精确的 95% 中央区间边界不是 \(2\sigma\) 而是 \(1.96\sigma\)——这就是数理统计中无处不在的 1.96 的来源。
设 \(X\sim N(\mu,\sigma^2)\),证明 \(P(|X-\mu|<1.96\,\sigma)=0.95\),并说明区间 \((\mu-1.96\sigma,\ \mu+1.96\sigma)\) 的含义。
5. 应用预告:二项分布的正态近似与历史注记
正态分布之所以"normal",还因为它是许多其他分布在大样本下的极限形状。最早被发现的情形是二项分布:当 \(n\) 很大时,\(B(n,p)\) 的直方图轮廓趋近于一条同均值、同方差的正态曲线(其理论保证是 8.3 节的中心极限定理,历史上称为 de Moivre–Laplace 定理)。先看一个预告性的计算。
掷一枚均匀硬币 100 次,\(X\) 为正面次数,\(X\sim B(100,\,0.5)\)。用正态近似计算 \(P(X\le 45)\)。
正态曲线最早由亚伯拉罕·棣莫弗(Abraham de Moivre)于 1733 年在伦敦求得:他在研究二项分布 \(B(n,\tfrac12)\) 的近似时,发现了这条曲线——正是例 3 的源头,也是历史上第一个中心极限定理的雏形。拉普拉斯(Laplace)在 1812 年《概率的分析理论》中把棣莫弗的结果推广到一般 \(p\) 并发展为严格的极限定理。高斯(Gauss)则在 1809 年研究天文观测的误差理论(theory of errors)时,从"多个小误差叠加"的模型再次导出这条曲线,并用它奠定了最小二乘法的根基——从此天文学、大地测量学界称它为"高斯分布"。后来 K. 皮尔逊(Pearson)为其取名 "normal",既表示"常规、标准",也提醒人们:许多本来不是正态的量,在叠加与平均之下也会趋向它(第 8 章中心极限定理)。三种出身——赌金计算、极限定理、测量误差——同归一曲线,这正是它在概率统计中核心地位的来源。
6. 本节小结
- 正态密度 \(f(x)=\dfrac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/(2\sigma^2)}\) 关于 \(\mu\) 对称;\(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2\);峰值 \(1/(\sigma\sqrt{2\pi})\) 在 \(x=\mu\) 处。
- 标准化 \(Z=\dfrac{X-\mu}{\sigma}\sim N(0,1)\):一切正态概率归结为 \(\Phi\) 的查表,\(P(X\le a)=\Phi\!\left(\frac{a-\mu}{\sigma}\right)\)。
- 对称性 \(\Phi(-z)=1-\Phi(z)\) 使负值免查;区间概率 \(P(a<X<b)=\Phi(z_b)-\Phi(z_a)\);表间数值用线性内插(略偏低)。
- 68-95-99.7 法则:\(\mu\pm\sigma\)、\(\mu\pm2\sigma\)、\(\mu\pm3\sigma\) 分别含约 68.3%、95%、99.7% 的概率;精确的 95% 边界是 \(1.96\sigma\)。
- 由百分位反解:\(\Phi(1.28)\approx0.90\)、\(\Phi(1.645)=0.95\)、\(\Phi(1.96)=0.975\);分数线类问题即 \(x_0=\mu+\sigma z\)。
- 正态曲线源自 de Moivre(1733) 对二项的近似,经 Laplace 推广、Gauss 用于误差理论;二项 \(B(n,p)\) 在大 \(n\) 时可用 \(N(np,\,np(1-p))\) 近似(含连续性修正),详见 8.3 节。
练习
练习 5-4-1
查表计算:智商得分 \(X\sim N(100,15^2)\)。求 (a) \(P(X>130)\);(b) \(P(85<X<115)\);(c) \(P(X<100)\)。
答案与提示(a) \(1-\Phi(2)=1-0.9772=0.0228\);(b) \(2\Phi(1)-1\approx0.6827\);(c) \(\Phi(0)=0.5\)——正态分布的中位数与均值相同,一半人在均值之下。
练习 5-4-2
对称区间:设 \(Z\sim N(0,1)\)。求 (a) \(P(-0.5<Z<2)\);(b) \(P(|Z|<1.645)\);(c) \(P(|Z|>2.5)\)。
答案与提示(a) \(\Phi(2)-\Phi(-0.5)=\Phi(2)-[1-\Phi(0.5)]=0.9772-0.3085=0.6687\);(b) \(2\Phi(1.645)-1=2\times0.95-1=0.90\);(c) \(2[1-\Phi(2.5)]=2\times0.0062=0.0124\)。注意 (a) 是非对称区间,不能套用 \(2\Phi-1\)。
练习 5-4-3
反查分位数:利用表 1 求常数 \(c\):(a) \(P(Z\le c)=0.90\);(b) \(P(Z>c)=0.025\);(c) \(P(|Z|\le c)=0.95\)。
答案与提示(a) \(c=1.28\)(因 \(\Phi(1.28)=0.8997\approx0.90\),即第 90 百分位点 \(z_{0.10}\));(b) \(c=1.96\)(因 \(\Phi(1.96)=0.975=1-0.025\));(c) \(c=1.96\)(\(2\Phi(c)-1=0.95\Rightarrow\Phi(c)=0.975\))。(b) 与 (c) 是同一分位点的"单侧/双侧"两种表述。
练习 5-4-4
由百分位反解 \(\mu,\sigma\):某地区成年男性身高 \(X\sim N(\mu,\sigma^2)\)。已知 \(P(X<165)=0.3085\),且 \(P(X>180)=0.0228\)。求 \(\mu\) 与 \(\sigma\)。
答案与提示由 \(\Phi(0.5)=0.6915\) 得 \(0.3085=\Phi(-0.5)\),故 \((165-\mu)/\sigma=-0.5\);由 \(0.0228=1-\Phi(2)\) 得 \((180-\mu)/\sigma=2\)。两式联立:\(\mu=165+0.5\sigma\),代入第二式 \((180-165-0.5\sigma)/\sigma=2\Rightarrow 15=2.5\sigma\Rightarrow\sigma=6\),\(\mu=168\)(厘米)。验证:\((165-168)/6=-0.5\),\((180-168)/6=2\),均与已知吻合。
练习 5-4-5
概念辨析:例 1(c) 把分数线定在 77.8 分,但 \(P(X=77.8)=0\)(正态是连续型分布)。这是否意味着"前 10%"的说法自相矛盾?
答案与提示不矛盾。连续型随机变量取任何单点概率为 0(5.1 节),但"前 10%"由尾部面积 \(P(X>77.8)=0.10\) 定义,与单点概率无关。分数线是一个阈值而非必须取得的分数;实际登记成绩经四舍五入离散化后,"高于 77.8"的近似比例仍约为 10%。