- 准确陈述中心极限定理,说明“标准化和依分布收敛于 \(\Phi\)”与“对原始分布形状不作任何要求”两层含义;
- 熟练使用两种实用形式——对部分和 \(\sum X_i\) 与对样本均值 \(\bar{X}\)——作近似概率计算;
- 掌握二项分布的正态近似与连续性校正(\(\pm 0.5\))的理由与用法;
- 能说清弱大数定律与中心极限定理的分工:“往哪收敛”与“以什么尺度、什么形状波动”;
- 了解定理的历史脉络(de Moivre → Laplace → Lindeberg/Feller)与 Berry–Esseen 界的含义(选学)。
1. 一个惊人的现象
上一节末我们留下一个悬念:切比雪夫不等式与弱大数定律只告诉我们样本均值 \(\bar{X}\) 会“贴住” \(\mu\),却说不出它以多大的幅度、按什么形状在 \(\mu\) 附近波动。本节的主角正面回答这个问题,它是全书最著名的定理。
先做一个模拟实验。令 \(X_i\) 服从 \((0,1)\) 上的均匀分布——一条与“钟形”毫无关系的平坦密度。把前 \(n\) 个独立观测相加,减去其均值 \(n/2\),再除以标准差 \(\sqrt{n/12}\),画出标准化和的直方图。图 1 显示了结果:\(n=1\) 时是完全平坦的;\(n=2\) 时是三角形的;\(n=5\) 时钟形已现;\(n=30\) 时与标准正态密度曲线几乎重合。
真正神奇的是:把均匀分布换成指数、伯努利、骰子点数……任何一个方差有限的分布,结局完全一样。正态分布是独立同分布随机变量之和的普适归宿——这一断言就是中心极限定理(central limit theorem, 简记 CLT)。
2. 定理的陈述与两种用法
CLT 断言的是“分布的形状”趋于正态,为此先给这种收敛方式一个名字。它是本教程用到的最弱的收敛概念:只要求分布函数逐点贴近,不要求随机变量本身(例如 \(Z_n\) 与 \(Z\) 定义在同一概率空间)有任何接近。
设随机变量 \(Z_n\) 的分布函数为 \(F_n\),随机变量 \(Z\) 的分布函数为 \(F\)。若在 \(F\) 的每个连续点 \(x\) 处都有 \(F_n(x)\to F(x)\),则称 \(Z_n\) 依分布收敛(convergence in distribution)于 \(Z\),记作 \(Z_n\Rightarrow Z\)。
例如本节中 \(F\) 就是标准正态分布函数 \(\Phi\),它在所有实数处连续,故只需对每个 \(x\) 验证 \(P(Z_n\le x)\to\Phi(x)\)。
设 \(X_1,X_2,\dots\) 独立同分布,期望 \(E[X_i]=\mu\),方差 \(\mathrm{Var}(X_i)=\sigma^2\in(0,\infty)\)。记标准化部分和 \[ Z_n=\frac{X_1+\cdots+X_n-n\mu}{\sigma\sqrt{n}}, \] 则对一切实数 \(x\), \[ \lim_{n\to\infty}P(Z_n\le x)=\Phi(x)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^{x}e^{-y^2/2}\,dy, \] 即 \(Z_n\) 依分布收敛于标准正态随机变量 \(Z\sim N(0,1)\)。
注意条件里只有“独立、同分布、期望方差存在且 \(\sigma>0\)”——对 \(X_i\) 的分布形状没有任何要求。证明需要较多分析工具,超出本书范围;直观要点是:标准化之后每一项的贡献都只有 \(O(1/\sqrt{n})\),没有一项能主导和的形状,而大量微小、独立贡献的叠加只有一种可能的极限形状——正态。
两种实用形式(\(n\) 较大时): \[ P\Big(\sum_{i=1}^{n}X_i\le a\Big)\approx \Phi\Big(\frac{a-n\mu}{\sigma\sqrt{n}}\Big),\qquad P(\bar{X}\le a)\approx \Phi\Big(\frac{a-\mu}{\sigma/\sqrt{n}}\Big), \] 第二式由第一式除以 \(n\) 得到。做近似时只需知道 \(\mu\) 与 \(\sigma\) 两个数,完全不必知道 \(X\) 的分布形状——这正是 CLT 威力所在。
设 \(X_i\sim U(0,1)\) 独立,\(n=12\)。求 \(\sum_{i=1}^{12}X_i\) 的近似分布,并计算 \(P\big(\sum X_i\le 7\big)\) 与 \(P\big(5\le\sum X_i\le 7\big)\)。
\(\sigma^2=\infty\) 时标准化 \(\sigma\sqrt{n}\) 失去意义,和的波动尺度不再服从 \(\sqrt{n}\) 律(重尾分布属于稳定分布的领地,超出本书范围,见练习 4);\(\sigma^2=0\) 意味着 \(X\) 是退化分布,和恒为常数,谈不上“形状”。此外“同分布”可以放宽为“独立但不必同分布”,只需各项都足够小、无一项主导,这就是第 5 小节提到的 Lindeberg 条件。
3. 二项分布的正态近似:连续性校正
最重要的特例是伯努利和:\(X\sim B(n,p)\)(4.6 节)等于 \(n\) 个独立 \(Bernoulli(p)\) 变量之和,故 \(\mu=np\),\(\sigma^2=np(1-p)\),CLT 直接可用。
设 \(X\sim B(n,p)\),记 \(\sigma=\sqrt{np(1-p)}\)。当 \(n\) 较大时, \[ P(X\le k)\approx\Phi\Big(\frac{k+0.5-np}{\sigma}\Big),\qquad P(a\le X\le b)\approx\Phi\Big(\frac{b+0.5-np}{\sigma}\Big)-\Phi\Big(\frac{a-0.5-np}{\sigma}\Big). \]
其中 \(\pm 0.5\) 称为连续性校正(continuity correction)。理由在图 2 中一目了然:\(X\) 是离散的,\(k\) 处的概率柱占据区间 \([k-0.5,\,k+0.5]\);事件 \(\{X\le 45\}\) 对应的柱区间一直延伸到 \(45.5\) 为止,故应以 \(45.5\)(而不是 \(45\))作为“等效连续点”代入密度曲线下面积。
掷一枚均匀硬币 \(n=100\) 次,\(X\) 为正面数。用正态近似计算 \(P(X\le 45)\),并比较不作连续性校正的结果。
4. 两个经典应用:保险与随机游走
CLT 之所以著名,在于它把“大量微小独立因素叠加”的现象变成可以查表计算的概率。以下两例是两种典型模式:先算出 \(n\mu\) 与 \(\sigma\sqrt{n}\),再标准化、查 \(\Phi\)。
某公司售出 10000 张一年期保单,每张独立地以概率 0.01 出险,出险即赔付 1000 元。求一年内总赔付额超过 120000 元的概率。
一质点从原点出发,每步独立地以概率 \(1/2\) 向右、概率 \(1/2\) 向左移动 1 个单位。求 100 步后位置 \(S\) 偏离原点超过 30 的概率。
5. 历史:从 de Moivre 到 Lindeberg–Feller
CLT 是概率论历史上第一个被严格研究的极限定理。1733 年,法国–英国数学家棣莫弗(A. de Moivre)对 \(p=1/2\) 的伯努利和建立了正态近似(并借助他与友人所发展的 \(n!\) 渐近公式,即 Stirling 公式),这是 CLT 的最早特例。1812 年,拉普拉斯(Laplace)在《概率的分析理论》中把近似推广到一般的 \(p\) 与大量独立误差之和,并给出了带误差阶的陈述。严格化是 20 世纪的工作:Liapounoff(1901)用矩条件给出证明,Lindeberg(1922)给出使 CLT 成立的Lindeberg 条件,Feller(1935)证明该条件还是必要的——至此“为什么正态普适”才有了完整答案。定理的名字由 Pólya 于 1920 年提出:“中心”意在强调它在整个理论中的中心地位。
6. 与弱大数定律的分工
把本节与 8.2 节放在一起看:弱大数定律说 \(\bar{X}_n\) 依概率收敛于 \(\mu\)——回答“往哪收敛”,但不含任何速率信息;中心极限定理说 \(\sqrt{n}(\bar{X}_n-\mu)/\sigma\) 依分布收敛于 \(N(0,1)\)——回答“以什么尺度(\(\sigma/\sqrt{n}\))、什么形状(钟形)在 \(\mu\) 附近波动”,可以查 \(\Phi\) 表定量计算。例如 \(n=10000\) 次重复测量、单次 \(\sigma=1\):弱大数定律只说误差趋于 0;CLT 则说误差近似 \(N(0,10^{-4})\),从而以 95% 的把握有 \(|\bar{X}-\mu|\le 1.96\times 0.01\approx 0.02\)。
| 弱大数定律(8.2 节) | 中心极限定理(本节) | |
|---|---|---|
| 结论 | \(\bar{X}_n\to\mu\)(依概率) | \(\sqrt{n}(\bar{X}_n-\mu)/\sigma\Rightarrow N(0,1)\) |
| 回答的问题 | 均值“往哪收敛” | 均值“以什么尺度、什么形状波动” |
| 精度信息 | 无(只说偏离概率趋于 0) | 尺度 \(\sigma/\sqrt{n}\),可查表定量 |
| 相互关系 | 在方差存在的条件下可由 CLT 推出(定理 3) | |
设 \(X_1,X_2,\dots\) 独立同分布,\(E[X_i]=\mu\),\(\mathrm{Var}(X_i)=\sigma^2<\infty\),则由定理 1 可推出:\(\bar{X}_n\) 依概率收敛于 \(\mu\)。
值得注意,两种收敛类型(依分布与依概率)本身并无可比强弱,这里之所以能“打通”,是因为收敛目标是常数 \(\mu\):分布集中到一点时,依分布收敛自动升级为依概率收敛。若不借道 CLT,弱大数定律只需方差存在(甚至只需 \(E|X|<\infty\),见 8.4 节的强大数定律),条件更弱。
7. 选学:收敛有多快——Berry–Esseen 界
图 1 中 \(n=30\) 已几乎重合,但这只是均匀分布的情形。一般地,若三阶绝对矩 \(\rho=E|X-\mu|^3\) 有限,则对一切 \(n\) 与 \(x\) 一致地有 \[ \sup_x\Big|P\Big(\frac{\sum X_i-n\mu}{\sigma\sqrt{n}}\le x\Big)-\Phi(x)\Big|\le C\cdot\frac{\rho}{\sigma^3\sqrt{n}}, \] 其中 \(C\) 是与分布无关的万有常数,目前所知的最佳上界约为 \(0.4748\)(Shevtsova,2011)。它告诉我们:其一,收敛速度一律是 \(O(n^{-1/2})\),不加校正时不必指望更快;其二,比值 \(\rho/\sigma^3\) 度量分布“偏离正态”的程度,越接近正态越快。以 \(U(0,1)\) 为例:\(\rho=1/32\),\(\sigma^3=(1/12)^{3/2}\approx 0.0241\),\(\rho/\sigma^3\approx 1.30\),\(n=30\) 时界约为 \(0.4748\times 1.30/\sqrt{30}\approx 0.11\)——与图 1 中 \(n=30\) 面板的吻合水平相当。至于“独立但不同分布”的完整刻画,正是第 5 小节提到的 Lindeberg 条件(Lindeberg 1922;Feller 1935 证其必要)。
8. 本节小结
- CLT:\(X_i\) 独立同分布、期望方差有限时,标准化和 \(\dfrac{\sum X_i-n\mu}{\sigma\sqrt{n}}\) 依分布收敛于 \(N(0,1)\)——与原始分布的形状无关。
- 两种用法:\(P(\sum X_i\le a)\approx\Phi\big((a-n\mu)/(\sigma\sqrt{n})\big)\);对 \(\bar{X}\) 则用尺度 \(\sigma/\sqrt{n}\)。
- 二项近似:\(X\sim B(n,p)\) 时用 \(\mu=np\)、\(\sigma=\sqrt{np(1-p)}\),并以 \(\pm 0.5\) 作连续性校正(例 2:\(\Phi(-0.9)=0.1841\),几乎精确)。
- 计算模式:求 \(n\mu\) 与 \(\sigma\sqrt{n}\) → 标准化 → 查 \(\Phi\) 表;保险(例 3)、随机游走(例 4)是两大原型。
- 分工:弱大数定律说“往哪收敛”,CLT 说“以什么尺度、什么形状波动”;方差存在时 CLT 蕴含弱大数定律(定理 3)。
- 历史主线:de Moivre(1733,伯努利)→ Laplace(1812,一般化)→ Liapounoff/Lindeberg/Feller(20 世纪严格化);收敛速度由 Berry–Esseen 界 \(O(n^{-1/2})\) 刻画(选学)。
练习
练习 8-3-1
设 \(X_i\sim U(0,1)\) 独立,\(n=100\)。用 CLT 估计 \(P\big(\sum X_i>55\big)。
答案与提示\(n\mu=50\),\(\sigma\sqrt{n}=\sqrt{100/12}\approx 2.887\),\(z=(55-50)/2.887\approx 1.73\),故概率 \(\approx 1-\Phi(1.73)\approx 0.042\)。
练习 8-3-2
掷一颗骰子 300 次,\(S\) 为总点数。估计 \(P(1000\le S\le 1100)\)。
答案与提示单次 \(E=3.5\),\(\mathrm{Var}=35/12\);故 \(E[S]=1050\),\(\mathrm{sd}(S)=\sqrt{300\times 35/12}=\sqrt{875}\approx 29.6\)。\(z=\pm 50/29.6\approx\pm 1.69\),概率 \(\approx 2\Phi(1.69)-1\approx 0.909\)(作连续性校正约 \(0.913\))。
练习 8-3-3
\(X\sim B(400,\,0.5)\)。用连续性校正计算 \(P(X\le 180)\)。
答案与提示\(\mu=200\),\(\sigma=10\);以 180.5 代入:\(z=(180.5-200)/10=-1.95\),\(P\approx\Phi(-1.95)=0.0256\)。不作校正会得 \(\Phi(-2)=0.0228\),偏差约 11%。
练习 8-3-4
判断:柯西分布(密度 \(f(x)=\frac{1}{\pi(1+x^2)}\))的样本均值是否满足 CLT?CLT 到底需要什么条件?
答案与提示不满足。柯西分布连期望都不存在(\(\int|x|f(x)dx\) 发散),更无方差,CLT 的前提(\(E[X_i]\)、\(\mathrm{Var}(X_i)\) 有限且 \(\sigma>0\))不成立。事实上柯西分布是稳定分布:\(\bar{X}_n\) 仍服从同一柯西分布,根本不收敛于常数——大数定律也失效。这说明“矩条件”不是技术装饰,而是实质前提。
练习 8-3-5
篮球赛:两队各打 100 个回合,每回合得分 \(X\)(与 \(Y\) 独立同分布)取 0、2、3 分的概率分别为 0.5、0.4、0.1。用 CLT 估计分差 \(D=\sum X_i-\sum Y_i\) 的绝对值不超过 20 分的概率。
答案与提示\(E[X]=1.1\),\(E[X^2]=1.7\),\(\mathrm{Var}(X)=0.49\)。两队得分独立,\(D\) 近似 \(N(0,\ 200\times 0.49=98)\),\(\mathrm{sd}\approx 9.9\)。\(z=20/9.9\approx 2.02\),故 \(P(|D|\le 20)\approx 2\Phi(2.02)-1\approx 0.96\)。