第 8 章 · 极限定理

8.3 中心极限定理

The Central Limit Theorem
学习目标
  • 准确陈述中心极限定理,说明“标准化和依分布收敛于 \(\Phi\)”与“对原始分布形状不作任何要求”两层含义;
  • 熟练使用两种实用形式——对部分和 \(\sum X_i\) 与对样本均值 \(\bar{X}\)——作近似概率计算;
  • 掌握二项分布的正态近似与连续性校正(\(\pm 0.5\))的理由与用法;
  • 能说清弱大数定律与中心极限定理的分工:“往哪收敛”与“以什么尺度、什么形状波动”;
  • 了解定理的历史脉络(de Moivre → Laplace → Lindeberg/Feller)与 Berry–Esseen 界的含义(选学)。

1. 一个惊人的现象

上一节末我们留下一个悬念:切比雪夫不等式与弱大数定律只告诉我们样本均值 \(\bar{X}\) 会“贴住” \(\mu\),却说不出它以多大的幅度、按什么形状在 \(\mu\) 附近波动。本节的主角正面回答这个问题,它是全书最著名的定理。

先做一个模拟实验。令 \(X_i\) 服从 \((0,1)\) 上的均匀分布——一条与“钟形”毫无关系的平坦密度。把前 \(n\) 个独立观测相加,减去其均值 \(n/2\),再除以标准差 \(\sqrt{n/12}\),画出标准化和的直方图。图 1 显示了结果:\(n=1\) 时是完全平坦的;\(n=2\) 时是三角形的;\(n=5\) 时钟形已现;\(n=30\) 时与标准正态密度曲线几乎重合。

n = 1 f(z) -202 n = 2 f(z) -202 n = 5 f(z) -202 n = 30 f(z) -202 纵轴:标准化和的密度 蓝线:标准正态密度 φ(z)(各面板同尺度)
图 1:从 \(U(0,1)\) 出发的标准化和。\(n=1\) 时是平顶的均匀密度(支撑 \(\pm\sqrt{3}\)),\(n=2\) 时是三角形,\(n=5\) 已具钟形,\(n=30\) 的直方图(示意)与标准正态密度曲线(蓝)几乎重合。起点与“正态”毫无关系,终点却只有一个人。

真正神奇的是:把均匀分布换成指数、伯努利、骰子点数……任何一个方差有限的分布,结局完全一样。正态分布是独立同分布随机变量之和的普适归宿——这一断言就是中心极限定理(central limit theorem, 简记 CLT)。

2. 定理的陈述与两种用法

CLT 断言的是“分布的形状”趋于正态,为此先给这种收敛方式一个名字。它是本教程用到的最弱的收敛概念:只要求分布函数逐点贴近,不要求随机变量本身(例如 \(Z_n\) 与 \(Z\) 定义在同一概率空间)有任何接近。

定义 1 依分布收敛

设随机变量 \(Z_n\) 的分布函数为 \(F_n\),随机变量 \(Z\) 的分布函数为 \(F\)。若在 \(F\) 的每个连续点 \(x\) 处都有 \(F_n(x)\to F(x)\),则称 \(Z_n\) 依分布收敛(convergence in distribution)于 \(Z\),记作 \(Z_n\Rightarrow Z\)。

例如本节中 \(F\) 就是标准正态分布函数 \(\Phi\),它在所有实数处连续,故只需对每个 \(x\) 验证 \(P(Z_n\le x)\to\Phi(x)\)。

定理 1 中心极限定理(Lindeberg–Lévy 形式)

设 \(X_1,X_2,\dots\) 独立同分布,期望 \(E[X_i]=\mu\),方差 \(\mathrm{Var}(X_i)=\sigma^2\in(0,\infty)\)。记标准化部分和 \[ Z_n=\frac{X_1+\cdots+X_n-n\mu}{\sigma\sqrt{n}}, \] 则对一切实数 \(x\), \[ \lim_{n\to\infty}P(Z_n\le x)=\Phi(x)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^{x}e^{-y^2/2}\,dy, \] 即 \(Z_n\) 依分布收敛于标准正态随机变量 \(Z\sim N(0,1)\)。

注意条件里只有“独立、同分布、期望方差存在且 \(\sigma>0\)”——对 \(X_i\) 的分布形状没有任何要求。证明需要较多分析工具,超出本书范围;直观要点是:标准化之后每一项的贡献都只有 \(O(1/\sqrt{n})\),没有一项能主导和的形状,而大量微小、独立贡献的叠加只有一种可能的极限形状——正态。

两种实用形式(\(n\) 较大时): \[ P\Big(\sum_{i=1}^{n}X_i\le a\Big)\approx \Phi\Big(\frac{a-n\mu}{\sigma\sqrt{n}}\Big),\qquad P(\bar{X}\le a)\approx \Phi\Big(\frac{a-\mu}{\sigma/\sqrt{n}}\Big), \] 第二式由第一式除以 \(n\) 得到。做近似时只需知道 \(\mu\) 与 \(\sigma\) 两个数,完全不必知道 \(X\) 的分布形状——这正是 CLT 威力所在。

例 1 十二个均匀数之和:最早的正态随机数发生器

设 \(X_i\sim U(0,1)\) 独立,\(n=12\)。求 \(\sum_{i=1}^{12}X_i\) 的近似分布,并计算 \(P\big(\sum X_i\le 7\big)\) 与 \(P\big(5\le\sum X_i\le 7\big)\)。

\(\mu=1/2\),\(\sigma^2=1/12\)。于是 \(n\mu=6\),\(\sigma\sqrt{n}=\sqrt{12\cdot(1/12)}=1\),故 \[ \sum_{i=1}^{12}X_i\ \text{近似服从}\ N(6,\,1). \] 从而 \(P(\sum X_i\le 7)\approx\Phi\big((7-6)/1\big)=\Phi(1)=0.8413\);\(P(5\le\sum X_i\le 7)\approx\Phi(1)-\Phi(-1)=0.6826\)。 历史上这正是早期计算机生成正态随机数的经典方法:把 12 个均匀随机数相加再减去 6,就得到近似 \(N(0,1)\) 的样本(其尾部精度有限,现已多被 Box–Muller 等方法取代)。一个与“钟形”无关的平坦分布,仅求 12 次和就已相当接近正态。
注记 为什么要求方差存在且非零

\(\sigma^2=\infty\) 时标准化 \(\sigma\sqrt{n}\) 失去意义,和的波动尺度不再服从 \(\sqrt{n}\) 律(重尾分布属于稳定分布的领地,超出本书范围,见练习 4);\(\sigma^2=0\) 意味着 \(X\) 是退化分布,和恒为常数,谈不上“形状”。此外“同分布”可以放宽为“独立但不必同分布”,只需各项都足够小、无一项主导,这就是第 5 小节提到的 Lindeberg 条件。

3. 二项分布的正态近似:连续性校正

最重要的特例是伯努利和:\(X\sim B(n,p)\)(4.6 节)等于 \(n\) 个独立 \(Bernoulli(p)\) 变量之和,故 \(\mu=np\),\(\sigma^2=np(1-p)\),CLT 直接可用。

定理 2 de Moivre–Laplace 定理(二项的正态近似)

设 \(X\sim B(n,p)\),记 \(\sigma=\sqrt{np(1-p)}\)。当 \(n\) 较大时, \[ P(X\le k)\approx\Phi\Big(\frac{k+0.5-np}{\sigma}\Big),\qquad P(a\le X\le b)\approx\Phi\Big(\frac{b+0.5-np}{\sigma}\Big)-\Phi\Big(\frac{a-0.5-np}{\sigma}\Big). \]

其中 \(\pm 0.5\) 称为连续性校正(continuity correction)。理由在图 2 中一目了然:\(X\) 是离散的,\(k\) 处的概率柱占据区间 \([k-0.5,\,k+0.5]\);事件 \(\{X\le 45\}\) 对应的柱区间一直延伸到 \(45.5\) 为止,故应以 \(45.5\)(而不是 \(45\))作为“等效连续点”代入密度曲线下面积。

例 2 掷 100 次硬币:校正与不校正的差别

掷一枚均匀硬币 \(n=100\) 次,\(X\) 为正面数。用正态近似计算 \(P(X\le 45)\),并比较不作连续性校正的结果。

这里 \(np=50\),\(\sigma=\sqrt{100\times 0.25}=5\)。 \[ P(X\le 45)\approx\Phi\Big(\frac{45.5-50}{5}\Big)=\Phi(-0.9)=0.1841. \] 若不作校正,则得 \(\Phi\big((45-50)/5\big)=\Phi(-1)=0.1587\),相对偏差约 \(14\%\)。而按分布列逐项求和(\(\sum_{k\le 45}\binom{100}{k}2^{-100}\))的精确值约为 \(0.1841\)——校正后的近似几乎完美。经验:\(np\) 与 \(n(1-p)\) 都不小于 \(5\)(更稳妥些不小于 \(10\))时近似良好;若 \(p\) 很小而 \(\lambda=np\) 适中,则应改用泊松近似(4.7 节)。
B(100, 0.5) 分布列 与 N(50, 5²) 密度的叠加 00.040.08 45.5 303540 455055 606570 正面次数 k B(100, 0.5) 分布列 N(50, 5²) 密度曲线
图 2:例 2 的几何。\(B(100,0.5)\) 的分布列(蓝柱,按真实概率比例绘制)与正态 \(N(50,25)\) 密度曲线(红线,纵轴为密度 \(\times 1\))几乎重合。金色虚线在 \(k=45.5\):事件 \(\{X\le 45\}\) 的柱区间延伸到此处为止,这正是连续性校正 \(\pm 0.5\) 的来源。

4. 两个经典应用:保险与随机游走

CLT 之所以著名,在于它把“大量微小独立因素叠加”的现象变成可以查表计算的概率。以下两例是两种典型模式:先算出 \(n\mu\) 与 \(\sigma\sqrt{n}\),再标准化、查 \(\Phi\)。

例 3 保险总赔付风险

某公司售出 10000 张一年期保单,每张独立地以概率 0.01 出险,出险即赔付 1000 元。求一年内总赔付额超过 120000 元的概率。

设出险保单数 \(N\sim B(10000,\,0.01)\),总赔付 \(T=1000N\)。逐项计算 \(\binom{10000}{k}\) 不现实,用 CLT: \[ E[N]=np=100,\qquad \mathrm{sd}(N)=\sqrt{np(1-p)}=\sqrt{99}\approx 9.95, \] 故 \(T\) 近似服从 \(N(100000,\ \mathrm{sd}\approx 1000\times 9.95\approx 9950)\)。于是 \[ P(T>120000)=P\Big(\frac{N-100}{9.95}>\frac{120-100}{9.95}\Big)\approx 1-\Phi(2.0)=0.0228. \] 即约 \(2.3\%\)。(若再作连续性校正:\(N\ge 121\) 以 120.5 代入,\(z=(120.5-100)/9.95\approx 2.06\),概率约 \(0.0197\),同一量级。)这类数字正是保费定价与再保险安排的出发点。
例 4 百步随机游走

一质点从原点出发,每步独立地以概率 \(1/2\) 向右、概率 \(1/2\) 向左移动 1 个单位。求 100 步后位置 \(S\) 偏离原点超过 30 的概率。

设第 \(i\) 步位移 \(X_i\in\{+1,-1\}\) 等概率,则 \(E[X_i]=0\),\(\mathrm{Var}(X_i)=1\),故 \(S=\sum_{i=1}^{100}X_i\) 近似服从 \(N(0,\,100)\),\(\mathrm{sd}=10\)。 \[ P(|S|>30)=P\Big(\Big|\frac{S}{10}\Big|>3\Big)\approx 2\big(1-\Phi(3)\big)=2\times 0.00135=0.0027. \] 约千分之三。注意 \(S\) 只取与 100 同奇偶的偶数,\(|S|>30\) 等价于 \(|S|\ge 32\);用连续性校正(以 \(\pm 31.5\) 代入)得 \(2(1-\Phi(3.15))\approx 0.0016\),与精确值更贴近。两种算法都表明“百步走出 30 步开外”相当罕见——这也正是物理学中扩散过程“位移尺度 \(\propto\sqrt{\text{步数}}\)”的概率根源。这样的 \(\pm 1\) 累加过程称为随机游走(random walk),其连续极限就是布朗运动。

5. 历史:从 de Moivre 到 Lindeberg–Feller

CLT 是概率论历史上第一个被严格研究的极限定理。1733 年,法国–英国数学家棣莫弗(A. de Moivre)对 \(p=1/2\) 的伯努利和建立了正态近似(并借助他与友人所发展的 \(n!\) 渐近公式,即 Stirling 公式),这是 CLT 的最早特例。1812 年,拉普拉斯(Laplace)在《概率的分析理论》中把近似推广到一般的 \(p\) 与大量独立误差之和,并给出了带误差阶的陈述。严格化是 20 世纪的工作:Liapounoff(1901)用矩条件给出证明,Lindeberg(1922)给出使 CLT 成立的Lindeberg 条件,Feller(1935)证明该条件还是必要的——至此“为什么正态普适”才有了完整答案。定理的名字由 Pólya 于 1920 年提出:“中心”意在强调它在整个理论中的中心地位。

高尔顿板(Galton board,1889) 每碰一钉:向左/向右各以概率 1/2 钟形堆积 ≈ 正态曲线 底部球数比 1 : 9 : 36 : 84 : 126 : 126 : 84 : 36 : 9 : 1,即 B(9, 1/2) 的分布列
图 3:高尔顿板——CLT 最直观的实物演示。小球依次碰撞 9 排钉,每钉处独立地以 \(1/2\) 向左或向右,落格编号是 9 个 \(\pm\) 位移之和,故堆积高度按 \(B(9,1/2)\) 分布;钉排足够多时即为正态曲线。高尔顿(Galton)称之为“从最混沌的元素中自行涌现的秩序”。

6. 与弱大数定律的分工

把本节与 8.2 节放在一起看:弱大数定律说 \(\bar{X}_n\) 依概率收敛于 \(\mu\)——回答“往哪收敛”,但不含任何速率信息;中心极限定理说 \(\sqrt{n}(\bar{X}_n-\mu)/\sigma\) 依分布收敛于 \(N(0,1)\)——回答“以什么尺度(\(\sigma/\sqrt{n}\))、什么形状(钟形)在 \(\mu\) 附近波动”,可以查 \(\Phi\) 表定量计算。例如 \(n=10000\) 次重复测量、单次 \(\sigma=1\):弱大数定律只说误差趋于 0;CLT 则说误差近似 \(N(0,10^{-4})\),从而以 95% 的把握有 \(|\bar{X}-\mu|\le 1.96\times 0.01\approx 0.02\)。

表 1:两条极限定理的分工
弱大数定律(8.2 节)中心极限定理(本节)
结论\(\bar{X}_n\to\mu\)(依概率)\(\sqrt{n}(\bar{X}_n-\mu)/\sigma\Rightarrow N(0,1)\)
回答的问题均值“往哪收敛”均值“以什么尺度、什么形状波动”
精度信息无(只说偏离概率趋于 0)尺度 \(\sigma/\sqrt{n}\),可查表定量
相互关系在方差存在的条件下可由 CLT 推出(定理 3)
定理 3 中心极限定理蕴含弱大数定律

设 \(X_1,X_2,\dots\) 独立同分布,\(E[X_i]=\mu\),\(\mathrm{Var}(X_i)=\sigma^2<\infty\),则由定理 1 可推出:\(\bar{X}_n\) 依概率收敛于 \(\mu\)。

证明记 \(Z_n=\sqrt{n}(\bar{X}_n-\mu)/\sigma\),CLT 即 \(Z_n\Rightarrow Z\sim N(0,1)\)。对任意 \(\varepsilon>0\),令 \(M_n=\varepsilon\sqrt{n}/\sigma\),则 \(M_n\to\infty\),且 \[ P(|\bar{X}_n-\mu|>\varepsilon)=P(|Z_n|>M_n). \] 对任意固定的 \(M>0\),当 \(n\) 充分大时 \(M_n\ge M\),故上式不超过 \(P(|Z_n|>M)\)。由依分布收敛(取 \(M\) 为连续点)得 \(\lim_n P(|Z_n|>M)=P(|Z|>M)=2(1-\Phi(M))\)。于是 \[ \limsup_n\,P(|\bar{X}_n-\mu|>\varepsilon)\le 2\big(1-\Phi(M)\big)\ \xrightarrow[M\to\infty]{}\ 0, \] 即得弱大数定律。

值得注意,两种收敛类型(依分布与依概率)本身并无可比强弱,这里之所以能“打通”,是因为收敛目标是常数 \(\mu\):分布集中到一点时,依分布收敛自动升级为依概率收敛。若不借道 CLT,弱大数定律只需方差存在(甚至只需 \(E|X|<\infty\),见 8.4 节的强大数定律),条件更弱。

7. 选学:收敛有多快——Berry–Esseen 界

选学 Berry–Esseen 定理:一致误差界

图 1 中 \(n=30\) 已几乎重合,但这只是均匀分布的情形。一般地,若三阶绝对矩 \(\rho=E|X-\mu|^3\) 有限,则对一切 \(n\) 与 \(x\) 一致地有 \[ \sup_x\Big|P\Big(\frac{\sum X_i-n\mu}{\sigma\sqrt{n}}\le x\Big)-\Phi(x)\Big|\le C\cdot\frac{\rho}{\sigma^3\sqrt{n}}, \] 其中 \(C\) 是与分布无关的万有常数,目前所知的最佳上界约为 \(0.4748\)(Shevtsova,2011)。它告诉我们:其一,收敛速度一律是 \(O(n^{-1/2})\),不加校正时不必指望更快;其二,比值 \(\rho/\sigma^3\) 度量分布“偏离正态”的程度,越接近正态越快。以 \(U(0,1)\) 为例:\(\rho=1/32\),\(\sigma^3=(1/12)^{3/2}\approx 0.0241\),\(\rho/\sigma^3\approx 1.30\),\(n=30\) 时界约为 \(0.4748\times 1.30/\sqrt{30}\approx 0.11\)——与图 1 中 \(n=30\) 面板的吻合水平相当。至于“独立但不同分布”的完整刻画,正是第 5 小节提到的 Lindeberg 条件(Lindeberg 1922;Feller 1935 证其必要)。

8. 本节小结

要点回顾
  • CLT:\(X_i\) 独立同分布、期望方差有限时,标准化和 \(\dfrac{\sum X_i-n\mu}{\sigma\sqrt{n}}\) 依分布收敛于 \(N(0,1)\)——与原始分布的形状无关
  • 两种用法:\(P(\sum X_i\le a)\approx\Phi\big((a-n\mu)/(\sigma\sqrt{n})\big)\);对 \(\bar{X}\) 则用尺度 \(\sigma/\sqrt{n}\)。
  • 二项近似:\(X\sim B(n,p)\) 时用 \(\mu=np\)、\(\sigma=\sqrt{np(1-p)}\),并以 \(\pm 0.5\) 作连续性校正(例 2:\(\Phi(-0.9)=0.1841\),几乎精确)。
  • 计算模式:求 \(n\mu\) 与 \(\sigma\sqrt{n}\) → 标准化 → 查 \(\Phi\) 表;保险(例 3)、随机游走(例 4)是两大原型。
  • 分工:弱大数定律说“往哪收敛”,CLT 说“以什么尺度、什么形状波动”;方差存在时 CLT 蕴含弱大数定律(定理 3)。
  • 历史主线:de Moivre(1733,伯努利)→ Laplace(1812,一般化)→ Liapounoff/Lindeberg/Feller(20 世纪严格化);收敛速度由 Berry–Esseen 界 \(O(n^{-1/2})\) 刻画(选学)。

练习

练习 8-3-1

设 \(X_i\sim U(0,1)\) 独立,\(n=100\)。用 CLT 估计 \(P\big(\sum X_i>55\big)。

答案与提示

\(n\mu=50\),\(\sigma\sqrt{n}=\sqrt{100/12}\approx 2.887\),\(z=(55-50)/2.887\approx 1.73\),故概率 \(\approx 1-\Phi(1.73)\approx 0.042\)。

练习 8-3-2

掷一颗骰子 300 次,\(S\) 为总点数。估计 \(P(1000\le S\le 1100)\)。

答案与提示

单次 \(E=3.5\),\(\mathrm{Var}=35/12\);故 \(E[S]=1050\),\(\mathrm{sd}(S)=\sqrt{300\times 35/12}=\sqrt{875}\approx 29.6\)。\(z=\pm 50/29.6\approx\pm 1.69\),概率 \(\approx 2\Phi(1.69)-1\approx 0.909\)(作连续性校正约 \(0.913\))。

练习 8-3-3

\(X\sim B(400,\,0.5)\)。用连续性校正计算 \(P(X\le 180)\)。

答案与提示

\(\mu=200\),\(\sigma=10\);以 180.5 代入:\(z=(180.5-200)/10=-1.95\),\(P\approx\Phi(-1.95)=0.0256\)。不作校正会得 \(\Phi(-2)=0.0228\),偏差约 11%。

练习 8-3-4

判断:柯西分布(密度 \(f(x)=\frac{1}{\pi(1+x^2)}\))的样本均值是否满足 CLT?CLT 到底需要什么条件?

答案与提示

不满足。柯西分布连期望都不存在(\(\int|x|f(x)dx\) 发散),更无方差,CLT 的前提(\(E[X_i]\)、\(\mathrm{Var}(X_i)\) 有限且 \(\sigma>0\))不成立。事实上柯西分布是稳定分布:\(\bar{X}_n\) 仍服从同一柯西分布,根本不收敛于常数——大数定律也失效。这说明“矩条件”不是技术装饰,而是实质前提。

练习 8-3-5

篮球赛:两队各打 100 个回合,每回合得分 \(X\)(与 \(Y\) 独立同分布)取 0、2、3 分的概率分别为 0.5、0.4、0.1。用 CLT 估计分差 \(D=\sum X_i-\sum Y_i\) 的绝对值不超过 20 分的概率。

答案与提示

\(E[X]=1.1\),\(E[X^2]=1.7\),\(\mathrm{Var}(X)=0.49\)。两队得分独立,\(D\) 近似 \(N(0,\ 200\times 0.49=98)\),\(\mathrm{sd}\approx 9.9\)。\(z=20/9.9\approx 2.02\),故 \(P(|D|\le 20)\approx 2\Phi(2.02)-1\approx 0.96\)。