- 用自己的话说出几乎必然收敛(almost sure convergence)的含义,并指出它与依概率收敛的本质区别;
- 准确陈述强大数定律,并比较其条件 \(E|X|<\infty\) 与弱大数定律的方差条件的强弱;
- 证明"几乎必然收敛蕴含依概率收敛",并能举出反向不成立的示意性反例;
- 用强大数定律解释频率解释的严格化,以及"长期赌徒必输"的必然性;
- 会用"大数定律 + 中心极限定理"设计蒙特卡洛估计(求 \(\pi\)、求积分),会计算估计量的标准差并做样本量设计。
1. 几乎必然收敛:对整条轨道的要求
在 8.2 节中,我们证明了弱大数定律(weak law of large numbers):在方差有限的条件下,样本均值 \(\bar{X}_n\) 依概率收敛(convergence in probability)于期望 \(\mu\),即对任意 \(\varepsilon>0\),
\[ \lim_{n\to\infty} P\bigl(|\bar{X}_n-\mu|>\varepsilon\bigr)=0. \]
这句话只对"每个固定时刻 \(n\)"作了承诺:偏离超过 \(\varepsilon\) 的轨道所占比例趋于 0。它并没有保证一条轨道一旦靠近 \(\mu\) 就永远贴住它——按此定义,轨道仍可能在越来越稀疏的时刻一次次冲出 \(\varepsilon\) 带,只要每次冲出的概率趋于 0。本节把收敛要求从"时刻"加强到"整条轨道",就得到大数定律最强的形式。
设 \(X_1,X_2,\ldots\) 与 \(X\) 是同一个样本空间上的随机变量。若
\[ P\Bigl(\bigl\{\omega:\ \lim_{n\to\infty}X_n(\omega)=X(\omega)\bigr\}\Bigr)=1, \]
则称 \(X_n\) 几乎必然收敛(convergence almost surely)于 \(X\),记作 \(X_n\to X\) a.s.(almost surely)。
直观理解:把每个样本点 \(\omega\) 想象成一次无限重复试验的完整记录,即一条样本轨道(sample path)——按这次记录依次算出的数列 \(X_1(\omega),X_2(\omega),\ldots\)。几乎必然收敛的意思是:除去一个概率为 0 的"坏轨道"集合外,每条轨道都是一条按普通微积分意义收敛的数列。例外集概率为 0,在实践中可以当作不存在。本教程不追求测度论的细节,记住这句直观表述即可。
两种收敛的分工可以这样概括:依概率收敛是对"时刻"的陈述——在每个时刻还有多大比例的轨道处于偏离状态;几乎必然收敛是对"轨道"的陈述——要求几乎每条轨道自身最终安静下来、偏离永远不再发生。图 1 用掷硬币的正面频率轨道展示二者的差别。
若 \(X_n\to X\) a.s.,则 \(X_n\) 依概率收敛于 \(X\)。
取相互独立的随机变量列,\(P(X_n=1)=1/n\),\(P(X_n=0)=1-1/n\)。对任意固定 \(\varepsilon\in(0,1)\),\(P(|X_n|>\varepsilon)=1/n\to0\),故 \(X_n\to0\) 依概率。但由于 \(\sum_n 1/n=\infty\) 且各次独立,可以证明" \(X_n=1\) 发生无穷多次"的概率为 1(这是 Borel–Cantelli 引理(Borel–Cantelli lemma)的结论,超出本书范围):偏离(幅度为 1)永不停止,几乎每条轨道都不收敛。可见弱收敛只要求"拍照时刻"偏离者渐少,强收敛要求"录像"最终归于平静。反过来,若偏离幅度本身趋于 0——例如取 \(P(X_n=1/n)=1/n\)(各次独立)——则无论偏离发生多少次,每条轨道都满足 \(|X_n|\le 1/n\to0\),必然收敛。这说明强弱之别不在偏离发生的次数多少,而在超出任意固定 \(\varepsilon\) 的偏离是否最终永远停止。
2. 强大数定律与频率解释的严格化
现在给出本节的主定理。
设 \(X_1,X_2,\ldots\) 独立同分布,且 \(E|X_1|<\infty\)。记 \(\mu=E[X_1]\),则
\[ P\left(\lim_{n\to\infty}\frac{X_1+X_2+\cdots+X_n}{n}=\mu\right)=1,\qquad\text{即}\quad \bar{X}_n\to\mu \ \text{a.s.} \]
证明需要 Borel–Cantelli 引理与截尾等技术(由 Kolmogorov 在 20 世纪 30 年代完成),超出本书范围,从略;8.2 节的切比雪夫论证可视为其精神先导。
与弱大数定律对比,有两点值得特别注意:
- 条件更弱:8.2 节用切比雪夫不等式证明弱大数定律时需要 \(\mathrm{Var}(X)<\infty\);而强大数定律只要求 \(E|X|<\infty\)(即期望存在且有限,见 4.3 节)——更弱的条件,更强的结论(由定理 1,几乎必然收敛自动蕴含依概率收敛)。事实上还可以证明:若 \(E|X_1|=\infty\),结论一般不再成立,故该条件已近乎最优。
- 结论更强:它断言样本均值不是"大概率靠近",而是几乎每条轨道都最终收敛并停在 \(\mu\) 附近——正是"平均值稳定性"这一经验事实的终极数学表述。
设 \(X_1,X_2,\ldots\) 独立同分布,\(P(X_i=1)=p\),\(P(X_i=0)=1-p\)(即每次试验中事件 \(A\) 以概率 \(p\) 发生),则 \(n\) 次试验中 \(A\) 出现的频率 \(f_n=\frac{1}{n}\sum_{i=1}^{n}X_i\) 满足
\[ f_n\to p \quad\text{a.s.} \]
这正是 8.1 节悬而未决的问题的最终答案:"频率稳定到概率"以几乎必然的方式成立:频率解释(frequency interpretation)之所以可信,是因为出错的轨道全体概率为 0。伯努利(Jacob Bernoulli)1713 年在遗著《猜度术》中证明了这一结果(他称之为"黄金定理"),并视其为自己最重要的成就——它比切比雪夫的弱定律版本早了一百多年。
美式轮盘有 38 个号码:18 红、18 黑、2 绿。赌徒每局押 1 元于"红",中奖按 1:1 赔付。试用强大数定律说明:长期赌下去,赌徒的累计净收益几乎必然趋于 \(-\infty\)。
3. 蒙特卡洛方法:用随机模拟算确定的数
强大数定律不仅是频率解释的根基,也是"用随机模拟计算确定的量"这类方法的理论执照——蒙特卡洛方法(Monte Carlo method)。其基本模式是:想计算某个量 \(\theta\),先把它写成某个随机变量 \(Y\) 的期望 \(\theta=E[Y]\);然后产生独立同分布样本 \(Y_1,\ldots,Y_N\),用样本均值 \(\hat{\theta}_N=\frac{1}{N}\sum_{i=1}^N Y_i\) 估计 \(\theta\)。强大数定律保证 \(\hat{\theta}_N\to\theta\) a.s.(模拟不会"算错"),中心极限定理进一步给出误差的分布:\(\hat{\theta}_N\) 近似服从 \(N\bigl(\theta,\ \mathrm{Var}(Y)/N\bigr)\),故误差量级为 \(O(1/\sqrt{N})\)。
向单位正方形 \([0,1]^2\) 内均匀、独立地撒点 \((U_i,V_i)\)。用落入四分之一圆 \(\{(u,v):u^2+v^2\le1\}\) 的点所占的比例估计 \(\pi\),并计算 \(N=10^4\) 时估计量的标准差。
| 点数 \(N\) | 估计值 \(\hat{\pi}_N\) | 理论标准差 | 实际误差 |
|---|---|---|---|
| \(100\) | 3.2400 | 0.183 | +0.0984 |
| \(10^3\) | 3.1320 | 0.058 | −0.0096 |
| \(10^4\) | 3.1456 | 0.0183 | +0.0040 |
| \(10^5\) | 3.14189 | 0.0058 | +0.0003 |
用蒙特卡洛方法估计 \(\displaystyle\int_0^1 x^2\,dx\),说明算法的合法性来源,并计算 \(N=10^3\) 时估计量的标准差。
误差量级与样本量设计。两个例子中估计量的标准差都是 \(\sqrt{\mathrm{Var}(Y)/N}\) 的形状:精度提高 10 倍,样本要增加 100 倍——这就是蒙特卡洛 \(O(1/\sqrt{N})\) 的误差代价。结合 8.3 节的中心极限定理,\(\hat{\theta}_N-\theta\) 近似服从 \(N(0,\mathrm{Var}(Y)/N)\),于是可用正态分布给出置信区间(如"约 95% 对应 \(\pm2\) 倍标准差")或反推所需样本量,例 2 中 \(\mathrm{sd}\approx0.0183\)、误差 \(\pm0.037\) 的数值正来源于此。
"蒙特卡洛"之名取自摩纳哥的赌城,由 Ulam 与 von Neumann 在 20 世纪 40 年代洛斯阿拉莫斯(曼哈顿计划)的工作中系统化。它把"算确定的量"化为"求随机平均值",合法性由强大数定律担保,精度由中心极限定理度量。其突出优点是:误差只依赖 \(\mathrm{Var}(Y)/N\),与维数无关——对高维积分、复杂系统的期望等确定性方法难以胜任的问题,它常常是唯一可行的手段。这也是强大数定律在当代科学计算中最响亮的应用。
4. 本节小结
- 几乎必然收敛要求几乎每条样本轨道自身收敛;依概率收敛只要求每个固定时刻偏离概率趋于 0。强蕴含弱(定理 1),反之不真(\(P(X_n=1)=1/n\) 独立反例:偏离永不停止)。
- 强大数定律:\(X_i\) iid 且 \(E|X_1|<\infty\) \(\Rightarrow\) \(\bar{X}_n\to\mu\) a.s.。条件比弱大数定律的"方差有限"更弱,结论却更强。
- 伯努利场合:频率 \(f_n\to p\) a.s.——频率解释的严格化;负期望游戏中累计收益 \(S_n=n\bar{X}_n\to-\infty\) a.s.,长期赌徒必输。
- 蒙特卡洛方法:把待计算的量写成期望 \(E[Y]\),用样本均值估计;SLLN 保证几乎必然收敛,CLT 给出 \(O(1/\sqrt{N})\) 的误差量级与置信区间、样本量设计。
练习
练习 8-4-1
设计一个模拟来估计 \(\displaystyle\int_0^1 e^{-x^2}\,dx\),写出估计量,并估计 \(N=10^4\) 时的精度。
答案与提示取 \(U_1,\ldots,U_N\) iid \(U(0,1)\),用 \(\hat{\theta}_N=\frac{1}{N}\sum e^{-U_i^2}\) 估计;由 SLLN,\(\hat{\theta}_N\to E[e^{-U^2}]=\int_0^1e^{-x^2}dx\) a.s.。方差:\(E[e^{-2U^2}]=\int_0^1e^{-2x^2}dx\approx0.5981\),而真值 \(\int_0^1e^{-x^2}dx=\frac{\sqrt{\pi}}{2}\operatorname{erf}(1)\approx0.7468\),故 \(\mathrm{Var}\approx0.5981-0.7468^2\approx0.0404\),单点标准差 \(\approx0.201\);\(N=10^4\) 时 \(\mathrm{sd}(\hat{\theta}_N)\approx0.002\),约 95% 的误差在 \(\pm0.004\) 内。
练习 8-4-2
概念辨析:(a) "若 \(X_n\to0\) 依概率,则几乎每条轨道最终必小于 0.01 并保持"——对吗?(b) 设各 \(X_n\) 独立,\(P(X_n=1)=1/n\),\(P(X_n=0)=1-1/n\):\(X_n\) 依概率收敛吗?几乎必然收敛吗?
答案与提示(a) 错。那正是几乎必然收敛的表述;依概率收敛只保证 \(P(|X_n|>0.01)\to0\),允许偏离发生无穷多次,只要趋于稀疏。(b) 依概率收敛成立:\(P(|X_n|>\varepsilon)=1/n\to0\)。但几乎必然收敛不成立:\(\sum_n 1/n=\infty\) 且各事件独立,由 Borel–Cantelli 引理,\(X_n=1\) 将几乎必然发生无穷多次,轨道在 0 与 1 之间永远跳动,不收敛。
练习 8-4-3
用强大数定律说明:若总体分布函数 \(F\) 连续且严格递增,\(\xi_p\) 为其 \(p\) 分位数,则样本 \(p\) 分位数 \(\hat{\xi}_{p,n}\to\xi_p\) a.s.
答案与提示经验分布函数(empirical distribution function) \(\hat{F}_n(x)=\frac{1}{n}\sum_{i=1}^n\mathbf{1}\{X_i\le x\}\)。对每个固定 \(x\),指示变量 iid 伯努利(\(F(x)\)),由 SLLN,\(\hat{F}_n(x)\to F(x)\) a.s.。取 \(x_1<\xi_p<x_2\) 使 \(F(x_1)<p<F(x_2)\):几乎必然地,从某个 \(n\) 起 \(\hat{F}_n(x_1)<p<\hat{F}_n(x_2)\),迫使 \(\hat{\xi}_{p,n}\in(x_1,x_2)\);再令 \(x_1\uparrow\xi_p\)、\(x_2\downarrow\xi_p\)(各取一列可数多个点,概率 1 的事件之交仍概率 1)即得 \(\hat{\xi}_{p,n}\to\xi_p\) a.s.。
练习 8-4-4
样本量设计:要以约 95% 的把握把 \(\pi\) 估计到 \(\pm0.01\) 之内,至少需要多少个随机点?
答案与提示由 CLT 近似,要求 \(2\,\mathrm{sd}(\hat{\pi}_N)\le0.01\),即 \(\mathrm{sd}(\hat{\pi}_N)\le0.005\)。由例 2,\(\mathrm{sd}(\hat{\pi}_N)=4\sqrt{p(1-p)/N}\le4\sqrt{0.21/N}\),故需 \(\sqrt{0.21/N}\le0.00125\),即 \(N\ge0.21/(0.00125)^2=134\,400\),约 \(1.35\times10^5\) 个点。(若按真值 \(p(1-p)=0.1685\) 计,\(N\ge1.08\times10^5\)。)注意精度只按 \(\sqrt{N}\) 改善:再要提一位小数,点数需再乘 100。