- 写出切比雪夫不等式的两种等价形式,并对离散型与连续型随机变量分别完成证明;
- 说明该界"只用期望与方差、对一切分布成立,因而必然宽松"的特点,并与正态分布的实际尾概率作数值对比;
- 陈述依概率收敛的定义,并解释它与普通数列收敛的区别;
- 用切比雪夫不等式证明弱大数定律,掌握关键计算 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\);
- 能运用不等式完成"精度—样本量"设计(\(n\ge\sigma^2/(\delta\varepsilon^2)\)),并估计频率稳定性的概率界。
1. 切比雪夫不等式
第 8.1 节提出的问题——"为什么大量重复观察的平均值会稳定在期望附近"——需要一个只凭少量信息就能奏效的工具。切比雪夫不等式(Chebyshev's inequality)正是这样的结果:它仅仅利用期望 \(\mu=E[X]\) 与方差 \(\sigma^2=\mathrm{Var}(X)\) 这两个数字,就对 \(X\) 偏离 \(\mu\) 超过任意给定量的概率给出上界,而且对任何分布一律成立。它是本节证明弱大数定律的引擎,也是 8.5 节一系列更精细不等式的原型。
设随机变量 \(X\) 的期望 \(E[X]=\mu\) 与方差 \(\mathrm{Var}(X)=\sigma^2\) 均有限,则对任意 \(\varepsilon>0\),
\[ P\{|X-\mu|\ge\varepsilon\}\le\frac{\sigma^2}{\varepsilon^2},\qquad\text{等价地}\qquad P\{|X-\mu|<\varepsilon\}\ge 1-\frac{\sigma^2}{\varepsilon^2}. \]
特别地,取 \(\varepsilon=k\sigma\;(k>0)\),得到以标准差为尺度的形式:
\[ P\{|X-\mu|\ge k\sigma\}\le\frac{1}{k^2}. \]
离散情形:设 \(X\) 的分布列为 \(p(x)=P\{X=x\}\)。由方差的定义与各项非负,
\[ \sigma^2=\sum_{x}(x-\mu)^2p(x)\;\ge\;\sum_{|x-\mu|\ge\varepsilon}(x-\mu)^2p(x)\;\ge\;\sum_{|x-\mu|\ge\varepsilon}\varepsilon^2\,p(x)=\varepsilon^2\,P\{|X-\mu|\ge\varepsilon\}. \]
第一步成立是因为舍去的项 \((x-\mu)^2p(x)\ge 0\)(只保留 \(|x-\mu|\ge\varepsilon\) 的 \(x\) 使和变小),第二步是因为在保留的范围内 \((x-\mu)^2\ge\varepsilon^2\)。两边同除以 \(\varepsilon^2\) 即得结论。
连续情形:设 \(X\) 的密度为 \(f(x)\),把求和换成积分,论证逐字相同:
\[ \sigma^2=\int_{-\infty}^{\infty}(x-\mu)^2f(x)\,dx\;\ge\;\int_{|x-\mu|\ge\varepsilon}(x-\mu)^2f(x)\,dx\;\ge\;\varepsilon^2\int_{|x-\mu|\ge\varepsilon}f(x)\,dx=\varepsilon^2\,P\{|X-\mu|\ge\varepsilon\}. \]
对既非离散也非连续的随机变量,可借助期望的抽象定义作同样的论证(7.8 节)。证毕。
请注意这个不等式没有对分布形状作任何假设:不知道分布列、密度,甚至不知道分布的类型,只要期望与方差存在,结论就成立。这份"普适性"正是它威力的来源,但天下没有免费的午餐——信息越少,界就只能越宽松。下一小节用正态分布来量化这份"宽松"。
2. 界有多宽松:与正态分布的对比
若 \(X\sim N(\mu,\sigma^2)\),则事件 \(\{|X-\mu|\ge k\sigma\}\) 等价于 \(\{|Z|\ge k\}\)(\(Z\) 为标准正态变量),概率可由正态表精确算出:\(k=1,2,3\) 时实际尾概率分别约为 \(0.317\)、\(0.0456\)、\(0.0027\)。而切比雪夫不等式给出的上界是 \(1\)、\(0.25\)、\(0.111\)。图 1 与表 1 把两者并排放在同一比例尺下:偏离 \(3\sigma\) 时,界比实际大约 \(41\) 倍。
| k(偏离幅度) | 切比雪夫上界 \(1/k^2\) | 正态实际 \(P\{|Z|\ge k\}\) | 界 / 实际 |
|---|---|---|---|
| \(k=1\) | 1.000 | 0.317 | 约 3.2 倍 |
| \(k=2\) | 0.250 | 0.0456 | 约 5.5 倍 |
| \(k=3\) | 0.111 | 0.0027 | 约 41 倍 |
界为什么只能这么松?因为它必须"迁就"所有可能的分布。事实上这个界已经无法一致改进:取三点分布 \(P\{X=\pm k\sigma\}=1/(2k^2)\)、\(P\{X=0\}=1-1/k^2\)(\(k\ge1\)),容易验证 \(E[X]=0\)、\(\mathrm{Var}(X)=\sigma^2\),而 \(P\{|X-\mu|\ge k\sigma\}=1/k^2\) 恰好取到上界(\(k=1\) 时退化为两点分布 \(P\{X=\pm\sigma\}=1/2\),见练习 5)。换句话说,宽松是"对一切分布都成立"这一普适性的必然代价:一旦额外知道分布的形状(例如近似正态),就应改用 8.3 节的中心极限定理或 8.5 节的更精细不等式来获得接近实际的数值。
其一,切比雪夫界并不是说 \(X\) 的取值被限制在 \(\mu\pm k\sigma\) 之内——它只约束"大幅偏离的概率",\(X\) 仍可能取到很远的值,只是这种可能性受控。其二,该界对分布没有任何对称性、单峰性要求;\(k=1\) 时上界为 \(1\),看似"什么也没说",但这恰是两点分布能实际达到的值,从 \(k\ge2\) 起界才变得非平凡而有实用价值。
3. 依概率收敛
要严格陈述"样本均值稳定于期望",先要说清"稳定"的数学含义。随机变量序列不是普通的数列:对每个 \(n\),\(X_n\) 的取值依赖于试验结果,因此不能要求它像数列那样逐点逼近某个数,而只能要求"偏离很大"这一事件的概率随 \(n\) 增大而消失。
设 \(\{X_n\}\) 为随机变量序列,\(\mu\) 为常数。若对任意 \(\varepsilon>0\),
\[ \lim_{n\to\infty}P\{|X_n-\mu|>\varepsilon\}=0, \]
则称 \(X_n\)依概率收敛(converges in probability)于 \(\mu\),记作 \(X_n\xrightarrow{\;P\;}\mu\)。
直观地说:不论 \(\varepsilon\) 多小,只要 \(n\) 充分大,\(X_n\) 落在 \(\mu\) 的 \(\varepsilon\)-邻域之外的概率就可以任意接近 \(0\)。注意这允许偶尔的大偏离——\(X_n\) 并非必然接近 \(\mu\),只是"跑偏"越来越罕见。这是最弱的一种"随机收敛",更强的几乎必然收敛(almost sure convergence)(要求偏离最终永远不再发生)将在 8.4 节讨论。
4. 弱大数定律
现在把切比雪夫不等式用到样本均值(sample mean)上。设 \(X_1,X_2,\ldots\) 独立同分布(independent and identically distributed, i.i.d.),期望为 \(\mu\)、方差为 \(\sigma^2<\infty\),记
\[ \bar X_n=\frac{X_1+X_2+\cdots+X_n}{n}. \]
样本均值仍然是随机变量,但它的波动比单个观测小得多:期望不变,方差按 \(1/n\) 缩小。这正是弱大数定律的全部秘密。
设 \(X_1,X_2,\ldots\) 独立同分布,\(E[X_i]=\mu\),\(\mathrm{Var}(X_i)=\sigma^2<\infty\),则对任意 \(\varepsilon>0\),
\[ P\{|\bar X_n-\mu|>\varepsilon\}\le\frac{\sigma^2}{n\,\varepsilon^2}\xrightarrow{\;n\to\infty\;}0, \]
即 \(\bar X_n\) 依概率收敛于 \(\mu\)。
\[ \mathrm{Var}(\bar X_n)=\frac{1}{n^2}\,\mathrm{Var}(X_1+\cdots+X_n)=\frac{n\sigma^2}{n^2}=\frac{\sigma^2}{n}. \]
对随机变量 \(\bar X_n\) 使用切比雪夫不等式(其期望为 \(\mu\)、方差为 \(\sigma^2/n\)),得
\[ P\{|\bar X_n-\mu|>\varepsilon\}\le\frac{\sigma^2/n}{\varepsilon^2}=\frac{\sigma^2}{n\varepsilon^2}, \]
右端与 \(n\) 成反比,令 \(n\to\infty\) 即得结论。证毕。
结论的几何图景:\(\bar X_n\) 的分布随 \(n\) 增大而围绕 \(\mu\) 收缩,标准差按 \(\sigma/\sqrt{n}\) 的速度变窄(图 2)。收缩速度是 \(\sqrt n\) 而非 \(n\)——想把精度提高一位数,样本量要增加一百倍,这一"平方根法则"贯穿整个统计学。
用一台仪器重复测量某物理量的真值 \(\mu\),各次读数 \(X_1,\ldots,X_n\) 独立同分布,标准差 \(\sigma=1\)(方差 \(\sigma^2=1\))。若要以不小于 \(0.95\) 的概率保证样本均值与真值的偏差不超过 \(\varepsilon=0.1\),至少要测量多少次?
\[ P\{|\bar X_n-\mu|>0.1\}\le\frac{\sigma^2}{n\varepsilon^2}=\frac{1}{n\times 0.01}=\frac{100}{n}. \]
要求 \(P\{|\bar X_n-\mu|\le 0.1\}=1-P\{|\bar X_n-\mu|>0.1\}\ge 0.95\),只需 \(\dfrac{100}{n}\le 0.05\),即
\[ n\ge\frac{\sigma^2}{\delta\,\varepsilon^2}=\frac{1}{0.05\times 0.01}=2000. \]
故 \(n\ge 2000\) 即可。注意这一保证不依赖读数分布的形状——这正是切比雪夫式论证的价值;其代价是保守,例 3 将看到正态情形实际需要的样本量远小于此。
掷一颗均匀骰子 \(n=1000\) 次,\(\bar X\) 为平均点数。用切比雪夫不等式估计 \(P\{|\bar X-3.5|\ge 0.1\}\) 的上界,并给出 \(P\{|\bar X-3.5|<0.1\}\) 的下界。
\[ E[X]=\frac{1+2+\cdots+6}{6}=3.5,\qquad \mathrm{Var}(X)=E[X^2]-3.5^2=\frac{91}{6}-\frac{49}{4}=\frac{35}{12}\approx 2.9167. \]
于是 \(\mathrm{Var}(\bar X)=\dfrac{35/12}{1000}\)。由切比雪夫不等式,取 \(\varepsilon=0.1\):
\[ P\{|\bar X-3.5|\ge 0.1\}\le\frac{35/12}{1000\times 0.01}=\frac{35}{120}\approx 0.2917, \]
从而
\[ P\{|\bar X-3.5|<0.1\}\ge 1-0.2917=0.7083\approx 0.708. \]
即:不依赖任何分布假设,我们能断言平均点数落在 \(3.4\sim 3.6\) 之间的概率至少约 \(70.8\%\)。
例 1 与例 2 的界都相当保守。若进一步假定 \(\bar X_n\) 近似服从正态分布(其依据是 8.3 节的中心极限定理),重新评估:(a) 例 1 中 \(n=2000\) 时的实际概率,以及达到 \(0.95\) 真正所需的最小 \(n\);(b) 例 2 中的实际概率。
(a) 例 1(\(\sigma=1\),\(\varepsilon=0.1\)):当 \(n=2000\) 时 \(0.1\sqrt{2000}=4.47\),查表得 \(P\{|Z|\le 4.47\}\approx 0.99999\)——远超所需的 \(0.95\)。反解 \(0.1\sqrt n\ge 1.96\) 得 \(\sqrt n\ge 19.6\),即 \(n\ge 384.2\),取 \(n=385\) 次即可:不到切比雪夫所需 \(2000\) 次的五分之一。
(b) 例 2(\(\sigma=\sqrt{35/12}\):)当 \(n=1000\)、\(\varepsilon=0.1\) 时,\(\dfrac{\varepsilon\sqrt n}{\sigma}=0.1\times\sqrt{\dfrac{1000\times 12}{35}}\approx 1.85\),故
\[ P\{|\bar X-3.5|<0.1\}\approx 2\Phi(1.85)-1\approx 2\times 0.9678-1\approx 0.936, \]
而切比雪夫只保证 \(0.708\)。结论:切比雪夫界"包打天下但宽松",中心极限定理"精确但只是近似且需较大 \(n\)"——两者的分工与衔接正是 8.3 节的主题。
这个不等式与法国数学家比安内梅(Bienaymé) 1853 年的工作密切相关,文献中亦称 Bienaymé–Chebyshev 不等式;俄国数学家切比雪夫(Chebyshev, 1821–1894) 在 1867 年给出上述证明并将其系统用于极限定理,他的学生马尔可夫(Markov)与李亚普诺夫(Lyapunov)沿此路线走向中心极限定理。大数定律最早的严格证明出自雅各布·伯努利(Jakob Bernoulli)——二项频率收敛于 \(p\) 的情形,发表于 1713 年遗著《猜度术》(Ars Conjectandi),用的是相当繁复的组合论证;切比雪夫不等式把这一证明压缩成三行(见练习 4)。另外,弱大数定律其实不要求方差存在:只要 \(E|X|<\infty\),结论仍成立(辛钦定理),但其证明需要特征函数工具,超出本书范围;更强的几乎必然收敛版本见 8.4 节。
5. 本节小结
- 切比雪夫不等式:\(P\{|X-\mu|\ge\varepsilon\}\le\sigma^2/\varepsilon^2\),等价于 \(P\{|X-\mu|\ge k\sigma\}\le 1/k^2\);证明只需对满足 \(|x-\mu|\ge\varepsilon\) 的部分求和(离散)或积分(连续),本质是马尔可夫式论证。
- 界只用期望与方差,故对一切分布成立且不可一致改进(三点分布可取到等号);代价是宽松——正态 \(2\sigma\) 偏离实际概率 \(0.0456\),界给 \(0.25\)。
- 依概率收敛 \(X_n\xrightarrow{P}\mu\):对任意 \(\varepsilon>0\),\(P\{|X_n-\mu|>\varepsilon\}\to 0\);允许偶发大偏离,只要求偏离概率消失。
- 弱大数定律:i.i.d. 且方差有限 \(\Rightarrow\bar X_n\xrightarrow{P}\mu\);关键计算是 \(\mathrm{Var}(\bar X_n)=\sigma^2/n\),标准差按 \(\sigma/\sqrt n\) 收缩(平方根法则)。
- 样本量设计公式:要 \(P\{|\bar X_n-\mu|\le\varepsilon\}\ge 1-\delta\),充分条件是 \(n\ge\sigma^2/(\delta\varepsilon^2)\)(例 1:\(n\ge 2000\));需要更精的数值时转入 8.3 节的中心极限定理。
练习
练习 8-2-1
设 \(E[X]=10\),\(\mathrm{Var}(X)=4\)。(a) 给出 \(P\{|X-10|\ge 6\}\) 的切比雪夫上界与 \(P\{|X-10|<6\}\) 的下界;(b) 若还知道 \(X\sim N(10,4)\),实际值是多少?
答案与提示(a) 上界 \(\sigma^2/\varepsilon^2=4/36=1/9\approx 0.111\),下界 \(1-1/9=8/9\approx 0.889\)。(b) \(\varepsilon=6=3\sigma\),实际 \(P\{|Z|\ge 3\}=0.0027\),比界小约 \(41\) 倍——已知分布形状时不必用切比雪夫,但 (a) 的保证对任何分布有效。
练习 8-2-2
设 \(X\sim B(100,\,1/2)\)。用切比雪夫不等式估计 \(P\{|X-50|\ge 10\}\) 的上界,再用正态近似(8.3 节预告)比较实际值。
答案与提示\(\mathrm{Var}(X)=np(1-p)=100\times 0.25=25\),上界 \(25/10^2=0.25\)。正态近似:\(\varepsilon=10=2\sigma\)(\(\sigma=5\)),实际 \(\approx P\{|Z|\ge 2\}=0.0456\)。两者之比约 \(5.5\) 倍,与表 1 的 \(k=2\) 行一致。
练习 8-2-3
某天平读数误差的方差为 \(\sigma^2=9\)(毫克²),用 \(n\) 次独立读数的平均估计真实重量。要求 \(P\{|\bar X-\mu|\le 0.5\}\ge 0.99\),\(n\) 至少多大?若只要求 \(0.95\) 呢?
答案与提示由 \(n\ge\sigma^2/(\delta\varepsilon^2)\):\(\delta=0.01\) 时 \(n\ge 9/(0.01\times 0.25)=3600\);\(\delta=0.05\) 时 \(n\ge 9/(0.05\times 0.25)=720\)。置信度从 \(0.95\) 提到 \(0.99\)(即 \(\delta\) 从 \(0.05\) 降到 \(0.01\)),样本量需增至 \(5\) 倍——可靠性是"买"来的。
练习 8-2-4
设 \(X\sim B(n,p)\),证明频率 \(X/n\) 依概率收敛于 \(p\)(伯努利大数定律)。
答案与提示把 \(X\) 写成 \(n\) 个伯努利(\(p\))变量之和即可套用定理 2,也可直接计算:\(E[X/n]=p\),\(\mathrm{Var}(X/n)=\mathrm{Var}(X)/n^2=np(1-p)/n^2=p(1-p)/n\le\dfrac{1}{4n}\)。由切比雪夫,对任意 \(\varepsilon>0\),\[ P\{|X/n-p|\ge\varepsilon\}\le\frac{p(1-p)}{n\varepsilon^2}\le\frac{1}{4n\varepsilon^2}\to 0. \] 这正是"频率稳定于概率"的严格形式,也是概率的频率解释(8.1 节)的理论根据。
练习 8-2-5
举出一个具体分布,使 \(P\{|X-\mu|\ge\sigma\}\) 恰好等于切比雪夫上界 \(1\),并说明:为什么这意味着不添加分布信息时,\(1/k^2\) 型的界无法被一致改进?
答案与提示取 \(X=\pm 1\) 各以概率 \(1/2\):则 \(\mu=0\),\(\sigma^2=1\),\(P\{|X-0|\ge 1\}=1=1/1^2\),取到等号。更一般地,对任意 \(k\ge1\),取 \(P\{X=\pm k\sigma\}=1/(2k^2)\)、\(P\{X=0\}=1-1/k^2\),可验证 \(\mathrm{Var}(X)=\sigma^2\) 且 \(P\{|X-\mu|\ge k\sigma\}=1/k^2\)。既然存在真实分布在每个 \(k\) 处都达到界,任何"对所有分布都更小"的上界都不可能存在。