第 8 章 · 极限定理

8.5 其他不等式

Other Inequalities
学习目标
  • 叙述并证明单边切比雪夫(Cantelli)不等式,说明"只关心一侧"为何能得到更紧的界;
  • 推导切尔诺夫界,会对具体分布(正态、二项、指数)选取最优参数并算出数值;
  • 叙述并证明延森不等式,会用它重证 \(\mathrm{Var}(X)\ge 0\),并解释凹效用函数下的风险厌恶与保险定价直觉;
  • 在同一问题上比较多项式衰减界与指数衰减界的数量级差异;
  • 了解这些不等式作为高维统计、机器学习与集中不等式理论入口的地位。

1. 引言:界还能更紧吗

8.2 节的切比雪夫不等式只用期望与方差两条信息,就对尾部概率(tail probability)给出了对一切分布一致成立的控制:\(\ P\{|X-\mu|\ge k\sigma\}\le 1/k^2\ \)。普适的代价是宽松——对正态分布,\(|X-\mu|\ge 2\sigma\) 的真实概率只有 \(0.0456\),界却给出 \(0.25\)。本节沿三个方向收紧:其一,若我们只关心一侧的尾部,把"另一半信息"白白扔掉是可惜的,由此得到单边切比雪夫不等式;其二,若分布的矩母函数(moment generating function)已知,马尔可夫不等式施加于 \(e^{tX}\) 便产生指数衰减的切尔诺夫界;其三,若已知函数的凸凹性,期望与函数可以交换次序吗?延森不等式给出确定的方向。这三件工具合称概率不等式(toolbox)的核心,也是现代集中不等式(concentration inequality)理论的入口。

2. 单边切比雪夫不等式(Cantelli)

切比雪夫不等式控制的是两侧偏离的总概率 \(\{|X-\mu|\ge a\}\)。许多实际问题只关心一侧:投保人只担心损失过大,服务系统只担心排队过长。此时把单侧事件嵌入双侧事件 \(\{X-\mu\ge a\}\subseteq\{|X-\mu|\ge a\}\) 固然可行,但相当于扔掉了"另一侧不会发生坏情况"的信息。技巧是对随机变量做一个平移,再用马尔可夫不等式,并选取最优的平移量。

定理 1 单边切比雪夫不等式(坎泰利不等式,Cantelli's inequality)

设 \(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2<\infty\),则对任意 \(a>0\),

\[ P\{X-\mu\ge a\}\;\le\;\frac{\sigma^2}{\sigma^2+a^2}, \qquad P\{X-\mu\le -a\}\;\le\;\frac{\sigma^2}{\sigma^2+a^2}. \]

证明对任意 \(b>0\),当 \(X-\mu\ge a\) 时有 \(X-\mu+b\ge a+b>0\),从而 \((X-\mu+b)^2\ge (a+b)^2\)。于是事件满足包含关系 \(\{X-\mu\ge a\}\subseteq\{(X-\mu+b)^2\ge(a+b)^2\}\)。对非负随机变量 \((X-\mu+b)^2\) 用马尔可夫不等式,并注意 \(E[X-\mu]=0\),得 \[ P\{X-\mu\ge a\}\le\frac{E\bigl[(X-\mu+b)^2\bigr]}{(a+b)^2}=\frac{\sigma^2+b^2}{(a+b)^2}. \] 右端关于 \(b\) 求导:\(\ \frac{d}{db}\frac{\sigma^2+b^2}{(a+b)^2}=\frac{2(ab-\sigma^2)}{(a+b)^3}\ \),故最小值在 \(b^{*}=\sigma^2/a\) 处取得,代入得 \[ \frac{\sigma^2+\sigma^4/a^2}{(a+\sigma^2/a)^2}=\frac{\sigma^2(a^2+\sigma^2)}{(a^2+\sigma^2)^2}=\frac{\sigma^2}{\sigma^2+a^2}. \] 对下尾,将上述结论应用于 \(-X\) 即可(\(-X\) 与 \(X\) 有相同的均值波动结构)。

与两边版 \(\sigma^2/a^2\) 相比,单边界的分母多了个 \(a^2\):当 \(a\) 较大时,两边界 \(\sigma^2/a^2\) 可能超过 \(1\) 而毫无用处,而单边界恒不超过 \(1\),且总是更紧。"只关心一边"的价值被显式地兑现了。

例 1 \(\ P\{X\ge \mu+2\sigma\}\ \) 的三级对比

设随机变量 \(X\) 的期望为 \(\mu\)、方差为 \(\sigma^2\)(其余分布信息未知)。分别用两边切比雪夫不等式与单边切比雪夫不等式估计 \(P\{X\ge\mu+2\sigma\}\);若再假设 \(X\) 服从正态分布,真实值是多少?

① 两边版:\(\ P\{X\ge\mu+2\sigma\}\le P\{|X-\mu|\ge2\sigma\}\le 1/2^2=0.25\)。② 单边版:取 \(a=2\sigma\),\(\ P\{X-\mu\ge2\sigma\}\le\frac{\sigma^2}{\sigma^2+4\sigma^2}=\frac15=0.2\)。③ 若 \(X\sim N(\mu,\sigma^2)\),则 \(\frac{X-\mu}{\sigma}\sim N(0,1)\),真实尾概率为 \(1-\Phi(2)=0.0228\)。三个数字逐级收紧:\(0.25\to0.20\to0.0228\)。可见即便是最紧的普适单边界,与正态的真实尾部相比仍差近十倍——这说明"只用方差"这一信息量本身有其极限,要更好必须引入分布形状信息,这正是下一小节的出发点。
表 1:\(P\{X\ge\mu+2\sigma\}\) 的界与真实值对比
方法所利用的信息结果
两边切比雪夫仅 \(\mu,\sigma^2\)\(\le 0.25\)
单边切比雪夫(Cantelli)仅 \(\mu,\sigma^2\),只用一侧\(\le 0.20\)
正态分布真实值完整分布形状\(0.0228\)

3. 切尔诺夫界:指数衰减的威力

切比雪夫型界的共同短板是随 \(1/a^2\)(多项式速度)衰减。现代应用(假设检验、通信编码、机器学习泛化分析)中,我们普遍需要指数衰减的上界。钥匙是对 \(X\) 做指数变换。

定义 1 矩母函数(moment generating function)

\[ M_X(t)=E\!\left[e^{tX}\right] \]

称为 \(X\) 的矩母函数(MGF),在 \(t=0\) 附近有定义时它能唯一确定分布(第 7 章末已作讨论)。本节只须知道它在若干 \(t>0\) 处取有限值即可。

定理 2 切尔诺夫界(Chernoff bound)

\[ P\{X\ge a\}\;\le\;\min_{t>0}\; e^{-ta}M_X(t). \]

证明对任意 \(t>0\),指数函数 \(x\mapsto e^{tx}\) 严格递增,故 \(\{X\ge a\}=\{e^{tX}\ge e^{ta}\}\)。对非负随机变量 \(e^{tX}\) 用马尔可夫不等式: \[ P\{X\ge a\}=P\{e^{tX}\ge e^{ta}\}\le e^{-ta}\,E[e^{tX}]=e^{-ta}M_X(t). \] 该式对每一个 \(t>0\) 都成立,故可对右端取最小;最优 \(t\) 通常由令 \(\frac{d}{dt}\bigl[-ta+\ln M_X(t)\bigr]=0\) 求得。下尾类似:\(\ P\{X\le a\}\le\min_{t<0}e^{-ta}M_X(t)\)。

直观地说,切尔诺夫界"借用"了 \(e^{tX}\) 的所有矩来刻画尾部:矩母函数增长越慢(分布越集中),界越紧。两个最重要的推论如下。

推论 1 标准正态尾界

若 \(Z\sim N(0,1)\),则对 \(a>0\),\[ P\{Z\ge a\}\;\le\;e^{-a^2/2}. \]

证明\(M_Z(t)=e^{t^2/2}\),故 \(e^{-ta}M_Z(t)=e^{t^2/2-ta}\),在 \(t^{*}=a\) 处取最小值 \(e^{-a^2/2}\)。
推论 2 伯努利和的乘性切尔诺夫界

设 \(X\) 为独立伯努利变量之和,\(\mu=E[X]\),则对 \(\delta>0\), \[ P\{X\ge(1+\delta)\mu\}\;\le\;\Bigl(\frac{e^{\delta}}{(1+\delta)^{1+\delta}}\Bigr)^{\mu}\;\le\;e^{-\mu\delta^2/(2+\delta)}\;\le\;e^{-\mu\delta^2/3}\quad(0<\delta\le1), \] \[ P\{X\le(1-\delta)\mu\}\;\le\;e^{-\mu\delta^2/2}. \]

证明思路:对单个伯努利变量求切尔诺夫界的最优 \(t\),再利用独立性(矩母函数相乘)合并;后两个不等号是对最优值的初等简化,便于心算数量级。

例 2 掷硬币 1000 次的尾部三界阶梯

设 \(X\sim B(1000,\,0.5)\)。估计 \(P\{X\ge600\}\):(a) 两边切比雪夫;(b) 单边切比雪夫;(c) 切尔诺夫界;(d) 用 8.3 节的中心极限定理求近似真实值,并比较四个结果的数量级。

这里 \(\mu=np=500\),\(\sigma^2=np(1-p)=250\),\(\sigma\approx15.81\);阈值偏离均值 \(a=600-500=100\)。
① 两边切比雪夫:\(\ P\{X\ge600\}\le P\{|X-500|\ge100\}\le\frac{250}{100^2}=0.025\)。
② 单边切比雪夫:\(\ P\{X\ge600\}\le\frac{250}{250+100^2}=\frac{250}{10250}\approx0.0244\),仅略有改进——因为 \(a\gg\sigma\),两侧信息在此并不关键。
③ 切尔诺夫(推论 2,取 \(\delta=100/500=0.2\),\(\mu=500\)):\(\ P\{X\ge600\}\le e^{-\mu\delta^2/3}=e^{-500\times0.04/3}=e^{-6.67}\approx1.3\times10^{-3}\)。若用未简化的精确形式 \(\bigl(e^{\delta}/(1+\delta)^{1+\delta}\bigr)^{\mu}=e^{-9.39}\approx8.3\times10^{-5}\),还可再紧一个多数量级。
④ CLT 近似:\(\ P\{X\ge600\}\approx P\Bigl\{Z\ge\frac{600-500}{15.81}\Bigr\}=1-\Phi(6.32)\approx1.3\times10^{-10}\)(加连续性校正 \(599.5\) 得 \(\Phi(-6.29)\approx1.6\times10^{-10}\),同一数量级;精确值亦为 \(10^{-10}\) 量级)。
四个结果构成一座数量级阶梯:\(10^{-2}\to10^{-2}\to10^{-3}\to10^{-10}\)。切尔诺夫界从多项式衰减跃升为指数衰减,是质的飞跃;而正态近似动用了全部分布形状信息,再精确七个数量级。图 1 在对数尺度上直观展示了这道阶梯。
P{X ≥ 600} 的三种结果(对数尺度:柱越长, 概率越小) 100 10-2 10-4 10-6 10-8 10-10 10-12 0.025 1.3×10-3 1.3×10-10 紧约 20 倍 再小 107 倍(7 个数量级) 切比雪夫不等式 只用 μ 与 σ 切尔诺夫界 用矩母函数 真实值(CLT 近似) 正态形状信息
图 1:例 2 中 \(X\sim B(1000,0.5)\) 的 \(P\{X\ge600\}\) 三级结果(对数尺度)。切比雪夫界只给出 \(10^{-2}\) 量级;切尔诺夫界提升到 \(10^{-3}\);中心极限定理给出的近似真实值低至 \(10^{-10}\)。信息越多,界越紧。
表 2:\(P\{X\ge600\}\) 的数量级阶梯(\(X\sim B(1000,0.5)\))
方法结果数量级
两边切比雪夫\(250/100^2=0.025\)\(10^{-2}\)
单边切比雪夫\(250/10250\approx0.0244\)\(10^{-2}\)
切尔诺夫界\(e^{-6.67}\approx1.3\times10^{-3}\)\(10^{-3}\)
CLT 近似真实值\(\Phi(-6.32)\approx1.3\times10^{-10}\)\(10^{-10}\)

4. 延森不等式:凸性的红利

前两个不等式控制尾部概率,延森不等式则回答另一个问题:期望与函数变换能否交换次序?答案取决于函数的弯曲方向。

定义 2 凸函数与凹函数(convex / concave function)

若对一切 \(x,y\) 与 \(\lambda\in[0,1]\),

\[ g\bigl(\lambda x+(1-\lambda)y\bigr)\;\le\;\lambda g(x)+(1-\lambda)g(y), \]

则称 \(g\) 为凸函数:任意弦(连接曲线上两点的线段)位于曲线上方;不等号反向则为凹函数(弦在曲线下方)。二阶判据:区间上 \(g''\ge0\) ⟹ 凸,\(g''\le0\) ⟹ 凹。例如 \(x^2\)、\(e^x\)、\(|x|\)、\(1/x\;(x>0)\) 是凸的;\(\ln x\)、\(\sqrt{x}\) 是凹的。图 2 展示了凸函数的几何。

凸函数:弦在曲线上方, 切线在曲线下方(延森不等式的几何) x g(x) g(x1) g(x2) 支撑切线(切于 μ) E[g(X)] ≥ g(E[X]) E[g(X)](弦的中点) g(E[X])(曲线上的点) x1 μ = E[X] x2 设 X 等可能地取 x1 与 x2:弦的中点高度是 E[g(X)], 曲线在 μ 处的高度是 g(E[X])
图 2:凸函数 \(g\) 的切线支撑与弦的位置。取 \(X\) 等可能地取 \(x_1,x_2\):弦中点(金色,高度 \(E[g(X)]\))恒在曲线上对应点(绛红,高度 \(g(E[X])\))之上;而过 \(\mu\) 处的切线(灰绿)则从下方托住整条曲线——这正是延森不等式证明的几何来源。
定理 3 延森不等式(Jensen's inequality)

若 \(g\) 为凸函数且 \(E|g(X)|<\infty\),则 \[ E[g(X)]\;\ge\;g\bigl(E[X]\bigr); \] 若 \(g\) 为凹函数,不等号反向:\[ E[g(X)]\;\le\;g\bigl(E[X]\bigr). \]

证明记 \(\mu=E[X]\)。凸函数在任意一点处存在支撑线(supporting line):存在常数 \(k\)(当 \(g\) 可微时即 \(k=g'(\mu)\)),使对一切 \(x\), \[ g(x)\;\ge\;g(\mu)+k\,(x-\mu). \] (几何上即图 2 中的切线整条位于曲线下方。)把 \(x\) 换成随机变量 \(X\),不等式逐点成立,而期望保持非负随机变量的非负性,故两边取期望: \[ E[g(X)]\;\ge\;g(\mu)+k\,\bigl(E[X]-\mu\bigr)=g(\mu)=g\bigl(E[X]\bigr), \] 右端化简用到 \(E[X]=\mu\)。凹函数情形对 \(-g\) 应用凸情形即得。
例 3 延森不等式的两个应用:方差非负与保险定价

(a) 利用延森不等式重新证明 \(\mathrm{Var}(X)\ge0\),即 \(E[X^2]\ge(E[X])^2\)。(b) 某投保人拥有初始财富 \(100\) 万元,可能遭受随机损失:以概率 \(1/2\) 损失 \(36\) 万元、以概率 \(1/2\) 损失 \(0\)。其效用函数为 \(u(w)=\sqrt{w}\)。求他愿意为全额保险支付的最高保费,并与期望损失比较。

(a) \(g(x)=x^2\) 是凸函数(\(g''=2>0\)),由延森不等式 \(\ E[X^2]\ge(E[X])^2\),从而 \(\mathrm{Var}(X)=E[X^2]-(E[X])^2\ge0\)。这与直接展开 \(\mathrm{Var}(X)=E[(X-\mu)^2]\ge0\)(4.5 节)殊途同归,但视角不同:方差非负是"平方的凸性"的直接后果。
(b) 最终财富 \(W\) 以等概率取 \(100\) 与 \(64\)(万元)。\(u=\sqrt{w}\) 是凹函数(\(u''<0\)),故 \[ E[u(W)]=\tfrac12\sqrt{100}+\tfrac12\sqrt{64}=\tfrac{10+8}{2}=9\;\le\;\sqrt{E[W]}=\sqrt{82}\approx9.06, \] 即"赌博的期望效用低于期望值的效用"——这就是风险厌恶(risk aversion)。设确定性等价(certainty equivalent) 为 \(c\):\(\sqrt{c}=9\Rightarrow c=81\)。投保人愿意支付的最高保费为 \(100-81=19\) 万元,而期望损失仅为 \(E[L]=18\) 万元:多出的 \(1\) 万元正是风险溢价(risk premium)。这解释了保险公司为何能收取"纯保费 + 附加保费"而仍有人投保;而保险公司一侧,凭借大数定律(8.28.4 节),承接大量独立保单后总赔付高度集中在期望附近,附加部分足以覆盖波动——一个完整的保险市场在两端各自的不等式中获得解释。

5. 从不等式到集中不等式:现代视角

本节三个不等式远不止是教材中的练习,它们是当代概率论最具活力的分支——集中不等式(concentration inequality)——的起点。核心问题一脉相承:随机量偏离其期望的概率有多小?

注记 不等式工具箱与机器学习

对独立有界变量之和,切尔诺夫方法逐项优化后得到霍夫丁不等式(Hoeffding's inequality) \(\ P\{S-E[S]\ge t\}\le e^{-2t^2/\sum(b_i-a_i)^2}\);允许函数对单个变量呈利普希茨依赖,则有 McDiarmid 不等式;尾部如正态一样指数衰减的变量统称亚高斯(sub-Gaussian) 变量,其一切尾界都由方差代理统一控制。在机器学习中,泛化误差界、PAC 学习理论、随机梯度收敛分析,以及在高维统计中关于最小二乘、压缩感知的误差概率控制,全部建立在这套"马尔可夫 → 切尔诺夫 → 集中"的递进逻辑之上。可以说:读懂本节,就拿到了现代高维概率的门票。

6. 本节小结

要点回顾
  • 单边切比雪夫(Cantelli):\(\ P\{X-\mu\ge a\}\le\sigma^2/(\sigma^2+a^2)\);证明对 \((X-\mu+b)^2\) 用马尔可夫不等式并取最优 \(b=\sigma^2/a\),恒比两边版更紧。
  • 切尔诺夫界:\(\ P\{X\ge a\}\le\min_{t>0}e^{-ta}M_X(t)\);本质是马尔可夫不等式作用于 \(e^{tX}\),带来指数速度的尾衰减;正态尾推论 \(\ P\{Z\ge a\}\le e^{-a^2/2}\)。
  • 数量级阶梯(\(B(1000,0.5)\) 的 \(P\{X\ge600\}\)):切比雪夫 \(0.025\) → 切尔诺夫 \(1.3\times10^{-3}\) → CLT 近似 \(1.3\times10^{-10}\)。
  • 延森不等式:凸 \(\Rightarrow E[g(X)]\ge g(E[X])\),证明用支撑切线;推论 \(E[X^2]\ge(E[X])^2\);凹效用 \(\Rightarrow E[u(W)]\le u(E[W])\),即风险厌恶与保险附加保费的来源。
  • 这套"多项式界 → 指数界 → 凸性界"的工具箱是高维统计、机器学习与集中不等式理论的入口。
全书回顾 从计数到极限定理

至此,我们走完了一段完整的旅程:第 1 章的计数原理教会我们数样本点;第 2 章的柯尔莫哥洛夫公理把概率安放在坚实的地基上;第 3 章以条件概率与贝叶斯公式引入"信息更新"的观点;第 4、5 章分别用分布列与密度函数刻画离散与连续随机变量;第 6 章处理多个随机变量的联合行为与相关性;第 7 章把期望锻造成一件万能工具;而第 8 章的极限定理——弱大数定律、中心极限定理、强大数定律与本节的不等式——则为"频率稳定于概率""样本均值收敛于真值""尾部概率可以被有效控制"提供了终极保证。从掷一枚硬币到理解机器为何能从数据中学习,这条线索贯穿始终。概率论的旅程在此告一段落,而它通往统计学、随机过程与人工智能的大门,正为完成本教程的你敞开。

练习

练习 8-5-1

某品牌灯管寿命 \(X\) 的期望为 \(1000\) 小时、标准差为 \(100\) 小时(分布未知)。用单边切比雪夫不等式估计 \(P\{X\ge1200\}\),并与两边切比雪夫界比较。

答案与提示

取 \(a=200\),\(\sigma^2=10^4\):单边 \(\ \frac{10^4}{10^4+200^2}=\frac{10^4}{5\times10^4}=0.2\);两边 \(\ \frac{10^4}{200^2}=0.25\)。若寿命恰为正态,真实值 \(1-\Phi(2)=0.0228\)。

练习 8-5-2

设 \(X\sim\mathrm{Exp}(\lambda)\),其矩母函数为 \(M(t)=\lambda/(\lambda-t)\)(\(t<\lambda\))。求 \(P\{X\ge a\}\) 的切尔诺夫界及最优 \(t^{*}\),并就 \(\lambda=1,\ a=3\) 算出数值,与真实值比较。

答案与提示

最小化 \(f(t)=-ta+\ln\lambda-\ln(\lambda-t)\),令 \(f'(t)=-a+\frac{1}{\lambda-t}=0\) 得 \(t^{*}=\lambda-\frac1a\)(须 \(a>1/\lambda=E[X]\))。代回:\(\ P\{X\ge a\}\le e\cdot\lambda a\,e^{-\lambda a}\)。当 \(\lambda=1,a=3\):界为 \(3e^{-2}\approx0.406\),真实值 \(e^{-3}\approx0.0498\)——界成立但偏松;若取 \(a=6\),界为 \(6e^{-5}\approx0.040\),真实值 \(e^{-6}\approx0.0025\),指数优势开始显现。

练习 8-5-3

利用延森不等式证明:对任意正数 \(x_1,\dots,x_n\),几何均值不超过算术均值:\(\ \sqrt[n]{x_1x_2\cdots x_n}\le\frac{x_1+\cdots+x_n}{n}\),并用 \(x_1=2,\ x_2=8\) 验证。

答案与提示

设 \(X\) 等可能地取 \(x_1,\dots,x_n\)。\(g=\ln\) 为凹函数,故 \(E[\ln X]\le\ln E[X]\),即 \(\ln\sqrt[n]{\prod x_i}\le\ln\frac{\sum x_i}{n}\),指数化即得。验证:几何均值 \(\sqrt{16}=4\le\frac{2+8}{2}=5\)。

练习 8-5-4

判断下列函数在给定区间上凸、凹还是两者都不是:\(x^2\)、\(e^x\)、\(\ln x\;(x>0)\)、\(\sqrt{x}\;(x\ge0)\)、\(|x|\)、\(\frac1x\;(x>0)\),并写出每个函数对应的延森不等式形式。

答案与提示

凸:\(x^2,\ e^x,\ |x|,\ 1/x\)(用 \(g''\ge0\) 验证;\(|x|\) 在 \(0\) 处不可导,但支撑线存在——如 \(k\in[-1,1]\) 在 \(0\) 处均支撑);凹:\(\ln x,\ \sqrt{x}\)。凸者给 \(E[g(X)]\ge g(E[X])\)(例如 \(E[|X|]\ge|E[X]|\),即"均值的绝对值不超过绝对值的均值");凹者反向(例如 \(E[\ln X]\le\ln E[X]\),正是练习 3)。