第 2 章 · 概率的公理

2.6 概率:连续集函数

Probability as a Continuous Set Function
学习目标
  • 用单调包含关系定义"递增 / 递减事件列"及其极限事件,并说明 \(\bigcup E_n\)、\(\bigcap E_n\) 为何是自然的极限;
  • 陈述并证明递增、递减事件列的两个连续性定理(化不交并 + 可数可加公理,递减情形取补化为递增);
  • 在 \(S=(0,1)\) 的长度概率模型中验证两个定理,理解"交为空集而概率趋于 0"的微妙之处;
  • 运用连续性计算极限事件的概率(区间极限、可数点集),并解释"概率为 0 不等于不可能";
  • 说明"概率是连续集函数"这一观点对几何概率模型与后续分布函数、极限定理的意义。

1. 从有限并到可数并:概率函数为何要"连续"

2.3 节的三条公理中,公理 3 的可数可加性(countable additivity)只直接处理"两两互斥的无穷多个事件";2.4 节则把有限并、有限交情形的概率计算梳理清楚。一个自然的问题随之而来:当事件 \(E_n\) 随 \(n\) 的增大而"趋向"某个极限事件 \(E\) 时,概率 \(P(E_n)\) 是否也趋向 \(P(E)\)?换言之,\(P\) 作为以集合为自变量的集函数(set function),是否像微积分中的连续函数那样,允许交换"取极限"与"求概率"的次序?

集合之间没有天然的"距离",但有一类特殊而常见的收敛方式——单调包含。例如在 \(S=(0,1)\) 上按长度赋概,区间 \(E_n=(0,\,1-1/n]\) 随 \(n\) 增大逐渐撑满整个样本空间,其长度 \(1-1/n\) 趋于 1,与"极限区间"\((0,1)\) 的长度一致。本节将证明:对单调变化的事件列,这种交换永远合法——这正是标题"概率:连续集函数"的确切含义。

定义 1 单调事件列及其极限

设 \(\{E_n,\ n\ge 1\}\) 为样本空间 \(S\) 中的一列事件。若 \(E_1\subset E_2\subset E_3\subset\cdots\),称为递增事件列(increasing sequence of events),其极限事件(limit event)定义为 \(E=\bigcup_{n=1}^{\infty}E_n\),记作 \(E_n\uparrow E\);若 \(E_1\supset E_2\supset\cdots\),称为递减事件列(decreasing sequence of events),极限事件为 \(E=\bigcap_{n=1}^{\infty}E_n\),记作 \(E_n\downarrow E\)。

由 2.4 节的单调性命题,递增列的 \(P(E_n)\) 单调不减且有上界 1,递减列的 \(P(E_n)\) 单调不增且有下界 0,因此两端的数列极限都存在。下面的定理断言:这个数列极限恰好等于极限事件的概率。

2. 递增事件列的连续性定理

定理 1 递增事件列的连续性

若 \(E_1\subset E_2\subset\cdots\),则 \[ P\Big(\bigcup_{n=1}^{\infty}E_n\Big)=\lim_{n\to\infty}P(E_n). \]

证明思路是把"嵌套的并"改写成"不交的并",从而能调用公理 3。令 \(F_1=E_1\),并对 \(n\ge 2\) 令 \(F_n=E_n-E_{n-1}\)(差集,即 \(E_nE_{n-1}^c\))。
(i)\(\bigcup_{n=1}^{\infty}F_n=\bigcup_{n=1}^{\infty}E_n\)。一方面每个 \(F_n\subset E_n\),故"左含于右";另一方面,若 \(x\in\bigcup E_n\),设 \(k\) 为使 \(x\in E_k\) 的最小下标,则 \(k=1\) 时 \(x\in F_1\),\(k\ge 2\) 时 \(x\in E_k\) 但 \(x\notin E_{k-1}\),故 \(x\in F_k\)。
(ii)诸 \(F_n\) 两两不交:若 \(m<n\),则 \(F_m\subset E_m\subset E_{n-1}\),而 \(F_n\) 与 \(E_{n-1}\) 不相交。
于是由公理 3(可数可加性)与部分和的收敛, \[ P\Big(\bigcup_{n=1}^{\infty}E_n\Big)=\sum_{n=1}^{\infty}P(F_n)=\lim_{N\to\infty}\sum_{n=1}^{N}P(F_n). \] 对固定的 \(N\):因 \(E_{n-1}\subset E_n\) 且 \(E_n=E_{n-1}\cup(E_n-E_{n-1})\) 为不交分解,有 \(P(F_n)=P(E_n)-P(E_{n-1})\),代入后分子分母望远镜相消, \[ \sum_{n=1}^{N}P(F_n)=P(E_1)+\sum_{n=2}^{N}\big(P(E_n)-P(E_{n-1})\big)=P(E_N). \] 两端令 \(N\to\infty\),即得 \(P(\bigcup E_n)=\lim_{N\to\infty}P(E_N)\)。证毕。∎
递增事件列的嵌套扩张:E1 ⊂ E2 ⊂ E3 ⊂ ⋯ E1 E2 E3 E = ∪ En E2 E1 E3 E2 E1 E = ∪ En 极限事件 由单调性:P(E1) ≤ P(E2) ≤ P(E3) ≤ ⋯ ≤ 1,数列极限必存在 定理 1:P(En) ↑ P(∪En)——概率的极限 = 极限事件的概率
图 1:递增事件列 E1 ⊂ E2 ⊂ E3 ⊂ ⋯ 的文氏图序列。事件像"嵌套扩张的领土",每次新增的部分 En−En−1 互不重叠,把概率一层层累加到极限事件 ∪En 上。

直观地说,递增列的并好比一层层刷墙:每一遍新增的涂层 \(F_n=E_n-E_{n-1}\) 互不重叠,总的"覆盖量"当然是各层之和,而刷完第 \(N\) 遍时的覆盖量正是 \(P(E_N)\)。定理 1 把这一直观变成了定理。

3. 递减事件列的连续性定理

定理 2 递减事件列的连续性

若 \(E_1\supset E_2\supset\cdots\),则 \[ P\Big(\bigcap_{n=1}^{\infty}E_n\Big)=\lim_{n\to\infty}P(E_n). \]

证明取补集,把递减化为递增。令 \(F_n=E_n^c\)。由 \(E_n\supset E_{n+1}\) 得 \(F_n\subset F_{n+1}\),即 \(\{F_n\}\) 为递增列;又由 2.2 节的对偶律(De Morgan 律), \[ \bigcup_{n=1}^{\infty}F_n=\Big(\bigcap_{n=1}^{\infty}E_n\Big)^{\!c}. \] 对递增列 \(\{F_n\}\) 用定理 1,并用 2.4 节的 \(P(A^c)=1-P(A)\): \[ 1-P\Big(\bigcap_{n=1}^{\infty}E_n\Big)=P\Big(\Big(\bigcap_{n=1}^{\infty}E_n\Big)^{\!c}\Big)=\lim_{n\to\infty}P(F_n)=\lim_{n\to\infty}\big(1-P(E_n)\big)=1-\lim_{n\to\infty}P(E_n), \] 移项即得 \(P(\bigcap E_n)=\lim P(E_n)\)。证毕。∎
推论 1 收缩到空集

若 \(\{E_n\}\) 递减且 \(\bigcap_{n=1}^{\infty}E_n=\varnothing\),则 \(\lim_{n\to\infty}P(E_n)=0\)。

由定理 2 立得:\(P(\varnothing)=0\)。它常被用来证明"某类点被取到的概率为零",下节例题与第 8 章的极限定理都会反复使用这一手法。

4. 长度模型 \(S=(0,1)\) 中的验证

最能体现这两个定理价值的舞台是连续样本空间。考虑 \(S=(0,1)\),并按"长度"给事件赋概:区间 \((a,b)\)、\((a,b]\) 等的概率就取其长度 \(b-a\)。这正是第 5 章均匀分布(uniform distribution)的雏形(严格表述依赖一维勒贝格测度(Lebesgue measure),此处按直观理解即可)。在这一模型中,"事件列的极限"看得见摸得着。

例 1 \((0,1)\) 长度模型:两个定理的直接验证

在 \(S=(0,1)\) 按长度赋概的模型中:(a) 设 \(E_n=(0,\,1-1/n]\ (n\ge 2)\),验证 \(\{E_n\}\) 递增并求 \(P(\bigcup E_n)\);(b) 设 \(F_n=(0,\,1/n]\),验证 \(\{F_n\}\) 递减并求 \(P(\bigcap F_n)\)。

(a) 端点 \(1-1/n\) 随 \(n\) 增大,故 \(E_n\subset E_{n+1}\),\(\{E_n\}\) 递增。显然 \(\bigcup E_n\subset(0,1)\);反之任取 \(x\in(0,1)\),只要 \(n\ge 1/(1-x)\) 就有 \(1/n\le 1-x\),即 \(x\le 1-1/n\),故 \(x\in E_n\)。于是 \(\bigcup E_n=(0,1)\)。由定理 1, \[ P\Big(\bigcup E_n\Big)=\lim_{n\to\infty}P(E_n)=\lim_{n\to\infty}\Big(1-\frac{1}{n}\Big)=1=P\big((0,1)\big). \] (b) 端点 \(1/n\) 随 \(n\) 减小,故 \(\{F_n\}\) 递减。若 \(x>0\),取 \(n>1/x\) 便有 \(1/n<x\),即 \(x\notin F_n\);又 \(0\notin S\),根本没有别的候选点,故 \(\bigcap F_n=\varnothing\)。于是 \[ P\Big(\bigcap F_n\Big)=P(\varnothing)=0=\lim_{n\to\infty}\frac{1}{n}=\lim_{n\to\infty}P(F_n), \] 与定理 2、推论 1 完全一致。值得注意的是:直观上区间"收缩到点 0",但 0 并不是 \(S\) 的样本点,极限事件严格等于空集;定理保证概率确实降到 0,而不会"残留一个无穷小的正数"。
数轴上的区间套:En = (0, 1/n] 随 n 增大向 0 收缩 P(En) = 1/n → 0 0 1/5 1/4 1/3 1/2 1 x = 0.3 E1 E2 E3 E4 E5 P = 1 P = 1/2 P = 1/3 P = 1/4 P = 1/5 任何 x > 0 当 n > 1/x 时被挤出区间,且 0 ∉ S,故 ∩En = ∅,P(En) → 0 金色点 x = 0.3 只属于前 3 个区间——每个固定点最终都被挤出
图 2:数轴上的区间套 \(E_n=(0,\,1/n]\)(即例 1 (b))收缩示意。左端空心圆表示 0 不属于任何 \(E_n\),右端实心圆表示端点 \(1/n\) 属于 \(E_n\);区间右端逐步逼近 0,极限事件为空集,概率降为 0。
例 2 极限事件非空的对照与数值演示

(a) 在同一模型中取 \(G_n=(0,\,1/2+1/n]\ (n\ge 2)\),说明 \(\{G_n\}\) 递减且 \(\bigcap G_n\neq\varnothing\),并验证定理 2;(b) 用数值表演示例 1 (a) 中递增列 \(P(E_n)=1-1/n\) 的收敛过程。

(a) 端点 \(1/2+1/n\) 随 \(n\) 减小且以 \(1/2\) 为下确界,故 \(\{G_n\}\) 递减。逐点判断:\(x\in\bigcap G_n\) 当且仅当对一切 \(n\) 有 \(x\le 1/2+1/n\),即 \(x\le\inf_n(1/2+1/n)=1/2\),故 \(\bigcap G_n=(0,\,1/2]\),是一个非空集合。于是 \[ \lim_{n\to\infty}P(G_n)=\lim_{n\to\infty}\Big(\frac{1}{2}+\frac{1}{n}\Big)=\frac{1}{2}=P\Big(\big(0,\frac{1}{2}\Big]\Big)=P\Big(\bigcap G_n\Big). \] 与例 1 (b) 对照可见:递减列的极限事件既可能是空集,也可能是"实打实"的集合,两种情形概率的极限都与极限事件的概率吻合——定理 2 对它们一视同仁。(b) 见表 1:\(P(E_n)\) 单调上升,以 1 为极限,恰好收敛到极限事件 \((0,1)\) 的概率。
表 1:递增列 \(E_n=(0,\,1-1/n]\) 的概率收敛过程(长度模型)
\(n\)\(E_n\)\(P(E_n)=1-1/n\)
\(2\)\((0,\,1/2]\)\(0.5\)
\(3\)\((0,\,2/3]\)\(0.6667\)
\(4\)\((0,\,3/4]\)\(0.75\)
\(5\)\((0,\,4/5]\)\(0.8\)
\(10\)\((0,\,9/10]\)\(0.9\)
\(100\)\((0,\,99/100]\)\(0.99\)
\(1000\)\((0,\,999/1000]\)\(0.999\)
\(n\to\infty\)\(\bigcup E_n=(0,1)\)\(\to 1\)
例 3 可数点集的"长度"为零

在 \(S=(0,1)\) 中按长度赋概、随机取点。证明:该点落在有理数上的概率为 0,落在无理数上的概率为 1;并由此说明"概率为 0 的事件未必是不可能事件"。

\((0,1)\) 中的有理数是可数集(第 1 章),可排成序列 \(q_1,q_2,q_3,\dots\);每个单点集 \(\{q_i\}\) 的长度为 0。令 \(H_n=\{q_1,\dots,q_n\}\),则 \(\{H_n\}\) 递增且 \(\bigcup H_n=\mathbb{Q}\cap(0,1)\)。由有限可加性,\(P(H_n)=0\)(有限个"长度为零"的点)。由定理 1, \[ P\big(\mathbb{Q}\cap(0,1)\big)=P\Big(\bigcup_{n=1}^{\infty}H_n\Big)=\lim_{n\to\infty}P(H_n)=0, \qquad P\big(\text{无理数}\big)=1-0=1. \] 然而"取到有理数"在逻辑上并非不可能——有理数确实是 \(S\) 的样本点。在 2.5 节的有限等可能模型中,"概率为 0"与"不可能"是一回事;连续模型第一次把这两者区分开来:单个点(乃至任何可数点集)都"存在却测度为零"。

5. 意义:为什么称概率为"连续集函数"

至此可以正面回答本节标题的提问:概率确实是连续集函数——定理 1 与定理 2 表明,\(P\) 在事件的单调极限意义下连续,即允许交换"取极限"与"求概率"的次序。这一性质在三个层面上不可或缺。

其一,它是沟通有限与无限的桥梁。2.4 节的全部命题只涉及有限次并、交运算;定理 1 的证明正是把可数并拆成不交并之后才得以调用公理 3。可以说:连续性 = 可数可加性 + 有限结果取极限,它是从"有限可加"走向"可数可加"的通行证。其二,它为几何概率模型提供合法性。由例 3,单点与端点都不占"长度",于是 \((a,b)\)、\([a,b)\)、\((a,b]\)、\([a,b]\) 的概率同为 \(b-a\)——开闭端点不影响概率,这不是约定而是定理的推论;第 5 章分布函数 \(F(x)=P(X\le x)\) 的"右连续"性质,也正是定理 2 作用于递减列 \(( -\infty,\,x+1/n]\) 的直接结果。其三,它是研究无穷多次试验的基本工具:"事件最终发生""频率收敛于 \(p\)"这类极限表述,都要靠本节的定理才能严格化(第 8 章大数定律的证明将以它为基本部件)。

注记 两个常见误区

第一,单调性不可省略。对任意(不单调的)事件列,\(P(\lim E_n)=\lim P(E_n)\) 一般不再成立,一般情形需要上极限、下极限等更强工具,超出本书范围。第二,"递减到空集则概率趋于 0"并非有限可加性的推论:在只承认可有限加性的体系中,可以构造出 \(E_n\downarrow\varnothing\) 而 \(P(E_n)\equiv 1\) 的病态例子。换言之,柯尔莫哥洛夫选择可数可加的公理 3,正是为了排除这类"不连续"的概率——这正是"连续集函数"一词的深意所在。

6. 本节小结

要点回顾
  • 定义:递增列 \(E_n\uparrow\bigcup E_n\),递减列 \(E_n\downarrow\bigcap E_n\);由单调性,\(P(E_n)\) 单调有界,极限必存在。
  • 定理 1(递增):\(P(\bigcup E_n)=\lim P(E_n)\)。证明要点:化不交并 \(E_1\cup(E_2-E_1)\cup(E_3-E_2)\cup\cdots\),用公理 3 与望远镜求和。
  • 定理 2(递减):\(P(\bigcap E_n)=\lim P(E_n)\)。证明要点:取补化为递增列再用定理 1;推论 1:交为空集则概率趋于 0。
  • 长度模型验证:\(S=(0,1)\) 中 \(E_n=(0,1-1/n]\) 递增趋于全空间、\(F_n=(0,1/n]\) 递减收缩到空集,两个定理均成立;可数点集概率为 0,故概率为 0 不等于不可能。
  • 意义:概率是连续集函数——为几何概率、第 5 章分布函数的右连续性与第 8 章极限定理奠基。

练习

练习 2-6-1

不取补,直接用"差不交分解"证明定理 2(递减列的连续性)。

答案与提示

令 \(D_k=E_k-E_{k+1}\),则诸 \(D_k\) 两两不交,且 \(\bigcup_{k=n}^{\infty}D_k=E_n-\bigcap_{k}E_k\)(若 \(x\in E_n\) 且 \(x\notin\bigcap E_k\),取最小的 \(k\ge n\) 使 \(x\notin E_{k+1}\),则 \(x\in D_k\))。于是 \(E_n=(\bigcap E_k)\cup\bigcup_{k\ge n}D_k\) 为不交并, \[ P(E_n)=P\Big(\bigcap E_k\Big)+\sum_{k=n}^{\infty}P(D_k). \] 由 \(0\le\sum_{k=1}^{\infty}P(D_k)\le P(E_1)<\infty\) 知该级数收敛,其尾部 \(\sum_{k\ge n}P(D_k)\to 0\),故 \(P(E_n)\to P(\bigcap E_k)\)。

练习 2-6-2

设 \(\{E_n\}\) 递减且 \(\bigcap E_n=\varnothing\),证明 \(P(E_n)\to 0\);并在 \(S=(0,1)\) 长度模型中用 \(E_n=(0,\,1/n]\) 给出具体印证。

答案与提示

由定理 2,\(P(E_n)\to P(\bigcap E_n)=P(\varnothing)=0\)。具体印证即例 1 (b):\(P(E_n)=1/n\to 0\)。这一推论是证明"某类点被取到概率为零"的标准工具。

练习 2-6-3

(可数集的赋权)设 \(x_1,x_2,\dots\) 是 \(S\) 中互异的点,对每点赋值 \(P(\{x_i\})=p_i\ge 0\)。令 \(F_n=\{x_1,\dots,x_n\}\),用定理 1 证明 \(P\big(\bigcup_{i=1}^{\infty}\{x_i\}\big)=\sum_{i=1}^{\infty}p_i\)。

答案与提示

\(F_n\) 递增且 \(\bigcup F_n=\bigcup\{x_i\}\);由有限可加性 \(P(F_n)=\sum_{i=1}^{n}p_i\);由定理 1 取极限即得。这说明在连续性定理之下,"对单点赋权"自动扩张为对整个可数集的合法概率——例 3 即其 \(p_i\equiv 0\) 的特例。

练习 2-6-4

在 \(S=(0,1)\) 长度模型中,令 \(G_n=\big(\tfrac{1}{n+1},\,\tfrac{1}{n}\big]\)。证明这些区间两两不交,并用定理 1 求 \(P\big(\bigcup_{n=1}^{\infty}G_n\big)\)。

答案与提示

相邻区间端点相接但不重叠,任意两个不同区间不相交。部分并 \(H_N=\bigcup_{n=1}^{N}G_n=\big(\tfrac{1}{N+1},\,1\big]\) 递增,其极限事件 \(\bigcup G_n\) 作为 \(S\) 的子集就是 \((0,1)\)(端点 1 不属于 \(S\))。由定理 1,\(P(\bigcup G_n)=\lim_{N\to\infty}\big(1-\tfrac{1}{N+1}\big)=1\)。也可由公理 3 直接求和验证:\(\sum_{n=1}^{\infty}\big(\tfrac{1}{n}-\tfrac{1}{n+1}\big)=1\),正是望远镜级数。