第 2 章 · 概率的公理

2.2 样本空间与事件

Sample Spaces and Events
学习目标
  • 给定一个随机试验,能写出恰当的样本空间,并指出它是有限、可数无限还是连续的;
  • 把"至少一个发生""恰好一个发生""都不发生"等日常表述翻译成集合表达式;
  • 绘制文氏图解释事件的并、交、补、差与互斥关系;
  • 陈述事件的交换、结合、分配律,并能证明与运用 De Morgan 对偶律;
  • 理解"事件 = 样本空间的子集"这一观点如何为 2.3 节的概率公理化铺平道路。

1. 样本空间:把所有可能列成集合

2.1 节指出,概率论的第一步是为随机试验建立数学模型,而建模的起点是把试验的全部可能结果无遗漏地界定清楚。掷一枚硬币,结果非正即反;掷一颗骰子,结果必是 \(1\) 到 \(6\) 之一——虽然单次结果不可预知,但"结果的可能范围"在试验之前就完全已知。把这个范围写成集合,就得到本教程最基本的概念。

定义 1 样本空间与样本点

随机试验的所有可能结果构成的集合 \(S\),称为该试验的样本空间(sample space);\(S\) 中的每个元素,即试验的一个可能结果,称为样本点(sample point)。

样本空间应当"完备且互斥":每次试验的结果恰好落回 \(S\) 中的一个样本点,既不遗漏、也不重复。例如掷一枚硬币 \(S=\{\text{正},\text{反}\}\);掷一颗骰子 \(S=\{1,2,3,4,5,6\}\);统计某商品明日销量 \(S=\{0,1,2,\ldots\}\);测量一只灯泡的寿命 \(S=(0,\infty)\)。

样本空间的选取存在粒度问题:掷两颗骰子,若记录两颗各自的点数(有序对),则共有 \(36\) 个样本点;若只记录点数之和,则只有 \(2\) 到 \(12\) 这 \(11\) 个样本点。两种样本空间都"完备且互斥",因而都合法,但只有前者的样本点是等可能的——粒度选错,等可能分析就会失效,这一点在 2.5 节的等可能模型中将再次警示。一般原则是:粒度应细到能区分试验中我们关心的全部差别

2. 事件:样本空间的子集

有了样本空间,"事件"就有了精确的落点。我们关心的问题往往不是单个结果,而是满足某种条件的一批结果:"掷出偶数点""寿命超过 5000 小时""点数之和为 7"。这些条件各自挑出 \(S\) 的一个子集——这就是事件的全部含义。

定义 2 事件、必然事件与不可能事件

样本空间 \(S\) 的任一子集 \(E\) 称为一个事件(event)。当且仅当试验结果 \(s\in E\) 时,称事件 \(E\) 发生。其中 \(S\) 本身包含全部样本点,每次试验必然发生,称为必然事件(certain event);空集 \(\varnothing\) 不含任何样本点,永不发生,称为不可能事件(impossible event)。

例如掷一颗骰子时,"掷出偶数点"是事件 \(\{2,4,6\}\);单点子集 \(\{2\}\) 表示"恰好掷出 2"。若掷得 4,则事件 \(\{2,4,6\}\) 发生,而事件 \(\{2\}\) 不发生。

"发生"一词的准确含义由此变为"试验结果落在子集之内"。于是,关于事件的一切逻辑——"或、且、非"——都自动翻译为集合的并、交、补。反过来看,所谓概率,就是把一个数合理地分配给每个子集(事件)的函数;对这样的函数应当提出什么要求,正是 2.3 节三条公理的任务。

3. 事件的运算与运算律

设 \(E\)、\(F\) 为同一样本空间 \(S\) 中的事件。(union)\(E\cup F\) 表示"\(E\) 或 \(F\) 至少一个发生";(intersection)\(EF=E\cap F\) 表示"\(E\) 与 \(F\) 同时发生";(complement)\(E^c=S-E\) 表示"\(E\) 不发生";(difference)\(E-F=E\cap F^c\) 表示"\(E\) 发生而 \(F\) 不发生"。四种运算的直观形象见图 1 的文氏图(Venn diagram)。

定义 3 互斥事件

若两个事件没有公共样本点,即 \(EF=\varnothing\),则称 \(E\) 与 \(F\) 互斥(mutually exclusive)(或不相交)。互斥事件在同一次试验中不可能同时发生。

例如掷一颗骰子,"掷出 1"与"掷出 2"互斥;而"掷出偶数"与"掷出小于 4 的数"不互斥,因为掷出 2 时两者同时发生。

并 E ∪ F S E F E、F 至少一个发生 交 E ∩ F S E F E、F 同时发生 补 Ec S E F E 不发生 差 E − F S E F E 发生而 F 不发生
图 1:文氏图四联。每个面板中,矩形表示样本空间 \(S\),阴影部分表示相应运算的结果事件:并取两圆全体,交取公共透镜区域,补取圆外一切区域,差取 \(E\) 中除去与 \(F\) 公共的部分。

事件运算满足与数的运算相仿的规律,其中最有价值的是对偶律:把"取补"施加于并(交),得到的是补的交(并)。它把"至少一个不发生"与"都不发生"互相转化,是今后化简事件的常用工具。

定理 1 事件的运算律与对偶律

设 \(E\)、\(F\)、\(G\) 为事件,则有:

交换律与结合律:

\[ E\cup F=F\cup E,\qquad EF=FE; \qquad (E\cup F)\cup G=E\cup(F\cup G),\qquad (EF)G=E(FG). \]

分配律:

\[ E(F\cup G)=EF\cup EG,\qquad E\cup FG=(E\cup F)(E\cup G). \]

对偶律(De Morgan 律):

\[ (E\cup F)^c=E^cF^c,\qquad (EF)^c=E^c\cup F^c. \]

证明交换律、结合律与分配律是集合运算的一般性质,可直接按"发生"的含义读出,例如 \(E(F\cup G)\) 表示"\(E\) 发生,且 \(F\)、\(G\) 至少一个发生",这恰好等于"\(E\)、\(F\) 同时发生,或 \(E\)、\(G\) 同时发生",即 \(EF\cup EG\)。下面用双向包含严格证明对偶律第一式。记 \(A=(E\cup F)^c\),\(B=E^cF^c\)。一方面,若 \(s\in A\),则 \(s\notin E\cup F\),即 \(s\notin E\) 且 \(s\notin F\),于是 \(s\in E^c\) 且 \(s\in F^c\),从而 \(s\in B\),故 \(A\subset B\)。另一方面,若 \(s\in B\),则 \(s\in E^c\) 且 \(s\in F^c\),即 \(s\notin E\) 且 \(s\notin F\),于是 \(s\notin E\cup F\),从而 \(s\in A\),故 \(B\subset A\)。两方面合起来即 \(A=B\)。对于第二式,在已证的第一式中把 \(E\)、\(F\) 换成 \(E^c\)、\(F^c\),得 \((E^c\cup F^c)^c=(E^c)^c(F^c)^c=EF\),两边再取补(取补是对合运算,\((E^c)^c=E\)),即得 \((EF)^c=E^c\cup F^c\)。对偶律还可以推广到任意有限多个事件:\((\bigcup_{i=1}^{n}E_i)^c=\bigcap_{i=1}^{n}E_i^c\),\((\bigcap_{i=1}^{n}E_i)^c=\bigcup_{i=1}^{n}E_i^c\)。证毕。

为便于查阅,下表把集合语言与概率语言逐条对照。本节之后,我们将在这两种语言之间自由切换。

表 1:集合语言与概率语言对照表
记号集合论含义概率论含义
\(S\)全集样本空间(必然事件)
\(\varnothing\)空集不可能事件
\(E\subset S\)子集事件
\(s\in E\)元素属于子集结果为 \(s\),事件 \(E\) 发生
\(E\cup F\)并集\(E\)、\(F\) 至少一个发生
\(EF\)交集\(E\)、\(F\) 同时发生
\(E^c\)补集\(E\) 不发生
\(E-F\)差集\(E\) 发生而 \(F\) 不发生
\(EF=\varnothing\)不相交\(E\)、\(F\) 互斥
\(E\subset F\)包含\(E\) 发生必导致 \(F\) 发生
注记 互斥不等于对立

常见误区是把"互斥"与"对立"混为一谈。\(E\)、\(F\) 互斥只要求 \(EF=\varnothing\);而 "\(F\) 是 \(E\) 的对立事件"还要求 \(E\cup F=S\),即两者恰好把样本空间分尽。掷一颗骰子,\(\{1\}\) 与 \(\{2\}\) 互斥但不对立(还有其余四种结果);\(\{1\}\) 与 \(\{2,3,4,5,6\}\) 才互为对立事件。对立必互斥,互斥未必对立。另外,"两两互斥"的说法在涉及三个及以上事件时才真正重要——它意味着任意两个都互斥,这一条件将直接出现在 2.3 节的可数可加公理中。

4. 样本空间的三种类型:三个例题

按"大小"分,样本空间有三类:有限(finite)的,如掷骰子;可数无限(countably infinite)的,即其样本点可以排成无穷序列 \(s_1,s_2,s_3,\ldots\);以及连续(continuous)(不可数)的,如寿命取遍区间 \((0,\infty)\)。下面三个例题各对应一类。无论哪一类,事件的运算与运算律完全相同——集合论不关心 \(S\) 的大小;而 2.3 节的公理也正是对三类空间统一陈述的。

例 1 掷两颗骰子(有限样本空间)

掷一颗红骰子和一颗蓝骰子,写出样本空间 \(S\),并给出事件 \(E\)=“两颗骰子的点数之和为 7”所含的全部样本点。\(E\) 中的样本点占 \(S\) 的比例是多少?

两颗骰子可以分辨,因此一个结果是有序对 \((i,j)\),其中 \(i\) 为红骰子点数、\(j\) 为蓝骰子点数,各取 \(1,\ldots,6\)。于是 \[ S=\{(i,j): i,j=1,2,\ldots,6\}, \] 共 \(6\times 6=36\) 个样本点,可用图 2 的 \(6\times 6\) 网格一一列出。事件 \(E\) 由满足 \(i+j=7\) 的有序对组成: \[ E=\{(1,6),(2,5),(3,4),(4,3),(5,2),(6,1)\}, \] 共 \(6\) 个样本点,恰好落在网格的反对角线上。它占全部样本点的比例为 \(6/36=1/6\)。由两颗骰子的对称性,这 \(36\) 个结果中有理由认为每一个都等可能(2.5 节将把这一比例定义为 \(P(E)=1/6\))。若一开始偷懒只记录点数之和,\(S\) 便只有 \(11\) 个样本点且远非等可能——粒度的选择直接决定了后续分析能否进行。
第二颗骰子的点数 j 1 2 3 4 5 6 1 2 3 4 5 6 2 3 4 5 6 3 4 5 6 8 4 5 6 8 9 5 6 8 9 10 6 8 9 10 11 8 9 10 11 12 7 7 7 7 7 7 和为 7 的样本点 E = {(i,j) : i+j = 7} (1,6) (2,5) (3,4) (4,3) (5,2) (6,1) 共 6 个样本点(反对角线) 占比 6/36 = 1/6 (2.5 节将其定义为 P(E)) 第一颗骰子的点数 i
图 2:两颗骰子样本空间的 \(6\times 6\) 网格,单元格中标注点数之和 \(i+j\)。高亮的反对角线恰为事件“点数之和为 7”的 \(6\) 个样本点;每条平行于它的方向上的格子之和相同,而主对角线方向和为 2 与 12 的各只有 1 个样本点。
例 2 显像管的寿命(连续样本空间)

测试一只电视显像管的寿命(单位:小时)。写出样本空间 \(S\),并把事件 \(E\)=“寿命超过 5000 小时”、\(H\)=“寿命超过 4000 小时”表示为 \(S\) 的子集;再用差运算表示“寿命超过 4000 但不超过 5000 小时”。

寿命可以是任何正实数,故 \(S=(0,\infty)\),这是一个连续(不可数)的样本空间:任取两个寿命值之间总还有别的可能。两个事件都是半直线区间: \[ E=(5000,\infty),\qquad H=(4000,\infty). \] 显然 \(E\subset H\)(寿命超过 5000 必超过 4000)。于是“超过 4000 但不超过 5000”即 \[ H-E=H\cap E^c=(4000,5000]. \] 注意区间的开闭:寿命恰好等于 5000 属于 \(H\) 而不属于 \(E\),故包含在 \(H-E\) 中;像 \(\{5000\}\) 这样的单点集也是合法事件(“寿命恰好为 5000 小时”)。连续样本空间中的事件通常是区间或若干区间的并,其概率无法靠“数样本点”得到,而要靠 2.3 节的公理配合长度等测度来赋值,这正是第 5 章连续型随机变量的出发点。
例 3 掷到首次出现 6(可数无限样本空间)

反复掷一颗骰子,直到首次出现 6 点为止,记录整个投掷序列。写出样本空间 \(S\),说明它是可数无限的,并给出事件“恰好掷 3 次才首次出现 6”与“首次 6 出现在偶数次投掷”。

由于出现 6 时立即停止,每个结果是一个最后一项为 6、之前各项只能取 \(1\) 到 \(5\) 的有限序列: \[ S=\{x_1x_2\cdots x_{n-1}6:\ n\ge 1,\ x_1,\ldots,x_{n-1}\in\{1,2,3,4,5\}\}. \] 它是无限集:序列长度可以任意长。但它可数:按长度分层,长度为 \(n\) 的序列恰有 \(5^{\,n-1}\) 个(有限的),先数尽长度 1 的,再数长度 2 的,如此排下去,全体样本点便与自然数 \(1,2,3,\ldots\) 一一对应。据此,两个事件分别为 \[ \{x_1x_2 6:\ x_1,x_2\in\{1,2,3,4,5\}\}\quad(\text{含 }25\text{ 个样本点}), \] 以及“长度 \(n\) 为偶数的序列全体”——它仍是无限事件。本例默认试验总会停止,因而每个样本点都是有限序列;“直到首次成功为止”的试验的完整概率结构将在第 4 章的几何分布中严格展开。

5. 本节小结

要点回顾
  • 样本空间 \(S\) 是全部样本点的集合;事件 \(E\) 是 \(S\) 的子集,“发生”即结果落入子集;\(S\) 为必然事件,\(\varnothing\) 为不可能事件。
  • 四种基本运算:并 \(E\cup F\)(至少一个发生)、交 \(EF\)(同时发生)、补 \(E^c\)(不发生)、差 \(E-F=EF^c\)(发生 \(E\) 而不发生 \(F\));\(EF=\varnothing\) 即互斥。
  • 事件满足交换、结合、分配律;De Morgan 对偶律 \((E\cup F)^c=E^cF^c\)、\((EF)^c=E^c\cup F^c\) 把“至少一个”与“全部”互相转化。
  • 样本空间分有限(两骰 36 点)、可数无限(掷到首次 6)、连续(寿命 \((0,\infty)\))三类;集合运算与 2.3 节的公理对三类统一适用。
  • 下一节将把概率定义为作用在事件(子集)上、满足三条公理的函数——本节的集合语言就是公理的地基。

练习

练习 2-2-1

设 \(E\)、\(F\) 为两个事件,试用 \(E\)、\(F\) 的集合表达式分别表示:(a) \(E\)、\(F\) 至少一个发生;(b) \(E\)、\(F\) 恰好一个发生;(c) \(E\)、\(F\) 都不发生。

答案与提示

(a) \(E\cup F\)。(b) \(EF^c\cup E^cF\),即“\(E\) 发生 \(F\) 不发生,或 \(F\) 发生 \(E\) 不发生”;它也等于 \((E\cup F)-EF\),即从“至少一个”中挖去“两个同时”的部分。(c) \(E^cF^c\),由对偶律它恰是 \((E\cup F)^c\)——“至少一个发生”的补集。

练习 2-2-2

取 \(S=\{1,2,3,4,5,6\}\),\(E=\{1,2,3,4\}\),\(F=\{3,4,5\}\)。逐一列出元素,验证两条对偶律 \((E\cup F)^c=E^cF^c\) 与 \((EF)^c=E^c\cup F^c\)。

答案与提示

\(E\cup F=\{1,2,3,4,5\}\),故 \((E\cup F)^c=\{6\}\);而 \(E^c=\{5,6\}\),\(F^c=\{1,2,6\}\),交为 \(\{6\}\),两边相等。又 \(EF=\{3,4\}\),故 \((EF)^c=\{1,2,5,6\}\);而 \(E^c\cup F^c=\{5,6\}\cup\{1,2,6\}=\{1,2,5,6\}\),亦相等。小例子验证大定理,有助于把“补”与“交并互换”的直觉固定下来。

练习 2-2-3

把两只(可分辨的)球逐一放入三个盒子,每只球等可能地落入任一盒。写出样本空间 \(S\),并数出样本点总数。若两球不可分辨,样本点又是多少个?

答案与提示

一个结果由“球 1 落入的盒子 \(i\)”与“球 2 落入的盒子 \(j\)”完全确定,故 \(S=\{(i,j): i,j\in\{1,2,3\}\}\),共 \(3^2=9\) 个样本点(第 1 章的乘法原理:\(3\times 3\))。若两球不可分辨,能区分的只是各盒球数的分布 \((2,0,0)\) 型 3 个、\((1,1,0)\) 型 3 个,共 \(6\) 个样本点——但它们不再等可能(前者各对应 1 个有序结果,后者各对应 2 个)。两种粒度的差异正对应 2.5 节的警示。

练习 2-2-4

在例 1 的两骰样本空间中,用集合写出事件 \(G\)=“至少一颗骰子点数为 6”,并数出 \(|G|\)。

答案与提示

记 \(G_1\)=“红骰为 6”\(=\{(6,j):j=1,\ldots,6\}\),\(G_2\)=“蓝骰为 6”\(=\{(i,6):i=1,\ldots,6\}\),则 \(G=G_1\cup G_2\)。若直接相加得 \(12\) 就重复计了 \((6,6)\):\(G_1G_2=\{(6,6)\}\),故 \(|G|=6+6-1=11\)。这一“多退少补”的计数思想,正是 2.4 节容斥公式的雏形。