- 说明本章主旋律"把复杂随机量分解为简单量之和"的动机:直接求"和"的分布通常不可行,而求"和"的期望存在捷径;
- 写出指示随机变量 \(I_A\) 的定义并验证 \(E[I_A]=P(A)\),说明它是分解计数型随机量的最小积木;
- 陈述期望的线性性,并用离散情形的两行推导说明它为何不需要独立性;
- 在保险公司总赔付问题中执行"分解—求和—回收"三步,得出 \(E[S]=50\,000\) 元;
- 按顺序说出三大工具(线性性 / 条件期望 / 矩母函数)的用途分支及对应节次 7.2–7.8。
1. 计算的困境与出路
第 4 章我们学会了计算单个随机变量的期望(expectation):离散型逐点加权求和,连续型积分;第 5 章处理了连续型变量,第 6 章又把若干随机变量放到一起,引入联合分布(joint distribution)。然而真实问题交给我们的,往往不是"某一个随机变量",而是"一大堆随机因素叠加出的总量":保险公司一年的总赔付是成百上千张保单赔付额之和;同时掷 \(n\) 颗骰子的总点数是 \(n\) 个点数之和;抽样调查面对的样本均值(sample mean) 是 \(n\) 个观测的平均;排队系统一天的总等待时间是一段段服务时间之和。
对这样的"和",前几章的路线是迂回的:先求出和的分布,再算期望。设 \(S=X_1+\cdots+X_n\),若各 \(X_i\) 独立,密度须经 \(n-1\) 次卷积(convolution);若相依,还得先拿下整个联合分布——多数场合根本做不到。本章的立场是:若目的只是期望(以及与它同族的方差、矩等量),完全可以绕开分布,直接对期望动手术。为此要系统研究的,就是期望的性质(properties of expectation)。
2. 主旋律:把复杂随机量分解为简单量之和
本章一切技巧共用一个主旋律:把复杂随机量分解为简单量之和。当每个"零件"都简单到能一眼写出期望时,一条几乎不花成本的运算规则——期望的线性性(linearity of expectation)——就能把零件的期望装配回总量的期望。先认识最小的零件。
设 \(A\) 为样本空间 \(S\) 中的事件,定义指示随机变量(indicator random variable) \[ I_A(\omega)=\begin{cases}1, & \omega\in A,\\[2pt] 0, & \omega\notin A.\end{cases} \] 它仅取 0 与 1 两个值,且 \(E[I_A]=P(A)\)。
一行验证:\(E[I_A]=1\cdot P(A)+0\cdot P(A^c)=P(A)\)——指示变量把概率藏进了期望。当要分解的对象是"满足某条件的个数"(计数)时,零件更是清一色的指示变量:计数 \(X\) 总可写成 \(X=I_{A_1}+\cdots+I_{A_n}\),于是 \(E[X]=\sum_{i=1}^n P(A_i)\)。这一"指示变量法"是 7.2 节的方法论主角。
只要各期望存在,对任意常数 \(a,b\) 有 \[ E[aX+bY]=a\,E[X]+b\,E[Y],\qquad\text{特别地}\qquad E[X_1+\cdots+X_n]=E[X_1]+\cdots+E[X_n], \] 且不需要 \(X_1,\dots,X_n\) 相互独立。
线性性最令人意外的收获,是它对相依性的"免疫"。看本章的引入例。
某保险公司售出 100 张同类型保单。单张保单的赔付额 \(X_i\)(元)满足 \(P(X_i=10\,000)=0.05\)、\(P(X_i=0)=0.95\)。各保单之间高度相依——例如一场火灾或地震会同时触发多张保单。求全年总赔付 \(S=X_1+\cdots+X_{100}\) 的期望。
3. 三大工具与本章地图
线性性解决"和"的一阶问题;沿着"分解"这条主线,本章还备有两件配套工具。条件期望(conditional expectation) 把"按分量分解"推广为"按信息分解":先在每个条件下求平均,再对条件本身求平均,即全期望公式(law of total expectation) \(E[X]=E[E[X\mid Y]]\)。矩母函数(moment generating function) 则把整个分布压缩成一个函数 \(M(t)=E[e^{tX}]\):求各阶矩变成求导,识别分布只需比对函数,独立和的矩母函数直接相乘。三大工具的用途分支与各节安排见图 1、表 1。
| 工具 | 核心事实 | 主战场 | 典型应用 | 依赖与衔接 |
|---|---|---|---|---|
| 期望的线性性 | \(E\big[\sum_i X_i\big]=\sum_i E[X_i]\),无需独立 | 7.2、7.3 | 匹配数、优惠券收集、样本均值 | 7.3 加入协方差处理方差 |
| 条件期望 | \(E[X]=E\big[E[X\mid Y]\big]\) | 7.4、7.5 | 矿工问题、随机和、最优预测 | 7.5 的线性预测需 7.3 |
| 矩母函数 | \(M(t)=E[e^{tX}]\),独立和相乘 | 7.6、7.7 | 求各阶矩、识别分布、正态和 | 7.7 全面依赖 7.6 |
按此地图,本章的行军路线依次为:
- 7.2 随机变量之和的期望:线性性的正式定理与指示变量法的主场——匹配数、超几何计数、优惠券收集等经典问题一网打尽,并得到 \(E[\overline{X}]=\mu\)(本章起点,无前置依赖);
- 7.3 协方差、和的方差与相关系数:把线性性推进到二阶——交叉项 \(E[XY]\) 与协方差(covariance) 登场,得到 \(\operatorname{Var}(\sum_i X_i)\) 与 \(\operatorname{Var}(\overline{X})=\sigma^2/n\)(依赖 7.2);
- 7.4 条件期望:全期望公式、解"自引用方程"的技巧、随机和的期望(依赖 7.2–7.3 的概念);
- 7.5 条件期望与预测:\(E[X\mid Y]\) 是用 \(Y\) 预测 \(X\) 的均方最优解;最佳线性预测要动用 7.3 的协方差(依赖 7.3、7.4);
- 7.6 矩母函数:\(M(t)=E[e^{tX}]\) 一手抓矩、一手抓分布,独立和的矩母函数直接相乘;
- 7.7 正态随机变量的其他性质:用矩母函数证明独立正态和仍正态,并给出统计推断的基石三条(依赖 7.6);
- 7.8 期望的一般定义(选学):\(X^+\)、\(X^-\) 分解与黎曼–斯蒂尔杰斯积分,为全章补上理论地基。
4. 工作流:分解—求和—回收
把思想落成可操作的步骤,就是贯穿全章的三步工作流:分解(把复杂量写成简单量之和)→ 求和(用线性性逐项取期望)→ 回收(把结果组装回原问题的答案)。图 2 以例 1 的保险总赔付为实例演示全过程。
下面两道小例分别试验"按分量拆"与"按信息拆"。
从一副 52 张扑克牌中无放回地抽取 5 张,记第 \(i\) 张的点值为 \(X_i\)(A 记 1,J 记 11,Q 记 12,K 记 13),\(S\) 为 5 张牌点值之和。(a) 说明 \(X_1\) 与 \(X_2\) 不独立;(b) 求 \(E[S]\)。
掷两颗骰子,\(X\) 为第一颗的点数,\(S=X+Y\) 为点数之和。(a) 用线性性求 \(E[S]\);(b) 计算 \(E[S\mid X=x]\),并用 \(E[S]=E\big[E[S\mid X]\big]\) 复核。
本章是第 8 章极限定理与数理统计的地基:大数定律断言样本均值稳定于期望,而其证明所需的全部概率装备,不过是本章两行计算——\(E[\overline{X}]=\mu\)(7.2)与 \(\operatorname{Var}(\overline{X})=\sigma^2/n\)(7.3)。另值得一提:期望的概念先于概率的公理化诞生——惠更斯 1657 年的《论赌博中的计算》通篇以"预期赌金"(期望)为核心概念,"概率"反而是后来才成为主角的。本章以"期望的性质"为纲,某种意义上是回到这门学科最初的出发点。
5. 本节小结
- 本章主旋律:把复杂随机量分解为简单量之和——复杂问题先"拆",再用期望的运算性质"装"回去。
- 期望的线性性 \(E[\sum_i X_i]=\sum_i E[X_i]\) 无条件成立,不要求独立;求"和的期望"只需各项的边缘期望,求"和的分布"才需要联合结构与卷积。
- 指示随机变量 \(I_A\) 把概率藏进期望:\(E[I_A]=P(A)\),是分解计数问题的最小积木(7.2 的方法论主角)。
- 三大工具与分支:线性性(7.2–7.3,按分量拆、延伸到方差);条件期望(7.4–7.5,按信息拆、通向预测);矩母函数(7.6–7.7,一个函数携带全部分布信息);7.8 补理论地基。
- 工作流:分解 → 求和 → 回收;保险总赔付例中三步各一行,即得 \(E[S]=50\,000\) 元,全程与相依性无关。
练习
练习 7-1-1
思考题:为什么"求和的期望"比"求和的分布"容易得多?请从所需信息量、运算类型与本章例 1 的体会三个角度作答。
答案与提示(i) 信息量——\(E[\sum_i X_i]=\sum_i E[X_i]\) 只需每个 \(X_i\) 自身(一维边缘)的期望;而和的分布由整个联合分布决定,必须知道全部相依结构。(ii) 运算类型——即使独立,求和的密度也要做 \(n-1\) 次卷积,项数一多计算量爆炸;期望的相加是线性运算,几乎零成本。(iii) 例 1 中无论各保单赔付是否联动,恒有 \(E[S]=50\,000\) 元;但 \(P(S>60\,000)\) 这类分布问题没有相依信息根本无法回答。直观地说:期望只是分布的"一阶汇总数字",相依结构所携带的信息恰好不影响它;分布则要携带全部信息。
练习 7-1-2
某公司同时经营两类保单:A 类 120 张,每张以概率 0.03 赔付 8 000 元;B 类 60 张,每张以概率 0.04 赔付 15 000 元。求全年总赔付的期望(各保单之间的相依关系未知)。
答案与提示设总赔付 \(S=\sum_{i=1}^{120}X_i+\sum_{j=1}^{60}Y_j\),其中 \(E[X_i]=0.03\times 8\,000=240\),\(E[Y_j]=0.04\times 15\,000=600\)。由线性性 \(E[S]=120\times 240+60\times 600=28\,800+36\,000=64\,800\) 元——两类保单、不同赔付、相依未知,统统不影响"逐项相加"的合法性。
练习 7-1-3
同时掷 4 颗骰子,记 \(M\) 为出现 6 点的骰子数。把 \(M\) 写成指示随机变量之和并求 \(E[M]\)。
答案与提示令 \(I_i=1\) 表示第 \(i\) 颗骰子出现 6 点,则 \(M=I_1+\cdots+I_4\),\(E[I_i]=P(\text{第 } i \text{ 颗为 6})=1/6\),故 \(E[M]=4\times\frac{1}{6}=\frac{2}{3}\approx 0.667\)。即使有人把四颗骰子粘成一组联动投掷(只要每颗出现 6 的概率仍是 \(1/6\)),期望不变——而 \(M\) 的分布会彻底改变。"计数 = 指示求和"将在 7.2 节全面展开。
练习 7-1-4
辨析两个说法:(a) "只有当 \(X,Y\) 独立时,才有 \(E[X+Y]=E[X]+E[Y]\)";(b) "若 \(E[X+Y]=E[X]+E[Y]\) 成立,则 \(X,Y\) 独立"。是否正确?各说明理由或举出反例。
答案与提示两个说法都不正确。性质 1 的证明只用了交换求和次序,从未涉及独立性,故 (a) 错;线性性无条件成立,于是它的成立也推不出任何独立性,故 (b) 错——取 \(X=Y\)(完全相依),仍有 \(E[X+Y]=2E[X]=E[X]+E[Y]\),但二者显然不独立。需要区分的是另一件事:独立性能简化的是乘积的期望(\(X,Y\) 独立 \(\Rightarrow E[XY]=E[X]E[Y]\))与和的分布,这些分别在 7.3 与 7.6 讨论。