- 说明随机变量的函数 \(g(X)\) 仍是随机变量,并会按“映到同一 \(y\) 则概率相加”写出其分布列;
- 陈述并运用核心定理 \(E[g(X)]=\sum_x g(x)p(x)\),解释它为何无需先求 \(Y=g(X)\) 的分布;
- 运用线性性 \(E[ag(X)+bh(X)+c]=aE[g(X)]+bE[h(X)]+c\) 计算复合表达的期望;
- 熟练计算 \(E[X^2]\)、\(E[(X-\mu)^2]\) 等平方型期望,为下一节的方差做准备;
- 辨析 \(E[g(X)]\) 与 \(g(E[X])\):只有仿射函数可以交换期望与变换的顺序。
1. 随机变量的函数:从赔付封顶说起
4.3 节解决了“随机变量自身的期望怎么算”。然而应用中我们真正关心的量,往往是随机变量的某个函数:保险公司规定“单次事故赔付封顶 20 千元”,赔付额就是损失 \(X\) 的函数 \(g(X)=\min(X,20)\);商家的利润是销量 \(X\) 的函数;度量数据围绕均值的散布时,我们会遇上 \((X-\mu)^2\)。一般地,设 \(g:\mathbb{R}\to\mathbb{R}\) 是给定的实值函数:当试验结果使 \(X\) 取值 \(x\) 时,量 \(g(X)\) 就随之确定为 \(g(x)\)。也就是说,\(g(X)\) 把每个样本点先经 \(X\) 数值化、再经 \(g\) 加工,仍是定义在样本空间上的实值函数——它当然还是一个随机变量,称为随机变量的函数(function of a random variable)。
既然 \(Y=g(X)\) 是随机变量,它就有自己的分布列,从而可以按 4.3 节的定义求期望。先把分布列写清楚。
设离散型随机变量 \(X\) 的分布列为 \(p(x)\),\(g\) 为实值函数,则 \(Y=g(X)\) 的分布列为 \[ P(Y=y)=\sum_{x:\,g(x)=y} p(x), \] 即把所有满足 \(g(x)=y\) 的 \(x\) 的概率相加。
若 \(g\) 是一一对应,只需把取值直接替换(\(p_Y(g(x))=p(x)\);见 4.9 节的系统讨论);若 \(g\) 是多对一,则概率发生合并。例如掷一颗骰子令 \(g(x)=(x-3.5)^2\):六个 \(x\) 只映成三个 \(y\) 值 \(6.25,\,2.25,\,0.25\),每个 \(y\) 由两个 \(x\) 合并而成,概率相加得 \(2/6=1/3\)。
如果目的不止于期望,而是需要 \(Y\) 的完整分布(例如计算某个 \(P(Y\le y)\)),就得老老实实按定义 1 做替换与合并。但本节的主题是一个出人意料的好消息:求 \(E[g(X)]\) 时,“先求 \(Y\) 的分布”这一步可以整个跳过。
2. 核心定理:先变换,再加权
下面的定理是本节的核心,也是第 7 章“期望的性质”整个工具箱的第一块基石。
设离散型随机变量 \(X\) 的分布列为 \(p(x)\),实值函数 \(g\) 满足 \(\sum_x |g(x)|\,p(x)<\infty\)(保证无穷级数与求和顺序无关),则 \[ E[g(X)] \;=\; \sum_x g(x)\,p(x). \]
定理的算法可以概括为六个字:先变换,再加权。加权只认 \(X\) 原来的取值 \(x\),概率 \(p(x)\) 原样搬用,变换只作用在数值上;当多个 \(x\) 映到同一个 \(y\) 时,相当于求和过程中自动完成了“合并同类项”——这正是证明里绕开 \(p_Y\) 的关键。图 1 以掷骰子、\(g(x)=x^2\) 为例展示这一过程。
掷一颗均匀骰子,\(X\) 为所得点数。求 \(E[X^2]\),并与 \((E[X])^2\) 比较。
某保单一年内的事故损失 \(X\)(千元)的分布为 \(P(X=0)=0.80\),\(P(X=10)=0.15\),\(P(X=50)=0.05\)。保险合同规定赔付限额 20 千元,即实际赔付 \(g(X)=\min(X,20)\)。求期望赔付额;并与不设封顶时的期望损失比较。
| 损失 \(x\) | \(p(x)\) | 赔付 \(g(x)\) | \(g(x)\,p(x)\) |
|---|---|---|---|
| 0 | 0.80 | 0 | 0.00 |
| 10 | 0.15 | 10 | 1.50 |
| 50 | 0.05 | 20 | 1.00 |
| 合计 | 1.00 | — | 2.50 |
掷 3 枚均匀硬币,\(X\) 为正面个数。求 \(E[2^X]\)。
3. 线性性:期望是一个线性算子
把 \(E[\cdot]\) 看成一台机器:吃进一个随机变量,吐出一个数。这样的“机器”在数学上称为算子(operator)。定理 1 立刻给出这台算子最重要的品质——线性性(linearity):它与加法、数乘可以自由交换顺序。
设 \(a,b,c\) 为常数,\(g,h\) 为实值函数且诸期望存在,则 \[ E\big[a\,g(X)+b\,h(X)+c\big]=a\,E[g(X)]+b\,E[h(X)]+c. \]
两个常用特例:取 \(g(X)=X\)、\(h\equiv 0\),得 \(E[aX+b]=aE[X]+b\),即 4.3 节的性质;取 \(g(X)=(X-\mu)^2\) 展开可得 \(E[(X-\mu)^2]=E[X^2]-\mu^2\)(见第 4 小节)。线性性对任意有限多个函数同样成立,其求和版本是第 7 章的主力工具。图 2 把“先分别取期望、再作同一线性组合”画成一张流程图。
定理 2 只对仿射组合(系数乘、相加、加常数)有效,切莫推广过头:一般地 \(E[g(X)]\neq g(E[X])\)。骰子便是一例:\(E[X^2]=91/6\approx 15.17\),而 \((E[X])^2=12.25\)。直观原因:\(x^2\) 是弯曲的,它放大远离均值的取值;先取平均则把这种不对称抹平了。当 \(g\) 为凸函数时,不等号方向有保证:\(E[g(X)]\ge g(E[X])\)(Jensen 不等式)。有趣的是,骰子例子中两值之差 \(91/6-12.25=35/12\) 恰好就是下一节要定义的方差。
4. 通向方差:\(E[X^2]\) 的角色
4.3 节的投资练习已经表明:期望相同不代表风险相同。要度量风险,自然的想法是看 \(X\) 偏离均值 \(\mu=E[X]\) 的平均幅度;为避免正负偏差互相抵消,先平方、再取期望,即考察 \(E[(X-\mu)^2]\)。本节的两个定理恰好为它备齐了工具:定理 1 说明这个量可以直接对 \((x-\mu)^2\) 加权求和,完全不必先求 \((X-\mu)^2\) 的分布(回忆第 1 小节:那个分布需要把六个点合并成三个,颇费笔墨);定理 2 则给出另一条路——把平方展开: \[ E[(X-\mu)^2]=E[X^2-2\mu X+\mu^2]=E[X^2]-2\mu\,E[X]+\mu^2=E[X^2]-\mu^2. \]
用骰子验算:直接加权得 \(E[(X-3.5)^2]=(2.5^2+1.5^2+0.5^2)\times 2/6=17.5/6=35/12\approx 2.9167\);间接用公式得 \(E[X^2]-\mu^2=91/6-12.25=35/12\)。两条路完全一致。这个量就是 4.5 节将要定义的方差(variance),而“先算 \(E[X^2]\)、再减 \(\mu^2\)”正是它的标准算法——本节例 1 的结果 \(91/6\) 已经把最费手的一步算完了。
5. 本节小结
- \(Y=g(X)\) 仍是随机变量,其分布列按 \(y\) 合并概率:\(P(Y=y)=\sum_{x:\,g(x)=y}p(x)\)(定义 1)。
- 核心定理:\(E[g(X)]=\sum_x g(x)p(x)\)——先变换,再加权,无需先求 \(Y=g(X)\) 的分布;证明要点是按 \(y\) 合并同类项(定理 1)。
- 线性性:\(E[ag(X)+bh(X)+c]=aE[g(X)]+bE[h(X)]+c\);期望是一个线性算子,但只对仿射组合有效,\(E[g(X)]\neq g(E[X])\)(如 \(E[X^2]>(E[X])^2\))(定理 2)。
- 典型计算:骰子 \(E[X^2]=91/6\approx 15.17\);封顶赔付 \(E[\min(X,20)]=2.5\) 千元;掷 3 枚硬币 \(E[2^X]=27/8=3.375\)。
- 为方差铺路:\(E[(X-\mu)^2]=E[X^2]-\mu^2\);骰子 \(91/6-3.5^2=35/12\approx 2.9167\),正是 4.5 节的方差。
练习
练习 4-4-1
掷一颗均匀骰子:(a) 用定理 1 求 \(E[X^2]\);(b) 直接对 \((x-3.5)^2\) 加权求 \(E[(X-3.5)^2]\);(c) 验证 \(E[(X-3.5)^2]=E[X^2]-3.5^2\),并说明这个数值与 4.5 节的方差有何关系。
答案与提示(a) \(E[X^2]=91/6\approx 15.17\)。(b) 偏差为 \(\pm 2.5,\pm 1.5,\pm 0.5\),故 \(E[(X-3.5)^2]=(6.25+2.25+0.25)\times 2/6=17.5/6=35/12\approx 2.9167\);注意这里六个 \(x\) 只映成三个平方值,概率需两两合并。(c) \(91/6-12.25=15.1667-12.25=2.9167=35/12\),两法一致;\(35/12\) 正是 4.5 节将定义的骰子方差 \(\mathrm{Var}(X)\),届时可直接核对。
练习 4-4-2
掷一颗均匀骰子,求平均绝对偏差 \(E[|X-3|]\),并与练习 1 的平方偏差比较。
答案与提示\(|X-3|\) 的取值为 \(2,1,0,1,2,3\),故 \(E[|X-3|]=(2+1+0+1+2+3)/6=9/6=1.5\)。它度量“平均偏离多少个点数”;与平方偏差 \(35/12\approx 2.92\) 相比,绝对偏差对极端值不那么敏感(平方会放大远端的偏差)。
练习 4-4-3
利用定理 1 证明线性性:\(E[ag(X)+bh(X)+c]=aE[g(X)]+bE[h(X)]+c\),并指出证明中哪里用到了规范性 \(\sum_x p(x)=1\)。
答案与提示对函数 \(ag+bh+c\) 应用定理 1,得 \(\sum_x [ag(x)+bh(x)+c]p(x)\);由分配律拆成 \(a\sum g(x)p(x)+b\sum h(x)p(x)+c\sum p(x)\);最后一步 \(\sum_x p(x)=1\) 使常数项 \(c\) 从加权求和中“全身而退”,只留下 \(c\) 本身——这正是平移不影响线性结构的根源。
练习 4-4-4
设 \(X\) 的分布列为 \(p(x)=x/21\),\(x=1,2,\dots,6\)(4.3 节例 3 已算得 \(E[X]=91/21\approx 4.33\))。求 \(E[X^2]\) 与 \(E[1/X]\),并检验 \(E[1/X]\) 是否等于 \(1/E[X]\)。
答案与提示\(E[X^2]=\sum x^2\cdot\frac{x}{21}=\frac{1+8+27+64+125+216}{21}=\frac{441}{21}=21\)(此值将在 4.5 节例 3 中用于求方差)。\(E[1/X]=\sum \frac{1}{x}\cdot\frac{x}{21}=\frac{6}{21}=\frac{2}{7}\approx 0.286\);而 \(1/E[X]=21/91\approx 0.231\),两者不等——再次印证期望只与线性函数交换,取倒数(凸与凹并存的非线性)不行。