- 能把"求 \(Y=g(X)\) 的分布"转化为"把原像集合上的概率求和",正确写出并运用公式 \(p_Y(y)=\sum_{x:\,g(x)=y}p_X(x)\);
- 区分 \(g\) 一一对应与多对一两种情形:前者直接替换取值,后者把"撞在一起"的概率相加;
- 掌握另一途径——先求 \(F_Y(y)=P(g(X)\le y)\) 再差分——并能用两种方法互相验证;
- 通过 \(Y=X^2\)、\(Y=|X|\)、\(Y=2X+1\)、\(Y=\max(X,0)\) 等变换,理解"函数可能丢失信息"与"线性变换只搬动概率质量";
- 了解离散方法为何不能照搬到连续情形,为 5.7 节的一般方法做好铺垫。
1. 问题的提出:随机变量的函数
在应用中,我们关心的量往往不是随机变量 \(X\) 本身,而是它的某个函数。例如在 4.4 节的赔付问题中,保险公司实际支付的是封顶赔付 \(g(x)=\min(x,20)\);测量误差的"平方损失"是 \(X^2\);温度读数从摄氏换算到华氏是线性函数 \(g(x)=1.8x+32\)。一般地,若已知 \(X\) 的分布,如何求出 \(Y=g(X)\) 的分布?这就是本节的主题。4.4 节已经解决了它的"平均版本"——不求 \(Y\) 的分布也能算出 \(E[g(X)]\);现在我们要的是完整的分布列,它比期望包含更多的信息(例如 \(Y\) 最可能取什么值、尾部有多重)。
设 \(X\) 是定义在样本空间 \(S\) 上的随机变量(random variable),\(g:\mathbb{R}\to\mathbb{R}\) 为实值函数。对每个结果 \(s\in S\),令 \[ Y(s) = g\big(X(s)\big), \] 则称 \(Y=g(X)\) 为随机变量的函数(function of a random variable)。它把每个试验结果的数值再作一次加工,本身仍是一个随机变量。
本节讨论 \(X\) 为离散型的情形,目标是:已知 \(X\) 的分布列 \(p_X(x)\)(4.2 节),求 \(Y=g(X)\) 的分布列 \(p_Y(y)\)。
2. 基本方法:按原像合并概率
关键在于用 \(X\) 的语言翻译事件 \(\{Y=y\}\):\(Y\) 恰好等于 \(y\),当且仅当 \(X\) 取到的值经 \(g\) 加工后等于 \(y\),也就是 \(X\) 落在 \(y\) 的原像集合(preimage) \(\{x:\, g(x)=y\}\) 之中。对离散型 \(X\) 而言,"落在集合中"可以拆成"落在一个个别点上",而诸事件 \(\{X=x\}\) 两两互不相容,概率便可直接相加。
设 \(X\) 为离散型随机变量,分布列为 \(p_X(x)\),\(Y=g(X)\)。则对任意实数 \(y\), \[ p_Y(y) \;=\; P(Y=y) \;=\; \sum_{x:\,g(x)=y} p_X(x), \] 其中和式取遍所有满足 \(g(x)=y\) 的 \(x\);若这样的 \(x\) 不存在(或都不在 \(X\) 的可能取值之内),则 \(p_Y(y)=0\)。
定理 1 在两种典型情形下表现出两种面貌。
情形一:\(g\) 一一对应(直接替换)。若 \(g\) 把 \(X\) 的不同取值映到不同的 \(y\),则每个原像集合只含一个点,求和只剩一项——概率原封不动,只需把取值"改个名字"。
设 \(g\) 在 \(X\) 的可能取值集合上一一对应(\(x_1\ne x_2 \Rightarrow g(x_1)\ne g(x_2)\))。则 \(Y=g(X)\) 的可能取值为 \(y=g(x)\),且 \[ p_Y\big(g(x)\big) \;=\; p_X(x). \]
情形二:多对一(概率合并,本节核心思想)。若 \(g(x_1)=g(x_2)=y\),则两个原本互不相容的事件 \(\{X=x_1\}\)、\(\{X=x_2\}\) 一同导致 \(\{Y=y\}\),概率必须相加:概率永远跟着样本点走;若干个 \(x\) 被压到同一个 \(y\),它们的概率质量就在那里合并。合并的代价可能是信息丢失——例如 \(g(x)=x^2\) 丢掉符号,知道 \(Y=1\) 并不能区分 \(X=-1\) 还是 \(X=1\);而 \(g(x)=|x|\) 同样丢符号但保留幅度。
其一,当 \(g\) 多对一时不能写成 \(p_Y(y)=p_X\big(g^{-1}(y)\big)\):\(g^{-1}(y)\) 不是一个数而是一个集合(例如 \(g(x)=x^2\) 时 \(g^{-1}(1)=\{-1,1\}\)),单点代入会漏掉概率。其二,\(Y\) 的分布列只需列在 \(g\) 的值域中"被 \(X\) 取到的部分"上;对值域之外的 \(y\) 写 \(p_Y(y)=0\) 即可,不必强行求和。检验答案的简便办法永远是:\(p_Y\) 的全部取值之和必须等于 1。
3. 三个典型变换:平方、绝对值与线性
设 \(X\) 的分布列为 \(P(X=-1)=0.2,\;P(X=0)=0.3,\;P(X=1)=0.3,\;P(X=2)=0.2\)。令 \(Y=X^2\),求 \(Y\) 的分布列。
(1) 只有 \(x=0\) 映到 \(0\):\(P(Y=0)=P(X=0)=0.3\);
(2) \(x=-1\) 与 \(x=1\) 都映到 \(1\),事件 \(\{X=-1\}\) 与 \(\{X=1\}\) 互不相容:\(P(Y=1)=0.2+0.3=0.5\);
(3) 只有 \(x=2\) 映到 \(4\):\(P(Y=4)=0.2\)。
检验:\(0.3+0.5+0.2=1\),确为分布列。作为旁证,用 4.4 节的定理计算 \(E[X^2]=0.2+0+0.3+0.8=1.3\),而用 \(Y\) 的分布列计算 \(E[Y]=0\times0.3+1\times0.5+4\times0.2=1.3\),两条路线一致。
| \(y\) | 0 | 1 | 4 |
|---|---|---|---|
| 原像 \(\{x:\,x^2=y\}\) | \(\{0\}\) | \(\{-1,\,1\}\) | \(\{2\}\) |
| \(p_Y(y)\) | 0.3 | \(0.2+0.3=0.5\) | 0.2 |
设 \(X\) 在 \(\{-2,-1,0,1,2\}\) 上等可能取值(各 \(1/5\))。令 \(Y=|X|\),求 \(Y\) 的分布列。
设 \(X\) 服从例 1 的分布列。令 \(Y=2X+1\),求 \(Y\) 的分布列,并验证 \(E[Y]=2E[X]+1\)。
4. 另一途径:先求分布函数再差分
定理 1 要求"解方程 \(g(x)=y\)"列出全部原像;当 \(g\) 的结构较复杂、或原像不易逐一枚举时,换一条路往往更稳:先求 \(Y\) 的分布函数(cumulative distribution function)(4.1 节) \[ F_Y(y) \;=\; P(Y\le y) \;=\; P\big(g(X)\le y\big) \;=\; \sum_{x:\,g(x)\le y} p_X(x), \] 即把满足 \(g(x)\le y\) 的所有 \(x\) 的概率加起来;再用 4.2 节的差分公式 \(p_Y(y)=F_Y(y)-F_Y(y^-)\) 逐点还原分布列。这条"先累积、后差分"的路线在离散情形与定理 1 等价,但它的真正价值在于:它是连续情形中几乎唯一可行的方法(见本节末注记)。
设 \(X\) 服从例 1 的分布列,\(Y=X^2\)。先用 \(F_Y(y)=P(X^2\le y)\) 求出 \(Y\) 的分布函数,再差分得到分布列。
若 \(X\) 是连续型随机变量(第 5 章),则对每个点 \(x\) 都有 \(P(X=x)=0\),"把原像上的概率加起来"只能得到 0——定理 1 的求和公式整体失效。彼时标准做法正是本节第二条途径的连续版:先算 \(F_Y(y)=P(g(X)\le y)=\int_{x:\,g(x)\le y} f_X(x)\,dx\),再对 \(y\) 求导得密度;当 \(g\) 单调可微时有显式公式 \(f_Y(y)=f_X\big(g^{-1}(y)\big)\left|\frac{\mathrm{d}}{\mathrm{d}y}g^{-1}(y)\right|\)。届时还会看到与例 3 呼应的"线性变换拉伸密度"现象。详见 5.7 节。
5. 本节小结
- 问题:已知 \(X\) 的分布列,求 \(Y=g(X)\) 的分布列;一切计算围绕原像集合 \(\{x:\,g(x)=y\}\) 展开。
- 核心公式:\(p_Y(y)=\sum_{x:\,g(x)=y}p_X(x)\)——概率跟着样本点走,多个 \(x\) 映到同一 \(y\) 时概率相加(多对一合并)。
- 一一对应时退化为直接替换:\(p_Y(g(x))=p_X(x)\);线性变换 \(Y=aX+b\;(a\ne0)\) 是典型代表。
- 另一途径:先求 \(F_Y(y)=P(g(X)\le y)\)(按 \(g(x)\le y\) 累加),再差分 \(p_Y(y)=F_Y(y)-F_Y(y^-)\);两条路线可互相验证。
- 平方与绝对值会丢失符号信息(\(Y=1\) 分不清 \(X=\pm1\));连续情形须改用 CDF 途径(5.7 节)。
练习
练习 4-9-1
(截断变换)设 \(X\) 服从例 1 的分布列,\(Y=\max(X,0)\)(把负值截断为 0)。求 \(Y\) 的分布列,并指出 \(Y\) 能否反推 \(X\)。
答案与提示\(g(x)=\max(x,0)\) 把 \(-1\) 和 \(0\) 都映到 \(0\),把 \(1,2\) 原样保留。故 \(P(Y=0)=P(X=-1)+P(X=0)=0.2+0.3=0.5\),\(P(Y=1)=0.3\),\(P(Y=2)=0.2\)(和为 1)。由 \(Y=0\) 无法区分 \(X=-1\) 与 \(X=0\),故不能反推——截断与平方一样是"多对一丢信息"的典型。此类"截断赔付"在保险精算中常见(对照 4.4 节例 2 的封顶赔付 \(\min(x,20)\),二者思路相同、方向相反)。
练习 4-9-2
设 \(X\) 在 \(\{0,1,2,3\}\) 上等可能取值,\(Y=\dfrac{X(X-1)}{2}\)。求 \(Y\) 的分布列。
答案与提示逐点计算 \(g\):\(0\mapsto0\),\(1\mapsto0\),\(2\mapsto1\),\(3\mapsto3\)。于是 \(P(Y=0)=\frac12\)(\(x=0,1\) 合并),\(P(Y=1)=\frac14\),\(P(Y=3)=\frac14\)。注意 \(y=2\) 在值域之外,\(P(Y=2)=0\),不必列入分布列。
练习 4-9-3
设 \(X\) 在 \(\{1,2,3,4\}\) 上等可能取值,\(Y=(X-2)^2\)。请分别用"原像合并"与"先求 CDF 再差分"两种方法求 \(Y\) 的分布列,并核对结果一致。
答案与提示方法一(合并):\(2\mapsto0\);\(1,3\mapsto1\);\(4\mapsto4\),故 \(P(Y=0)=\frac14\),\(P(Y=1)=\frac12\),\(P(Y=4)=\frac14\)。方法二(CDF):\(F_Y(y)=0\;(y<0)\),\(=\frac14\;(0\le y<1)\),\(=\frac34\;(1\le y<4)\),\(=1\;(y\ge4)\);差分得 \(p_Y(0)=\frac14\)、\(p_Y(1)=\frac12\)、\(p_Y(4)=\frac14\),两法一致。
练习 4-9-4
(思考题,预告 5.7 节)若 \(X\) 是连续型随机变量,例如服从 \((0,1)\) 上的均匀分布,\(Y=X^2\)。此时"把 \(\{x:\,x^2=y\}\) 上的概率加起来"会得到什么?正确的第一步应当改求什么量?
答案与提示连续型 \(X\) 取任何单点的概率都是 0,求和只得 \(P(Y=y)=0\),得不到有用信息。应先求分布函数 \(F_Y(y)=P(X^2\le y)=P(X\le\sqrt y)=\sqrt y\)(\(0\le y\le1\)),再求导得密度 \(f_Y(y)=\frac{1}{2\sqrt y}\)——这正是 5.7 节一般方法(CDF 途径 + 单调变换公式)的最小例子。离散与连续的关键差别:前者质量集中在点上、可直接相加;后者质量按密度铺开、必须经 CDF 累积再求导。