第 4 章 · 随机变量

4.9 随机变量函数的分布

The Distribution of a Function of a Random Variable
学习目标
  • 能把"求 \(Y=g(X)\) 的分布"转化为"把原像集合上的概率求和",正确写出并运用公式 \(p_Y(y)=\sum_{x:\,g(x)=y}p_X(x)\);
  • 区分 \(g\) 一一对应与多对一两种情形:前者直接替换取值,后者把"撞在一起"的概率相加;
  • 掌握另一途径——先求 \(F_Y(y)=P(g(X)\le y)\) 再差分——并能用两种方法互相验证;
  • 通过 \(Y=X^2\)、\(Y=|X|\)、\(Y=2X+1\)、\(Y=\max(X,0)\) 等变换,理解"函数可能丢失信息"与"线性变换只搬动概率质量";
  • 了解离散方法为何不能照搬到连续情形,为 5.7 节的一般方法做好铺垫。

1. 问题的提出:随机变量的函数

在应用中,我们关心的量往往不是随机变量 \(X\) 本身,而是它的某个函数。例如在 4.4 节的赔付问题中,保险公司实际支付的是封顶赔付 \(g(x)=\min(x,20)\);测量误差的"平方损失"是 \(X^2\);温度读数从摄氏换算到华氏是线性函数 \(g(x)=1.8x+32\)。一般地,若已知 \(X\) 的分布,如何求出 \(Y=g(X)\) 的分布?这就是本节的主题。4.4 节已经解决了它的"平均版本"——不求 \(Y\) 的分布也能算出 \(E[g(X)]\);现在我们要的是完整的分布列,它比期望包含更多的信息(例如 \(Y\) 最可能取什么值、尾部有多重)。

定义 1 随机变量的函数

设 \(X\) 是定义在样本空间 \(S\) 上的随机变量(random variable),\(g:\mathbb{R}\to\mathbb{R}\) 为实值函数。对每个结果 \(s\in S\),令 \[ Y(s) = g\big(X(s)\big), \] 则称 \(Y=g(X)\) 为随机变量的函数(function of a random variable)。它把每个试验结果的数值再作一次加工,本身仍是一个随机变量。

本节讨论 \(X\) 为离散型的情形,目标是:已知 \(X\) 的分布列 \(p_X(x)\)(4.2 节),求 \(Y=g(X)\) 的分布列 \(p_Y(y)\)。

2. 基本方法:按原像合并概率

关键在于用 \(X\) 的语言翻译事件 \(\{Y=y\}\):\(Y\) 恰好等于 \(y\),当且仅当 \(X\) 取到的值经 \(g\) 加工后等于 \(y\),也就是 \(X\) 落在 \(y\) 的原像集合(preimage) \(\{x:\, g(x)=y\}\) 之中。对离散型 \(X\) 而言,"落在集合中"可以拆成"落在一个个别点上",而诸事件 \(\{X=x\}\) 两两互不相容,概率便可直接相加。

定理 1 离散型随机变量函数的分布列

设 \(X\) 为离散型随机变量,分布列为 \(p_X(x)\),\(Y=g(X)\)。则对任意实数 \(y\), \[ p_Y(y) \;=\; P(Y=y) \;=\; \sum_{x:\,g(x)=y} p_X(x), \] 其中和式取遍所有满足 \(g(x)=y\) 的 \(x\);若这样的 \(x\) 不存在(或都不在 \(X\) 的可能取值之内),则 \(p_Y(y)=0\)。

证明事件 \(\{Y=y\}\) 可以分解为 \[ \{Y=y\} \;=\; \bigcup_{x:\,g(x)=y} \{X=x\}. \] 事实上,若某个结果使 \(X=x\) 且 \(g(x)=y\),则该结果使 \(Y=y\);反之亦然。由于 \(X\) 在一次试验中只能取一个值,右端诸事件 \(\{X=x\}\) 两两互不相容,故由概率的可加性(2.3 节公理 3)得 \[ P(Y=y)=\sum_{x:\,g(x)=y}P(X=x)=\sum_{x:\,g(x)=y}p_X(x). \qquad\blacksquare \]

定理 1 在两种典型情形下表现出两种面貌。

情形一:\(g\) 一一对应(直接替换)。若 \(g\) 把 \(X\) 的不同取值映到不同的 \(y\),则每个原像集合只含一个点,求和只剩一项——概率原封不动,只需把取值"改个名字"。

定理 2 一一对应时的直接替换

设 \(g\) 在 \(X\) 的可能取值集合上一一对应(\(x_1\ne x_2 \Rightarrow g(x_1)\ne g(x_2)\))。则 \(Y=g(X)\) 的可能取值为 \(y=g(x)\),且 \[ p_Y\big(g(x)\big) \;=\; p_X(x). \]

证明此时对每个 \(y=g(x)\),原像集合 \(\{x':\,g(x')=y\}\) 中属于 \(X\) 取值范围的元素只有 \(x\) 一个,定理 1 的和式化为单项 \(p_X(x)\)。

情形二:多对一(概率合并,本节核心思想)。若 \(g(x_1)=g(x_2)=y\),则两个原本互不相容的事件 \(\{X=x_1\}\)、\(\{X=x_2\}\) 一同导致 \(\{Y=y\}\),概率必须相加:概率永远跟着样本点走;若干个 \(x\) 被压到同一个 \(y\),它们的概率质量就在那里合并。合并的代价可能是信息丢失——例如 \(g(x)=x^2\) 丢掉符号,知道 \(Y=1\) 并不能区分 \(X=-1\) 还是 \(X=1\);而 \(g(x)=|x|\) 同样丢符号但保留幅度。

注记 两个常见误区

其一,当 \(g\) 多对一时不能写成 \(p_Y(y)=p_X\big(g^{-1}(y)\big)\):\(g^{-1}(y)\) 不是一个数而是一个集合(例如 \(g(x)=x^2\) 时 \(g^{-1}(1)=\{-1,1\}\)),单点代入会漏掉概率。其二,\(Y\) 的分布列只需列在 \(g\) 的值域中"被 \(X\) 取到的部分"上;对值域之外的 \(y\) 写 \(p_Y(y)=0\) 即可,不必强行求和。检验答案的简便办法永远是:\(p_Y\) 的全部取值之和必须等于 1。

3. 三个典型变换:平方、绝对值与线性

例 1 平方变换 \(Y=X^2\)(多对一合并)

设 \(X\) 的分布列为 \(P(X=-1)=0.2,\;P(X=0)=0.3,\;P(X=1)=0.3,\;P(X=2)=0.2\)。令 \(Y=X^2\),求 \(Y\) 的分布列。

\(Y\) 的可能取值由平方产生:\(0^2=0\),\((\pm1)^2=1\),\(2^2=4\),即 \(Y\in\{0,1,4\}\)。逐个用定理 1:
(1) 只有 \(x=0\) 映到 \(0\):\(P(Y=0)=P(X=0)=0.3\);
(2) \(x=-1\) 与 \(x=1\) 都映到 \(1\),事件 \(\{X=-1\}\) 与 \(\{X=1\}\) 互不相容:\(P(Y=1)=0.2+0.3=0.5\);
(3) 只有 \(x=2\) 映到 \(4\):\(P(Y=4)=0.2\)。
检验:\(0.3+0.5+0.2=1\),确为分布列。作为旁证,用 4.4 节的定理计算 \(E[X^2]=0.2+0+0.3+0.8=1.3\),而用 \(Y\) 的分布列计算 \(E[Y]=0\times0.3+1\times0.5+4\times0.2=1.3\),两条路线一致。
表 1:例 1 中 \(Y=X^2\) 的分布列及其来源
\(y\)014
原像 \(\{x:\,x^2=y\}\)\(\{0\}\)\(\{-1,\,1\}\)\(\{2\}\)
\(p_Y(y)\)0.3\(0.2+0.3=0.5\)0.2
Y = X²:多对一时概率相加 X 的分布列 p(x) X x 0.2 −1 0.3 0 0.3 1 0.2 2 g(x) = x² Y y 0 p_Y = 0.3 1 p_Y = 0.2+0.3 = 0.5 4 p_Y = 0.2 两支绛红箭头汇聚于 y = 1:{X=−1} 与 {X=1} 互不相容,概率直接相加
图 1:多对一映射的概率合并。上排为 \(X\) 的取值及其概率,下排为 \(Y=X^2\) 的取值;\(-1\) 与 \(1\) 两支箭头汇聚到 \(y=1\),对应概率相加(高亮显示)。
例 2 绝对值变换 \(Y=|X|\)(对称折叠)

设 \(X\) 在 \(\{-2,-1,0,1,2\}\) 上等可能取值(各 \(1/5\))。令 \(Y=|X|\),求 \(Y\) 的分布列。

\(Y\) 的可能取值为 \(0,1,2\),逐点合并原像上的概率: \[ P(Y=0)=P(X=0)=\tfrac15,\qquad P(Y=1)=P(X=-1)+P(X=1)=\tfrac25,\qquad P(Y=2)=P(X=-2)+P(X=2)=\tfrac25. \] 三者之和为 1。可以看出"折叠"效应:关于 \(0\) 对称的两个取值被 \(|\,\cdot\,|\) 压到同一点,概率翻倍;而 \(x=0\) 没有对称伙伴,概率保持 \(1/5\) 不变。
例 3 线性变换 \(Y=2X+1\)(直接替换)

设 \(X\) 服从例 1 的分布列。令 \(Y=2X+1\),求 \(Y\) 的分布列,并验证 \(E[Y]=2E[X]+1\)。

\(g(x)=2x+1\) 是严格单调(从而一一对应)的函数,由定理 2 直接替换取值:\(Y\) 取 \(-1,\,1,\,3,\,5\),概率依次仍为 \(0.2,\,0.3,\,0.3,\,0.2\)。先算 \(E[X]=(-1)(0.2)+0(0.3)+1(0.3)+2(0.2)=0.5\),由 4.3 节应有 \(E[Y]=2\times0.5+1=2\);再用 \(Y\) 的分布列直接验证:\((-1)(0.2)+1(0.3)+3(0.3)+5(0.2)=2\),一致。一般地,\(a\ne 0\) 时 \(Y=aX+b\) 总是一一对应:支集被拉伸 \(|a|\) 倍再平移 \(b\),而概率质量原地不动——这与 \(E[aX+b]=aE[X]+b\)、\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)(4.5 节)一脉相承。
X 的分布列 p(x) x 0.5 0 0.2 −1 0.3 0 0.3 1 0.2 2 Y = X² 的分布列 p_Y(y) y 0.5 0 0.3 0 0.5 = 0.2+0.3 1 0.2 4 两幅子图采用同一纵向比例(概率 0.5 对应 140 像素高),可直接对比:合并使 y = 1 处质量最重
图 2:例 1 中 \(X\) 与 \(Y=X^2\) 的分布列对照(同一纵向比例)。四个取值的分布在平方后只剩三个取值,\(-1\) 与 \(1\) 的质量合并成 \(y=1\) 处最高的那根柱子。

4. 另一途径:先求分布函数再差分

定理 1 要求"解方程 \(g(x)=y\)"列出全部原像;当 \(g\) 的结构较复杂、或原像不易逐一枚举时,换一条路往往更稳:先求 \(Y\) 的分布函数(cumulative distribution function)(4.1 节) \[ F_Y(y) \;=\; P(Y\le y) \;=\; P\big(g(X)\le y\big) \;=\; \sum_{x:\,g(x)\le y} p_X(x), \] 即把满足 \(g(x)\le y\) 的所有 \(x\) 的概率加起来;再用 4.2 节的差分公式 \(p_Y(y)=F_Y(y)-F_Y(y^-)\) 逐点还原分布列。这条"先累积、后差分"的路线在离散情形与定理 1 等价,但它的真正价值在于:它是连续情形中几乎唯一可行的方法(见本节末注记)。

例 4 用分布函数途径重解例 1

设 \(X\) 服从例 1 的分布列,\(Y=X^2\)。先用 \(F_Y(y)=P(X^2\le y)\) 求出 \(Y\) 的分布函数,再差分得到分布列。

当 \(y<0\) 时 \(\{X^2\le y\}\) 为不可能事件,\(F_Y(y)=0\);当 \(y\ge 0\) 时 \(X^2\le y\) 即 \(-\sqrt y\le X\le\sqrt y\),逐段累加概率: \[ F_Y(y)= \begin{cases} 0, & y<0,\\[2pt] 0.3, & 0\le y<1 \quad(\text{仅 } x=0),\\[2pt] 0.8, & 1\le y<4 \quad(x\in\{-1,0,1\}),\\[2pt] 1, & y\ge 4. \end{cases} \] 在跳点处差分:\(p_Y(0)=0.3-0=0.3\),\(p_Y(1)=0.8-0.3=0.5\),\(p_Y(4)=1-0.8=0.2\),与例 1 完全一致。顺带可读出区间概率,如 \(P(0<Y\le 1)=F_Y(1)-F_Y(0)=0.5\)。
注记 连续情形预告(5.7 节)

若 \(X\) 是连续型随机变量(第 5 章),则对每个点 \(x\) 都有 \(P(X=x)=0\),"把原像上的概率加起来"只能得到 0——定理 1 的求和公式整体失效。彼时标准做法正是本节第二条途径的连续版:先算 \(F_Y(y)=P(g(X)\le y)=\int_{x:\,g(x)\le y} f_X(x)\,dx\),再对 \(y\) 求导得密度;当 \(g\) 单调可微时有显式公式 \(f_Y(y)=f_X\big(g^{-1}(y)\big)\left|\frac{\mathrm{d}}{\mathrm{d}y}g^{-1}(y)\right|\)。届时还会看到与例 3 呼应的"线性变换拉伸密度"现象。详见 5.7 节

5. 本节小结

要点回顾
  • 问题:已知 \(X\) 的分布列,求 \(Y=g(X)\) 的分布列;一切计算围绕原像集合 \(\{x:\,g(x)=y\}\) 展开。
  • 核心公式:\(p_Y(y)=\sum_{x:\,g(x)=y}p_X(x)\)——概率跟着样本点走,多个 \(x\) 映到同一 \(y\) 时概率相加(多对一合并)。
  • 一一对应时退化为直接替换:\(p_Y(g(x))=p_X(x)\);线性变换 \(Y=aX+b\;(a\ne0)\) 是典型代表。
  • 另一途径:先求 \(F_Y(y)=P(g(X)\le y)\)(按 \(g(x)\le y\) 累加),再差分 \(p_Y(y)=F_Y(y)-F_Y(y^-)\);两条路线可互相验证。
  • 平方与绝对值会丢失符号信息(\(Y=1\) 分不清 \(X=\pm1\));连续情形须改用 CDF 途径(5.7 节)。

练习

练习 4-9-1

(截断变换)设 \(X\) 服从例 1 的分布列,\(Y=\max(X,0)\)(把负值截断为 0)。求 \(Y\) 的分布列,并指出 \(Y\) 能否反推 \(X\)。

答案与提示

\(g(x)=\max(x,0)\) 把 \(-1\) 和 \(0\) 都映到 \(0\),把 \(1,2\) 原样保留。故 \(P(Y=0)=P(X=-1)+P(X=0)=0.2+0.3=0.5\),\(P(Y=1)=0.3\),\(P(Y=2)=0.2\)(和为 1)。由 \(Y=0\) 无法区分 \(X=-1\) 与 \(X=0\),故不能反推——截断与平方一样是"多对一丢信息"的典型。此类"截断赔付"在保险精算中常见(对照 4.4 节例 2 的封顶赔付 \(\min(x,20)\),二者思路相同、方向相反)。

练习 4-9-2

设 \(X\) 在 \(\{0,1,2,3\}\) 上等可能取值,\(Y=\dfrac{X(X-1)}{2}\)。求 \(Y\) 的分布列。

答案与提示

逐点计算 \(g\):\(0\mapsto0\),\(1\mapsto0\),\(2\mapsto1\),\(3\mapsto3\)。于是 \(P(Y=0)=\frac12\)(\(x=0,1\) 合并),\(P(Y=1)=\frac14\),\(P(Y=3)=\frac14\)。注意 \(y=2\) 在值域之外,\(P(Y=2)=0\),不必列入分布列。

练习 4-9-3

设 \(X\) 在 \(\{1,2,3,4\}\) 上等可能取值,\(Y=(X-2)^2\)。请分别用"原像合并"与"先求 CDF 再差分"两种方法求 \(Y\) 的分布列,并核对结果一致。

答案与提示

方法一(合并):\(2\mapsto0\);\(1,3\mapsto1\);\(4\mapsto4\),故 \(P(Y=0)=\frac14\),\(P(Y=1)=\frac12\),\(P(Y=4)=\frac14\)。方法二(CDF):\(F_Y(y)=0\;(y<0)\),\(=\frac14\;(0\le y<1)\),\(=\frac34\;(1\le y<4)\),\(=1\;(y\ge4)\);差分得 \(p_Y(0)=\frac14\)、\(p_Y(1)=\frac12\)、\(p_Y(4)=\frac14\),两法一致。

练习 4-9-4

(思考题,预告 5.7 节)若 \(X\) 是连续型随机变量,例如服从 \((0,1)\) 上的均匀分布,\(Y=X^2\)。此时"把 \(\{x:\,x^2=y\}\) 上的概率加起来"会得到什么?正确的第一步应当改求什么量?

答案与提示

连续型 \(X\) 取任何单点的概率都是 0,求和只得 \(P(Y=y)=0\),得不到有用信息。应先求分布函数 \(F_Y(y)=P(X^2\le y)=P(X\le\sqrt y)=\sqrt y\)(\(0\le y\le1\)),再求导得密度 \(f_Y(y)=\frac{1}{2\sqrt y}\)——这正是 5.7 节一般方法(CDF 途径 + 单调变换公式)的最小例子。离散与连续的关键差别:前者质量集中在点上、可直接相加;后者质量按密度铺开、必须经 CDF 累积再求导。