第 5 章 · 连续型随机变量

5.7 随机变量函数的分布

The Distribution of a Function of a Random Variable
学习目标
  • 会用分布函数法求 \(Y=g(X)\) 的密度:先算 \(F_Y(y)=P(g(X)\le y)\),再求导;
  • 能叙述并证明单调变换公式 \(f_Y(y)=f_X(g^{-1}(y))\,\bigl|d g^{-1}(y)/dy\bigr|\),并用"微元质量守恒"解释雅可比因子的直观含义;
  • 能对非单调变换(如 \(Y=X^2\))正确地分段合并,并说明漏掉一支的后果;
  • 熟练推导均匀、正态随机变量经线性变换与平方变换后的分布(标准化、\(\chi_1^2\));
  • 了解逆变换法在随机模拟中的原理与作用。

1. 问题的提出:跟踪质量,而不是概率

测量单位的换算(摄氏→华氏)是线性函数,信号的能量是电压的平方,价格与对数收益率互为函数关系——实际应用中我们关心的量,往往是某个随机变量的函数。设 \(X\) 为连续型随机变量,其密度 \(f_X\) 已知,\(g:\mathbb{R}\to\mathbb{R}\) 是给定的连续函数,本节的核心问题是:随机变量的函数(function of a random variable) \(Y=g(X)\) 的密度 \(f_Y\)

回忆 4.9 节的离散情形:\(p_Y(y)=\sum_{x:\,g(x)=y}p_X(x)\),把"映到 \(y\) 的所有 \(x\)"的概率统统加起来即可。连续情形不能照抄——单点概率恒为 \(0\)(5.1 节),逐点相加毫无意义。但 5.1 节同时提供了正确的抓手:\(X\) 落入小区间 \([x,\,x+dx]\) 的概率约为 \(f_X(x)\,dx\),这是一份可以搬运的"概率质量"。因此连续情形的策略是:跟踪每个微元区间的质量被 \(g\) 搬到了哪里,而不是逐点追问概率。

定义 1 随机变量的函数的分布

设 \(X\) 为具有密度 \(f_X\) 的连续型随机变量,\(g:\mathbb{R}\to\mathbb{R}\),\(Y=g(X)\)。则对实数集 \(A\), \[ P(Y\in A)=P\bigl(X\in g^{-1}(A)\bigr)=\int_{\{x:\;g(x)\in A\}} f_X(x)\,dx, \] 其中 \(g^{-1}(A)=\{x:\ g(x)\in A\}\) 称为 \(A\) 在 \(g\) 下的原像(preimage)。

这个式子说明:\(Y\) 的一切概率性质都由 \(f_X\) 与 \(g\) 完全决定。本节的任务,是把它变成可以直接使用的密度公式。

2. 分布函数法:通用程序

最通用、永不失效的程序是分布函数法(distribution function technique):先求 \(Y\) 的分布函数,再求导还原密度。它之所以总是可行,是因为 \(F_Y(y)\) 只是某个事件的概率,而连续型随机变量的概率永远可以写成 \(f_X\) 在相应集合上的积分——问题于是从"求密度"退化为"把事件 \(\{g(X)\le y\}\) 等价改写为 \(X\) 的取值范围"。

定理 1 分布函数法

设 \(X\) 具有密度 \(f_X\),\(Y=g(X)\),则 \[ F_Y(y)=P(Y\le y)=P(g(X)\le y)=\int_{\{x:\;g(x)\le y\}} f_X(x)\,dx, \] 且在 \(F_Y\) 的可导点处,\(f_Y(y)=F_Y'(y)\)。

证明第一个等号是分布函数的定义;第二个等号把事件 \(\{g(X)\le y\}\) 写成"\(X\) 落入集合 \(\{x:\ g(x)\le y\}\)",由 5.1 节,连续型随机变量落入集合的概率等于密度在该集合上的积分。右端是上限 \(y\) 的函数,在 \(F_Y\) 的可导点处由微积分基本定理求导即得 \(f_Y\)。

改写 \(\{g(X)\le y\}\) 时要注意 \(g\) 的单调性:当 \(g\) 在相关范围上单调时,它等价于一个以 \(g^{-1}(y)\) 为端点的区间;当 \(g\) 不单调时,它是若干个区间的并——这正是第 4 小节"分段合并"的伏笔。

例 1 平方根变换:\(X\sim U(0,1)\),\(Y=\sqrt{X}\)

设 \(X\sim U(0,1)\),\(Y=\sqrt{X}\)。求 \(Y\) 的密度 \(f_Y\)。

先求 \(F_Y\)。由 \(\sqrt{X}\ge 0\) 知:当 \(y<0\) 时 \(F_Y(y)=0\);当 \(y\ge 1\) 时 \(\sqrt{X}\le 1\le y\) 恒成立,\(F_Y(y)=1\)。当 \(0\le y<1\) 时,不等式 \(\sqrt{X}\le y\) 两边非负、可平方,得 \[ F_Y(y)=P(\sqrt{X}\le y)=P(X\le y^2)=y^2, \] 这里用了 \(U(0,1)\) 的分布函数 \(F_X(x)=x\)(\(0\le x\le 1\)),且 \(0\le y^2<1\)。求导得 \[ f_Y(y)=\frac{d}{dy}\,y^2=2y,\qquad 0<y<1, \] 其余处 \(f_Y(y)=0\)。验算:\(\int_0^1 2y\,dy=\bigl[y^2\bigr]_0^1=1\),规范性成立。直观上,\(x\in(0,1)\) 时 \(\sqrt{x}>x\),变换把概率质量向右推,故密度从左端的 \(0\) 线性升到右端的 \(2\),与分布函数 \(F_Y(y)=y^2\) 的凸性一致。

3. 单调变换公式:微元质量守恒

分布函数法可靠,但每个新问题都要"重做一遍积分再求导"。当 \(g\) 严格单调时,整个过程可以浓缩成一个公式,其直观根源是微元质量守恒:把 \(X\) 的取值区间切成微元 \([x,\,x+dx]\),\(g\) 把它搬到 \(y\) 轴上的 \([y,\,y+dy]\)(\(y=g(x)\))。概率不会因为换一根轴而凭空消失: \[ f_X(x)\,|dx| = f_Y(y)\,|dy|. \] 若 \(g\) 在 \(x\) 处把轴局部拉伸 \(k=|g'(x)|\) 倍,则 \(|dy|=k\,|dx|\),于是 \(f_Y(y)=f_X(x)/k\):拉伸则质量摊薄、密度变稀;压缩则质量聚集、密度变浓。密度本来就是"单位长度上的质量",换轴只是重新记账。

定理 2 单调变换公式(变量替换公式)

设 \(X\) 的密度 \(f_X\) 在区间 \(I\) 上恒正(\(I\) 为 \(X\) 的支撑,support),\(g\) 在 \(I\) 上严格单调、可微且 \(g'\ne 0\)。记 \(J=g(I)\),\(h=g^{-1}:J\to I\) 为反函数。则 \(Y=g(X)\) 的密度为 \[ f_Y(y)=f_X\bigl(h(y)\bigr)\,\bigl|h'(y)\bigr|=\frac{f_X\bigl(h(y)\bigr)}{\bigl|g'\bigl(h(y)\bigr)\bigr|},\qquad y\in J, \] 而在 \(J\) 之外 \(f_Y(y)=0\)。

证明设 \(g\) 严格递增,则 \(h\) 也递增,且 \(g(x)\le y\iff x\le h(y)\),故 \[ F_Y(y)=P\bigl(X\le h(y)\bigr)=F_X\bigl(h(y)\bigr),\qquad f_Y(y)=f_X\bigl(h(y)\bigr)\,h'(y)=f_X\bigl(h(y)\bigr)\,\bigl|h'(y)\bigr|. \] 设 \(g\) 严格递减,则不等号反向:\(g(x)\le y\iff x\ge h(y)\),故 \[ F_Y(y)=P\bigl(X\ge h(y)\bigr)=1-F_X\bigl(h(y)\bigr),\qquad f_Y(y)=-f_X\bigl(h(y)\bigr)\,h'(y)=f_X\bigl(h(y)\bigr)\,\bigl|h'(y)\bigr|, \] 最后一步用了递减时 \(h'(y)<0\)。两种情形统一为带绝对值的公式;第二个等号由反函数求导法则 \(h'(y)=1/g'\bigl(h(y)\bigr)\) 得到。
微元映射与概率质量守恒(以 X~U(0,1)、Y=√X 为例) y = √x fX(x)·dx = fY(y)·dy (换轴:区间长度变了,概率质量不变) X 的密度:f(x) = 1 x 1 面积 = 0.10 0 1 0.32 0.42 dx Y 的密度:f(y) = 2y y ≈1.21 0 1 0.57 0.65 dy
图 1:微元区间的概率质量守恒(例 1 的变换)。x 轴上 [0.32, 0.42] 内的概率 0.10 被映到 y 轴上 [√0.32, √0.42] ≈ [0.566, 0.648]:该处局部伸缩率 |g′(x)| = 1/(2√x) ≈ 0.82,区间被压缩为约 0.82 倍长,密度相应升为约 1.21 倍 = 1/|g′|(即 2√x ≈ 1.22,1 → 2y),两块阴影面积(即概率)严格相等。

图 1 把这套"记账"规则画了出来:公式中的因子 \(\bigl|h'(y)\bigr|=\bigl|d g^{-1}(y)/dy\bigr|\) 称为雅可比因子(Jacobian factor),它正是局部伸缩率的倒数——\(y\) 轴上每被拉伸一份,密度就摊薄一份。下面两个例子给出它最常用的特例。

例 2 线性变换 \(Y=aX+b\):均匀→均匀

设 \(a\ne 0\)、\(b\) 为常数,\(Y=aX+b\),\(X\) 具有密度 \(f_X\)。求 \(f_Y\) 的一般公式;再就 \(X\sim U(0,1)\) 写出 \(Y\) 的分布。

\(g(x)=ax+b\) 严格单调,反函数 \(h(y)=(y-b)/a\),\(\bigl|h'(y)\bigr|=1/|a|\),由定理 2: \[ f_Y(y)=\frac{1}{|a|}\,f_X\!\left(\frac{y-b}{a}\right). \] 若 \(X\sim U(0,1)\):当 \(a>0\) 时,\(f_X\bigl((y-b)/a\bigr)=1\iff 0\le \dfrac{y-b}{a}\le 1\iff b\le y\le a+b\),故 \(f_Y(y)=1/a\),即 \(Y\sim U(b,\ a+b)\);当 \(a<0\) 时,同法得 \(0<\dfrac{y-b}{a}<1\iff a+b<y<b\),故 \(Y\sim U(a+b,\ b)\)。两种情形合起来:均匀分布经线性变换仍是均匀分布——线性映射把区间 \((0,1)\) 搬到端点 \(b\) 与 \(a+b\) 之间(长度乘 \(|a|\)),"处处等可能"的性质不变。一般地,该公式表明线性变换只对密度做"平移 \(b\) + 横向拉伸 \(|a|\) + 纵向压缩 \(1/|a|\)",图像下的总面积保持为 1。
例 3 标准化:\(X\sim N(\mu,\sigma^2)\Rightarrow Z\sim N(0,1)\)

设 \(X\sim N(\mu,\sigma^2)\),\(Z=\dfrac{X-\mu}{\sigma}\)。证明 \(Z\sim N(0,1)\)。

这是例 2 的线性变换:\(a=1/\sigma>0\),\(b=-\mu/\sigma\),反函数 \(h(z)=\sigma z+\mu\),\(\bigl|h'(z)\bigr|=\sigma\)。代入 \(X\) 的密度: \[ f_Z(z)=f_X(\sigma z+\mu)\cdot\sigma =\sigma\cdot\frac{1}{\sqrt{2\pi}\,\sigma}\exp\!\left(-\frac{(\sigma z+\mu-\mu)^2}{2\sigma^2}\right) =\frac{1}{\sqrt{2\pi}}\,e^{-z^2/2},\qquad z\in\mathbb{R}, \] 此即标准正态密度,故 \(Z\sim N(0,1)\)。5.4 节反复使用的"标准化后查 \(\Phi\) 表"从此有了严格根据;同法还可得一般结论 \(aX+b\sim N(a\mu+b,\ a^2\sigma^2)\):线性变换不改变正态性,只改变位置与刻度

4. 非单调变换:分段合并

一旦 \(g\) 非单调,定理 2 的前提被破坏:同一个 \(y\) 可能对应多个 \(x\),这些微元里的质量全部落入 \(Y\) 的同一微元,必须逐支相加。以 \(g(x)=x^2\) 为例(图 2):\(x_0\) 与 \(-x_0\) 都被映到 \(y_0=x_0^2\),于是 \(f_Y(y_0)\,dy=f_X(x_0)\,dx+f_X(-x_0)\,dx\)。若只取 \(\sqrt{y}\) 一支硬套定理 2,得到的"密度"在全轴上的积分只有 \(1/2\)——恰好丢掉一半质量。由此得到一个必须养成的习惯:每求出一个 \(f_Y\),立即验证 \(\int f_Y\,dy=1\),它能在大多数场合立刻暴露漏支、丢绝对值之类的错误。

定理 3 分段单调的合并公式

设 \(X\) 的支撑可分成互不相交的区间 \(I_1,\dots,I_k\)(其并覆盖支撑),\(g\) 在每个 \(I_i\) 上严格单调、可微且 \(g'\ne 0\),值域 \(J_i=g(I_i)\),相应的反函数为 \(h_i\)。则对 \(Y=g(X)\), \[ f_Y(y)=\sum_{i:\;y\in J_i} f_X\bigl(h_i(y)\bigr)\,\bigl|h_i'(y)\bigr|. \]

证明对固定的 \(y\),事件 \(\{g(X)\le y\}\) 落在每个 \(I_i\) 内的部分是以 \(h_i(y)\) 为端点的区间,故 \(F_Y(y)\) 等于若干个 \(F_X\bigl(h_i(y)\bigr)\) 与 \(1-F_X\bigl(h_i(y)\bigr)\)(视 \(g\) 在该支上递增或递减)之和。逐项求导,每项恰贡献 \(f_X\bigl(h_i(y)\bigr)\bigl|h_i'(y)\bigr|\),相加即得。
非单调变换:g(x) = x² 把 x 与 −x 都映到同一个 y fX(x)·dx + fX(−x)·dx = fY(y)·dy x y y = x² dy y₀ = x₀² −2 −1 1 2 0 dx dx
图 2:非单调变换 g(x) = x² 的两支合并。取 x₀ = 1:x 轴上 −x₀ 与 x₀ 附近的两个微元(红、金,宽度均为 dx)都被映到 y 轴上同一个微元 dy(绿)附近,故 fY(y₀)dy = fX(x₀)dx + fX(−x₀)dx,其中 dx = dy/(2√y₀)。这正是例 4 的密度中出现两个 φ(√y) 贡献的原因。
例 4 平方变换:\(X\sim N(0,1)\),\(Y=X^2\)(χ²₁ 伏笔)

设 \(X\sim N(0,1)\),\(Y=X^2\)。求 \(Y\) 的密度 \(f_Y\)。

恒有 \(Y\ge 0\),故 \(y<0\) 时 \(F_Y(y)=0\)。当 \(y>0\),事件 \(\{X^2\le y\}\) 即 \(\{-\sqrt{y}\le X\le\sqrt{y}\}\),用 5.4 节的记号与对称性 \(\Phi(-t)=1-\Phi(t)\): \[ F_Y(y)=P\bigl(-\sqrt{y}\le X\le\sqrt{y}\bigr)=\Phi(\sqrt{y})-\Phi(-\sqrt{y})=2\Phi(\sqrt{y})-1. \] 求导(记 \(\varphi\) 为标准正态密度,\(\frac{d}{dy}\Phi(\sqrt{y})=\varphi(\sqrt{y})\cdot\frac{1}{2\sqrt{y}}\)): \[ f_Y(y)=2\varphi(\sqrt{y})\cdot\frac{1}{2\sqrt{y}}=\frac{1}{\sqrt{2\pi y}}\,e^{-y/2},\qquad y>0, \] 其余处 \(f_Y(y)=0\)。用定理 3 复核:正支 \(h_1(y)=\sqrt{y}\)、负支 \(h_2(y)=-\sqrt{y}\),两支都有 \(\bigl|h_i'(y)\bigr|=\dfrac{1}{2\sqrt{y}}\),故 \[ f_Y(y)=\frac{\varphi(\sqrt{y})}{2\sqrt{y}}+\frac{\varphi(-\sqrt{y})}{2\sqrt{y}}=\frac{\varphi(\sqrt{y})}{\sqrt{y}}, \] 与分布函数法的结果一致——两支贡献相同(\(\varphi\) 对称),恰好各占一半。两点观察:其一,\(y\to 0^+\) 时 \(f_Y(y)\to\infty\),密度可以在端点无界,但 \(\int_0^{\varepsilon}y^{-1/2}dy=2\sqrt{\varepsilon}<\infty\),总质量仍为 1——再次印证"密度不是概率"(5.1 节);其二,这个分布就是自由度为 1 的卡方分布(chi-square distribution) \(\chi_1^2\),7.7 节将证明:\(n\) 个独立标准正态变量的平方和服从 \(\chi_n^2\)。
注记 常见陷阱与延伸

三个高频错误:忘记绝对值(算出"负密度");非单调时硬套定理 2,例如对 \(Y=X^2\) 只保留 \(\sqrt{y}\) 一支,密度积分只剩 \(1/2\);忘记先确定 \(Y\) 的取值范围(支撑往往已改变)。对策就是上面的铁律——求完必验 \(\int f_Y=1\)。

延伸:若 \(g\) 在某个正长度的区间上恒取常数 \(c\),则 \(P(Y=c)>0\),\(Y\) 的分布不再是纯连续型,求导法失效,只能回到分布函数本身。另外,把本节思想反过来用,就是随机模拟中的逆变换法(inverse transform method):若 \(U\sim U(0,1)\)、\(F\) 连续严格增,则 \(X=F^{-1}(U)\) 的分布函数恰为 \(F\),因为 \(P\bigl(F^{-1}(U)\le y\bigr)=P\bigl(U\le F(y)\bigr)=F(y)\)(练习 3 是活例子,思想在 5.3 节已埋下)。多个随机变量之和的分布将在 6.3 节用卷积处理,\(\chi^2\) 分布族则在 7.7 节展开。

5. 本节小结

要点回顾
  • 分布函数法(通用)三步:写 \(F_Y(y)=P(g(X)\le y)\) → 把事件等价改写为 \(X\) 的范围并用 \(F_X\) 表达 → 求导得 \(f_Y\)。
  • 单调公式:\(f_Y(y)=f_X\bigl(g^{-1}(y)\bigr)\,\bigl|d g^{-1}(y)/dy\bigr|\);本质是微元质量守恒 \(f_X(x)\,dx=f_Y(y)\,dy\),雅可比因子是局部伸缩率的倒数。
  • 线性变换 \(Y=aX+b\):\(f_Y(y)=\frac{1}{|a|}f_X\bigl(\frac{y-b}{a}\bigr)\);均匀→均匀,正态→正态(标准化 \(N(\mu,\sigma^2)\to N(0,1)\))。
  • 非单调必须分段合并:各支反函数的贡献相加;\(Y=X^2\) 的两支给出 \(\chi_1^2\) 密度 \(\frac{1}{\sqrt{2\pi y}}e^{-y/2}\)(\(y>0\))。
  • 好习惯:动笔前先问"\(Y\) 的支撑是什么",收笔前必验 \(\int f_Y\,dy=1\)。
表 1:本节常见变换速查
原变量与变换\(Y\) 的分布\(Y\) 的密度 / 说明
\(X\sim U(0,1)\),\(Y=\sqrt{X}\)密度 \(2y\)(\(0<y<1\))\(F_Y(y)=y^2\) 先推,再求导
\(Y=aX+b\)(\(a\ne0\))线性变换\(\frac{1}{|a|}f_X\bigl(\frac{y-b}{a}\bigr)\)
\(X\sim U(0,1)\),\(a>0\)\(U(b,\ a+b)\)均匀→均匀;\(a<0\) 时为 \(U(a+b,\ b)\)
\(X\sim N(\mu,\sigma^2)\),\(Z=\frac{X-\mu}{\sigma}\)\(N(0,1)\)标准化;查 \(\Phi\) 表的依据
\(X\sim N(0,1)\),\(Y=X^2\)\(\chi_1^2\)\(\frac{1}{\sqrt{2\pi y}}e^{-y/2}\)(\(y>0\))
\(X\sim U(0,1)\),\(Y=-\ln X\)\(\mathrm{Exp}(1)\)逆变换法实例(练习 3)

练习

练习 5-7-1

设 \(X\sim U(0,1)\),\(Y=1/X\)。求 \(Y\) 的密度,并判断 \(E[Y]\) 是否存在。

答案与提示

\(y\ge 1\) 时 \(F_Y(y)=P(1/X\le y)=P(X\ge 1/y)=1-\frac{1}{y}\);\(y<1\) 时 \(F_Y(y)=0\)。求导得 \(f_Y(y)=\frac{1}{y^2}\)(\(y>1\)),其余为 0;验证 \(\int_1^{\infty}y^{-2}dy=1\)。但 \(E[Y]=\int_1^{\infty}y\cdot y^{-2}\,dy=\int_1^{\infty}\frac{dy}{y}=+\infty\):\(Y\) 是完全合法的随机变量,期望却不存在——与 5.6 节的 Cauchy 分布同属"尾部太厚"的典型。

练习 5-7-2

设 \(X\sim U(0,1)\),\(Y=X^3\)。分别用分布函数法与单调变换公式求 \(f_Y\)。

答案与提示

\(g(x)=x^3\) 在 \((0,1)\) 上严格递增,\(h(y)=y^{1/3}\),\(\bigl|h'(y)\bigr|=\frac{1}{3}y^{-2/3}\),故 \(f_Y(y)=\frac{1}{3}y^{-2/3}\)(\(0<y<1\))。用分布函数法:\(F_Y(y)=P\bigl(X\le y^{1/3}\bigr)=y^{1/3}\),求导一致。密度在 \(y\to 0^+\) 处无界但可积(这是 Beta\(\bigl(\tfrac{1}{3},1\bigr)\) 分布)。

练习 5-7-3

设 \(X\sim U(0,1)\),\(Y=-\ln X\)。证明 \(Y\sim\mathrm{Exp}(1)\),并说明它是逆变换法的实例。

答案与提示

\(y>0\) 时 \(F_Y(y)=P(-\ln X\le y)=P(\ln X\ge -y)=P\bigl(X\ge e^{-y}\bigr)=1-e^{-y}\);\(y\le 0\) 时 \(F_Y(y)=0\)。故 \(f_Y(y)=e^{-y}\)(\(y>0\)),即 \(\mathrm{Exp}(1)\)(5.5 节)。反过来看:\(\mathrm{Exp}(1)\) 的分布函数 \(F(y)=1-e^{-y}\) 的反函数为 \(F^{-1}(u)=-\ln(1-u)\),而 \(1-U\sim U(0,1)\),所以 \(-\ln U\sim\mathrm{Exp}(1)\)——计算机只要能产生 \(U(0,1)\) 随机数,就能生成指数随机数,这正是 5.3 节所述逆变换思想的落地。

练习 5-7-4

设 \(X\sim\mathrm{Exp}(\lambda)\),\(Y=e^{X}\)。求 \(f_Y\) 并验证其规范性。

答案与提示

恒有 \(Y>1\)。\(h(y)=\ln y\),\(\bigl|h'(y)\bigr|=1/y\),故 \(f_Y(y)=f_X(\ln y)\cdot\frac{1}{y}=\lambda e^{-\lambda\ln y}\big/y=\lambda\,y^{-(\lambda+1)}\)(\(y>1\)),其余为 0。\(\int_1^{\infty}\lambda y^{-(\lambda+1)}dy=1\) 成立。这是帕累托(Pareto)型的幂律分布——对指数变量再取指数,"轻尾"被改造成"重尾"。