- 会用分布函数法求 \(Y=g(X)\) 的密度:先算 \(F_Y(y)=P(g(X)\le y)\),再求导;
- 能叙述并证明单调变换公式 \(f_Y(y)=f_X(g^{-1}(y))\,\bigl|d g^{-1}(y)/dy\bigr|\),并用"微元质量守恒"解释雅可比因子的直观含义;
- 能对非单调变换(如 \(Y=X^2\))正确地分段合并,并说明漏掉一支的后果;
- 熟练推导均匀、正态随机变量经线性变换与平方变换后的分布(标准化、\(\chi_1^2\));
- 了解逆变换法在随机模拟中的原理与作用。
1. 问题的提出:跟踪质量,而不是概率
测量单位的换算(摄氏→华氏)是线性函数,信号的能量是电压的平方,价格与对数收益率互为函数关系——实际应用中我们关心的量,往往是某个随机变量的函数。设 \(X\) 为连续型随机变量,其密度 \(f_X\) 已知,\(g:\mathbb{R}\to\mathbb{R}\) 是给定的连续函数,本节的核心问题是:求 随机变量的函数(function of a random variable) \(Y=g(X)\) 的密度 \(f_Y\)。
回忆 4.9 节的离散情形:\(p_Y(y)=\sum_{x:\,g(x)=y}p_X(x)\),把"映到 \(y\) 的所有 \(x\)"的概率统统加起来即可。连续情形不能照抄——单点概率恒为 \(0\)(5.1 节),逐点相加毫无意义。但 5.1 节同时提供了正确的抓手:\(X\) 落入小区间 \([x,\,x+dx]\) 的概率约为 \(f_X(x)\,dx\),这是一份可以搬运的"概率质量"。因此连续情形的策略是:跟踪每个微元区间的质量被 \(g\) 搬到了哪里,而不是逐点追问概率。
设 \(X\) 为具有密度 \(f_X\) 的连续型随机变量,\(g:\mathbb{R}\to\mathbb{R}\),\(Y=g(X)\)。则对实数集 \(A\), \[ P(Y\in A)=P\bigl(X\in g^{-1}(A)\bigr)=\int_{\{x:\;g(x)\in A\}} f_X(x)\,dx, \] 其中 \(g^{-1}(A)=\{x:\ g(x)\in A\}\) 称为 \(A\) 在 \(g\) 下的原像(preimage)。
这个式子说明:\(Y\) 的一切概率性质都由 \(f_X\) 与 \(g\) 完全决定。本节的任务,是把它变成可以直接使用的密度公式。
2. 分布函数法:通用程序
最通用、永不失效的程序是分布函数法(distribution function technique):先求 \(Y\) 的分布函数,再求导还原密度。它之所以总是可行,是因为 \(F_Y(y)\) 只是某个事件的概率,而连续型随机变量的概率永远可以写成 \(f_X\) 在相应集合上的积分——问题于是从"求密度"退化为"把事件 \(\{g(X)\le y\}\) 等价改写为 \(X\) 的取值范围"。
设 \(X\) 具有密度 \(f_X\),\(Y=g(X)\),则 \[ F_Y(y)=P(Y\le y)=P(g(X)\le y)=\int_{\{x:\;g(x)\le y\}} f_X(x)\,dx, \] 且在 \(F_Y\) 的可导点处,\(f_Y(y)=F_Y'(y)\)。
改写 \(\{g(X)\le y\}\) 时要注意 \(g\) 的单调性:当 \(g\) 在相关范围上单调时,它等价于一个以 \(g^{-1}(y)\) 为端点的区间;当 \(g\) 不单调时,它是若干个区间的并——这正是第 4 小节"分段合并"的伏笔。
设 \(X\sim U(0,1)\),\(Y=\sqrt{X}\)。求 \(Y\) 的密度 \(f_Y\)。
3. 单调变换公式:微元质量守恒
分布函数法可靠,但每个新问题都要"重做一遍积分再求导"。当 \(g\) 严格单调时,整个过程可以浓缩成一个公式,其直观根源是微元质量守恒:把 \(X\) 的取值区间切成微元 \([x,\,x+dx]\),\(g\) 把它搬到 \(y\) 轴上的 \([y,\,y+dy]\)(\(y=g(x)\))。概率不会因为换一根轴而凭空消失: \[ f_X(x)\,|dx| = f_Y(y)\,|dy|. \] 若 \(g\) 在 \(x\) 处把轴局部拉伸 \(k=|g'(x)|\) 倍,则 \(|dy|=k\,|dx|\),于是 \(f_Y(y)=f_X(x)/k\):拉伸则质量摊薄、密度变稀;压缩则质量聚集、密度变浓。密度本来就是"单位长度上的质量",换轴只是重新记账。
设 \(X\) 的密度 \(f_X\) 在区间 \(I\) 上恒正(\(I\) 为 \(X\) 的支撑,support),\(g\) 在 \(I\) 上严格单调、可微且 \(g'\ne 0\)。记 \(J=g(I)\),\(h=g^{-1}:J\to I\) 为反函数。则 \(Y=g(X)\) 的密度为 \[ f_Y(y)=f_X\bigl(h(y)\bigr)\,\bigl|h'(y)\bigr|=\frac{f_X\bigl(h(y)\bigr)}{\bigl|g'\bigl(h(y)\bigr)\bigr|},\qquad y\in J, \] 而在 \(J\) 之外 \(f_Y(y)=0\)。
图 1 把这套"记账"规则画了出来:公式中的因子 \(\bigl|h'(y)\bigr|=\bigl|d g^{-1}(y)/dy\bigr|\) 称为雅可比因子(Jacobian factor),它正是局部伸缩率的倒数——\(y\) 轴上每被拉伸一份,密度就摊薄一份。下面两个例子给出它最常用的特例。
设 \(a\ne 0\)、\(b\) 为常数,\(Y=aX+b\),\(X\) 具有密度 \(f_X\)。求 \(f_Y\) 的一般公式;再就 \(X\sim U(0,1)\) 写出 \(Y\) 的分布。
设 \(X\sim N(\mu,\sigma^2)\),\(Z=\dfrac{X-\mu}{\sigma}\)。证明 \(Z\sim N(0,1)\)。
4. 非单调变换:分段合并
一旦 \(g\) 非单调,定理 2 的前提被破坏:同一个 \(y\) 可能对应多个 \(x\),这些微元里的质量全部落入 \(Y\) 的同一微元,必须逐支相加。以 \(g(x)=x^2\) 为例(图 2):\(x_0\) 与 \(-x_0\) 都被映到 \(y_0=x_0^2\),于是 \(f_Y(y_0)\,dy=f_X(x_0)\,dx+f_X(-x_0)\,dx\)。若只取 \(\sqrt{y}\) 一支硬套定理 2,得到的"密度"在全轴上的积分只有 \(1/2\)——恰好丢掉一半质量。由此得到一个必须养成的习惯:每求出一个 \(f_Y\),立即验证 \(\int f_Y\,dy=1\),它能在大多数场合立刻暴露漏支、丢绝对值之类的错误。
设 \(X\) 的支撑可分成互不相交的区间 \(I_1,\dots,I_k\)(其并覆盖支撑),\(g\) 在每个 \(I_i\) 上严格单调、可微且 \(g'\ne 0\),值域 \(J_i=g(I_i)\),相应的反函数为 \(h_i\)。则对 \(Y=g(X)\), \[ f_Y(y)=\sum_{i:\;y\in J_i} f_X\bigl(h_i(y)\bigr)\,\bigl|h_i'(y)\bigr|. \]
设 \(X\sim N(0,1)\),\(Y=X^2\)。求 \(Y\) 的密度 \(f_Y\)。
三个高频错误:忘记绝对值(算出"负密度");非单调时硬套定理 2,例如对 \(Y=X^2\) 只保留 \(\sqrt{y}\) 一支,密度积分只剩 \(1/2\);忘记先确定 \(Y\) 的取值范围(支撑往往已改变)。对策就是上面的铁律——求完必验 \(\int f_Y=1\)。
延伸:若 \(g\) 在某个正长度的区间上恒取常数 \(c\),则 \(P(Y=c)>0\),\(Y\) 的分布不再是纯连续型,求导法失效,只能回到分布函数本身。另外,把本节思想反过来用,就是随机模拟中的逆变换法(inverse transform method):若 \(U\sim U(0,1)\)、\(F\) 连续严格增,则 \(X=F^{-1}(U)\) 的分布函数恰为 \(F\),因为 \(P\bigl(F^{-1}(U)\le y\bigr)=P\bigl(U\le F(y)\bigr)=F(y)\)(练习 3 是活例子,思想在 5.3 节已埋下)。多个随机变量之和的分布将在 6.3 节用卷积处理,\(\chi^2\) 分布族则在 7.7 节展开。
5. 本节小结
- 分布函数法(通用)三步:写 \(F_Y(y)=P(g(X)\le y)\) → 把事件等价改写为 \(X\) 的范围并用 \(F_X\) 表达 → 求导得 \(f_Y\)。
- 单调公式:\(f_Y(y)=f_X\bigl(g^{-1}(y)\bigr)\,\bigl|d g^{-1}(y)/dy\bigr|\);本质是微元质量守恒 \(f_X(x)\,dx=f_Y(y)\,dy\),雅可比因子是局部伸缩率的倒数。
- 线性变换 \(Y=aX+b\):\(f_Y(y)=\frac{1}{|a|}f_X\bigl(\frac{y-b}{a}\bigr)\);均匀→均匀,正态→正态(标准化 \(N(\mu,\sigma^2)\to N(0,1)\))。
- 非单调必须分段合并:各支反函数的贡献相加;\(Y=X^2\) 的两支给出 \(\chi_1^2\) 密度 \(\frac{1}{\sqrt{2\pi y}}e^{-y/2}\)(\(y>0\))。
- 好习惯:动笔前先问"\(Y\) 的支撑是什么",收笔前必验 \(\int f_Y\,dy=1\)。
| 原变量与变换 | \(Y\) 的分布 | \(Y\) 的密度 / 说明 |
|---|---|---|
| \(X\sim U(0,1)\),\(Y=\sqrt{X}\) | 密度 \(2y\)(\(0<y<1\)) | \(F_Y(y)=y^2\) 先推,再求导 |
| \(Y=aX+b\)(\(a\ne0\)) | 线性变换 | \(\frac{1}{|a|}f_X\bigl(\frac{y-b}{a}\bigr)\) |
| \(X\sim U(0,1)\),\(a>0\) | \(U(b,\ a+b)\) | 均匀→均匀;\(a<0\) 时为 \(U(a+b,\ b)\) |
| \(X\sim N(\mu,\sigma^2)\),\(Z=\frac{X-\mu}{\sigma}\) | \(N(0,1)\) | 标准化;查 \(\Phi\) 表的依据 |
| \(X\sim N(0,1)\),\(Y=X^2\) | \(\chi_1^2\) | \(\frac{1}{\sqrt{2\pi y}}e^{-y/2}\)(\(y>0\)) |
| \(X\sim U(0,1)\),\(Y=-\ln X\) | \(\mathrm{Exp}(1)\) | 逆变换法实例(练习 3) |
练习
练习 5-7-1
设 \(X\sim U(0,1)\),\(Y=1/X\)。求 \(Y\) 的密度,并判断 \(E[Y]\) 是否存在。
答案与提示\(y\ge 1\) 时 \(F_Y(y)=P(1/X\le y)=P(X\ge 1/y)=1-\frac{1}{y}\);\(y<1\) 时 \(F_Y(y)=0\)。求导得 \(f_Y(y)=\frac{1}{y^2}\)(\(y>1\)),其余为 0;验证 \(\int_1^{\infty}y^{-2}dy=1\)。但 \(E[Y]=\int_1^{\infty}y\cdot y^{-2}\,dy=\int_1^{\infty}\frac{dy}{y}=+\infty\):\(Y\) 是完全合法的随机变量,期望却不存在——与 5.6 节的 Cauchy 分布同属"尾部太厚"的典型。
练习 5-7-2
设 \(X\sim U(0,1)\),\(Y=X^3\)。分别用分布函数法与单调变换公式求 \(f_Y\)。
答案与提示\(g(x)=x^3\) 在 \((0,1)\) 上严格递增,\(h(y)=y^{1/3}\),\(\bigl|h'(y)\bigr|=\frac{1}{3}y^{-2/3}\),故 \(f_Y(y)=\frac{1}{3}y^{-2/3}\)(\(0<y<1\))。用分布函数法:\(F_Y(y)=P\bigl(X\le y^{1/3}\bigr)=y^{1/3}\),求导一致。密度在 \(y\to 0^+\) 处无界但可积(这是 Beta\(\bigl(\tfrac{1}{3},1\bigr)\) 分布)。
练习 5-7-3
设 \(X\sim U(0,1)\),\(Y=-\ln X\)。证明 \(Y\sim\mathrm{Exp}(1)\),并说明它是逆变换法的实例。
答案与提示\(y>0\) 时 \(F_Y(y)=P(-\ln X\le y)=P(\ln X\ge -y)=P\bigl(X\ge e^{-y}\bigr)=1-e^{-y}\);\(y\le 0\) 时 \(F_Y(y)=0\)。故 \(f_Y(y)=e^{-y}\)(\(y>0\)),即 \(\mathrm{Exp}(1)\)(5.5 节)。反过来看:\(\mathrm{Exp}(1)\) 的分布函数 \(F(y)=1-e^{-y}\) 的反函数为 \(F^{-1}(u)=-\ln(1-u)\),而 \(1-U\sim U(0,1)\),所以 \(-\ln U\sim\mathrm{Exp}(1)\)——计算机只要能产生 \(U(0,1)\) 随机数,就能生成指数随机数,这正是 5.3 节所述逆变换思想的落地。
练习 5-7-4
设 \(X\sim\mathrm{Exp}(\lambda)\),\(Y=e^{X}\)。求 \(f_Y\) 并验证其规范性。
答案与提示恒有 \(Y>1\)。\(h(y)=\ln y\),\(\bigl|h'(y)\bigr|=1/y\),故 \(f_Y(y)=f_X(\ln y)\cdot\frac{1}{y}=\lambda e^{-\lambda\ln y}\big/y=\lambda\,y^{-(\lambda+1)}\)(\(y>1\)),其余为 0。\(\int_1^{\infty}\lambda y^{-(\lambda+1)}dy=1\) 成立。这是帕累托(Pareto)型的幂律分布——对指数变量再取指数,"轻尾"被改造成"重尾"。