第 5 章 · 连续型随机变量

5.3 均匀随机变量

The Uniform Random Variable
学习目标
  • 写出区间 \((a,b)\) 上均匀分布的密度函数与分布函数,并说明密度高度 \(1/(b-a)\) 的来历;
  • 证明"等长区间上的概率相等",并用区间长度直接计算 \(P(c \lt X \lt d)\);
  • 推导 \(E[X]=(a+b)/2\) 与 \(\mathrm{Var}(X)=(b-a)^2/12\);
  • 用均匀分布建模等待时间与舍入误差等实际问题,并求其分位数与中位数;
  • 说明逆变换法 \(X=F^{-1}(U)\) 如何由 \(U(0,1)\) 生成任意连续分布。

1. 均匀分布的定义

第 4 章里,掷一颗均匀骰子把概率 \(1/6\) 平均分给六个点数,那是"离散等可能"的原型。连续情形下的"完全等可能"是什么意思?由于连续型随机变量取任何单点的概率都是 \(0\)(5.1 节),"等可能"只能理解为:落在任何等长区间内的概率相同。满足这一点的最简单密度,是一条水平线段——这正是"均匀"(uniform)一词的由来。

定义 1 均匀随机变量

若随机变量 \(X\) 的概率密度函数(probability density function)为 \[ f(x)=\begin{cases}\dfrac{1}{b-a}, & a \lt x \lt b,\\[2pt] 0, & \text{其他},\end{cases}\] 其中 \(-\infty \lt a \lt b \lt \infty\),则称 \(X\) 为区间 \((a,b)\) 上的均匀随机变量(uniform random variable),记作 \(X \sim U(a,b)\)。

密度的高度不是随意选取的:规范性 \(\int_{-\infty}^{\infty} f(x)\,dx=1\) 要求底为 \(b-a\)、高为 \(1/(b-a)\) 的矩形面积恰为 \(1\)。注意当 \(b-a \lt 1\) 时高度会大于 \(1\)——这再次印证 5.1 节的提醒:密度不是概率,它可以超过 \(1\)。

由 \(F(x)=\int_{-\infty}^{x} f(t)\,dt\) 立即得到分布函数(cumulative distribution function):在 \(x \lt a\) 时累积面积为 \(0\),在 \(a \le x \lt b\) 时等于宽为 \(x-a\) 的矩形面积,超过 \(b\) 后为 \(1\): \[ F(x)=\begin{cases} 0, & x \lt a,\\[2pt] \dfrac{x-a}{b-a}, & a \le x \lt b,\\[2pt] 1, & x \ge b.\end{cases} \] 它在 \([a,b]\) 上以恒定斜率 \(1/(b-a)\) 线性上升——密度均匀,累积自然匀速。

密度函数 f(x) f(x) = 1/(b−a),a < x < b P(c < X < d) = (d−c)/(b−a) a c d b 1/(b−a) 0 f 分布函数 F(x) F(x) = (x−a)/(b−a) a c d b 1 0 0.3 0.7 F
图 1:均匀分布 \(U(a,b)\) 的密度(左)与分布函数(右)。密度是高为 \(1/(b-a)\) 的矩形,\(X\) 落入 \((c,d)\) 的概率等于其上方阴影面积 \((d-c)/(b-a)\);\(F(x)\) 在 \([a,b]\) 上从 \(0\) 线性升到 \(1\)(虚线演示 \(c\)、\(d\) 两处的取值)。

2. 等长区间,等概率

均匀分布的概率计算有一个极简的规则:概率就是区间长度除以全长

定理 1 区间概率只依赖长度

设 \(X \sim U(a,b)\),则对任何 \(a \le c \lt d \le b\), \[ P(c \lt X \lt d)=\int_c^d \frac{1}{b-a}\,dx=\frac{d-c}{b-a}. \] 特别地,\((a,b)\) 内长度相等的区间有相等的概率

证明在 \((a,b)\) 上密度恒为 \(1/(b-a)\),故积分就是底为 \(d-c\)、高为 \(1/(b-a)\) 的矩形面积: \[ P(c \lt X \lt d)=\frac{1}{b-a}\int_c^d dx=\frac{d-c}{b-a}, \] 它只含区间的长度 \(d-c\),与区间的位置无关,结论得证。

反过来也可以证明:若某连续分布落入区间的概率只依赖区间长度,则它必是均匀分布(思考题)。因此"均匀"就是连续世界里"等可能"(equally likely)的精确化身——正如骰子之于离散情形。这一性质使均匀分布成为几何概率的天然模型:概率化为长度之比,不再需要积分。

例 1 区间概率的计算

设 \(X \sim U(0,10)\)。求 (a) \(P(3 \lt X \lt 7)\);(b) \(P(X \gt 8)\)。

密度在 \((0,10)\) 上恒为 \(1/10\),用定理 1 直接按长度计算。 (a) \(P(3 \lt X \lt 7)=\dfrac{7-3}{10}=\dfrac{4}{10}=0.4\)。 (b) 区间 \((8,10)\) 的长度为 \(2\),故 \(P(X \gt 8)=\dfrac{10-8}{10}=0.2\);也可用分布函数 \(F(8)=\dfrac{8-0}{10}=0.8\),得 \(P(X \gt 8)=1-F(8)=0.2\)。

3. 期望与方差

均匀分布的期望与方差公式形式简洁,且都能用初等积分完整算出。这一推导同时是 5.2 节连续型期望定义的最好练习。

定理 2 均匀分布的期望与方差

设 \(X \sim U(a,b)\),则 \[ E[X]=\frac{a+b}{2}, \qquad \mathrm{Var}(X)=\frac{(b-a)^2}{12}, \qquad \sigma_X=\frac{b-a}{\sqrt{12}}\approx 0.289\,(b-a). \]

证明先算期望: \[ E[X]=\int_a^b \frac{x}{b-a}\,dx=\frac{1}{b-a}\cdot\frac{x^2}{2}\Big|_a^b=\frac{b^2-a^2}{2(b-a)}=\frac{(b-a)(a+b)}{2(b-a)}=\frac{a+b}{2}. \] 再算二阶矩(利用 \(b^3-a^3=(b-a)(a^2+ab+b^2)\)): \[ E[X^2]=\int_a^b \frac{x^2}{b-a}\,dx=\frac{1}{b-a}\cdot\frac{x^3}{3}\Big|_a^b=\frac{b^3-a^3}{3(b-a)}=\frac{a^2+ab+b^2}{3}. \] 最后由 \(\mathrm{Var}(X)=E[X^2]-\mu^2\)(\(\mu=E[X]\)): \[ \mathrm{Var}(X)=\frac{a^2+ab+b^2}{3}-\frac{(a+b)^2}{4}=\frac{4a^2+4ab+4b^2-3a^2-6ab-3b^2}{12}=\frac{a^2-2ab+b^2}{12}=\frac{(b-a)^2}{12}. \] 开方即得标准差。

期望恰是区间的中点:这与 5.2 节"对称密度的期望等于对称中心"的结论一致——均匀密度关于 \(x=(a+b)/2\) 对称。5.2 节例 1 算过的 \(U(0,1)\)(\(E=1/2\),\(\mathrm{Var}=1/12\))正是本定理取 \(a=0,\ b=1\) 的特例。注意标准差约为区间全长的 \(0.289\) 倍:即使取值"最分散"的均匀变量,其典型偏离也不到半区间的一半。

表 1:几个常用均匀分布的期望、方差与标准差
分布\(E[X]\)\(\mathrm{Var}(X)\)\(\sigma_X\)
\(U(0,1)\)\(1/2\)\(1/12\)\(\approx 0.289\)
\(U(0,15)\)\(7.5\)\(18.75\)\(\approx 4.33\)
\(U(-0.5,\,0.5)\)\(0\)\(1/12\)\(\approx 0.289\)

4. 应用一:等待时间与舍入误差

均匀分布最适合刻画"发生在整段时间内、毫无规律可循"的量。最经典的两类模型是等待时间舍入误差

例 2 公交等待时间

某路公交每 15 分钟整点发一班。一位对班次表一无所知的乘客在任意时刻"随机"到达车站。求他等车超过 10 分钟的概率与平均等待时间。

把乘客到达时刻所在的那个班次间隔平移为 \((0,15)\),记到达时刻为 \(T\)。"随机到达、对班次无偏好"意味着 \(T\) 在 \((0,15)\) 上等可能取值,即 \(T \sim U(0,15)\)。等待时间为下一班时刻减去到达时刻:\(X=15-T\)。 等待超过 10 分钟等价于\(X \gt 10\),即 \(T \lt 5\),故 \[ P(X \gt 10)=P(T \lt 5)=\frac{5-0}{15}=\frac{1}{3}\approx 0.333. \] 又 \(X=15-T\) 是 \(T\) 的线性变换,故仍服从 \(U(0,15)\)(见 5.2 节 \(aX+b\) 的性质,或由 \(F_X(x)=P(T \lt 15-x)\) 直接验证)。由定理 2, \[ E[X]=\frac{0+15}{2}=7.5 \ \text{分钟}, \qquad \mathrm{Var}(X)=\frac{15^2}{12}=18.75, \qquad \sigma_X\approx 4.33 \ \text{分钟}. \] 平均要等 7.5 分钟——恰好是间隔的一半,这与直觉相符。
每 15 分钟一班的公交与随机到达的乘客 等待 X = 8 分钟 班车发车时刻 8:00 8:15 8:30 8:45 乘客到达(8:22) 8:15 8:20 8:30 1/15 等待 > 10 分钟 ⇔ 到达在 8:15–8:20 到达时刻在班次间隔内均匀 ⇒ 等待时间 X = 下一班时刻 − 到达时刻 ~ U(0, 15)
图 2:公交等待时间模型(横轴每分钟 12 像素,按真实比例绘制)。上:时间线与 8:22 到达的乘客,金色段为其 8 分钟等待区间;下:到达时刻在班次间隔 \((8{:}15,\,8{:}30)\) 内均匀分布,只有落在 8:15–8:20(阴影,长 5 分钟)才会等待超过 10 分钟,故 \(P(X \gt 10)=5/15=1/3\)。
注记 舍入误差也服从均匀分布

把测量值四舍五入到最接近的整数时,真值的小数部分被视为"毫无偏向",于是舍入误差(rounding error)通常建模为 \(U(-0.5,\,0.5)\):期望为 \(0\)(无系统偏差),方差为 \(1/12\),标准差约 \(0.289\)。这给数值计算中"每步舍入至多半个百分点、典型偏差约 \(0.29\)"以定量刻画;在误差传播分析与某些统计推断中,\(\mathrm{Var}=1/12\) 这一常数会反复出现。

5. 分位数与中位数

分布函数线性意味着均匀分布的分位数(quantile)可以"按比例"直接读出。

定义 2 p 分位数与中位数

设 \(X\) 的分布函数 \(F\) 连续且严格递增。对 \(0 \lt p \lt 1\),称满足 \(F(x_p)=p\) 的点 \(x_p\) 为 \(X\) 的 \(p\) 分位数(即 \(100p\) 百分位数, percentile);\(p=1/2\) 时的分位数称为中位数(median),记作 \(m\)。

例 3 均匀分布的中位数与分位数

设 \(X \sim U(a,b)\),求其中位数 \(m\) 与一般的 \(p\) 分位数 \(x_p\),并算出 \(U(0,10)\) 的中位数与上下四分位数。

在 \([a,b]\) 上 \(F(x)=\dfrac{x-a}{b-a}\),令其等于 \(p\) 解出即可: \[ F(x_p)=p \iff \frac{x_p-a}{b-a}=p \iff x_p=a+p\,(b-a). \] 取 \(p=1/2\) 得中位数 \[ m=a+\frac{1}{2}(b-a)=\frac{a+b}{2}, \] 恰为区间中点——与对称性一致(对称分布的中位数与期望重合)。对 \(U(0,10)\):中位数 \(m=5\),下四分位数 \(x_{0.25}=0+0.25\times 10=2.5\),上四分位数 \(x_{0.75}=7.5\),第 90 百分位数 \(x_{0.9}=9\)。分位数把区间等分的事实,再次体现"均匀"的本义。

6. 逆变换法:从均匀走向一切分布

均匀分布还有一重特殊身份:它是随机模拟的起点。计算机的随机数发生器直接产生的既不是正态也不是指数样本,而是近似服从 \(U(0,1)\) 的伪随机数(pseudorandom numbers)。有了 \(U(0,1)\),其余的连续分布都可以按下述定理"加工"出来。

定理 3 逆变换法

设 \(F\) 是某连续型分布的分布函数且在其承载区间上严格递增,\(U \sim U(0,1)\)。令 \[ X = F^{-1}(U), \] 其中 \(F^{-1}\) 是 \(F\) 的反函数(\(F^{-1}(u)=x \iff F(x)=u\))。则 \(X\) 的分布函数恰为 \(F\)。

证明对任意实数 \(x\),由 \(F\) 严格递增知 \(F^{-1}\) 也严格递增,于是不等式 \(F^{-1}(U) \le x\) 与 \(U \le F(x)\) 等价。而 \(U \sim U(0,1)\) 的分布函数为 \(P(U \le u)=u\)(\(0 \le u \le 1\)),故 \[ P(X \le x)=P\bigl(F^{-1}(U) \le x\bigr)=P\bigl(U \le F(x)\bigr)=F(x). \] 即 \(X\) 的分布函数就是 \(F\)。

例如 5.5 节的指数分布 \(F(x)=1-\mathrm{e}^{-\lambda x}\)(\(x \ge 0\)),其反函数为 \(F^{-1}(u)=-\ln(1-u)/\lambda\),于是 \(-\ln(1-U)/\lambda\) 就是指数样本——完整推导见本节练习 3。更一般的"随机变量函数的分布"理论将在 5.7 节展开,其练习恰好从 \(U(0,1)\) 出发构造指数变量,与本节首尾呼应。

注记 为什么均匀分布如此重要

其一,它描述"完全无信息"的量——不知道任何偏好时,等待时刻、舍入误差、未知相位都先用均匀分布兜底;其二,蒙特卡洛方法(8.4 节)以 \(U(0,1)\) 为唯一的随机源;其三,逆变换法把"生成任意分布"归约为"生成均匀分布"。正因如此,均匀分布虽形状最简单,却是模拟链条中最上游的一环。

7. 本节小结

要点回顾
  • \(X \sim U(a,b)\):密度 \(f(x)=\dfrac{1}{b-a}\)(\(a \lt x \lt b\)),分布函数 \(F(x)=\dfrac{x-a}{b-a}\) 在 \([a,b]\) 上线性。
  • 概率只依赖区间长度:\(P(c \lt X \lt d)=\dfrac{d-c}{b-a}\),等长区间等概率——连续世界的"等可能"。
  • \(E[X]=\dfrac{a+b}{2}\)(区间中点),\(\mathrm{Var}(X)=\dfrac{(b-a)^2}{12}\),\(\sigma=\dfrac{b-a}{\sqrt{12}}\approx 0.289(b-a)\)。
  • 典型应用:公交等待时间 \(U(0,15)\)(\(P(X \gt 10)=1/3\),\(E=7.5\))与舍入误差 \(U(-0.5,0.5)\)。
  • \(p\) 分位数 \(x_p=a+p(b-a)\),中位数 \(m=\dfrac{a+b}{2}\)。
  • 逆变换法 \(X=F^{-1}(U)\):由 \(U(0,1)\) 可生成任何连续分布——均匀分布是随机模拟的原材料(详见 5.7 节)。

练习

练习 5-3-1

设 \(X \sim U(a,b)\),\(\mu=E[X]\),\(\sigma=\sqrt{\mathrm{Var}(X)}\)。计算 \(P(|X-\mu| \lt \sigma)\)。

答案与提示

由定理 2,\(\mu=\dfrac{a+b}{2}\),\(\sigma=\dfrac{b-a}{\sqrt{12}}\approx 0.289\,(b-a)\)。由于 \(\sigma \lt \dfrac{b-a}{2}\),区间 \((\mu-\sigma,\ \mu+\sigma)\) 完全落在 \((a,b)\) 内,故按长度计算: \[ P(|X-\mu| \lt \sigma)=P(\mu-\sigma \lt X \lt \mu+\sigma)=\frac{2\sigma}{b-a}=\frac{2}{\sqrt{12}}=\frac{1}{\sqrt{3}}\approx 0.577. \] 即约 \(57.7\%\)——低于正态分布一倍标准差内的约 \(68\%\)(5.4 节),因为均匀分布把质量摊平而没有向中心集中。

练习 5-3-2

设 \(X \sim U(2,10)\)。求中位数 \(m\)、上下四分位数与第 90 百分位数。

答案与提示

用 \(x_p=a+p(b-a)=2+8p\):中位数 \(x_{0.5}=6\),下四分位数 \(x_{0.25}=4\),上四分位数 \(x_{0.75}=8\),第 90 百分位数 \(x_{0.9}=2+0.9\times 8=9.2\)。

练习 5-3-3

逆变换法生成指数变量:设 \(U \sim U(0,1)\),令 \(X=-\dfrac{1}{\lambda}\ln U\)(\(\lambda \gt 0\))。证明 \(X\) 服从参数为 \(\lambda\) 的指数分布,并说明用 \(1-U\) 代替 \(U\) 同样可行。

答案与提示

对 \(x \ge 0\), \[ F_X(x)=P(X \le x)=P\Bigl(-\frac{\ln U}{\lambda} \le x\Bigr)=P\bigl(\ln U \ge -\lambda x\bigr)=P\bigl(U \ge \mathrm{e}^{-\lambda x}\bigr)=1-\mathrm{e}^{-\lambda x}, \] 求导得密度 \(f_X(x)=\lambda\mathrm{e}^{-\lambda x}\)(\(x \ge 0\)),此即 \(\mathrm{Exp}(\lambda)\)(5.5 节);\(x \lt 0\) 时 \(F_X(x)=0\)。又因 \(1-U\) 与 \(U\) 同服从 \(U(0,1)\),故 \(X=-\dfrac{1}{\lambda}\ln(1-U)\) 亦可。这正是计算机生成指数随机数的标准算法,也与 5.7 节"由 \(U(0,1)\) 构造 \(Y=-\ln X\)"的练习相互印证。

练习 5-3-4

把测量值(单位:毫米)四舍五入到最接近的整数,设舍入误差 \(X \sim U(-0.5,\,0.5)\)。求 \(P(|X| \lt 0.2)\) 与 \(X\) 的标准差。

答案与提示

\(P(|X| \lt 0.2)=\dfrac{0.2-(-0.2)}{0.5-(-0.5)}=\dfrac{0.4}{1}=0.4\);\(\mathrm{Var}(X)=\dfrac{1^2}{12}=\dfrac{1}{12}\approx 0.083\),标准差 \(\sigma=\dfrac{1}{\sqrt{12}}\approx 0.289\) 毫米。