第 5 章 · 连续型随机变量

5.5 指数随机变量

The Exponential Random Variable
学习目标
  • 写出指数分布的密度函数、分布函数与生存函数,并说明速率参数 \(\lambda\) 的含义与量纲;
  • 用分部积分完整推导 \(E[X]=1/\lambda\) 与 \(\mathrm{Var}(X)=1/\lambda^2\);
  • 叙述并证明无记忆性,用它解释"旧器件与新器件一样可靠"的寿命悖论;
  • 由均值或半衰期反求 \(\lambda\),计算中位数 \(\ln 2/\lambda\) 与指定的概率;
  • 说明指数分布与几何分布的类比,以及它作为"到达间隔模型"在排队论中的角色。

1. 定义:密度、分布函数与生存函数

均匀分布刻画"等可能落入区间",正态分布刻画"大量微小因素叠加形成的误差",而本节的主角——指数随机变量(exponential random variable)——刻画的是另一类极常见的现象:等待。一只灯泡还能点多久、下一次电话何时响起、一个放射性原子何时衰变、服务器下一次请求何时到达——它们都是"直到某事件首次发生所经历的时间"。这类"寿命"或"间隔"最自然的模型就是指数分布。它与 4.7 节的泊松分布是一对孪生兄弟:单位时间内事件的计数服从泊松分布,相邻两次事件的间隔则服从指数分布。

定义 1 指数随机变量

\[ f(x)=\begin{cases}\lambda e^{-\lambda x}, & x\ge 0,\\[2pt] 0, & x<0,\end{cases}\qquad \lambda>0, \] 若连续型随机变量 \(X\) 具有上述密度,则称 \(X\) 服从参数为 \(\lambda\) 的指数分布,记作 \(X\sim \mathrm{Exp}(\lambda)\)。\(\lambda\) 称为速率参数(rate parameter),量纲为"1/时间",表示事件发生的平均频繁程度。

密度显然非负;规范性由 \(\int_0^\infty \lambda e^{-\lambda x}\,dx=\bigl[-e^{-\lambda x}\bigr]_0^\infty=1\) 保证。密度在 \(x=0\) 处取最大值 \(\lambda\),之后单调下降、以横轴为渐近线:等待"立刻发生"最有可能,等待越久越罕见,但任何长的等待都有正概率。

对 \(x\ge 0\),积分密度即得分布函数(cumulative distribution function):

\[ F(x)=P(X\le x)=\int_0^x \lambda e^{-\lambda t}\,dt=1-e^{-\lambda x},\qquad x\ge 0 \]

取补即得本节反复使用的生存函数(survival function):

\[ S(x)=P(X>x)=e^{-\lambda x},\qquad x\ge 0. \]

可靠性工程喜欢这个名字:\(S(x)\) 就是"寿命超过 \(x\)"的概率。指数分布的生存函数简洁到只需一次求幂,这使它成为寿命建模的第一站。

密度 f(x) = e−x(λ = 1) 0 1 2 3 4 5 x 1 0.5 0 f(x) 阴影面积 = P(X ≤ 1) ≈ 0.632 生存函数 S(x) = P(X > x) = e−x 0 1 2 3 4 5 x 1 0.5 0 S(x) e−1 ≈ 0.368 阴影面积 = P(X > 1) ≈ 0.368
图 1:指数分布(\(\lambda=1\))的密度(左)与生存函数(右)。左图阴影面积 \(P(X\le 1)=1-e^{-1}\approx 0.632\),右图阴影面积 \(P(X>1)=e^{-1}\approx 0.368\),两块面积互补;生存曲线在 \(x\) 处的"高度"本身就是概率 \(P(X>x)\)。
注记 参数 \(\lambda\) 的读法与时间尺度

"\(\lambda=0.1\)/年"可以读成两句话:事件平均以每秒年 \(0.1\) 次的速率发生;平均等待 \(1/\lambda=10\) 年。\(\lambda\) 只负责设定时间单位——若 \(X\sim\mathrm{Exp}(\lambda)\),则 \(Y=\lambda X\sim\mathrm{Exp}(1)\),因为 \(P(\lambda X>t)=P(X>t/\lambda)=e^{-\lambda\cdot t/\lambda}=e^{-t}\)。换算时间单位(年→月)时 \(\lambda\) 与 \(1/\lambda\) 同步换算即可。

2. 期望与方差

5.2 节,连续型随机变量的期望是积分 \(E[X]=\int x f(x)\,dx\)。指数分布的这两条积分值得亲手完整算一遍——分部积分与"指数衰减快于多项式增长"这一极限事实是全部技巧所在。

定理 1 指数分布的期望与方差

\[ X\sim\mathrm{Exp}(\lambda)\quad\Longrightarrow\quad E[X]=\frac{1}{\lambda},\qquad \mathrm{Var}(X)=\frac{1}{\lambda^2}. \]

证明先算 \(E[X]\)。取 \(u=x\),\(dv=\lambda e^{-\lambda x}dx\),则 \(v=-e^{-\lambda x}\),分部积分得 \[ E[X]=\int_0^\infty x\,\lambda e^{-\lambda x}\,dx=\bigl[-x e^{-\lambda x}\bigr]_0^\infty+\int_0^\infty e^{-\lambda x}\,dx=0+\frac{1}{\lambda}=\frac{1}{\lambda}, \] 其中 \(\bigl[-x e^{-\lambda x}\bigr]_0^\infty=0\) 用到 \(\lim_{x\to\infty}x e^{-\lambda x}=0\)(指数衰减压倒多项式增长)。再算 \(E[X^2]\),仍用分部积分: \[ E[X^2]=\int_0^\infty x^2\lambda e^{-\lambda x}\,dx=\bigl[-x^2 e^{-\lambda x}\bigr]_0^\infty+2\int_0^\infty x e^{-\lambda x}\,dx. \] 由上一步 \(\int_0^\infty x\,\lambda e^{-\lambda x}dx=1/\lambda\) 知 \(\int_0^\infty x e^{-\lambda x}dx=1/\lambda^2\),故 \(E[X^2]=2/\lambda^2\)。于是 \[ \mathrm{Var}(X)=E[X^2]-\bigl(E[X]\bigr)^2=\frac{2}{\lambda^2}-\frac{1}{\lambda^2}=\frac{1}{\lambda^2}.\quad\blacksquare \]

这个结果简洁得近乎"匀称":均值是 \(1/\lambda\),标准差也是 \(1/\lambda\)(变异系数为 1)。更值得注意的是它的实际含义:

\[ \lambda=\frac{1}{E[X]}. \]

只要知道平均寿命(平均等待时间)这一个数字,整个分布就完全确定了——这是指数分布在应用中如此便利、也如此危险的原因:它把"磨损、老化"等一切细节全部押注在"无记忆"这一假设上。分布明显右偏(长尾向右),中位数小于均值(见第 4 小节),"平均"被少数长寿个体拉高。

3. 无记忆性:指数分布的灵魂

一台已经用了 10 年的机器,和一台全新的机器,哪个更可能再正常工作 5 年?直觉说"新机器",但指数模型给出一个出人意料的回答:两者完全一样。这就是无记忆性(memoryless property),它是指数分布的招牌性质,也是本节的灵魂。

定理 2 无记忆性

\[ X\sim\mathrm{Exp}(\lambda),\ s,t\ge 0\quad\Longrightarrow\quad P(X>s+t \mid X>s)=P(X>t). \]

证明按条件概率的定义与生存函数 \(P(X>x)=e^{-\lambda x}\): \[ P(X>s+t \mid X>s)=\frac{P(X>s+t,\ X>s)}{P(X>s)}=\frac{P(X>s+t)}{P(X>s)}=\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}}=e^{-\lambda t}=P(X>t).\quad\blacksquare \]

要点在于比值 \(\dfrac{e^{-\lambda(s+t)}}{e^{-\lambda s}}\) 中因子 \(e^{-\lambda s}\) 恰好约去:已经存活过的 \(s\) 个单位时间被彻底"遗忘"。把 \(\{X>s\}\) 想成"器件已存活 \(s\)",则剩余寿命 \(X-s\) 在此条件下的分布仍是 \(\mathrm{Exp}(\lambda)\)——与新器件毫无差别。

换个角度看,无记忆性等价于失效率恒定。定义年龄 \(t\) 处的失效率(failure rate, 亦称危险率 hazard rate):在已存活到 \(t\) 的条件下,未来一小段时间 \(\Delta t\) 内失效的概率约为 \(r(t)\,\Delta t\)。对指数分布, \[ P(t<X<t+\Delta t \mid X>t)=\frac{e^{-\lambda t}-e^{-\lambda(t+\Delta t)}}{e^{-\lambda t}}=1-e^{-\lambda\Delta t}\approx \lambda\,\Delta t, \] 与当前年龄 \(t\) 无关:失效完全由"随机冲击"造成,器件不会变旧。这就是寿命悖论之所在:说"这台机器平均寿命 10 年",又发现它已正常运转 10 年,人们以为大限将至;模型却说它的期望剩余寿命仍是 10 年。真实器件会磨损老化(失效率上升),指数假设只在"失效由偶然事故主导"的场景(电子元件的随机击穿、意外断电、事故性破损)中近似成立;刻画老化的常用模型是 5.6 节的 Weibull 分布(\(\beta>1\) 时失效率递增)。

0 1 2 3 4 5 6 x 1 0.5 0 f s = 2 整体向右平移 s = 2 f(x) f(x | X > s) 原密度 f(x) 条件密度 f(x)/P(X > s) 两条曲线形状完全相同:旧器件的剩余寿命 X − s 仍服从 Exp(λ)
图 2:无记忆性的几何图示(\(\lambda=1\),\(s=2\))。在 \(x=s\) 处截断后,把条件密度 \(f(x\mid X>s)=f(x)/P(X>s)\) 除以存活概率 \(e^{-\lambda s}\) 重新归一化,所得红色虚线恰是原密度曲线向右平移 \(s\) 个单位的形状(红色箭头)。"旧器件的剩余寿命分布 = 新器件的寿命分布"。
例 1 机器的寿命(无记忆性演示)

设某机器的寿命 \(X\)(年)服从指数分布,平均寿命为 10 年。(a) 求机器寿命超过 15 年的概率;(b) 已知机器已正常工作 10 年,求它再正常工作 15 年(即寿命超过 25 年)的概率;(c) 已知机器已正常工作 10 年,求它再正常工作 5 年的概率。

平均寿命 \(E[X]=10\),故 \(\lambda=1/E[X]=0.1\)(每年)。(a) 生存函数给出 \[ P(X>15)=e^{-0.1\times 15}=e^{-1.5}\approx 0.223. \] (b) 由无记忆性(定理 2,取 \(s=10,\ t=15\)): \[ P(X>25 \mid X>10)=P(X>15)=e^{-1.5}\approx 0.223, \] 与一台全新机器工作 15 年的概率分毫不差——用了 10 年丝毫没有"变旧"。(c) 同理 \(P(X>15\mid X>10)=P(X>5)=e^{-0.5}\approx 0.607\):旧机器再干 5 年的概率等于新机器干 5 年的概率。顺带一提,中位寿命为 \(10\ln 2\approx 6.93\) 年:一半的机器其实撑不到 7 年,"平均 10 年"是右偏长尾拉出来的。
注记 与几何分布的类比

第 4 章的几何随机变量(geometric random variable)——"直到首次成功的试验次数"——也满足完全相同形式的无记忆性:\(P(X>m+n\mid X>m)=P(X>n)\)。把时间轴切成等长的小格,每格内"事件是否发生"近似独立,首次发生所在的格序号就是几何变量;网格无限加细,几何分布的极限正是指数分布。事实上,在连续分布中,指数分布是唯一具有无记忆性的:无记忆性迫使生存函数满足 \(S(s+t)=S(s)S(t)\),配合连续性只能解出 \(S(x)=e^{-\lambda x}\)(离散情形的唯一解则是几何分布)。

表 1:几何分布与指数分布——同一"无记忆"性格的离散与连续版本
比较项几何随机变量(离散)指数随机变量(连续)
典型背景直到首次成功的试验次数直到首次事件的等待时间
取值范围\(1,2,3,\dots\)\([0,\infty)\)
分布列 / 密度\(p(1-p)^{n-1}\)\(\lambda e^{-\lambda x}\)
无记忆性\(P(X>m+n\mid X>m)=P(X>n)\)\(P(X>s+t\mid X>s)=P(X>t)\)
期望\(1/p\)\(1/\lambda\)
唯一性离散情形唯一无记忆分布连续情形唯一无记忆分布

4. 中位数、半衰期与百分位数

分布右偏使"半数个体死在什么时候"(中位数(median))比均值更贴近日常直觉。令 \(F(m)=1/2\):

\[ 1-e^{-\lambda m}=\frac12 \;\Longrightarrow\; e^{-\lambda m}=\frac12 \;\Longrightarrow\; m=\frac{\ln 2}{\lambda}\approx\frac{0.693}{\lambda}. \]

在放射性物理里,这个中位数有专名——半衰期(half-life):经过一个半衰期,未衰变原子恰好剩下一半;经过 \(k\) 个半衰期剩 \(2^{-k}\)。一般地,\(p\) 分位百分位数(percentile) \(x_p\) 由 \(F(x_p)=p\) 解得:

\[ x_p=-\frac{\ln(1-p)}{\lambda}. \]

例 2 放射性衰变与半衰期

某放射性同位素的半衰期为 5 年。(a) 求衰变时间分布的参数 \(\lambda\);(b) 求一个原子在 12 年内衰变的概率;(c) 求平均衰变时间,并与半衰期比较。

(a) 半衰期即中位数:\(\lambda=\ln 2/5\approx 0.1386\)(每年)。(b) 12 年恰好是 \(12/5=2.4\) 个半衰期,于是 \[ P(X\le 12)=1-e^{-12\lambda}=1-e^{-(12/5)\ln 2}=1-2^{-2.4}\approx 1-0.189=0.81, \] 其中 \(2^{-2.4}=e^{-2.4\ln 2}=e^{-1.664}\approx 0.189\)——每过一个半衰期存活概率减半,2.4 个半衰期后只剩 \(2^{-2.4}\)。(c) 平均衰变时间为 \(1/\lambda=5/\ln 2\approx 7.21\) 年,大于半衰期 5 年:长尾上的"长寿原子"把均值拉高。这正是右偏分布的典型特征。无记忆性在此有一个物理上颇为戏剧化的推论:一个已经存在了一万年的原子,未来 5 年内衰变的概率仍然是 \(1/2\)——原子不会变旧。

5. 应用一瞥:排队系统中的到达间隔

排队论(queueing theory)是指数分布最重要的舞台。顾客到达银行、电话呼叫抵达交换机、数据包到达路由器——如果事件"完全随机"地发生(即严格地说,事件按泊松过程(Poisson process)发生,与 4.7 节的泊松计数遥相呼应),则相邻两次到达的间隔独立同分布,且服从指数分布。"完全随机"翻译成模型语言正是无记忆性:刚刚多久没人来,不影响下一个客人还要多久才来。此外,5.3 节的练习已经给出模拟中的标准生成方法:若 \(U\sim U(0,1)\),则 \(-\ln U/\lambda\sim\mathrm{Exp}(\lambda)\)。

例 3 柜台前的到达间隔

设顾客到达某柜台的间隔时间 \(X\)(分钟)服从指数分布,平均间隔 5 分钟。(a) 求下一次间隔小于 2 分钟的概率;(b) 求间隔超过 10 分钟的概率;(c) 已知刚过去的 3 分钟无人到达,求未来 2 分钟内有人到达的概率。

平均间隔 \(E[X]=5\),故 \(\lambda=1/5=0.2\)(每分钟)。(a) \[ P(X<2)=1-e^{-0.2\times 2}=1-e^{-0.4}\approx 0.33. \] (b) \(P(X>10)=e^{-0.2\times 10}=e^{-2}\approx 0.135\)。(c) 由无记忆性,已等待的 3 分钟被彻底遗忘: \[ P(X<5 \mid X>3)=P(X<2)=1-e^{-0.4}\approx 0.33, \] 与 (a) 完全相同。"已经等了 3 分钟,所以下一个客人该到了"的感觉只是心理安慰——指数模型下等待从不"累积进度"。

最后预告一个练习中将证明、且在可靠性分析中极为有用的事实:两个独立的指数随机变量 \(X\sim\mathrm{Exp}(\lambda_1)\) 与 \(Y\sim\mathrm{Exp}(\lambda_2)\),其最小值 \(\min(X,Y)\sim\mathrm{Exp}(\lambda_1+\lambda_2)\)——速率相加。把 \(X,Y\) 想成串联系统中两个元件的寿命,先坏的那个决定系统寿命,系统失效率正是两元件失效率之和(独立随机变量的概率计算将在第 6 章系统展开)。

6. 本节小结

要点回顾
  • 密度 \(f(x)=\lambda e^{-\lambda x}\)(\(x\ge 0\)),分布函数 \(F(x)=1-e^{-\lambda x}\),生存函数 \(P(X>x)=e^{-\lambda x}\);\(\lambda\) 是速率,量纲 1/时间。
  • \(E[X]=1/\lambda\),\(\mathrm{Var}(X)=1/\lambda^2\)(分部积分完整推导);\(\lambda=1/E[X]\):一个数字定出整个分布。
  • 无记忆性 \(P(X>s+t\mid X>s)=P(X>t)\):已存活的时间被完全遗忘,旧器件与新器件一样可靠——"寿命悖论";等价于失效率恒为 \(\lambda\)。
  • 指数分布是连续情形唯一无记忆的分布,是几何分布(离散、唯一无记忆)的连续版本。
  • 中位数 \(m=\ln 2/\lambda\) 即半衰期;\(k\) 个半衰期后存活概率 \(2^{-k}\);\(p\) 分位数 \(x_p=-\ln(1-p)/\lambda\)。
  • 应用:泊松型到达的间隔模型(排队论);独立指数变量之最小值仍为指数分布,速率相加。

练习

练习 5-5-1

设 \(X\sim\mathrm{Exp}(\lambda)\),已知 \(P(X>10)=e^{-2}\)。求 \(\lambda\)、\(E[X]\)、标准差,以及 \(P(X>30\mid X>10)\)。

答案与提示

由 \(e^{-10\lambda}=e^{-2}\) 得 \(\lambda=0.2\);\(E[X]=1/\lambda=5\),标准差也是 \(5\)(指数分布变异系数恒为 1)。由无记忆性 \(P(X>30\mid X>10)=P(X>20)=e^{-0.2\times 20}=e^{-4}\approx 0.0183\)。

练习 5-5-2

(串联系统)系统由两个独立元件串联而成,元件寿命 \(X\sim\mathrm{Exp}(0.02)\)、\(Y\sim\mathrm{Exp}(0.03)\)(单位:小时),系统寿命 \(T=\min(X,Y)\)。证明 \(T\sim\mathrm{Exp}(0.05)\),并求 \(P(T>20)\) 与 \(E[T]\)。

答案与提示

由独立性,\(P(T>t)=P(X>t,\,Y>t)=P(X>t)\,P(Y>t)=e^{-0.02t}\,e^{-0.03t}=e^{-0.05t}\),故 \(T\sim\mathrm{Exp}(0.02+0.03)\)。于是 \(P(T>20)=e^{-1}\approx 0.368\),\(E[T]=1/0.05=20\) 小时。一般地,独立 \(\mathrm{Exp}(\lambda_i)\) 的最小值服从 \(\mathrm{Exp}\bigl(\sum_i\lambda_i\bigr)\):串联系统的失效率是各元件失效率之和。

练习 5-5-3

某芯片寿命 \(X\sim\mathrm{Exp}(\lambda)\),已知它工作满 3 年的概率为 \(e^{-0.75}\)。求 \(\lambda\)、平均寿命、中位数、\(P(X<1)\) 以及 90% 分位数。

答案与提示

\(e^{-3\lambda}=e^{-0.75}\) 给出 \(\lambda=0.25\)(每年),平均寿命 \(4\) 年;中位数 \(m=\ln 2/0.25=4\ln 2\approx 2.77\) 年;\(P(X<1)=1-e^{-0.25}\approx 0.221\);90% 分位数 \(x_{0.9}=-\ln(0.1)/0.25=4\ln 10\approx 9.21\) 年——是均值的两倍多,再次体现长尾。

练习 5-5-4

(讨论)人类寿命为什么不满足无记忆性?请用失效率的概念说明,并指出指数分布在哪类场景下仍是合理近似。

答案与提示

无记忆性等价于失效率恒定,而人类死亡率随年龄剧烈变化:婴儿期较高、青壮年低而平稳、老年阶段快速上升(人口学中的冈珀茨增长律)。若人类寿命真无记忆,一位 90 岁老人的剩余寿命分布应与新生儿相同、平均还能再活约七八十年,显然荒谬。指数分布适合"随机冲击主导"的失效(事故、雷击、随机击穿),或仅在某个失效率近似平稳的局部年龄段(如青壮年期)作粗略近似;刻画老化应选用失效率递增的模型,如 5.6 节的 Weibull 分布(\(\beta>1\))。