第 4 章 · 随机变量

4.7 泊松随机变量

The Poisson Random Variable
学习目标
  • 写出泊松分布(Poisson distribution)的分布列,并利用 \(e^x\) 的泰勒级数证明其规范性;
  • 推导二项分布的泊松极限(\(n\to\infty\)、\(np\to\lambda\)、固定 \(k\) 展开),并说出经验使用条件 \(n\ge 100\)、\(np\le 10\);
  • 陈述泊松过程的两个机理假设与强度 \(\lambda\) 的可加性,并举出稀有事件计数的典型场景;
  • 用相邻项之比 \(p(k)/p(k-1)=\lambda/k\) 证明最大概率点为 \(k=\lfloor\lambda\rfloor\);
  • 借助 \(E[X(X-1)]=\lambda^2\) 的技巧证明 \(E[X]=\mathrm{Var}(X)=\lambda\),并求解错字、呼叫、保险等实际问题。

1. 泊松分布的定义与规范性

4.6 节中,我们用二项分布刻画 \(n\) 重独立重复试验的成功次数。但当 \(n\) 很大时,\(\binom{n}{k}\) 的计算十分繁琐;更重要的是,现实中大量现象天然表现为"大量机会、单独概率极小"的计数问题:一页书上的错字个数、一台电话交换台一分钟内收到的呼叫数、一大块放射性物质一秒钟内的衰变次数、一条长消息在信道中传输的误码数。它们的共同画像是——机会数 \(n\) 巨大、每个机会"出事"的概率 \(p\) 极小,而人们关心的只是总计数。泊松随机变量(Poisson random variable)正是刻画这类现象的模型,它是概率论中最重要的离散分布之一。

定义 1 泊松随机变量

若随机变量 \(X\) 取值为 \(0,1,2,\ldots\),且存在常数 \(\lambda\gt 0\) 使得 \[ P(X=k)=e^{-\lambda}\frac{\lambda^{k}}{k!},\qquad k=0,1,2,\ldots \] 则称 \(X\) 服从参数为 \(\lambda\) 的泊松分布(Poisson distribution),记作 \(X\sim\mathrm{Poisson}(\lambda)\)。

参数 \(\lambda\) 的直观意义是"平均发生的次数"——本节第 4 部分将严格证明 \(E[X]=\mathrm{Var}(X)=\lambda\)。分布列的非负性显然,但由于 \(X\) 取遍全体非负整数,还须验证所有概率之和确实为 \(1\)。

定理 1 规范性

\[ \sum_{k=0}^{\infty} e^{-\lambda}\frac{\lambda^{k}}{k!}=1. \]

证明回忆指数函数的泰勒级数(Taylor series)展开:对一切实数 \(x\), \[ e^{x}=\sum_{k=0}^{\infty}\frac{x^{k}}{k!}=1+x+\frac{x^{2}}{2!}+\frac{x^{3}}{3!}+\cdots \] 以 \(x=\lambda\in(0,\infty)\) 代入,并注意该级数绝对收敛、可逐项乘以常数 \(e^{-\lambda}\),得 \[ \sum_{k=0}^{\infty} e^{-\lambda}\frac{\lambda^{k}}{k!}=e^{-\lambda}\sum_{k=0}^{\infty}\frac{\lambda^{k}}{k!}=e^{-\lambda}\cdot e^{\lambda}=1. \qquad\blacksquare \]

实际计算泊松概率时有一个便利的递推关系:由 \(p(k)=e^{-\lambda}\lambda^k/k!\) 相邻两项相除得 \[ \frac{p(k)}{p(k-1)}=\frac{\lambda}{k},\qquad k\ge 1, \] 于是从 \(p(0)=e^{-\lambda}\) 出发即可依次乘出整张分布列(这一比值也是第 4 部分确定最大概率点的钥匙)。几个常用的数值:\(e^{-1}\approx 0.3679\),\(e^{-2}\approx 0.1353\),\(e^{-3}\approx 0.0498\)。

例 1 一页书上的错字

历史统计表明,某书排版后平均每页出现 \(2\) 个错字,且认为一页上的错字个数 \(X\) 服从参数 \(\lambda=2\) 的泊松分布。求:(a) 随机翻开一页恰好没有错字的概率;(b) 恰有 \(2\) 个错字的概率;(c) 至少有 \(1\) 个错字的概率。

(a) \(P(X=0)=e^{-2}\approx 0.1353\)。
(b) \(P(X=2)=e^{-2}\dfrac{2^{2}}{2!}=2e^{-2}\approx 0.2707\)。注意这是所有 \(k\) 中最大的概率(见第 4 部分定理 3:\(\lfloor 2\rfloor=2\)),即"恰好 2 个错字"比"恰好 0 个错字"更可能发生。
(c) \(P(X\ge 1)=1-P(X=0)=1-e^{-2}\approx 0.8647\)——平均每 8 页中约有 7 页带错字。

2. 来源一:二项分布的泊松极限

泊松分布从何而来?第一个来源是二项分布的极限。设想独立重复试验的次数 \(n\) 越来越多,而单次成功的概率 \(p\) 越来越小,两者的乘积 \(np=\lambda\) 保持不变——"成功"成为越来越稀有的事件,但"成功总数"的平均水平不变。此时二项分布收敛于泊松分布,因此泊松定理又被称为稀有事件定律(law of rare events)。

定理 2 泊松极限定理

设 \(X_n\sim B(n,p_n)\)。若当 \(n\to\infty\) 时 \(np_n\to\lambda\gt 0\)(为叙述方便取 \(p_n=\lambda/n\)),则对每个固定的 \(k=0,1,2,\ldots\), \[ \lim_{n\to\infty}\binom{n}{k}p_n^{k}\left(1-p_n\right)^{n-k}=e^{-\lambda}\frac{\lambda^{k}}{k!}. \] 即 \(n\) 很大、\(p\) 很小、\(np\approx\lambda\) 时,二项概率可用 \(\mathrm{Poisson}(\lambda)\) 近似。

证明固定 \(k\),把 \(p=\lambda/n\) 代入二项概率并展开: \[ \binom{n}{k}\left(\frac{\lambda}{n}\right)^{k}\left(1-\frac{\lambda}{n}\right)^{n-k} =\frac{\lambda^{k}}{k!}\cdot\underbrace{\frac{n(n-1)\cdots(n-k+1)}{n^{k}}}_{\text{因子 (i)}}\cdot\underbrace{\left(1-\frac{\lambda}{n}\right)^{n}}_{\text{因子 (ii)}}\cdot\underbrace{\left(1-\frac{\lambda}{n}\right)^{-k}}_{\text{因子 (iii)}}. \] 令 \(n\to\infty\),逐项考察:因子 (i) 是 \(k\) 个形如 \(\frac{n-j}{n}=1-\frac{j}{n}\)(\(j=0,\ldots,k-1\))的乘积,由于 \(k\) 固定,每个因子都趋于 \(1\);因子 (iii) 中指数 \(-k\) 固定,底数趋于 \(1\),故整体趋于 \(1\);因子 (ii) 由微积分中的重要极限 \(\left(1-\frac{\lambda}{n}\right)^{n}\to e^{-\lambda}\)。三处极限相乘即得 \[ \binom{n}{k}p^{k}(1-p)^{n-k}\longrightarrow\frac{\lambda^{k}}{k!}\,e^{-\lambda}. \qquad\blacksquare \]

这一近似何时"够准"?经验法则(rule of thumb)是:当 \(n\ge 100\) 且 \(np\le 10\)(即 \(p\le 0.1\))时,泊松近似通常已给出千分位级别的精度。它把需要计算组合数 \(\binom{n}{k}\) 的二项概率,化为只需递推 \(p(k+1)=p(k)\cdot\frac{\lambda}{k+1}\) 的泊松概率,在计算工具匮乏的年代这是实实在在的解放。

例 2 B(100, 0.05) 与 Poisson(5) 的对照

设 \(X\sim B(100,\,0.05)\),取 \(\lambda=np=5\),用泊松分布 \(\mathrm{Poisson}(5)\) 近似 \(X\) 的分布。对 \(k=0,1,\ldots,8\) 列出两者的概率并比较近似程度。

二项概率按 \(\binom{100}{k}(0.05)^{k}(0.95)^{100-k}\) 计算;泊松概率从 \(p(0)=e^{-5}\approx 0.0067\) 出发,依次乘 \(\frac{5}{k}\) 递推。结果列于表 1(图 1 画出了 \(k=0,\ldots,13\) 的双色棒图)。两组概率几乎重合,最大绝对误差约 \(0.0046\)(出现在 \(k=5\) 处),绝大部分 \(k\) 处误差不超过 \(0.003\)——\(n=100\)、\(np=5\) 恰在经验法则之内,近似效果相当好。
表 1:二项分布 B(100, 0.05) 与泊松分布 Poisson(5) 的概率对照
\(k\)012345678
\(B(100,0.05)\).0059.0312.0812.1396.1781.1800.1500.1060.0649
\(\mathrm{Poisson}(5)\).0067.0337.0842.1404.1755.1755.1462.1044.0653
绝对误差.0008.0025.0030.0008.0026.0045.0038.0016.0004
0 0.05 0.10 0.15 0.20 0 1 2 3 4 5 6 7 8 9 10 11 12 13 k B(100, 0.05) Poisson(5) P(X = k)
图 1:二项分布 \(B(100,0.05)\)(绛红窄棒)与泊松分布 \(\mathrm{Poisson}(5)\)(深蓝宽棒)的重叠对照(\(k=0,\ldots,13\),高度按真实概率比例绘制)。两条分布几乎重合,仅在众数附近有约 \(0.005\) 的偏差。
例 3 保险赔案(泊松近似二项)

某保险公司承保 \(100\) 张保单,每张保单在一年内出险的概率为 \(0.01\),各保单相互独立。求一年内至少发生 \(3\) 件赔案的概率。

设 \(X\) 为一年内的赔案总数,则 \(X\sim B(100,\,0.01)\)。这里 \(n=100\) 已足够大、\(p=0.01\) 足够小,\(\lambda=np=1\) 在 \(10\) 以内,符合经验法则,用 \(\mathrm{Poisson}(1)\) 近似: \[ P(X\ge 3)=1-\bigl[P(0)+P(1)+P(2)\bigr]=1-e^{-1}\left(1+1+\frac{1}{2!}\right)=1-2.5\,e^{-1}\approx 1-0.9197=0.0803. \] 作为对照,用二项分布精确计算得 \(P(X\ge 3)=1-\bigl[0.99^{100}+100(0.01)(0.99)^{99}+\binom{100}{2}(0.01)^{2}(0.99)^{98}\bigr]\approx 0.0794\),绝对误差不足 \(0.001\)——近似已相当精确,而计算量大幅减少。

3. 来源二:泊松过程

泊松分布的第二个来源完全不借助极限,而是直接从"事件流"的机理假设出发。考虑随时间随机发生的事件:电话交换台的呼叫、放射源的衰变、织机的断纱、服务器收到的请求。记 \(N(t)\) 为时间段 \([0,t]\) 内事件发生的次数,则下面的两条假设足以推出 \(N(t)\) 服从泊松分布——这组假设称为泊松过程(Poisson process)。

定义 2 泊松过程(机理表述)

称计数过程 \(\{N(t),\,t\ge 0\}\) 是强度(rate)为 \(\lambda\) 的泊松过程,若它满足:
(i) 独立增量(independent increments):在不相交时间区间内发生的事件数相互独立,且过程的统计规律不因计时起点的平移而改变;
(ii) 比例性:在长度为 \(\Delta t\) 的很短区间内,恰好发生一次事件的概率约为 \(\lambda\,\Delta t\),发生两次及以上的概率是 \(\Delta t\) 的高阶小量 \(o(\Delta t)\)。
此时对任意 \(t\gt 0\), \[ P(N(t)=k)=e^{-\lambda t}\frac{(\lambda t)^{k}}{k!},\qquad k=0,1,2,\ldots \] 即 \(N(t)\sim\mathrm{Poisson}(\lambda t)\)。

直观地说:把 \([0,t]\) 切成 \(n\) 个小区间,每个小区间"出一次事"的概率为 \(\lambda t/n\)(且几乎不会出两次以上),于是 \(N(t)\) 近似为 \(B(n,\lambda t/n)\)——令 \(n\to\infty\) 便回到定理 2 的极限。泊松过程的两个来源在此合流。

由定义 2 立即得到强度的可加性,它是应用中换算时间尺度的依据:(a)时间可加——不相交区间上的事件数相互独立,且总次数服从参数相加的泊松分布:\(N(s+t)\) 与 \(N(s)+N'(t)\) 同分布,均服从 \(\mathrm{Poisson}(\lambda s+\lambda t)=\mathrm{Poisson}(\lambda(s+t))\)。例如呼叫强度为每分钟 \(\lambda=3\),则 \(5\) 分钟内的呼叫数服从 \(\mathrm{Poisson}(15)\)。(b)流可加——两个相互独立的泊松流叠加仍是泊松流,强度为 \(\lambda_1+\lambda_2\):交换台同时接收语音呼叫(\(\lambda_1\))与传真呼叫(\(\lambda_2\))时,总呼叫流强度为 \(\lambda_1+\lambda_2\)。适用场景遍布各领域:放射性衰变(原子数极多而单个原子瞬间衰变的概率极小,正是"二项极限"的物理版本)、一页书的错字(字符多、每字出错概率小)、长消息传输误码、高速公路事故、排队系统的到达。反之,若事件明显"扎堆"(如地震余震)或呈周期性(如上班高峰的车流),或强度随时间变化,则不能套用泊松过程。

例 4 电话交换台的呼叫

某电话交换台白天的呼叫到达近似为强度 \(\lambda=3\)(次/分钟)的泊松过程。设 \(X\) 为某一分钟内收到的呼叫数。(a) 求 \(P(X=0)\);(b) 求该分钟内至少接到 \(2\) 个呼叫的概率;(c) 问接下来 \(5\) 分钟内呼叫数的分布。

\(X\sim\mathrm{Poisson}(3)\)。
(a) \(P(X=0)=e^{-3}\approx 0.0498\),即平均每 \(20\) 个一分钟里约有 \(1\) 分钟完全空闲。
(b) \(P(X\ge 2)=1-P(X=0)-P(X=1)=1-e^{-3}(1+3)=1-4e^{-3}\approx 1-0.1991=0.8009\)。"至少两个呼叫"竟占到八成——因为均值 \(3\) 本身就不小。
(c) 由强度的可加性,\(5\) 分钟内的呼叫数 \(Y\sim\mathrm{Poisson}(3\times 5)=\mathrm{Poisson}(15)\),且 \(Y\) 与先前一分钟内的呼叫数相互独立。
注记 泊松分布的发现与"马踢死骑兵"数据

泊松分布由法国数学家西莫恩·德尼·泊松(Siméon Denis Poisson,1781–1840)于 1837 年在著作《刑事与民事审判概率的研究》中发表,当时并未引起重视。让它名声大噪的是波兰经济学家博尔特基维奇(L. Bortkiewicz)1898 年的数据分析:普鲁士军队 \(14\) 个骑兵军团在 \(20\) 年间被马踢死的士兵人数,在 \(200\) 个"军团–年"中共死亡 \(122\) 人(平均每个军团–年 \(0.61\) 人),实际频数与 \(\mathrm{Poisson}(0.61)\) 的理论频数吻合得极好——死亡事件稀少、机会(骑兵与马的接触)众多,正是泊松分布的典型舞台。这一例子后来成了统计学教科书的经典,被称为"小数定律"(law of small numbers)的示范。另见 5.5 节:泊松过程中相邻两次事件的间隔服从指数分布,两者互为表里。

4. 最大概率点、期望与方差

泊松分布仅含一个参数 \(\lambda\),它完全决定了分布的形态与数字特征。下面三个结论把本节开头的承诺逐一兑现:最可能取何值?平均值是多少?散布有多大?

定理 3 最大概率点(众数)

设 \(X\sim\mathrm{Poisson}(\lambda)\),记 \(p(k)=P(X=k)\),则 \(p(k)\) 在 \(k^{\ast}=\lfloor\lambda\rfloor\) 处取得最大值;当 \(\lambda\) 为正整数时,\(k^{\ast}=\lambda\) 与 \(k^{\ast}=\lambda-1\) 两点并列最大。

证明考察相邻两项之比: \[ \frac{p(k)}{p(k-1)}=\frac{e^{-\lambda}\lambda^{k}/k!}{e^{-\lambda}\lambda^{k-1}/(k-1)!}=\frac{\lambda}{k},\qquad k\ge 1. \] 因此 \[ p(k)\ge p(k-1)\iff \frac{\lambda}{k}\ge 1\iff k\le\lambda. \] 即序列 \(p(0),p(1),p(2),\ldots\) 在 \(k\le\lambda\) 的范围内单调不减,一旦 \(k\gt\lambda\) 便严格递减。于是最大值在"最后一个不下降的位置"取得,即 \(k^{\ast}=\lfloor\lambda\rfloor\);若 \(\lambda\) 恰为整数,则 \(p(\lambda)/p(\lambda-1)=\lambda/\lambda=1\),两点概率相等、并列最大。 \(\blacksquare\)

验证几个实例:\(\lambda=2\) 时众数为 \(2\),且 \(p(1)=p(2)=2e^{-2}\approx 0.2707\)(与例 1 的计算一致);\(\lambda=0.4\lt 1\) 时比值 \(\lambda/1\lt 1\),序列从开头就递减,众数为 \(0\);\(\lambda=4\) 时 \(p(3)=p(4)\approx 0.1954\) 并列最大。

定理 4 期望与方差

设 \(X\sim\mathrm{Poisson}(\lambda)\),则 \(E[X]=\lambda\),\(\mathrm{Var}(X)=\lambda\)。

证明先算期望。利用 \(k/k!=1/(k-1)!\) 消去因子 \(k\)(\(k=0\) 项自动为零): \[ E[X]=\sum_{k=0}^{\infty}k\,e^{-\lambda}\frac{\lambda^{k}}{k!} =\lambda e^{-\lambda}\sum_{k=1}^{\infty}\frac{\lambda^{k-1}}{(k-1)!} =\lambda e^{-\lambda}\cdot e^{\lambda}=\lambda. \] 再算方差。直接处理 \(E[X^2]\) 中的 \(k^2\) 较繁,更优雅的做法是先算二阶阶乘矩(factorial moment) \(E[X(X-1)]\)——因子 \(k(k-1)\) 恰好把阶乘消到 \((k-2)!\): \[ E\bigl[X(X-1)\bigr]=\sum_{k=0}^{\infty}k(k-1)\,e^{-\lambda}\frac{\lambda^{k}}{k!} =\lambda^{2}e^{-\lambda}\sum_{k=2}^{\infty}\frac{\lambda^{k-2}}{(k-2)!} =\lambda^{2}e^{-\lambda}\cdot e^{\lambda}=\lambda^{2}. \] 由 4.4 节期望的线性性,\(X^2=X(X-1)+X\),故 \(E[X^2]=E[X(X-1)]+E[X]=\lambda^{2}+\lambda\)。再由 4.5 节的公式, \[ \mathrm{Var}(X)=E[X^2]-\bigl(E[X]\bigr)^{2}=\lambda^{2}+\lambda-\lambda^{2}=\lambda. \qquad\blacksquare \]

均值与方差同为 \(\lambda\)是泊松分布的"指纹":实测数据的样本均值与样本方差近似相等,常被用作判定其是否服从泊松分布的经验依据。它与二项分布的关系也严丝合缝——\(B(n,p)\) 的期望为 \(np\)、方差为 \(np(1-p)\),当 \(p\to 0\) 时 \(1-p\to 1\),两者都趋于 \(np=\lambda\),恰与定理 2 的极限一致。此外,\(\lambda\) 较大时泊松分布逐渐对称,并可用正态分布 \(N(\lambda,\lambda)\) 近似(见 8.3 节中心极限定理)。图 2 展示了 \(\lambda=1,4,10\) 三个成员的形态演变:\(\lambda=1\) 时质量集中于 \(0\) 与 \(1\)、强烈右偏;\(\lambda=4\) 时众数移到 \(3,4\);\(\lambda=10\) 时已相当接近对称。

0 0.1 0.2 0.3 0.4 012 345 678 91011 121314 151617 181920 k λ = 1(众数 0, 1) λ = 4(众数 3, 4) λ = 10(众数 9, 10) P(X = k)
图 2:泊松分布列曲线族(\(k=0,\ldots,20\),纵轴为概率,各点纵坐标按真实数值比例绘制)。\(\lambda=1\)(绛红)集中于 \(0,1\) 两点;\(\lambda=4\)(赭金)众数为 \(3,4\);\(\lambda=10\)(深蓝)众数为 \(9,10\),形态已趋于对称。三条曲线下的面积(各棒之和)均为 \(1\)。

5. 本节小结

要点回顾
  • 分布列:\(P(X=k)=e^{-\lambda}\lambda^{k}/k!\)(\(k=0,1,2,\ldots\)),规范性由 \(e^{x}=\sum_k x^k/k!\) 的泰勒级数立即得出;相邻项之比 \(p(k)/p(k-1)=\lambda/k\) 提供递推。
  • 来源一(二项极限):\(n\to\infty\)、\(np\to\lambda\)、固定 \(k\) 展开可证 \(\binom{n}{k}p^{k}(1-p)^{n-k}\to e^{-\lambda}\lambda^{k}/k!\);经验法则 \(n\ge 100\)、\(np\le 10\)。
  • 来源二(泊松过程):单位时间(空间)内稀有事件的计数;不相交区间独立、概率与区间长度成比例;强度可加——\(t\) 个单位时间为 \(\mathrm{Poisson}(\lambda t)\),两独立流叠加强度相加。
  • 众数:\(p(k)\ge p(k-1)\iff k\le\lambda\),故最大概率点为 \(k=\lfloor\lambda\rfloor\)(\(\lambda\) 为整数时与 \(\lambda-1\) 并列)。
  • 数字特征:\(E[X]=\lambda\),\(\mathrm{Var}(X)=\lambda\);方差证明的关键技巧是阶乘矩 \(E[X(X-1)]=\lambda^{2}\)。均值等于方差是泊松分布的判别特征。
  • 下一节 4.8 将继续介绍几何分布、负二项分布与超几何分布,完成离散分布工具箱的搭建。

练习

练习 4-7-1

设 \(X\sim\mathrm{Poisson}(\lambda)\)。已知 \(P(X=0)=P(X=1)\),求 \(\lambda\),并求 \(P(X\ge 2)\) 与分布的最大概率点。

答案与提示

由 \(e^{-\lambda}=\lambda e^{-\lambda}\) 得 \(\lambda=1\)。于是 \(P(X\ge 2)=1-e^{-1}(1+1)=1-2e^{-1}\approx 0.2642\);由定理 3,最大概率点 \(k=\lfloor 1\rfloor=1\)(此时 \(p(0)=p(1)=e^{-1}\) 并列最大,即 \(\lambda\) 为整数时与 \(\lambda-1\) 并列的情形)。

练习 4-7-2

判断下列二项分布能否用泊松分布近似,并说明理由:(a) \(B(5000,\,0.002)\);(b) \(B(20,\,0.4)\);(c) \(B(100,\,0.05)\)。

答案与提示

泊松近似的适用条件是"试验次数大、单次概率小",经验上 \(n\ge 100\) 且 \(np\le 10\)。(a) 可以:\(np=10\),\(p=0.002\) 极小,可用 \(\mathrm{Poisson}(10)\);(b) 不宜:虽然 \(np=8\le 10\),但 \(p=0.4\) 并不小、\(n\) 也不大,二项形态(对称程度、支撑范围)与泊松差异明显,应直接按二项计算;(c) 可以:\(n=100\)、\(np=5\),例 2 的对照表显示绝对误差不超过 \(0.005\)。

练习 4-7-3

设 \(X\sim\mathrm{Poisson}(2)\),求 \(P(X\le 2)\)。

答案与提示

\(P(X\le 2)=e^{-2}\left(1+2+\frac{2^{2}}{2!}\right)=5e^{-2}\approx 0.6767\)。注意"至多 2 次"的概率接近七成——虽然均值是 2,但分布右偏使小值一侧累计更快。

练习 4-7-4

某服务器收到的请求为强度每小时 \(12\) 次的泊松流。求某 \(15\) 分钟时段内:(a) 恰好收到 \(0\) 次请求的概率;(b) 至少收到 \(1\) 次请求的概率。

答案与提示

由强度可加性,\(15\) 分钟 \(=\frac14\) 小时内的请求数 \(X\sim\mathrm{Poisson}\left(12\times\frac14\right)=\mathrm{Poisson}(3)\)。(a) \(P(X=0)=e^{-3}\approx 0.0498\);(b) \(P(X\ge 1)=1-e^{-3}\approx 0.9502\)。关键在于先把强度换算到同一时间单位,再套用泊松分布列。