第 6 章 · 联合分布的随机变量

6.6 顺序统计量

Order Statistics
学习目标
  • 写出顺序统计量 \(X_{(1)}\le\cdots\le X_{(n)}\) 的定义,并说明连续总体下样本值以概率 1 互不相同;
  • 独立推导最大值与最小值的分布 \(F(x)^n\) 与 \(1-[1-F(x)]^n\) 及其密度公式;
  • 用多项安排计数的直观论证导出第 \(k\) 个顺序统计量的密度,并了解它与贝塔分布的联系;
  • 将极值分布用于可靠性分析:指数组件串联后系统寿命服从 \(\mathrm{Exp}(n\lambda)\),平均寿命 \(1/(n\lambda)\);
  • 会求小样本(\(n=3\))样本中位数的密度与期望,并计算 \(U(0,1)\) 样本极值的期望。

1. 顺序统计量的定义

统计问题的出发点是样本(sample):设 \(X_1,X_2,\ldots,X_n\) 是取自某个总体的 \(n\) 个独立同分布(independent and identically distributed, 简称 iid)随机变量——例如从同一生产线上随机抽取的 \(n\) 个零件的寿命。6.2 节告诉我们,独立性使联合分布完全由单个变量的边缘分布决定。本节研究这组随机变量的一类重要函数:把它们"从小到大排序"之后的产物。许多实际问题天然只关心排序后的量:\(n\) 天里的最高水位、一批零件中最早失效的那一个、全班成绩排队后位于正中间的那一个。

定义 1 顺序统计量

设 \(X_1,\ldots,X_n\) 独立同分布,其共同分布函数为 \(F\)。将这 \(n\) 个观测值从小到大重新排列,记第 \(k\) 小的值为

\[ X_{(1)} \le X_{(2)} \le \cdots \le X_{(k)} \le \cdots \le X_{(n)}, \]

称 \(X_{(k)}\) 为第 \(k\) 个顺序统计量(k-th order statistic);\(X_{(1)}=\min(X_1,\ldots,X_n)\) 为最小值,\(X_{(n)}=\max(X_1,\ldots,X_n)\) 为最大值。

注意:顺序统计量是关于 \(X_1,\ldots,X_n\) 的对称函数——无论哪个观测恰好排到第 \(k\) 位,\(X_{(k)}\) 的值都一样,因此它当然还是随机变量。当总体为连续型时,任意两个样本值相等的概率为 \(0\),故以概率 1 有严格不等式 \(X_{(1)}<X_{(2)}<\cdots<X_{(n)}\),排序没有歧义。

同一组观测的两种编号:上方为原始观测序号,下方为从小到大的次序 x 0 1 X4 X1 X5 X2 X3 X(1) X(2) X(3) X(4) X(5) 样本中位数 X(3)(n = 5 时 k = 3)
图 1:数轴上的 \(n=5\) 个样本点。上方为原始观测编号 \(X_1,\ldots,X_5\)(次序杂乱),下方为排序后的顺序统计量 \(X_{(1)}\le\cdots\le X_{(5)}\);排序本质上只是给同一组点重新命名。

顺序统计量家族提供了一批常用统计量:\(X_{(1)}\) 与 \(X_{(n)}\) 分别称为样本最小值与样本最大值,合称极值(extreme values);两者之差 \(R=X_{(n)}-X_{(1)}\) 称为极差(range),是衡量样本散布的最简单度量;位于"正中间"的那个顺序统计量称为样本中位数(sample median),它对极端值不敏感,是稳健统计的首选位置度量(见第 4 小节)。本节的中心任务,就是求出这些"由排序产生"的随机变量的分布。

2. 极值的分布:最大值与最小值

先处理两个极端情形。求最大值与最小值的分布只需要两件工具:独立性("同时发生"的概率等于概率之积,见 6.2 节)与分布函数,推导非常干净。

定理 1 极值的分布

设 \(X_1,\ldots,X_n\) 独立同分布,分布函数为 \(F(x)\),密度为 \(f(x)\),则

\[ F_{X_{(n)}}(x)=P\bigl(X_{(n)}\le x\bigr)=F(x)^n, \qquad F_{X_{(1)}}(x)=P\bigl(X_{(1)}\le x\bigr)=1-\bigl[1-F(x)\bigr]^n, \] \[ f_{X_{(n)}}(x)=n\,F(x)^{n-1}f(x), \qquad f_{X_{(1)}}(x)=n\,\bigl[1-F(x)\bigr]^{n-1}f(x). \]
证明最大值不超过 \(x\),当且仅当所有 \(n\) 个观测都不超过 \(x\)。由独立性, \[ F_{X_{(n)}}(x)=P(X_1\le x,\ldots,X_n\le x)=\prod_{i=1}^{n}P(X_i\le x)=F(x)^n, \] 两边对 \(x\) 求导(链式法则)即得 \(f_{X_{(n)}}(x)=nF(x)^{n-1}f(x)\)。 对最小值,改用补事件更方便:"最小值 \(>x\)" 等价于"所有观测都 \(>x\)",于是 \[ P\bigl(X_{(1)}>x\bigr)=P(X_1>x,\ldots,X_n>x)=\prod_{i=1}^{n}\bigl[1-F(x)\bigr]=\bigl[1-F(x)\bigr]^n, \] 从而 \(F_{X_{(1)}}(x)=1-[1-F(x)]^n\),求导得 \(f_{X_{(1)}}(x)=n[1-F(x)]^{n-1}f(x)\)。证毕。

两个公式的结构完全对偶:把最小值问题中的每个事件换成补事件,\(F\) 与 \(1-F\) 就互换角色。密度中因子 \(f(x)\) 表示"有一个观测恰好落在 \(x\) 处",而 \(F(x)^{n-1}\)(或 \([1-F(x)]^{n-1}\))表示其余 \(n-1\) 个观测全部落在其左侧(或右侧)。

例 1 三个 \(U(0,1)\) 观测的极值

设 \(X_1,X_2,X_3\) 独立同分布,均服从 \((0,1)\) 上的均匀分布 \(U(0,1)\)。求最大值 \(X_{(3)}\) 与最小值 \(X_{(1)}\) 的密度,并用积分计算 \(E[X_{(3)}]\) 与 \(E[X_{(1)}]\)。

对 \(U(0,1)\) 有 \(F(x)=x\),\(f(x)=1\)(当 \(0<x<1\))。代入定理 1: \[ f_{X_{(3)}}(x)=3\cdot x^{3-1}\cdot 1=3x^2, \qquad f_{X_{(1)}}(x)=3\cdot(1-x)^{3-1}\cdot 1=3(1-x)^2, \quad 0<x<1. \] (也可直接看出 \(P(X_{(3)}\le x)=P(\text{三个观测都}\le x)=x^3\),求导同样得 \(3x^2\)。)再算期望: \[ E\bigl[X_{(3)}\bigr]=\int_0^1 x\cdot 3x^2\,dx=3\int_0^1 x^3\,dx=\frac{3}{4}, \] \[ E\bigl[X_{(1)}\bigr]=\int_0^1 x\cdot 3(1-x)^2\,dx=3\int_0^1\bigl(x-2x^2+x^3\bigr)\,dx=3\Bigl(\frac12-\frac23+\frac14\Bigr)=3\cdot\frac{1}{12}=\frac14. \] 即三个观测中最大值平均落在区间的 \(\tfrac34\) 处,最小值平均落在 \(\tfrac14\) 处——两者恰好关于中点 \(\tfrac12\) 对称,这由密度 \(3x^2\) 与 \(3(1-x)^2\) 的镜像关系决定(见图 2)。
最大值 X(n) 的密度 最小值 X(1) 的密度 0 1 2 3 0 1 2 3 0 0.5 1 0 0.5 1 n = 1 n = 2 n = 3
图 2:\(U(0,1)\) 样本(\(n=1,2,3\))的最大值密度 \(f_{X_{(n)}}(x)=nx^{\,n-1}\)(左)与最小值密度 \(f_{X_{(1)}}(x)=n(1-x)^{\,n-1}\)(右)。两图关于竖线 \(x=1/2\) 互为镜像;曲线峰值均为 \(n\),随 \(n\) 增大,最大值越来越向 \(1\) 堆积、最小值越来越向 \(0\) 堆积。

图 2 显示了一个明显趋势:观测越多,最大值越挤向右端、最小值越挤向左端。事实上对 \(U(0,1)\) 样本有 \(E[X_{(n)}]=n/(n+1)\to 1\),\(E[X_{(1)}]=1/(n+1)\to 0\)(练习 1 给出一般 \(n\) 的计算)。这正是洪水平、强度极值等"重现期"问题的数学骨架。

3. 可靠性应用:串联与并联系统

可靠性理论(reliability theory)是极值分布最直接的应用舞台。设一个系统由 \(n\) 个组件构成,组件 \(i\) 的寿命为 \(X_i\)。若组件串联(series system)——系统正常工作当且仅当每个组件都正常,如同一根链条任一环断裂即整链断开——则系统寿命为 \[ T_{\text{串}}=\min(X_1,\ldots,X_n); \] 反之,并联系统(parallel system)只要有至少一个组件正常即可工作,故 \[ T_{\text{并}}=\max(X_1,\ldots,X_n), \] 这种"多留一条后路"的设计称为冗余(redundancy)。于是,串联系统的寿命分析就是最小值的分布问题,并联系统就是最大值的分布问题。

例 2 串联系统:指数组件之和的"失效率叠加"

设 \(n\) 个组件的寿命相互独立且都服从参数为 \(\lambda\) 的指数分布(平均寿命 \(1/\lambda\),无记忆性见 5.5 节)。(a) 证明由它们组成的串联系统寿命 \(T\) 服从 \(\mathrm{Exp}(n\lambda)\),并求 \(E[T]\);(b) 两个组件 \(\lambda=1/1000\)(即单个平均寿命 1000 小时)串联,求系统平均寿命。

(a) 系统寿命 \(T=\min(X_1,\ldots,X_n)\)。对 \(t\ge 0\),"系统存活超过 \(t\)"等价于"每个组件都存活超过 \(t\)"。利用独立性与指数分布的生存函数 \(P(X_i>t)=e^{-\lambda t}\): \[ P(T>t)=P(X_1>t,\ldots,X_n>t)=\prod_{i=1}^{n}e^{-\lambda t}=\bigl(e^{-\lambda t}\bigr)^n=e^{-n\lambda t}. \] 这正是参数为 \(n\lambda\) 的指数分布的生存函数,故 \[ T\sim \mathrm{Exp}(n\lambda),\qquad f_T(t)=n\lambda e^{-n\lambda t},\qquad E[T]=\frac{1}{n\lambda}. \] (b) 代入 \(n=2\)、\(\lambda=1/1000\):\(E[T]=\dfrac{1}{2\times(1/1000)}=500\) 小时。 注意结论的量级:单个组件平均寿命 1000 小时,再串联一个同型组件,系统平均寿命反而缩短一半——串联系统比任何单个组件都更脆弱。从失效率(failure rate)看更直观:每个组件单位时间失效的机会为 \(\lambda\),\(n\) 个组件同时运转时,任意一个失效都会令系统停机,故系统失效率为 \(n\lambda\)——串联使失效率叠加。

并联系统则相反:由定理 1,\(F_{T_{\text{并}}}(t)=\bigl(1-e^{-\lambda t}\bigr)^n\),它不再是指数分布——冗余改变了失效机制,无记忆性随之丧失。两个 \(\lambda=1/1000\) 的组件并联时 \(E[T]=1500\) 小时(计算见练习 4):冗余确实延长了寿命,但收益并非翻倍。

4. 第 k 个顺序统计量与样本中位数

最大值对应 \(k=n\),最小值对应 \(k=1\);介于两者之间的一般情形,其密度的形态可以用一个极其直观的计数论证得到。关键想法:\(X_{(k)}\) 落在 \(x\) 附近,意味着 \(n\) 个观测中"恰有一个落在 \(x\) 旁边,\(k-1\) 个落在 \(x\) 左侧,\(n-k\) 个落在 \(x\) 右侧"——这是一个三类安排的计数问题。

定理 2 第 k 个顺序统计量的密度

设 \(X_1,\ldots,X_n\) 独立同分布,分布函数为 \(F\),密度为 \(f\),则对 \(1\le k\le n\),

\[ f_{X_{(k)}}(x)=\frac{n!}{(k-1)!\,(n-k)!}\,F(x)^{k-1}\,\bigl[1-F(x)\bigr]^{\,n-k}\,f(x). \]
证明(直观推导)把数轴分成三段:\((-\infty,x)\)、\([x,x+dx)\)、\([x+dx,+\infty)\)。由独立性,任一观测落入三段的概率分别约为 \(F(x)\)、\(f(x)\,dx\) 与 \(1-F(x)\)。事件 \(X_{(k)}\in[x,x+dx)\) 即"三段的观测数分别为 \(k-1\)、\(1\)、\(n-k\)"。把 \(n\) 个可分辨的观测分配到三段、各段数目固定的安排数(第 1 章的计数公式)为 \[ \frac{n!}{(k-1)!\cdot 1!\cdot(n-k)!}, \] 而每一种安排的概率都等于 \(F(x)^{k-1}\cdot\bigl(f(x)\,dx\bigr)\cdot\bigl[1-F(x)\bigr]^{\,n-k}\)。两者相乘并用 \(dx\) 除,即得所证公式(其中 \(1!=1\))。证毕。 严格证明可从分布函数出发:\(X_{(k)}\le x\) 等价于"至少 \(k\) 个观测不超过 \(x\)",故 \(F_{X_{(k)}}(x)=\sum_{j=k}^{n}\binom{n}{j}F(x)^j\bigl[1-F(x)\bigr]^{\,n-j}\);对 \(x\) 求导后各项逐对相消,结果与上式一致。

作为检验:\(k=n\) 时系数为 \(n!/[(n-1)!\,0!]=n\),\(f_{X_{(n)}}=nF^{\,n-1}f\);\(k=1\) 时同理回到 \(n[1-F]^{\,n-1}f\)——定理 1 是其特例。有了一般公式,样本中位数(sample median)的分布便可直接读出:\(n\) 为奇数时中位数定义为 \(X_{((n+1)/2)}\);\(n\) 为偶数时习惯取正中两个值的平均 \(\bigl(X_{(n/2)}+X_{(n/2+1)}\bigr)/2\)(后者需借助 6.7 节的联合分布才能处理)。

例 3 三个观测的样本中位数

设 \(X_1,X_2,X_3\) 独立同分布 \(U(0,1)\),求样本中位数 \(X_{(2)}\) 的密度与期望 \(E[X_{(2)}]\)。

取 \(n=3\)、\(k=2\),代入定理 2(\(F(x)=x\),\(f(x)=1\),\(0<x<1\)): \[ f_{X_{(2)}}(x)=\frac{3!}{1!\cdot 1!}\,x^{2-1}\,(1-x)^{3-2}\cdot 1=6x(1-x),\qquad 0<x<1. \] 这是一条关于 \(x=\tfrac12\) 对称的抛物线形拱。期望为 \[ E\bigl[X_{(2)}\bigr]=\int_0^1 x\cdot 6x(1-x)\,dx=6\int_0^1\bigl(x^2-x^3\bigr)\,dx=6\Bigl(\frac13-\frac14\Bigr)=\frac12, \] 期望恰落在密度图形的对称中心——由于 \(6x(1-x)\) 关于 \(\tfrac12\) 对称,这一结果无须计算即可预判。再补一个二阶矩:\(E\bigl[X_{(2)}^2\bigr]=6\int_0^1(x^3-x^4)\,dx=6\bigl(\tfrac14-\tfrac15\bigr)=\tfrac{3}{10}\),故 \(\mathrm{Var}\bigl(X_{(2)}\bigr)=\tfrac{3}{10}-\tfrac14=\tfrac{1}{20}\)。
注记 贝塔分布:顺序统计量的统一面孔

定理 2 表明,\(U(0,1)\) 样本的第 \(k\) 个顺序统计量服从参数为 \((k,\,n-k+1)\) 的贝塔分布(Beta distribution)——公式中 \(x^{k-1}(1-x)^{n-k}\) 与阶乘系数的组合正是贝塔密度的标准形状(例 3 的 \(6x(1-x)\) 即 \(\mathrm{Beta}(2,2)\))。更进一步,若总体的 \(F\) 连续且严格递增,则由概率积分变换 \(Y=F(X)\sim U(0,1)\)(5.7 节的变量替换),任意总体的顺序统计量经 \(F\) 变换后都化归均匀情形——这就是 \(U(0,1)\) 案例具有普遍意义的原因。由贝塔积分还可得简洁公式 \(E\bigl[X_{(k)}\bigr]=\dfrac{k}{n+1}\):\(n\) 个观测"平均地把 \((0,1)\) 分成 \(n+1\) 等份"(练习 1 是其 \(k=n\) 的特例)。

表 1:顺序统计量的分布一览(总体密度 \(f\)、分布函数 \(F\);均匀情形 \(F(x)=x\))
统计量密度(一般总体)\(U(0,1)\) 总体分布记号
最大值 \(X_{(n)}\)\(nF^{\,n-1}f\)\(nx^{\,n-1}\)\(\mathrm{Beta}(n,1)\)
最小值 \(X_{(1)}\)\(n(1-F)^{\,n-1}f\)\(n(1-x)^{\,n-1}\)\(\mathrm{Beta}(1,n)\)
第 \(k\) 个 \(X_{(k)}\)\(\dfrac{n!}{(k-1)!(n-k)!}F^{\,k-1}(1-F)^{\,n-k}f\)\(\dfrac{n!}{(k-1)!(n-k)!}x^{\,k-1}(1-x)^{\,n-k}\)\(\mathrm{Beta}(k,n-k+1)\)

5. 本节小结

要点回顾
  • 把样本 \(X_1,\ldots,X_n\) 从小到大排序得顺序统计量 \(X_{(1)}\le\cdots\le X_{(n)}\);连续总体下以概率 1 严格排序。
  • 极值分布只依赖独立性:\(F_{X_{(n)}}=F^n\),\(F_{X_{(1)}}=1-(1-F)^n\);密度为 \(nF^{\,n-1}f\) 与 \(n(1-F)^{\,n-1}f\)。
  • 一般公式:\(f_{X_{(k)}}=\dfrac{n!}{(k-1)!(n-k)!}F^{\,k-1}(1-F)^{\,n-k}f\),来自"1 个落在 \(x\)、\(k-1\) 个在左、\(n-k\) 个在右"的多项安排计数。
  • 应用:串联系统寿命 \(=\min\),iid 指数组件时 \(T\sim\mathrm{Exp}(n\lambda)\),\(E[T]=1/(n\lambda)\);并联系统寿命 \(=\max\),分布 \(F^n\),不再是指数分布。
  • 样本中位数:\(n=3\) 时密度 \(6x(1-x)\),\(E=\tfrac12\);\(U(0,1)\) 样本有 \(E[X_{(k)}]=k/(n+1)\),即 \(X_{(k)}\sim\mathrm{Beta}(k,n-k+1)\)。

练习

练习 6-6-1

设 \(X_1,\ldots,X_n\) 独立同分布 \(U(0,1)\),求 \(E[X_{(n)}]\) 与 \(E[X_{(1)}]\)。

答案与提示

由定理 1,\(f_{X_{(n)}}(x)=nx^{\,n-1}\),\(f_{X_{(1)}}(x)=n(1-x)^{\,n-1}\)(\(0<x<1\))。故 \[ E\bigl[X_{(n)}\bigr]=\int_0^1 x\cdot nx^{\,n-1}\,dx=\frac{n}{n+1},\qquad E\bigl[X_{(1)}\bigr]=\int_0^1 x\cdot n(1-x)^{\,n-1}\,dx=\frac{1}{n+1} \] (后者可令 \(u=1-x\) 化为 \(\int_0^1(1-u)^n\,du=\tfrac1{n+1}\) 的倍数)。例 1 的 \(\tfrac34,\tfrac14\) 即 \(n=3\) 特例;一般地 \(E[X_{(k)}]=k/(n+1)\)。

练习 6-6-2

证明最小值的分布公式 \(F_{X_{(1)}}(x)=1-[1-F(x)]^n\),并导出其密度。

答案与提示

从补事件入手:\(\{X_{(1)}>x\}=\{X_1>x\}\cap\cdots\cap\{X_n>x\}\)。由独立性,\(P(X_{(1)}>x)=\prod_{i=1}^nP(X_i>x)=[1-F(x)]^n\)。于是 \(F_{X_{(1)}}(x)=1-[1-F(x)]^n\);对 \(x\) 求导(注意内层导数为 \(-f(x)\))得 \(f_{X_{(1)}}(x)=n[1-F(x)]^{\,n-1}f(x)\)。要点:最小值的"生存函数"比分布函数更好用,这在可靠性分析(例 2)中反复出现。

练习 6-6-3

设 \(X_1,X_2\) 独立同分布 \(U(0,1)\),极差 \(R=X_{(2)}-X_{(1)}=|X_1-X_2|\)。求 \(R\) 的密度与 \(E[R]\)。

答案与提示

用几何方法:\(\{R\le r\}\) 即单位正方形中满足 \(|x-y|\le r\) 的带形区域,其面积为 \(1-(1-r)^2\)(两个角落三角形被去掉)。故 \(F_R(r)=2r-r^2\)(\(0\le r\le 1\)),求导得 \[ f_R(r)=2(1-r),\qquad 0<r<1, \] \[ E[R]=\int_0^1 r\cdot 2(1-r)\,dr=2\Bigl(\frac12-\frac13\Bigr)=\frac13. \] 极差在 \(0\) 附近最可能取值——两个均匀观测倾向于相距不远。

练习 6-6-4

两个独立组件,寿命均服从 \(\lambda=1/1000\) 的指数分布(单位:小时)。将它们并联,求系统寿命 \(T=\max(X_1,X_2)\) 的分布函数、密度与 \(E[T]\),并与串联情形(例 2)比较。

答案与提示

由定理 1,\(F_T(t)=\bigl(1-e^{-t/1000}\bigr)^2\),求导得 \(f_T(t)=2\lambda e^{-\lambda t}\bigl(1-e^{-\lambda t}\bigr)\)(\(\lambda=1/1000\))。期望用生存函数积分(4.3 节):\(P(T>t)=1-F_T(t)=2e^{-\lambda t}-e^{-2\lambda t}\),故 \[ E[T]=\int_0^\infty\bigl(2e^{-\lambda t}-e^{-2\lambda t}\bigr)\,dt=\frac{2}{\lambda}-\frac{1}{2\lambda}=\frac{3}{2\lambda}=1500\ \text{小时}. \] 比较:单组件 1000 小时,串联 500 小时,并联 1500 小时——冗余提高寿命,但并非按组件数翻倍;且并联寿命已不是指数分布,无记忆性丧失。