第 4 章 · 随机变量

4.1 随机变量

Random Variables
学习目标
  • 用函数的观点陈述随机变量的定义 \(X:S\to\mathbb{R}\),并能对具体试验自行构造随机变量;
  • 写出分布函数 \(F(x)=P(X\le x)\) 的定义,并证明其单调不减、右连续与两端极限性质;
  • 利用公式 \(P(a<X\le b)=F(b)-F(a)\) 由分布函数计算各类区间上的概率;
  • 求出指示随机变量 \(I_E\) 的分布列与阶梯形分布函数;
  • 了解离散型与连续型随机变量的划分,以及本章后续各节的路线。

1. 从结果到数值:随机变量的概念

前三章里,我们研究的对象是事件(event)及其概率。然而事件的表述方式五花八门:"灯泡寿命超过 1000 小时""掷两颗骰子点数之和等于 7""3 枚硬币中正面恰好出现 2 次"——它们各说各话,难以统一处理。但稍加留意便会发现:这些事件关心的都是试验结果的某个数值特征:寿命是一个数,点数之和是一个数,正面次数也是一个数。一旦把每个试验结果都换算成一个数,概率论就有了统一的舞台:求和、作差、取平均、画图,全都成为可能。随机变量(random variable)正是"把试验结果数值化"的严格数学工具。

定义 1 随机变量

设 \(S\) 为某随机试验的样本空间(sample space)。若对每一个样本点 \(s\in S\),都依照某种规则唯一地对应一个实数 \(X(s)\),则称 \(X\) 为定义在 \(S\) 上的随机变量(random variable),记作 \[ X:\; S\to\mathbb{R},\qquad s\mapsto X(s). \]

换言之,随机变量就是定义在样本空间上的实值函数:试验结果一旦出现,\(X\) 的取值便随之完全确定。习惯上用大写字母 \(X,Y,Z\) 表示随机变量,用小写字母 \(x\) 表示它可能取到的数值。

所谓"随机",指的是 \(X\) 的取值依赖于试验的偶然结果,试验之前无法预知;而一旦样本点 \(s\) 已实现,\(X(s)\) 就是一个确定的数。同一个试验上可以定义许多不同的随机变量:掷两颗骰子时,既可以取"点数之和",也可以取"两颗中较大的点数"或"是否出现对子",研究哪个取决于我们关心什么。

样本空间 → 实数轴:随机变量 X 的映射(掷两颗骰子,X = 点数和) 样本空间 S (i, j):两颗骰子的点数 (1,1) (1,2) (2,1) (4,6) 2 3 4 6 8 10 12 实数轴 ℝ X 不同的样本点可以映到同一个数值:(1,2) 与 (2,1) 都映到 3。
图 1:随机变量 \(X\) 是从样本空间 \(S\) 到实数轴 \(\mathbb{R}\) 的函数。图中以"掷两颗骰子,\(X=\)点数和"为例:每个样本点 \((i,j)\) 被映射为实数 \(i+j\),映射可以多对一。
例 1 掷两颗骰子:点数和的分布

掷两颗骰子,令 \(X\) 为两点数之和。写出 \(X\) 的全部可能取值及相应的概率。

样本空间含 \(6\times 6=36\) 个等可能样本点 \((i,j)\),\(1\le i,j\le 6\),而 \(X(i,j)=i+j\) 可取 \(2,3,\dots,12\) 共 11 个值。事件 \(\{X=k\}\) 由满足 \(i+j=k\) 的样本点组成:例如 \(\{X=3\}=\{(1,2),(2,1)\}\),含 2 个样本点;一般地,\(k\le 7\) 时 \(\{X=k\}\) 含 \(k-1\) 个样本点,\(k\ge 7\) 时含 \(13-k\) 个样本点。逐值清点得表 1,各概率之和恰为 \(\frac{1+2+\cdots+6+5+\cdots+1}{36}=1\)。
表 1:\(X=\)点数和 的概率分布
\(x\)23456789101112
样本点个数12345654321
\(P(X=x)\)\(\frac{1}{36}\)\(\frac{2}{36}\)\(\frac{3}{36}\)\(\frac{4}{36}\)\(\frac{5}{36}\)\(\frac{6}{36}\)\(\frac{5}{36}\)\(\frac{4}{36}\)\(\frac{3}{36}\)\(\frac{2}{36}\)\(\frac{1}{36}\)
例 2 掷 3 枚硬币:正面数

将一枚均匀硬币连掷 3 次,令 \(X\) 为正面出现的次数。写出 \(X\) 的取值与概率。

样本空间由 \(2^3=8\) 个等可能结果组成:正正正、正正反、正反正、反正正、正反反、反正反、反反正、反反反。按正面个数归类:0 个正面有 1 个结果,1 个有 3 个,2 个有 3 个,3 个有 1 个。于是 \(X\) 取 \(0,1,2,3\) 的概率分别为 \(\frac{1}{8},\frac{3}{8},\frac{3}{8},\frac{1}{8}\)。这类"计数式"概率的一般公式 \(\binom{3}{k}/8\) 将在 4.2 节4.6 节中详细推导。
注记 "随机变量"其实是函数

初学者常把随机变量误解为"未知的数"。恰恰相反:\(X\) 是一个函数,它的"自变量"是样本点 \(s\)。另一要点是:对任意实数 \(x\),满足 \(X(s)\le x\) 的样本点构成 \(S\) 的子集,即事件 \(\{X\le x\}=\{s\in S: X(s)\le x\}\),因此 \(P(X\le x)\) 有明确意义——这正是下一小节分布函数的出发点。

2. 分布函数及其性质

例 1、例 2 中,我们用一张"取值—概率"表描述了 \(X\) 的全部信息。是否有一种统一格式,能同时装下离散与连续两类随机变量的概率信息?答案是:对每个实数 \(x\),给出事件 \(\{X\le x\}\) 的概率。

定义 2 分布函数

设 \(X\) 为随机变量,称函数 \[ F(x) = P(X\le x),\qquad x\in\mathbb{R} \] 为 \(X\) 的分布函数(distribution function),又称累积分布函数(cumulative distribution function,简称 CDF)。

直观上,\(F(x)\) 是"累计到 \(x\) 为止"的概率质量:随着 \(x\) 从左向右移动,累计值不断增多却永不减少、也永不越过 1。

定理 1 分布函数的基本性质

设 \(F(x)=P(X\le x)\) 为任意随机变量 \(X\) 的分布函数,则: \[ \begin{aligned} \text{(i)}&\quad 0\le F(x)\le 1,\ \text{且 } F \text{ 单调不减: } a<b \Rightarrow F(a)\le F(b);\\ \text{(ii)}&\quad F \text{ 右连续: } \lim_{h\downarrow 0}F(x+h)=F(x);\\ \text{(iii)}&\quad \lim_{x\to-\infty}F(x)=0,\qquad \lim_{x\to+\infty}F(x)=1;\\ \text{(iv)}&\quad P(a<X\le b)=F(b)-F(a),\qquad a<b. \end{aligned} \]

证明(i) 概率介于 0 与 1 之间,故 \(0\le F(x)\le 1\)。若 \(a<b\),则 \(\{X\le a\}\subseteq\{X\le b\}\),由概率的单调性得 \(F(a)\le F(b)\)。
(iv) 事件分解 \(\{X\le b\}=\{X\le a\}\cup\{a<X\le b\}\) 中两事件互不相容,由概率的可加性,\(F(b)=F(a)+P(a<X\le b)\),移项即得。
(iii) 记 \(A_n=\{X\le n\}\),则 \(A_1\subseteq A_2\subseteq\cdots\),且因 \(X\) 只取有限实数,\(\bigcup_{n=1}^{\infty}A_n=S\)。由概率的连续性(第 2 章),\(F(n)=P(A_n)\to P(S)=1\)。同理 \(B_n=\{X\le -n\}\) 递减且 \(\bigcap_n B_n=\varnothing\),故 \(F(-n)\to 0\)。
(ii) 对固定的 \(x\),令 \(C_n=\{X\le x+\tfrac{1}{n}\}\),则 \(C_n\) 递减且 \(\bigcap_n C_n=\{X\le x\}\)。仍由概率的连续性,\(F(x+\tfrac1n)\to F(x)\),即 \(F\) 在 \(x\) 处右连续。

性质 (iv) 表明:有了分布函数,任何形如 \((a,b]\) 的区间上的概率都能"两值相减"直接读出,再结合对立事件与拆分,可得 \(P(X>a)=1-F(a)\)、\(P(X\ge a)=1-F(a)+P(X=a)\) 等一整套公式。注意一般而言 \(P(X<b)\ne F(b)\):因为 \(\{X<b\}\) 比 \(\{X\le b\}\) 少了 \(\{X=b\}\),正确的式子是 \(P(X<b)=F(b)-P(X=b)\)。

把例 1 的表 1 逐项累加,就得到两颗骰子点数和的分布函数,它是一条 11 级的阶梯曲线:在每个整数 \(k=2,\dots,12\) 处向上跳变,跳变高度恰为 \(P(X=k)\)(如图 2)。

0 1/4 1/2 3/4 1 F(x) x 234 567 8910 1112 跳变高度 P(X=7)=6/36 实心点:F(7)=21/36 空心点:左极限 15/36
图 2:掷两颗骰子 \(X=\)点数和 的分布函数(由表 1 逐项累加,纵坐标按真实比例)。\(F\) 为 11 级阶梯,在 \(x=2,3,\dots,12\) 处跳变,跳变高度等于 \(P(X=x)\);每个跳变点取右端的值(实心点),故 \(F\) 右连续。
例 3 由分布函数求区间概率

沿用例 1 的两颗骰子。(a) 求 \(P(4<X\le 9)\);(b) 求 \(P(X>9)\);(c) 求 \(P(X\le 4)\)。

由表 1 累加:\(F(4)=\frac{1+2+3}{36}=\frac{6}{36}=\frac16\),\(F(9)=\frac{1+2+\cdots+6+5+4+3}{36}=\frac{30}{36}=\frac56\)。
(a) 由定理 1 (iv),\(P(4<X\le 9)=F(9)-F(4)=\frac{30}{36}-\frac{6}{36}=\frac{24}{36}=\frac23\)。由于 \(X\) 只取整数值,这也就是 \(P(5\le X\le 9)\),可直接验证:\((4+5+6+5+4)/36=\frac{24}{36}\)。
(b) \(P(X>9)=1-F(9)=1-\frac56=\frac16\),即点数和为 \(10,11,12\) 的概率 \((3+2+1)/36\)。
(c) \(P(X\le 4)=F(4)=\frac16\)。可见只要手里有 \(F\),各类区间概率皆由"读值、作差"完成。
注记 为何用 "≤" 定义 F

采用 \(P(X\le x)\)(而非 \(P(X<x)\))来定义分布函数,是全世界的统一约定。在此约定下,离散型随机变量的 \(F\) 恰好右连续(台阶取右上端的值),与测度论中的标准体系一致。判断一个阶梯图是否为合法 CDF 时,"实心点在右侧、空心点在左侧"是快速检查右连续性的口诀。

3. 指示随机变量

有一类结构最简单的随机变量值得专门命名:它只回答一个"是/否"问题,把任一事件翻译成一个数。它是后续章节(特别是第 7 章用指示变量求和计算期望)的重要工具。

定义 3 指示随机变量

设 \(E\subseteq S\) 为事件,定义 \[ I_E(s)=\begin{cases}1, & s\in E,\\[2pt] 0, & s\notin E.\end{cases} \] 称 \(I_E\) 为事件 \(E\) 的指示随机变量(indicator random variable),又称伯努利随机变量。

显然 \(P(I_E=1)=P(E)\),\(P(I_E=0)=1-P(E)\):指示变量把"事件 \(E\) 是否发生"完整编码为 0/1 两个值。

例 4 指示变量的分布函数:两级阶梯

设事件 \(E\) 满足 \(P(E)=p\),令 \(X=I_E\)。(a) 写出 \(X\) 的分布列;(b) 求 \(X\) 的分布函数 \(F(x)\) 并作图(以掷一颗骰子、\(E=\{\)出现 6 点\(\}\) 为例作图)。

(a) \(X\) 只取 0 与 1:\(P(X=1)=P(E)=p\),\(P(X=0)=1-p\)。
(b) 按 \(x\) 的范围分段计算:当 \(x<0\) 时,事件 \(\{X\le x\}\) 不含任何样本点,\(F(x)=0\);当 \(0\le x<1\) 时,\(\{X\le x\}=\{X=0\}\),\(F(x)=1-p\);当 \(x\ge 1\) 时,\(\{X\le x\}=S\),\(F(x)=1\)。即 \[ F(x)=\begin{cases}0, & x<0,\\ 1-p, & 0\le x<1,\\ 1, & x\ge 1.\end{cases} \] 这是一个只有两级台阶的阶梯函数:在 \(x=0\) 处跳升 \(1-p\),在 \(x=1\) 处跳升 \(p\)。图 3 以掷一颗骰子、\(E=\{\)出现 6 点\(\}\)(\(p=\frac16\),中间台阶高度 \(1-p=\frac56\))为例按真实比例画出。
0 1−p 1 F(x) 0 1 x 1−p = 5/6 实心点:右连续取值;空心点:左极限。 x=0 处跳至 1−p,x=1 处跳至 1。 图中取 p=P(E)=1/6
图 3:指示随机变量 \(I_E\) 的分布函数(以 \(P(E)=\frac16\) 为例,按真实比例)。它只有两级台阶:\(x=0\) 处从 0 跳至 \(1-p\),\(x=1\) 处从 \(1-p\) 跳至 1;一般事件只需更换 \(p\) 的值。

指示随机变量的价值在于"把事件变成数":随机变量之和 \(\sum I_{E_i}\) 自动完成对"诸事件发生次数"的计数。例如掷 \(n\) 次硬币,"正面总数"正是指示"第 \(i\) 次为正面"的 \(n\) 个指示变量之和——这一观点将在 4.6 节(二项随机变量)与第 7 章反复发挥威力。

4. 离散型与连续型:本章路线图

本节所有例子中的 \(X\) 都只取有限个(或可数无穷个)孤立的值,这类随机变量称为离散型(discrete)随机变量,是本章的主角:4.2 节引入分布列 \(p(x)=P(X=x)\),4.3–4.5 节依次建立期望与方差,4.6–4.8 节研究三类最重要的离散模型——伯努利与二项、泊松、几何与超几何等。与之相对,若 \(X\) 的可能值充满某个区间(如灯泡寿命、测量误差),则称为连续型(continuous)随机变量,其严格描述需要密度函数,留待第 5 章(5.1 节起)展开。

分布函数的一大优点是统一:无论离散还是连续,\(F(x)=P(X\le x)\) 都有定义、都满足定理 1 的全部性质——离散情形它是阶梯(图 2、图 3),连续情形它是一条上升到 1 的光滑曲线。因此"任给一个函数,它能否作为某个随机变量的 CDF"只需对照定理 1 逐条检验即可,这也正是本节练习的重点之一。

5. 本节小结

要点回顾
  • 随机变量 \(X:S\to\mathbb{R}\) 是定义在样本空间上的实值函数,把每个试验结果数值化;它是函数,不是"未知量"。
  • 分布函数 \(F(x)=P(X\le x)\) 统一刻画随机变量的概率规律:单调不减、右连续、两端极限为 0 与 1。
  • 区间概率由差分得到:\(P(a<X\le b)=F(b)-F(a)\),且 \(P(X>a)=1-F(a)\);注意 \(P(X<b)=F(b)-P(X=b)\)。
  • 离散型随机变量的 CDF 是阶梯曲线:在取值点 \(x_k\) 处跳升 \(P(X=x_k)\),跳变点取右端值(右连续)。
  • 指示随机变量 \(I_E\) 把事件数值化为 0/1,其 CDF 是两级阶梯;随机变量的划分(离散/连续)指引本章与第 5 章的路线。

练习

练习 4-1-1

利用例 1 与图 2 中的分布函数,求 \(P(X\le 3)\) 与 \(P(X=3)\)。

答案与提示

\(P(X\le 3)=F(3)=\frac{1+2}{36}=\frac{3}{36}=\frac{1}{12}\);\(P(X=3)=F(3)-F(2)=\frac{3}{36}-\frac{1}{36}=\frac{2}{36}=\frac{1}{18}\)。单点概率等于分布函数在该点的跳变高度。

练习 4-1-2

判断下列函数能否作为某随机变量的分布函数,并说明理由:(a) \(F(x)=1-\mathrm{e}^{-x}\ (x\ge 0)\),\(F(x)=0\ (x<0)\);(b) \(F(x)=\mathrm{e}^{-x}\ (x\ge 0)\),\(F(x)=0\ (x<0)\);(c) \(F(x)=\frac12+\frac{1}{\pi}\arctan x\)。

答案与提示

(a) 可以——单调不减、在 0 处右连续、左极限 0 与右极限 1 都成立(这就是第 5 章的指数分布)。(b) 不可以——在 \([0,\infty)\) 上单调递减,违反单调不减;且 \(x\to\infty\) 时极限为 0 而非 1。(c) 可以——\(\arctan\) 单调增、函数处处连续(故右连续),两端极限分别为 \(0\) 与 \(1\)(这是著名的柯西分布的分布函数)。

练习 4-1-3

连掷 3 枚均匀硬币(例 2),令 \(I=I_E\) 为事件 \(E=\{\)至少出现一次正面\(\}\) 的指示随机变量。写出 \(I\) 的分布列与分布函数,并求 \(P(0<I\le 1)\)。

答案与提示

\(P(I=0)=P(\)全反面\()=\frac18\),\(P(I=1)=\frac78\)。故 \(F(x)=0\ (x<0)\),\(F(x)=\frac18\ (0\le x<1)\),\(F(x)=1\ (x\ge 1)\)。\(P(0<I\le 1)=F(1)-F(0)=1-\frac18=\frac78=P(E)\),与直观一致。

练习 4-1-4

利用事件分解 \(\{X\le b\}=\{X\le a\}\cup\{a<X\le b\}\)(两事件互不相容)证明定理 1 的性质 (iv);并说明为什么一般而言 \(P(a\le X\le b)\ne F(b)-F(a)\)。

答案与提示

由有限可加性 \(F(b)=P(X\le b)=P(X\le a)+P(a<X\le b)=F(a)+P(a<X\le b)\),移项即得。至于后者:\(\{a\le X\le b\}\) 比 \(\{a<X\le b\}\) 多包含样本点 \(\{X=a\}\),故 \(P(a\le X\le b)=F(b)-F(a)+P(X=a)\);只有当 \(P(X=a)=0\)(例如连续型情形)时两者才相等。