- 写出伯努利随机变量的分布列,并推导其期望 \(p\) 与方差 \(pq\);
- 对 \(n\) 重独立重复试验,独立完成二项分布列 \(P\{X=k\}=\binom{n}{k}p^k q^{n-k}\) 的两步推导(特定模式概率 + 模式计数);
- 用指示变量分解 \(X=\sum I_i\) 证明 \(E[X]=np\)、\(\mathrm{Var}(X)=npq\),并能指出独立性在哪一步被使用;
- 描述分布列形态随 \(p\) 的变化(\(p=0.5\) 对称、\(p\) 小右偏),会求最可能的成功次数;
- 运用互补事件思想计算"至少一次成功"的概率 \(1-q^n\),并反解所需的最少试验次数。
1. 伯努利随机变量
前几节我们学会了分布列(4.2 节)、期望(4.3 节)与方差(4.5 节)这三件工具,从本节起把它们投入使用,陆续研究几类最重要的离散型分布。第一类模型来自一类极其常见的试验:结果只有两种。产品检验分合格与不合格,治疗分有效与无效,投篮分命中与打铁,掷一枚硬币分正反,掷一颗骰子可以只关心"是否掷出 6 点"。概率论把这类两结果试验抽象为:其中一种结果称为成功(success),另一种称为失败(failure),而只取 0、1 两个值的随机变量正是对它的数值刻画。
若随机变量 \(X\) 只取 \(1\) 与 \(0\) 两个值,且 \[ P\{X=1\}=p,\qquad P\{X=0\}=1-p, \] 其中 \(0<p<1\),则称 \(X\) 为伯努利随机变量(Bernoulli random variable),\(p\) 称为成功概率。习惯上记 \(q=1-p\)(失败概率),对应的单次两结果试验称为伯努利试验(Bernoulli trial)。
"\(X=1\)"即试验成功,"\(X=0\)"即失败。伯努利随机变量是最简单的非退化随机变量,但正如后文所见,它是搭建二项分布乃至许多更复杂模型的砖块。
设 \(X\) 为成功概率为 \(p\) 的伯努利随机变量,则 \[ E[X]=p,\qquad \mathrm{Var}(X)=pq=p(1-p). \]
值得玩味的是方差 \(pq\) 随 \(p\) 的变化:当 \(p=\tfrac12\) 时取最大值 \(\tfrac14\),当 \(p\to 0\) 或 \(p\to 1\) 时趋于 \(0\)。这与 4.5 节"方差度量不确定性"的解释完全吻合——成败各半时结果最难预料,而几乎必然成功(或失败)的试验几乎没有悬念。
2. 二项随机变量:分布列的推导
单次伯努利试验提供的信息有限,真正有用的是把同一试验在相同条件下独立地重复 \(n\) 次,然后统计成功的总次数。这就引出本节的主角。
考虑满足以下三个条件的 \(n\) 次试验:(i) 各次试验相互独立;(ii) 每次试验只有成功、失败两种结果;(iii) 每次试验的成功概率同为 \(p\)。这样的试验序列称为 \(n\) 重伯努利试验。若 \[ X=\ n\ \text{次试验中成功的总次数}, \] 则称 \(X\) 为参数为 \((n,p)\) 的二项随机变量(binomial random variable),记作 \(X\sim B(n,p)\),其中记号 \(\sim\) 读作"服从"。
我们来推导 \(X\) 的分布列,即对每个 \(k=0,1,\ldots,n\) 计算 \(P\{X=k\}\)。先用一个具体小例热身:设 \(n=4\)、\(k=2\)。考虑一个特定的结果序列"成、败、成、败",由各次试验独立(第 3 章),其概率为
\[ p\cdot q\cdot p\cdot q=p^2q^2. \]
关键在于:任何一个恰好含有两次成功的序列,例如"败、成、成、败",概率都等于 \(p^2q^2\)——因为乘式中 \(p\) 恰好出现 \(k=2\) 次、\(q\) 恰好出现 \(n-k=2\) 次,与次序无关。而事件 \(\{X=2\}\) 正是所有这类序列的并,且不同序列互不相容。这样的序列有多少个?在 \(4\) 个位置中选 \(2\) 个放"成功",由第 1 章的组合计数,共有 \(\binom{4}{2}=6\) 个。于是 \(P\{X=2\}=6p^2q^2\)。
一般情形完全同理,推导分两步:
- 第一步(每个模式多大概率):任一恰好含 \(k\) 次成功的特定结果序列,由独立性,其概率为 \(p^k q^{n-k}\);
- 第二步(共有多少模式):这类序列的个数等于从 \(n\) 个位置中选取 \(k\) 个成功位置的方式数 \(\binom{n}{k}\)。
若 \(X\sim B(n,p)\),记 \(q=1-p\),则 \[ P\{X=k\}=\binom{n}{k}p^{k}q^{\,n-k},\qquad k=0,1,2,\ldots,n. \]
一场考试有 10 道四选一的单选题,某考生对题目一无所知,每题独立地随机猜测。设 \(X\) 为答对的题数,求:(a) \(P\{X=6\}\);(b) \(P\{X\ge 6\}\);(c) \(P\{X=0\}\)(全错的概率)。
(a) 由定理 2, \[ P\{X=6\}=\binom{10}{6}\Big(\frac14\Big)^{6}\Big(\frac34\Big)^{4}=210\cdot\frac{1}{4096}\cdot\frac{81}{256}=\frac{17010}{1048576}\approx 0.0162. \]
(b) \(P\{X\ge 6\}=P\{X=6\}+P\{X=7\}+P\{X=8\}+P\{X=9\}+P\{X=10\}\),逐项计算见表 1:
| \(k\) | \(\binom{10}{k}\) | \(P\{X=k\}=\binom{10}{k}(\tfrac14)^{k}(\tfrac34)^{10-k}\) |
|---|---|---|
| 6 | 210 | 0.01622 |
| 7 | 120 | 0.00309 |
| 8 | 45 | 0.00039 |
| 9 | 10 | 0.00003 |
| 10 | 1 | 0.00000 |
| 合计 | — | 0.01973 ≈ 0.0197 |
即猜对 6 题及以上的概率不足百分之二——靠瞎猜通过考试并不现实。
(c) "全错"即 \(k=0\) 的情形,此时无需组合系数: \[ P\{X=0\}=\Big(\frac34\Big)^{10}=\frac{59049}{1048576}\approx 0.0563. \] 有趣的是,全错的概率约为 \(5.6\%\),比"恰好猜对 6 题"大得多;事实上由下一节的形态分析可知,此分布最可能的取值是 \(k=2\)(概率约 \(0.2816\)),平均猜对 \(np=2.5\) 题。
将一颗均匀骰子独立地掷 10 次,设 \(X\) 为其中掷出 6 点的次数。求 \(P\{X=2\}\) 与"至少出现一次 6 点"的概率。
3. 分布列的形态:对称与偏斜
固定 \(n=10\),让 \(p\) 变化,可以直观看到二项分布列的两种典型形态。当 \(p=0.5\) 时(图 1),由组合恒等式 \(\binom{10}{k}=\binom{10}{10-k}\) 可知 \(P\{X=k\}=P\{X=10-k\}\),分布关于 \(k=np=5\) 完全对称,峰值恰在中央。
当 \(p\) 偏小时(图 2 取 \(p=0.25\),即例 1 的猜题分布),质量向左侧(成功次数少的一侧)堆积,峰值移到 \(k=2\),右侧拖出一条细长的尾巴——这种形态称为右偏(right-skewed)。\(p\) 越小、或 \(n\) 越大而 \(np\) 不大,偏态越明显。
最可能的成功次数(即分布列的众数(mode))有简洁的判别法。由定理 2 相邻两项之比
\[ \frac{P\{X=k+1\}}{P\{X=k\}}=\frac{n-k}{k+1}\cdot\frac{p}{q}, \]
该比值 \(\ge 1\) 当且仅当 \(k\le (n+1)p-1\)。因此概率随 \(k\) 先增后减:当 \((n+1)p\) 不是整数时,众数为 \(\lfloor (n+1)p\rfloor\)。对照两图:\(p=0.5\) 时 \((n+1)p=5.5\),众数为 \(5\)(概率 \(252/1024\approx 0.246\));\(p=0.25\) 时 \((n+1)p=2.75\),众数为 \(2\)(概率 \(\approx 0.2816\))。
分布列对 \(k\) 求和恰展开二项式 \((p+q)^n\),"二项分布"因此得名;而"伯努利"指的是雅各布·伯努利(Jacob Bernoulli),其在 1713 年身后出版的《猜度术》中首次系统研究了这类重复试验模型,并证明了"频率依概率收敛到 \(p\)"的大数定律——正是 1.1 节时间线上 1713 年那个节点。单次试验只有两种结果看似贫乏,但"独立重复"把简单性转化为普适性:凡能化为"计数 \(n\) 次独立观察中某事件发生的次数"的现象,二项模型几乎都能登场。
4. 期望与方差:指示变量分解
若直接用定义 \(E[X]=\sum k\binom{n}{k}p^kq^{n-k}\) 计算二项随机变量的期望,将陷入繁杂的代数。下面这个证明被认为是概率论中最优雅的论证之一,其核心是 4.1 节引入的指示随机变量(indicator random variable)。
对 \(i=1,2,\ldots,n\),令
\[ I_i=\begin{cases}1, & \text{第}\ i\ \text{次试验成功},\\[2pt] 0, & \text{第}\ i\ \text{次试验失败},\end{cases} \]
则每个 \(I_i\) 都是以 \(p\) 为参数的伯努利随机变量。整个论证只有三步:
- 恒等分解:成功一次计数加 1,故 \(X=I_1+I_2+\cdots+I_n\) 恒成立(见图 3);
- 单个零件:由定理 1,\(E[I_i]=p\),\(\mathrm{Var}(I_i)=pq\);
- 组装:用期望的线性性与试验的独立性把 \(n\) 份贡献相加。
若 \(X\sim B(n,p)\),\(q=1-p\),则 \[ E[X]=np,\qquad \mathrm{Var}(X)=npq. \]
期望:由期望的线性性(4.3 节), \[ E[X]=E\Big[\sum_{i=1}^{n}I_i\Big]=\sum_{i=1}^{n}E[I_i]=\sum_{i=1}^{n}p=np. \] 注意此步不需要独立性——线性性对任意随机变量成立。
方差:记 \(X-np=\sum_{i=1}^{n}(I_i-p)\),展开平方的期望,交叉项与平方项分开处理: \[ \mathrm{Var}(X)=E\Big[\Big(\sum_{i=1}^{n}(I_i-p)\Big)^{2}\Big]=\sum_{i=1}^{n}E\big[(I_i-p)^{2}\big]\;+\;2\sum_{i<j}E\big[(I_i-p)(I_j-p)\big]. \] 对角项:\(E[(I_i-p)^2]=\mathrm{Var}(I_i)=pq\),共 \(n\) 项,合计 \(npq\)。交叉项:当 \(i\ne j\) 时,第 \(i\) 次与第 \(j\) 次试验独立,故 \(I_i\) 与 \(I_j\) 独立,于是 \[ E\big[(I_i-p)(I_j-p)\big]=E[I_i-p]\cdot E[I_j-p]=(p-p)(p-p)=0, \] 交叉项全部消失。综上 \[ \mathrm{Var}(X)=npq+0=npq. \qquad\blacksquare \]
取 \(n=1\) 即退化为定理 1,两结果互相印证。
直接展开 \(\sum k\binom{n}{k}p^kq^{n-k}\) 需要巧妙地拼凑二项式系数;而指示变量分解把一个复杂的 \(X\) 拆成 \(n\) 个最简单的零件,期望一步相加,方差中"平方展开产生交叉项、独立性使交叉项归零"的结构一目了然。这一技巧在本书还将反复亮相:第 7 章方差的性质、超几何分布期望的计算(4.8 节)等都依赖同样的思想。请记住两点:期望的线性性无需独立性;方差的可加性需要独立性(更准确地,需要协方差为零)。
某保险公司承保 10000 张一年期保单,设各保单是否出险相互独立,每张保单一年内出险的概率均为 0.001。以 \(X\) 记一年内的出险总件数,求 \(E[X]\)、\(\mathrm{Var}(X)\) 与标准差 \(\sigma_X\)。
5. 至少一次成功:反解试验次数
"至少一次成功"是二项模型中最常被问到的复合事件。事件 \(\{X\ge 1\}\) 的对立事件是 \(\{X=0\}\)(全部失败),后者只有一种模式,无需组合系数,于是
\[ P\{X\ge 1\}=1-P\{X=0\}=1-q^{\,n}. \]
反过来问:"要让至少一次成功的概率不低于某个水平 \(\alpha\),至少要做多少次试验?"由 \[ 1-q^{\,n}\ \ge\ \alpha \quad\Longleftrightarrow\quad q^{\,n}\ \le\ 1-\alpha \quad\Longleftrightarrow\quad n\ \ge\ \frac{\ln(1-\alpha)}{\ln q}, \] (因 \(0<q<1\),\(\ln q<0\),两边取对数后不等号反向),取不小于右端的最小整数即可。
(a) 掷一颗骰子 4 次,至少出现一次 6 点的概率是多少?(b) 要使"至少出现一次 6 点"的概率不低于 \(0.99\),至少需要掷多少次?
(a) \(n=4\): \[ P\{X\ge 1\}=1-\Big(\frac56\Big)^{4}=1-\frac{625}{1296}\approx 0.518, \] 只是略过一半——这正是 1.1 节提到的德·梅雷问题的一方:他凭赌桌经验相信"掷 4 次骰子赌出 6 点"占优,结论确实成立,但优势远比想象中微弱。
(b) 要求 \(1-\left(\tfrac56\right)^{n}\ge 0.99\),即 \[ n\ \ge\ \frac{\ln 0.01}{\ln(5/6)}=\frac{-4.6052}{-0.1823}\approx 25.3, \] 故取 \(n=26\)。验证:\(\left(\tfrac56\right)^{25}\approx 0.0105>0.01\)(25 次还不够),而 \(\left(\tfrac56\right)^{26}\approx 0.0087<0.01\),此时 \[ P\{X\ge 1\}=1-0.0087=0.9913\ \ge\ 0.99. \] 直觉上"概率这么小的事,掷十来次总该出了"——实际需要 26 次,可见小概率事件需要可观的重复次数来"稀释"其稀少性。
6. 本节小结
- 伯努利随机变量:\(P\{X=1\}=p\),\(P\{X=0\}=q=1-p\);\(E[X]=p\),\(\mathrm{Var}(X)=pq\)(\(p=\tfrac12\) 时方差最大)。
- 二项分布:\(n\) 重独立重复、单次成功率为 \(p\) 的试验中,成功次数 \(X\sim B(n,p)\) 的分布列为 \(\binom{n}{k}p^kq^{n-k}\);推导分两步——每个特定模式概率 \(p^kq^{n-k}\),模式数 \(\binom{n}{k}\);对 \(k\) 求和恰为 \((p+q)^n=1\)。
- 期望与方差:\(E[X]=np\),\(\mathrm{Var}(X)=npq\);指示变量分解 \(X=\sum I_i\) 的证明中,线性性给出期望,独立性使方差展开式的交叉项归零。
- 形态:\(p=0.5\) 时分布列关于 \(np\) 对称;\(p\) 偏小时右偏、峰值左移;众数为 \(\lfloor (n+1)p\rfloor\)(当 \((n+1)p\) 非整数)。
- 至少一次成功:\(P\{X\ge 1\}=1-q^n\);要使它 \(\ge\alpha\),只需 \(n\ge \ln(1-\alpha)/\ln q\)(掷骰子出 6 点、\(\alpha=0.99\) 时 \(n=26\))。
- 下一节(4.7)将看到:\(n\) 大、\(p\) 小、\(np\) 适中时,二项分布可用泊松分布近似——例 3 的保险模型正是天然素材。
练习
练习 4-6-1
将一颗骰子独立地掷 5 次,求至少出现一次 6 点的概率。
答案与提示用对立事件。\(P\{X\ge 1\}=1-\left(\tfrac56\right)^5=1-\tfrac{3125}{7776}\approx 1-0.4019=0.598\)。注意"5 次里至少一次 6 点"并不像直觉以为的那样占压倒优势。
练习 4-6-2
设 \(X\sim B(n,\,0.3)\) 且 \(E[X]=6\),求 \(n\)、\(\mathrm{Var}(X)\) 与标准差。
答案与提示由 \(np=6\) 得 \(n=6/0.3=20\);\(\mathrm{Var}(X)=npq=20\times 0.3\times 0.7=4.2\),标准差 \(\sigma=\sqrt{4.2}\approx 2.05\)。
练习 4-6-3
设 \(X\sim B(5,\,0.4)\),先算出 \(P\{X=0\}\) 与 \(P\{X=1\}\),再利用对立事件求 \(P\{X\ge 2\}\)。
答案与提示\(P\{X=0\}=0.6^5=0.07776\),\(P\{X=1\}=\binom{5}{1}\times 0.4\times 0.6^4=0.2592\),故 \(P\{X\ge 2\}=1-0.07776-0.2592=0.66304\approx 0.6630\)。逐项硬算 \(k=2,3,4,5\) 也可,但先算小 \(k\) 端再取补往往省力。
练习 4-6-4
复述定理 3 的证明:用指示变量分解 \(X=\sum I_i\) 证明 \(\mathrm{Var}(X)=npq\),并明确指出独立性在哪一步被使用;再说明为什么 \(E[X]=np\) 的成立不需要各次试验独立。
答案与提示\(\mathrm{Var}(X)=E[(\sum(I_i-p))^2]=\sum E[(I_i-p)^2]+2\sum_{i<j}E[(I_i-p)(I_j-p)]\)。第一组每项 \(=\mathrm{Var}(I_i)=pq\),共 \(n\) 项;第二组交叉项为零恰恰用到独立性:\(I_i\) 与 \(I_j\) 独立使 \(E[(I_i-p)(I_j-p)]=E[I_i-p]\,E[I_j-p]=0\)。而期望一步只用了线性性 \(E[\sum I_i]=\sum E[I_i]\),它对任意(哪怕高度相关)的随机变量都成立,故无需独立性。若没有独立性,期望仍是 \(np\),但方差会多出协方差交叉项而偏离 \(npq\)(详见第 7 章)。