第 4 章 · 随机变量

4.5 方差

Variance
学习目标
  • 写出方差(variance)与标准差(standard deviation)的定义,并解释它们度量的是"围绕期望的散布";
  • 熟练使用两步公式 \(\mathrm{Var}(X)=E[X^2]-\mu^2\) 计算具体分布列的方差;
  • 证明并应用性质 \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\),说明平移不改变散布的原因;
  • 推导离散均匀分布 \(\{1,\dots,n\}\) 的期望 \((n+1)/2\) 与方差 \((n^2-1)/12\);
  • 用方差比较期望相同的收益方案,说明"风险"的量化含义。

1. 方差的定义:期望之外的第二个数字

4.3 节告诉我们,期望 \(E[X]=\mu\) 是分布列的"重心",它回答的是"平均而言 X 取多大"。但只知道重心并不够。设想两笔投资:A 稳获 100 万元;B 以各半概率获得 70 万元或 130 万元。两者的期望都是 100,长期平均收益完全相同,然而 B 的结果会来回大幅摆动,A 则纹丝不动。区分它们的,是取值围绕期望的散布程度方差(variance)就是对这种散布的标准度量。

一个自然的想法是看"平均偏差" \(E[X-\mu]\),但偏差有正有负,且由期望的线性性立刻得到 \(E[X-\mu]=E[X]-\mu=0\):正负恰好抵消。解决办法是先平方、再平均——平方既消除了符号,又放大了远离中心的行为,使"离谱"的取值受到更重的惩罚。

定义 1 方差与标准差

设随机变量 \(X\) 的期望 \(\mu=E[X]\) 存在。若 \(E[(X-\mu)^2]\) 有限,则称 \[ \operatorname{Var}(X) = E\big[(X-\mu)^2\big] = \sum_{x} (x-\mu)^2\, p(x) \] 为 \(X\) 的方差(variance),也记作 \(\sigma^2\);其算术平方根 \[ \sigma = \sqrt{\operatorname{Var}(X)} \] 称为 \(X\) 的标准差(standard deviation)。

直观地说,方差是"平方偏差的加权平均":每个取值 \(x\) 到中心 \(\mu\) 的距离平方 \((x-\mu)^2\),按其概率 \(p(x)\) 加权汇总。标准差 \(\sigma\) 则把量纲还原回与 \(X\) 相同的单位,可解释为"典型的偏离幅度"。

分布 A:高瘦(质量集中在 μ 附近) 0.2 0.4 0.6 p(x) μ = 100 0.2 0.6 0.2 90 100 110 Var = 40,σ ≈ 6.3 分布 B:矮胖(质量铺得更开) 0.2 0.4 0.6 p(x) μ = 100 0.2 0.2 0.2 0.2 0.2 70 85 100 115 130 Var = 450,σ ≈ 21.2 两个分布的期望同为 μ = 100,但 B 的方差是 A 的 11 倍多:期望定中心,方差定散布。
图 1:期望相同、散布不同的两个分布列。分布 A 高而瘦(取 90、100、110,概率 0.2、0.6、0.2);分布 B 矮而胖(在 70 至 130 上平坦铺开,各点概率 0.2)。金色竖线标出共同的中心 μ = 100。
注记 为什么用平方而不用绝对值

"平均绝对偏差" \(E[|X-\mu|]\) 同样度量散布,但绝对值函数在零点不可导,与期望的运算配合笨拙;而平方是光滑的二次函数,借助4.4 节期望的线性性可以展开、化简,几乎总能得到简洁的闭式(见定理 1)。更深远的是,第 8 章的切比雪夫不等式与中心极限定理正是建立在平方偏差之上——方差不是最直观的散布度量,却是最"好用"的那一个。

2. 计算公式:先算 E[X²],再减 μ²

按定义计算方差需要先知道每个取值到 \(\mu\) 的偏差,再逐项平方加权。下面的公式把这一过程化为两个更简单的期望之差,是实际计算中几乎唯一使用的方式。

定理 1 方差的计算公式

\[ \operatorname{Var}(X) = E[X^2] - \mu^2, \qquad \mu = E[X]. \]

证明将平方展开,并使用 4.4 节期望的线性性 \(E[a\,g(X)+b\,h(X)+c]=aE[g(X)]+bE[h(X)]+c\)(注意 \(\mu\) 是常数,且 \(E[X]=\mu\)): \[ \begin{aligned} \operatorname{Var}(X) &= E\big[(X-\mu)^2\big] = E\big[X^2 - 2\mu X + \mu^2\big] \\ &= E[X^2] - 2\mu\,E[X] + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2. \quad\blacksquare \end{aligned} \]

于是计算方差的标准流程是两步:第一步用 4.4 节的 \(E[g(X)]=\sum_x g(x)p(x)\) 算出 \(E[X^2]\)(取 \(g(x)=x^2\),无需先求 \((X-\mu)^2\) 的分布);第二步减去 \(\mu\) 的平方。

例 1 掷一颗骰子的方差与标准差

掷一颗均匀骰子,\(X\) 为所得点数。求 \(\operatorname{Var}(X)\) 与 \(\sigma\)。

4.3 节已算得 \(\mu = E[X] = \frac{1}{6}(1+2+\cdots+6) = \frac{7}{2}\);4.4 节例 1 已算得 \[ E[X^2] = \frac{1}{6}\sum_{k=1}^{6} k^2 = \frac{1^2+2^2+\cdots+6^2}{6} = \frac{91}{6}. \] 由定理 1, \[ \operatorname{Var}(X) = \frac{91}{6} - \Big(\frac{7}{2}\Big)^2 = \frac{91}{6} - \frac{49}{4} = \frac{364-294}{24} = \frac{35}{12} \approx 2.917, \] \[ \sigma = \sqrt{\frac{35}{12}} \approx 1.708. \] 解读:骰子的六个点数关于中心 3.5 的"典型偏离"约为 1.7 个点——尽管 \(X\) 本身永远不等于 3.5,更谈不上偏离 1.708,但作为平方偏差的平均开根,它给出了散布的合理标尺。

图 2 把定义"平方偏差的加权平均"画了出来:让骰子的六个取值作为质量点落在抛物线 \(y=(x-\mu)^2\) 上,每点携带质量 \(1/6\),则方差正是这些点高度的等权平均。

平方偏差的加权平均 = 方差(以骰子为例) (x − 3.5)² 0 2 4 6 (1−3.5)² = 6.25 (3−3.5)² = 0.25 每个圆点带质量 1/6 Var(X) = 35/12 ≈ 2.92(六个高度的等权平均) 1 2 3 4 5 6 μ = 3.5
图 2:平方偏差加权示意。骰子的六个取值(红点,各带概率 1/6)落在抛物线 \(y=(x-3.5)^2\) 上;方差就是这些点纵坐标的加权平均 35/12(金色虚线)。离 μ 越远的点被抛物线抬得越高,在方差中的贡献也越大。

3. 方差与风险:同期望的两种命运

在金融与决策问题中,期望衡量"平均回报",方差衡量"风险"(risk)——结果的不确定性或波动幅度。下面的例子是 Ross 原书风格的经典对比。

例 2 同期望、不同风险的两个投资方案

考虑期望收益相同的两个方案(单位:万元):方案 A 的收益 \(X\) 与方案 B 的收益 \(Y\) 的分布列如下。分别计算两者的方差与标准差,并说明哪个方案风险更大。

表 1:两个方案的收益分布列
收益取值(万元)060100140200
方案 A:\(p(x)\)0.250.500.25
方案 B:\(p(y)\)0.250.500.25
两个方案的期望相同: \[ E[X] = 0.25\times 60 + 0.5\times 100 + 0.25\times 140 = 100, \qquad E[Y] = 0.25\times 0 + 0.5\times 100 + 0.25\times 200 = 100. \] 二阶矩分别为 \[ E[X^2] = 0.25\times 60^2 + 0.5\times 100^2 + 0.25\times 140^2 = 900+5000+4900 = 10800, \] \[ E[Y^2] = 0.25\times 0^2 + 0.5\times 100^2 + 0.25\times 200^2 = 0+5000+10000 = 15000. \] 由定理 1 与 \(\mu^2 = 10000\): \[ \operatorname{Var}(X) = 10800 - 10000 = 800, \qquad \sigma_X = \sqrt{800} = 20\sqrt{2} \approx 28.3; \] \[ \operatorname{Var}(Y) = 15000 - 10000 = 5000, \qquad \sigma_Y = \sqrt{5000} = 50\sqrt{2} \approx 70.7. \] 两方案平均收益同为 100 万元,但 B 的标准差是 A 的 2.5 倍:A 的收益几乎总落在 100±30 万元内,B 则有四分之三的机会偏离中心至少 100 万元。若以"结果偏离预期的幅度"定义风险,B 的风险远大于 A。风险厌恶者选 A,风险偏好者才愿意承担 B 的波动去博取 200 万元——期望无法区分的方案,方差给出了决断的依据。
表 2:两方案指标对比
指标方案 A方案 B
期望 \(\mu\)100100
\(E[X^2]\)1080015000
方差 \(\operatorname{Var}\)8005000
标准差 \(\sigma\)\(\approx 28.3\)\(\approx 70.7\)

4. 线性变换与离散均匀分布

4.3 节有 \(E[aX+b]=aE[X]+b\),期望对线性变换是"一次"的;方差则不同——下面的定理表明它是"二次"的,而且与平移完全无关。

定理 2 线性变换下的方差

\[ \operatorname{Var}(aX+b) = a^2 \operatorname{Var}(X), \qquad a, b \text{ 为常数}. \]

证明记 \(\mu=E[X]\)。由 4.3 节,\(E[aX+b]=a\mu+b\),即新变量的中心是 \(a\mu+b\)。于是 \[ \begin{aligned} \operatorname{Var}(aX+b) &= E\big[(aX+b-(a\mu+b))^2\big] = E\big[(aX-a\mu)^2\big] = E\big[a^2(X-\mu)^2\big] \\ &= a^2 E\big[(X-\mu)^2\big] = a^2 \operatorname{Var}(X). \quad\blacksquare \end{aligned} \] 关键在于偏差 \(aX+b-(a\mu+b)=a(X-\mu)\):常数 \(b\) 在作差时被完全消去。

两点解读:平移不变(translation invariance)——把整个分布向右搬运 \(b\),各取值间的相对距离不变,散布自然不变;缩放平方——把所有取值放大 \(a\) 倍,偏差同乘 \(a\),平方后变为 \(a^2\),因此标准差按 \(|a|\) 倍缩放(这正是例 2 中 \(\sigma_Y=2.5\,\sigma_X\) 的原因:B 的散布宽度是 A 的 2.5 倍)。

定理 3 方差的基本性质

(1) 常数的方差为零:\(\operatorname{Var}(c)=0\);(2) 方差非负:\(\operatorname{Var}(X)\ge 0\);(3) \(\operatorname{Var}(-X)=\operatorname{Var}(X)\)。

证明(1) 常数 \(c\) 的期望为 \(c\),偏差恒为 0,故 \(\operatorname{Var}(c)=E[(c-c)^2]=0\)(在定理 2 中取 \(a=0,\ b=c\) 亦可)。(2) \((X-\mu)^2\ge 0\) 恒成立,非负随机变量的期望非负,故 \(\operatorname{Var}(X)=E[(X-\mu)^2]\ge 0\)。(3) 在定理 2 中取 \(a=-1,\ b=0\) 即得 \(\operatorname{Var}(-X)=(-1)^2\operatorname{Var}(X)=\operatorname{Var}(X)\)——镜像翻转不改变到中心的距离。证毕

反过来"方差为零意味着什么",留作练习 5:离散情形下 \(\operatorname{Var}(X)=0\) 当且仅当 \(X\) 以概率 1 等于一个常数。

作为定理 1 的系统应用,我们推导一个贯穿全书的结果:在 \(\{1,2,\dots,n\}\) 上等可能取值的离散均匀分布(discrete uniform distribution)。

定理 4 离散均匀分布的期望与方差

设 \(X\) 等可能地取 \(1,2,\dots,n\)(即 \(p(k)=1/n\))。则 \[ E[X] = \frac{n+1}{2}, \qquad \operatorname{Var}(X) = \frac{n^2-1}{12}. \]

推导期望:由求和公式 \(\sum_{k=1}^{n} k = \frac{n(n+1)}{2}\), \[ E[X] = \frac{1}{n}\sum_{k=1}^{n} k = \frac{1}{n}\cdot\frac{n(n+1)}{2} = \frac{n+1}{2}. \] 二阶矩:由 \(\sum_{k=1}^{n} k^2 = \frac{n(n+1)(2n+1)}{6}\), \[ E[X^2] = \frac{1}{n}\sum_{k=1}^{n} k^2 = \frac{(n+1)(2n+1)}{6}. \] 代入定理 1: \[ \operatorname{Var}(X) = \frac{(n+1)(2n+1)}{6} - \Big(\frac{n+1}{2}\Big)^{2} = (n+1)\,\frac{2(2n+1)-3(n+1)}{12} = \frac{(n+1)(n-1)}{12} = \frac{n^2-1}{12}. \quad\blacksquare \]

校验:\(n=6\)(骰子)时 \(\operatorname{Var}(X)=\frac{36-1}{12}=\frac{35}{12}\),与例 1 完全一致。分布铺得越宽(\(n\) 越大),方差按 \(n^2/12\) 的速度增长。

例 3 分布列 p(x) = x/21 的方差

设 \(X\) 的分布列为 \(p(x)=x/21,\ x=1,2,\dots,6\)(4.3 节例 3 已算得 \(E[X]=91/21\))。求 \(\operatorname{Var}(X)\) 与 \(\sigma\),并与均匀骰子比较。

第一步,计算二阶矩(用 \(\sum_{k=1}^{n} k^3 = \big(n(n+1)/2\big)^2\)): \[ E[X^2] = \sum_{x=1}^{6} x^2\cdot\frac{x}{21} = \frac{1}{21}\sum_{x=1}^{6} x^3 = \frac{1}{21}\cdot\Big(\frac{6\times 7}{2}\Big)^2 = \frac{441}{21} = 21. \] 第二步,减去 \(\mu^2\)。由 \(\mu = \frac{91}{21} = \frac{13}{3}\)(因 \(91=13\times 7,\ 21=3\times 7\)): \[ \operatorname{Var}(X) = 21 - \Big(\frac{13}{3}\Big)^2 = \frac{189-169}{9} = \frac{20}{9} \approx 2.222, \qquad \sigma = \sqrt{\frac{20}{9}} = \frac{2\sqrt{5}}{3} \approx 1.49. \] 与均匀骰子(\(\mu=3.5\),\(\operatorname{Var}=35/12\approx 2.92\))对比:这个偏向大点数的分布不仅期望更高(\(13/3\approx 4.33\)),方差也更小(\(20/9\approx 2.22\))——概率质量向 5、6 集中,分布反而更"稳"。

5. 本节小结

要点回顾
  • 方差是平方偏差的期望 \(\operatorname{Var}(X)=E[(X-\mu)^2]\),标准差 \(\sigma=\sqrt{\operatorname{Var}(X)}\) 与 \(X\) 同单位,度量围绕期望的散布。
  • 计算几乎总用两步公式 \(\operatorname{Var}(X)=E[X^2]-\mu^2\):先算 \(E[X^2]\),再减 \(\mu^2\);其证明只用到期望的线性性。
  • \(\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X)\):平移不改变散布(\(b\) 被偏差消去),缩放使标准差乘 \(|a|\);又 \(\operatorname{Var}(c)=0\)、\(\operatorname{Var}(X)\ge 0\)。
  • 离散均匀分布 \(\{1,\dots,n\}\):\(E[X]=\frac{n+1}{2}\),\(\operatorname{Var}(X)=\frac{n^2-1}{12}\);\(n=6\) 给出骰子的 \(35/12\)。
  • 期望相同不代表等价:方差(风险)是决策的第二个坐标——例 2 中同期望的两方案,标准差相差 2.5 倍。
  • 下一节 4.6 节将把本节工具用于伯努利与二项随机变量,得到优雅的 \(E=np\) 与 \(\operatorname{Var}=np(1-p)\)。

练习

练习 4-5-1

掷 3 枚均匀硬币,\(X\) 为正面次数。求 \(\operatorname{Var}(X)\) 与 \(\sigma\)。

答案与提示

分布列为 \(p(0),p(1),p(2),p(3)=\frac18,\frac38,\frac38,\frac18\)。\(\mu=\frac32\);\(E[X^2]=\frac{0+3+12+9}{8}=3\)。故 \(\operatorname{Var}(X)=3-\frac94=\frac34\),\(\sigma=\frac{\sqrt3}{2}\approx 0.87\)。

练习 4-5-2

\(X\) 等可能地取 \(1,2,\dots,10\)。利用定理 4 直接写出 \(E[X]\) 与 \(\operatorname{Var}(X)\),并求 \(\sigma\)。

答案与提示

\(E[X]=\frac{10+1}{2}=5.5\);\(\operatorname{Var}(X)=\frac{10^2-1}{12}=\frac{99}{12}=\frac{33}{4}=8.25\);\(\sigma=\frac{\sqrt{33}}{2}\approx 2.87\)。

练习 4-5-3

设 \(X\) 分别以概率 \(\frac14,\frac12,\frac14\) 取 \(-1,0,1\)。求 \(\operatorname{Var}(X)\) 与 \(\operatorname{Var}(2X+3)\)。

答案与提示

\(E[X]=0\),\(E[X^2]=\frac14\cdot 1+\frac14\cdot 1=\frac12\),故 \(\operatorname{Var}(X)=\frac12-0=\frac12\)。由定理 2,\(\operatorname{Var}(2X+3)=2^2\operatorname{Var}(X)=2\)——加 3 不起作用,乘 2 使方差变为 4 倍。

练习 4-5-4

证明:对任意常数 \(a,b\),\(\operatorname{Var}(aX+b)=a^2\operatorname{Var}(X)\),并指出 \(b\) 在证明的哪一步消失。

答案与提示

记 \(\mu=E[X]\),则 \(E[aX+b]=a\mu+b\),且 \(aX+b-(a\mu+b)=a(X-\mu)\)。于是 \(\operatorname{Var}(aX+b)=E[a^2(X-\mu)^2]=a^2E[(X-\mu)^2]=a^2\operatorname{Var}(X)\)。\(b\) 在计算新变量对其自身中心的偏差时被减去——平移把中心与取值一起搬动,散布不变。

练习 4-5-5

判断并证明(离散情形):\(\operatorname{Var}(X)=0\) 的充分必要条件是存在常数 \(c\) 使 \(P(X=c)=1\)。

答案与提示

充分性:若 \(P(X=c)=1\) 则 \(\mu=c\),偏差恒为 0。必要性:若 \(\operatorname{Var}(X)=\sum_x (x-\mu)^2 p(x)=0\),而和式中每一项非负,故凡 \(p(x)>0\) 的取值必有 \((x-\mu)^2=0\),即 \(x=\mu\)。于是全部概率集中在单点 \(\mu\) 上,\(P(X=\mu)=1\)。