- 把"观察到 \(Y\) 后预测 \(X\)"写成均方误差极小化问题,并说明采用平方准则的理由;
- 证明最佳预测为条件期望 \(E[X\mid Y]\)(平方分解与逐点最小化两条思路);
- 利用偏导数为零推导最佳线性预测系数 \(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)\)、\(b^*=\mu_X-a^*\mu_Y\),以及最小均方误差 \(\sigma_X^2(1-\rho^2)\);
- 完成由矩出发的数值预测计算(身高—体重例子),并解释"向平均回归"现象;
- 说明条件期望预测与线性预测的优劣关系,以及二元正态情形二者恰好一致的原因。
1. 预测问题与均方误差
概率论中有一类极重要的应用问题:两个相依的随机变量,我们能够观察到其中一个,却要对另一个作出推断。通信工程中接收到的是混入噪声的信号 \(Y\),要恢复发送的信号 \(X\);统计学中测得人的体重,要估计其身高;金融中持有一项资产,要用对冲头寸去"预测"(抵消)其收益的波动。这类问题统称为预测问题(prediction problem):观察到 \(Y\),选取一个只依赖 \(Y\) 的函数 \(g(Y)\),作为 \(X\) 的预测值。
要比较不同预测子的好坏,必须先指定一个"损失"的度量。本节采用最常用的均方误差(mean squared error, MSE)准则:以平方 \((X-g(Y))^2\) 惩罚误差,再取期望。它处处可微、关于 \(g\) 是凸的(因此最优解唯一、好求),对大误差施以重罚,并且与最小二乘法、正态噪声模型有深刻联系(见第 9–10 章统计部分)。当然也可以用绝对误差等准则,但平方准则下的理论最为完整优美。
设 \(E[X^2]<\infty\)。对任何函数 \(g\),以 \(g(Y)\) 预测 \(X\) 的均方误差定义为 \[ \mathrm{MSE}(g) = E\big[(X-g(Y))^2\big]. \] 若函数 \(g^*\) 使 \(\mathrm{MSE}(g^*)\le \mathrm{MSE}(g)\) 对一切 \(g\) 成立,则称 \(g^*(Y)\) 为由 \(Y\) 对 \(X\) 的最佳预测(best predictor)。
注意 \(g\) 可以是任意(可测)函数——既可以是直线,也可以是任何曲线。预测问题就是在这一切函数中选出使平均平方误差最小者。
图 1 预告了贯穿本节的一组数据(对应例 3 的模型):横轴为观察值,纵轴为被预测量,数据散布在三角形区域 \(0<x<y<1\) 内。红色曲线与蓝色直线是两个候选预测子。本节将证明:红色曲线——条件期望曲线——在均方误差意义下不可能被任何预测子击败;而蓝色直线是在"只允许使用一阶、二阶矩"约束下的最优解,也是实践中最常用的选择。
2. 最佳预测:条件期望
直觉先行。观察到的信息是 "\(Y=y\)",而预测子 \(g(Y)\) 在 \(Y=y\) 处只能给出一个常数 \(g(y)\)。于是问题化为:固定 \(y\),在一切常数 \(c\) 中找使 \(E[(X-c)^2\mid Y=y]\) 最小者。由恒等式 \[ E[(X-c)^2\mid Y=y] = \mathrm{Var}(X\mid Y=y) + \big(c-E[X\mid Y=y]\big)^2 \] 立刻看出:取 \(c=E[X\mid Y=y]\) 时第二项为零,误差只剩不可约的条件方差。条件期望(conditional expectation)正是把每个 \(y\) 处的最优常数串成的一条曲线(其定义与性质见 7.4 节)。下面的定理把这一"逐点最小化"的论证整理为严格的平方分解。
设 \(E[X^2]<\infty\),则在一切 \(Y\) 的函数中,使均方误差 \(E[(X-g(Y))^2]\) 最小的预测子为 \[ g^*(Y) = E[X\mid Y], \] 且最小均方误差为 \(E\big[\mathrm{Var}(X\mid Y)\big]\)。
由 7.4 节的全方差公式 \(\mathrm{Var}(X)=E[\mathrm{Var}(X\mid Y)]+\mathrm{Var}(E[X\mid Y])\),定理 1 的最小误差还可以写成 \[ \mathrm{Var}(X) - \mathrm{Var}\big(E[X\mid Y]\big), \] 即:观察 \(Y\) 之后,\(X\) 的不确定性从 \(\mathrm{Var}(X)\) 降去了"\(E[X\mid Y]\) 的方差"这么多。若 \(X\) 与 \(Y\) 独立,则 \(E[X\mid Y]\equiv\mu_X\),观察毫无增益——这与直觉一致。
掷两颗骰子,\(X\) 为点数和,\(Y\) 为第一颗的点数。(a) 求由 \(Y\) 预测 \(X\) 的最佳预测及其均方误差;(b) 与"不观察、只用常数预测"的最佳结果比较。
3. 最佳线性预测
定理 1 虽然给出了"终极答案",但使用它需要知道完整的联合分布——实践中往往拿不到。而在许多应用中,我们只掌握(或只能从数据估计出)均值、方差与相关系数这些矩(moments)。于是退而求其次:把 \(g\) 限制为线性函数 \(aY+b\),在"直线家族"内部寻找最优者,称为最佳线性预测(best linear predictor)。这一限制换来的是可解性、稳健性与可解释性——它正是统计中线性回归的理论原型。
先看均方误差的几何意义。图 2 中每个样本点到预测直线有一个竖直偏差(vertical deviation),平方误差恰是以偏差为边长的正方形面积;均方误差就是这些面积的平均。最佳直线 \(a^*Y+b^*\) 使平均面积最小。
设 \(\mathrm{Var}(Y)>0\),记 \(\mu_X=E[X]\),\(\mu_Y=E[Y]\)。则在一切形如 \(aY+b\) 的预测子中,使 \(E[(X-aY-b)^2]\) 最小的直线唯一,为 \[ \hat{X}^* = a^*Y+b^*,\qquad a^*=\frac{\mathrm{Cov}(X,Y)}{\mathrm{Var}(Y)}=\rho\,\frac{\sigma_X}{\sigma_Y},\qquad b^*=\mu_X-a^*\mu_Y . \]
最佳线性预测的最小均方误差为 \[ E\big[(X-a^*Y-b^*)^2\big]=\sigma_X^2\,(1-\rho^2). \]
两个直接推论值得记录。其一,误差非负,故 \(\rho^2\le 1\)——这给出 7.3 节不等式 \(|\rho|\le 1\) 的一个"二次型"证明,且 \(|\rho|=1\) 当且仅当 \(\sigma_X^2(1-\rho^2)=0\),即预测无误差、\(X\) 与 \(Y\) 存在完全线性关系。其二,\(\rho^2\) 恰是被直线"解释掉的方差比例",\(1-\rho^2\) 是剩余比例。
某成年人群体的身高 \(X\)(cm)与体重 \(Y\)(kg)满足 \(\mu_X=170\),\(\mu_Y=65\),\(\sigma_X=8\),\(\sigma_Y=6\),相关系数 \(\rho=0.6\)。(a) 求由 \(Y\) 预测 \(X\) 的最佳线性预测;(b) 观察到 \(Y=70\),预测身高;(c) 求该预测的均方误差与残差标准差,并与"不观察"情形比较。
4. 条件期望对直线:一个完整对比
线性预测类是一切函数类的子集,故其最优均方误差 \(\sigma_X^2(1-\rho^2)\) 绝不会小于条件期望的误差 \(E[\mathrm{Var}(X\mid Y)]\)。二者何时拉开差距?当条件期望曲线本身弯曲的时候。例 3 用一个"给定 \(Y\) 时 \(X\) 条件均匀"的模型把全部数量算到底——这正是图 1 的数据来源。
设 \(Y\sim U(0,1)\);给定 \(Y=y\),\(X\mid Y=y\sim\) 均匀分布 \(U(0,y)\)(联合密度 \(f(x,y)=1/y\),\(0<x<y<1\))。本例观察 \(X\)、预测 \(Y\)(把正文记号对调,两定理对称适用)。(a) 求各阶矩;(b) 求条件期望预测子;(c) 求最佳直线;(d) 比较三者的均方误差。
| 预测子 | 表达式 | 均方误差 | 解释的方差比例 |
|---|---|---|---|
| 最佳常数(不观察) | \(\tfrac12\) | \(\tfrac1{12}\approx 0.0833\) | 0% |
| 最佳直线 | \(\tfrac67 X+\tfrac27\) | \(\tfrac1{21}\approx 0.0476\) | \(\rho^2=\tfrac37\approx 42.9\%\) |
| 条件期望 | \(\dfrac{1-X}{-\ln X}\) | \(\tfrac13-\ln\tfrac43\approx 0.0457\) | \(\approx 45.2\%\) |
表 1 也提示了一个现实的折中:本例中曲线只比直线多解释约 \(2.3\%\) 的方差——非线性虽真实存在,收益却可能有限。这正是线性预测在工程与统计中长盛不衰的原因:它只依赖少数几个矩,稳健、易算、易解释。但如果条件期望弯曲得厉害(或像直线越界那样给出荒谬预测),就必须回到定理 1 的最佳预测本身。
5. 二元正态:两条预测子重合
线性预测何时"不是妥协而是恰好最优"?答案是正态分布——这是本节最重要的结论之一。
设 \((X,Y)\) 服从二元正态分布(bivariate normal distribution),参数为 \(\mu_X,\mu_Y,\sigma_X,\sigma_Y,\rho\)(\(|\rho|<1\))。则对任意 \(y\), \[ E[X\mid Y=y]=\mu_X+\rho\frac{\sigma_X}{\sigma_Y}(y-\mu_Y), \qquad \mathrm{Var}(X\mid Y=y)=\sigma_X^2(1-\rho^2), \] 条件期望是 \(y\) 的线性函数。因此最佳预测与最佳线性预测恰好一致,最小均方误差同为 \(\sigma_X^2(1-\rho^2)\)。
定理 3 为例 2 的计算补上了"合法性":若该人群的(身高,体重)近似二元正态,则 \(\hat X=0.8Y+118\) 不只是最佳直线,而且就是条件期望本身——观察到体重 70 kg 时身高的条件期望恰为 174 cm,条件方差恰为 40.96。线性预测的最优性由此获得了正态模型下的完整辩护;反之,一旦偏离正态(如例 3 的三角形支撑),线性就只是近似。
高尔顿(Francis Galton)1886 年研究亲子身高时发现:高个父母的子女平均仍高,却比父母更接近人群均值。用本节的语言,这一"向平均回归"(regression toward the mean)现象只是定理 2 的系数:\(a^*=\rho\sigma_X/\sigma_Y\)。当 \(|\rho|<1\) 时 \(a^*<\sigma_X/\sigma_Y\),父母身高每偏高一个标准差,子女身高的条件预期只偏高 \(\rho\) 个标准差(例 2 中体重偏高 1 个 \(\sigma_Y\),身高预期只偏高 0.6 个 \(\sigma_X\))。只要两个量不完全线性相关,"极端搭档"的另一方总会被拉回均值——这不是因果,而是算术。高尔顿的"regression"从此成了统计学的通用词,线性回归之名即源于此。
6. 本节小结
- 预测问题:观察到 \(Y\),用 \(g(Y)\) 预测 \(X\),以均方误差 \(E[(X-g(Y))^2]\) 为准则(定义 1)。
- 在一切函数中,最佳预测是条件期望 \(g^*(Y)=E[X\mid Y]\),最小误差 \(E[\mathrm{Var}(X\mid Y)]=\mathrm{Var}(X)-\mathrm{Var}(E[X\mid Y])\)(定理 1,平方分解证明)。
- 限定直线 \(aY+b\) 时,\(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)=\rho\sigma_X/\sigma_Y\),\(b^*=\mu_X-a^*\mu_Y\)(偏导为零推导),最小误差 \(\sigma_X^2(1-\rho^2)\)(定理 2 与推论 1)。
- \(\rho^2\) 是直线可解释的方差比例;\(|\rho|=1\) 当且仅当可无误差线性预测——这也是 \(|\rho|\le1\) 的二次型证明。
- 条件期望一般严格优于直线(例 3:\(0.04565\) 对 \(1/21\approx 0.04762\));但 \((X,Y)\) 二元正态时条件期望本身线性,二者重合(定理 3)。
- 系数 \(a^*=\rho\sigma_X/\sigma_Y\) 蕴含"向平均回归":\(|\rho|<1\) 时预测值总比观察值更靠近均值。
练习
练习 7-5-1
某生产线用测量值 \(Y\) 预测成品长度 \(X\),已知 \(\mu_X=100\),\(\mu_Y=50\),\(\sigma_X=10\),\(\sigma_Y=5\),\(\rho=0.8\)。求最佳线性预测、最小均方误差与残差标准差,并计算 \(Y=55\) 时的预测值。
答案与提示\(a^*=\rho\sigma_X/\sigma_Y=0.8\times 10/5=1.6\),\(b^*=\mu_X-a^*\mu_Y=100-1.6\times 50=20\),故 \(\hat X^*=1.6Y+20\)。最小均方误差 \(\sigma_X^2(1-\rho^2)=100\times 0.36=36\),残差标准差 \(6\)(无观察时为 \(10\))。\(Y=55\) 时 \(\hat X^*=1.6\times 55+20=108\)。
练习 7-5-2
证明定理 2:对 \(h(a,b)=E[(X-aY-b)^2]\) 令偏导数为零,解出 \(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)\) 与 \(b^*=\mu_X-a^*\mu_Y\),并说明一阶条件的解确为最小值点。
答案与提示\(\partial h/\partial b=-2E[X-aY-b]=0\) 给出 \(b=\mu_X-a\mu_Y\);代入 \(\partial h/\partial a=-2E[Y(X-aY-b)]=0\) 给出 \(E[XY]=a\,\mathrm{Var}(Y)+\mu_X\mu_Y\),即 \(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)\)。二阶条件:\(h\) 的 Hessian 矩阵为 \(2\begin{pmatrix}E[Y^2] & E[Y]\\ E[Y] & 1\end{pmatrix}\),其行列式 \(4\,\mathrm{Var}(Y)>0\) 且首项为正,故正定,\(h\) 为严格凸函数,驻点即唯一全局最小值点。
练习 7-5-3
讨论 \(\rho=0\) 时的最佳线性预测:证明它是常数 \(\mu_X\),最小均方误差为 \(\sigma_X^2\);并说明能否据此断言 "\(Y\) 对预测 \(X\) 毫无用处"。
答案与提示\(\rho=0\Rightarrow\mathrm{Cov}(X,Y)=0\Rightarrow a^*=0\),\(b^*=\mu_X\),即最优直线退化为常数 \(\mu_X\),误差 \(\sigma_X^2(1-0)=\sigma_X^2\)——线性意义上 \(Y\) 不含关于 \(X\) 的信息。但不能断言全局无用:\(\mathrm{Cov}=0\) 不等于独立(7.3 节反例:\(X\sim N(0,1)\),\(Y=X^2\),\(\mathrm{Cov}=0\) 而 \(Y\) 完全由 \(X\) 决定)。若依赖是非线性的,条件期望 \(E[X\mid Y]\) 仍可能显著不同于 \(\mu_X\) 而改进预测;"\(\rho=0\) ⇒ 最佳预测 \(=\mu_X\)"只在附加了线性或正态等条件后才对全体预测子成立。
练习 7-5-4
设 \(Y\sim U(0,1)\),给定 \(Y=y\) 时 \(X\mid Y=y\sim U(0,y)\)(例 3 的模型)。求由 \(Y\) 预测 \(X\) 的最佳预测及其均方误差,并用全方差公式加以验证。
答案与提示\(E[X\mid Y=y]=y/2\),故最佳预测 \(\hat X^*=Y/2\),均方误差 \(E[\mathrm{Var}(X\mid Y)]=E[Y^2/12]=\tfrac1{36}\approx 0.0278\)。验证:\(\mathrm{Var}(E[X\mid Y])=\mathrm{Var}(Y/2)=\tfrac1{48}\),\(E[\mathrm{Var}(X\mid Y)]=\tfrac1{36}\),两者相加 \(=\tfrac7{144}=\mathrm{Var}(X)\)(与例 3(a) 一致)。此方向上条件期望恰是过原点的直线,最佳直线与它重合——非线性差异只出现在反方向(由 \(X\) 预测 \(Y\))。