第 7 章 · 期望的性质

7.5 条件期望与预测

Conditional Expectation and Prediction
学习目标
  • 把"观察到 \(Y\) 后预测 \(X\)"写成均方误差极小化问题,并说明采用平方准则的理由;
  • 证明最佳预测为条件期望 \(E[X\mid Y]\)(平方分解与逐点最小化两条思路);
  • 利用偏导数为零推导最佳线性预测系数 \(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)\)、\(b^*=\mu_X-a^*\mu_Y\),以及最小均方误差 \(\sigma_X^2(1-\rho^2)\);
  • 完成由矩出发的数值预测计算(身高—体重例子),并解释"向平均回归"现象;
  • 说明条件期望预测与线性预测的优劣关系,以及二元正态情形二者恰好一致的原因。

1. 预测问题与均方误差

概率论中有一类极重要的应用问题:两个相依的随机变量,我们能够观察到其中一个,却要对另一个作出推断。通信工程中接收到的是混入噪声的信号 \(Y\),要恢复发送的信号 \(X\);统计学中测得人的体重,要估计其身高;金融中持有一项资产,要用对冲头寸去"预测"(抵消)其收益的波动。这类问题统称为预测问题(prediction problem):观察到 \(Y\),选取一个只依赖 \(Y\) 的函数 \(g(Y)\),作为 \(X\) 的预测值。

要比较不同预测子的好坏,必须先指定一个"损失"的度量。本节采用最常用的均方误差(mean squared error, MSE)准则:以平方 \((X-g(Y))^2\) 惩罚误差,再取期望。它处处可微、关于 \(g\) 是凸的(因此最优解唯一、好求),对大误差施以重罚,并且与最小二乘法、正态噪声模型有深刻联系(见第 9–10 章统计部分)。当然也可以用绝对误差等准则,但平方准则下的理论最为完整优美。

定义 1 均方误差与最佳预测

设 \(E[X^2]<\infty\)。对任何函数 \(g\),以 \(g(Y)\) 预测 \(X\) 的均方误差定义为 \[ \mathrm{MSE}(g) = E\big[(X-g(Y))^2\big]. \] 若函数 \(g^*\) 使 \(\mathrm{MSE}(g^*)\le \mathrm{MSE}(g)\) 对一切 \(g\) 成立,则称 \(g^*(Y)\) 为由 \(Y\) 对 \(X\) 的最佳预测(best predictor)。

注意 \(g\) 可以是任意(可测)函数——既可以是直线,也可以是任何曲线。预测问题就是在这一切函数中选出使平均平方误差最小者。

图 1 预告了贯穿本节的一组数据(对应例 3 的模型):横轴为观察值,纵轴为被预测量,数据散布在三角形区域 \(0<x<y<1\) 内。红色曲线与蓝色直线是两个候选预测子。本节将证明:红色曲线——条件期望曲线——在均方误差意义下不可能被任何预测子击败;而蓝色直线是在"只允许使用一阶、二阶矩"约束下的最优解,也是实践中最常用的选择。

同一组数据的两个候选预测子 0 0.2 0.4 0.6 0.8 1.0 0 0.25 0.5 0.75 1 观察值 x(=X) 被预测量 y(=Y) 支撑边界 y=x 条件期望曲线(例 3) 最佳直线(例 3) 样本点 (x, y)
图 1:三角形支撑数据 \(0<x<y<1\)(例 3 的模型,观察量记作 \(X\)、被预测量记作 \(Y\))下的两个候选预测子:红色曲线为条件期望 \((1-x)/(-\ln x)\),蓝色直线为最佳线性预测 \(\tfrac{6}{7}x+\tfrac{2}{7}\)。曲线处处贴合数据的条件均值,均方误差更小;直线在 \(x>5/6\) 处甚至预测出超过 1 的"不可能"数值。全部计算见例 3。

2. 最佳预测:条件期望

直觉先行。观察到的信息是 "\(Y=y\)",而预测子 \(g(Y)\) 在 \(Y=y\) 处只能给出一个常数 \(g(y)\)。于是问题化为:固定 \(y\),在一切常数 \(c\) 中找使 \(E[(X-c)^2\mid Y=y]\) 最小者。由恒等式 \[ E[(X-c)^2\mid Y=y] = \mathrm{Var}(X\mid Y=y) + \big(c-E[X\mid Y=y]\big)^2 \] 立刻看出:取 \(c=E[X\mid Y=y]\) 时第二项为零,误差只剩不可约的条件方差。条件期望(conditional expectation)正是把每个 \(y\) 处的最优常数串成的一条曲线(其定义与性质见 7.4 节)。下面的定理把这一"逐点最小化"的论证整理为严格的平方分解。

定理 1 最佳预测是条件期望

设 \(E[X^2]<\infty\),则在一切 \(Y\) 的函数中,使均方误差 \(E[(X-g(Y))^2]\) 最小的预测子为 \[ g^*(Y) = E[X\mid Y], \] 且最小均方误差为 \(E\big[\mathrm{Var}(X\mid Y)\big]\)。

证明记 \(m(Y)=E[X\mid Y]\)。对任意 \(g\) 作平方分解: \[ E\big[(X-g(Y))^2\big] = E\big[(X-m(Y))^2\big] + E\big[(m(Y)-g(Y))^2\big] + 2E\big[(X-m(Y))(m(Y)-g(Y))\big]. \] 对交叉项先用重期望公式(7.4 节定理 1)再在 \(Y\) 的条件下取期望:由 \(m(Y)-g(Y)\) 是 \(Y\) 的函数,而 \(E[X-m(Y)\mid Y]=0\),得 \[ E\big[(X-m(Y))(m(Y)-g(Y))\big] = E\Big[\big(m(Y)-g(Y)\big)\,\underbrace{E\big[X-m(Y)\,\big|\,Y\big]}_{=\,0}\Big] = 0 . \] 故 \[ E\big[(X-g(Y))^2\big] = E\big[(X-m(Y))^2\big] + E\big[(m(Y)-g(Y))^2\big] \ge E\big[(X-m(Y))^2\big], \] 等号成立当且仅当 \(g(Y)=m(Y)\)(几乎必然)。又 \(X-m(Y)\) 恰为给定 \(Y\) 后的残差,故最小值等于 \(E\big[\mathrm{Var}(X\mid Y)\big]\)。证毕。

7.4 节的全方差公式 \(\mathrm{Var}(X)=E[\mathrm{Var}(X\mid Y)]+\mathrm{Var}(E[X\mid Y])\),定理 1 的最小误差还可以写成 \[ \mathrm{Var}(X) - \mathrm{Var}\big(E[X\mid Y]\big), \] 即:观察 \(Y\) 之后,\(X\) 的不确定性从 \(\mathrm{Var}(X)\) 降去了"\(E[X\mid Y]\) 的方差"这么多。若 \(X\) 与 \(Y\) 独立,则 \(E[X\mid Y]\equiv\mu_X\),观察毫无增益——这与直觉一致。

例 1 掷两颗骰子:观察一颗,预测点数和

掷两颗骰子,\(X\) 为点数和,\(Y\) 为第一颗的点数。(a) 求由 \(Y\) 预测 \(X\) 的最佳预测及其均方误差;(b) 与"不观察、只用常数预测"的最佳结果比较。

(a) 给定 \(Y=y\),\(X=y+Z\),其中 \(Z\) 为第二颗的点数,故 \(E[X\mid Y=y]=y+3.5\),最佳预测为 \[ \hat{X}^* = E[X\mid Y] = Y + 3.5 . \] 其均方误差为 \(E[\mathrm{Var}(X\mid Y)]=\mathrm{Var}(Z)=\dfrac{35}{12}\approx 2.92\)。 (b) 不观察时最佳常数预测为 \(E[X]=7\),均方误差 \(\mathrm{Var}(X)=\mathrm{Var}(Y)+\mathrm{Var}(Z)=\dfrac{35}{6}\approx 5.83\)。观察第一颗骰子使误差恰好减半。 顺带一提:这里 \(E[X\mid Y]=Y+3.5\) 本身是一条直线,故最佳线性预测与条件期望重合;\(\mathrm{Cov}(X,Y)=\mathrm{Var}(Y)=35/12\),\(\rho=1/\sqrt2\),用第 3 节的公式验证 \(\sigma_X^2(1-\rho^2)=\frac{35}{6}\cdot\frac12=\frac{35}{12}\),完全吻合。第 4 节将看到条件期望弯曲时二者如何分离。

3. 最佳线性预测

定理 1 虽然给出了"终极答案",但使用它需要知道完整的联合分布——实践中往往拿不到。而在许多应用中,我们只掌握(或只能从数据估计出)均值、方差与相关系数这些(moments)。于是退而求其次:把 \(g\) 限制为线性函数 \(aY+b\),在"直线家族"内部寻找最优者,称为最佳线性预测(best linear predictor)。这一限制换来的是可解性、稳健性与可解释性——它正是统计中线性回归的理论原型。

先看均方误差的几何意义。图 2 中每个样本点到预测直线有一个竖直偏差(vertical deviation),平方误差恰是以偏差为边长的正方形面积;均方误差就是这些面积的平均。最佳直线 \(a^*Y+b^*\) 使平均面积最小。

均方误差 = 竖直偏差正方形面积的平均 观察值 Y X 的取值 预测直线 g(Y)=aY+b 竖直偏差 e 面积=偏差²
图 2:均方误差准则的几何图景:把每个样本点到预测直线的竖直偏差(虚线段)平方——即以偏差为边长的正方形面积——再取平均。最佳直线 \(a^*Y+b^*\) 使这些正方形的平均面积最小。
定理 2 最佳线性预测的系数

设 \(\mathrm{Var}(Y)>0\),记 \(\mu_X=E[X]\),\(\mu_Y=E[Y]\)。则在一切形如 \(aY+b\) 的预测子中,使 \(E[(X-aY-b)^2]\) 最小的直线唯一,为 \[ \hat{X}^* = a^*Y+b^*,\qquad a^*=\frac{\mathrm{Cov}(X,Y)}{\mathrm{Var}(Y)}=\rho\,\frac{\sigma_X}{\sigma_Y},\qquad b^*=\mu_X-a^*\mu_Y . \]

证明目标函数 \(h(a,b)=E[(X-aY-b)^2]\) 是 \((a,b)\) 的凸二次函数,其一阶条件既是必要也是充分的。令两个偏导数为零: \[ \frac{\partial h}{\partial b}=-2E[X-aY-b]=0 \;\Longrightarrow\; b=\mu_X-a\mu_Y , \] \[ \frac{\partial h}{\partial a}=-2E\big[Y(X-aY-b)\big]=0 \;\Longrightarrow\; E[XY]=a\,E[Y^2]+b\,E[Y] . \] 把第一式的 \(b\) 代入第二式: \[ E[XY]=a\,E[Y^2]+(\mu_X-a\mu_Y)\mu_Y=a\,\mathrm{Var}(Y)+\mu_X\mu_Y, \] 即 \(a^*=\dfrac{E[XY]-\mu_X\mu_Y}{\mathrm{Var}(Y)}=\dfrac{\mathrm{Cov}(X,Y)}{\mathrm{Var}(Y)}\)(协方差的定义见 7.3 节),再由 \(\rho=\mathrm{Cov}(X,Y)/(\sigma_X\sigma_Y)\) 得 \(a^*=\rho\sigma_X/\sigma_Y\),代回得 \(b^*=\mu_X-a^*\mu_Y\)。证毕。
推论 1 最小均方误差

最佳线性预测的最小均方误差为 \[ E\big[(X-a^*Y-b^*)^2\big]=\sigma_X^2\,(1-\rho^2). \]

证明由定理 2,\(X-a^*Y-b^*=(X-\mu_X)-a^*(Y-\mu_Y)\)(残差,residual)。展开并代入 \(a^*=\mathrm{Cov}(X,Y)/\sigma_Y^2\): \[ \sigma_X^2-2a^*\mathrm{Cov}(X,Y)+a^{*2}\sigma_Y^2 =\sigma_X^2-\frac{\mathrm{Cov}(X,Y)^2}{\sigma_Y^2} =\sigma_X^2(1-\rho^2). \quad\blacksquare \]

两个直接推论值得记录。其一,误差非负,故 \(\rho^2\le 1\)——这给出 7.3 节不等式 \(|\rho|\le 1\) 的一个"二次型"证明,且 \(|\rho|=1\) 当且仅当 \(\sigma_X^2(1-\rho^2)=0\),即预测无误差、\(X\) 与 \(Y\) 存在完全线性关系。其二,\(\rho^2\) 恰是被直线"解释掉的方差比例",\(1-\rho^2\) 是剩余比例。

例 2 由体重预测身高(数值计算)

某成年人群体的身高 \(X\)(cm)与体重 \(Y\)(kg)满足 \(\mu_X=170\),\(\mu_Y=65\),\(\sigma_X=8\),\(\sigma_Y=6\),相关系数 \(\rho=0.6\)。(a) 求由 \(Y\) 预测 \(X\) 的最佳线性预测;(b) 观察到 \(Y=70\),预测身高;(c) 求该预测的均方误差与残差标准差,并与"不观察"情形比较。

(a) 先算协方差:\(\mathrm{Cov}(X,Y)=\rho\sigma_X\sigma_Y=0.6\times 8\times 6=28.8\)。于是 \[ a^*=\frac{28.8}{\sigma_Y^2}=\frac{28.8}{36}=0.8 \qquad\Big(\,=\rho\frac{\sigma_X}{\sigma_Y}=0.6\times\frac{8}{6}\,\Big), \qquad b^*=\mu_X-a^*\mu_Y=170-0.8\times 65=118 . \] 最佳线性预测为 \(\hat{X}^*=0.8\,Y+118\)。 (b) \(Y=70\) 时,\(\hat{X}^*=0.8\times 70+118=56+118=174\)(cm)。 (c) 最小均方误差 \[ \sigma_X^2(1-\rho^2)=8^2\times(1-0.36)=64\times 0.64=40.96 , \] 残差标准差 \(\sqrt{40.96}=6.4\) cm,恰为 \(0.8\,\sigma_X\)。也可直接验证:\(\mathrm{Var}(X-0.8Y)=64+0.64\times 36-1.6\times 28.8=64+23.04-46.08=40.96\)。不观察时误差为 \(\sigma_X^2=64\)(标准差 8 cm):体重这一观察把身高不确定性压缩了两成。 注意 \(a^*=0.8<\sigma_X/\sigma_Y=8/6\approx 1.33\):体重每偏离均值 1 个标准差(6 kg),身高预期只偏离 0.6 个标准差(4.8 cm)——极端个体的身高预测被"向平均值收缩",详见第 5 节注记。

4. 条件期望对直线:一个完整对比

线性预测类是一切函数类的子集,故其最优均方误差 \(\sigma_X^2(1-\rho^2)\) 绝不会小于条件期望的误差 \(E[\mathrm{Var}(X\mid Y)]\)。二者何时拉开差距?当条件期望曲线本身弯曲的时候。例 3 用一个"给定 \(Y\) 时 \(X\) 条件均匀"的模型把全部数量算到底——这正是图 1 的数据来源。

例 3 均匀条件分布:弯曲的条件期望击败一切直线

设 \(Y\sim U(0,1)\);给定 \(Y=y\),\(X\mid Y=y\sim\) 均匀分布 \(U(0,y)\)(联合密度 \(f(x,y)=1/y\),\(0<x<y<1\))。本例观察 \(X\)、预测 \(Y\)(把正文记号对调,两定理对称适用)。(a) 求各阶矩;(b) 求条件期望预测子;(c) 求最佳直线;(d) 比较三者的均方误差。

(a) 反方向的条件期望是线性的:\(E[X\mid Y=y]=y/2\),据此逐项求矩(重期望公式): \[ E[Y]=\tfrac12,\quad E[X]=E\big[\tfrac{Y}{2}\big]=\tfrac14,\quad E[XY]=E\big[Y\cdot\tfrac{Y}{2}\big]=\tfrac{E[Y^2]}{2}=\tfrac16,\quad E[X^2]=E\big[\tfrac{Y^2}{3}\big]=\tfrac19 . \] 于是 \(\mathrm{Var}(Y)=\tfrac1{12}\),\(\mathrm{Var}(X)=\tfrac19-\tfrac1{16}=\tfrac7{144}\),\(\mathrm{Cov}(X,Y)=\tfrac16-\tfrac14\cdot\tfrac12=\tfrac1{24}\)。 (b) \(X\) 的边际密度 \(f_X(x)=\int_x^1 \frac{1}{y}\,\mathrm{d}y=-\ln x\)(\(0<x<1\)),故 \[ E[Y\mid X=x]=\frac{1}{-\ln x}\int_x^1 y\cdot\frac{1}{y}\,\mathrm{d}y=\frac{1-x}{-\ln x}, \] 这是一条非线性曲线(图 1 中的红线):\(x\to 0\) 时趋于 \(0\),\(x\to 1\) 时趋于 \(1\),中间弯成弓形。 (c) 由定理 2(\(X\)、\(Y\) 互换): \[ a^*=\frac{\mathrm{Cov}(X,Y)}{\mathrm{Var}(X)}=\frac{1/24}{7/144}=\frac67,\qquad b^*=\mu_Y-a^*\mu_X=\tfrac12-\tfrac67\cdot\tfrac14=\tfrac27, \] 最佳直线为 \(\tfrac67 X+\tfrac27\)(图 1 中的蓝线)。 (d) 直线的误差:\(\rho^2=\dfrac{(1/24)^2}{(7/144)(1/12)}=\dfrac37\),故 \[ \mathrm{MSE}_{\text{直线}}=\mathrm{Var}(Y)(1-\rho^2)=\frac1{12}\cdot\frac47=\frac1{21}\approx 0.04762 . \] 条件期望的误差:由全方差公式 \(\mathrm{MSE}_{\text{条件期望}}=E[\mathrm{Var}(Y\mid X)]=\mathrm{Var}(Y)-\mathrm{Var}(E[Y\mid X])=\tfrac13-E\big[(E[Y\mid X])^2\big]\)。计算末项需用恒等式 \[ \frac{x^a-x^b}{-\ln x}=\int_a^b x^t\,\mathrm{d}t \;\Longrightarrow\; \int_0^1\frac{x^a-x^b}{-\ln x}\,\mathrm{d}x=\int_a^b\frac{\mathrm{d}t}{t+1}=\ln\frac{b+1}{a+1}, \] 于是 \[ E\big[(E[Y\mid X])^2\big]=\int_0^1\frac{(1-x)^2}{-\ln x}\,\mathrm{d}x =\int_0^1\frac{(x^0-x^1)-(x^1-x^2)}{-\ln x}\,\mathrm{d}x =\ln 2-\ln\tfrac32=\ln\tfrac43\approx 0.2877, \] \[ \mathrm{MSE}_{\text{条件期望}}=\frac13-\ln\frac43\approx 0.33333-0.28768=0.04565 . \] 结论:\(0.04565<0.04762=\tfrac1{21}\),条件期望严格优于任何直线。直观上:数据上疏下密(密度 \(\propto 1/y\))且支撑是三角形,最优拟合天然带弯;直线除了误差更大,还在 \(x>5/6\) 处给出超过 1 的预测值——落在 \(Y\) 的可能范围之外。
表 1:例 3 模型中三类预测子的均方误差对比(\(\mathrm{Var}(Y)=1/12\approx 0.0833\))
预测子表达式均方误差解释的方差比例
最佳常数(不观察)\(\tfrac12\)\(\tfrac1{12}\approx 0.0833\)0%
最佳直线\(\tfrac67 X+\tfrac27\)\(\tfrac1{21}\approx 0.0476\)\(\rho^2=\tfrac37\approx 42.9\%\)
条件期望\(\dfrac{1-X}{-\ln X}\)\(\tfrac13-\ln\tfrac43\approx 0.0457\)\(\approx 45.2\%\)

表 1 也提示了一个现实的折中:本例中曲线只比直线多解释约 \(2.3\%\) 的方差——非线性虽真实存在,收益却可能有限。这正是线性预测在工程与统计中长盛不衰的原因:它只依赖少数几个矩,稳健、易算、易解释。但如果条件期望弯曲得厉害(或像直线越界那样给出荒谬预测),就必须回到定理 1 的最佳预测本身。

5. 二元正态:两条预测子重合

线性预测何时"不是妥协而是恰好最优"?答案是正态分布——这是本节最重要的结论之一。

定理 3 二元正态情形:线性预测=条件期望

设 \((X,Y)\) 服从二元正态分布(bivariate normal distribution),参数为 \(\mu_X,\mu_Y,\sigma_X,\sigma_Y,\rho\)(\(|\rho|<1\))。则对任意 \(y\), \[ E[X\mid Y=y]=\mu_X+\rho\frac{\sigma_X}{\sigma_Y}(y-\mu_Y), \qquad \mathrm{Var}(X\mid Y=y)=\sigma_X^2(1-\rho^2), \] 条件期望是 \(y\) 的线性函数。因此最佳预测与最佳线性预测恰好一致,最小均方误差同为 \(\sigma_X^2(1-\rho^2)\)。

证明把二元正态联合密度(见 7.7 节)中的指数部分视为 \(x\) 的二次函数并对 \(x\) 配方(对 \(y\) 积分归一化),可得给定 \(Y=y\) 时 \(X\) 的条件密度为正态: \[ X\mid Y=y \;\sim\; N\!\Big(\mu_X+\rho\frac{\sigma_X}{\sigma_Y}(y-\mu_Y),\;\sigma_X^2(1-\rho^2)\Big). \] 正态分布的期望即其中参数,故条件期望线性于 \(y\)、条件方差为常数 \(\sigma_X^2(1-\rho^2)\)。既然条件期望本身落在"直线家族"内,而直线家族的最优者不可能超过全体函数的最优者(定理 1),二者必相等;且此时 \(E[\mathrm{Var}(X\mid Y)]=E[\sigma_X^2(1-\rho^2)]=\sigma_X^2(1-\rho^2)\),与推论 1 完全吻合。证毕。

定理 3 为例 2 的计算补上了"合法性":若该人群的(身高,体重)近似二元正态,则 \(\hat X=0.8Y+118\) 不只是最佳直线,而且就是条件期望本身——观察到体重 70 kg 时身高的条件期望恰为 174 cm,条件方差恰为 40.96。线性预测的最优性由此获得了正态模型下的完整辩护;反之,一旦偏离正态(如例 3 的三角形支撑),线性就只是近似。

注记 "回归"一词的由来:向平均回归

高尔顿(Francis Galton)1886 年研究亲子身高时发现:高个父母的子女平均仍高,却比父母更接近人群均值。用本节的语言,这一"向平均回归"(regression toward the mean)现象只是定理 2 的系数:\(a^*=\rho\sigma_X/\sigma_Y\)。当 \(|\rho|<1\) 时 \(a^*<\sigma_X/\sigma_Y\),父母身高每偏高一个标准差,子女身高的条件预期只偏高 \(\rho\) 个标准差(例 2 中体重偏高 1 个 \(\sigma_Y\),身高预期只偏高 0.6 个 \(\sigma_X\))。只要两个量不完全线性相关,"极端搭档"的另一方总会被拉回均值——这不是因果,而是算术。高尔顿的"regression"从此成了统计学的通用词,线性回归之名即源于此。

6. 本节小结

要点回顾
  • 预测问题:观察到 \(Y\),用 \(g(Y)\) 预测 \(X\),以均方误差 \(E[(X-g(Y))^2]\) 为准则(定义 1)。
  • 在一切函数中,最佳预测是条件期望 \(g^*(Y)=E[X\mid Y]\),最小误差 \(E[\mathrm{Var}(X\mid Y)]=\mathrm{Var}(X)-\mathrm{Var}(E[X\mid Y])\)(定理 1,平方分解证明)。
  • 限定直线 \(aY+b\) 时,\(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)=\rho\sigma_X/\sigma_Y\),\(b^*=\mu_X-a^*\mu_Y\)(偏导为零推导),最小误差 \(\sigma_X^2(1-\rho^2)\)(定理 2 与推论 1)。
  • \(\rho^2\) 是直线可解释的方差比例;\(|\rho|=1\) 当且仅当可无误差线性预测——这也是 \(|\rho|\le1\) 的二次型证明。
  • 条件期望一般严格优于直线(例 3:\(0.04565\) 对 \(1/21\approx 0.04762\));但 \((X,Y)\) 二元正态时条件期望本身线性,二者重合(定理 3)。
  • 系数 \(a^*=\rho\sigma_X/\sigma_Y\) 蕴含"向平均回归":\(|\rho|<1\) 时预测值总比观察值更靠近均值。

练习

练习 7-5-1

某生产线用测量值 \(Y\) 预测成品长度 \(X\),已知 \(\mu_X=100\),\(\mu_Y=50\),\(\sigma_X=10\),\(\sigma_Y=5\),\(\rho=0.8\)。求最佳线性预测、最小均方误差与残差标准差,并计算 \(Y=55\) 时的预测值。

答案与提示

\(a^*=\rho\sigma_X/\sigma_Y=0.8\times 10/5=1.6\),\(b^*=\mu_X-a^*\mu_Y=100-1.6\times 50=20\),故 \(\hat X^*=1.6Y+20\)。最小均方误差 \(\sigma_X^2(1-\rho^2)=100\times 0.36=36\),残差标准差 \(6\)(无观察时为 \(10\))。\(Y=55\) 时 \(\hat X^*=1.6\times 55+20=108\)。

练习 7-5-2

证明定理 2:对 \(h(a,b)=E[(X-aY-b)^2]\) 令偏导数为零,解出 \(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)\) 与 \(b^*=\mu_X-a^*\mu_Y\),并说明一阶条件的解确为最小值点。

答案与提示

\(\partial h/\partial b=-2E[X-aY-b]=0\) 给出 \(b=\mu_X-a\mu_Y\);代入 \(\partial h/\partial a=-2E[Y(X-aY-b)]=0\) 给出 \(E[XY]=a\,\mathrm{Var}(Y)+\mu_X\mu_Y\),即 \(a^*=\mathrm{Cov}(X,Y)/\mathrm{Var}(Y)\)。二阶条件:\(h\) 的 Hessian 矩阵为 \(2\begin{pmatrix}E[Y^2] & E[Y]\\ E[Y] & 1\end{pmatrix}\),其行列式 \(4\,\mathrm{Var}(Y)>0\) 且首项为正,故正定,\(h\) 为严格凸函数,驻点即唯一全局最小值点。

练习 7-5-3

讨论 \(\rho=0\) 时的最佳线性预测:证明它是常数 \(\mu_X\),最小均方误差为 \(\sigma_X^2\);并说明能否据此断言 "\(Y\) 对预测 \(X\) 毫无用处"。

答案与提示

\(\rho=0\Rightarrow\mathrm{Cov}(X,Y)=0\Rightarrow a^*=0\),\(b^*=\mu_X\),即最优直线退化为常数 \(\mu_X\),误差 \(\sigma_X^2(1-0)=\sigma_X^2\)——线性意义上 \(Y\) 不含关于 \(X\) 的信息。但不能断言全局无用:\(\mathrm{Cov}=0\) 不等于独立(7.3 节反例:\(X\sim N(0,1)\),\(Y=X^2\),\(\mathrm{Cov}=0\) 而 \(Y\) 完全由 \(X\) 决定)。若依赖是非线性的,条件期望 \(E[X\mid Y]\) 仍可能显著不同于 \(\mu_X\) 而改进预测;"\(\rho=0\) ⇒ 最佳预测 \(=\mu_X\)"只在附加了线性或正态等条件后才对全体预测子成立。

练习 7-5-4

设 \(Y\sim U(0,1)\),给定 \(Y=y\) 时 \(X\mid Y=y\sim U(0,y)\)(例 3 的模型)。求由 \(Y\) 预测 \(X\) 的最佳预测及其均方误差,并用全方差公式加以验证。

答案与提示

\(E[X\mid Y=y]=y/2\),故最佳预测 \(\hat X^*=Y/2\),均方误差 \(E[\mathrm{Var}(X\mid Y)]=E[Y^2/12]=\tfrac1{36}\approx 0.0278\)。验证:\(\mathrm{Var}(E[X\mid Y])=\mathrm{Var}(Y/2)=\tfrac1{48}\),\(E[\mathrm{Var}(X\mid Y)]=\tfrac1{36}\),两者相加 \(=\tfrac7{144}=\mathrm{Var}(X)\)(与例 3(a) 一致)。此方向上条件期望恰是过原点的直线,最佳直线与它重合——非线性差异只出现在反方向(由 \(X\) 预测 \(Y\))。