原书第 4 版 7.F 的结果编号为 7.82–7.111,依次覆盖:线性映射范数 (7.82–7.91)、低维值域最佳逼近 (7.92)、极分解 (7.93)、椭球与平行多面体 (7.95–7.107)、经奇异值看体积 (7.108–7.111),并以一张"正规算子的性质 ⟺ 特征值位置"的表格结束全章。伪逆 \(T^\dagger\) 的定义在 6.C(6.68),其奇异值分解公式在 7.E(7.75、7.78),本页将在适当处把它们与 7.F 的逼近观点统一起来。全章约定:\(\mathbf{F}\) 为 \(\mathbf{R}\) 或 \(\mathbf{C}\),\(V\)、\(W\) 是非零有限维内积空间。
线性映射的范数
奇异值分解 (singular value decomposition) 在 7.E 中已证明:若 \(T\in\mathcal{L}(V,W)\) 的正奇异值为 \(s_1,\dots,s_m\),则存在 \(V\) 中标准正交组 \(e_1,\dots,e_m\) 与 \(W\) 中标准正交组 \(f_1,\dots,f_m\),使得
\[ Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m,\qquad v\in V. \]本节的第一件事是用最大奇异值控制 \(\|Tv\|\)。
7.82(\(\|Tv\|\) 的上界) 设 \(T\in\mathcal{L}(V,W)\),\(s_1\) 是 \(T\) 的最大奇异值。则对一切 \(v\in V\) 有 \[ \|Tv\|\le s_1\|v\|. \]
证明 取上述奇异值分解。由 \(f_1,\dots,f_m\) 标准正交,
\[ \|Tv\|^2=s_1^2|\langle v,e_1\rangle|^2+\cdots+s_m^2|\langle v,e_m\rangle|^2 \le s_1^2\bigl(|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_m\rangle|^2\bigr) \le s_1^2\|v\|^2, \]其中最后一步用了 Bessel 不等式 (Bessel's inequality,6.26)。开方即得欲证者。\(\blacksquare\)
在分解式中取 \(v=e_1\),得 \(Te_1=s_1f_1\),故最大值 \(s_1\) 在单位向量 \(e_1\) 处取到,于是(编号沿用原书)
\[ 7.85\qquad \max\{\|Tv\|:v\in V,\ \|v\|\le 1\}=s_1. \]这个等式促成了下面的定义,它不再提及奇异值。
7.86(线性映射的范数) 设 \(T\in\mathcal{L}(V,W)\),定义 \(T\) 的范数 (norm of a linear map) 为 \[ \|T\|=\max\{\|Tv\|:v\in V,\ \|v\|\le 1\}. \]
一般说来,无限多个非负数的最大值未必存在;但 7.85 表明上式中的最大值确实存在(且等于最大奇异值)。注意现在 \(\|\cdot\|\) 有两重含义:内积空间中向量的范数,与线性映射的范数。二者由上下文区分;而且 \(\mathcal{L}(V,W)\) 上的范数一般不来自某个内积(原书练习 7F.21)。
7.87(范数的基本性质) 设 \(T\in\mathcal{L}(V,W)\),则
(a) \(\|T\|\ge 0\);\quad (b) \(\|T\|=0\iff T=0\);\quad (c) 对一切 \(\lambda\in\mathbf{F}\) 有 \(\|\lambda T\|=|\lambda|\,\|T\|\);
(d) 对一切 \(S\in\mathcal{L}(V,W)\) 有三角不等式 \(\|S+T\|\le\|S\|+\|T\|\)。
证明 (a) 显然。(b) 若 \(\|T\|=0\),则对一切 \(\|v\|\le1\) 有 \(Tv=0\);对任意非零 \(u\in V\),写 \(u=\|u\|\cdot(u/\|u\|)\),其中 \(u/\|u\|\) 的范数为 1,故 \(Tu=0\),从而 \(T=0\)。反向显然。(c) 由 \(\|\lambda Tv\|=|\lambda|\,\|Tv\|\) 取最大值得到。(d) 取 \(v\in V\),\(\|v\|\le1\),使 \(\|S+T\|=\|(S+T)v\|\)(最大值可取到),则
\[ \|S+T\|=\|Sv+Tv\|\le\|Sv\|+\|Tv\|\le\|S\|+\|T\|. \]证毕。\(\blacksquare\)
于是 \(\|S-T\|\) 可以看作 \(S\) 与 \(T\) 之间的距离;原书练习 7F.7 指出它确实给出 \(\mathcal{L}(V,W)\) 上的一个度量 (metric)。
7.88(\(\|T\|\) 的等价公式) 设 \(T\in\mathcal{L}(V,W)\),则
(a) \(\|T\|\) 等于 \(T\) 的最大奇异值;
(b) \(\|T\|=\max\{\|Tv\|:v\in V,\ \|v\|=1\}\);
(c) \(\|T\|\) 是使 \(\|Tv\|\le c\|v\|\) 对一切 \(v\in V\) 成立的最小常数 \(c\)。
证明 (a) 即 7.85。(b) 设 \(0<\|v\|\le1\),令 \(u=v/\|v\|\),则 \(\|u\|=1\) 且 \(\|Tu\|=\|Tv\|/\|v\|\ge\|Tv\|\),故求最大值时可只看单位向量。(c) 在 (b) 的式子里对 \(v\ne 0\) 用 \(v/\|v\|\) 得基本不等式
\[ 7.89\qquad \|Tv\|\le\|T\|\,\|v\|,\qquad v\in V. \]反之若 \(\|Tv\|\le c\|v\|\) 对一切 \(v\) 成立,则在单位球上 \(\|Tv\|\le c\),取最大值得 \(\|T\|\le c\)。\(\blacksquare\)
由 7.89 立即得到范数的次乘性 (submultiplicativity):对 \(T\in\mathcal{L}(V,U)\)、\(S\in\mathcal{L}(U,W)\),
\[ \|ST\|\le\|S\|\,\|T\|, \]因为 \(\|STv\|\le\|S\|\,\|Tv\|\le\|S\|\|T\|\|v\|\),再用 7.88(c) 即可。这个在数值分析与算子代数中无处不在的不等式,原书列为练习 7F.5。
与上界 7.82 相对,最小奇异值控制极小化增益:设 \(\dim V=n\),奇异值 \(s_1\ge\cdots\ge s_n\),则由奇异值分解与 Parseval 恒等式 (6.30(b)),
\[ \|Tv\|^2=\sum_{k=1}^{n}s_k^2|\langle v,e_k\rangle|^2 \ \Longrightarrow\ s_n\|v\|\le\|Tv\|\le s_1\|v\|, \]且两个界都在单位向量处取到(\(e_n\) 与 \(e_1\)),从而 \(\{\|Tv\|:\|v\|=1\}=[s_n,s_1]\)(原书练习 7E.4、7E.14)。若 \(T\) 可逆,对 \(T^{-1}\) 用上界便得 \(\|T^{-1}\|=1/s_n\)(练习 7E.10)。
例 1(范数的计算,依原书 7.90)。(i) 恒等算子满足 \(\|I\|=1\)。(ii) 设 \(T\in\mathcal{L}(\mathbf{F}^n)\) 的矩阵全为 1,则 \((1,\dots,1)\) 是特征值为 \(n\) 的特征向量,而 \(T\) 自伴,故奇异值为 \(n,0,\dots,0\),\(\|T\|=n\)。(iii) 若 \(V\) 有由 \(T\) 的特征向量构成的标准正交基,相应特征值为 \(\lambda_1,\dots,\lambda_n\),则 \(T\) 正规(或自伴),其奇异值为 \(|\lambda_1|,\dots,|\lambda_n|\)(7E 练习 7),故 \(\|T\|=\max_k|\lambda_k|\)。(iv) 设 \(T\in\mathcal{L}(\mathbf{R}^5)\) 的矩阵第 \(j\) 行第 \(k\) 列元素为 \(1/(j^2+k)\)。数学软件给出其最大奇异值约为 \(0.8\),最小奇异值约为 \(10^{-6}\),于是 \(\|T\|\approx0.8\),而 \(\|T^{-1}\|\approx10^{6}\):这类矩阵接近不可逆,"求逆"在数值上高度病态。范数一般不存在闭式公式,其计算通常只能数值逼近:先算 \(T^*T\),再求其最大特征值的近似值,开方即可(这正是 7.88(a) 的用途)。
7.91(伴随的范数) 设 \(T\in\mathcal{L}(V,W)\),则 \(\|T^*\|=\|T\|\)。
证明 对 \(w\in W\),由 Cauchy–Schwarz 不等式与 7.89,
\[ \|T^*w\|^2=\langle TT^*w,w\rangle\le\|TT^*w\|\,\|w\|\le\|T\|\,\|T^*w\|\,\|w\|. \]若 \(\|T^*w\|>0\),约去得 \(\|T^*w\|\le\|T\|\|w\|\);若 \(\|T^*w\|=0\) 该式平凡。由 7.88(c) 得 \(\|T^*\|\le\|T\|\)。在其中把 \(T\) 换成 \(T^*\) 并用 \((T^*)^*=T\),又得 \(\|T\|\le\|T^*\|\)。\(\blacksquare\)
另一条路线:线性映射与其伴随有相同的正奇异值(7E 练习 9),由 7.88(a) 立得 \(\|T^*\|=\|T\|\)。此外,练习 7F.19 的恒等式 \(\|T^*T\|=\|T\|^2\) 是 \(C^*\)-代数的出发点,值得亲手验证。
用低维值域逼近:截断奇异值分解
先回顾秩的刻画(7.E 的 7.68):\(T\) 的正奇异值的个数等于 \(\dim\operatorname{range} T\)。这是因为:谱定理把正算子 \(T^*T\) 对角化后,其正特征值的个数(计重数)等于 \(\dim\operatorname{range}(T^*T)\),而 7.64(c)、(d) 给出 \(\dim\operatorname{range}(T^*T)=\dim\operatorname{range}T^*=\dim\operatorname{range}T\)。翻译成矩阵语言:矩阵的秩 (rank) 等于其非零奇异值个数,这与 3.C 中"行秩等于列秩"(3.57) 相互印证——行秩与列秩的共同值,正是 \(T^*T\) 的非零特征值个数。由此还可读出维数关系:奇异值表长为 \(\dim V\),其中正的个数是 \(\dim\operatorname{range}T\),为零的个数是 \(\dim\operatorname{null}T\),而 \(T\) 满射当且仅当正奇异值个数等于 \(\dim W\)。
下面的定理是奇异值分解最漂亮的应用之一,文献中常称为Eckart–Young–Mirsky 型定理。它断言:在所有值域维数不超过 \(k\) 的线性映射中,距离 \(T\) 最近的就是"砍掉"奇异值分解后 \(k\) 项之外的截断 (truncation)。
7.92(用值域维数 \(\le k\) 的线性映射作最佳逼近) 设 \(T\in\mathcal{L}(V,W)\),正奇异值 \(s_1\ge\cdots\ge s_m\),且 \(1\le k<m\)。则
\[ \min\{\|T-S\|:S\in\mathcal{L}(V,W),\ \dim\operatorname{range}S\le k\}=s_{k+1}. \]而且,若 \(Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m\) 是 \(T\) 的一个奇异值分解,定义
\[ T_kv=s_1\langle v,e_1\rangle f_1+\cdots+s_k\langle v,e_k\rangle f_k, \]则 \(\dim\operatorname{range}T_k=k\) 且 \(\|T-T_k\|=s_{k+1}\),即 \(T_k\) 达到上述最小值。
证明 第一步:\(\|T-T_k\|=s_{k+1}\)。对 \(v\in V\),
\[ \|(T-T_k)v\|^2=\Bigl\|\sum_{j=k+1}^{m}s_j\langle v,e_j\rangle f_j\Bigr\|^2 =\sum_{j=k+1}^{m}s_j^2|\langle v,e_j\rangle|^2 \le s_{k+1}^2\sum_{j=k+1}^{m}|\langle v,e_j\rangle|^2 \le s_{k+1}^2\|v\|^2, \]末步再用 Bessel 不等式。故 \(\|T-T_k\|\le s_{k+1}\);而 \((T-T_k)e_{k+1}=s_{k+1}f_{k+1}\) 在单位向量处取等,故 \(\|T-T_k\|=s_{k+1}\)。
第二步:任意 \(\dim\operatorname{range}S\le k\) 的 \(S\) 都满足 \(\|T-S\|\ge s_{k+1}\)。此时 \(Se_1,\dots,Se_{k+1}\) 是长为 \(k+1\) 的表,落在维数 \(\le k\) 的子空间中,故线性相关:存在不全为零的 \(a_1,\dots,a_{k+1}\) 使 \(\sum_{j=1}^{k+1}a_jSe_j=0\)。令 \(u=a_1e_1+\cdots+a_{k+1}e_{k+1}\ne0\)。由 \(Su=0\) 与 \(f_1,\dots,f_{k+1}\) 标准正交,
\[ \|(T-S)u\|^2=\|Tu\|^2=\Bigl\|\sum_{j=1}^{k+1}s_ja_jf_j\Bigr\|^2 =\sum_{j=1}^{k+1}s_j^2|a_j|^2 \ge s_{k+1}^2\sum_{j=1}^{k+1}|a_j|^2 =s_{k+1}^2\|u\|^2, \]故 \(\|T-S\|\ge\|(T-S)(u/\|u\|)\|\ge s_{k+1}\)。两步合起来,\(S=T_k\) 正是所求的最小化者。\(\blacksquare\)
例 2(\(2\times2\) 矩阵的最佳秩一逼近)。设 \(A=\begin{pmatrix}3&2\\2&3\end{pmatrix}\)。\(A\) 自伴,特征值 \(5\) 与 \(1\),对应标准正交特征向量 \(u_1=\tfrac{1}{\sqrt2}(1,1)\)、\(u_2=\tfrac{1}{\sqrt2}(1,-1)\),故奇异值为 \(5,1\)。按 7.92,\(k=1\) 时
\[ T_1v=5\langle v,u_1\rangle u_1,\qquad \mathcal{M}(T_1)=5u_1u_1^{\,t}=\begin{pmatrix}5/2&5/2\\5/2&5/2\end{pmatrix}, \]\(\|T-T_1\|=s_2=1\),并且任何秩 \(\le1\) 的 \(B\) 都有 \(\|T-B\|\ge1\)。注意 \(T_1\) 完全由"最大奇异值方向" \(u_1\) 携带:它保留了 \(A\) 最主要的作用方向。
数据压缩的直觉。把 7.80 的矩阵分解 \(A=BDC^*\) 与 7.92 结合起来:\(M\times n\) 的矩阵 \(A\) 有 \(Mn\) 个元素,而秩 \(m\) 的分解 \(B,D,C\) 共只需存 \(m(M+m+n)\) 个数;取截断 \(T_k\) 后更只需 \(k(M+n+k)\) 个。当 \(k\ll m\) 时,存储量从"与面积成正比"降到"与周长成正比",而误差被第 \(k+1\) 个奇异值精确控制。这就是图像压缩与主成分方向的思想:一幅图像的矩阵在最大奇异值方向 \(f_1\) 上的分量最"重",丢弃奇异值小的高阶分量,损失的是范数意义下最小的信息。原书 7.F 虽未展开图像实例,但在 7.80 之后专门讨论了这一存储量的节省,本节定理 7.92 则说明这种截断在所有低秩选择中是最优的。原书练习 7F.22 与 7F.27 还给出两个同型的最佳逼近问题:在 \(k\) 维子空间上限制 \(T\) 使其范数最小(答案 \(s_{n-k+1}\)),以及求距离给定算子最近的酉算子。
极分解
回忆第 7 章反复使用的类比:\(\mathcal{L}(V)\) 中的伴随像 \(\mathbf{C}\) 中的共轭。复平面单位圆 (\(|z|=1\)) 对应酉算子 (unitary operators),非负实数对应正算子 (positive operators)。每个非零复数可写成
\[ z=\frac{z}{|z|}\,|z|=\frac{z}{|z|}\sqrt{\bar zz}, \]其中第一个因子模为 1。类比提示:每个 \(T\in\mathcal{L}(V)\) 应能写成一个酉算子乘以 \(\sqrt{T^*T}\)。由于 \(T^*T\) 是正算子 (7.64(a)),其唯一的正平方根 \(\sqrt{T^*T}\)(记号见 7.39、7.40)有意义。这就是极分解 (polar decomposition)。
7.93(极分解) 设 \(T\in\mathcal{L}(V)\),则存在酉算子 \(S\in\mathcal{L}(V)\) 使得 \[ T=S\sqrt{T^*T}. \]
证明 设 \(s_1,\dots,s_m\) 是 \(T\) 的正奇异值,取奇异值分解
\[ 7.94\qquad Tv=s_1\langle v,e_1\rangle f_1+\cdots+s_m\langle v,e_m\rangle f_m,\qquad v\in V, \]并把 \(e_1,\dots,e_m\) 与 \(f_1,\dots,f_m\) 分别扩充为 \(V\) 的标准正交基 \(e_1,\dots,e_n\) 与 \(f_1,\dots,f_n\)。定义 \(S\in\mathcal{L}(V)\):
\[ Sv=\langle v,e_1\rangle f_1+\cdots+\langle v,e_n\rangle f_n . \]由 Parseval 恒等式,\(\|Sv\|^2=\sum_{k=1}^n|\langle v,e_k\rangle|^2=\|v\|^2\),故 \(S\) 保范,从而是酉算子(有限维时等距即可逆)。
对 7.94 两边作用 \(T^*\) 并用 7.77 的伴随公式,得 \(T^*Tv=\sum_{k=1}^m s_k^2\langle v,e_k\rangle e_k\)。把 \(v\) 映为 \(\sum_{k=1}^m s_k\langle v,e_k\rangle e_k\) 的算子是正算子且平方等于 \(T^*T\),由正平方根的唯一性 (7.39),
\[ \sqrt{T^*T}\,v=s_1\langle v,e_1\rangle e_1+\cdots+s_m\langle v,e_m\rangle e_m . \]于是
\[ S\sqrt{T^*T}\,v=S\Bigl(\sum_{k=1}^m s_k\langle v,e_k\rangle e_k\Bigr)=\sum_{k=1}^m s_k\langle v,e_k\rangle f_k=Tv,\qquad v\in V, \]即 \(T=S\sqrt{T^*T}\)。\(\blacksquare\)
唯一性。极分解中的正算子因子没有任何任意性:若 \(T=SR\),其中 \(S\) 酉、\(R\) 正,则
\[ T^*T=RS^*SR=R^2, \]故 \(R\) 是正算子 \(T^*T\) 的正平方根,由 7.39 必有 \(R=\sqrt{T^*T}\)(原书练习 7F.30)。至于酉因子:每个 \(u\in\operatorname{range}\sqrt{T^*T}=(\operatorname{null}T)^\perp\) 都可写成 \(u=\sqrt{T^*T}\,v\),于是 \(Su=S\sqrt{T^*T}v=Tv\) 被确定,故 \(S\) 在 \((\operatorname{null}T)^\perp\) 上被 \(T\) 完全确定;而在 \(\operatorname{null}T=\{0\}\),即 \(T\) 可逆时,\(S=T(\sqrt{T^*T})^{-1}\) 在整个 \(V\) 上唯一(练习 7F.26,见本页练习 5)。当 \(T\) 不可逆时,\(S\) 在 \(\operatorname{null}T\) 上的取法可以随意(只需把 \(\operatorname{null}T\) 等距地映到 \((\operatorname{range}T)^\perp\) 上),故不唯一。原书练习 7F.27 还说明:证明中构造的 \(S\) 是距离 \(T\) 最近的酉算子。此外把极分解用于 \(T^*\) 可得对称的写法 \(T=\sqrt{TT^*}\,S'\)(练习 7F.28)。
例 3(\(2\times2\) 矩阵的显式极分解)。设 \(T\in\mathcal{L}(\mathbf{R}^2)\) 的矩阵为 \(\begin{pmatrix}0&-2\\1&0\end{pmatrix}\),即 \(T(x,y)=(-2y,x)\)。直接计算 \(T^*T\) 的矩阵为 \(\begin{pmatrix}1&0\\0&4\end{pmatrix}\),故 \(\sqrt{T^*T}(x,y)=(x,2y)\),奇异值为 \(2,1\)。令 \(S=T(\sqrt{T^*T})^{-1}\),其矩阵为
\[ \begin{pmatrix}0&-2\\1&0\end{pmatrix}\begin{pmatrix}1&0\\0&1/2\end{pmatrix}=\begin{pmatrix}0&-1\\1&0\end{pmatrix}, \]即逆时针旋转 \(90^\circ\) 的酉算子。验证:\(S\sqrt{T^*T}(x,y)=S(x,2y)=(-2y,x)=T(x,y)\)。这正是图 1 的情形:先沿坐标轴把纵轴拉伸 2 倍,再整体旋转 \(90^\circ\)。
极分解把任意算子拆成"完全被理解"的两类算子之积:酉算子(在复情形)与正算子都由谱定理完全描述(7.B、7.C、7.D)。一个值得留意的警告:\(S\) 与 \(\sqrt{T^*T}\) 一般需要不同的标准正交基来对角化;当 \(T\) 正规(且 \(\mathbf{F}=\mathbf{C}\))时,二者才可以同时对角化(原书练习 7F.31)。原书还提到,极分解也可以避开 SVD 直接用谱定理证明,但上述证明更为干净。
伪逆与最小二乘:两种观点的统一
伪逆 (pseudoinverse) \(T^\dagger\) 的定义属于 6.C:对 \(w\in W\),\(T^\dagger w\) 是唯一位于 \((\operatorname{null}T)^\perp\) 中且满足 \(TT^\dagger w=P_{\operatorname{range}T}w\) 的向量(6.68);当 \(T\) 可逆时 \(T^\dagger=T^{-1}\)(6.69(a))。7.E 的 7.75 则给出其 SVD 公式:由 \(Tv=\sum_k s_k\langle v,e_k\rangle f_k\) 得
\[ 7.78\qquad T^*w=\sum_{k=1}^m s_k\langle w,f_k\rangle e_k,\qquad T^\dagger w=\sum_{k=1}^m\frac{\langle w,f_k\rangle}{s_k}\,e_k . \]两条路线——6.C 的正交补观点与 7.E/7.F 的奇异值观点——在 \(e_1,\dots,e_m\) 是 \((\operatorname{null}T)^\perp\) 的标准正交基、\(f_1,\dots,f_m\) 是 \(\operatorname{range}T\) 的标准正交基这一事实(7E 练习 8)处会合:前者说明 \(T^\dagger\) 存在且唯一,后者给出可计算的显式公式,两者是同一对象的两种坐标。
伪逆的威力在于最小范数最小二乘解 (least squares solution of minimal norm)。当方程 \(Tx=y\) 无解时,自然的替代问题是求 \(v\) 使 \(\|Tv-y\|\) 最小;若这样的 \(v\) 不唯一,再取范数最小者。
(最小二乘的极小范数解) 设 \(T\in\mathcal{L}(V,W)\),\(y\in W\)。则 \(v\mapsto\|Tv-y\|\) 的最小值点恰为满足 \(Tv=P_{\operatorname{range}T}y\) 的 \(v\),即集合 \(T^\dagger y+\operatorname{null}T\);其中范数最小者是唯一的,就是 \(T^\dagger y\)。
证明 写 \(y=P_{\operatorname{range}T}y+u\),其中 \(u\in(\operatorname{range}T)^\perp\)。对任意 \(v\in V\),向量 \(Tv-P_{\operatorname{range}T}y\) 属于 \(\operatorname{range}T\),与 \(u\) 正交,故由勾股定理
\[ \|Tv-y\|^2=\|Tv-P_{\operatorname{range}T}y\|^2+\|u\|^2\ge\|u\|^2, \]等号成立当且仅当 \(Tv=P_{\operatorname{range}T}y=TT^\dagger y\),亦即 \(v-T^\dagger y\in\operatorname{null}T\)。故最小值点集为 \(T^\dagger y+\operatorname{null}T\)。最后,对 \(v=T^\dagger y+u'\)(\(u'\in\operatorname{null}T\)),因 \(T^\dagger y\in(\operatorname{null}T)^\perp\),有
\[ \|T^\dagger y+u'\|^2=\|T^\dagger y\|^2+\|u'\|^2, \]故在所有最小值点中 \(T^\dagger y\) 的范数严格最小(除非 \(u'=0\))。\(\blacksquare\)
矩阵版本同样实用:若 \(A=BDC^*\) 是 7.80 的分解,则 \(A^\dagger=CD^{-1}B^*\),这可由 7.78 直接读出——把正奇异值逐个换成倒数,再交换两组正交向量组的作用。数值上,病态方程组(如例 1(iv))的求解正是靠丢弃小奇异值来正则化:截断的伪逆 \(T^\dagger_k\) 以 \(1/s_{k+1}\) 为范数上界,而完全伪逆的范数 \(1/s_m\) 可能巨大。
顺带一提,7.92 与本节练习共同给出伪逆与最佳逼近的另一层联系:\(TT^\dagger=P_{\operatorname{range}T}\) 本身就是到子空间的最佳逼近;而 \(T_k\) 的截断伪逆正是 \(T^\dagger\) 只保留前 \(k\) 个奇异值的版本。两条逼近问题——"用低秩映射逼近映射"与"用值域中的点逼近目标"——都由同一组奇异值给出最优解。
椭球、平行多面体与体积
本小节(原书 7.95–7.111)把 SVD 变成几何语言,回答"算子把什么图形变成什么图形"。
7.95(球,ball) \(V\) 中以 0 为心、半径 1 的球定义为 \(B=\{v\in V:\|v\|<1\}\)。
7.96(椭球,ellipsoid,与主轴,principal axes) 设 \(f_1,\dots,f_n\) 是 \(V\) 的标准正交基,\(s_1,\dots,s_n>0\)。定义主轴为 \(s_1f_1,\dots,s_nf_n\) 的椭球为 \[ E(s_1f_1,\dots,s_nf_n)=\Bigl\{v\in V:\frac{|\langle v,f_1\rangle|^2}{s_1^2}+\cdots+\frac{|\langle v,f_n\rangle|^2}{s_n^2}<1\Bigr\}. \]
直观上,椭球就是单位球沿各 \(f_k\) 轴分别伸缩 \(s_k\) 倍所得。由 Parseval 恒等式,\(E(f_1,\dots,f_n)=B\):伸缩倍数全为 1 时椭球就是球,与基的选取无关。
例 4(椭球,依原书 7.97)。在 \(\mathbf{R}^2\) 中,若 \(f_1,f_2\) 是标准基,则 \(E(2f_1,f_2)\) 是半轴为 \(2\) 与 \(1\)、与坐标轴对齐的椭圆;若改取 \(f_1=\tfrac{1}{\sqrt2}(1,1)\)、\(f_2=\tfrac{1}{\sqrt2}(-1,1)\),则 \(E(2f_1,f_2)\) 是同样的椭圆整体旋转 \(45^\circ\)。在 \(\mathbf{R}^3\) 中,\(E(4f_1,3f_2,2f_3)\) 是半轴 \(4,3,2\) 的椭球。可见"椭球"同时编码了三个信息:主轴方向(标准正交基)、各轴长度(伸缩倍数)与位置(中心在原点)。
对 \(T\) 是 \(V\) 上的函数与 \(\Omega\subseteq V\),记 \(T(\Omega)=\{Tv:v\in\Omega\}\)(7.98)。
7.99(可逆算子把球映为椭球) 设 \(T\in\mathcal{L}(V)\) 可逆,则 \(T\) 把 \(V\) 中的球 \(B\) 映到 \(V\) 中的一个椭球上。确切地说,若 \(Tv=\sum_{k=1}^n s_k\langle v,e_k\rangle f_k\) 是 \(T\) 的奇异值分解(此时所有 \(s_k>0\)),则 \(T(B)=E(s_1f_1,\dots,s_nf_n)\)。
证明 设 \(v\in B\)。由 \(T\) 可逆知各 \(s_k\ne0\)(7.68(a)),且
\[ \sum_{k=1}^n\frac{|\langle Tv,f_k\rangle|^2}{s_k^2}=\sum_{k=1}^n|\langle v,e_k\rangle|^2=\|v\|^2<1, \]其中用了分解式给出的 \(\langle Tv,f_k\rangle=s_k\langle v,e_k\rangle\) 与 Parseval 恒等式。故 \(T(B)\subseteq E(s_1f_1,\dots,s_nf_n)\)。反之设 \(w\in E(s_1f_1,\dots,s_nf_n)\),令 \(v=\sum_k\frac{\langle w,f_k\rangle}{s_k}e_k\),则同样的计算给出 \(\|v\|<1\) 且 \(Tv=w\),故反向包含也成立。\(\blacksquare\)
由于椭球 \(E(s_1f_1,\dots,s_nf_n)\) 是"沿正交方向伸缩"算子 \(S\) 作用于 \(B\) 的像,而任意可逆 \(T\) 作用于椭球 \(E\) 时有 \(T(E)=T(S(B))=(TS)(B)\),对 \(TS\) 用 7.99 立得:可逆算子把每个椭球映为椭球(7.101)。
7.102(平行多面体,parallelepiped) 设 \(v_1,\dots,v_n\) 是 \(V\) 的基,令 \(P(v_1,\dots,v_n)=\{a_1v_1+\cdots+a_nv_n:a_1,\dots,a_n\in(0,1)\}\)。平行多面体是形如 \(u+P(v_1,\dots,v_n)\) 的集合,\(v_1,\dots,v_n\) 称为其棱 (edges)。\(\dim V=2\) 时就是平行四边形。
7.104(可逆算子把平行多面体映为平行多面体) 设 \(u\in V\),\(v_1,\dots,v_n\) 是 \(V\) 的基,\(T\in\mathcal{L}(V)\) 可逆,则 \[ T\bigl(u+P(v_1,\dots,v_n)\bigr)=Tu+P(Tv_1,\dots,Tv_n). \]
证明 \(T\) 可逆故 \(Tv_1,\dots,Tv_n\) 仍是基;对 \(a_1,\dots,a_n\in(0,1)\),线性性给出 \(T(u+\sum_k a_kv_k)=Tu+\sum_k a_kTv_k\),两边对所有系数取并即得等式。\(\blacksquare\)
7.105(长方体,box) 形如 \(u+P(r_1e_1,\dots,r_ne_n)\) 的集合称为 \(V\) 中的长方体,其中 \(r_1,\dots,r_n>0\) 且 \(e_1,\dots,e_n\) 是标准正交基,即棱相互正交的平行多面体(\(\mathbf{R}^2\) 中为矩形)。
可逆算子一般把长方体映成"斜"的平行多面体,但 SVD 选出的特殊基例外:
7.107(每个可逆算子都把某些长方体映为长方体) 设 \(T\in\mathcal{L}(V)\) 可逆,奇异值分解 \(Tv=\sum_{k=1}^n s_k\langle v,e_k\rangle f_k\) 如上。则对一切正数 \(r_1,\dots,r_n\) 与 \(u\in V\),\(T\) 把长方体 \(u+P(r_1e_1,\dots,r_ne_n)\) 映到长方体 \(Tu+P(r_1s_1f_1,\dots,r_ns_nf_n)\) 上。
证明 对 \(a_1,\dots,a_n\in(0,1)\),线性地计算:
\[ T(u+a_1r_1e_1+\cdots+a_nr_ne_n)=Tu+a_1r_1s_1f_1+\cdots+a_nr_ns_nf_n, \]因为 \(T(r_ke_k)=r_kT(e_k)=r_ks_kf_k\)。取并即得结论。\(\blacksquare\)
经奇异值看体积 (volume)。以下设 \(\mathbf{F}=\mathbf{R}\),采用直观的体积概念(可像 Riemann 积分那样用分析严格化)。最基本的约定是:长方体的体积等于各棱长之积,
\[ 7.108\qquad \operatorname{vol}\bigl(u+P(r_1e_1,\dots,r_ne_n)\bigr)=r_1\times\cdots\times r_n, \]而一般集合 \(\Omega\subseteq V\) 的体积用互不相交的长方体之并去逼近、求和取极限来理解 (7.109)。
例 5(体积变化,依原书 7.110)。设 \(T\in\mathcal{L}(\mathbf{R}^2)\) 为 \(Tv=2\langle v,e_1\rangle e_1+\langle v,e_2\rangle e_2\),即沿横轴拉伸 2 倍。用一列矩形逼近单位圆盘时,\(T\) 把每个以 \(e_1,e_2\) 为方向的矩形都映成宽度加倍、高度不变的矩形,面积恰好加倍;求和便知 \(T\) 把圆盘的面积放大 2 倍——恰是奇异值之积 \(2\times1\)。类似地,\(\mathbf{R}^3\) 中把球映为 \(E(4f_1,3f_2,2f_3)\) 的算子使体积变为 \(4\times3\times2=24\) 倍。
7.111(体积按奇异值之积变化) 设 \(\mathbf{F}=\mathbf{R}\),\(T\in\mathcal{L}(V)\) 可逆,\(\Omega\subseteq V\)。则 \[ \operatorname{vol}\,T(\Omega)=\bigl(T\ \text{的奇异值之积}\bigr)\cdot\operatorname{vol}\,\Omega. \]
证明 取 \(T\) 的奇异值分解,奇异值 \(s_1,\dots,s_n\)(全为正)。用 7.107 中 \(e\)-基方向的长方体 \(u+P(r_1e_1,\dots,r_ne_n)\) 去逼近 \(\Omega\),每个这样的长方体体积为 \(r_1\times\cdots\times r_n\),而 \(T\) 把它映为体积 \((s_1\times\cdots\times s_n)(r_1\times\cdots\times r_n)\) 的长方体 \(Tu+P(r_1s_1f_1,\dots,r_ns_nf_n)\)。像长方体们逼近 \(T(\Omega)\),且每个的体积都放大同一倍数 \(s_1\times\cdots\times s_n\),求和取极限即得结论。\(\blacksquare\)
这里的关键正是 7.107:SVD 提供了使"长方体映为长方体"的特殊基底,于是体积放大倍数可以逐块读出。最后留一个伏笔:第 9 章将证明奇异值之积等于 \(|\det T|\)(原书 9.60、9.61)。届时 7.111 就成为熟悉的公式 \(\operatorname{vol}T(\Omega)=|\det T|\cdot\operatorname{vol}\Omega\);例如例 5 中矩阵 \(\begin{pmatrix}2&0\\0&1\end{pmatrix}\) 的行列式为 2,与面积加倍吻合。
特征值决定算子的性质:本章收官
第 7 章以下面这张总表收束(语境:\(\mathbf{F}=\mathbf{C}\)、\(V\) 有限维,\(T\) 正规;第一行是唯一不需要正规性假设的行)。它把全章的定理压缩成一句话:正规算子的每种好性质,都恰好对应其特征值在复平面中的一处落点。
| 正规算子的性质 | 特征值落于 |
|---|---|
| 可逆 | \(\mathbf{C}\setminus\{0\}\) |
| 自伴 | \(\mathbf{R}\) |
| 斜 (skew,\(T^*=-T\)) | \(\{\lambda\in\mathbf{C}:\operatorname{Re}\lambda=0\}\) |
| 正交投影 | \(\{0,1\}\) |
| 正算子 | \([0,\infty)\) |
| 酉算子 | \(\{\lambda\in\mathbf{C}:|\lambda|=1\}\) |
| \(\|T\|<1\) | \(\{\lambda\in\mathbf{C}:|\lambda|<1\}\) |
表中各行都是前文的直接推论。以最后一行为例:\(\|T\|\) 等于最大奇异值 (7.85),而复正规算子的奇异值是特征值的模 (7E 练习 7),故 \(\|T\|<1\) 当且仅当一切特征值满足 \(|\lambda|<1\)。
至此,"Axler 路线"把内积空间的几何威力全部兑现:伴随 (7.A) 引出自伴与正规算子,谱定理 (7.B) 把它们彻底对角化;由此得到正算子及其平方根 (7.C),再到等距、酉算子与 QR、Cholesky 分解 (7.D);随后 SVD (7.E) 把谱定理的适用面扩张到任意线性映射,而本节 (7.F) 用它定义范数、完成最佳低秩逼近、导出极分解与伪逆公式,并把算子的几何作用(椭球、体积)完全读出。回望整章,核心工具只有一件:内积提供了"正交",正交提供了"最佳逼近",而最佳逼近的思想在谱定理、SVD、极分解、伪逆与 7.92 中反复出现。
第 8 章将暂时放下内积,回到一般向量空间上任意算子的结构问题:当算子不正规、甚至不可对角化时,必须引入广义特征向量 (generalized eigenvectors) 与幂零算子 (nilpotent operators),为最终的 Jordan 形与行列式理论做准备。
练习
练习 7.F-1
设 \(S,T\in\mathcal{L}(V,W)\)。证明反向三角不等式 \[ \bigl|\,\|S\|-\|T\|\,\bigr|\le\|S-T\|. \]
解答/提示由 7.87(d),\(\|S\|=\|(S-T)+T\|\le\|S-T\|+\|T\|\),故 \(\|S\|-\|T\|\le\|S-T\|\);交换 \(S,T\) 的角色得 \(\|T\|-\|S\|\le\|S-T\|\)。两者合并即得。
练习 7.F-2
设 \(U\) 是有限维内积空间,\(T\in\mathcal{L}(V,U)\),\(S\in\mathcal{L}(U,W)\)。证明 \(\|ST\|\le\|S\|\,\|T\|\),并举例说明等号可以严格不成立。
解答/提示对 \(v\in V\),两次使用 7.89:\(\|STv\|\le\|S\|\,\|Tv\|\le\|S\|\|T\|\,\|v\|\),再由 7.88(c) 得结论。严格不等式之例:取 \(V=U=W=\mathbf{R}^2\),\(S\) 为到第一坐标轴的投影 \((x,y)\mapsto(x,0)\),\(T\) 为到第二坐标轴的投影 \((x,y)\mapsto(0,y)\),则 \(ST=0\) 而 \(\|S\|=\|T\|=1\),故 \(\|ST\|=0<1=\|S\|\,\|T\|\)。(对照:\(S=T=\) 到第一坐标轴的投影时 \(ST=S\),等号成立。)
练习 7.F-3
设 \(T\in\mathcal{L}(V,W)\),\(v\in V\)。证明 \[ \|Tv\|=\|T\|\,\|v\|\iff T^*Tv=\|T\|^2v. \]
解答/提示若 \(T^*Tv=\|T\|^2v\),则 \(\|Tv\|^2=\langle T^*Tv,v\rangle=\|T\|^2\|v\|^2\)。反之设等式成立且 \(v\ne0\)(\(v=0\) 平凡)。记 \(c=\|T\|\),由 Cauchy–Schwarz 与 7.89 的推论 \(\|T^*Tv\|\le c^2\|v\|\):
\[ c^2\|v\|^2=\langle T^*Tv,v\rangle\le\|T^*Tv\|\,\|v\|\le c^2\|v\|^2, \]处处取等,特别地 Cauchy–Schwarz 取等,故 \(T^*Tv=\lambda v\) 对某个 \(\lambda\in\mathbf{F}\) 成立;与 \(v\) 作内积得 \(\lambda\|v\|^2=c^2\|v\|^2\),即 \(\lambda=c^2\)。
练习 7.F-4
设 \(T\in\mathcal{L}(V,W)\)。证明 \(\|T^*T\|=\|T\|^2\)。
解答/提示一方面,由练习 2 与 7.91,\(\|T^*T\|\le\|T^*\|\,\|T\|=\|T\|^2\)。另一方面,由 7.88(b) 及最大值可取到,取单位向量 \(v\) 使 \(\|Tv\|=\|T\|\);则由 Cauchy–Schwarz,
\[ \|T^*T\|\ge\|T^*Tv\|\ge\langle T^*Tv,v\rangle=\|Tv\|^2=\|T\|^2. \]两方面的估计合起来即得等式。
练习 7.F-5
设 \(T\in\mathcal{L}(V)\)。证明:\(T\) 可逆当且仅当存在唯一的酉算子 \(S\) 使 \(T=S\sqrt{T^*T}\)。(原书练习 7F.26)
解答/提示(\(\Leftarrow\)) 设这样的 \(S\) 唯一。若 \(T\) 不可逆,则 \(\operatorname{null}T\ne\{0\}\),且由 7.64(b) 知 0 是 \(T^*T\) 的特征值,故奇异值中有零。按 7.93 的证明,酉因子在 \(\operatorname{span}(e_1,\dots,e_m)=(\operatorname{null}T)^\perp\) 上被 \(Se_k=f_k\) 强制,但在 \(\operatorname{null}T\) 上可以任取:只要任选一个把 \(\operatorname{null}T\) 映到 \(\operatorname{span}(f_{m+1},\dots,f_n)=(\operatorname{range}T)^\perp\) 的酉算子即可(维数相同,这样的酉算子存在且不止一个,当 \(\dim\operatorname{null}T\ge1\) 时把某个 \(e_j\) 映为 \(-f_j\)、其余不动便得到另一个)。与唯一性矛盾,故 \(T\) 可逆。
(\(\Rightarrow\)) 设 \(T\) 可逆且 \(T=S\sqrt{T^*T}\)。此时 \(T^*T\) 从而 \(\sqrt{T^*T}\) 可逆,于是 \(S=T(\sqrt{T^*T})^{-1}\) 被唯一确定。
练习 7.F-6
设 \(T\in\mathcal{L}(V,W)\) 可逆,\(\dim V=n\),奇异值 \(s_1\ge\cdots\ge s_n>0\)。证明 \[ \min\{\|Tv\|:v\in V,\ \|v\|=1\}=s_n,\qquad \|T^{-1}\|=\frac{1}{s_n}. \]
解答/提示取奇异值分解 \(Tv=\sum_k s_k\langle v,e_k\rangle f_k\)。由 Parseval 恒等式,\(\|Tv\|^2=\sum_k s_k^2|\langle v,e_k\rangle|^2\),而 \(\sum_k|\langle v,e_k\rangle|^2=\|v\|^2=1\),故 \(s_n^2\le\|Tv\|^2\le s_1^2\),且在 \(v=e_n\)、\(v=e_1\) 处分别取等,第一式得证。对第二式:任意 \(w\in W\) 写 \(w=Tv\),则
\[ \|T^{-1}w\|=\|v\|\le\frac{\|Tv\|}{s_n}=\frac{\|w\|}{s_n}, \]由 7.88(c) 得 \(\|T^{-1}\|\le 1/s_n\);取 \(w=f_n=T(e_n)/s_n\) 知等号成立。等价地说:\(T^{-1}\) 的奇异值恰为 \(1/s_n,\dots,1/s_1\)。