第七章 · 7.D

7.D 等距算子、酉算子与矩阵分解

本节研究保持范数的线性映射——等距算子 (isometry),证明它的五条等价刻画:保范数、保内积、\(S^*S=I\)、把标准正交基映为标准正交组、矩阵列标准正交。随后讨论酉算子 (unitary operator,可逆的等距算子) 的代数性质与谱刻画,最后以 Gram–Schmidt 程序为核心工具,导出两类在数值线性代数中极为重要的矩阵分解:QR 分解与 Cholesky 分解,并说明它们与解线性方程组的联系。

与原书一致,本章的全章约定是:\(\mathbb{F}\) 表示 \(\mathbb{R}\) 或 \(\mathbb{C}\),\(V\) 与 \(W\) 是 \(\mathbb{F}\) 上的非零有限维内积空间;内积关于第一个变量线性、关于第二个变量共轭线性(原书约定)。本节结果的编号沿用原书第四版(7.44–7.63);其中 7.46–7.48、7.50、7.59 在原书中是证明过程中的公式编号,本页不再单独标注。此外说明:第四版 7.D 的矩阵分解部分包含QR 分解(7.56–7.60)与 Cholesky 分解(7.61–7.63)两个子节,本页与之对应;极分解在原书中编排在 7.F 节(结果号 7.93),本页只在结尾展望中提及。

等距算子

在几何中,最"温和"的变换是那些不改变任何长度(从而也不改变角度)的变换,即刚性运动。本节研究这类变换的线性部分。保持范数的线性映射足够重要,值得单独命名。

定义 7.44(等距算子, isometry). 设 \(S\in\mathcal{L}(V,W)\)。若

\[ \|Sv\|=\|v\| \quad \text{对每个 } v\in V, \]

则称 \(S\) 为一个等距算子。换言之,等距算子就是保持范数的线性映射。

词源上,希腊语 isos 意为"相等",metron 意为"度量",故 isometry 直译即"等度量"。每个等距算子都自动是单射:若 \(Sv=0\),则 \(\|v\|=\|Sv\|=\|0\|=0\),从而 \(v=0\)。因此在有限维情形,把 \(V\) 映到自身的等距算子必然可逆(单射算子在有限维空间上自动可逆);这一点在讨论酉算子时还会用到。

几何直观如下:若 \(S\) 是等距算子,则单位圆(一般地,球面)在 \(S\) 下的像仍是"同样大小"的图形;而一般的线性算子会沿不同方向以不同倍数拉伸,把单位圆变成椭圆(参见 7.F 节关于椭球的讨论)。图 1 对比了这两种情形。

等距算子(旋转):圆映为圆 一般算子:圆映为椭圆 θ v Sv |v| = |Sv| = 1,内积与角度保持 v Tv |Tv| ≠ |v|:沿两轴伸缩比不同(此处 ×2 与 ×0.6)
图 1:等距算子保持长度与角度——单位圆在旋转之下映到自身(左,红虚线与蓝实线重合);一般线性算子把单位圆映为椭圆,长度不再保持(右)。

下面的例子给出等距算子的一个普遍来源:只要把某个标准正交基映到一个标准正交组,就自动得到等距算子。

例 1(标准正交基映到标准正交组 \(\Rightarrow\) 等距;原书 7.45). 设 \(e_1,\dots,e_n\) 是 \(V\) 的标准正交基,\(g_1,\dots,g_n\) 是 \(W\) 中的标准正交组。设 \(S\in\mathcal{L}(V,W)\) 是满足 \(Se_k=g_k\)(\(k=1,\dots,n\))的唯一线性映射。由 Parseval 等式,对任意 \(v\in V\),

\[ v=\langle v,e_1\rangle e_1+\cdots+\langle v,e_n\rangle e_n, \qquad \|v\|^2=|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_n\rangle|^2. \]

对第一个展开式两边作用 \(S\),并利用 \(g_1,\dots,g_n\) 标准正交,得

\[ Sv=\langle v,e_1\rangle g_1+\cdots+\langle v,e_n\rangle g_n, \qquad \|Sv\|^2=|\langle v,e_1\rangle|^2+\cdots+|\langle v,e_n\rangle|^2. \]

两式比较即得 \(\|Sv\|=\|v\|\),故 \(S\) 是等距算子。∎

例 2(恒等与坐标置换). 恒等算子 \(I\) 显然是等距算子。更有代表性的例子是坐标置换:设 \(\sigma\) 是 \(\{1,\dots,n\}\) 的一个置换,定义 \(S\in\mathcal{L}(\mathbb{F}^n)\) 为

\[ S(z_1,\dots,z_n)=(z_{\sigma(1)},\dots,z_{\sigma(n)}). \]

则 \(\langle Sz,Sw\rangle=\sum_{k=1}^n z_{\sigma(k)}\overline{w_{\sigma(k)}}=\langle z,w\rangle\),故 \(S\) 保持内积,从而(由下面的定理 7.49)是等距算子;其伴随 \(S^*\) 就是把坐标按逆置换重新排列,且 \(S^{-1}=S^*\)。相应的矩阵(置换矩阵)的每一行、每一列都恰有一个 1,是正交矩阵的特例。当 \(n=2\)、\(\sigma\) 交换两个坐标时,\(S(w,z)=(z,w)\) 恰是关于直线 \(y=x\) 的反射(见例 4)。

等距算子的等价刻画

下面的定理把"保长度"与其他四个彼此很不相同的角度——代数(\(S^*S=I\))、内积、标准正交组、矩阵的列——联系起来,是本节的基础结果。其中 (a) 与 (c) 的等价说明:保持范数的线性映射自动保持全部内积,从而保持角度(角度经由内积的余弦定义)。(a) 与 (d) 的等价说明例 1 中的情形实际上穷尽了所有等距算子;而且由于 (a) 不依赖于基的选取,线性映射是等距算子当且仅当它把每一个标准正交基映为标准正交组。

定理 7.49(等距算子的刻画). 设 \(S\in\mathcal{L}(V,W)\),\(e_1,\dots,e_n\) 是 \(V\) 的标准正交基,\(f_1,\dots,f_m\) 是 \(W\) 的标准正交基。则下列条件等价:

(a) \(S\) 是等距算子;

(b) \(S^*S=I\)(其中 \(I\) 是 \(V\) 上的恒等算子);

(c) \(\langle Su,Sv\rangle=\langle u,v\rangle\) 对所有 \(u,v\in V\) 成立;

(d) \(Se_1,\dots,Se_n\) 是 \(W\) 中的标准正交组;

(e) 矩阵 \(\mathcal{M}\bigl(S,(e_1,\dots,e_n),(f_1,\dots,f_m)\bigr)\) 的各列构成 \(\mathbb{F}^m\) 中(关于欧几里得内积的)标准正交组。

证明. (a)\(\Rightarrow\)(b):设 \(S\) 是等距算子。对任意 \(v\in V\),

\[ \bigl\langle (I-S^*S)v,\,v\bigr\rangle=\langle v,v\rangle-\langle S^*Sv,v\rangle =\|v\|^2-\langle Sv,Sv\rangle=\|v\|^2-\|Sv\|^2=0. \]

算子 \(I-S^*S\) 是自伴的,故由 7.A 节的结果(自伴算子 \(T\) 若满足 \(\langle Tv,v\rangle=0\) 对一切 \(v\) 成立,则 \(T=0\),原书 7.16)得 \(I-S^*S=0\),即 \(S^*S=I\)。

(b)\(\Rightarrow\)(c):若 \(S^*S=I\),则对 \(u,v\in V\),

\[ \langle Su,Sv\rangle=\langle S^*Su,v\rangle=\langle Iu,v\rangle=\langle u,v\rangle. \]

(c)\(\Rightarrow\)(d):取 \(u=e_j\),\(v=e_k\),得 \(\langle Se_j,Se_k\rangle=\langle e_j,e_k\rangle\),后者当 \(j=k\) 时为 1、当 \(j\ne k\) 时为 0,故 \(Se_1,\dots,Se_n\) 是标准正交组。

(d)\(\Rightarrow\)(e):记 \(A=\mathcal{M}\bigl(S,(e_1,\dots,e_n),(f_1,\dots,f_m)\bigr)\),则 \(Se_k=\sum_{j=1}^m A_{j,k}f_j\)。由 \(f_1,\dots,f_m\) 标准正交,对任意 \(k,r\in\{1,\dots,n\}\),

\[ \sum_{j=1}^m A_{j,k}\overline{A_{j,r}} =\Bigl\langle \sum_{j=1}^m A_{j,k}f_j,\ \sum_{j=1}^m A_{j,r}f_j\Bigr\rangle =\langle Se_k,Se_r\rangle= \begin{cases}1, & k=r,\\ 0, & k\ne r.\end{cases} \]

上式左端恰是 \(A\) 的第 \(k\) 列与第 \(r\) 列(视为 \(\mathbb{F}^m\) 中的向量)的欧几里得内积,故 \(A\) 的列是标准正交组。

(e)\(\Rightarrow\)(a):设 \(A\) 的列是 \(\mathbb{F}^m\) 中的标准正交组。上面的计算反过来说明 \(\langle Se_k,Se_r\rangle\) 等于 \(A\) 的第 \(k\) 列与第 \(r\) 列的内积,从而 \(Se_1,\dots,Se_n\) 是 \(W\) 中的标准正交组。于是例 1 的论证(把 \(Se_1,\dots,Se_n\) 当作那里的 \(g_1,\dots,g_n\))表明 \(\|Sv\|=\|v\|\) 对一切 \(v\in V\) 成立,即 \(S\) 是等距算子。

至此 (a)\(\Rightarrow\)(b)\(\Rightarrow\)(c)\(\Rightarrow\)(d)\(\Rightarrow\)(e)\(\Rightarrow\)(a),证明完成。∎

条件 (e) 用矩阵语言说就是:等距算子在标准正交基下的矩阵是列标准正交的。当 \(m=n\) 时,这样的方阵就是下面 7.56 意义下的酉矩阵;当 \(m\gt n\) 时则是列标准正交的"瘦长"矩阵,这也是最小二乘理论中的标准对象。原书本节练习 1 与练习 11 还给出了更多等价条件(例如:只要对每个长度为 2 的标准正交组 \(e_1,e_2\),像 \(Se_1,Se_2\) 都标准正交,就足以保证 \(S\) 是等距算子)。

酉算子

现在把注意力集中到从一个空间到自身的线性映射,即算子上。

定义 7.51(酉算子, unitary operator). 设 \(S\in\mathcal{L}(V)\)。若 \(S\) 是可逆的等距算子,则称 \(S\) 为酉算子

两点说明。第一,在有限维空间上,"可逆"一词其实是冗余的:每个等距算子都是单射,而有限维空间上的单射算子自动可逆;原书保留"可逆"是为了与无穷维内积空间文献中的定义保持一致。第二,术语习惯:在内积空间的语境中,很多教材把这样的算子称为正交算子 (orthogonal operator);相应地,实数域上的酉矩阵称为正交矩阵 (orthogonal matrix),即满足 \(Q^{\mathsf{T}}Q=I\) 的实方阵。本页沿用原书,统一使用"酉"一词,\(\mathbb{F}=\mathbb{R}\) 与 \(\mathbb{F}=\mathbb{C}\) 均适用。

无穷维的补充例子(超出本章有限维约定,仅供理解"可逆"为何要写进定义):在由平方可和序列组成的空间 \(\ell^2\subset\mathbb{F}^\infty\) 上,定义前向移位 (unilateral shift)

\[ S(z_1,z_2,z_3,\dots)=(0,z_1,z_2,\dots). \]

则 \(\|Sz\|^2=\sum_{k\ge 2}|z_{k-1}|^2=\|z\|^2\),故 \(S\) 是等距算子;但 \(S\) 的像由第一坐标为 \(0\) 的序列组成,\(S\) 不满,从而不可逆——这是"等距而非酉"的典型例子。它的伴随是后向移位 \(S^*(z_1,z_2,z_3,\dots)=(z_2,z_3,\dots)\),它满而不单,不是等距算子。

例 3(\(\mathbb{R}^2\) 的旋转;原书 7.52). 设 \(\theta\in\mathbb{R}\),\(S\) 是 \(\mathbb{F}^2\) 上矩阵(在标准基下)为

\[ \begin{pmatrix}\cos\theta & -\sin\theta\\ \sin\theta & \cos\theta\end{pmatrix} \]

的算子。该矩阵的两个列 \((\cos\theta,\sin\theta)\) 与 \((-\sin\theta,\cos\theta)\) 构成 \(\mathbb{F}^2\) 的标准正交组,故由定理 7.49 中 (a) 与 (e) 的等价,\(S\) 是等距算子,从而是酉算子。当 \(\mathbb{F}=\mathbb{R}\) 时,\(S\) 就是绕原点逆时针旋转 \(\theta\) 弧度;这也从几何上解释了为什么 \(S\) 保持范数。

例 4(反射). 设 \(\varphi\in\mathbb{R}\),考虑 \(\mathbb{R}^2\) 中关于过原点、倾角为 \(\varphi\) 的直线的反射 \(S_\varphi\)。容易写出

\[ S_\varphi(x,y)=\bigl(x\cos 2\varphi+y\sin 2\varphi,\ x\sin 2\varphi-y\cos 2\varphi\bigr), \qquad \mathcal{M}(S_\varphi)=\begin{pmatrix}\cos 2\varphi & \sin 2\varphi\\ \sin 2\varphi & -\cos 2\varphi\end{pmatrix}. \]

该矩阵对称(故 \(S_\varphi\) 自伴),且两个列标准正交,故 \(S_\varphi\) 是酉算子,且 \(S_\varphi^{-1}=S_\varphi^*=S_\varphi\),\(S_\varphi^2=I\);其特征值为 \(1\) 与 \(-1\),绝对值都是 1,与下面的定理 7.54 一致。取 \(\varphi=\pi/4\) 得矩阵 \(\begin{pmatrix}0&1\\1&0\end{pmatrix}\),即例 2 中的坐标交换——它既是置换又是反射。旋转与反射恰好穷尽 \(\mathbb{R}^2\) 的全部酉算子:行列式为 \(+1\) 的是旋转,为 \(-1\) 的是反射。

下面的定理把定理 7.49 的条件平移到算子的情形,并因"映到自身"的语境而增添新的等价条件。注意与 7.49 的差别:等距只需 \(S^*S=I\),而酉算子要求 \(S^*S=SS^*=I\)(两边都要);7.49(d) 说的是标准正交组,7.53(d) 说的是标准正交基;7.49(e) 谈矩阵的列,7.53(e) 谈矩阵的行。

定理 7.53(酉算子的刻画). 设 \(S\in\mathcal{L}(V)\),\(e_1,\dots,e_n\) 是 \(V\) 的标准正交基。则下列条件等价:

(a) \(S\) 是酉算子;

(b) \(S^*S=SS^*=I\);

(c) \(S\) 可逆且 \(S^{-1}=S^*\);

(d) \(Se_1,\dots,Se_n\) 是 \(V\) 的标准正交基;

(e) 矩阵 \(\mathcal{M}\bigl(S,(e_1,\dots,e_n)\bigr)\) 的各行构成 \(\mathbb{F}^n\) 的标准正交基(欧几里得内积);

(f) \(S^*\) 是酉算子。

证明. (a)\(\Rightarrow\)(b):设 \(S\) 酉。由 \(S\) 是等距算子及定理 7.49 中 (a) 与 (b) 的等价,得 \(S^*S=I\)。两边右乘 \(S^{-1}\),得 \(S^*=S^{-1}\),于是 \(SS^*=SS^{-1}=I\)。

(b)\(\Rightarrow\)(c):这正是可逆与逆的定义。

(c)\(\Rightarrow\)(d):由 \(S^{-1}=S^*\) 得 \(S^*S=I\),故由定理 7.49 中 (b) 与 (d) 的等价,\(Se_1,\dots,Se_n\) 是标准正交组;其长度恰为 \(n=\dim V\),而 \(n\) 个向量组成的标准正交组线性无关,故是 \(V\) 的标准正交基。

(d)\(\Rightarrow\)(e):由 (d) 及定理 7.49 中 (a) 与 (d) 的等价,\(S\) 是等距算子;作为有限维空间上的算子,\(S\) 可逆,故 \(S\) 酉。于是由本证明中已经建立的 (a)\(\Rightarrow\)(b),有 \(SS^*=I\),从而

\[ (S^*)^*S^*=SS^*=I, \]

由定理 7.49((a) 与 (b) 等价,应用于 \(S^*\))知 \(S^*\) 是等距算子;再由 7.49((a) 与 (e) 等价),\(\mathcal{M}(S^*,(e_1,\dots,e_n))\) 的列构成 \(\mathbb{F}^n\) 的标准正交组。而 \(\mathcal{M}(S^*)=\mathcal{M}(S)^*\)(共轭转置),故 \(\mathcal{M}(S)\) 的第 \(k\) 行逐分量取共轭后恰是 \(\mathcal{M}(S^*)\) 的第 \(k\) 列;对一组向量逐个取共轭不改变它们之间内积是否为零、也不改变范数(因为 \(\langle \bar x,\bar y\rangle=\overline{\langle x,y\rangle}\)),故 \(\mathcal{M}(S)\) 的各行构成 \(\mathbb{F}^n\) 的标准正交基。

(e)\(\Rightarrow\)(f):(e) 说明 \(\mathcal{M}(S^*)\) 的列(即 \(\mathcal{M}(S)\) 各行的共轭)构成 \(\mathbb{F}^n\) 的标准正交基,由定理 7.49 中 (a) 与 (e) 的等价,\(S^*\) 是等距算子,从而(作为有限维空间上的算子)可逆,故 \(S^*\) 酉。

(f)\(\Rightarrow\)(a):把已证的 (a)\(\Rightarrow\)(f) 应用于 \(S^*\),得 \((S^*)^*=S\) 是酉算子。

于是 (a)\(\Rightarrow\)(b)\(\Rightarrow\)(c)\(\Rightarrow\)(d)\(\Rightarrow\)(e)\(\Rightarrow\)(f)\(\Rightarrow\)(a),证毕。∎

推论(酉算子是正规的). 条件 (b) 表明酉算子 \(S\) 满足 \(S^*S=SS^*\),即 \(S\) 正规。因此复谱定理适用于酉算子——这正是下面谱刻画 (7.55) 的入口。此外,(c) 说明酉算子的作用可以"原路返回":\(S^{-1}=S^*\),这在数值上是极其优良的性质(转置加取共轭即可得到逆)。

回忆贯穿本章的类比:\(\mathcal{L}(V)\) 与 \(\mathbb{C}\) 类比,伴随对应于复共轭——自伴算子对应实数,正算子对应非负实数。复平面上还有一个特殊子集:单位圆 \(\{z\in\mathbb{C}:|z|=1\}\),其特征是 \(\bar z z=1\),恰与 \(S^*S=I\) 对应。所以,酉算子对应单位圆上的复数。下面的两个结果是这个类比的直接体现。

定理 7.54(酉算子的特征值绝对值为 1). 酉算子的每个特征值 \(\lambda\) 都满足 \(|\lambda|=1\)。

证明. 设 \(S\in\mathcal{L}(V)\) 酉,\(\lambda\) 是 \(S\) 的特征值,取 \(v\ne 0\) 使 \(Sv=\lambda v\)。则

\[ |\lambda|\,\|v\|=\|\lambda v\|=\|Sv\|=\|v\|. \]

由 \(\|v\|\ne 0\) 得 \(|\lambda|=1\)。∎

定理 7.55(复内积空间上酉算子的谱刻画). 设 \(\mathbb{F}=\mathbb{C}\),\(S\in\mathcal{L}(V)\)。则下列条件等价:

(a) \(S\) 是酉算子;

(b) \(V\) 有由 \(S\) 的特征向量构成的标准正交基,且相应的特征值绝对值全为 1。

证明. (a)\(\Rightarrow\)(b):设 \(S\) 酉。由定理 7.53(b),\(S\) 正规,故复谱定理(7.B 节)给出由 \(S\) 的特征向量构成的标准正交基;再由定理 7.54,相应特征值的绝对值全为 1。

(b)\(\Rightarrow\)(a):设 \(e_1,\dots,e_n\) 是由 \(S\) 的特征向量构成的标准正交基,对应特征值 \(\lambda_1,\dots,\lambda_n\),每个 \(|\lambda_k|=1\)。则对任意 \(j,k\),

\[ \langle Se_j,Se_k\rangle=\langle \lambda_j e_j,\lambda_k e_k\rangle=\lambda_j\overline{\lambda_k}\langle e_j,e_k\rangle= \begin{cases}0, & j\ne k,\\ 1, & j=k,\end{cases} \]

其中用到 \(|\lambda_j|=1\) 保证 \(\lambda_j\overline{\lambda_j}=1\)。故 \(Se_1,\dots,Se_n\) 是标准正交基,由定理 7.53 中 (a) 与 (d) 的等价,\(S\) 酉。∎

因此,复有限维内积空间上的酉算子恰是"在某个标准正交基下以单位圆上的数为对角元"的算子:几何上就是沿若干两两垂直的方向各旋转一个角度。例如例 3 中取 \(\mathbb{F}=\mathbb{C}\) 时,\(S\) 的特征值为 \(e^{i\theta}\) 与 \(e^{-i\theta}\),对应的标准正交特征向量是 \(\tfrac{1}{\sqrt2}(i,1)\) 与 \(\tfrac{1}{\sqrt2}(-i,1)\)。

QR 分解

从本小节起,我们把视角从算子转向矩阵,并练习在"算子语言"与"矩阵语言"之间来回翻译。约定:谈到 \(n\times n\) 方阵时,把它等同于 \(\mathbb{F}^n\) 上(取欧几里得内积、标准基)的算子。先把"酉"移植到矩阵上。

定义 7.56(酉矩阵, unitary matrix). 若 \(n\times n\) 矩阵的各列构成 \(\mathbb{F}^n\) 中的标准正交组(等价地,标准正交基),则称它为酉矩阵

由定理 7.49 中 (a) 与 (e) 的等价:\(S\in\mathcal{L}(V)\) 酉当且仅当它在任意两个标准正交基下的矩阵是酉矩阵。下面的刻画中,\(Qv\) 表示矩阵与列向量的乘积,\(\|{\cdot}\|\) 是 \(\mathbb{F}^n\) 上的欧几里得范数,\(Q^*\) 表示共轭转置。原书把它的证明留作练习(本节练习 17),此处补全。

定理 7.57(酉矩阵的刻画). 设 \(Q\) 是 \(n\times n\) 矩阵。则下列条件等价:

(a) \(Q\) 是酉矩阵;

(b) \(Q\) 的各行构成 \(\mathbb{F}^n\) 中的标准正交组;

(c) \(\|Qv\|=\|v\|\) 对每个 \(v\in\mathbb{F}^n\) 成立;

(d) \(Q^*Q=QQ^*=I\)(\(n\times n\) 单位阵)。

证明. 记 \(Q\) 的第 \(k\) 列为 \(q_k\in\mathbb{F}^n\)、第 \(j\) 行为 \(r_j\)。按欧几里得内积(对第一个变量线性)直接展开矩阵乘积:

\[ (Q^*Q)_{k,r}=\sum_{j=1}^n \overline{Q_{j,k}}\,Q_{j,r}=\langle q_r,q_k\rangle, \qquad (QQ^*)_{j,k}=\sum_{r=1}^n Q_{j,r}\,\overline{Q_{k,r}}=\langle r_j,r_k\rangle. \]

故"各列标准正交"等价于 \(Q^*Q=I\),"各行标准正交"等价于 \(QQ^*=I\)。

(a)\(\Rightarrow\)(d):设各列标准正交,则 \(Q^*Q=I\)。此时映射 \(v\mapsto Qv\) 是单射(\(Qv=0\Rightarrow Q^*Qv=0\Rightarrow v=0\)),而有限维方阵情形单射即可逆,故 \(Q\) 可逆;在 \(Q^*Q=I\) 两边左乘 \(Q^{-1}\) 得 \(Q^*=Q^{-1}\),于是 \(QQ^*=I\)。

(d)\(\Rightarrow\)(b) 与 (b)\(\Rightarrow\)(d):由上面两个展开式,"行标准正交"即 \(QQ^*=I\),此时 \(Q\) 可逆且 \(Q^{-1}=Q^*\)(同法论证),故 \(Q^*Q=I\)。于是 (b) 与 (d) 等价。

(d)\(\Rightarrow\)(c):若 \(Q^*Q=I\),则 \(\|Qv\|^2=\langle Qv,Qv\rangle=\langle Q^*Qv,v\rangle=\langle v,v\rangle=\|v\|^2\)。

(c)\(\Rightarrow\)(a):设 \(\|Qv\|=\|v\|\) 对一切 \(v\)。由极化恒等式,内积可由范数表出:当 \(\mathbb{F}=\mathbb{R}\) 时

\[ \langle u,v\rangle=\tfrac14\bigl(\|u+v\|^2-\|u-v\|^2\bigr), \]

当 \(\mathbb{F}=\mathbb{C}\) 时再补上虚部项 \(\tfrac{i}{4}\bigl(\|u-iv\|^2-\|u+iv\|^2\bigr)\)。对 \(Qu,Qv\) 应用同一恒等式并利用 \(\|Qw\|=\|w\|\)(线性性保证 \(Q(u\pm v)=Qu\pm Qv\) 等),得 \(\langle Qu,Qv\rangle=\langle u,v\rangle\)。取 \(u=e_j,v=e_k\) 为标准基向量,即得 \(\langle q_j,q_k\rangle=\delta_{jk}\),故 \(Q\) 的列标准正交。∎

现在给出本小节的核心结果。QR 分解断言:列线性无关的方阵可以唯一地分解为一个酉矩阵与一个对角元为正的上三角矩阵之积。它是著名的 QR 算法(数值计算特征值的主力算法)的主要工具,原书还将在第 9 章用它证明 Hadamard 不等式。其存在性的来源正是第 6 章的 Gram–Schmidt 程序。

定理 7.58(QR 分解, QR factorization). 设 \(A\) 是列线性无关的 \(n\times n\) 矩阵。则存在唯一的矩阵 \(Q\) 与 \(R\),使得 \(Q\) 酉、\(R\) 是对角元全为正数的上三角矩阵,且

\[ A=QR. \]

证明. 存在性。把 \(A\) 的列记为 \(v_1,\dots,v_n\in\mathbb{F}^n\),它们线性无关。对列表 \(v_1,\dots,v_n\) 施行 Gram–Schmidt 程序(6.B 节),得到 \(\mathbb{F}^n\) 的标准正交基 \(e_1,\dots,e_n\),满足

\[ \operatorname{span}(v_1,\dots,v_k)=\operatorname{span}(e_1,\dots,e_k),\qquad k=1,\dots,n. \]

定义 \(R\) 为 \(R_{j,k}=\langle v_k,e_j\rangle\)。若 \(j\gt k\),则 \(e_j\) 正交于 \(\operatorname{span}(e_1,\dots,e_k)\),从而由上式正交于 \(v_k\),即 \(R_{j,k}=0\),故 \(R\) 是上三角的。令 \(Q\) 为以 \(e_1,\dots,e_n\) 为列的酉矩阵。矩阵乘法表明 \(QR\) 的第 \(k\) 列等于 \(Q\) 的各列以 \(R\) 的第 \(k\) 列为系数的线性组合:

\[ (QR\text{ 的第 }k\text{ 列})=\langle v_k,e_1\rangle e_1+\cdots+\langle v_k,e_n\rangle e_n=v_k, \]

最后一步是标准正交基下的 Fourier 展开式(6.B 节 6.30(a))。于是 \(A=QR\)。

对角元为正。Gram–Schmidt 程序给出 \(u_k=v_k-\sum_{j\lt k}\langle v_k,e_j\rangle e_j\) 与 \(e_k=u_k/\|u_k\|\),其中由线性无关性 \(u_k\ne 0\)。于是

\[ R_{k,k}=\langle v_k,e_k\rangle=\bigl\langle u_k+\sum_{j\lt k}\langle v_k,e_j\rangle e_j,\ e_k\bigr\rangle=\langle u_k,u_k\rangle/\|u_k\|=\|u_k\|\gt 0. \]

唯一性。设另有 \(A=\hat Q\hat R\),其中 \(\hat Q\) 酉、\(\hat R\) 是对角元全正的上三角矩阵,记 \(\hat Q\) 的列为 \(q_1,\dots,q_n\)。与上一段同样的列式展开说明 \(v_k=\sum_{j\le k}\hat R_{j,k}\,q_j\),从而 \(\operatorname{span}(v_1,\dots,v_k)=\operatorname{span}(q_1,\dots,q_k)\),且系数 \(\hat R_{k,k}=\langle v_k,q_k\rangle\gt 0\)。对 \(k\) 归纳:\(q_1\) 是 \(v_1\) 方向上的单位向量且 \(\langle v_1,q_1\rangle\gt 0\),故 \(q_1=e_1\);若已有 \(q_j=e_j\)(\(j\lt k\)),则 \(q_k\) 是 \(v_k\) 减去其在 \(\operatorname{span}(v_1,\dots,v_{k-1})=\operatorname{span}(e_1,\dots,e_{k-1})\) 上投影后所得向量的单位化,且内积为正选取了正向,故 \(q_k=e_k\)。于是 \(\hat Q=Q\),进而由 \(Q\) 可逆,\(A=QR=Q\hat R\) 给出 \(R=\hat R\)。∎

证明同时给出了构造算法:对 \(A\) 的列做 Gram–Schmidt,得到的标准正交组排成 \(Q\),内积系数 \(\langle v_k,e_j\rangle\) 排成 \(R\)。图 2 展示了这一几何图景。

列向量的 Gram–Schmidt 正交化 Q 的列:e₁, e₂ v₁ e₁ = v₁/|v₁| v₂ u₂ e₂ O R(上三角,正对角) R₁₁ R₁₂ 0 R₂₂ R₁₁ = |v₁| › 0 R₁₂ = ⟨v₂, e₁⟩ R₂₂ = ⟨v₂, e₂⟩ = |u₂| › 0
图 2:QR 分解的几何。\(A\) 的列 \(v_1,v_2\) 经 Gram–Schmidt 正交化为标准正交组 \(e_1,e_2\)(即 \(Q\) 的列);上三角矩阵 \(R\) 记录展开系数:\(R_{11}=\|v_1\|\)、\(R_{12}=\langle v_2,e_1\rangle\)、\(R_{22}=\langle v_2,e_2\rangle=\|u_2\|\),对角线下方全为 0。

例 5(\(3\times 3\) 矩阵的 QR 分解;原书 7.60).

\[ A=\begin{pmatrix}1&2&1\\ 0&1&-4\\ 0&3&2\end{pmatrix} \]

的 QR 分解。其列为 \(v_1=(1,0,0)\),\(v_2=(2,1,3)\),\(v_3=(1,-4,2)\)。Gram–Schmidt:

\[ e_1=(1,0,0); \] \[ \langle v_2,e_1\rangle=2,\quad u_2=v_2-2e_1=(0,1,3),\quad e_2=\Bigl(0,\tfrac{1}{\sqrt{10}},\tfrac{3}{\sqrt{10}}\Bigr); \] \[ \langle v_3,e_1\rangle=1,\quad \langle v_3,e_2\rangle=\frac{-4+6}{\sqrt{10}}=\frac{2}{\sqrt{10}},\quad u_3=v_3-e_1-\frac{2}{\sqrt{10}}e_2=\Bigl(0,-\frac{21}{5},\frac{7}{5}\Bigr),\quad e_3=\Bigl(0,-\frac{3}{\sqrt{10}},\frac{1}{\sqrt{10}}\Bigr), \]

其中 \(\|u_3\|=7\sqrt{10}/5\)。于是

\[ Q=\begin{pmatrix}1&0&0\\[2pt] 0&\frac{1}{\sqrt{10}}&-\frac{3}{\sqrt{10}}\\[2pt] 0&\frac{3}{\sqrt{10}}&\frac{1}{\sqrt{10}}\end{pmatrix}, \qquad R_{j,k}=\langle v_k,e_j\rangle,\quad R=\begin{pmatrix}1&2&1\\[2pt] 0&\sqrt{10}&\frac{\sqrt{10}}{5}\\[2pt] 0&0&\frac{7\sqrt{10}}{5}\end{pmatrix}. \]

\(R\) 确实是对角元全为正的上三角矩阵。验证 \(A=QR\):例如第 3 列

\[ 1\cdot e_1+\frac{\sqrt{10}}{5}e_2+\frac{7\sqrt{10}}{5}e_3 =\Bigl(1,\ \frac15-\frac{21}{5},\ \frac35+\frac75\Bigr)=(1,-4,2)=v_3, \]

第 1、2 列同理,故 \(A=QR\)。∎

应用:不用高斯消元解方程组。设 \(A\) 是列线性无关的 \(n\times n\) 矩阵且已求得分解 \(A=QR\)(由定理 7.58 的证明,只需对 \(A\) 的列做 Gram–Schmidt)。要解 \(Ax=b\)(\(b\in\mathbb{F}^n\)),注意该方程等价于 \(QRx=b\);两边左乘 \(Q^*\),由定理 7.57(d) 得

\[ Rx=Q^*b. \]

右端 \(Q^*b\) 只是共轭转置与乘法,计算直接;而 \(R\) 是对角元为正的上三角矩阵,故可从 \(x_n\) 开始逐个回代求解。数值线性代数中,这一途径(以及基于豪斯霍尔德反射的更稳定变体)是解方程组与最小二乘问题的标准算法。稳定性方面的原因与本节主题直接相关:酉矩阵保持范数(定理 7.57(c)),由它实施的变换不会放大舍入误差——这正是"用等距算子做计算"的好处。

Cholesky 分解

本小节把 7.C 节的正算子理论翻译到矩阵上,并用 QR 分解证明:每个正定矩阵都可以唯一地写成"上三角矩阵乘其共轭转置"。先给出一个用内积刻画"正且可逆"的结果。

命题 7.61(正可逆算子). 设 \(T\in\mathcal{L}(V)\) 自伴。则 \(T\) 是正的可逆算子当且仅当

\[ \langle Tv,v\rangle\gt 0\quad \text{对每个非零 } v\in V. \]

证明. 设 \(T\) 正且可逆。若 \(v\ne 0\),则由可逆性 \(Tv\ne 0\);由 7.C 节(正算子 \(T\) 若满足 \(\langle Tv,v\rangle=0\) 则 \(Tv=0\),原书 7.43)得 \(\langle Tv,v\rangle\ne 0\),结合正性 \(\langle Tv,v\rangle\ge 0\) 即得严格大于 0。

反之,设 \(v\ne 0\) 时 \(\langle Tv,v\rangle\gt 0\)。若 \(Tv=0\),则 \(\langle Tv,v\rangle=0\),与假设矛盾,故 \(T\) 单射;有限维算子单射即(正的)可逆算子。∎

定义 7.62(正定矩阵, positive definite matrix). 设 \(B\) 是 \(n\times n\) 矩阵。若 \(B^*=B\) 且

\[ \langle Bx,x\rangle\gt 0\quad \text{对每个非零 } x\in\mathbb{F}^n \]

(欧几里得内积),则称 \(B\) 为正定矩阵

换言之,\(B\) 正定当且仅当它在 \(\mathbb{F}^n\) 上对应的算子是正的可逆算子;由命题 7.61,正定矩阵必可逆。回忆:上三角矩阵的共轭转置是下三角矩阵。下面的分解把正定矩阵写成下三角矩阵与上三角矩阵之积,在计算线性代数中意义重大(法国军官 André-Louis Cholesky, 1875–1918 发现,1924 年身后发表)。

定理 7.63(Cholesky 分解, Cholesky factorization). 设 \(B\) 是正定矩阵。则存在唯一的对角元全为正数的上三角矩阵 \(R\),使得

\[ B=R^*R. \]

证明. 存在性。因为 \(B\) 正定,由 7.C 节正算子刻画 ((a) 与 (f) 等价,原书 7.38)及命题 7.61 的算子版本,存在与 \(B\) 同阶的可逆方阵 \(A\) 使 \(B=A^*A\)。(最自然可取 \(A\) 为 \(B\) 的唯一正平方根 \(\sqrt{B}\),但下面的论证对任何这样的 \(A\) 都成立,而具体问题中往往有更容易找到的 \(A\)。)

对可逆矩阵 \(A\) 用 QR 分解(定理 7.58):\(A=QR\),其中 \(Q\) 酉、\(R\) 为对角元全正的上三角矩阵。则 \(A^*=R^*Q^*\),于是

\[ B=A^*A=R^*Q^*QR=R^*R, \]

其中用了 \(Q^*Q=I\)。

唯一性。设 \(S\) 也是对角元全正的上三角矩阵且 \(B=S^*S\)。由 \(B\) 可逆知 \(S\) 可逆(\(Sx=0\Rightarrow Bx=0\))。在 \(B=S^*S\) 两边右乘 \(S^{-1}\) 得 \(BS^{-1}=S^*\)。取存在性部分的 \(A\),则

\[ (AS^{-1})^*(AS^{-1})=(S^{-1})^*A^*AS^{-1}=(S^*)^{-1}BS^{-1}=(S^*)^{-1}S^*=I. \]

故方阵 \(AS^{-1}\) 满足 \((AS^{-1})^*(AS^{-1})=I\),由定理 7.57 知 \(AS^{-1}\) 酉。于是

\[ A=(AS^{-1})\,S \]

是 \(A\) 的一个"酉 \(\times\) 正对角上三角"分解;由 QR 分解的唯一性(定理 7.58),必有 \(S=R\)。∎

例 6(\(2\times 2\) 正定矩阵的 Cholesky 分解).

\[ B=\begin{pmatrix}2&-2\\ -2&5\end{pmatrix}. \]

先验证正定性(\(B\) 实对称,故 \(B^*=B\)):对 \(x=(x_1,x_2)\ne 0\),配方可得

\[ \langle Bx,x\rangle=2x_1^2-4x_1x_2+5x_2^2=2(x_1-x_2)^2+3x_2^2\gt 0. \]

故 \(B\) 正定。设 \(R=\begin{pmatrix}a&b\\ 0&c\end{pmatrix}\)(\(a,c\gt 0\)),则(实情形)

\[ R^*R=\begin{pmatrix}a&0\\ b&c\end{pmatrix}\begin{pmatrix}a&b\\ 0&c\end{pmatrix} =\begin{pmatrix}a^2&ab\\ ab&b^2+c^2\end{pmatrix} \stackrel{!}{=}\begin{pmatrix}2&-2\\ -2&5\end{pmatrix}. \]

依次解得 \(a=\sqrt2\)(取正根),\(b=-2/a=-\sqrt2\),\(c=\sqrt{5-b^2}=\sqrt3\)。于是

\[ R=\begin{pmatrix}\sqrt2&-\sqrt2\\ 0&\sqrt3\end{pmatrix}, \qquad B=R^*R=\begin{pmatrix}\sqrt2&0\\ -\sqrt2&\sqrt3\end{pmatrix} \begin{pmatrix}\sqrt2&-\sqrt2\\ 0&\sqrt3\end{pmatrix}. \]

验算:\(R^*R\) 的四个元分别为 \(2\),\(-2\),\(-2\),\(2+3=5\),确为 \(B\)。文献中也常把 Cholesky 分解写成下三角形式 \(B=LL^*\),只需取 \(L=R^*\) 即可。∎

数值视角:解正定方程组 \(Bx=b\) 时,先做 Cholesky 分解 \(B=R^*R\),把问题化为解两个三角方程组 \(R^*y=b\)、\(Rx=y\),都是直接回代;与通用的高斯消元相比,它只利用了下三角一半的存储,运算量减半,且数值稳定,是科学计算中求解大规模正定系统(如最小二乘正规方程)的标准手段。理论视角:Cholesky 分解是 7.C 节"正算子有唯一正平方根"的矩阵化身影——两者都把"正性"兑换成"三角(对角)结构"。

小结:刚性运动与下一节的衔接

本节的主线可以概括为一张对照表:

概念算子语言矩阵语言(标准正交基)
等距算子\(\|Sv\|=\|v\| \;\Longleftrightarrow\; S^*S=I\)列标准正交(\(m\ge n\) 时列构成标准正交组)
酉算子可逆等距\( \;\Longleftrightarrow\; S^{-1}=S^*\)酉矩阵:\(U^*U=UU^*=I\);实情形 \(Q^{\mathsf{T}}Q=I\)
谱(复情形)标准正交特征基,特征值满足 \(|\lambda|=1\)可酉对角化,对角元在单位圆上
QR 分解Gram–Schmidt:基 \(\mapsto\) 标准正交基列满秩方阵 \(A=QR\)(唯一,\(R\) 对角为正)
Cholesky 分解正算子 \(T=A^*A\)、\(\sqrt{T}\)正定矩阵 \(B=R^*R\)(唯一,\(R\) 对角为正)

几何上,等距算子正是"刚性运动"的线性部分:它把单位球映到单位球,保持一切长度、内积与角度;酉算子则在此基础上可逆,从而是内积空间结构的"旋转-反射式"自同构。矩阵方面,QR 分解把任意一组基"正交化",Cholesky 分解把正定性分解为三角结构,两者都以 7.C 节与第 6 章的构造(Gram–Schmidt、正平方根)为枢纽。

与下一节的衔接:任取线性映射 \(T\in\mathcal{L}(V,W)\),即使 \(T\) 本身完全不等距,\(T^*T\) 也总是 \(V\) 上的正算子(原书 7.64),于是它有唯一的正平方根 \(\sqrt{T^*T}\)——这正是把"拉伸了多少"从 \(T\) 中剥离出来的量。7.E 节的奇异值分解将指出:等距算子恰好就是所有奇异值都等于 1 的线性映射(原书 7.69),而任意算子都可以写成"等距 \(\times\) 正算子"的乘积 \(T=S\sqrt{T^*T}\)——极分解(原书 7.93,编排在第 7.F 节)。换言之,本节的酉算子与 7.C 的正算子将在 SVD 处会师:每个线性映射都是"先做各方向不等比例的拉伸、再做刚性旋转"的复合。

练习

练习 7.D-1

设 \(S_1,S_2\in\mathcal{L}(V)\) 都是酉算子。证明:\(S_1S_2\) 与 \(S_1^{-1}\) 也都是酉算子。(这说明 \(V\) 上全体酉算子在乘法下构成一个群。)

解答/提示

用伴随的性质 \((ST)^*=T^*S^*\):\((S_1S_2)^*(S_1S_2)=S_2^*S_1^*S_1S_2=S_2^*IS_2=I\),同理 \((S_1S_2)(S_1S_2)^*=S_1S_2S_2^*S_1^*=I\),故 \(S_1S_2\) 酉(定理 7.53(b))。又由 7.53(c),\(S_1^{-1}=S_1^*\),而 \(S_1^*\) 酉(7.53(f)),故 \(S_1^{-1}\) 酉。

练习 7.D-2

设 \(S\in\mathcal{L}(V)\) 既是自伴算子又是酉算子。证明 \(S^2=I\),且 \(V=E(1,S)\oplus E(-1,S)\)(两个特征子空间的正交直和)。由此说明例 4 中的反射具有这种性质。

解答/提示

\(S^2=S^*S=I\)。于是 \(S\) 的最小多项式整除 \((z-1)(z+1)\),没有重根,故 \(S\) 可对角化;特征值 \(\lambda\) 满足 \(\lambda^2=1\),即只能是 \(\pm1\)。自伴算子对应不同特征值的特征向量互相正交(7.A 节),故两个特征子空间正交,而它们的和是全空间的可对角化和,即 \(V=E(1,S)\oplus E(-1,S)\)。例 4 的反射:镜面上的向量特征值为 \(1\),镜面法方向特征值为 \(-1\),恰好就是这一分解。

练习 7.D-3

求 \(A=\begin{pmatrix}1&1\\ 1&0\end{pmatrix}\) 的 QR 分解(要求 \(R\) 对角元为正)。

解答/提示

列向量 \(v_1=(1,1)\),\(v_2=(1,0)\)。Gram–Schmidt:\(e_1=\tfrac{1}{\sqrt2}(1,1)\);\(\langle v_2,e_1\rangle=\tfrac{1}{\sqrt2}\),\(u_2=v_2-\tfrac{1}{\sqrt2}e_1=(\tfrac12,-\tfrac12)\),\(\|u_2\|=\tfrac{1}{\sqrt2}\),\(e_2=\tfrac{1}{\sqrt2}(1,-1)\)。于是

\[ Q=\frac{1}{\sqrt2}\begin{pmatrix}1&1\\ 1&-1\end{pmatrix},\qquad R=\begin{pmatrix}\sqrt2&\frac{1}{\sqrt2}\\[2pt] 0&\frac{1}{\sqrt2}\end{pmatrix}. \]

验证第 2 列:\(\tfrac{1}{\sqrt2}e_1+\tfrac{1}{\sqrt2}e_2=\tfrac12(1,1)+\tfrac12(1,-1)=(1,0)=v_2\)。∎

练习 7.D-4

利用练习 3 的 QR 分解求解 \(Ax=b\),其中 \(b=(2,1)\),并与直接求解对照。

解答/提示

方程化为 \(Rx=Q^*b\)。此处 \(Q^*=Q\),故 \(Q^*b=\tfrac{1}{\sqrt2}(3,1)\)。从最后一个分量回代:\(\tfrac{1}{\sqrt2}x_2=\tfrac{1}{\sqrt2}\Rightarrow x_2=1\);\(\sqrt2\,x_1+\tfrac{1}{\sqrt2}\cdot 1=\tfrac{3}{\sqrt2}\Rightarrow \sqrt2\,x_1=\sqrt2\Rightarrow x_1=1\)。故 \(x=(1,1)\)。直接解 \(x_1+x_2=2,\ x_1=1\) 得同样结果。∎

练习 7.D-5

验证 \(B=\begin{pmatrix}4&2\\ 2&3\end{pmatrix}\) 是正定矩阵,并求其 Cholesky 分解 \(B=R^*R\)。

解答/提示

\(B\) 实对称,且 \(\langle Bx,x\rangle=4x_1^2+4x_1x_2+3x_2^2=4\bigl(x_1+\tfrac{x_2}{2}\bigr)^2+2x_2^2\gt 0\) 对 \(x\ne0\) 成立,故正定。设 \(R=\begin{pmatrix}a&b\\ 0&c\end{pmatrix}\),由 \(a^2=4\)、\(ab=2\)、\(b^2+c^2=3\) 及 \(a,c\gt0\) 解得 \(a=2\),\(b=1\),\(c=\sqrt2\),即

\[ R=\begin{pmatrix}2&1\\ 0&\sqrt2\end{pmatrix}, \qquad R^*R=\begin{pmatrix}4&2\\ 2&1+2\end{pmatrix}=B. \quad\blacksquare \]
练习 7.D-6

判断下列命题是否成立,并给出证明或反例:

(a) 若 \(S\in\mathcal{L}(V)\) 把某个标准正交基映为标准正交组,则 \(S\) 是酉算子;

(b) 若方阵 \(Q\) 满足 \(Q^*Q=I\),则 \(Q\) 的行也构成标准正交组;

(c) 若 \(T\in\mathcal{L}(\mathbb{C}^2)\) 的所有特征值的绝对值都是 1,则 \(T\) 是等距算子。

解答/提示

(a) 成立。由定理 7.49 中 (a) 与 (d) 的等价,\(S\) 是等距算子;作为有限维空间上的算子,等距蕴含单射,单射蕴含可逆,故 \(S\) 酉。

(b) 成立。\(Q^*Q=I\) 说明 \(Q\) 酉(定理 7.57 (a) 与 (d) 等价),再由 7.57 (d) 与 (b) 等价即得行标准正交(或直接用 7.53(e))。

(c) 不成立。取 \(T\in\mathcal{L}(\mathbb{C}^2)\) 的矩阵为 \(\begin{pmatrix}1&1\\ 0&1\end{pmatrix}\),其特征值只有 1(绝对值为 1);但 \(T(0,1)=(1,1)\),\(\|T(0,1)\|=\sqrt2\ne\|(0,1)\|=1\),故 \(T\) 不是等距算子。可见"特征值在单位圆上"必须配上正规性(定理 7.55)或"对所有向量压缩"(参见原书本节练习 9)才能推出酉性。