第五章 · 5.B

5.B 极小多项式

上一节我们看到特征向量如何拆解算子,但 \(\mathbb{R}^2\) 上的旋转连一个特征值都没有。本节换一件武器:证明有限维空间上的每个算子都被某个非常数多项式零化;其中次数最低的首一零化多项式——极小多项式——唯一存在,它整除一切零化多项式,其零点恰为特征值。算子的线性递推关系由此被压缩成唯一的多项式不变量,成为 5.C 上三角化、5.D 对角化与第 8 章若尔当理论的关键工具。

编号说明:本节条目编号大体沿用原书第四版 5.B(约 5.23–5.36);为便于网页阅读,个别例子做了合并与扩充,编号与原书可能略有出入,请以主题为准。如无特别声明,总设 \(V\) 是有限维非零向量空间,\(T\in\mathcal{L}(V)\)。

引言:算子的递推关系

研究一个算子 \(T\) 时,一个基本的观察是:\(T\) 的各次幂 \(I,T,T^2,\dots\) 之间可能出现线性关系。例如,若某算子满足

\[ T^2 = 3T - 2I, \]

那么多项式 \(z^2-3z+2=(z-1)(z-2)\) 在 \(T\) 处"取值为零"。一般地,回顾 5.A 的定义 5.13:对 \(p=a_0+a_1z+\cdots+a_mz^m\in\mathcal{P}(\mathbb{F})\),规定

\[ p(T)=a_0I+a_1T+\cdots+a_mT^m\in\mathcal{L}(V), \]

其中常数项必须乘上恒等算子 \(I\),因为 \(\mathcal{L}(V)\) 中的"标量"是 \(\lambda I\)。多项式代入与多项式运算完全相容:对任意 \(p,r\in\mathcal{P}(\mathbb{F})\),

\[ (p+r)(T)=p(T)+r(T),\qquad (pr)(T)=p(T)\,r(T)=r(T)\,p(T), \]

第二个等式源于 \(T^jT^k=T^{j+k}=T^kT^j\),展开后两边都等于 \(\sum_{j,k}a_jc_kT^{j+k}\)。特别地,以 \(T\) 为"变量"的多项式彼此可交换——这一看似平凡的性质是本节所有证明的润滑剂,请读者留意它在带余除法论证中反复出现的形式。若 \(p(T)=0\),则称 \(p\) 零化 (annihilate) \(T\),或称 \(p\) 是 \(T\) 的零化多项式 (annihilating polynomial)。

零化多项式为什么重要?若已知 \(p(T)=0\) 且 \(\deg p=d\),则关系式 \(T^d=\)(更低次幂的线性组合)使得一切高次幂 \(T^k\)(\(k\gt d\))都能降次:序列 \(I,T,T^2,\dots\) 从第 \(d\) 项起完全由前 \(d\) 项的递推决定。更重要的是,由本节定理 5.27 与 5.28,\(T\) 的特征值必是 \(p\) 的零点,于是"解方程 \(p(\lambda)=0\)"立刻圈定特征值的候选范围。一个多项式,就这样把无穷序列 \(\{T^k\}\) 的信息压缩成有限的对象。

本节的主线是三个问题:零化多项式是否存在(定理 5.23)?若存在,有没有"最短"的一条(定义 5.25 与定理 5.26)?它与其余零化多项式、与特征值的关系如何(定理 5.27 与 5.28)?答案分别是:有限维时总存在;最短的首一零化多项式唯一,称为极小多项式;一切零化多项式恰是它的倍式,而它的零点恰是特征值。

零化多项式的存在性

定理 5.23(零化多项式的存在性)

设 \(V\) 是有限维向量空间且 \(V\neq\{0\}\),\(T\in\mathcal{L}(V)\)。则存在非常数多项式 \(p\in\mathcal{P}(\mathbb{F})\) 使得 \(p(T)=0\)。

证明. 记 \(n=\dim V\ge 1\)。由第 3 章关于线性映射空间的维数公式,

\[ \dim\mathcal{L}(V)=(\dim V)^2=n^2, \]

即 \(\mathcal{L}(V)\) 是 \(n^2\) 维向量空间。考察其中的 \(n^2+1\) 个向量

\[ I,\;T,\;T^2,\;\dots,\;T^{n^2}. \]

由于向量个数 \(n^2+1\) 超过了所在空间的维数 \(n^2\),由第 2 章"长度大于维数的向量组必线性相关"知,这组向量线性相关。于是存在不全为零的标量 \(a_0,a_1,\dots,a_{n^2}\in\mathbb{F}\) 使

\[ a_0I+a_1T+a_2T^2+\cdots+a_{n^2}T^{n^2}=0. \]

令 \(p(z)=a_0+a_1z+\cdots+a_{n^2}z^{n^2}\),上式恰好说明 \(p(T)=0\)。最后验证 \(p\) 非常数:若 \(a_1=\cdots=a_{n^2}=0\),则由系数不全为零得 \(a_0\neq 0\),于是 \(a_0I=0\);任取非零向量 \(v\in V\),得 \(a_0v=0\),即 \(a_0=0\),矛盾。故必有某个 \(a_j\neq 0\)(\(j\ge 1\)),从而 \(\deg p\ge 1\)。

L(V) 的一组基(n = 4) 16 = n² 个基向量 dim L(V) = n² I, T, T², T³, … 都住在 L(V) 中 T 的前 n² + 1 个幂 I T T² T³ T 共 n² + 1 = 17 个向量 17 > 16 = dim L(V) ⟹ 必线性相关 相关系数拼出非常数多项式 p,使 p(T) = 0
图 1:维数论证示意。左:\(\mathcal{L}(V)\) 是 \(n^2\) 维空间(图中取 \(n=4\),基含 16 个向量);右:\(I,T,T^2,\dots,T^{n^2}\) 共 \(n^2+1\) 个向量,超过维数必线性相关,相关系数即给出零化多项式。

图 1 直观展示了这条维数论证:\(\mathcal{L}(V)\) 只有 \(n^2\) 维,"房间"里挤进 \(n^2+1\) 个向量 \(I,T,\dots,T^{n^2}\),必然线性相关,而相关系数正好拼出一个零化多项式。值得强调:证明完全没有用到特征值,甚至不要求 \(\mathbb{F}=\mathbb{C}\),对任意域都成立;它还顺带给出界 \(\deg p\le n^2\)。当 \(V=\{0\}\) 时结论平凡:此时 \(T=0\),多项式 \(z\) 即零化 \(T\)。

首一多项式与极小多项式

定义 5.24(首一多项式)

设 \(p\in\mathcal{P}(\mathbb{F})\)。若 \(p\neq 0\) 且 \(p\) 的最高次项系数为 \(1\),则称 \(p\) 是首一多项式 (monic polynomial)。例如 \(z^3+5z^2-3z+7\) 是首一的,而 \(2z+1\) 与零多项式都不是。

每个非零多项式都有唯一的"首一化":把它除以自己的最高次项系数即可,次数与零点都不改变。因此在零化多项式中挑出次数最低者之后,总可以再标准化成首一的。

定义 5.25(极小多项式)

设 \(V\) 有限维且 \(V\neq\{0\}\),\(T\in\mathcal{L}(V)\)。由定理 5.23,零化 \(T\) 的非常数多项式组成的集合非空;在其中取次数最低者,再除以其最高次项系数使其首一。所得多项式称为 \(T\) 的极小多项式 (minimal polynomial),本节依照原书记作 \(q\);需要强调对 \(T\) 的依赖时,也常写作 \(\mu_T\)。

表面上看,"次数最低再首一化"的选取未必唯一——两条不同的最低次数零化多项式首一化后会不会不同?下面的唯一性定理排除这一担忧,从而使定义 5.25 良定。它的证明手法(两个首一多项式相减导致降次)将在本节反复出现,值得细读。

定理 5.26(极小多项式的唯一性)

零化 \(T\) 的、次数最低的首一多项式只有一个。换言之,每个 \(T\) 的极小多项式唯一。

证明. 设 \(q_1,q_2\) 都是零化 \(T\) 的首一多项式,且次数都等于最低次数 \(d\)(即 \(d\) 是零化 \(T\) 的非常数多项式的最小次数)。令 \(h=q_1-q_2\)。则

\[ h(T)=q_1(T)-q_2(T)=0, \]

且两个首一多项式的最高次项相消,故 \(h=0\) 或 \(\deg h\lt d\)。反设 \(h\neq 0\):若 \(h\) 是非零常数 \(c\),则 \(cI=h(T)=0\),取非零向量 \(v\) 得 \(c=0\),矛盾;若 \(\deg h\ge 1\),把 \(h\) 除以其最高次项系数,得到零化 \(T\) 的首一多项式,次数 \(\deg h\lt d\),与 \(d\) 的最小性矛盾。两种情形都导致矛盾,故 \(h=0\),即 \(q_1=q_2\)。

由定理 5.23 与 5.26,极小多项式良定且 \(\deg q\le n^2\)。这一界的显著改进(\(\deg q\le n\))将在 5.C 与第 10 章以不同方式得到,见本节末尾的预告。

整除判据:零化多项式恰为 q 的倍式

先回顾第 4 章的带余除法 (division algorithm):设 \(p,s\in\mathcal{P}(\mathbb{F})\) 且 \(s\neq 0\),则存在唯一的一对多项式 \(h,r\) 使

\[ p=sh+r,\qquad r=0\ \text{或}\ \deg r\lt\deg s, \]

其中 \(r\) 称为余式。本节两次用到它:一次取 \(s=q\),一次取 \(s=z-\lambda\)。

定理 5.27(零化多项式恰为极小多项式的倍式)

设 \(q\) 是 \(T\) 的极小多项式,\(p\in\mathcal{P}(\mathbb{F})\)。则

\[ p(T)=0\quad\Longleftrightarrow\quad q \text{ 整除 } p, \]

其中"\(q\) 整除 \(p\)"指存在 \(h\in\mathcal{P}(\mathbb{F})\) 使 \(p=qh\),记作 \(q\mid p\)。

证明. 充分性:设 \(p=qh\)。由多项式代入与乘法的相容性,

\[ p(T)=(qh)(T)=q(T)\,h(T)=0\cdot h(T)=0. \]

必要性:设 \(p(T)=0\)。用带余除法以 \(q\) 除 \(p\):存在 \(h,r\in\mathcal{P}(\mathbb{F})\) 使

\[ p=qh+r,\qquad r=0\ \text{或}\ \deg r\lt\deg q. \]

把 \(T\) 代入,并利用 \(p(T)=0\) 与 \(q(T)=0\):

\[ r(T)=p(T)-q(T)h(T)=0. \]

断言 \(r=0\)。若 \(r\neq 0\):当 \(r\) 为非零常数时,\(rI=r(T)=0\) 与 \(V\neq\{0\}\) 矛盾;当 \(\deg r\ge 1\) 时,把 \(r\) 首一化,便得到零化 \(T\) 的首一多项式,次数 \(\deg r\lt\deg q\),与极小多项式的次数最小性矛盾。故 \(r=0\),即 \(p=qh\)。

换个角度看,定理 5.27 说明:零化 \(T\) 的多项式全体恰好是"\(q\) 的倍式"之集 \(\{qh:h\in\mathcal{P}(\mathbb{F})\}\);用近世代数的话说,这是多项式环中由 \(q\) 生成的主理想。极小多项式把 \(I,T,T^2,\dots\) 之间所有线性递推关系压缩成一个对象:任何一条递推关系都是最短那条的推论。这也解释了"极小"二字的分量——它不是众多零化多项式中普通的一员,而是生成全部关系的那一个。

特征值刻画:q 的零点即特征值

定理 5.28(特征值的刻画)

设 \(q\) 是 \(T\) 的极小多项式,\(\lambda\in\mathbb{F}\)。则

\[ \lambda \text{ 是 } T \text{ 的特征值}\quad\Longleftrightarrow\quad (z-\lambda)\mid q. \]

证明. (⇒) 设 \(\lambda\) 是特征值,取特征向量 \(v\neq 0\):\(Tv=\lambda v\)。对 \(k\) 归纳可得 \(T^kv=\lambda^kv\)(\(k=0\) 时 \(Iv=v=\lambda^0v\);若 \(T^kv=\lambda^kv\),则 \(T^{k+1}v=T(\lambda^kv)=\lambda^kTv=\lambda^{k+1}v\))。于是对任意 \(p(z)=\sum_k a_kz^k\),

\[ p(T)v=\sum_k a_kT^kv=\Big(\sum_k a_k\lambda^k\Big)v=p(\lambda)\,v. \]

特别地,\(0=q(T)v=q(\lambda)v\);由 \(v\neq 0\) 得 \(q(\lambda)=0\)。再对 \(q\) 用带余除法除以 \(z-\lambda\):\(q=(z-\lambda)s+c\),其中 \(c\) 为常数;代入 \(z=\lambda\) 得 \(c=q(\lambda)=0\),故 \(q=(z-\lambda)s\),即 \((z-\lambda)\mid q\)。

(⇐) 设 \((z-\lambda)\mid q\),写 \(q=(z-\lambda)h\)。反设 \(\lambda\) 不是特征值,则由 5.A 的等价刻画,\(\operatorname{null}(T-\lambda I)=\{0\}\),即 \(T-\lambda I\) 是单射。由于 \(q\) 与 \(z-\lambda\) 都首一,\(h\) 也首一,且 \(\deg h=\deg q-1\lt\deg q\)。把 \(T\) 代入 \(q=(z-\lambda)h\):

\[ 0=q(T)=(T-\lambda I)\,h(T). \]

对任意 \(v\in V\),上式给出 \((T-\lambda I)\big(h(T)v\big)=0\);由 \(T-\lambda I\) 单射得 \(h(T)v=0\)。于是 \(h(T)=0\)。但这是荒谬的:若 \(\deg h\ge 1\),则 \(h\) 是零化 \(T\) 的首一多项式且次数小于 \(\deg q\),与极小性矛盾;若 \(h\) 是常数,则由首一性 \(h=1\),于是 \(h(T)=I\neq 0\)(因 \(V\neq\{0\}\)),同样矛盾。故反设不成立,\(\lambda\) 是 \(T\) 的特征值。

推论 5.29(零点集等于特征值集)

极小多项式 \(q\) 的零点集合(不计重数)恰为 \(T\) 的特征值集合。

证明. "\((z-\lambda)\mid q\)" 等价于"\(q(\lambda)=0\)":这正是 (⇒) 中用带余除法得到的余式定理。再结合定理 5.28 即得。

两点注记。其一,定理 5.28 的两个方向其实都只用到 \(q\) 的存在性,并未直接使用有限维;有限维真正发挥作用的地方是定理 5.23。其二,(⇐) 的论证展示了本节第二个反复出现的技巧:与单射算子复合后为零的算子必为零。它与"两个首一多项式相减降次"一起,构成极小多项式理论的两大证明引擎。

现在回收引言的伏笔:若 \(p\) 零化 \(T\),则由定理 5.27 得 \(q\mid p\),再由定理 5.28,\(T\) 的特征值都是 \(p\) 的零点。例如由 \(T^2=3T-2I\) 知 \(p=(z-1)(z-2)\) 零化 \(T\),立刻断言特征值只能取 \(1\) 或 \(2\)。

例子一览

例 5.30(数量算子、恒等算子与零算子)

设 \(T=\lambda_0 I\) 是数量算子。则 \(z-\lambda_0\) 零化 \(T\);而次数更低的非常数首一多项式不存在(非常数多项式次数至少为 1),常数首一多项式只有 \(1\) 且 \(1(T)=I\neq 0\)。故 \(q=z-\lambda_0\)。特别地,恒等算子的极小多项式是 \(z-1\),零算子的极小多项式是 \(z\)。这与推论 5.29 一致:数量算子恰有特征值 \(\lambda_0\)。

例 5.31(\(\mathbb{R}^2\) 上的旋转:极小多项式 \(z^2+1\))

设 \(T\in\mathcal{L}(\mathbb{R}^2)\) 由 \(T(x,y)=(-y,x)\) 给出(逆时针旋转 \(90^{\circ}\))。直接计算 \(T^2(x,y)=T(-y,x)=(-x,-y)\),即 \(T^2=-I\),故 \(z^2+1\) 零化 \(T\),由定理 5.27 得 \(q\mid z^2+1\)。由于 \(z^2+1\) 在 \(\mathbb{R}\) 上没有零点,它不可约,其非常数的首一因子只有自身,于是 \(q=z^2+1\)。这与推论 5.29 完全吻合:该旋转没有实特征值,而 \(z^2+1\) 没有实零点。若改在 \(\mathbb{C}^2\) 上考虑同一公式定义的算子,则特征值为 \(\mathrm{i}\) 与 \(-\mathrm{i}\),极小多项式依旧是 \(z^2+1=(z-\mathrm{i})(z+\mathrm{i})\)——多项式未变,变的是它在不同域上的分解。

例 5.32(幂零算子:\(q=z^j\))

称 \(N\in\mathcal{L}(V)\) 为幂零算子 (nilpotent operator),若存在正整数 \(m\) 使 \(N^m=0\);设 \(j\) 是使 \(N^j=0\) 的最小正整数(幂零指标)。断言:\(N\) 的极小多项式是 \(z^j\)。事实上 \(z^j\) 零化 \(N\),故 \(q\mid z^j\);而 \(z^j\) 的首一因式只有 \(z^i\)(\(0\le i\le j\)),其中 \(z^0=1\) 不零化 \(N\)(\(1(N)=I\neq 0\)),故 \(q=z^i\) 且 \(i\ge 1\)。又 \(q\) 零化 \(N\) 意味着 \(N^i=0\),由 \(j\) 的最小性 \(i\ge j\),于是 \(i=j\)。例如 \(N\in\mathcal{L}(\mathbb{F}^3)\) 由 \(N(x,y,z)=(0,x,y)\) 定义:\(N^2(x,y,z)=(0,0,x)\),\(N^3=0\) 而 \(N^2\neq 0\),故 \(q=z^3\)。注意此例的特征值只有 \(0\),但极小多项式是 \(z^3\) 而非 \(z\)——零点的重数携带了特征值之外的信息,这正是第 8 章广义特征空间与若尔当形的入口。

例 5.33(微分算子:有限维与无限维的对照)

(a) 设 \(V=\mathcal{P}_n(\mathbb{F})\) 是次数不超过 \(n\) 的多项式组成的空间(\(\dim V=n+1\)),\(D\) 是求导算子。则 \(D^{n+1}=0\) 而 \(D^n(x^n)=n!\neq 0\),由例 5.32 的论证,\(D\) 的极小多项式是 \(z^{n+1}\)。

(b) 现在把同一个求导算子放到无限维空间 \(\mathcal{P}(\mathbb{F})\)(全体多项式)上。断言:没有任何非零多项式零化 \(D\),从而极小多项式不存在——定理 5.23 的有限维假设必不可少。证明:设 \(p(z)=a_0+a_1z+\cdots+a_dz^d\neq 0\),取 \(M\ge d\),考察 \(x^M/M!\)。对 \(0\le k\le M\) 有 \(D^k(x^M/M!)=x^{M-k}/(M-k)!\),于是

\[ p(D)\Big(\frac{x^M}{M!}\Big)=\sum_{k=0}^{d}a_k\,\frac{x^{M-k}}{(M-k)!}. \]

右端各项的次数依次为 \(M,M-1,\dots,M-d\),两两不同,且凡系数 \(a_k\neq 0\) 的项都非零,故它是非零多项式,从而 \(p(D)\neq 0\)。证毕。

例 5.34(\(\mathbb{F}^{\infty}\) 上的后向移位)

定义 \(T\in\mathcal{L}(\mathbb{F}^{\infty})\) 为 \(T(z_1,z_2,z_3,\dots)=(z_2,z_3,\dots)\)。注意 \(T\) 把 \(e_j\) 映为 \(e_{j-1}\)(\(j\ge 2\)),把 \(e_1\) 映为 \(0\)。设 \(p(z)=\sum_{k=0}^{d}a_kz^k\) 满足 \(p(T)=0\),考察 \(e_{d+1}\):对 \(0\le k\le d\) 有 \(T^ke_{d+1}=e_{d+1-k}\),故

\[ 0=p(T)e_{d+1}=\sum_{k=0}^{d}a_k\,e_{d+1-k}. \]

诸 \(e_{d+1-k}\) 是两两不同的标准向量,线性无关,于是 \(a_0=\cdots=a_d=0\),即 \(p=0\)。因此后向移位同样没有非零零化多项式:又一个无限维反例。耐人寻味的是,\(T\) 并非没有特征值——常值序列 \((1,1,1,\dots)\) 满足 \(T(1,1,\dots)=(1,1,\dots)\),\(1\) 是特征值——但在无限维空间,"有特征值"远不足以保证"有零化多项式"。

例 5.35(对角算子:互异特征值给出无重根)

设 \(T(x_1,\dots,x_n)=(\lambda_1x_1,\dots,\lambda_nx_n)\),且 \(\lambda_1,\dots,\lambda_m\) 是其中互异的值。则每个 \(\lambda_i\) 都是特征值,故由定理 5.28 每个 \(z-\lambda_i\) 整除 \(q\);这些一次因式两两互素,由多项式版的欧几里得引理(可由带余除法得到),其乘积 \(\tilde q=(z-\lambda_1)\cdots(z-\lambda_m)\) 仍整除 \(q\)。另一方面,把 \(\tilde q\) 代入 \(T\) 并作用于基向量 \(e_j\):结果为 \(\prod_{i=1}^{m}(\lambda_j-\lambda_i)\),其中含零因子 \(\lambda_j-\lambda_j=0\),故 \(\tilde q(T)=0\),从而由定理 5.27 得 \(q\mid\tilde q\)。结合 \(q\) 与 \(\tilde q\) 均首一,即得 \(q=\tilde q\):对角算子的极小多项式无重根。例如 \(\operatorname{diag}(2,2,3)\) 与 \(\operatorname{diag}(2,3,3)\) 的极小多项式都是 \((z-2)(z-3)\)——特征值重复多少次并不进入 \(q\)。5.D 将证明其逆也无条件成立:\(T\) 可对角化,当且仅当其极小多项式无重根。

计算视角:从矩阵求极小多项式

设 \(v_1,\dots,v_n\) 是 \(V\) 的基,\(A=\mathcal{M}(T)\)。矩阵对应保持加法、标量乘法与乘法,故对任意多项式 \(p\) 有 \(\mathcal{M}(p(T))=p(A)\),从而 \(p(T)=0\) 当且仅当 \(p(A)=0\)。于是求 \(q\) 是一个有限步的线性代数问题:把 \(n\times n\) 矩阵全体看成 \(n^2\) 维向量空间,寻找使 \(I,A,A^2,\dots,A^m\) 线性相关的最小 \(m\)。等价地说,

\[ \deg q=\min\{\,m\ge 1:\ I,\,A,\,\dots,\,A^m\ \text{线性相关}\,\}. \]

理由:若 \(q\) 是 \(d\) 次首一多项式,则 \(q(A)=0\) 给出 \(I,A,\dots,A^d\) 的非平凡相关关系,故最小 \(m\le\deg q\);反之,设 \(I,\dots,A^m\) 线性相关,取不全为零的系数 \(a_0,\dots,a_m\),令 \(p=\sum_j a_jz^j\),则 \(p(A)=0\) 且 \(p\neq 0\)。\(p\) 不可能是非零常数(否则 \(a_0I=0\)),故 \(p\) 非常数,从而 \(\deg q\le\deg p\le m\)。两相比较即得等式。实操上,把每个 \(A^k\) 拉直成 \(\mathbb{F}^{n^2}\) 中的长向量再做高斯消元即可。

另外,极小多项式是算子的不变量,与基的选取无关:若 \(A\) 与 \(B=C^{-1}AC\) 是 \(T\) 在两组基下的矩阵,则 \((C^{-1}AC)^k=C^{-1}A^kC\),于是 \(p(B)=C^{-1}p(A)C\),从而 \(p(B)=0\) 当且仅当 \(p(A)=0\)。特别地,相似矩阵有相同的极小多项式(逆命题不成立,见本节末注记)。

例 5.36(一个 \(3\times 3\) 矩阵的完整计算)

\[ A=\begin{pmatrix}2&1&0\\0&2&0\\0&0&3\end{pmatrix}. \]

第一步,计算各次幂:

\[ A^2=\begin{pmatrix}4&4&0\\0&4&0\\0&0&9\end{pmatrix},\qquad A^3=\begin{pmatrix}8&12&0\\0&8&0\\0&0&27\end{pmatrix}. \]

第二步,先尝试二次首一多项式 \(z^2+\beta z+\gamma\)。要求 \(A^2+\beta A+\gamma I=0\):位于 \((1,2)\) 的元素给出 \(4+\beta=0\),即 \(\beta=-4\);位于 \((3,3)\) 的元素给出 \(9+3\beta+\gamma=0\),即 \(\gamma=3\);但此时位于 \((1,1)\) 的元素为 \(4+2\beta+\gamma=4-8+3=-1\neq 0\),矛盾。故没有二次零化多项式,\(\deg q\ge 3\)。

第三步,设三次首一多项式 \(z^3+\beta z^2+\gamma z+\delta\) 零化 \(A\),逐元素写出方程(其余元素自动为零):

\[ \begin{cases} 8+4\beta+2\gamma+\delta=0 & ((1,1)\ \text{处}),\\ 12+4\beta+\gamma=0 & ((1,2)\ \text{处}),\\ 27+9\beta+3\gamma+\delta=0 & ((3,3)\ \text{处}). \end{cases} \]

第三式减第一式得 \(19+5\beta+\gamma=0\),再减第二式得 \(7+\beta=0\),故 \(\beta=-7\);代回得 \(\gamma=16\)、\(\delta=-12\)。于是

\[ q(z)=z^3-7z^2+16z-12=(z-2)^2(z-3). \]

验证:逐元素计算 \(A^3-7A^2+16A-12I\) 确为零矩阵。上三角矩阵 \(A\) 的对角元是 \(2,2,3\),故特征值恰为 \(2\) 与 \(3\),正是 \(q\) 的零点,与推论 5.29 相印证。对比例 5.35:若把 \(A\) 中位于 \((1,2)\) 的 \(1\) 改成 \(0\)(即对角阵 \(\operatorname{diag}(2,2,3)\)),极小多项式降为无重根的 \((z-2)(z-3)\)。可见正是那个偏离对角的"1"迫使因子 \((z-2)\) 重复出现——重数敏感于块结构,这一点将在第 8 章若尔当形中完全展开。最后,由定理 5.27 免费得到完整结论:\(A\) 的零化多项式恰是 \((z-2)^2(z-3)\) 的全体倍式。

注记:极小多项式在全书中的角色

把本节结果串起来看,极小多项式回答的问题是:"算子 \(T\) 满足怎样的线性递推关系,其中最短的一条是什么?"定理 5.23 保证至少有一条;定义 5.25 与定理 5.26 挑出唯一的最短关系;定理 5.27 说明其余一切关系都是它的倍式推论;定理 5.28 把它的零点与特征值等同起来。一个次数不超过 \(n^2\) 的多项式,就这样完整编码了无穷序列 \(I,T,T^2,\dots\) 的全部线性信息。

预告框图:特征多项式的严格定义见原书第 10 章(迹与行列式) 特征多项式 χT(z) = det(zI − T),deg χT = n Cayley–Hamilton:χT(T) = 0,再由定理 5.27 得 q | χT 极小多项式 q:deg q ≤ n,q 整除 χT q 的零点集 = χT 的零点集 = T 的特征值集 零点集(不计重数)相同:都恰为 T 的特征值集合 差别在重数:χT 按代数重数计数;q 的重数反映若尔当块结构(第 8 章)
图 2:极小多项式与特征多项式的关系(预告图)。在原书第 10 章定义特征多项式 \(\chi_T\) 并证明 Cayley–Hamilton 定理后,由定理 5.27 立得 \(q\mid\chi_T\),从而 \(\deg q\le n\),远强于定理 5.23 的 \(n^2\) 界;两个多项式的零点集(不计重数)相同。重数层面的差别将在第 8 章(广义特征空间与若尔当形)中精确刻画。

与特征多项式的关系(预告)。定义 \(\chi_T(z)=\det(zI-T)\)(原书第 10 章,迹与行列式),Cayley–Hamilton 定理断言 \(\chi_T(T)=0\)。于是由定理 5.27 立刻得到 \(q\mid\chi_T\),特别地 \(\deg q\le n\),远强于定理 5.23 的 \(n^2\) 界。再由推论 5.29 与第 10 章的相应结论,两个多项式的零点集相同,差别全在重数:\(\chi_T\) 按代数重数计数,而 \(q\) 中每个特征值只出现"必要"的次数。图 2 总结了这些关系,严格的展开见原书第 8 章与第 10 章,此处仅作导读性预告。

后续路线图。5.C 研究上三角矩阵,将证明复数域上每个算子都有上三角矩阵,证明的核心手法正是在 \(q\) 的零点处考察 \(T-\lambda I\) 的不变子空间;上三角化之后还能反过来改进对 \(q\) 的估计。5.D 证明对角化判据:\(T\) 可对角化当且仅当其极小多项式无重根(例 5.35 已给出"必要性方向"的典型实例)。第 8 章用 \(q\) 的因式分解 \(q(z)=(z-\lambda_1)^{d_1}\cdots(z-\lambda_m)^{d_m}\) 引导广义特征空间分解,诸指数 \(d_i\) 与相应特征值的若尔当块大小直接相关。可以说,本章余下部分乃至第 8 章,都在反复使用本节奠定的"以多项式驾驭算子"的思路。

最后是两点观察。其一,极小多项式是相似不变量,常用来排除相似性:若两个算子的极小多项式不同,它们必不相似。但逆命题不成立:在 \(\mathbb{F}^4\) 上取 \(N_1\) 与 \(N_2\),使其在某组基下的矩阵分别为

\[ \begin{pmatrix}0&1\\0&0\end{pmatrix}\oplus\begin{pmatrix}0&1\\0&0\end{pmatrix},\qquad \begin{pmatrix}0&1\\0&0\end{pmatrix}\oplus 0\oplus 0, \]

两者都是幂零算子且极小多项式均为 \(z^2\),但 \(\operatorname{rank}N_1=2\neq 1=\operatorname{rank}N_2\),故不相似。极小多项式压缩掉的信息,将由第 8 章的若尔当形补全。其二,就计算而言,例 5.36 的线性方程组法是最直接可靠的途径;先算特征多项式再验证其因式(利用 \(q\mid\chi_T\))则是另一条常用路线。

练习

练习 5.B-1

设 \(T\in\mathcal{L}(\mathbb{F}^2)\) 由 \(T(x,y)=(x+y,\,y)\) 给出。求 \(T\) 的极小多项式,并用定理 5.28 加以检验。

解答/提示

记 \(N=T-I\),则 \(N(x,y)=(y,0)\),直接计算得 \(N^2=0\) 而 \(N\neq 0\)。于是 \((z-1)^2\) 零化 \(T\)。若一次首一多项式 \(z+c\) 零化 \(T\),则 \(T=-cI\) 是数量算子;但 \(T(0,1)=(1,1)\) 不与 \((0,1)\) 成比例,故 \(T\) 非数量,排除一次。又常数首一多项式 \(1\) 给出 \(1(T)=I\neq 0\)。故 \(q=(z-1)^2\)。检验:\(T\) 的矩阵 \(\begin{pmatrix}1&1\\0&1\end{pmatrix}\) 是上三角的,唯一特征值是 \(1\),恰为 \(q\) 的唯一零点;因子 \((z-1)\) 出现两次,预示特征值 \(1\) 的几何重数(1)小于代数重数(2),详见第 8 章。

练习 5.B-2

证明:\(T\) 可逆当且仅当其极小多项式 \(q\) 的常数项非零;且当 \(T\) 可逆时,\(T^{-1}\) 可以表示为 \(T\) 的多项式。

解答/提示

设 \(q(z)=z^d+a_{d-1}z^{d-1}+\cdots+a_1z+a_0\)。若 \(a_0\neq 0\),则由 \(q(T)=0\) 得 \(a_0I=-(a_1T+\cdots+T^d)=-T\,(a_1I+a_2T+\cdots+T^{d-1})\),于是

\[ I=T\cdot g(T),\qquad g(T)=-\tfrac{1}{a_0}\big(a_1I+a_2T+\cdots+T^{d-1}\big), \]

且 \(g(T)\) 与 \(T\) 可交换,故它既是右逆又是左逆,\(T^{-1}=g(T)\)。反之,若 \(a_0=0\),则 \(q(0)=0\),即 \((z-0)\mid q\),由定理 5.28 知 \(0\) 是 \(T\) 的特征值,故存在 \(v\neq 0\) 使 \(Tv=0\),\(T\) 不单射,从而不可逆(有限维下单射等价于可逆)。证毕。

练习 5.B-3

设 \(V=U\oplus W\),\(U\) 与 \(W\) 都在 \(T\) 下不变,记 \(q_U,q_W\) 分别为限制算子 \(T|_U\) 与 \(T|_W\) 的极小多项式。证明:\(T\) 的极小多项式是 \(q_U\) 与 \(q_W\) 的首一最小公倍式。

解答/提示

先注意:对任意多项式 \(p\),\(p(T)\) 限制在 \(U\) 上恰为 \(p(T|_U)\)(对 \(\deg p\) 归纳即可)。设 \(m\) 为 \(q_U\) 与 \(q_W\) 的首一最小公倍式。一方面,\(q_U\mid m\) 故 \(m(T|_U)=0\),同理 \(m(T|_W)=0\);于是 \(m(T)\) 在 \(U\) 与 \(W\) 上都为零,而 \(V=U+W\),故 \(m(T)=0\),由定理 5.27 得 \(q\mid m\)。另一方面,\(q(T)=0\) 限制到 \(U\) 得 \(q(T|_U)=0\),对算子 \(T|_U\) 用定理 5.27 得 \(q_U\mid q\);同理 \(q_W\mid q\),由最小公倍数的性质得 \(m\mid q\)。结合两者并注意首一,得 \(q=m\)。证毕。

练习 5.B-4

(a) 给出一个无限维空间 \(V\) 与 \(T\in\mathcal{L}(V)\),使得不存在非零多项式零化 \(T\);(b) 给出一个无限维空间与算子,使其极小多项式存在,并求出它。由此说明:有限维性是定理 5.23 的充分而非必要条件。

解答/提示

(a) 取 \(V=\mathbb{F}^{\infty}\) 与后向移位算子(例 5.34),或取 \(V=\mathcal{P}(\mathbb{F})\) 与求导算子(例 5.33(b)),两者都已证明:任何非零多项式都不零化它们。(b) 取任意无限维空间 \(V\) 与 \(T=I\):\(z-1\) 零化 \(I\),而更低的非常数次数不存在,常数 \(1\) 不零化(\(I\neq 0\)),故极小多项式存在且等于 \(z-1\)(取 \(T=0\) 则得 \(q=z\))。两例合观:有限维保证存在性,但存在性也能在特定的无限维情形出现,故是充分而非必要条件。

练习 5.B-5

设 \(A=\begin{pmatrix}0&0&1\\1&0&0\\0&1&0\end{pmatrix}\)(它把 \(e_1\mapsto e_2\mapsto e_3\mapsto e_1\) 循环轮换)。求 \(A\) 的极小多项式,并用定理 5.28 解释它与实特征值的关系。

解答/提示

由轮换关系得 \(A^3=I\) 且 \(A\neq I\),故 \(z^3-1\) 零化 \(A\);由定理 5.27,\(q\mid z^3-1=(z-1)(z^2+z+1)\)。又 \((1,1,1)\) 满足 \(A(1,1,1)=(1,1,1)\),故 \(1\) 是特征值,由定理 5.28 得 \((z-1)\mid q\)。于是 \(q\) 只能是 \(z-1\) 或 \((z-1)(z^2+z+1)=z^3-1\);前者意味着 \(A=I\),不成立。故 \(q=z^3-1\)。检验:\(z^3-1\) 的实零点只有 \(1\),恰是 \(A\) 唯一的实特征值;在 \(\mathbb{C}\) 上另两个零点 \(\frac{-1\pm\sqrt{3}\,\mathrm{i}}{2}\) 是把 \(A\) 复化后所得算子的特征值(参见第 9 章关于实算子复化的讨论)。