线性代数二三事

第3章:线性变换之间的转化

3.3 线性变换(矩阵)的对角化

第3章 线性变换之间的转化

在特征向量与特征值一节中,我们了解了形如T(x)=λx\vec T(\vec x) = \lambda \vec x的形式: 其中λ\lambda为线性变换的特征值, x\vec x为与其对应的特征向量.我们在本节中将尝试扩大x\vec x的可能取值范围——把范围扩大到线性变换所作用的整个线性空间V\vec V.此时,我们能否尝试利用向量分解的形式, 把任意的vV\vec v \in \vec V分解成v=v1+v2++vn\vec v = \vec v_1 + \vec v_2 + \cdots + \vec v_n, 使得每一个vi\vec v_i都是和特征值λi\lambda_i有关的向量?这样一来我们便有

T(v)=λ1v1++λnvn.\vec T(\vec v) = \lambda_1 \vec v_1 + \cdots + \lambda_n \vec v_n.

定理 3.5

λ1,λ2\lambda_1, \lambda_2为线性变换T\vec T的两个不同的特征值,则EigT(λ1)EigT(λ2)={0}Eig_{\vec T}(\lambda_1) \cap Eig_{\vec T} (\lambda_2)= \{\vec 0\}.

证明

假设存在非零向量u\vec u, 使得uEigT(λ1)EigT(λ2)\vec u \in Eig_{\vec T}(\lambda_1) \cap Eig_{\vec T}(\lambda_2), 那么有

(Tλ1I)u=(Tλ2I)u=0,(\vec T - \lambda_1 I) \vec u= \cdot (\vec T - \lambda_2I)\vec u = \vec 0,

(λ1λ2)Iu=0(\lambda_1-\lambda_2)I\vec u = \vec 0. 根据定义, λ1=λ2\lambda_1=\lambda_2.

该定理告诉了我们不同的特征空间之间没有交集(虽然其交集存在零向量,但是根据我们的定义,零向量不在我们所考虑的特征向量中).这也就意味着特征空间彼此线性无关.那么这些线性无关的特征空间构成的并集能否包含V\vec V呢?我们由此引出矩阵对角化的概念:

定义 3.5

在线性变换T:VV\vec T : \vec V \longrightarrow \vec V中, 设dim(V)=n\dim(\vec V) = n. 如果存在互不相同的子空间W1,W2,,Wm\mathcal{W}_1, \mathcal{W}_2, \cdots, \mathcal{W}_m以及常数λ1,λ2,,λmF\lambda_1, \lambda_2, \cdots, \lambda_m \in \mathbb{F} (mnm \leq n), 使得

(i) V=i=1mWi\vec V = \displaystyle{\bigoplus_{i=1}^m\mathcal{W}_i};

(ii)对于任意的wWi\vec w \in \mathcal{W}_i, 有 T(w)=λiw\vec T(\vec w) = \lambda_i \vec w.

我们则称T\vec T 可对角化 (Diagonalizable)

该定理告诉我们:线性变换(矩阵)可对角化需要满足两个条件:第一,其作用的线性空间V\vec V是若干个字空间的直和(不清楚此概念的读者请阅读第一章第四节的内容), 这些子空间其实就是T\vec T的特征空间;第二:对于每一个特征空间Wi\vec{W}_i而言,对于wWi\vec w \in \vec{W}_i, 满足T(w)=λiw\vec T(\vec w) = \lambda_i \vec w, 这里面λi\lambda_i即为和特征空间Wi\vec{W}_i相对应的特征值.

此时我们便知道,根据直和的定义,对于任意的vV\vec v \in \vec V, 都存在wiWi\vec w_i \in \vec{W}_i, 使得

v=w1+w2++wm.\vec v = \vec w_1 + \vec w_2 + \cdots + \vec w_m.

为方便后续的推导, 我们此时先假设m=nm=n. 因此,再根据矩阵对角化的概念,我们便有

T(v)=λ1w1+λ2w2++λnwn,\vec T(\vec v) = \lambda_1 \vec w_1 + \lambda_2 \vec w_2 + \cdots + \lambda_n \vec w_n,

其中λi\lambda_i即为与特征空间Wi\vec{W}_i对应的特征值.

由于特征空间彼此线性无关,因此w1,w2,,wn\vec w_1, \vec w_2, \cdots, \vec w_n也彼此线性无关.根据直和的定义,此时γ={w1,w2,,wn}\gamma= \lbrace\vec w_1, \vec w_2, \cdots, \vec w_n \rbrace也构成V\vec V的一组基底,如果我们考虑线性变换T\vec T在基底γ\gamma下面的矩阵形式,不难得到

[T]γ=(λ10λ20λn)=diag(λ1,λ2,,λn).[\vec T]_{\gamma} = \begin{pmatrix} \lambda_1 & & & \vec 0 \\ & \lambda_2 & & \\ & & \ddots & \\ \vec 0& & & \lambda_n \end{pmatrix} = \diag(\lambda_1, \lambda_2, \cdots, \lambda_n).

此时,我们也自然而然地联想到了基底之间的变换,如果设[T]E[\vec T]_{E}为该线性变换在标准基底下的表达形式的话,那么我们知道,存在可逆矩阵Q\mathcal{Q}, 使得

[T]γ=Q1[T]EQ.[\vec T]_{\gamma} = \mathcal{Q}^{-1} [\vec T]_{E} \mathcal{Q}.

我们再一次回顾形如下图的转化关系:

[v]γ[T]γ[Tv]γQQ1[v]E[T]E[Tv]E\begin{CD} [\vec v]_{\gamma} @>{[\vec T]_{\gamma}}>> [\vec T \vec v]_{\gamma} \\ @V{\mathcal{Q}}VV @AA{\mathcal{Q}^{-1}}A \\ [\vec v]_{E} @>{[\vec T]_{E}}>> [\vec T \vec v]_{E} \end{CD}

其中可逆矩阵Q\mathcal{Q}即为从标准基底γ\gamma变化到基底EE的变化矩阵. 此时不妨设在标准基底E={e1,e2,,en}E = \lbrace \vec e_1, \vec e_2, \cdots, \vec e_n \rbrace中,有

v=c1e1+c2e2++cnen\vec v = c_1 \vec e_1 + c_2 \vec e_2 + \cdots + c_n \vec e_n

同时,v\vec v还满足

v=λ1w1+λ2w2++λnwn\vec v = \lambda_1 \vec w_1 + \lambda_2 \vec w_2 + \cdots + \lambda_n \vec w_n

根据定义,我们有:

([T(e1)]γ[T(en)]γ)(λ1λn)γ=(c1cn)E\left(\begin{array}{|c|} \\ [\vec T(\vec e_1)]_{\gamma} & \cdots & [\vec T(\vec e_n)]_{\gamma} \\ \end{array}\right) \begin{pmatrix} \lambda_1 \\ \vdots \\ \lambda_n \end{pmatrix}_{\gamma} = \begin{pmatrix} c_1 \\ \vdots \\ c_n\end{pmatrix}_{E}

形如([T(e1)]γ[T(en)]γ)\left(\begin{array}{|c|} \\ [\vec T(\vec e_1)]_{\gamma} & \cdots & [\vec T(\vec e_n)]_{\gamma} \\ \end{array}\right) 的矩阵即为可逆矩阵Q\mathcal{Q}. 不难发现,我们得到

λ1[T(e1)]γ++λn[T(en)]γ=v.\lambda_1 [\vec T(\vec e_1)]_{\gamma} + \cdots + \lambda_n [\vec T(\vec e_n)]_{\gamma} = \vec v.

根据定义,我们便有[T(ei)]γ=wi[\vec T(\vec e_i)]_{\gamma} = \vec w_i, 其中wi\vec w_i为特征向量. 由此我们得出,可逆矩阵Q\mathcal{Q}的第ii列即为线性变换中与λi\lambda_i所对应的特征向量.

此时如果m<nm<n, 且我们发现某一个特征空间的维数为k,(k>1)k, (k>1)时,我们需要将该特征空间的特征值在对角线上重复kk次,然后选取构成其基底的kk个向量作为不同的特征向量依次写在相应的列里面. 即对每个特征空间而言, 我们取其一组基底, 若所有这些特征空间的基底合并后恰好构成V\vec V的一组基底,则T\vec T在这组基底下的矩阵为对角矩阵. 这一过程便是矩阵(线性变换)的对角化 (Diagonalization).

此时,我们便得出了判断线性变换(矩阵)是否可对角化的第一个定理:

定理 3.6

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, 那么T\vec T可对角化的充要条件是存在可逆矩阵Q\mathcal{Q}与对角矩阵P\mathcal{P}, 使得

Q1TQ=P\mathcal{Q}^{-1} \vec T \mathcal{Q} = \mathcal{P}

其中Q\mathcal{Q}的列向量即为T\vec T的特征向量;P\mathcal{P}主对角线上的元素即为相对应的特征值.

该定理也可以叙述为:设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, 那么T\vec T可对角化的条件是存在可逆矩阵Q\mathcal{Q}与对角矩阵P\mathcal{P}, 使得

QPQ1=T\mathcal{Q}^{} \mathcal{P} \mathcal{Q}^{-1} = \vec T

其中Q\mathcal{Q}的列向量即为T\vec T的特征向量;P\mathcal{P}主对角线上的元素即为相对应的特征向量.

随后,我们进一步来探究线性变换(矩阵)可对角化的条件.设线性空间V\vec V的维数为nn.假设此时线性变换T:VV\vec T: \vec V \longrightarrow \vec Vnn个不同的特征值,那么我们便知道此时就有nn个彼此线性无关的特征向量,由这些特征向量作为列向量构成的矩阵可逆,也就满足了矩阵对角化的条件.由此我们可以再引出一条定理:

定理 3.7

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, dim(V)=n\dim(\vec V) = n.若T\vec T存在nn个互不相同的特征值,则T\vec T可对角化.

如果T\vec T的特征值个数小于nn, 此时并不意味着T\vec T不能对角化,我们只需要找出nn个彼此线性无关的特征向量即可.此时我们注意到由于特征空间的个数小于nn, 因此一定存在维数大于11的特征空间,自然在该空间里面也可以找到多个彼此线性无关的特征向量.在这种情况下该特征空间对应的特征值在对角矩阵中会重复出现,出现次数与其维数相同.

推论 3.4

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, dim(V)=n\dim(\vec V) = n.若T\vec T存在nn个彼此线性无关的特征向量,则T\vec T可对角化.

此时,我们再从几何重数与代数重数的角度去理解这个问题.我们知道,特征值的几何重数代表其特征空间的维数,也代表着该特征空间里面彼此线性无关的特征向量的个数.因此我们还可以引出一条推论:

推论 3.5

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, dim(V)=n\dim(\vec V) = n.若T\vec T的所有特征值的几何重数之和为nn, 则T\vec T可对角化.

再进一步的深入讨论之前,我们引出一条定理,来说明几何重数与代数重数之间的关系.

定理 3.8

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, 则对于T\vec T的任意一个特征值λ\lambda而言,其代数重数大于等于其几何重数.

该定理的证明我们在此省略,读者不必知道其证明方法.值得注意的是,任何一个特征值的代数重数均大于等于11, 并且根据定义, 当特征多项式在数域F\mathbb{F}中可分解时, 所有特征值的代数重数之和为nn(线性空间的维数).

例题 3.5

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, 已知dim(V)=5\dim(\vec V) = 5, 且T\vec T的特征值为0,1,20,1,2. 若rank(T)=2\rank(\vec T) = 2, 证明: T\vec T可对角化.

解答 3.5

由秩零定理可知,dim(Ker(T))=3\dim(\Ker(\vec T)) = 3, 即dim(Ker(T0I))=3\dim(\Ker(\vec T - 0 I)) = 3, 则特征值00对应的特征空间的维数为33,特征值λ=0\lambda=0的几何重数即为33.也就是说λ=0\lambda = 0的代数重数大于等于33, 由于全体特征值的代数重数之和为55, 且1,21,2这两个特征值的代数重数不为零,则λ=0\lambda=0的代数重数为33, 特征值1,21,2的代数重数均为11,且已知任何特征值的代数重数均大于等于其几何重数,所以特征值1,21,2的几何重数为11. 由于所有特征值的几何重数之和为55 (dim(V\dim(\vec V)), 因此T\vec T可对角化.

那么我们现在已经万事俱备,只欠东风了:我们引出最重要的对角化定理:

定理 3.9

设线性变换T:VV\vec T : \vec V \longrightarrow \vec V, dim(V)=n\dim(\vec V) = n, 且其特征多项式可在数域F\mathbb{F}中完全分解. 则T\vec T可对角化的充要条件是对于任何一个T\vec T的特征值λ\lambda, 其几何重数等于其代数重数.

这一定理的证明我们暂时忽略.

例题 3.6

aa为任意实数,在下列矩阵中,哪一个矩阵不可以对角化?

(A) (1a102a003)\begin{pmatrix} 1 & a & -1 \\ 0 & 2 & a \\ 0 & 0 & 3 \end{pmatrix}

(B) (1a0a21013)\begin{pmatrix} 1 & a & 0 \\ a & 2 & -1 \\ 0 & -1 & 3 \end{pmatrix}

(C) (11a020002)\begin{pmatrix} 1 & 1 & a \\ 0 & 2 & 0 \\ 0 & 0 & 2 \end{pmatrix}

(D) (11a022002)\begin{pmatrix} 1 & 1 & a \\ 0 & 2 & 2 \\ 0 & 0 & 2 \end{pmatrix}

解答 3.6

我们逐个分析:

(A)(A)选项:根据上三角矩阵的性质,AA的特征值为1,2,31,2,3, 因此可知AA33个互不相同的特征值, 因此AA可对角化.

(B)(B)选项: 不难发现BB为对称矩阵, 所有的对称矩阵均可对角化 (见本节章末习题).

(C)(C)选项:根据上三角矩阵的性质,CC的特征值为1,21,2, 其中λ=1\lambda = 1的代数重数为11, 经计算其几何重数为11; λ=2\lambda = 2的代数重数为22, 经计算其几何重数为22. 因此每一个特征值的代数重数均等于几何重数,则CC可对角化.

(D)(D)选项:根据上三角矩阵的性质,CC的特征值为1,21,2, 其中λ=1\lambda = 1的代数重数为11, 经计算其几何重数为11; λ=2\lambda = 2的代数重数为22, 经计算其几何重数为11. 对于λ=2\lambda=2而言其几何重数不等于代数重数,因此DD不可对角化.

{3.3 练习}

1. 判断下列矩阵能否对角化:

A=(1232)B=(2411)C=(2141).A = \begin{pmatrix} 1 & 2 \\ 3 & 2 \end{pmatrix} \hspace{0.5cm} B = \begin{pmatrix} 2 & -4 \\ -1 & -1 \end{pmatrix} \hspace{0.5cm} C = \begin{pmatrix} 2 & 1 \\ 4 & -1 \end{pmatrix}.

2. 特征多项式相同的n×nn \times n矩阵一定都可以(或都不可以)对角化吗?不妨使用A=(233101112),B=(010301200)A = \begin{pmatrix} 2 & 3 & -3 \\ 1 & 0 & -1 \\1& 1 & -2 \end{pmatrix}, B= \begin{pmatrix} 0 & 1 & 0 \\ 3 & 0 & 1 \\ 2 & 0 & 0 \end{pmatrix}来验证这一猜想.

3. 设线性变换T:VV\vec T : \vec V \longrightarrow \vec V 满足T2(v)=v,vV\vec T^2(\vec v) = \vec v, \hspace{0.1cm} \forall \vec v \in \vec V.证明:T\vec T可对角化.

4. 证明任何的对称矩阵(即A=ATA = A^T)均可对角化.

5.n1n \geq 1, 定义线性变换T:Pn(x)Pn(x)\vec T : \mathbb{P}_n(x) \longrightarrow \mathbb{P}_n(x), 满足:

T(f(x))=f(x)+f(1)(x)+f(2)(x)++f(n)(x)\vec T(f(x)) = f(x) + f^{(1)}(x) + f^{(2)}(x) + \cdots + f^{(n)}(x)

其中f(k)(x)f^{(k)}(x)代表多项式f(x)f(x)kk阶导数.判断T\vec T能否对角化.