在特征向量与特征值一节中,我们了解了形如T(x)=λx的形式: 其中λ为线性变换的特征值, x为与其对应的特征向量.我们在本节中将尝试扩大x的可能取值范围——把范围扩大到线性变换所作用的整个线性空间V.此时,我们能否尝试利用向量分解的形式, 把任意的v∈V分解成v=v1+v2+⋯+vn, 使得每一个vi都是和特征值λi有关的向量?这样一来我们便有
T(v)=λ1v1+⋯+λnvn.
定理 3.5
设λ1,λ2为线性变换T的两个不同的特征值,则EigT(λ1)∩EigT(λ2)={0}.
证明
假设存在非零向量u, 使得u∈EigT(λ1)∩EigT(λ2), 那么有
(T−λ1I)u=⋅(T−λ2I)u=0,即(λ1−λ2)Iu=0. 根据定义, λ1=λ2.
∎
该定理告诉了我们不同的特征空间之间没有交集(虽然其交集存在零向量,但是根据我们的定义,零向量不在我们所考虑的特征向量中).这也就意味着特征空间彼此线性无关.那么这些线性无关的特征空间构成的并集能否包含V呢?我们由此引出矩阵对角化的概念:
定义 3.5
在线性变换T:V⟶V中, 设dim(V)=n. 如果存在互不相同的子空间W1,W2,⋯,Wm以及常数λ1,λ2,⋯,λm∈F (m≤n), 使得
(i) V=i=1⨁mWi;
(ii)对于任意的w∈Wi, 有
T(w)=λiw.
我们则称T 可对角化 (Diagonalizable)
该定理告诉我们:线性变换(矩阵)可对角化需要满足两个条件:第一,其作用的线性空间V是若干个字空间的直和(不清楚此概念的读者请阅读第一章第四节的内容), 这些子空间其实就是T的特征空间;第二:对于每一个特征空间Wi而言,对于w∈Wi, 满足T(w)=λiw, 这里面λi即为和特征空间Wi相对应的特征值.
此时我们便知道,根据直和的定义,对于任意的v∈V, 都存在wi∈Wi, 使得
v=w1+w2+⋯+wm.
为方便后续的推导, 我们此时先假设m=n. 因此,再根据矩阵对角化的概念,我们便有
T(v)=λ1w1+λ2w2+⋯+λnwn,
其中λi即为与特征空间Wi对应的特征值.
由于特征空间彼此线性无关,因此w1,w2,⋯,wn也彼此线性无关.根据直和的定义,此时γ={w1,w2,⋯,wn}也构成V的一组基底,如果我们考虑线性变换T在基底γ下面的矩阵形式,不难得到
[T]γ=λ10λ2⋱0λn=diag(λ1,λ2,⋯,λn).
此时,我们也自然而然地联想到了基底之间的变换,如果设[T]E为该线性变换在标准基底下的表达形式的话,那么我们知道,存在可逆矩阵Q, 使得
[T]γ=Q−1[T]EQ.
我们再一次回顾形如下图的转化关系:
[v]γQ↓⏐[v]E[T]γ[T]E[Tv]γ⏐↑Q−1[Tv]E
其中可逆矩阵Q即为从标准基底γ变化到基底E的变化矩阵.
此时不妨设在标准基底E={e1,e2,⋯,en}中,有
v=c1e1+c2e2+⋯+cnen
同时,v还满足
v=λ1w1+λ2w2+⋯+λnwn
根据定义,我们有:
([T(e1)]γ⋯[T(en)]γ)λ1⋮λnγ=c1⋮cnE
形如([T(e1)]γ⋯[T(en)]γ)
的矩阵即为可逆矩阵Q. 不难发现,我们得到
λ1[T(e1)]γ+⋯+λn[T(en)]γ=v.
根据定义,我们便有[T(ei)]γ=wi, 其中wi为特征向量. 由此我们得出,可逆矩阵Q的第i列即为线性变换中与λi所对应的特征向量.
此时如果m<n, 且我们发现某一个特征空间的维数为k,(k>1)时,我们需要将该特征空间的特征值在对角线上重复k次,然后选取构成其基底的k个向量作为不同的特征向量依次写在相应的列里面. 即对每个特征空间而言, 我们取其一组基底, 若所有这些特征空间的基底合并后恰好构成V的一组基底,则T在这组基底下的矩阵为对角矩阵. 这一过程便是矩阵(线性变换)的对角化 (Diagonalization).
此时,我们便得出了判断线性变换(矩阵)是否可对角化的第一个定理:
定理 3.6
设线性变换T:V⟶V, 那么T可对角化的充要条件是存在可逆矩阵Q与对角矩阵P, 使得
Q−1TQ=P其中Q的列向量即为T的特征向量;P主对角线上的元素即为相对应的特征值.
该定理也可以叙述为:设线性变换T:V⟶V, 那么T可对角化的条件是存在可逆矩阵Q与对角矩阵P, 使得
QPQ−1=T
其中Q的列向量即为T的特征向量;P主对角线上的元素即为相对应的特征向量.
随后,我们进一步来探究线性变换(矩阵)可对角化的条件.设线性空间V的维数为n.假设此时线性变换T:V⟶V有n个不同的特征值,那么我们便知道此时就有n个彼此线性无关的特征向量,由这些特征向量作为列向量构成的矩阵可逆,也就满足了矩阵对角化的条件.由此我们可以再引出一条定理:
定理 3.7
设线性变换T:V⟶V, dim(V)=n.若T存在n个互不相同的特征值,则T可对角化.
如果T的特征值个数小于n, 此时并不意味着T不能对角化,我们只需要找出n个彼此线性无关的特征向量即可.此时我们注意到由于特征空间的个数小于n, 因此一定存在维数大于1的特征空间,自然在该空间里面也可以找到多个彼此线性无关的特征向量.在这种情况下该特征空间对应的特征值在对角矩阵中会重复出现,出现次数与其维数相同.
推论 3.4
设线性变换T:V⟶V, dim(V)=n.若T存在n个彼此线性无关的特征向量,则T可对角化.
此时,我们再从几何重数与代数重数的角度去理解这个问题.我们知道,特征值的几何重数代表其特征空间的维数,也代表着该特征空间里面彼此线性无关的特征向量的个数.因此我们还可以引出一条推论:
推论 3.5
设线性变换T:V⟶V, dim(V)=n.若T的所有特征值的几何重数之和为n, 则T可对角化.
再进一步的深入讨论之前,我们引出一条定理,来说明几何重数与代数重数之间的关系.
定理 3.8
设线性变换T:V⟶V, 则对于T的任意一个特征值λ而言,其代数重数大于等于其几何重数.
该定理的证明我们在此省略,读者不必知道其证明方法.值得注意的是,任何一个特征值的代数重数均大于等于1, 并且根据定义, 当特征多项式在数域F中可分解时, 所有特征值的代数重数之和为n(线性空间的维数).
例题 3.5
设线性变换T:V⟶V, 已知dim(V)=5, 且T的特征值为0,1,2. 若rank(T)=2, 证明: T可对角化.
解答 3.5
由秩零定理可知,dim(Ker(T))=3, 即dim(Ker(T−0I))=3, 则特征值0对应的特征空间的维数为3,特征值λ=0的几何重数即为3.也就是说λ=0的代数重数大于等于3, 由于全体特征值的代数重数之和为5, 且1,2这两个特征值的代数重数不为零,则λ=0的代数重数为3, 特征值1,2的代数重数均为1,且已知任何特征值的代数重数均大于等于其几何重数,所以特征值1,2的几何重数为1. 由于所有特征值的几何重数之和为5 (dim(V)), 因此T可对角化.
那么我们现在已经万事俱备,只欠东风了:我们引出最重要的对角化定理:
定理 3.9
设线性变换T:V⟶V, dim(V)=n, 且其特征多项式可在数域F中完全分解. 则T可对角化的充要条件是对于任何一个T的特征值λ, 其几何重数等于其代数重数.
这一定理的证明我们暂时忽略.
例题 3.6
设a为任意实数,在下列矩阵中,哪一个矩阵不可以对角化?
(A) 100a20−1a3
(B) 1a0a2−10−13
(C) 100120a02
(D) 100120a22
解答 3.6
我们逐个分析:
(A)选项:根据上三角矩阵的性质,A的特征值为1,2,3, 因此可知A有3个互不相同的特征值, 因此A可对角化.
(B)选项: 不难发现B为对称矩阵, 所有的对称矩阵均可对角化 (见本节章末习题).
(C)选项:根据上三角矩阵的性质,C的特征值为1,2, 其中λ=1的代数重数为1, 经计算其几何重数为1; λ=2的代数重数为2, 经计算其几何重数为2. 因此每一个特征值的代数重数均等于几何重数,则C可对角化.
(D)选项:根据上三角矩阵的性质,C的特征值为1,2, 其中λ=1的代数重数为1, 经计算其几何重数为1; λ=2的代数重数为2, 经计算其几何重数为1. 对于λ=2而言其几何重数不等于代数重数,因此D不可对角化.
{3.3 练习}
1. 判断下列矩阵能否对角化:
A=(1322)B=(2−1−4−1)C=(241−1).
2. 特征多项式相同的n×n矩阵一定都可以(或都不可以)对角化吗?不妨使用A=211301−3−1−2,B=032100010来验证这一猜想.
3. 设线性变换T:V⟶V 满足T2(v)=v,∀v∈V.证明:T可对角化.
4. 证明任何的对称矩阵(即A=AT)均可对角化.
5. 设n≥1, 定义线性变换T:Pn(x)⟶Pn(x), 满足:
T(f(x))=f(x)+f(1)(x)+f(2)(x)+⋯+f(n)(x)
其中f(k)(x)代表多项式f(x)的k阶导数.判断T能否对角化.