线性代数二三事

第2章:作用于线性空间之间的变换

2.1 线性变换和矩阵的关系

第2章 作用于线性空间之间的变换

经过了第一章的学习,我们对于线性代数的一些基本概念已经有所了解.在第一章中,我们主要研究的是对于给定向量和向量组之间的关系.那么在本章节里面我们将会从宏观的角度去进一步研究矩阵和向量之间的关系. 我们可以把矩阵和向量的乘法Ax=b\vec A\vec x = \vec b当作是一个函数,其中矩阵便代表了这个函数的法则, x\vec x便代表了函数里的输入值.通过给定的法则我们便可以知道其结果b\vec b的取值.我们便很想知道这些法则之间究竟有着怎么样的奥秘?这些法则和函数之间的相同点与不同点分别是什么?在线性代数中,我们称这样的运算法则为线性变换,它是线性代数得以发展壮大的媒介,任何矩阵的背后都有其独特的线性变换.通过完成对本章的学习,我们将建立起矩阵和线性变换的关系,届时我们对线性代数的理解便会更上一层楼.

对于函数y=f(x)y = f(x)而言,我们可以写成映射的形式f:XYf : X \rightarrow Y, 其中集合XX代表函数ff的定义域, 集合YY代表函数ff的值域.即xXx \in X, y=f(x)Yy = f(x) \in Y.那么我们同样可以从函数的角度去考虑我们的老朋友Ax=b\vec A \vec x = \vec b, 我们知道如果A\vec Am×nm \times n矩阵,那么xRn\vec x \in \mathbb{R}^n, bRm\vec b \in \mathbb{R}^m.因此矩阵A\vec A同样也可以看作类同于ff的运算法则,我们一般用T\vec T表示这样的运算法则.那么形如Ax=b\vec A\vec x = \vec b的方程即可以表示为T:RnRm\vec T : \mathbb{R}^n \longrightarrow \mathbb{R}^m.其中Rn\mathbb{R}^n即为运算T\vec T的定义域,我们一般也用集合URnU \subset \mathbb{R}^n来表示定义域;用VRmV \subset \mathbb{R}^m来表示值域.我们知道,对于函数y=f(x)y = f(x)而言,对给定的xx而言,有且仅有一个yy使得f(x)=yf(x) = y,否则便不满足函数的定义.那么对于我们所定义的运算T\vec T而言,其当然也有一定的限制条件.我们把这种满足条件的运算T\vec T称作是线性变换 (Linear Transformation),其具体定义如下:

定义 2.1

在数域F\mathbb{F}和线性空间U,VU, V上,若对任意的v,uU,λF\vec v , \vec u \in U , \lambda \in \mathbb{F}, 变换T:UV\vec T:U \to V满足

T(x+y)=T(x)+T(y)λT(x)=T(λx),\text{①} \hspace{0.1cm} \vec T(\vec x + \vec y) = \vec T(\vec x) + \vec T (\vec y) \hspace{0.3cm} \text{②} \hspace{0.1cm} \lambda \vec T (\vec x) = \vec T(\lambda \vec x),

我们则称T:UV\vec T : U \rightarrow V为定义在线性空间U,VU,V之间的线性变换,

在目前阶段,除非有特殊说明,否则我们一律默认作用于线性变换的数域为全体实数R\mathbb{R}.看到这样的定义,读者能否尝试从函数的角度去理解?读者可以尝试构造出一个函数g(x)g(x), 使得其为线性变换.

定理 2.1

T:UV\vec T : U \rightarrow V为定义在线性空间U,VU,V之间的线性变换, 则:

T(0)=0T(v)=T(v)\vec T(\vec 0) = \vec 0 \hspace{0.3cm} \text{②} \vec T(-\vec v) = -\vec T(\vec v).

证明

① :根据零向量的定义,0=0+0\vec 0 = \vec 0 + \vec 0, 则T(0)=T(0+0)=T(0)+T(0)\vec T(\vec 0) = \vec T(\vec 0 + \vec 0) = \vec T(\vec 0) + \vec T(\vec 0), 即T(0)=0\vec T(\vec 0) = \vec 0.② : 我们取常数λ=1\lambda = -1, 则T(v)=T((1)v)=T(v)\vec T(-\vec v) = \vec T((-1)\vec v) = -\vec T(\vec v).

虽然我们发现T(0)=0\vec T(\vec 0) = \vec 0, 但我们要注意“此零非彼零”:两个零向量分别指代线性空间UUVV的零向量. 因此严格来讲我们有T(0U)=0V\vec T(\vec 0_U) = \vec 0_V. 但是对于任何线性空间而言,零向量的定义是不变的,即0+u=u\vec 0 + \vec u = \vec u.

例题 2.1

设作用于R2\mathbb{R}^2上的运算HH满足H(x,y)=(x,y)H (x , y ) = ( \vert x \vert , \vert y \vert ), 那么HH是否为线性变换?

解答 2.1

我们可以先验证零向量: 即验证H(0,0)=(0,0)H(0,0) = (0,0), 这一点显然满足题意.随后我们设u1=(x1,y1);u2=(x2,y2)\vec u_1 = (x_1,y_1) ; \vec u_2 = (x_2,y_2), 那么H(u1+u2)=H((x1+x2,y1+y2))=(x1+x2,y1+y2)H(\vec u_1 + \vec u_2) = H( (x_1 + x_2 , y_1 + y_2) ) = ( \vert x_1 + x_2 \vert , \vert y_1 + y_2 \vert ).而H(u1)+H(u2)=(x1,y1)+(x2,y2)=(x1+x2,y1+y2)H(\vec u_1) + H(\vec u_2) = (\vert x_1 \vert , \vert y_1 \vert ) + (\vert x_2 \vert , \vert y_2 \vert) = (\vert x_1 \vert + \vert x_2 \vert , \vert y_1 \vert + \vert y_2 \vert ), 我们知道x+yx+y\vert x + y \vert \leq \vert x \vert + \vert y \vert, 因此H(u1+u2)H(u1)+H(u2)H(\vec u_1 + \vec u_2 ) \neq H(\vec u_1) + H(\vec u_2).因此HH不为线性变换.

例题 2.2

设运算D:Pn(x)Pn1(x)D : \mathbb{P}_n(x) \longrightarrow \mathbb{P}_{n-1}(x), 设f(x)Pn(x)f(x) \in \mathbb{P}_n(x), 满足D(f(x))=f(x)D(f(x)) = f'(x), 那么DD是否为线性变换?

解答 2.2

由于常值函数的导数为零,因此f(x)=0f(x) = 0f(x)=0f'(x) = 0. 根据求导法则,我们很容易知道(f(x)+g(x))=f(x)+g(x);(cf(x))=cf(x)(f(x) + g(x) )' = f'(x) + g'(x) ; (cf(x))' = cf'(x), 因此DD为线性变换.

接下来,在我们知道线性变换的抽象定义之后,我们怎么把抽象问题具体化呢?于是我们来一起研究一下线性变换和矩阵之间的关系.我们不妨设T:UV\vec T : U \longrightarrow V为一个线性变换,然后我们再设β={u1,u2,,un}\beta = \lbrace \vec u_1, \vec u_2 , \cdots, \vec u_n \rbrace为线性空间UU的一组基底.那么我们知道对任意的xU\vec x \in U, 存在唯一的线性组合x=c1u1+c2u2++cnun\vec x = c_1 \vec u_1 + c_2 \vec u_2 + \cdots + c_n \vec u_n, 并且我们知道向量x\vec x在基底β\beta下的坐标为 [x]β=(c1c2cn)β[\vec x]_{\beta} = \begin{pmatrix} c_1 & c_2 & \cdots & c_n \end{pmatrix}_{\beta}^\top. 因此对x\vec x施加变换T\vec T, 我们有T(x)=T(c1u1++cnun)\vec T(\vec x) = \vec T(c_1 \vec u_1 + \cdots + c_n \vec u_n). 再结合线性变换的性质, 我们得到

T(x)=c1T(u1)++cnT(un).\vec T(\vec x) = c_1 \vec T(\vec u_1) + \cdots + c_n \vec T(\vec u_n).

此时, 我们设矩阵A\vec A的列向量分别为T(u1),,T(un)\vec T(\vec u_1), \cdots, \vec T(\vec u_n), 那么我们便得到

T(x)=Ax=(T(u1)T(u2)T(un))(c1cn)=c1T(u1)++cnT(un).\vec T(\vec x) = \vec A \vec x= \left(\begin{array}{||c|} \\ \vec T(\vec u_1) & \vec T(\vec u_2) & \cdots & \vec T(\vec u_n) \\ \end{array}\right) \begin{pmatrix} c_1 \\ \vdots \\ c_n \end{pmatrix} = c_1 \vec T(\vec u_1) + \cdots +c_n \vec T(\vec u_n).

如果此时我们假设VV的一组基底为γ={v1,,vm}\gamma=\{\vec v_1,\cdots,\vec v_m\}, 然后我们将T(ui)\vec T(\vec u_i)写成在γ\gamma下的坐标[T(ui)]γ[\vec T(\vec u_i)]_\gamma, 那么原来的线性变换便可以写作

[T(x)]γ=c1[T(u1)]γ++cn[T(un)]γ=[T]βγ[x]β.[\vec T(\vec x)]_\gamma = c_1[\vec T(\vec u_1)]_\gamma + \cdots+c_n[\vec T(\vec u_n)]_\gamma = [\vec T]_{\beta}^\gamma[\vec x]_\beta.

经由上面的推理,我们发现在线性变换T:UV\vec T: U \to V中, 在选定UU的基底β\beta, VV的基底γ\gamma的情况下, Tx\vec T \vec x便是将x\vec xβ\beta基底下的坐标变换成Tx\vec T\vec xγ\gamma基底下的坐标. 我们称此时的矩阵为该线性变换的矩阵形式. 我们不难发现, 不同的基底对应的矩阵形式不一定相同. 因此对于特定的问题而言,我们也要选取特定的基底γ\gamma, 使得运算更为简便.这一点我们会在后面几节当中深入学习.

定理 2.2

T:UV\vec T : U \rightarrow V为定义在线性空间U,VU,V之间的线性变换, β={u1,,un}\beta = \lbrace \vec u_1, \cdots , \vec u_n \rbraceUU的一组基底, γ\gammaVV的一组基底,那么对于x=c1u1++cnunU\vec x = c_1 \vec u_1 + \cdots + c_n \vec u_n \in U, 有

[T(x)]γ=c1[T(u1)]γ++cn[T(un)]γ=[T]βγ[x]β.[\vec T(\vec x)]_\gamma = c_1 [\vec T(\vec u_1)]_{\gamma} + \cdots + c_n [\vec T(\vec u_n)]_{\gamma}=[\vec T]_\beta^\gamma[\vec x]_\beta.

我们这样做的目的还是为了使得计算更加简便,当x\vec x整体不好计算时,我们可以把x\vec x写成若干基底向量的线性组合,然后对形式简单的基底向量施加线性变换,最后再进行加和.我们来通过一个具体的例子来看这种简化思想是怎么体现的:

例题 2.3

在平面直角坐标系R2\mathbb{R}^2中,线性变换RR满足以下性质:对于任意的xR2\vec x \in \mathbb{R}^2, R(x)R(\vec x)的结果为将向量x\vec x绕坐标原点顺时针旋转角度θ(0θπ/2)\theta (0 \leq \theta \leq \pi/2). 那么对于任意的向量x=(ab)\vec x = \begin{pmatrix} a \\ b \end{pmatrix}而言, 计算其结果[R(x)]E[R(\vec x)]_E

解答 2.3

对于本题中提到的线性变换R:R2R2R : \mathbb{R}^2 \longrightarrow \mathbb{R}^2,此时我们可以统一选取标准基底E={(10),(01)}E = \left\{ \begin{pmatrix} 1 \\ 0 \end{pmatrix} , \begin{pmatrix} 0 \\ 1 \end{pmatrix} \right\}, 然后我们对基底向量施加变换RR : 在平面直角坐标系中,通过几何关系便不难发现将(10)\begin{pmatrix} 1 \\ 0 \end{pmatrix}顺时针旋转角度θ\theta之后得到(cos(θ)sin(θ))\begin{pmatrix} \cos(\theta) \\ -\sin(\theta)\end{pmatrix}. 同理不难求出R(01)=(sin(θ)cos(θ))R \begin{pmatrix} 0 \\ 1 \end{pmatrix} = \begin{pmatrix} \sin(\theta) \\ \cos(\theta) \end{pmatrix}, 则变换RR在标准基底EE下对应的矩阵形式即为[R]E=(cos(θ)sin(θ)sin(θ)cos(θ))[R]_E = \begin{pmatrix} \cos(\theta) & \sin(\theta) \\ -\sin(\theta) & \cos(\theta) \end{pmatrix}, 将其乘以向量x\vec x, 我们得到

[R](x)=a(cos(θ)sin(θ))+b(sin(θ)cos(θ))=(acos(θ)+bsin(θ)asin(θ)+bcos(θ)),[R] (\vec x) = a \begin{pmatrix} \cos(\theta) \\ -\sin(\theta)\end{pmatrix} + b \begin{pmatrix} \sin(\theta) \\ \cos(\theta) \end{pmatrix} = \begin{pmatrix} a \cos(\theta) + b \sin(\theta) \\ -a\sin(\theta) + b\cos(\theta)\end{pmatrix},

该结果即为在标准基底EE下的坐标.

我们便不难发现,基底的选取一定要巧妙. 如果我们选取

β={(20232024),(20242023)}\beta = \left\{ \begin{pmatrix} 2023 \\ 2024 \end{pmatrix} , \begin{pmatrix} 2024 \\ -2023 \end{pmatrix} \right\}

作为基底的话,不是不能算,但要是像这样去求这些向量绕原点旋转角度θ\theta的话,与标准基底相比肯定就会复杂许多. 但是当我们选取简便的基底时, 我们需要格外小心. 再来看一个R2\mathbb{R}^2的例子:

例题 2.4

在平面直角坐标系R2\mathbb{R}^2中,线性变换PP满足以下性质:对于任意的xR2\vec x \in \mathbb{R}^2, P(x)P(\vec x)的结果为将向量x\vec x投影至直线y=2xy = 2x上.那么对于任意的向量x=(ab)\vec x = \begin{pmatrix} a \\ b \end{pmatrix}而言, 计算其结果P(x)P(\vec x)

解答 2.4

我们是不是可以直接选取这样的一组基底β={v1,v2}\beta = \lbrace \vec v_1 , \vec v_2 \rbrace, 使得v1\vec v_1恰在直线上,这样一来P(v1)=v1=(10)βP(\vec v_1) = \vec v_1 = \begin{pmatrix} 1 \\0 \end{pmatrix}_{\beta}, 投影即为其自身; 对于v2\vec v_2而言,我们是否也可以找一个与直线垂直的向量?这样P(v2)=0=(00)βP(\vec v_2) = 0 = \begin{pmatrix} 0 \\ 0 \end{pmatrix}_{\beta}. 我们不妨设

v1=(12),v2=(21).\vec v_1 = \begin{pmatrix} 1 \\ 2 \end{pmatrix}, \quad \vec v_2 = \begin{pmatrix} -2 \\ 1\end{pmatrix}.

那么这样一来, 根据定义我们就有该线性变换的矩阵形式(P(v1)P(v2))=(1000)\begin{pmatrix} P(\vec v_1) & P(\vec v_2) \end{pmatrix} = \begin{pmatrix} 1 & 0 \\ 0 & 0 \end{pmatrix}. 我们如果取xOyxOy内任意一点(ab)\begin{pmatrix} a \\ b \end{pmatrix}, 那么将其投影到直线 y=2xy = 2x之后的结果应该是a(10)+b(00)=(a0)a \begin{pmatrix} 1 \\ 0 \end{pmatrix} + b \begin{pmatrix} 0 \\0 \end{pmatrix} = \begin{pmatrix} a \\ 0 \end{pmatrix}.这样计算有什么问题?

在此时的矩阵A=(P(v1)P(v2))\vec A = \begin{pmatrix} P(\vec v_1) & P(\vec v_2) \end{pmatrix}为线性变换在基底β\beta下的形式. 而我们随后乘以的向量x\vec x是在标准基底下的形式. 因此两者的基底不同, 我们便不能放在一起去运算. 我会在稍微靠后的章节中讲解基变换, 到时候我们便知道这两种方法之间的联系.

定理 2.3

T,S:UV\vec T,\mathcal{S} : U \rightarrow V为定义在线性空间U,VU,V之间的线性变换, β={u1,,un}\beta = \lbrace \vec u_1, \cdots , \vec u_n \rbraceUU的一组基底, 若对任意的viβ\vec v_i \in \beta,有T(vi)=S(vi)\vec T(\vec v_i) = \mathcal{S}(\vec v_i), 则T=S\vec T = \mathcal{S}.

证明

任取xU\vec x \in U, 则有x=c1v1++cnvn\vec x = c_1 \vec v_1 + \cdots + c_n \vec v_n, 则T(x)=c1T(v1)++cnT(vn)=c1S(v1)++cnS(vn)=S(x)\vec T(\vec x) = c_1 \vec T(\vec v_1) + \cdots + c_n \vec T(\vec v_n) = c_1 \mathcal{S}(\vec v_1) + \cdots + c_n\mathcal{S}(\vec v_n) = \mathcal{S}(\vec x).

例题 2.5

在空间直角坐标系R3\mathbb{R}^3中,线性变换P:R3R3P : \mathbb{R}^3 \longrightarrow \mathbb{R}^3满足以下性质:

P(112)=(100);P(011)=(010);P(211)=(001).P\begin{pmatrix} 1 \\ -1 \\ 2 \end{pmatrix} = \begin{pmatrix} 1 \\ 0 \\ 0 \end{pmatrix} ;\quad P\begin{pmatrix} 0 \\ 1 \\ 1 \end{pmatrix} = \begin{pmatrix} 0 \\ 1 \\ 0 \end{pmatrix} ;\quad P\begin{pmatrix} 2 \\ 1 \\ -1 \end{pmatrix} = \begin{pmatrix} 0 \\ 0 \\ 1 \end{pmatrix}.

据此求P(420)P\begin{pmatrix} 4 \\ 2 \\ 0 \end{pmatrix}.

解答 2.5

由线性变换的性质,我们知道存在这样的线性组合:

(420)=c1(112)+c2(011)+c3(211).\begin{pmatrix} 4 \\ 2 \\ 0 \end{pmatrix} = c_1 \begin{pmatrix} 1 \\ -1 \\ 2 \end{pmatrix} + c_2 \begin{pmatrix} 0 \\ 1 \\ 1 \end{pmatrix} + c_3 \begin{pmatrix} 2 \\ 1 \\ -1 \end{pmatrix}.

不难解出原方程的解为c1=12,c2=34,c3=74c_1 = \frac{1}{2}, c_2 = \frac{3}{4}, c_3 = \frac{7}{4}这样一来

P(420)=12P(112)+34P(011)+74P(211)=(231).P\begin{pmatrix} 4 \\ 2 \\ 0 \end{pmatrix} = \frac{1}{2} P\begin{pmatrix} 1 \\ -1 \\ 2 \end{pmatrix} + \frac{3}{4} P\begin{pmatrix} 0 \\ 1 \\ 1 \end{pmatrix} + \frac{7}{4} P\begin{pmatrix} 2 \\ 1 \\ -1 \end{pmatrix} = \begin{pmatrix} 2 \\ 3 \\ 1 \end{pmatrix}.

{2.1 练习}

1.T1,T2,T3,T4:R2R2\vec T_1, \vec T_2, \vec T_3 , \vec T_4 : \mathbb{R}^2 \longrightarrow \mathbb{R}^244个线性变换,其在标准基底下的变化矩阵分别为

T1=(1201);T2=(2011);T3=(0112);T4=(0121);\vec T_1 = \begin{pmatrix} 1 & -2 \\ 0 & 1 \end{pmatrix} ; \vec T_2 = \begin{pmatrix} 2 & 0 \\ 1 & 1 \end{pmatrix} ; \vec T_3 = \begin{pmatrix} 0 & -1 \\ -1 & 2 \end{pmatrix} ; \vec T_4 = \begin{pmatrix} 0 & 1 \\ 2 & 1 \end{pmatrix};

那么对于如下图所示的图形而言,经过上述的四种变换之后分别对应下列选项中的哪一个图像?

2. 我们设T:RnRn\vec T : \mathbb{R}^n \longrightarrow \mathbb{R}^n为线性变换,我们任取v1,v2vnRn\vec v_1 , \vec v_2 \cdots \vec v_n \in \mathbb{R}^n, 那么v1,v2,,vn\vec v_1 , \vec v_2, \cdots, \vec v_n彼此线性无关是T(v1),T(v2),,T(vn)\vec T(\vec v_1) , \vec T(\vec v_2) , \cdots, \vec T(\vec v_n)彼此线性无关的 ( )

(A) 充要条件 (B) 充分但不必要条件 (C) 必要但不充分条件 (D) 既不充分也不必要条件

3. 设线性变换T:R3R3\vec T : \mathbb{R}^3 \longrightarrow \mathbb{R}^3, 且 β={e1,e2,e3}\beta = \lbrace \vec e_1 , \vec e_2 , \vec e_3 \rbraceR3\mathbb{R}^3的一组基底,已知 T(e1+e2)=e3;T(e1+e3)=e2;T(e2+e3)=e1\vec T(\vec e_1 + \vec e_2) = \vec e_3 ; \vec T(\vec e_1 + \vec e_3) =\vec e_2 ; \vec T(\vec e_2 + \vec e_3) = \vec e_1, 据此求出T(e1)+T(e2)+T(e3)\vec T(\vec e_1) + \vec T(\vec e_2) + \vec T(\vec e_3).

4. 设线性变换Q:P2(x)RQ : \mathbb{P}_2(x) \longrightarrow \mathbb{R}, 已知Q(x+2)=1;Q(1)=5;Q(x2+x)=0Q(x+2) = 1 ; Q(1) = 5 ;Q(x^2 + x) = 0, 据此求Q(2x+3x2)Q(2-x+3x^2).

5. 在平面直角坐标系xOyxOy中,我们将抛物线y=x2y = x^2(0,0)(0,0)为旋转中心绕原点顺时针旋转角度θ,(0<θ<π/2)\theta, (0 < \theta < \pi/2), 使得旋转过后抛物线与xx轴相交于(5,0)(5,0), 通过建立合适的线性变换模型,求出此时抛物线旋转的角度θ\theta.