线性代数二三事

第7章:线性回归分析初步

7.1 *统计推断基础

第7章 线性回归分析初步

数据在我们的生活中随处可见. 给定一组数据, 我们该如何研究数据中不同变量之间的关系? 在本章中, 我们将一起窥探线性回归分析: 通过建立变量之间的线性模型来对数据进行拟合.

在我看来, 想要更好地了解线性回归的话就必然要有扎实的统计推断基础. 尽管这本书是一本关于线性代数的书籍, 但我的初衷却是想让读者学到尽可能多的应用知识. 在当今环境下, 学好统计推断迫在眉睫. 因此在这一节里面我将用最简捷明了的篇幅带领大家学习统计推断中的重要概念和结论.

*{概率测度}

概率论为测度论的重要应用之一. 在此我将简要地叙述概率测度中的常见概念:

样本空间 (Sample Space): 我们通常使用集合Ω\Omega来表示样本空间. 样本空间代表了对于我们的研究对象而言所有可能发生的事件. 比如当我们研究抛一枚硬币时, 我们便可以将样本空间记作Ω={H,T}\Omega = \{ H, T\}. 其中HH表示硬币正面朝上; TT表示硬币背面朝上. 还比如当我们研究某物种种群的数量时, 我们便可以取样本空间为全体自然数, Ω={0,1,2,}\Omega = \{0,1,2,\cdots\}.

样本空间的σ\sigma-代数 (Sigma Algebra): 我们通常使用F\mathcal{F}表示. F\mathcal{F}为由Ω\Omega中的元素所组成的新集合. 我们称F\mathcal{F}是样本空间的Ω\Omegaσ\sigma-代数, 如果其满足以下三条性质:

(i) ΩF\Omega \in \mathcal{F};

(ii) 对任意的AFA \in \mathcal{F}, 其关于Ω\Omega的补集ΩAF\Omega \setminus A \in \mathcal{F};

(iii) 若A1,A2,FA_1,A_2,\cdots\in \mathcal{F}, 那么其并集i=1AiF\displaystyle{\bigcup_{i=1}^\infty A_i \in \mathcal{F}}.

在现阶段, 我们可以将F\mathcal{F}简单理解为将样本空间Ω\Omega中的元素进行任意交集, 并集与补集运算所得到的新集合. 那么对于抛一枚硬币而言, 此时Ω\Omegaσ\sigma-代数即为F={{H},{T},{H,T},}\mathcal{F}=\{ \{ H\}, \{T \}, \{H,T\}, \varnothing \}. 另外, 我们再定义 Borel σ\sigma-代数 (Borel Sigma-Algebra), 简记为B(R)B(\mathbb{R}), 且我们称其中的元素为Borel集 (Borel Set). 在本书涉及的常见集合中,例如区间、有限并、可数并、可数交等,都可以视为 Borel 集.我们不会涉及非 Borel 集的例子.

概率测度 (Probability Measure): 我们通常使用P\P来表示概率测度. 概率测度P\P是定义在样本空间Ω\Omegaσ\sigma-代数F\mathcal{F}上的函数. 对于AFA \in \mathcal{F}, 我们记P(A)\P(A)为事件AA发生的概率. 概率测度满足以下性质:

(i) 对任意的AFA \in \mathcal{F}, 0P(A)10\leq \P(A) \leq 1, 且P(Ω)=1\P(\Omega)=1;

(ii) 若A1,A2,FA_1,A_2,\cdots \in \mathcal{F}AiAj=,ijA_i \cap A_j = \varnothing, i\neq j, 那么

P(i=1Ai)=i=1P(Ai).\P\left( \bigcup_{i=1}^\infty A_i \right) = \sum_{i=1}^\infty \P(A_i).

我们习惯性地把(Ω,F,P)(\Omega, \mathcal{F}, \P)称为概率空间 (Probability Space). 对于A,BFA,B \in \mathcal{F}, 我们称事件A,BA,B的交事件为ABA \cap B, 即事件A,BA,B同时发生; 我们称A,BA,B的并事件为ABA \cup B, 即事件A,BA,B至少有一个发生. 若P(AB)=P(A)P(B)\P(A \cap B) = \P(A)\P(B), 我们则称事件A,BA,B相互独立 (Independent), 也就是说事件AA的发生不会影响到事件BB的发生, 反之同样成立.

条件概率 (Conditional Probability) 也是我们重点研究的对象之一. 对于事件A,BFA,B\in \mathcal{F}, 条件概率P(AB)\P(A|B)表示已知事件BB发生的情况下事件AA发生的概率. 其计算公式为

P(AB)=P(AB)P(B).\P(A|B) = \frac{\P(A \cap B)}{\P(B)}.

同理, 我们有P(BA)=P(BA)P(A)\P(B|A) = \frac{\P(B \cap A)}{\P(A)}. 因此综合二式我们可以得到

P(AB)=P(BA)P(A)P(B).\P(A|B) = \frac{\P(B|A)\P(A)}{\P(B)}.

此时, 若A,BA, B相互独立, 我们便有P(AB)=P(A)\P(A|B)=\P(A), 更加清晰地诠释了事件BB的发生不影响事件AA的发生. 我们如果考虑样本空间Ω\Omega的一个划分: Ω=B1B2Bn\Omega = B_1 \cup B_2 \cup \cdots \cup B_n, 且BiBj=B_i \cap B_j = \varnothing, 那么对于任意的事件BB, 我们可以求出BBBiB_i发生下的条件概率P(BBi)\P(B|B_i). 如果我们此时知道P(Bi)\P(B_i)的概率, 我们便可以将其进行结合从而得到全概率公式 (Law of Total Probability):

P(B)=P(BB1)P(B1)++P(BBn)P(Bn).\P(B) = \P(B|B_1)\P(B_1) + \cdots+\P(B|B_n)\P(B_n).

那么, 由此我们便可以得出Bayes 定理 (Bayes Theorem):

P(BiB)=P(BBi)P(Bi)P(BB1)P(B1)++P(BBn)P(Bn).\P(B_i|B) = \frac{\P(B|B_i)\P(B_i)}{\P(B|B_1)\P(B_1)+\cdots+\P(B|B_n)\P(B_n)}.

*{随机变量}

随机变量 (Random Variables)为将样本空间中的元素映射到实数的一个函数. 我们通常用XX来表示随机变量, 只不过此时随机变量的取值不再介于0011之间, 而是可以根据我们的研究兴趣而自由选择. 比如在抛硬币中, 我们规定正面朝上时得11分, 反面朝上时得00分. 此时我们便有X(H)=1,X(T)=0X(H)=1, X(T)=0. 当然, 我们还有其它更多的方法去定义这个随机变量, 比如正面得55分等. 设BB为任意一Borel集. 若函数X:ΩRX: \Omega \to \mathbb{R}满足 X1(B):={AΩ:X(A)B}FX^{-1}(B) := \{ A \in \Omega: X(A) \in B\} \in \mathcal{F}, 我们则称XX为一随机变量.

该定义告诉我们XX作为随机变量的充要条件为任意Borel集BB, 其原像为F\mathcal{F}中的元素. 在实践中, 我们往往将BB取区间(,x](-\infty, x]. 即对所有的xRx\in\mathbb{R},

X1((,x])={wΩ:X(w)x}F.X^{-1}((-\infty,x]) = \{ w \in \Omega : X(w) \leq x \} \in \mathcal{F}.

我们不妨回到最开始抛硬币的例子中: 设正面朝上得11分, 反面朝上得00分, 我们有X(H)=1,X(T)=0X(H)=1, X(T)=0. 那么对于xx而言, 我们分三种情况讨论:

• 若x<0x <0. 此时 我们知道没有相应的事件AΩA \in \Omega使得X(A)<0X(A)<0, 那么此时的原像便为空集X1((,x])=X^{-1}((-\infty, x])=\varnothing, 而我们前面知道F\varnothing \in \mathcal{F};

• 若0x<10\leq x < 1, 此时有TT满足条件, 因为X(T)=0X(T)=0. 因此X1((,x])={T}FX^{-1}((-\infty,x])=\{T \}\in \mathcal{F};

• 若x1x\geq 1, 此时H,TH,T均满足条件. 因此X1((,x])={H,T}=ΩFX^{-1}((-\infty, x]) = \{H,T\} =\Omega \in \mathcal{F}.

由此我们得知XX即为随机变量. 随机变量满足线性关系, 即当X,YX,Y均为随机变量, a,ba,b均为常数时, aX+bYaX+bY也为随机变量. 随机变量分为两类: 离散型随机变量 (Discrete Random Variables)连续型随机变量 (Continuous Random Variables). 对于离散型随机变量而言, 其函数取值通常为整数: 即X=0,1,2,3,X=0,1,2,3,\cdots. 对于连续型随机变量而言, 其取值通常为一个连续的区间[a,b][a,b]. 随机变量XX分布函数 (Distribution Function), 通常记作F(x)F(x), 被定义为是使得随机变量的取值小于xx的概率, 即

F(x):=P({wΩ:X(w)x}),F(x) := \P( \{ w \in \Omega: X(w) \leq x \}),

我们也通常将其简记为P(Xx)\P(X \leq x). 根据定义, 分布函数的取值为0011之间, 且单调递增. 在离散型随机变量中, 假设随机变量取得数值ii的概率为pip_i, P(X=i)=pi\P(X = i) = p_i. 那么

F(x)=ixpi,F(x) = \sum_{i \leq x} p_i,

此时pip_i被称作是离散型随机变量XX概率质量函数 (Probability Mass Function). 而对于连续型随机变量而言, 加和的形式即被替换成了积分:

F(x)=xf(t)dt,F(x) = \int_{-\infty}^x f(t) dt,

此时f(x)f(x)也被称作是连续性随机变量XX概率密度函数 (Probability Density Function).

XX为随机变量, 我们假设随机变量YY为关于XX的一元函数, 即Y=g(X)Y = g(X). 我们假设函数gg是单调且光滑的, 这样一来, 我们便知道YY的分布函数满足

FY(y)=P(Yy)=P(g(X)y)=P(Xg1(y)),F_Y(y)=\P(Y \leq y) = \P(g(X) \leq y) = \P(X \leq g^{-1}(y)),

其中g1(y)g^{-1}(y)为函数gg的反函数. 那么由此一来我们便有

FY(y)=g1(y)fX(x)dx.F_Y(y) = \int_{-\infty}^{g^{-1}(y)} f_X(x) dx.

再根据微积分基本定理, YY的概率密度函数即可写作

fY(y)=ddyFY(y)=ddxg1(y)fX(x)dx=fX(g1(y))ddyg1(y).f_Y(y) = \frac{d}{dy} F_Y(y) = \frac{d}{dx}\int_{-\infty}^{g^{-1}(y)} f_X(x) dx = f_X(g^{-1}(y))\cdot \left| \frac{d}{dy} g^{-1}(y) \right|.

*{随机变量的期望与方差}

对于一个随机变量而言, 我们定义其期望 (Expectation), 通常记作E[X]\E[X], 为

E[X]=iipi, 若X为离散型随机变量;E[X]=xf(x)dx, 若X为连续型随机变量,\E[X] = \sum_i i p_i, \text{ 若} X \text{为离散型随机变量}; \quad\E[X]=\int_{-\infty}^\infty x f(x) dx, \text{ 若} X \text{为连续型随机变量},

而对于关于XX的连续函数g(X)g(X)而言, 随机变量g(X)g(X)的期望满足

E[g(X)]=ig(i)pi, 若X为离散型随机变量;E[g(X)]=g(x)f(x)dx, 若X为连续型随机变量.\E[g(X)] = \sum_i g(i) p_i, \text{ 若} X \text{为离散型随机变量}; \quad\E[g(X)]=\int_{-\infty}^\infty g(x) f(x) dx, \text{ 若} X \text{为连续型随机变量}.

随机变量的期望同样满足线性关系. 设X,YX,Y为随机变量, a,ba,b为常数, 则E[aX+bY]=aE[X]+bE[Y]\E[aX+bY] = a\E[X]+b\E[Y]. 我们同时定义随机变量XX方差 (Variance), 通常记作Var(X)\Var(X), 为

Var(X)=E[(XE[X])2]:=E[X2](E[X])2.\Var(X) = \E\Big[ (X - \E[X])^2 \Big] := \E[X^2] - \Big( \E[X] \Big)^2.

对于随机变量XX和常数cc而言, Var(cX)=c2Var(X)\Var(cX) = c^2\Var(X), Var(c)=0\Var(c) = 0. 对于随机变量而言, 有两个重要的不等式. 它们分别为Markov 不等式 (Markov Inequality)Chebyshev 不等式 (Chebyshev Inequality):

  • Markov不等式: 对于非负随机变量XX而言, 设x0x \neq 0, 则 P(Xx)E[X]x\P(X \geq x) \leq \displaystyle{ \frac{\E[X]}{x} }.
  • Chevbyshev 不等式: 对随机变量XX和任意的x>0x>0, 有P(XE[X]x)Var(X)x2\displaystyle{ \P(|X-\E[X]| \geq x ) \leq \frac{\Var(X)}{x^2} }.

我们最后给出随机变量的矩母函数 (Moment Generating Function)的定义: 对于随机变量XX而言, 其矩母函数MX(t),t>0M_X(t), t>0

MX(t)=E[etX]={ietiP(X=i) 若X为离散型随机变量etxfX(x)dxX为连续型随机变量.M_X(t) = \E[e^{tX}] = \begin{cases} \sum_{i} e^{ti}\cdot \P(X=i) & \text{ 若} X \text{为离散型随机变量} \\ \int e^{tx} f_X(x) dx & \text{若} X \text{为连续型随机变量} \end{cases}.

矩母函数和随机变量之间有着一一对应的关系. 这一点同概率密度(质量)函数一样. 不同的随机变量便对应着不同的矩母函数与概率密度(质量)函数.

*{随机变量的联合分布}

对于多个随机变量而言, 我们同样可以定义它们的联合分布函数 (Joint Distribution Function). 我们设X1,X2,,XnX_1,X_2,\cdots,X_n为随机变量, 且X1f1(x),,Xnfn(x)X_1 \sim f_1(x), \cdots, X_n \sim f_n(x), 那么联合分布函数F(x1,x2,,xn)F(x_1,x_2,\cdots,x_n)的定义为

F(x1,x2,,xn)=P(X1x1X2x2Xnxn).F(x_1,x_2,\cdots,x_n) = \P(X_1\leq x_1 \cap X_2 \leq x_2 \cap \cdots \cap X_n \leq x_n).

X1,,XnX_1,\cdots,X_n均为连续性随机变量, 那么存在唯一的函数f(x1,,xn)f(x_1,\cdots,x_n), 使得

F(x1,,xn)=x1xnf(x1,,xn)dxndx1.F(x_1,\cdots,x_n) = \int_{-\infty}^{x_1}\cdots\int_{-\infty}^{x_n} f(x_1,\cdots,x_n) dx_n\cdots dx_1.

我们称f(x1,,xn)f(x_1,\cdots,x_n)X1,,XnX_1,\cdots,X_n联合密度函数 (Joint Density Function). 对于离散型随机变量而言我们只需要将积分替换成求和即可.

Xf(x),Yg(y)X \sim f(x), Y \sim g(y)为两个连续性随机变量, 令f(x,y)f(x,y)为其联合密度函数. 我们此时可以定义X,YX, Y边际密度函数 (Marginal Density Function):

f(y):=f(x,y)dx,f(x)=f(x,y)dy.f(y) := \int_{-\infty}^\infty f(x,y) dx, \quad f(x) = \int_{-\infty}^\infty f(x,y) dy.

F(x,y)=P(Xx)P(Yy)=xf(x)dxyg(y)dy,F(x,y) = \P(X \leq x) \cdot \P(Y \leq y) = \int_{-\infty}^x f(x) dx \cdot \int_{-\infty}^y g(y)dy,

我们则称随机变量X,YX,Y相互独立. 对于随机变量X,YX,Y而言, 我们定义它们之间的协方差 (Covariance)

Cov(X,Y)=E[(XE[X])(YE[Y])]=E[XY]E[X]E[Y],\Cov(X,Y) = \E\Big[(X-\E[X])(Y-\E[Y])\Big]=\E[XY]-\E[X]\E[Y],

其中

E[XY]=xyf(x,y)dxdy.\E[XY] = \iint xy f(x,y) dxdy.

X,YX,Y相互独立, 则Cov(X,Y)=0\Cov(X,Y) = 0.

*{大数定律与中心极限定理}

在本节里面我们将考虑一个随机变量列X1,X2,X_1,X_2,\cdots, 并研究其性质. 若X1,X2,X_1,X_2,\cdots独立, 且服从相同的概率密度函数(概率质量函数) f(x)f(x), 我们称{Xn}n=1\{ X_n\}_{n=1}^\infty独立同分布 (Independent and Identically Distributed. 通常记作X1,X2,i.i.df(x)X_1,X_2,\cdots \overset{i.i.d}{\sim} f(x).独立同分布且期望存在的随机变量列满足弱大数定律 (Weak Law of Large Numbers): 记E[X1]=E[X2]==μ\E[X_1]=\E[X_2]=\cdots=\mu,

1n(X1++Xn)Pμ,\frac{1}{n} (X_1+\cdots+X_n) \overset{\P}{\to} \mu,

我们通常将1n(X1++Xn)\frac{1}{n}(X_1+\cdots+X_n)记作样本均值 (Sample Mean)(或样本矩). 此时我们称样本均值依概率收敛 (Convergence in Probability)μ\mu, 记作XnPμ\overline{X}_n \overset{\P}{\to} \mu. 随机变量列{Xn}\{X_n\}依概率收敛于XX的严格定义为: 对任意的ε>0\epsilon>0, 都有

limnP(XnX>ε)=0.\lim_{n \to \infty} \P\Big( |X_n - X| > \epsilon \Big) = 0.

除了弱大数定律外, 还存在强大数定律 (Strong Law of Large Numbers). 在强大数定律下样本均值几乎处处收敛 (Amlost Surely Convergence)μ\mu, 记作Xna.sμ\overline{X}_n\overset{a.s}{\to}\mu. 随机变量列{Xn}\{X_n\}几乎处处收敛于XX的严格定义为:

P(limnXn=X)=1.\P\Big( \lim_{n \to \infty} X_n = X) = 1.

目前阶段读者不需要知道二者之间的差别. 如感兴趣, 欢迎阅读测度论相关的书籍. 我们再定义一种收敛类型: 弱收敛 (Weak Convergence), 通常记作d\overset{d}{\to}. 该收敛可以理解为是在分布函数层面上的收敛. 即若随机变量列{Xn}\{X_n\}弱收敛于XX, 那么设FnF_nXnX_n的分布函数, FFXX的分布函数, 则

limnFn(x)=F(x).\lim_{n\to\infty} F_n(x) = F(x).

中心极限定理 (Central Limit Theorem) 告诉我们, 对于期望(μ\mu)和方差(σ2)(\sigma^2)均存在的独立同分布随机变量列{Xn}\{X_n\},

Zn=Xnμσ/ndN(0,1),Z_n = \frac{\overline{X}_n - \mu}{\sigma/\sqrt{n}} \overset{d}{\to} N(0,1),

即随机变量列ZnZ_n弱收敛于正态分布N(0,1)N(0,1)的概率密度函数. 此时正态分布N(0,1)N(0,1)对应的概率密度函数即为

f(x)=12πex2/2.f(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2}.

当我们知道了随机变量列{Xn}\{X_n\}的收敛性后, 我们还可以研究其变换{g(Xn)}\{ g(X_n) \}的收敛性. 假设g(x)g(x)为连续函数, 且XnX_n弱收敛于XX:XnXX_n \to X, 那么根据连续映射定理 (Continuous Mapping Theorem), 我们有

g(Xn)dg(X).g(X_n) \overset{d}{\to} g(X).

*{最大似然估计}

我们在统计推断中, 往往会假设我们获得的样本符合独立同分布的特征. 我们记X1,,Xni.i.df(x;θ)X_1,\cdots,X_n \overset{i.i.d}{\sim } f(x;\theta). 其中ff为随机变量的概率密度(质量)函数, 而θ\theta为参数. 比如对于指数分布而言, 其概率密度函数为

f(x;θ)=1θex/θ;f(x;\theta) = \frac{1}{\theta} e^{-x/\theta};

而对于正态分布而言, 其概率密度函数为

f(x;μ,σ2)=12πσe(xμ)2/2σ2.f(x;\mu,\sigma^2) = \frac{1}{\sqrt{2\pi}\sigma} e^{-(x-\mu)^2/2\sigma^2}.

通常我们会假设我们已经知道了这组独立同分布随机变量所属的分布类型. 那么我们只需要估计出里面的参数θ\theta便可以更好地了解其分布情况. 我们将这类问题称作是参数估计 (Parameter Estimation). 此时我们拥有的数据仅为X1,,XnX_1,\cdots,X_n这些观测到的样本, 我们定义参数θ\theta的一个估计量 (Estimator) 即为关于X1,,XnX_1,\cdots,X_n的一个函数. 比如样本均值1n(X1++Xn)\frac{1}{n}(X_1+\cdots+X_n)即为一个估计量. 此外, 形式简单的X1+X2X_1+X_2也为一个估计量. 我们用无偏性 (Unbiasedness)来衡量估计量的好坏. 若某估计量T(X1,,Xn)T(X_1,\cdots,X_n)满足E[T(X1,,Xn)]=θ\E[T(X_1,\cdots,X_n)] = \theta, 我们则称T(X1,,Xn)T(X_1,\cdots,X_n)为关于θ\theta无偏估计量 (Unbiased Estimator); 同时若估计量T(X1,,Xn)T(X_1,\cdots,X_n)依测度收敛于θ\theta, 我们则称T(X1,,Xn)T(X_1,\cdots,X_n)为关于θ\theta一致估计量 (Consistent Estimator). 比如在我们的例子中, 样本均值的期望满足

E[1n(X1++Xn)]=1n(E[X1]+E[X2]++E[Xn])=1nnμ=μ,\E\left[ \frac{1}{n}(X_1+\cdots+X_n ) \right] = \frac{1}{n}\Big(\E[X_1] + \E[X_2] + \cdots + \E[X_n] \Big) = \frac{1}{n}\cdot n\mu = \mu,

因此样本均值Xn\overline{X}_n为关于μ\mu的无偏估计量.

最大似然估计 (Maximum Likelihood Estimator) 是目前使用最广泛的参数估计法之一. 对于给定的独立同分布样本X1,,Xni.i.df(x;θ)X_1,\cdots,X_n \overset{i.i.d}{\sim} f(x;\theta), 假设我们得出的样本观测值为x1,,xnx_1,\cdots,x_n. 那么该样本的似然函数为

L(θ)=i=1nf(xi;θ).L(\theta) = \prod_{i=1}^n f(x_i;\theta).

我们可以将其看作是关于θ\theta的一个函数. 那么在此情况下参数θ\theta的最大似然估计量θ^MLE\hat{\theta}_{MLE}即为使得似然函数L(θ)L(\theta)取得极大值时的θ\theta取值:

θ^MLE=argmaxθL(θ).\hat{\theta}_{MLE}=\arg\max_{\theta} L(\theta).

通常我们取似然函数的对数, 从而得到对数似然函数:

(θ)=i=1nlogf(xi;θ),\ell(\theta) = \sum_{i=1}^n \log f(x_i;\theta),

然后结合对数函数的单调性, 最大似然估计量θ^MLE\hat{\theta}_{MLE}同时也为使得对数似然函数取得最大值时θ\theta的取值. 比如在服从两点分布的样本中, 假设参数为θ,(0<θ<1)\theta, (0<\theta<1), 其概率质量函数为θx(1θ)1x,x=0,1\theta^x(1-\theta)^{1-x}, x=0,1. 那么我们有

(θ)=i=1nlogθxi(1θ)1xi=i=1nxilogθ+(1xi)log(1θ),\ell(\theta) = \sum_{i=1}^n \log \theta^{x_i} (1-\theta)^{1-x_i} = \sum_{i=1}^n x_i\log\theta +(1-x_i)\log(1-\theta),

对其求导得

θ=i=1nxiθ1xi1θ,\frac{\pl \ell}{\pl\theta} = \sum_{i=1}^n \frac{x_i}{\theta} - \frac{1-x_i}{1-\theta},

求解θ=0\frac{\pl \ell}{\pl\theta}=0, 我们有

i=1nxiθθ(1θ)=0,\sum_{i=1}^n\frac{x_i-\theta}{\theta(1-\theta)}=0,

由于分母恒不为零, 因此i=1nxinθ=0\sum_{i=1}^n x_i-n\theta=0, 即θ^MLE=Xn\hat{\theta}_{MLE} =\overline{X}_n. 因此我们称在两点分布中样本均值Xn\overline{X}_n即为参数θ\theta得最大似然估计. 最大似然估计量满足不变性, 即若θ^\hat{\theta}为参数θ\theta的最大似然估计量, 那么对于函数f(x)f(x)而言, f(θ^)f(\hat{\theta})也同为f(θ)f(\theta)的最大似然估计量.

*{Fisher 信息}

假设我们有独立同分布的样本X1,X2,,Xni.i.df(x;θ)X_1,X_2,\cdots,X_n \overset{i.i.d}{\sim} f(x;\theta), 其中θ\theta为参数. 在统计推断中, 我们经常需要引入正则条件 (Regularity Conditions):

(i) 随机变量的概率密度(质量)函数的定义域与参数θ\theta无关;

(ii) 我们默认概率密度 (质量) 函数为关于参数θ\theta的光滑函数.

在正则条件下, 我们能够给出有关参数θ\theta的估计量T(X)T(\vec X)的一些性质: 我们定义样本XiX_iFisher 信息 (Fisher Information)

Ii(θ)=E[(θlogf(xi;θ))2],\mathcal{I}_i(\theta) = \E\left[ \left( \frac{\pl}{\pl\theta} \log f(x_i;\theta) \right)^2 \right],

总样本的Fisher信息为

In(θ)=E[(θlogi=1nf(xi;θ))2].\mathcal{I}_n(\theta) = \E\left[ \left( \frac{\pl}{\pl\theta} \log\prod_{i=1}^n f(x_i;\theta) \right)^2 \right].

根据Bartlett公式, Fisher信息还可以写作

In(θ)=E[2θ2logi=1nf(xi;θ)].\mathcal{I}_n(\theta) = -\E\left[ \frac{\pl^2}{\pl\theta^2} \log\prod_{i=1}^n f(x_i;\theta) \right].

Fisher信息可用于对某一参数估计量的方差进行检验. 我们设T(X)T(\vec X)为关于以参数θ\theta为变量的函数τ(θ)\tau(\theta)的无偏估计量, 那么Var(T(X))\Var(T(\vec X))存在一确定下界. 该下界也被称为Cramér-Rao 下界 (Cramér-Rao Lower Bound):

Var(T(X))[τ(θ)]2In(θ).\Var(T(\vec X)) \geq \frac{[\tau'(\theta)]^2}{\mathcal{I}_n(\theta)}.

在参数估计中, Ii(θ)\mathcal{I}_i(\theta)往往为未知量, 我们也可用其估计量I^i(θ)\hat{\mathcal{I}}_i(\theta):

I^1(θ)=1nj=1n2θ2logf(xj;θ^MLE).\hat{\mathcal{I}}_1(\theta) = -\frac{1}{n}\sum_{j=1}^n \frac{\pl^2}{\pl\theta^2} \log f(x_j;\hat{\theta}_{MLE}).

*{置信区间}

不同于最大似然估计, 置信区间 (Confidence Interval)利用中心极限定理来构造一个区间(L(X),U(X))(L(X), U(X)), 使得在重复抽样的前提下,参数θ\theta包含在区间(L(X),U(X))(L(X), U(X))中的概率为α\alpha. 在这里尤其注意的是真实参数θ\theta为一定值, 因此不存在”区间(L(X),U(X))(L(X), U(X))包含参数θ\theta的概率为α\alpha”这一说法, 因为当区间确定后只有两种可能性: 区间包含θ\theta与区间不包含θ\theta. 对置信区间合理的解释是: 在重复实验的前提下,计算每一次实验由结果得到的区间(L(X),U(X))(L(X), U(X)), 那么这些区间中大约有α%\alpha\%比例的区间包含参数θ\theta.

在中心极限定理中, 我们已经知道

n(Xnμ)σN(0,1),\sqrt{n}\cdot\frac{(\overline{X}_n - \mu)}{\sigma} \to N(0,1),

那么根据定义, 对于期望μ\mu而言, 此时一个1α1-\alpha置信水平的置信区间满足

P(L(X)μU(X))=1α.\P(L(X) \leq \mu \leq U(X)) = 1-\alpha.

在正态分布中, 我们定义zα/2z_{\alpha/2}N(0,1)N(0,1)中的上侧α/2\alpha/2分位点 (α/2\alpha/2 Quantile), 即P(Xzα/2)=α/2\P(X \geq z_{\alpha/2}) = \alpha/2. 此时我们对中心极限定理进行改写, 关于μ\muα%\alpha\%置信区间即可写作

(Xnzα/2σn,Xn+zα/2σn).\left( \overline{X}_n - z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \quad,\quad \overline{X}_n + z_{\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \right).

在实践中, 我们往往无法得知σ\sigma, 因此我们也经常将其替换成σ\sigma的无偏估计量SnS_n:

Sn:=1n1i=1n(XiXn)2,S_n := \sqrt{\frac{1}{n-1}\sum_{i=1}^n (X_i - \overline{X}_n)^2},

此时的置信区间为

(Xnt(n1,α/2)Snn,Xn+t(n1,α/2)Snn),\left( \overline{X}_n - t(n-1,\alpha/2) \cdot \frac{S_n}{\sqrt{n}} \quad,\quad \overline{X}_n + t(n-1,\alpha/2)\cdot \frac{S_n}{\sqrt{n}} \right),

此时t(n1,α/2)t(n-1,\alpha/2)为带有n1n-1个自由度的tt分布的上侧α/2\alpha/2分位点. 感兴趣的读者欢迎阅读更多相关材料.

*{假设检验}

在统计推断中, 我们经常希望根据样本数据判断某个关于总体的假设是否合理. 这样的过程称为假设检验(Hypothesis Testing). 通常我们会提出两个互相对立的假设:

H0:<b>原假设(NullHypothesis)</b>,H1:<b>备择假设(AlternativeHypothesis)</b>.H_0:<b>原假设 (Null Hypothesis)</b>, \qquad H_1:<b>备择假设 (Alternative Hypothesis)</b>.

其中,H0H_0 通常代表我们在没有充分证据时默认接受的假设,而 H1H_1 代表我们希望通过数据支持的另一种可能性. 假设检验的目标不是直接估计未知参数, 而是根据样本判断是否有足够证据拒绝 H0H_0.

设样本空间为 H\mathcal H, 一个检验可以看作是将样本空间划分为两个部分:

R=RRc,\mathcal R = \mathcal R \cup \mathcal R^c,

其中 R\mathcal R 称为拒绝域 (Rejection Region). 当观测值 xRx\in\mathcal R 时,我们拒绝原假设 H0H_0; 而 当 xRcx\in\mathcal R^c 时,我们不拒绝 H0H_0. 等价地,我们可以定义检验函数

φ(x)={1,xR0,xRc,\phi(x)= \begin{cases} 1, & x\in \mathcal R\\ 0, & x\in \mathcal R^c \end{cases},

其中 φ(x)=1\phi(x)=1 表示拒绝 H0H_0,而 φ(x)=0\phi(x)=0 表示不拒绝 H0H_0. 在假设检验中可能出现两类错误: 若 H0H_0 实际为真, 但我们错误地拒绝了 H0H_0, 我们则称为第一类错误 (Type I Error); 若 H0H_0 实际为假,但我们没有拒绝 H0H_0, 则称为第二类错误(Type II Error). 第一类错误的概率通常记为

α=PH0(拒绝 H0),\alpha=\P_{H_0}(\text{拒绝 }H_0),

即为当H0H_0为真时拒绝H0H_0的概率, 我们也将其称为检验的显著性水平(Significance Level. 第二类错误的概率通常记为

β=PH1(不拒绝 H0),\beta=P_{H_1}(\text{不拒绝 }H_0),

即当H1H_1为真时不拒绝H0H_0的概率. 相应地, 1β1-\beta也被称为检验的功效(Power), 它表示当备择假设 H1H_1 为真时, 检验能够正确拒绝 H0H_0 的概率.

一种常用的构造检验的方法是似然比检验(Likelihood Ratio Test): 设样本 X1,,XnX_1,\cdots,X_n 整体的似然函数为 Ln(θ)L_n(\theta), 原假设和备择假设对应的参数空间分别为 Θ0\Theta_0Θ\Theta. 定义似然比统计量

λn(X)=supθΘ0Ln(θ)supθΘLn(θ).\lambda_n(X) = \frac{\sup_{\theta\in\Theta_0} L_n(\theta)} {\sup_{\theta\in\Theta} L_n(\theta)}.

由于 Θ0Θ\Theta_0\subseteq \Theta,因此有 0λn(X)10\leq \lambda_n(X)\leq 1. 当 λn(X)\lambda_n(X) 很小时,说明在原假设 H0H_0 限制下,能够达到的最大似然值远小于总体参数空间中的最大似然值,因此数据对 H0H_0 不利. 于是似然比检验的拒绝域通常写作

R={xX:λn(x)<c},\mathcal R = \{x\in\mathcal X:\lambda_n(x)<c\},

其中常数 cc 由给定的显著性水平 α\alpha 决定. 在适当的正则条件下, 当样本量nn\to\infty时, 似然比统计量还具有如下近似分布:

2logλn(X)dχd2,-2\log \lambda_n(X) \overset{d}{\to} \chi_d^2,

其中d=dim(Θ)dim(Θ0).d=\dim(\Theta)-\dim(\Theta_0). 因此,在显著性水平为 α\alpha 的检验中,常用的拒绝域可以写为

R={xX:2logλn(x)χd,α2},\mathcal R = \left\{ x\in\mathcal X: -2\log \lambda_n(x) \geq \chi_{d,\alpha}^2 \right\},

其中 χd,α2\chi_{d,\alpha}^2 表示自由度为 ddχ2\chi^2分布的上 α\alpha 分位点.

{7.1 练习}

1.(Ω,F,P)(\Omega,\mathcal{F},\P)为概率空间.

(i) 证明概率测度满足单调性. 即当ABA \subset B (A,BFA,B \in\mathcal{F})时, P(A)P(B)\P(A) \leq \P(B);

(ii) 设A1,A2,,AnFA_1,A_2,\cdots,A_n \in \mathcal{F}, 证明:

P(i=1nAi)i=1nP(Ai).\P\left( \bigcup_{i=1}^n A_i \right) \leq \sum_{i=1}^n \P(A_i).

2. 已知人群中某种疾病的患病率约为1/100001/10000. 现有一种检测方法可以判断一个人是否患有该疾病, 对于该检测方法, 我们已知: (i) 在一个人未患病的条件下,检测结果呈阳性的概率仅为0.020.02; (ii) 在一个人患病的条件下, 检测结果呈阴性的概率仅为0.010.01. 现在随机选取一个人进行该疾病检测, 且检测结果为阳性. 那么此人真正患有该疾病的概率是多少?

3. 已知XX服从标准正态分布, 即其概率密度函数满足

f(x)=12πex22.f(x) = \frac{1}{\sqrt{2\pi}} e^{-\frac{x^2}{2}}.

证明随机变量Y=X2Y=X^2服从自由度为11χ2\chi^2分布, 即其概率密度函数为

g(y)=12πey21y.g(y) = \frac{1}{\sqrt{2\pi}} e^{-\frac{y}{2}}\cdot \frac{1}{\sqrt{y}}.

4. (Chernoff 界)XX为一随机变量. 证明对于任意的aR,s>0a\in\mathbb{R}, s>0, 有P(Xa)MX(s)eas\P(X \geq a) \leq M_X(s) e^{-as}.

5. 甲乙二人准备于99点至1010点之间在某地见面. 已知二人会在之间的任意时刻等可能到达, 且二人到达的时间相互独立. 那么先到的一方等另外一方超过1010分钟的概率是多少?

6.X1,,Xni.i.df(x;θ)X_1,\cdots,X_n \overset{i.i.d}{\sim} f(x;\theta)为独立同分布的样本.

(i) 样本服从泊松分布(Poisson Distribution): f(x;θ)=eθθxx!f(x;\theta) = \frac{e^{-\theta} \theta^x}{x!}, x=0,1,2,x=0,1,2,\cdots, 求参数θ\theta的最大似然估计量;

(ii) 样本服从指数分布(Exponential Distribution): f(x;θ)=θeθx,x>0f(x;\theta) = \theta e^{-\theta x}, x >0, 求参数θ\theta的最大似然估计量;

(iii) 样本服从几何分布(Geometric Distribution): f(x;θ)=θx(1θ)x1,x=1,2,f(x;\theta) = \theta^x (1-\theta)^{x-1}, x=1,2,\cdots, 求参数θ\theta的最大似然估计量.

(iv) 在(i) - (iii)中, 求出此时所有关于参数θ\theta的无偏估计量的Crémer-Rao下界, 并判断此时最大似然估计量的方差是否取到该下界.

7. (Bayes估计法) 假设X1,,Xni.i.df(x;θ)X_1,\cdots,X_n \overset{i.i.d}{\sim} f(x;\theta), 我们将参考条件概率公式, 给出一个参数θ\theta先验分布 (Prior Distribution)π(θ)\pi(\theta). 先验分布往往是我们对于参数本身的一种分布假设. 那么参数θ\theta后验分布 (Posterior Distribution)p(θx)p(\theta|x)便满足

p(θx)=f(x;θ)π(θ)f(x;θ)π(θ)dθ.p(\theta|x) = \frac{f(x;\theta)\pi(\theta)}{\int f(x;\theta)\pi(\theta)d\theta}.

其中f(x;θ)f(x;\theta)为样本的似然函数.

(i) 已知样本服从Bernoulli分布 (Bernoulli Distribution), 即X1,,Xni.i.dθx(1θ)1x,x=0,1X_1,\cdots,X_n \overset{i.i.d}{\sim} \theta^{x}(1-\theta)^{1-x}, x=0,1. 已知θ\theta的先验分布服从Beta分布(Beta Distribution), 即

π(θ)=Γ(α+β)Γ(α)Γ(β)θα1(1θ)β1,α,β>0,\pi(\theta)= \frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}\theta^{\alpha-1}(1-\theta)^{\beta-1}, \alpha,\beta>0,

其中α,β\alpha,\beta为确定常数. 求出此时θ\theta的后验分布p(θx)p(\theta|x).

(ii) 在(i)的条件下, 求出Eθ[p(θx)]\E_\theta[p(\theta|x)].

8. (最大似然估计量的渐近正态性) 假设X1,,Xni.i.df(x;θ)X_1,\cdots,X_n \overset{i.i.d}{\sim} f(x;\theta), 设θ^\hat{\theta}θ\theta的最大似然估计量. 在适当的正则条件下, 当样本量nn \to \infty时, θ^\hat{\theta}的分布会渐近于正态分布, 即

n(θ^θ)I^1(θ)N(0,1).\frac{\sqrt{n}\cdot\Big( \hat{\theta} - \theta\Big)}{\sqrt{\hat{\mathcal{I}}_1(\theta)}} \sim N(0,1).

现已知样本服从Poisson分布: X1,,Xni.i.deθθxx!,x=0,1,2,X_1,\cdots,X_n \overset{i.i.d}{\sim} \frac{e^{-\theta} \theta^x}{x!}, x=0,1,2,\cdots. 利用最大似然估计量的渐近正态性, 求出一个关于参数θ\theta1α1-\alpha置信水平的置信区间.