1、第三章 多元线性回归 简单线性回归模型是用一个解释变量来解释应变量的。但在现实经济关系中,人们所要研究的变量往往受到一个以上的变量的影响,或者说可由多个变量来解释。例如,个人消费不仅与个人当期收入有关,还可能与财富及预期收入有关;个人收入不仅与受教育年限有关,还与年龄的大小有关;等等。所以用多个解释变量来说明应变量会使模型更为有用。 第一节 多元线性回归模型的基本假设 设Y为应变量,为k个不同用来说明Y的被称为解释变量的变量,其中恒等于1,则称式子(3.1)所表示的模型为多元线性回归模型。 (3.1) 其中,为随机扰动项;固定参数,,…, 称为(总体)回归系数或
2、偏回归系数。若令 , , , 则(3.1)式可用如下矩阵形式表为 (3.1’) 在本章,我们研究满足如下经典假设的多元线性回归模型。 假设1 随机扰动项的数学期望(均值)为零。即 (3.2) 假设1意味着 (3.3) 称(3.3)式为线性回归模型(3.1’)的总体回归函数总体回归方程。 假设2 随机扰动项的方差相等,并且跨期扰动项不相关。即 用I表示单位矩阵,则假设2即为
3、 (3.4) 这里的假设2就是第二章的假设2与假设3的综合,即同方差性与序列无关性的综合。 假设3 随机扰动项和解释变量X不相关,即中不含解释变量X的任何信息。用数学式子可表示为 (3.5) 在X是非随机变量矩阵的情况下,(3.5) 式是自动成立的,但为了一般起见,即使X为随机变量矩阵,只要(3.5) 式成立,那么对X为非随机变量矩阵情况下的结论,可以直接推广到X为随机变量矩阵的情形。假设3是一个非常重要的假设,它说明,随机向量Y中能够用X解释的部分完全从随机扰动项中分离了出来,因而,在随机扰动项中不再包括与解释变量相关的因素了。 假设4 X
4、是秩为k的矩阵。它要求X的各列线性无关,或者说解释变量之间不存在多重共线性。所谓多重共线性是指解释变量之间存在完全或近乎完全的线性相关。 假设5 随机扰动项为服从正态分布的随机向量,即 (3.6) 在样本容量足够大时,由数理统计学中的中心极限定理,假设5是近似成立的,此外,如果我们只是为为估计回归系数的值,假设5就是一个不必要的假设。 假设6 解释变量X有足够多的变异。 第二节 多元线性回归模型的参数估计 一 最小二乘估计 设与总体回归模型(3.1)对应的样本回归模型为 (3.7) 或用矩阵表示为
5、 (3.7’) 其中表示总体回归系数向量的最小二乘估计,表示残差向量。其基本意义与第二章相同。 在线性样本回归模型(3.7)或(3.7)’中,使残差平方和最小的回归系数的估计称为最小二乘估计(LSE或OLS)。即使 (3.8) 最小的。其中是的转置。下面推导最小二乘估计的表达式或计算公式。 为求使(3.8)式最小的,可将看成是的函数,则其关于的一阶偏导数必须为零,即 据此得到正规方程 (3.9) 若是非奇异的(假设6可保证),则
6、 (3.10) 可证上式即为使残差平方和最小的估计量。为证是使残差平方和最小的最小值点只需证其二阶偏导数矩阵是正定的即可。事实上, (3.11) 对任意一非零向量c,令,则。除非v的每一元素都为零,否则是正的。但若v=0的话,则必是奇异的(因为c是非零向量),这与的非奇异假定相矛盾,所以一定是正定的。 可将(3.9)式写成 (3.9’) 上式在形式上与第二章的(2.15’)是一致的。 例3.1 表3.1是在表2.2的基础上加上一列广告支出的数据表。设苹果
7、销量不仅与的价格(元/千克)有关,而且与相应的广告支出有关。用表示价格,表示广告支出(元),Y表示需求量(千克),设在任意价格水平上超市有满足任意需求的能力。那么,这12天的数据就是需求函数的表现。若假设需求量平均来看是价格和广告支出的线性函数。试估计该需求函数。 表3.1 销售量(千克) 价格(元/千克) 广告支出(元/千克) 55 10 0.55 70 9 0.63 90 8 0.72 100 7 0.7 90 7 0.63 105 7 0.735 80 7 0.56 110 6.5 0.715 125 6 0.75 115
8、 6 0.69 130 5.5 0.715 130 5 0.65 解 设需求量关于价格和广告支出的线性回归模型为 令恒等于1,则由表3.1中的资料计算得 = 所以 故样本回归模型为 上式初步说明在价格水平不变的条件下广告有较大的边际效应。 二 最小二乘估计的统计特性 1 线性性。所谓线性性是指总体回归系数的估计量是应变量的线性函数。从最小二乘估计量的表达式知线性性是显然的。 2 无偏性。即 (3.12) 因 即 (3.13) 所以,即无
9、偏性成立。 3 有效性。在所有线性无偏估计量中,最小二乘估计量具有最小方差。 为证明最小二乘估计量的有效性,先求的协方差矩阵 (3.14) 再设的另一线性无偏估计量为,其中,A是一个矩阵。则由 得 (3.15) 和 令,则,,代入上式,得 在上式中,由于是一个非负定矩阵(的二次型是),即 是一个非负定矩阵,这说明,的主对角线上的表示各回归系数的线性估计量的元素,大于的主对角线上的相应元素。可见,在所有线性无偏估计量中,最小二乘估计量具有最小方差。
10、 综合以上性质得高斯—马尔可夫定理:对满足经典假设1-4的多元线性回归模型,其回归系数的最小方差线性无偏估计量是最小二乘估计量。 三 随机扰动项方差的估计 由于回归系数的最小二乘估计的方差与随机扰动项的方差有很大的关系,所以根据样本资料估计随机扰动项的方差也就很有必要了。为此,先考虑残差向量 (3.16) 其中称为最小二乘基本等幂矩阵,它是一个矩阵,它具有 对称性(),等幂性(),而且与解释变量不相关()。这些性质通过简单矩阵运算即可得到。 再考虑残差平方和的数学期望 tr(A)表示矩阵A的主对角线上的元素的和,称为矩阵的迹,通过
11、验算即知:矩阵的和的迹等于迹的和;矩阵的转置的迹等于原矩阵的迹;矩阵的数乘的迹等于矩阵的迹乘以该数;矩阵的乘积的迹与矩阵的位置无关,即tr(AB)=tr(BA)。在这里要注意到:矩阵的迹等于它本身。 (3.17) 故 (3.18) 这说明随机扰动项的方差的一个无偏估计量为 (3.19) 四 最大似然估计与Cramer-Rao定理 下面用最大似然法估计模型 (3.1’)
12、 中的参数。 设随机扰动项为服从正态分布的随机向量,即。则,随机向量的密度函数为 (3.20) 其对数似然函数为 (3.21) 在给定样本条件下,求参数的估计值,使对数似然函数达到最大。设回归系数的最大似然估计为,随机扰动项的方差的最大似然估计为,则 可见回归系数的最大似然估计与最小二乘估计是一样的,而随机扰动项的方差的最小似然估计则有所不同,而且是有偏的。但当样本容样很大时,最大似然估计与无偏估计基本一致,即是渐进无偏的。 为了进一步研究回归系数的统计特性,我们应用第二章第二节的Cramer-Rao定理及其推论: Cra
13、mer-Rao定理:设是基于样本 的关于参数向量的无偏估计量,则的协方差矩阵与信息矩阵的逆矩阵(简称逆信息矩阵)之差将是一个半正定矩阵。 推论:设是参数向量的无偏估计量,而的主对角线上的元素为,则。 下面求对数似然函数(3.21)信息矩阵 故 (3.22) 它的逆为: (3.23) 由于回归系数的最小二乘估计的协方差矩阵为,它与信息矩阵的逆矩阵在相应位置的主对角线上的元素相同,所以最小二乘估计量不仅是最优线性无偏估计,而且还是最优无偏估计。 五 估计量的分布特性 显然样本回归系数向量服从数学期望为向量,
14、协方差矩阵为的多元正态分布。即 (3.24) 而服从自由度为的分布,而且与相互独立。这个结论正是曾在第二章第三节所给出的定理,当时并没有给出证明,现在证明之。 首先证明服从自由度为的分布,即证明 (3.25) 由于对称等幂矩阵的秩等于它的迹 参见[美]威谦H.格林著,王明舰等译《经济计量分析》第32-44页,中国社会科学出版社,1998年3月。 ,而最小二乘等幂矩阵M是对称的等幂矩阵,根据(3.17)式便知最小二乘等幂矩阵的迹为,所以它的秩为。 又由于对称的等幂矩阵的特征根不是1就是0,故
15、存在正交矩阵C,使得 同上。 ,其中是一个主对角线上前个数为1,其它位置上的元素都为0的对角矩阵。 将代入中,得 (3.26) 令,则 (3.27) 其中是将作正交变换后的结果。 根据,,以及 得也服从数学期望为零,协方差矩阵为的正态分布,从而其分量服从数学期望为零,方差为的正态分布,而且由于不同分量的协方差为零,所以不同分量是相互独立的。 故为个相互独立的标准正态分布的平方和,根据分布的定义,服从自由度为的分布。 其次,关于与相互独立的问题,可由下式验证。 (3.27) 可见,残
16、差与回归系数的最小二乘估计是相互独立的,从而作为残差的函数的与回归系数的最小二乘估计也是相互独立的。 上述结论为多元回归系数的置信区间与显著性检验的研究打下了理论基础。 第三节 多元回归模型的统计检验 多元回归模型的统计检验是要对已得模型是否可用于经济分析、政策评价、结构分析、预测等问题在统计性质方面作出分析与评价,以决定已得模型的应用价值。就其内容来看,它包括总体参数的置信区间的探求,显著性检验和一般线性假设检验,拟合优度与方差分析,相关分析等。 一 置信区间 1 总体回归系数的置信区间 对于多元线性回归模型,设其中为矩阵中第i行,第j列的元素。
17、由于,所以回归系数的最小二乘估计的方差为 (3.28) 因此随机变量的标准化随机变量服从标准正态分布。同简单线性回归分析一样,我们引入样本回归系数的标准误。则因为随机变量 的分子服从标准正态分布,分母为一个自由度为的分布除以其自由度后的算术平方根。根据t分布的定义,服从自由度为的t分布。故,的置信度为的置信区间为 (3.29) 其中为置信度为时t分布的双侧临界值。 2 总体方差的置信区间 多元线性回归模型中方差的置信区间与简单线性回归模型中的情形类似。由于在的正态性假设下,变量
18、 (3.30) 服从自由度为的分布。故可利用分布来建立的置信区间: (3.31) 其中居于双重不等式中间的值由(3.40)给出,而和是得自数值表中自由度为的两个值(临界值),使得它们各切去分布的100尾部面积。 将(3.40) 代入(3.41),并加整理得, (3.32) 这就给出了的置信区间。 二 假设检验 1 回归系数的显著性检验(t检验)。所谓回归方程的显著性检验是指对总体线性回归模型 (3.1) 而言,假设是否在统计上被拒绝,如果不被拒绝,则称回归系数对被解释变量的影响是
19、不显著的,或称解释变量对应变量的影响是不显著的;如果假设在统计上被拒绝,则称回归系数对被解释变量的影响是显著的,或称解释变量对应变量的影响是显著的。 如前所述,服从自由度为的t分布,所以在假设的前提下,服从自由度为的t分布。故可构造t检验程序如下: (1)设置原假设与对立假设:原假设和对立假设; (2)作统计量 (3.33) (3)根据样本数据和原假设计算统计量t的值; (4)根据统计量t的值进行显著性判断: 如果统计量t的值落入了以为中心的其概率度为(称为显著性水平,一般为值较小的正数,通常小于0.1)的区间内,即t的绝对值小于
20、某个临界值,则我们认为没有理由拒绝假设,从而不显著异于零,表明根据观测样本来看,解释变量对应变量的影响是不显著的;如果统计量t的值落在以为中心且概率度为的区间之外,即t的绝对值大于某个临界值则说明小概率事件发生了,这说明我们的假设可能有误,所以要拒绝假设,这就是说显著异于零,表明根据观测样本来看,解释变量对应变量的影响是显著的。 2 回归方程的显著性检验(F检验)。所谓回归方程的显著性检验是指对总体线性回归模型 (3.1) 而言,假设是否在统计上被拒绝,如果不被拒绝,则称回归方程对被解释变量的影响是不显著的;如果被拒绝,则称回归方程对解释变量的影响是显著的。表现在
21、样本上就是由回归所产生的变异在解释应变量的变异方面是否明显。 由于在零假设前提下,可证统计量 (3.34) 服从第一个自由度为,第二个自由度为的F分布 。故可设计显著性检验程序。 (1) 设置原假设与对立假设:原假设: (即回归方程不显著)和对立假设:不全为零 (即回归方程显著); (2) 作统计量 (3) 根据样本数据和原假设计算统计量F的值; (4) 根据统计量F的值进行显著性判断: 如果统计量F的值小于某个临界值(是使得的F分布的值)。不拒绝回归方程不显著的假设。 如果统计量F的值大于某个临界值,则拒绝回归方程不显
22、著的假设,即回归方程显著。在这里表示显著性水平。 值得注意的是,能否逐一地用t检验对偏回归系数进行显著性检验来代替对回归方程所作的总显著性检验呢?回答是否定的。事实上,在我们检验偏回归系数的显著性时,我们并没有考虑不同解释变量之间的在应用同一个样本时的联系,或者说,我们没有考虑样本回归系数之间的相关性。而在对回归方程进行总显著性检验和联合显著性检验时,则我们不能不考虑样本回归系数之间的相关性,所以在多元回归分析中,t检验和F检验是不能相互替代的。 *3 线性约束检验(F检验)。对偏回归系数的显著性检验可以看成是在原线性回归模型中令某偏回系数为零以后得到的被称作是受约束(受到某
23、个偏回归系数为零的约束)的线性回归模型是否就可以说明经济变量之间的关系的问题;同样对回归方程的显著性检验也可以看成是在原线性回归模型中令所有解释变量(常数项除外)前的回归系数都为零后的同样被称作是受约束(受到所有解释变量前的回归系数都为零的约束)的线性回归模型是否就可以说明经济变量之间的关系的问题。如果把这种思维加以展开,我们则容易想到一般的线性约束的检验问题。 对多元线性回归模型 或 (3.1’) 我们要检验线性约束 (3.35) 是否不能在统计上拒绝。这就是指,我们要根据样本来对线性约束(
24、3.35)进行统计检验。在(3.35)式中,C是一个矩阵,它的秩为r,d是一个矩阵即是一个r维列向量。所以线性约束(3.35),代表了r个独立的线性约束。 由于我们是根据样本进行推断,所以我们要用回归系数的最小二乘估计来检验(3.35)式是否显著不成立,或者与的差异是否足够大,以至于我们要拒绝线性约束。为此,我们考虑的统计特性。由于服从正态分布,所以也服从正态分布,在原假设的前提下,有 (3.36) 故 (3.37) 服从自由度为r的分布参见[美]威谦H.格林著,王明舰等译《经济计量分析》第86-87页,中国社会科学出版社,1998年3月。 。
25、又根据(3.25)式可得知:末受约束的回归模型的残差平方和与扰动项的方差的比值服从自由度为的分布。 故 (3.38) 服从第一个自由度为r,第二个自由度为的F检验。 因而,可构造F检验程序如下: (1) 设置原假设与对立假设:原假设:和对立假设: (2) 作统计量 (3) 根据样本数据和原假设计算统计量F的值; (4) 根据统计量F的值进行显著性判断: 如果统计量F的值小于某个临界值(是使得的F分布的值)。不拒绝线性约束假设。 如果统计量F的值大于某个临界值拒绝线性约束假设。在这里表示显著性水平。 显然回归方程的显著性检验是线性约束检验的特例,只
26、要在约束方程中令 则线性约束,即为回归方程的总显著性检验的原假设。 4 精确显著性水平:p值。显著性检验的一个令人迷惑的地方是显著性水平的选择是主观的,无论是回归系数的显著性检验还是回归方程的总显著性检验,直至线性约束的检验,都涉及到这个问题。当选定一个显著性水平(比如1%)时回归系数可能是不显著的,但改变显著性水平的值(比如5%)后,回归系数则显著起来。在这样的情况下,相应的解释变量对应变量的影响是否显著的问题,就是一个很难回答得令人满意的问题。既然如此,我们还不如在已得样本下,计算出相应的检验统计量如t统计量,或F统计量的值,客观地给出其绝对值超过已计算出的这个统计量的确切的概率
27、值。这个概率值叫做p值,也叫观测或精确显著性水平,或犯第І类错误的精确概率。用更专业化的语言说,p值是一个虚拟假设可被拒绝的最低显著性水平。 这样,与其人为地确定一个显著性水平,还不如客观地将精确显著性水平告诉读者,让读者自己来决定原假设是否该拒绝。 第四节 拟合优度与方差分析 一 方差分解 与简单线性回归模型类似,在多元线性回归模型中,也可进行方差分解。对于作为应变量的随机变量,其样本观测值为(相应的解释变量取值为)。尽管我们根据最小二乘法求出样本回归方程以反映解释变量对应变量的解释。但是,这并没有反映的变化在多大程度上可以用样本回归函数的变化来解释。只有对此有了
28、一定的了解,我们才能回答样本回归线在多大程度上与样本似合的问题。 可以通过方差分析来研究的变差(相对于样本均值)中可以用样本回归函数()来说明的部分和不能由样本回归函数来说明的部分。 注意到: 两边平方: 求和: 故: (3.39) 上式中左边表示应变量的样本值相对于其平均数的离差的平方和,它说明了应变量的样本值的变异程度,称之为总变差或总平方和,用SST表示。式子中右边的第一项是应变量的预测值(或者说更准确地说在样本回归线上与应变量相应的值)相对于其平均数(应变量的样本平均数与其预测值的平均数相等)的离差的平方和,它说明了预测值的变异程度,由
29、于这此值都在样本回归线上故称之为回归平方和,用SSR表示。式子右边的第二项是残差的平方和,用SSE表示。所以(2.76)表示总变差可以分解为由回归方程解释的变差和不能由回归方程解释的变差,即总平方和等于回归平方和加上残差平方和。(2.76)式可以写成: SST=SSR+SSE (3.39’) 二 拟合优度 在应变量的样本总平方和中,一部分为回归平方和,另一部分为残差平方和。这就意味着从已得的样本观测值来看,应变量的变差一部分可以用解释变量来解释,而另一部分则不能用解释变量来解释。显然能够用解释变量来解释的部分占应变量的总变差的比例就是表示样本回
30、归线对应变量的样本值拟合程度的一个量度,我们称这个量度为判定系数或决定系数,用表示。即 (3.40) 显然,判定系数的值在0和1之间。当时,残差平方和为零,从而必有残差为零。这时,应变量的变差可完全由解释变量解释,此时,从已得样本来看,样本点全部落在样本回归线上。当时,应变量的变差完全不能由解释变量解释。一般情况下,。而越接近1,回归模型的拟合状态就越好。 显然,在多元线性回归模型中增加一个解释变量,则残差平方和一般会减小(至少不会增大),从而判定系数则会相应的增大。由此可得知即使加入一个与应变量没有什么关系的变量作为解释变量,也会使判定系数增
31、大。所以在比较有同一应变量但有不同个数的解释变量的两个回归时,选择有较大判定系数的回归模型就有可能误导。因此,有时我们有必要消除因解释变量个数的不同对判定系数的影响。可采用如下被称为校正判定系数来说明不同个数的解释变量的拟合优度。 (3.41) 但是,校正判定系数也有一些可能更严重的问题如可能为负等。 此外,在回归方程的总显著性检验中的F统计量与决定系数之间有如下关系: (3.42) 三 再论线性约束检验 上一节已讨论过线性约束检验的问题,但在操作性方面上一节的讨论是不太方便的。为了使线性约束检验更便于操作和更自然,将约
32、束条件代入到原回归模型中,得两个回归模型: 不受约束的回归模型 (3.43) 其中,分别代表在没有约束条件下的回归系数和扰动项。 受约束的回归模型 (3.44) 其中,分别代表约束条件下的回归系数和扰动项。 用最小二乘法求得不受约束的(3.43)和受约束的(3.44)样本回归模型分别为 (3.45) 和 (3.46) 其中,分别代表在没有约束条件下的回归系数的最小二乘估计和残差;分别代表约束条件下回归系
33、数的最小二乘估计和残差。 则显而易见受约束的残差平方和大于不受约束的残差平方和,并且 (3.47) 服从第一个自由度为m,第二个自由度为n-k的F分布。其中,m是线性约束条件的个数,k为未受约束模型中解释变量的个数(包括常数项),n为样本容量。 (3.47)式还可表示为 (3.48) 根据以上讨论,可设计线性约束检验如下: 1. 利用样本数据对不受约束的多元线性回归(3.43)做回归求出残差平方和(或决定系数)。 2. 将m个线性约束条件代入原不受约束的多元线性回归模型中,得出约束条件下的多元线性回归模型(3
34、44)。 3. 利用样本数据对受约束的多元线性回归(3.44)做回归求出残差平方和(或决定系数)。 4. 构造F统计量(或),并计算其值。 5. 查自由度为的F分布表得显著性水平为的F分布的临界值。 6. 根据统计量F的值进行显著性判断: 如果统计量F的值小于,则不拒绝线性约束。 如果统计量F的值大于,则拒绝线性约束。 四 方差分析表 把方差分解、判定系数和F统计量列在一个如下表所示的表格中就形成了一个方差分析表。 表3.2 方差分析表 变差来源 变差 自由度 均方 回归 SSR k-1 残差 SSE= n-k 总 S
35、ST=SSR+SSE n-1 例3.2 设GDP增长率线性地决定于人均消费增长率,投资增长率,政府支出增长率,货币供给增长率,和出口增长率。试根据表3.3的数据进行回归分析和方差分析。 表3.3 宏观经济数据表 年份 GDP (亿元) 人均消费(元) 非国家投资(亿元) 政府支出增长率 货币供给量(亿元) 出口总额 (亿美元) 1990 18547.9 803 1530.7 9.2 6950.7 2985.8 1991 21617.8 896 1880.7 9.8 8633.3 3827.1 1992 26
36、638.1 1070 2581.4 10.5 11731.5 4676.3 1993 34634.4 1331 5146.4 24.1 16280.4 5284.8 1994 46759.4 1746 7427.1 24.8 20540.7 10421.8 1995 58478.1 2236 9121.1 17.8 23987.1 12451.8 1996 67884.6 2641 10907.3 16.3 28514.8 12576.4 1997 74462.6 2834 11849.4 16.3 34826.3
37、 15160.7 1998 78345.2 2972 13036.9 16.9 38953.7 15231.6 1999 82067.5 3138 13906.95 22.1 45837.2 16159.8 2000 89442.2 3397 16413.29 20.5 53147.2 20635.2 2001 95933.3 3611 1530.7 19 59871.6 22029.1 资料来源:《中国统计年鉴2002》。 解 根据题意建立多元线性回归模型如下: 为了估计上述模型,根据表3.3的资料计算得表3.4如下:
38、 表3.4 提炼的宏观经济数据表 年份 1991 0.165512 0.115816 0.228654 9.8 0.242076 0.281767031 1992 0.23223 0.194196 0.372574 10.5 0.358866 0.221891249 1993 0.300183 0.243925 0.993647 24.1 0.387751 0.130124244 1994 0.350085 0.311796 0.443164 24.8 0.261683 0.972033 1995 0.25
39、0617 0.280641 0.228084 17.8 0.167784 0.19478401 1996 0.160855 0.181127 0.195832 16.3 0.188756 0.010006585 1997 0.0969 0.073078 0.086373 16.3 0.221341 0.205488057 1998 0.052142 0.048694 0.100216 16.9 0.118514 0.004676565 1999 0.047512 0.055855 0.066737 22.1 0.17671 0.
40、0609391 2000 0.089861 0.082537 0.180222 20.5 0.159477 0.276946497 2001 0.072573 0.062997 -0.90674 19 0.126524 0.067549624 (一) 根据表3.4中的资料用最小二乘法得样本回归模型为 上式中括号内的数字为相应回归系数的t值。 1.从样本回归模型中可看出: 第一, 决定系数表明拟合优度很好。 第二,的系数所对应的t值为-0.277,表明投资的增长率对国内生产总值的增长率的影响并不显著;的系数所对应的t值为-0.128,表明政府支出的增长率
41、对国内生产总值的增长率的影响并不显著。 第三,的系数所对应的t值为9.77,的系数所对应的t值为3.38,和的系数所对应的t值为2.23,表明人均消费的增长率对国内生产总值的增长率的影响是相当显著的,货币供给的增长率对国内生产总值的影响也是显著的,出口增长率也有一定的显著性。 第四,,表明回归方程是显著的。 2.对样本观测值进行方差分析如下: 方差分析表 变差来源 变差 自由度 均方 回归 0.108318 5 0.021664 残差 0.001446 5 0.000289 总 0.109764 10 0.010976 (二) 现对
42、原回归模型附加三个线性约束:。 受约束的回归模型为 根据表3.4中的资料用最小二乘法得受约束条件下的样本回归模型为 上式中括号内的数字为相应回归系数的t值。 1.进行线性约束检验。 显然不能拒绝线性约束假设。 故可采用受约束模型。 2.在受约束的样本回归模型中进行显著性检验。 由于的系数所对应的t值为8.61,所以其显著性水平极高,其精确性显著水平为;而的系数所对应的t值为3.07,所以货币供给的增长率也是显著性,其精确性显著水平为0.0154,的系数所对应的t值为1.93,在10%的显著性水平下也能通过显著性检验,其精确性显著水平为0.09。 3.受约束
43、回归模型条件下的方差分析表为 受约束条件下的方差分析表 变差来源 变差 自由度 均方 回归 0.10657 3 0.035523 残差 0.003194 8 0.000399 总 0.109764 11 0.009979 根据以上分析得出结论:国内生产总值增长的关键性因素当首推消费的增长,其次是货币供给量的增长,再次是出口的增长。 第五节 偏相关系数与回归系数释义 为了简单起见,考虑如下二元回归模型 (3.49) 上式中的应变量和解释变量均以其离差形式给出。设其最小二乘估计
44、的样本回归模型为 (3.50) 一 偏相关系数 在多元回归模型中,偏相关系数是指在某一个或某些解释变量不变条件下应变量与一个解释变量的相关系数。 用分别表示Y与,Y与,与的简单相关系数,即在没有考虑其它变量是否变化下的两个变量之间的相关系数。有时称它们为零阶相关系数。 用表示在保持不变条件下Y与的相关系数;用表示在保持不变条件下Y与的相关系数。称它们为一阶偏相关系数。这里的阶是指在研究两个变量的相关性时,排除它们所共同含有的因素(模型中的解释变量)的个数。 在研究保持不变条件下Y与的相关关系时,如何排除Y与所共同含有的因素呢?由于这里研究的问题
45、是样本问题,所以不妨用最小二乘法做Y对的回归得其残差,则从样本来看,这个残差就是把Y中含有的因素排除了,记为;同样用最小二乘法做对的回归得其残差,则从样本来看,这个残差就是把中含有的因素排除了,记为。于是在保持不变条件下Y与的相关系数,即一阶相关系数,就是与的简单(或零阶)相关系数。 设在最小二乘法下,Y对的简单线性回归为 (3.51) 对的简单线性回归为 (3.52) 则在保持不变条件下Y与的相关系数,即一阶相关系数为 (3.53) 类似地,若Y对的简单线性回归为
46、 (3.54) 对的简单线性回归为 (3.55) 则在保持不变条件下Y与的相关系数,即一阶相关系数为 (3.56) 可以证明 (3.57) (3.58) 虽然一阶相关系数与零阶相关系数在大小上并无一定的关系,即一阶相关系数可能大于或小于零阶相关系数,但是当零阶相关系数较大,而一阶相关系数接近零的时候,则说明可能存在谬误相关。 二 偏回归系数释义 对二元线性回归模型,考虑回
47、归方程 (3.59) 易见,,从而 (3.60) 可见,偏回归系数的意义是:在其它解释变量不变的条件下,解释变量或增加一个单位时,平均来看,应变量的增量。在现实经济活动中,经济变量的取值一般是非实验性的,所以在研究被解释变量受多个因素的影响时,很难通过实验将一个或几个解释变量固定或控制在某一水平去考察一个解释变量的变化对应变量的偏影响。但从上面的分析可知,多元回归分析解决了这个问题。正如许多人所说,多元回归方程的OLS估计,解决了实验科学中保持其它情况不变的问题,从而使对经济学的研究变得具有“实验性”。但是简单线性回归则不能
48、做到这一点。 在经典线性回归分析中,常常把应变量的期望值看成一种典型值,把误差或扰动看成是对典型值的偏离,而现代的计量分析则主要是把偏离看成未观测到的因素的作用。所以当经济变量之间的关系本来是多元关系而我们用简单线性回归模型来代替时,由于简单线性回归模型把许多未观测到的因素放入到扰动项中了,因此很难说斜率项回归系数是在其它变量保持不变时,解释变量对被解释变量的影响,换言之,由于简单线性回归模型把许多未观测到的因素放入到扰动项中,从而使研究者无法通过最小二乘法把这些变量控制,因而回归系数所反映的并不是模型中的解释变量对应变量的净影响。所以一般来说,回归系数的最小二乘估计是有偏的和不一致的。
49、例如:真实模型为 (3.49) 误设为 (3.61) 的最小二乘估计为,则 (3.62) 其中,为对的样本OLS回归系数。可见所表明的是对应变量的直接效应与通过其它解释变量如而影响应变量的间接效应如之和。因此简单线性回归中的回归系数并没有反映解释变量对应变量的净影响。因此,如果在模型中忽略了真实模型中的一个或几个解释变量,则其回归系数的最小二乘估计量不仅是有偏的,而且还是不一致的。当回归模型中所忽略的变量与解释变量有正的相关关系时,回归系数的最小二乘估计会偏高,而当所
50、忽略的变量与解释变量有负的相关关系时,回归系数的最小二乘估计会偏低。 第六节 预测 一 均值预测 1 点预测 考虑满足正态经典假设条件的简单线性回归模型 (3.1’) 其样本回归函数为 当由各解释变量为分量构成的解释向量控制在 [] 时,应变量的均值为 称 为均值的点预测。 易知,均值的点预测是无偏的。事实上, 。 的方差为 (3.63) 2 区间预测 由于是正态分布的线性函数,所以它也服从正态分布,故有






