资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,*,第,8,章 回归分析与聚类分析初步,8.1,一元线性回归分析,8.2,二元线性回归,8.3,主成分分析,8.4,聚类分析,内容提要,1,8.1,一元线性回归,(1),确定性关系,对应关系、函数关系。其变量称确定性变量。,(2),相关关系,对应的变量称随机变量。没有一一对应的函数关系,但有统计规律,散点图、回归方程。,一元回归分析,研究单因素与试验指标间相关关系;,多元回归分析,研究多因素与试验指标间相关关系;,线性回归、非线性回归,相关关系为线性或非线性。,8.1.1,概述,科研与生产中,变量之间的关系有两种情况,2,设有一组试验数据,xi,,,yi,(i=1,,,2,,,,,n),,,其中,x,是自变量,,y,是因变量。若,x,,,y,符合线性关系,或已知经验公式为直线形式,即:,8.1,一元线性回归,8.1.2,回归方法,a,b,称为回归系数,;,是由,x,i,代入回归方程的计算值,称为回归值。,3,与,y,i,之间的偏差称为残差,用,e,i,表示,则有:,残差平方值(考虑到残差有正有负)之和为:,显然,只有残差平方和最小时,回归方程与试验值的拟合程度最好。,残差平方和,SSe,为,a,,,b,的函数,即:,SSe,=f(a,b),为使,SSe,值到达极小,根据极值原理,只要对上式分别对,a,,,b,求偏导数,并令其等于零,求解方程组即可求得,a,,,b,之值,最小二乘法原理。,4,要使误差最小,则,对方程组求解,即可得到回归系数,a,b,的计算式:,正规方程组,5,为了方便计算,令:,于是:,6,(,1,)相关系数检验法,先求出回归方程的相关系数,然后与临界值进行对比:,计算值,临界值,两变量不是独立,相关关系成立;,计算值,F,0.01,(,f,R,f,e,),,,称,x,与,y,有非常显著的线性关系,用两个“*”号表示,2.,若,F,0.05,(,f,R,f,e,),F,F,0.01,(,f,R,f,e,),,,称,x,与,y,有显著的线性关系,用一个“*”号表示;,3.,若,F,F,0.01,(,f,R,f,e,),,,称,y,与,x,1,,,x,2,,,,,x,m,有非常显著的线性关系,用两个“*”号表示,2.,若,F,0.05,(,f,R,f,e,),F,F,0.01,(,f,R,f,e,),,称,y,与,x,1,,,x,2,,,,,x,m,有显著的线性关系,用一个“*”号表示;,3.,若,F,F,0.05,(,f,R,f,e,),,,则称,y,与,x,1,,,x,2,,,,,x,m,没有明显著的线性关系,回归方程不可信。,16,8.3,主成分分析,多元统计分析处理的是多变量(多指标)问题。由于变量较多,增加了分析问题的复杂性。,但在实际问题中,变量之间可能存在一定的相关性,多变量中可能存在信息的重叠。因此,人们自然希望通过克服相关性、重叠性,用较少的变量来代替原来较多的变量,而这种代替可以反映原来多个变量的大部分信息,.,这实际上是一种,“降维”,的思想。,17,主成分分析也称主分量分析,是由,Hotelling,于,1933,年首先提出的。,由于多个变量之间往往存在着一定程度的相关性。,人们自然希望通过线性组合的方式,从这些指标中尽可能快地提取信息。,当第一个线性组合不能提取更多的信息时,再考虑用第二个线性组合继续这个快速提取的过程,,,直到所提取的信息与原指标相差不多时为止。,这就是主成分分析的思想。,18,在力求数据信息丢失最少的原则下,对高维的变量空间降维,即研究指标体系的少数几个线性组合,并且这几个线性组合所构成的综合指标将尽可能多地保留原来指标变异方面的信息。这些综合指标就称为主成分。,要讨论的问题是:,(1),基于相关系数矩阵还是基于协方差矩阵做主成分分析,当分析中所选择的经济变量具有不同的量纲,变量水平差异很大,应该选择基于相关系数矩阵的主成分分析。,19,(,2,)选择几个主成分,主成分分析的目的是简化变量,一般情况下主成分的个数应该小于原始变量的个数。,关于保留几个主成分,应该权衡主成分个数和保留的信息。,(,3,)如何解释主成分所包含的经济意义,20,8.3.2,主成分的计算,设两个变量,(x,1,x,2,),的样板数据如下表,X,1,x,11,x,12,.,x,1n,x,2,x,21,x,22,.,x,2n,求得平均值和协和方差矩阵分别为,并有,适当选取(,a,1,a,2,),使,y,1,处于方差最大的方向。,21,设总体,X,的,样本数据阵为,则,样本协方差阵,S,及样本相关阵,R,分别为,22,其中,下面以样本协方差阵,S,作为,的估计或用,R,作为总体相关阵的估计,然后按上节方法求样本主成分。,23,8.4,聚类分析,8.4.1,概述,聚类分析的基本思想是在样品之间定义距离,在样品之间定义相似系数,距离或相似系数代表样品或者变量之间的相似程度。按相似程度的大小,将样品(或变量)逐一归类,关系密切的类聚集到一个小的分类单位,然后逐步扩大,使得关系疏远的聚合到一个大的分类单位,直到所有,的样品(或变量)都聚集完毕,形成一个表示亲疏关系的谱系图,依次按照某些要求对样品(或变量)进行分类,.,24,(,距离可以自己定义,只要满足距离的条件),8.4.2,样品间的距离,25,一般情况下,我们常用到下面定义的几种距离,欧氏距离,(Euclidean,distance),绝对距离(,Block,距离),明考斯基距离,(,Minkowski,),26,切比雪夫距离,(,Chebychev,),马氏距离,方差加权距离,27,方法,名称,参 数,最短距离,1/2,1/2,0,-1/2,最远距离,1/2,1/2,0,1/2,重心距离,0,0,类平均距离,0,离差平方和距离,0,五种系统聚类方法的距离参数值,8.4.3,类聚方法,28,
展开阅读全文