资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,*,典型相关分析,研究多个变量与多个变量之间的相关性,Canonical Correlation,1,要 点,典型相关分析的数学表达方式,约束条件;,典型相关系数的数学含义;,典型变量的数学含义;,典型相关系数的显著性检验;,冗余分析;,典型相关的应用,2,第一节 典型相关分析的基本思想,当研究两个变量,x,与,y,之间的相关关系时,,相关系数,是最,常用的度量。,如何研究,两组,变量之间的,相关关系,呢?,如何进一步确定两组变量在,整体,上的,相关程度,呢?,3,通常情况下,为了研究两组变量,的相关关系,可以用最原始的方法,分别计算两组变量之间的全部相关系数,一共有,pq,个简单相关系数,这样既烦琐又不能抓住问题的本质。,如果能够采用类似于主成分的思想,分别找出两组变量的各自的某个线性组合,讨论线性组合之间的相关关系,则更简捷。,4,典型相关分析,(,Canonical Correlation,)是研究,两组变量之间相关关系的一种多元统计方法。它能够揭示出两组变量之间的内在联系。,5,基本概念,Analyze the relationships between two sets of variables,Canonical correlation(,r,c,):Correlation between two composition of variables,X1,X2,X3,X4,X5,Y1,Y2,Y3,Y4,Y5,r,c,R,xx,R,yy,R,yx,R,xy,6,1936,年霍特,林,(,Hotelling,),最早就“大学表现”和“入学前成绩”的关系、政府政策变量与经济目标变量的关系等问题进行了研究,提出了典型相关分析技术。,之后,,Cooley,和,Hohnes(1971),,,Tatsuoka(1971),及,Mardia,,,Kent,和,Bibby(1979),等人对典型相关分析的应用进行了讨论,,Kshirsagar(1972),则从理论上给出了最好的分析。,7,在解决实际问题中,这种方法有广泛的应用。,如,居民生活环境与健康状况的关系,;,考察一些与,财政政策,有关的指标:财政支出总额增长率、财政赤字增长率、税率降低,与,经济发展,的一系列指标如,GDP,增长率、就业增长率、物价上涨率等,来研究,扩张性财政政策实施后对宏观经济发展,的影响。这些多变量间的相关性如何分析?,8,典型相关分析的目的是识别并量化两组变量之间的联系,将两组变量相关关系的分析,转化为一组变量的线性组合与另一组变量线性组合之间的相关关系分析。,目前,典型相关分析已被应用于心理学、市场营销等领域。如用于研究个人性格与职业兴趣的关系,市场促销活动与消费者响应之间的关系等问题的分析研究。,9,利用主成分分析的思想,可以把多个变量与多个变量之间的相关转化为,两个变量,之间的相关。,主成分,综合变量,找出系数 和 使得新变量,和,之间有最大可能的,相关系数,。,(典型相关系数),即使,10,例 家庭特征与家庭消费之间的关系,为了了解家庭的特征与其消费模式之间的关系。调查了,70,个家庭的下面两组变量:,分析两组变量之间的关系。,11,X1,X2,y1,y2,y3,X1,1.00,0.80,0.26,0.67,0.34,X2,0.80,1.00,0.33,0.59,0.34,y1,0.26,0.33,1.00,0.37,0.21,y2,0.67,0.59,0.37,1.00,0.35,y3,0.34,0.34,0.21,0.35,1.00,变量间的相关系数矩阵,R,xx,R,21,R,22,R,12,12,y,2,y,3,y,1,x,2,x,1,13,典型相关分析的思想:,首先分别在每组变量中找出第一对线性组合,使其具有最大相关性,,14,然后再在每组变量中找出第二对线性组合,使其分别与本组内的第一线性组合不相关,第二对本身具有次大的相关性。,u,2,和,v,2,与,u,1,和,v,1,相互独立,但,u,2,和,v,2,相关。如此继续下去,直至进行到,r,步,,两组变量的相关性被提取完为止。,r,min(p,q),,可以得到,r,组变量。,15,二、,典型相关的数学描述,考虑两组变量的向量,其协方差阵为,(一)想法,其中,11,是第一组变量的协方差矩阵;,22,是第二组变量的协方差矩阵;,是,X,和,Y,的,协方差矩阵。,16,如果我们记两组变量的第一对线性组合为:,其中:,所以,典型相关分析就是求,a,1,和,b,1,,使,uv,达到最大。,17,(二)典型相关系数和典型变量的求法,在,约束条件,:,下,求,a,1,和,b,1,,使,uv,达到最大。令,18,根据数学分析中条件极值的求法,引入,Lagrange,乘数,求极值问题,则可以转化为求,的极大值,其中,和,是,Lagrange,乘数。,19,将上面的,3,式分别左乘 和,20,将 左乘(,3,)的第二式,得,并将第一式代入,得,的特征根是 ,相应的特征向量为,21,将 左乘(,3,)的第一式,并将第二式代入,得,的特征根是 ,相应的特征向量为,22,结论:既是,M,1,又是,M,2,的特征根,和 是相应于,M,1,和,M,2,的特征向量。,至此,典型相关分析转化为求,M,1,和,M,2,特征根和特征向量的问题。,第一对典型变量提取了原始变量,X,与,Y,之间相关的主要部分,如果这部分还不能足以解释原始变量,可以在剩余的相关中再求出第二对典型变量和他们的典型相关系数。,23,在剩余的相关中再求出第二对典型变量和他们的典型相关系数。设第二对典型变量为:,在约束条件:,求使 达到最大的 和 。,24,例 家庭特征与家庭消费之间的关系,为了了解家庭的特征与其消费模式之间的关系。调查了,70,个家庭的下面两组变量:,分析两组变量之间的关系。,25,X1,X2,y1,y2,y3,X1,1.00,0.80,0.26,0.67,0.34,X2,0.80,1.00,0.33,0.59,0.34,y1,0.26,0.33,1.00,0.37,0.21,y2,0.67,0.59,0.37,1.00,0.35,y3,0.34,0.34,0.21,0.35,1.00,变量间的相关系数矩阵,26,典型相关分析,典型相,关系数,调整典型,相关系数,近似方差,典型相关系数的平方,1,0.687948,0.687848,0.005268,0.473272,2,0.186865,0.186638,0.009651,0.034919,27,X,组典型变量的系数,U1,U2,X1(,就餐),0.7689,-1.4787,X2,(电影),0.2721,1.6443,Y,组典型变量的系数,V1,V2,Y1,(年龄),0.0491,1.0003,Y2,(收入),0.8975,-0.5837,Y3,(文化),0.1900,0.2956,28,三、典型变量的性质,1,、,同一组变量的典型变量之间互不相关,X,组的典型变量之间是相互独立的:,Y,组的典型变量之间是相互独立的:,因为特征向量之间是正交的。故,29,2,、,不同组变量的典型变量之间的相关性,不同组内一对典型变量之间的相关系数为:,同对相关系数为,,,不同对则为零。,30,3,、原始变量与典型变量之间的相关系数,(,典型载荷分析,),原始变量相关系数矩阵,X,典型变量系数矩阵,31,y,典型变量系数矩阵,32,33,34,35,36,例 家庭特征与家庭消费之间的关系,为了了解家庭的特征与其消费模式之间的关系。调查了,70,个家庭的下面两组变量:,分析两组变量之间的关系。,37,X1,X2,y1,y2,y3,X1,1.00,0.80,0.26,0.67,0.34,X2,0.80,1.00,0.33,0.59,0.34,y1,0.26,0.33,1.00,0.37,0.21,y2,0.67,0.59,0.37,1.00,0.35,y3,0.34,0.34,0.21,0.35,1.00,变量间的相关系数矩阵,38,典型相关分析,典型相,关系数,调整典型,相关系数,近似方差,典型相关系数的平方,1,0.687948,0.687848,0.005268,0.473272,2,0.186865,0.186638,0.009651,0.034919,39,X,组典型变量的系数,U1,U2,X1(,就餐),0.7689,-1.4787,X2,(电影),0.2721,1.6443,Y,组典型变量的系数,V1,V2,Y1,(年龄),0.0491,1.0003,Y2,(收入),0.8975,-0.5837,Y3,(文化),0.1900,0.2956,40,典型变量的结构(相关系数),U1,U2,X1,0.9866,-0.1632,X2,0.8872,0.4614,V1,V2,Y1,0.4211,0.8464,Y2,0.9822,-0.1101,Y3,0.5145,0.3013,典型载荷分析,41,典型变量的结构(相关系数),V1,V2,X1,0.6787,-0.0305,X2,0.6104,0.0862,U1,U2,Y1,0.2897,0.1582,Y2,0.6757,-0.0206,Y3,0.3539,0.0563,Cross loadings,42,两个反映消费的指标与第一对典型变量中,u,1,的相关系数分别为,0.9866,和,0.8872,,可以看出,u,1,可以作为消费特性的指标,第一对典型变量中,v,1,与,Y,2,之间的相关系数为,0.9822,,可见典型变量,v,1,主要代表了了家庭收入,,u,1,和,v,1,的相关系数为,0.6879,,这就说明家庭的消费与家庭的收入之间其关系是很密切的;,43,第二对典型变量中,u,2,与,x,2,的相关系数为,0.4614,,可以看出,u,2,可以作为文化消费特性的指标,第二对典型变量中,v,2,与,Y,1,和,Y,3,之间的分别相关系数为,0.8464,和,0.3013,,可见典型变量,v,2,主要代表了家庭成员的年龄特征和教育程度,,u,2,和,v,2,的相关系数为,0.1869,,说明文化消费与年龄和受教育程度之间的相关性。,44,4,、各组原始变量被典型变量所解释的方差,(典型冗余分析),X,组原始变量被,u,i,解释的方差比例,X,组原始变量被,v,i,解释的方差比例,y,组原始变量被,u,i,解释的方差比例,y,组原始变量被,v,i,解释的方差比例,45,被典型变量解释的,X,组原始变量的方差,被本组的典型变量解释,被对方,Y,组典型变量解释,比例,累计比例,典型相关系数平方,比例,累计比例,1,0.8803,0.8803,0.4733,0.4166,0.4166,2,0.1197,1.0000,0.0349,0.0042,0.4208,46,被典型变量解释的,Y,组原始变量的方差,被本组的典型变量解释,被对方,X,组典型变量解释,比例,累计比例,典型相关系数平方,比例,累计比例,1,0.4689,0.4689,0.4733,0.2219,0.2219,2,0.2731,0.7420,0.0349,0.0095,0.2315,47,五、样本典型相关系数,在实际应用中,总体的协方差矩阵常常是未知的,类似于其他的统计分析方法,需要从总体中抽出一个样本,根据样本对总体的协方差或相关系数矩阵进行估计,然后利用估计得到的协方差或相关系数矩阵进行分析。,48,1,、假设有,X,组和,Y,组变量,样本容量为,n,。假设,(X,1,Y,1,),(X,2,Y,2,),(X,n,Y,n,),,观测值矩阵为:,49,2,、计算特征根和特征向量,求,M,1,和,M,2,的特征根 ,对应的特征向量 。则特征向量构成典型变量的系数,特征根为典型变量相关系数的平方。,50,职业满意度典型相关分析,某调查公司从一个大型零售公司随机调查了,784,人,测量了,5,个职业特性指标和,7,个职业满意度变量。讨论两组指标之间是否相联系。,X,组:,Y,组:,X1,用户反馈,Y1,主管满意度,X2,任务重要性,Y2,事业前景满意度,X3,任务多样性,Y3,财政满意度,X4,任务特殊性,Y4,工作强度满意度,X5,自主权,Y5,公司地位满意度,Y6,工作满意度,Y7,总体满意度,51,X1,X2,X3,X4,X5,Y1,Y2,Y3,Y4,Y5,Y6,Y7,X1,1.00,0.49,0.53,0.49,0.51,0.33,0.32,0.20,0.19,0.30,0.37,0.21,X2,0.49,1.00,0.57,0.46,0.53,0.30,0.21,0.16,0.08,0.27,0.35,0.20,X3,0.53,0.57,1.00,0.48,0.57,0.31,0.23,0.14,0.07,0.24,0.37,0.18,X4,0.49,0.46,0.48,1.00,0.57,0.24,0.22,0.12,0.19,0.21,0.29,0.16,X5,0.51,0.53,0.57,0.57,1.00,0.38,0.32,0.17,0.23,0.32,0.36,0.27,Y1,0.33,0.30,0.31,0.24,0.38,1.00,0.43,0.27,0.24,0.34,0.37,0.40,Y2,0.32,0.21,0.23,0.22,0.32,0.43,1.00,0.33,0.26,0.54,0.32,0.58,Y3,0.20,0.16,0.14,0.12,0.17,0.27,0.33,1.00,0.25,0.46,0.29,0.45,Y4,0.19,0.08,0.07,0.19,0.23,0.24,0.26,0.25,1.00,0.28,0.30,0.27,Y5,0.30,0.27,0.24,0.21,0.32,0.34,0.54,0.46,0.28,1.00,0.35,0.59,Y6,0.37,0.35,0.37,0.29,0.36,0.37,0.32,0.29,0.30,0.35,1.00,0.31,Y7,0.21,0.20,0.18,0.16,0.27,0.40,0.58,0.45,0.27,0.59,0.31,1.00,52,Canonical Correlation Analysis,Adjusted,Canonical,Correlation,Approx,Canonical,Correlation,Squared,Standard,Error,Canonical,Correlation,1,0.553706,0.553073,0.006934,0.306591,2,0.236404,0.234689,0.009442,0.055887,3,0.119186,.,0.009858,0.014205,4,0.072228,.,0.009948,0.005217,5,0.057270,.,0.009968,0.003280,53,U1,U2,U3,U4,U5,X1,0.4217,0.3429,-0.8577,-0.7884,0.0308,X2,0.19511,-0.6683,0.4434,-0.2691,0.9832,X3,0.1676,-0.8532,-0.2592,0.4688,-0.9141,X4,-0.0229,0.3561,-0.4231,1.0423,0.5244,X5,0.4597,0.7287,0.9799,-0.1682,-0.4392,X,组的典型变量,54,V1,V2,V3,V4,V5,Y1,0.4252,-0.0880,0.4918,-0.1284,-0.4823,Y2,0.2089,0.4363,-0.7832,-0.3405,-0.7499,Y3,-0.0359,-0.0929,-0.4778,-0.6059,0.3457,Y4,0.0235,0.9260,-0.0065,0.4044,0.3116,Y5,0.2902,-0.1011,0.2831,-0.4469,0.7030,Y6,0.5157,-0.5543,-0.4125,0.6876,0.1796,Y7,-0.1101,-0.0317,0.9285,0.2739,-0.0141,Y,组的典型变量,55,U1,U2,U3,U4,U5,X1,0.8293,0.1093,-0.4853,-0.2469,0.0611,X2,0.7304,-0.4366,0.2001,0.0021,0.4857,X3,0.7533,-0.4661,-0.1056,0.3020,-0.3360,X4,0.6160,0.2225,-0.2053,0.6614,0.3026,X5,0.8606,0.2660,0.3886,0.1484,-0.1246,V1,V2,V3,V4,V5,Y1,0.7564,0.0446,0.3395,-0.1294,-0.3370,Y2,0.6439,0.3582,-0.1717,-0.3530,-0.3335,Y3,0.3872,0.0373,-0.1767,-0.5348,0.4148,Y4,0.3772,0.7919,-0.0054,0.2886,0.3341,Y5,0.6532,0.1084,0.2092,-0.4376,0.4346,Y6,0.8040,-0.2416,-0.2348,0.4052,0.1964,Y7,0.5024,0.1628,0.4933,-0.1890,0.0678,原始变量与本组典型变量之间的相关系数,56,V1,V2,V3,V4,V5,X1,0.4592,0.0258,-0.0578,-0.0178,0.0035,X2,0.4044,-0.1032,0.0239,0.0002,0.0278,X3,0.4171,-0.1102,-0.0126,0.0218,-0.0192,X4,0.3411,0.0526,-0.0245,0.0478,0.0173,X5,0.4765,0.0629,0.0463,0.0107,-0.0071,U1,U2,U3,U4,U5,Y1,0.4188,0.0105,0.0405,-0.0093,-0.0193,Y2,0.3565,0.0847,-0.0205,-0.0255,-0.0191,Y3,0.2144,0.0088,-0.0211,-0.0386,0.0238,Y4,0.2088,0.1872,-0.0006,0.0208,0.0191,Y5,0.3617,0.0256,0.0249,-0.0316,0.0249,Y6,0.4452,-0.0571,-0.0280,0.0293,0.0112,Y7,0.2782,0.0385,0.0588,-0.0136,0.0039,原始变量与对应组典型变量之间的相关系数,57,可以看出,所有五个表示职业特性的变量与,u1,有大致相同的相关系数,,u1,视为形容职业特性的指标。第一对典型变量的第二个变量,v1,与,Y1,,,Y2,,,Y5,,,Y6,有较大的相关系数,说明,v1,主要代表了主管满意度、事业前景满意度、公司地位满意度和工种满意度。而,u1,和,v1,之间的相关系数,0.5537,。,58,Canonical Redundancy Analysis,Raw Variance of the VAR Variables,Explained by,Their Own The Opposite,Canonical Variables Canonical Variables,Cumulative Cumulative,Proportion Proportion Proportion Proportion,1 0.5818 0.5818 0.1784 0.1784,2 0.1080 0.6898 0.0060 0.1844,3 0.0960 0.7858 0.0014 0.1858,4 0.1223 0.9081,0.0006 0.1864,5 0.0919 1.0000 0.0003 0.1867,Raw Variance of the WITH Variables,Explained by,Their Own The Opposite,Canonical Variables Canonical Variables,Cumulative Cumulative,Proportion Proportion Proportion Proportion,1 0.3721 0.3721 0.1141 0.1141,2 0.1222 0.4943 0.0068 0.1209,3 0.0740 0.5683 0.0011 0.1220,4 0.1289 0.6972,0.0007 0.1226,5 0.1058 0.8030 0.0003 0.1230,59,u1,和,v1,解释的本组原始变量的比率:,X,组的原始变量被,u1,到,u5,解释了,100%,Y,组的原始变量被,v1,到,v5,解释了,80.3%,X,组的原始变量被,u1,到,u4,解释了,90.81%,Y,组的原始变量被,v1,到,v4,解释了,69.72%,60,六、典型相关系数的显著性检验,在进行典型相关分析时,对于两随机向量,(,X,Y,),,,我们,可以提取,min(,p,q,),对,典型变量,问题是进行典型相关分析的目的就是要减少分析变量,简化两组变量间关系分析,,提取,min(,p,q,),对,变量是否必要,?,我们,如何确定保留多少对典型变量?,61,62,63,64,65,例,10.1,康复俱乐部对,20,名中年人测量了三个生理指标:体重,(,x,1,),腰围,(,x,2,),,脉搏,(,x,3,),;三个训练指标:引体向上次数,(,y,1,),,起坐次数,(,y,2,),,跳跃次数,(,y,3,),。分析生理指标与训练指标的相关性。,表,康复俱乐部数据,66,67,68,69,70,71,72,73,74,75,从相关矩阵出发计算典型相关,为消除量纲影响,对数据先做标准化变换,然后再做典型相关分析。,显然,经标准化变换之后的协差阵就是相关系数矩阵,因而,也即通常应从相关矩阵出发进行典型相关分析。,76,对于例,10.1,从相关系数矩阵出发进行典型相关分析。,77,78,79,Path diagram for canonical analysis,Proportion of variance extracted,by X pv=(-.74,2,+.79,2,)/2=.58=58%,by Y pv=(-.44,2,+.88,2,)/2=.48=48%,Proportion of variance extracted,by X pv=(-.68,2,+.62,2,)/2,=.42=42%,by Y pv=(-.90,2,+.48,2,)/2,=.52=52%,58%+42%=100%,80,Proc cancorr data=SAS,数据集,out=SAS,数据集,outstat=SAS,数据集,all;,with,变量名,;,Var,变量名,;,Run;,SAS,程序,用来列出被分析的两组变量中的,第二组,变量,用来列出被分析的两组变量中的,第一组,变量,OUT=,包含原始数据和典型变量得分的数据集,OUTSTAT=,包含分析中用到的各种统计量,produce simple statistics,input variable correlations,and canonical redundancy analysis,81,
展开阅读全文