资源描述
,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,Click to edit Master title style,第五章,SPSS,基本统计分析,描述性统计分析,5.4,多选项分析,(频数分析和交叉分析),多选项问题的概念:多选项问题是根据实际调查的需要,要求被调查者从问卷给出的若干个可选答案中选择一个以上的答案。目前,市场研究或许多领域对某事物评价的研究中常常遇到这样的问题。,可以选多个,分为限选和不限选:,限选:如在,11,种工作种类中,选你喜欢的,最多可选,4,种(,Var1-Var4),;,求所有人喜欢各种工作的频数或频率。,不限选:如在所列的,20,种电器中,你家所拥有的电器,不限选(,Var1-Var20,),,求所有被调查家庭拥有各种电器的频数或频率。,5.4.1,多选项问题的分解,多,选项二分法及其编码,(,multiple dichotomies method,):,多选项二分法是将多选项问题中的每一个答案设为一个,SPSS,变量,每个变量值有,0,或,1,两个取值,分别表示选择了该答案和不选择该答案。如对下面问题有,9,个可能的答案,每个可选择的答案由一个变量表示,每个变量的值只能有表明“是”和“否”的两个代码,0,或者,1,。,编号 调查内容 选 项,1,您,喜欢红色吗,是,否,2,您喜欢橙色吗,是,否,3,您喜欢黄色吗,是,否,4,您喜欢绿色吗,是,否,5,您喜欢青色吗,是,否,6,您喜欢蓝色吗,是,否,7,您喜欢紫色吗,是,否,8,您喜欢黑色吗,是,否,9,您喜欢白色吗,是,否,左边的表格为向顾客发放的颜色调查,在选择服装时,您喜欢什么颜色作为主体颜色,在答案的“,”中,打,“,”,(可多选),这是一组问题,每个问题均有两个答案,回答者只能选择其中一种。在建立数据文件时,变量名使用相同的变量主名,后面加以不同序号组成,本组问题的,9,个变量名可以是,color1-color9,。而,答案的编码规则为:回答“是”变量值为,1,,回答“否”变量值为,0,,其他值为缺失值。,多,选项分类法及其编码,(,multiple category method,):多选项分类法中,首先应估计多选项问题最多可能出现的答案个数;然后为每个答案设置一个,SPSS,变量,变量取值为多选项问题中的所有可选答案。如上面有关选择服装的主体颜色,您可以选择喜欢的三种,在提供的,10,种答案前上选择。,1,、红,2,、橙,3,、黄,4,、绿,5,、青,6,、蓝,7,、紫,8,、黑,9,、白,10,说不清,这是一个问题,可以有三个答案。在建立数据文件时,要建立三个变量,color1-color3,表示回答者选择的三个颜色。,如选择结果为,1,、红、,6,、蓝、,8,、黑,则变量,color1,的值,为,1,变量,color2,的值为,6,变量,color3,的值为,8,。,如果采用多选二分法则有,6,个选项,故应设,6,个变量,运用,0-1,编码方法编码,即:,1,,,0,,,1,,,0,,,1,,,1,。,如果采用多选分类法,则编码为,1,,,3,,,5,,,6,,,0,,,0,。,1 3 5 6,问题,2,:择业中考虑的主要因素,(多选),1,经济收入,2,专业对口,3,发展前途,4,地理区位,5,个人爱好,6,风险大小,7,劳动强度,8,社会福利,9,其他,编码应为:,1,,,0,,,1,,,1,,,1,,,0,,,1,,,1,,,0,。,或,1,,,3,,,4,,,5,,,7,,,8,,,0,,,0,,,0,。,1 3 6,问题,3,:您择业中考虑的主要因素有(限选三项),1,经济收入,2,专业对口,3,发展前途,4,地理区位,5,个人爱好,6,风险大小,7,劳动强度,8,社会福利,9,社会地位,10,其他,因为限选三项,故应设三个变量,编码依次为,1,,,3,,,6,。,5.4.2,多选项分析的基本操作,首先将每个题的若干答案组成一个综合变量即,变量集,(Set),,,然后对综合变量的各种取值进行分析。只有通过定义多选项变量集,,spss,才能确定应对哪些变量取相同值的个案数进行累加。,多选项分析在,SPSS,中是通过,Analyze-Multiple Response,中的各项功能实现的。,1.Define Sets,:,(,1,)从左边的变量中将多选变量集的变量选择到,variables in sets,框中,建立多选二分变量集或多选分类变量集。,(,2,)在,variables are coded as,框中指定多选变量集中的变量是按照那种方法编码的。,Dichotomies,表示以多选二分法编码,,并在,counted value,中输入用哪个数值来表示选中该选项。,categories,表示以多选分类法编码,,并在,range,框中输入变量取值的最小值和最大,值。,(,3,),为多选项变量集命名,,系统会自动在该名字前加字符,$,。,(,4,)单击,add,按钮将定义好的多选项变量集加到,mult,response sets,框中。,Spss,可以定义多个多选项变量集。,2.Frequencies,:,对多选变量集进行频数分析。从,mult,response sets,中把待分析的多选项变量集选择到,tables for,框中;,3.Crosstabs,:,对多选变量集与其他变量集或与原基本变量进行交叉表分析。,(,1,)选择列联表的行变量并定义取值范围;(,2,)选择列联表的列变量并定义取值范围;(,3,)选择列联表的控制变量并定义取值范围;(,4,)单击,option,按钮选择列联表的输出内容和计算方法。,Match variable across response sets,选项表示,如果列联表的行列变量均为多选项变量集时,第一个变量集的第一个变量与第二个变量集的第,一,个变量作交叉分组,依次类推。,结果中:注意,Pct of Responses,(占,总回答数的)和,Pct of Case,(占总个案数)的区别。,5.4.3,多选项分析的应用举例,利用居民储蓄调查数据进行分析,实现以下两个分析目标:,1.,分析储户的储蓄目的;,2.,分析不同年龄段储户的储蓄目的。,分析,1.,为进行多选项分析,首先定义名为,cxmd,的多选项变量集,其中包括,a7_1,、,a7_2,、,a7_3,三个变量,然后对多选项变量集进行频数分析;,2.,对不同年龄段储户储蓄目的进行分析,采用多选项交叉分组下的频数分析。,5.5,探索分析,Explore,1.,分析目的和方法,奇异性:数据过大或过小(找出、分析原因、是否剔除),分布特征:数据是否来自正态总体,考察方法:统计量和统计图形(箱,式,图、茎叶图、QQ图,),2.,一般,是,考察,定距变量,3.,Analyze,+Descriptive Statistics+Explore,分析变量(,Dependent List,),:数值型变量,分组变量(,Factor List,):,分类变量,标识变量,(Label Cases by):,用某变量的值作为观察值的标识如,id,选择一个或多个变量进入,Dependent,框,作为分析变量,单击,OK,可获得分析变量的一系列基本统计量和图形。,此作为分组变量,可以是字符变量,对分析变量的分析将按该变量的观测值进行分组分析。可有多个分组变量,这时会按多个变量的交叉组合进行分组。,该框中的变量作为标识符,在输出诸如异常值时,用该变量进行标识,只允许有一个标识符。,可同时输出基本统计量和图形,只输出基本统计量,只输出图形,Explore,主对话框,输出基本统计量,均值的置信区间,可键入,199%,的任意值,根据该值算出置信区间的上下限。,给出中心趋势的最大似然比的稳健估计量,当数据分布均匀,且两尾较长,或当数据中存在极端值时,可给出比均值或中位数更合理的估计。,输出最大和最小的,5,个数,且在输出窗口中加以标明。,输出,5%,、,10%,、,25%,、,50%,、,75%,、,90%,和,95%,的百分位数。,Statistics,对话框,Statistics,子对话框:用于选择需要的描述统计量;,descriptives,:输出均值、中位数、众数、,5%,修正均值、估计标准误、方差、标准差、最小值、最大值、全距、四分位差、峰度系数及其标准误、偏度系数及其标准误及指定的均值置信区间;,m-estmators,:做集中趋势的最大稳健估计,该统计量是利用迭代方法计算出来的,受异常值的影响要小得多。,如果该估计量离均值较远,则说明数据可能存在异常值,此时宜用该估计量替代均值以反映集中趋势。,一共会输出四种,m,估计量,其中,huber,适用于数据接近正态分布时,另三种则适用于数据中有许多异常值的情况;,outliers,:输出五个最大值和五个最小值。,percentiles,:输出第,5%,、,10%,、,25%,、,50%,、,75%,、,90%,、,95%,分位数。,plots,子对话框:用于选择需要的统计图;,boxplots,复选框:确定箱式图的绘制方式,可以分组绘制(,factor levels together,),也可以不分组绘制(,dependents together,),或者不绘制(,none,),;,descriptive,复选框:可以选择绘制,茎叶图,(,stem-and-leaf,)和,直方图,(,histogram,);,normality plot with test,:绘制,正态分布图,(,QQ,图),并进行变量是否符合正态分布的检验;,茎叶图,(stem-and-leaf),1.,用于显示未分组的原始数据的分布,2.,由,“,茎,”,和,“,叶,”,两部分构成,其图形是由数字组成的,3.,以该组数据的高位数值作树茎,低位数字作树叶,4.,树叶上只保留一位数字,5.,茎叶图类似于横置的直方图,但又有区别:,直方图可观察一组数据的分布状况,但没有给出具体的数值,茎叶图既能给出数据的分布状况,又能给出每一个原始数值,保留了原始数据的信息,6.,图的下方会标示出茎宽和实际值的倍数,每行的茎和叶组成的数字再乘以茎宽,即得到实际数据的近似值如茎宽为,10,,则图中的,2.3,代表,23,,同样在图的下方也会标示出每片叶子代表的记录数。,未分组数据,茎叶图,例题,某大学数学教师认为,学生学习数学时的焦虑情绪是影响数学成绩的因素之一。他采用两种不同的教学方式(学生自学、教师讲授)考察不同焦虑水平的大学生解决某个数学问题的成绩。首先,通过“数学焦虑水平自评量表”筛选出被试,120,名,其中高焦虑的被试,60,名(称为高焦虑水平组),低焦虑的被试,60,名(称为低焦虑水平组)。再把高、低焦虑水平组被试各分成两组,每组,30,人,分别采用不同的教学方式学习某个数学问题(,120,个被试均没有学习过该数学问题)。经过同样的教学时间后,对全体被试进行同样的数学测验,并采取同样的评分标准评定每个学生的数学成绩。是分别对各组被试的数学成绩做探索分析。,练习,利用居民储蓄调查数据,对一次存款金额变量进行探索性分析。,5.6,比率分析,5.6.1,比率分析的目的和主要指标,比率分析用于对两变量间变量值比率变化的描述分析,适用于,数值型变量,。,例如根据,1999,年各地区保险业务情况的数据,分析各地区财产保险业务的保费收入占全部业务保费收入的比例情况。,通常的分析可以生成各个地区财产保险业务的保费收入占全部业务保费收入的比率变量,然后对该比率变量计算基本描述统计量(如均值、中位数、标准差、全距等),进而刻画比率变量的集中趋势和离散程度。,SPSS,的比率分析除能够完成上述分析外,还提供了其他相对比描述指标,大致也属于集中趋势描述指标和离散程度描述指标的范畴,具体包括:,(,1,),加权比率均值(,Weighted mean,),:,两变量均值的比,属集中趋势描述指标。,(,2,),AAD,(,Average Absolute Deviation,),平均绝对离差,:是对比率变量离散程度的描述,计算公式为:,其中,是比率数,,M,是比率变量的中位数,,N,为样本数,相对数或平均数计算平均数的计算,相对数(或平均数)用,Y,表示,有,Y=a/b,,,a,、,b,为总量指标。,求各期,Y,的平均一般,不能,采用简单算术平均法,即,因为各期数据,Yi,的对比基础,bi,不同,它们对全期总平均水平的影响作用应轻重有别,.,计算公式:,1.,分别计算其分子、分母的平均数,2.,对比得:,上式实质上等于对各期,Y,加权算术平均。,(,3,),COD,(,Coefficient of Dispersion,),离散系数,:也是对比率变量离散程度的描述,计算公式为:,(,4,),PRD,(,Price-related Differential,),相关价格微分,:是比率均值与加权比率均值的比,也是比率变量离散程度的描述。,(,5,),COV,变异系数,:用于对比率变量离散程度的描述,分为基于,均值的变异系数(,Mean centered COV,),和,中位数的变异系数(,Median centered COV,),。,前者是通常意义下的变异系数,是标准差除以均值;后者定义为:,5.6.2,比率分析的基本步骤,(,1,)选择菜单,Analyze,Descriptive Statistics,Radio,,,出现窗口,(,2,)将比率变量的分子选择到,Numerator,框中,将比率变量的分母选到,Denominator,框中。,(,3,)如果做不同组间的比率比较,则将分组变量选择到,Group Variable,框中。,(,4,)单击,Statistics,按钮指定输出哪些关于比率的描述统计量,出现如下窗口:,至此,,SPSS,将自动计算比率变量,并将相关指标输出到输出窗口中。,报表中的描述性统计分析,(,case summaries),过程,case summaries,过程用于按指定的分组变量的不同水平进行交叉描述性统计分析。,Analyze-report-case summary,进入。,variables,框:选择需要进行分析的变量,可多选;,grouping variables,框:选择用于分组的变量。如果选择了多个分组变量,则系统会按各个变量的不同取值的交叉组合对汇总变量进行分析。,Display case:,用于确定是否输出详细的记录列表,下面的三个复选框用于选择具体的输出方式。,Statistics,子对话框用于选择一些常用的统计量。,title,子对话框:,title,框:用于定义输出表格的标题,默认标题为,case summaries,。,caption,框:用于给输出表格加上注解文字。,subheadings for totals:,用于选择是否给每个分组均显示所计算统计量的名称;,exclude case with missing values,listwise,:,用于选择是否在分析中删除带有缺失值的变量。,missing statistics appear as:,用于输出一个字符串,用于在输出结果中表示缺失值。,报表中的描述性统计分析举例,1.,对居民储蓄调查数据中的居民存款金额按照户口和职业进行分类汇总得到均值、中位数及标准差。,分析:可以使用,split file,过程,然后使用,descriptive,过程来完成。但是我们用这里的,case summary,过程一步就能完成。,
展开阅读全文