收藏 分销(赏)

社会调查方法-spss高级统计.ppt

上传人:精**** 文档编号:14507509 上传时间:2026-10-02 格式:PPT 页数:83 大小:2.62MB 下载积分:10 金币
下载 相关
社会调查方法-spss高级统计.ppt_第1页
第1页 / 共83页
社会调查方法-spss高级统计.ppt_第2页
第2页 / 共83页


点击查看更多>>
资源描述
Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,社会调查统计学知识,2,一、,连续变量与离散变量,连续变量与离散变量,划分标准:,按变量值是否连续,来划分。,1,、,连续变量,:,在一定区间内可以任意取值的变量,。,特点:,其数值是连续不断的,,,相邻两个数值可作无限分割,,,即可取无限个数值,。,例如,,,生产零件的规格尺寸,,,人体测量的身高,、,体重,。,其数值只能用测量或计量的方法取得,.,2,、,离散变量,:,数值只能用自然数或整数单位计算,例如,:,企业个数,、,职工人数,、,设备台数等,,,只能按计量单位数计数,,,这种变量的数值一般用计数方法取得,。,连续变量与离散变量的简单区分方法,连续变量,是,一直叠加上去的,增长量可以划分为固定的单位,即:,1,2,3,例如:一个人的身高,他首先长到,然后才能长到,,1.53,;一次考试的分数,0-100,分。,离散变量则是通过计数方式取得的,即是对所要统计的对象进行计数,增长量非固定的,如:一个地区的企业数目可以是今年只有一家,而第二年开了十家;一个企业的职工人数今年只有,10,人,第二年一次招聘了,20,人等。,二、,P,值是什么,1,、,P,值的含义,P,值是概率(,Probability,),简单地说就是随机事件发生的可能性的大小。概率用从,0,到,1,之间的小数表示,也可表示为百分数。统计学通常认为如果,P,值小于,则该事件可视为小概率事件,即一次抽样中几乎不可能发生的事件。如果,P,值小于,同样也是小概率事件,只是进一步表明发生的概率更小。,用法及常见错误,P,值指的是比较的两者的差别是由机遇所致的可能性大小。,P,值越小,越有理由认为对比事物间存在差异。,例如,,P0.05,就是说结果显示的差别是由机遇所致的可能性不足,5%,,或者说,别人在同样的条件下重复同样的研究,得出相反结论的可能性不足,5%,。,统计学上规定的,P,值意义见下表,P,值,碰巧的概率,对无效假设,统计意义,P,0.05,碰巧出现的可能性大于,5%,不能否定无效假设,两组差别无显著意义,P,0.05,碰巧出现的可能性小于,5%,可以否定无效假设,两组差别有显著意义,P,0.01,碰巧出现的可能性小于,1%,可以否定无效假设,两者差别有非常显著意义,称,“,不显著,”,称,“,显著,”,称,“,非常显著,”,称,“极其,显著,”,2,、,P,值最常见的误用,最常见的错误是,把统计学上的显著,性,与实际中的显著差异相混淆,即混淆,“,差异具有显著性,”,和,“,具有显著差异,”,二者的意思。,前者指的是,,即说明有充分的理由认为比较的二者来自同一总体的可能性不足,5%,,因而认为二者确实有差异,下这个结论出错的可能性,5%,,是否我们就可以下结论说比较的二者没有差别呢?,P5%,只能说明没有充分的证据说明二者确有差别,但是也不能说二者没有差别或差别很小。在这两个极端之间还有一个过渡区间,即无论有差别还是没有差别或差别很小的证据都不足。要推断二者没有差别或差别很小,需要采用等效检验的统计推断方法。,有时具有统计意义显著的差异,在实际生活中可能意义并不大,如同在两个草堆之间找出一根草的差距,对判断两个草堆的大小没有实际意义。因此,对任何检验结题都应当有符合实际的解释和说明。,对于有的变量来说,即使是经过检验判定两者具有统计是有显著差异关系,也不一定存在实际意义上的关系,因为可能有未考虑到的变量或不可测量的变量在同时对两个研究变量起作用,有时甚至可能完全是偶然的巧合。,几个经典的话题,出去消防员越多火灾损失就越大,交通警察上路越多,路就越堵,人口增长率的降低导致了经济增长,流动人口犯罪率高于常住人口,推断统计:利用样本信息和概率论对总体的数量特征进行估计和检验,描述统计:统计数据的搜集、整理、显示和分析等,理论统计:研究统计学的一般理论;研究统计方法的数学原理。,应用统计:研究统计学在各领域的具体应用。,三、离散程度的测度,离散程度是指数据之间的差异程度或频数分布的分散程度。,离散程度与集中趋势是两个同样重要的数据分布特征。,集中趋势的测试值是对数据一般水平的一个概括性变量,它对一组数据的代表程度,取决于该组数据的离散水平。数据的离散程度越大,集中趋势的测度值对该组数据的代表性就越差,离散程度越小,其代表性就越好。,离散程度的测度,主要包括极差、方差和标准差、离散系数等。,(,一,),极差,最简单的变异指标。就是总体或分布中的最大标志值与最小标志值之差,又称全距,统计学上用,R,表示。,在总体中任何两个单位的标志值之差都不可能超过极差。,极差计算简单,含义直观,运用方便。,它仅仅取决于两个极端值的水平,不能反映其间的变量分布情况,同时易受极端值的影响。,极差的弊端如何解决?,用总体中所有,数据与均值之差的平均值就可以做到,和越大离散度也就越大。,离均差有正有负,怎么解决?,离均差的平方累加成了评价离散度一个指标,,(二)方差与标准差,方差:将离差求平均值。,常用符号,S,2,表示,标准差(,常用,S,或,SD,表示,),由于方差是数据的平方,与检测值本身相差太大,人们难以直观的衡量,所以常用方差开根号换算回来这就是我们要说的标准差。,标准差(,Standard Deviation,):也称均方差(,mean square error,),是各数据偏离平均数的距离的平均数,它是离均差平方和平均后的方根。简单说是方差的平方根。,方差与标准差的意义,方差与标准差是表示一组数据离散程度的最好的指标。其值越大,说明离散程度大,其值小说明数据比较集中,它是统计描述与统计分析中最常应用的差异量数。,它基本具备一个良好的差异量数应具备的条件:反应灵敏,每个数据取值的变化,方差或标准差都随之变化;有一定的计算公式严密确定;容易计算;适合代数运算;受抽样变动的影响小,即不同样本的标准差或方差比较稳定;简单明了,这一点与其他差异量数比较稍有不足,但其意义还是较明白的。,一个较大的标准差,代表大部分的数值和其平均值之间差异较大;一个较小的标准差,代表这些数值较接近平均值。,例如,两组数的集合,0,5,9,14,和,5,6,8,9,其平均值都是,7,,但第二个集合具有较小的标准差。,标准差与方差计算比较简便,又具有比较好的数学性质,是应用最广泛的统计离散程度的测度方法。,标准差可以当作不确定性的一种测量。例如在物理科学中,做重复性测量时,测量数值集合的标准差代表这些测量的精确度。当要决定测量值是否符合预测值,测量值的标准差占有决定性重要角色:如果测量平均值与预测值相差太远(同时与标准差数值做比较),则认为测量值与预测值互相矛盾。这很容易理解,因为如果测量值都落在一定数值范围之外,可以合理推论预测值是否正确。,标准差应用于 上,可作为量度回报稳定性的指标。标准差数值越大,代表回报远离过去平均数值,回报较不稳定故风险越高。相反,标准差数值越小,代表回报较为稳定,风险亦较小。,例:,A,、,B,两组各有,6,位学生参加同一次语文测验,,A,组的分数为,95,、,85,、,75,、,65,、,55,、,45,,,B,组的分数为,73,、,72,、,71,、,69,、,68,、,67,。这两组的平均数都是,70,,但,A,组的标准差为分,,B,组的标准差为分(此数据时在,R,统计软件中运行获得),说明什么?请解释。,A,组学生之间的差距要比,B,组学生之间的差距大得多。,(,三,),离散系数,离散系数的作用是消除变量值水平高低和计量单位不同对离散程度测度值的影响,是一相对指标。,离散系数通常是就标准差来计算的,因此也称标准差异系数。它是一组数据的标准差与其相应的算术平均数之比,是测度数据离散程度的相对指标。,离散系数主要是用于比较对不同组别数据的离散程度。离散系数大的说明数据的离散程度也就大,离散系数小的说明数据的离散程度也越小。,将统计数据按一定的顺序排列在表格上,就形成了统计表。从广义讲,统计表包括统计工作各阶段所使用的一切表格,有调查表、汇总表和分析表。以下,侧重就表现统计整理结果所用的统计表进行讨论。,四、统计资料的显示,1,、统计表的构成,从统计表的形式上看,可由总标题、横行标题、纵栏标题和指标数值四部分组成。此外有些统计表在表下还增列补充资料、注解、附记、资料来源、某些指标的计算方法、填表单位、填表人员以及填表日期等。,总标题,是表的名称,用以概括统计表中全部统计,资料,的内容。一般写在表的上端中部。,横行标题,是横行的名称,在统计表中通常用来表示各组的名称,它代表统计表所要说明的对象,一般写在表的左方。,纵栏标题,是纵栏的名称,在统计表中通常用来表示统计指标的名称。一般写在表的上方第一行。,指标数值,列在各横行标题与各纵栏标题的交叉处。统计表中任何一个数字的内容由横行标题和纵栏标题所限定。,2,、统计表的种类,简单表,,是指对总体未作任何分组而形成的统计表。可以有两种形式:一是按总体单位名称排列的统计表;二是按时间顺序排列的统计表。,(总体未分组),简单分组表,,是指总体仅按一个标志分组而形成的统计表。,(,对总体进行了分组),复合分组表,,是指总体按两个或两个以上标志进行复合分组而形成的统计表。,年份,国内生产总值(亿元),1996,1997,1998,1999,2000,67884.6,74462.6,78345.2,82067.5,89403.6,1,、我国近年来国内生产总值资料:,2,、,1999,年日均创国内生产总值:,按产业和,行业分组,国内生产总值(亿元),第一产业,第二产业,工业,建筑业,第三产业,交运仓储邮电通信业,批发零售贸易餐饮业,其他,39.6,110.7,95.8,14.9,74.1,12.2,18.7,43.2,合计,224.4,简单表,复合分组表,3.,统计表的设计,表的上下两边横线一般用粗线,给人醒目的感觉,中间用细线,统计表左右两边不封口,指标按次序排列,先因后果,先基础资料后计算结果,1.,要合理安排统计表的结构,2.,总标题内容应满足,3,W,要求(,when,、,what and where,),3.,数据计量单位相同时,可放在表的右上角标明,不,同时应放在每个指标后或单列出一列标明,4.,表中的上下两条横线一般用粗线,其他线用细线,5.,通常情况下,统计表的左右两边不封口,6.,表中的数据一般是右对齐,有小数点时应以小数点,对齐,而且小数点的位数应统一,7.,对于不应有数字的单元格,一般用“,”,表示,当缺,某项资料时应用“,”,表示,数值小可以忽略时要写上,“,0”,。,8.,必要时可在表的下方加上注释和资料来源。,五、统计图,(一)统计图包括,1.,标题,2.,坐标轴和网格线,3.,图例,(二)统计图的种类,直方图、折线图、曲线图,、,散点图、,柱形图、饼图等。,甲班,54,名学生统计学考试成绩,60 79 48 76 67 58 65 78 64 75 76 78 84 48 25 90 98 70 77 78 68 74 95 85 68 80 92 88 73 65 72 74 99 69 72 74 85 67 33 94 57 60 61 78 83 66 77 82 94 55 76 75 80 61,(一)编制频数分布数列,根据成绩高低分为五组:,0,59,60,69,70,79,80,89,90,100,用,excel,演示,甲班同学统计学考试成绩折线图,甲班同学统计学考试成绩柱状图,甲班同学统计学成绩饼图,而后者的意思是二者的差别确实很大。,碰巧出现的可能性大于5%,最常见的错误是把统计学上的显著性与实际中的显著差异相混淆,即混淆“差异具有显著性”和“具有显著差异”二者的意思。,甲班同学统计学成绩饼图,量值分布的次数少,形成“两头高、中间低”,同时应放在每个指标后或单列出一列标明,理论统计:研究统计学的一般理论;,横行标题是横行的名称,在统计表中通常用来表示各组的名称,它代表统计表所要说明的对象,一般写在表的左方。,可以有两种形式:一是按总体单位名称排列的统计表;,方差:将离差求平均值。,例:A、B两组各有6位学生参加同一次语文测验,A组的分数为95、85、75、65、55、45,B组的分数为73、72、71、69、68、67。,可以有两种形式:一是按总体单位名称排列的统计表;,60 79 48 76 67 58 65 78 64 75 76 78 84 48 25 90 98 70 77 78 68 74 95 85 68 80 92 88 73 65 72 74 99 69 72 74 85 67 33 94 57 60 61 78 83 66 77 82 94 55 76 75 80 61,这两组的平均数都是70,但A组的标准差为分,B组的标准差为分(此数据时在R统计软件中运行获得),说明什么?请解释。,同时应放在每个指标后或单列出一列标明,离散程度的测度,主要包括极差、方差和标准差、离散系数等。,例如,农业平均亩产量的分布、零件公差的分,由于人口总体中幼儿死亡人数和老年死亡人数均较高,而中年死亡人数最低,因而按年龄分组的人口死亡率便表现为U形分布。,U形分布的待征与钟形分布恰恰相反,靠近,对称分布中的正态分布最为重要,许多社会经济现象统计总体的分布都趋近于正态分布。,交运仓储邮电通信业,离散程度是指数据之间的差异程度或频数分布的分散程度。,交运仓储邮电通信业,2、1999年日均创国内生产总值:,二是按时间顺序排列的统计表。,有些期刊提倡如下用法:,1、连续变量:在一定区间内可以任意取值的变量。,一个企业的职工人数今年只有10人,第二年一次招聘了20人等。,例如,经济学中供给曲线,随着价格的提高供给量以较快的速度增加,呈现为正J形;,表中的数据一般是右对齐,有小数点时应以小数点,可以有两种形式:一是按总体单位名称排列的统计表;,指标数值列在各横行标题与各纵栏标题的交叉处。,反J形分布是次数随着变量值的增大而减少,绘,离散程度的测度,主要包括极差、方差和标准差、离散系数等。,钟形分布的特征是,“,两头小,中间大,”,,即靠近中间的变,量值分布的次数多,靠近两边的变量值分布的次数少。,钟形分布具体可分为对称分布和非对称分布。,对称分布的特征是中间变量值分布的次数最多,两侧变量值分布的次数则随着与中间变量值距离的增大而渐次减少,并且围绕中心变量值两侧呈对称分布,如图。,1.,钟形分布,对称分布中的正态分布最为重要,许多社会经济现象统计总体的分布都趋近于正态分布。,例如,农业平均亩产量的分布、零件公差的分,布、商品市场价格的分布,学生成绩的分布等。,正态分布在社会经济统计学中具有重要意义。,在非对称的分布中,有不同方向的偏态,如图(正偏或右偏分布)、(负偏或左偏分布)。,U,形分布的待征与钟形分布恰恰相反,靠近,两端的变量值分布的次数多,靠近中间的变,量值分布的次数少,形成,“,两头高、中间低,”,的分布持征。绘成曲线图,象英文字母,“,U,”,字。,形分布,有些社会经济现象的分布表现为,U,形分布,,例如人口死亡率分布,。由于人口总体中幼儿死亡人数和老年死亡人数均较高,而中年死亡人数最低,因而按年龄分组的人口死亡率便表现为,U,形分布。,J,形分布有两种类型。正,J,形分布是次数随着变,量值的增大而增多,绘成曲线图,犹如英文字母,“,J,”,字。,反,J,形分布是次数随着变量值的增大而减少,绘,成曲线图,犹如反写的英文字母,“,J,”,字,图形如,下,:,形分布,在社会经济现象中,有一些统计总体呈,J,形分布。,例如,经济学中供给曲线,随着价格的提高供给量以较快的速度增加,呈现为正,J,形;而需求曲线则表现为随着价格的增加需求量也较快的速度减少,呈现为反,J,形。,谢谢观看,
展开阅读全文

开通  VIP、SVIP  下载更划算
下载10份以上建议开通 VIP 会员
下载20份以上建议开通SVIP会员


开通VIP      成为共赢上传

当前位置:首页 > 包罗万象 > 大杂烩

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        关注我们

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服