收藏 分销(赏)

环境统计第四章.ppt

上传人:精**** 文档编号:12570189 上传时间:2025-11-02 格式:PPT 页数:130 大小:1.39MB 下载积分:22 金币
下载 相关
环境统计第四章.ppt_第1页
第1页 / 共130页
环境统计第四章.ppt_第2页
第2页 / 共130页


点击查看更多>>
资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,(2)通过,抽样调查,,取得,部分单位的,实际资料计算样本的,综合指标,,然后,对总体的规模、水平、结构等数量指标,做出,估计和推断,。,(3)用样本指标估计总体指标,,利用的是不确定的,概率估计的方法,。,(4)抽样误差可以计算和控制。,采取一定得组织措施来控制误差的范围,保证抽样推断的结果达到一定的可取程度。,有关抽样调查的几个基本概念,(1)总体和样本。总体是指被研究对象的全体,它是由所研究范围内具有某种共同性质的全体单位所组成的集合体。总体的单位数用,N,表示;样本是从总体中随机抽取出来的那部分单位的集合体。样本的单位数用,n,来表示。,(2)抽样框。划定一个尽可能接近总体的便于操作的框架,作为抽样总体,即抽样框。抽样框实际上是被抽单位的目录。,(3)参数和统计量。根据总体各单位的标志值或标志属性计算的,反映总体数量特征的综合指标称为总体指标,它是总体变量的函数,其数值是由总体各单位的标志值或标志属性决定的,一个总体指标是一个确定的、唯一的数值,也称真值,因此称为参数。根据样本各单位标志值或标志属性计算的综合指标称为统计量,也可称为样本指标。,(4)样本容量和样本个数。样本容量又称样本含量,是指一个样本包含的观察单位数。样本容量的大小直接影响着抽样调查的效果。一般将,n,30的样本称之为小样本,,n,30的样本称为大样本。样本个数又称样本可能数目,是指从一个总体中可能抽取的样本个数。,2.2分层抽样,分层抽样也称类型抽样或分类抽样。它是先将总体各单位按主要标志进行分层,然后再按比例从各层中随机抽取一定数目的单位构成样本。,分层抽样需要确定各层的样本数目分配,样本单位在各层中的数目分配,可以是等比例的分层抽样,也可以是不等比例的分层抽样。,(1)等比例分层抽样。就是按总体各层单位数的多少来分配每层应抽的样本单位数。,(2)不等比例抽样。,2.3等距抽样,等距抽样又称机械随机抽样或系统抽样。它是先将总体各单位按某一标志顺序排列,然后按固定的顺序和间隔抽取一定数目的总体单位构成样本。,在按无关标志排队的等距抽样中,可在第一个间隔内随机抽取第一个样本单位作为起点,然后每隔,K,个单位抽取一个样本单位,直到抽够所需要的样本单位数。,在按有关标志排队的等距抽样中,第一个样本单位通常按以下方法来确定。,(1)中点取样法。,(2)平均取样法。,(3)随机起点,对称等距取样。,2.4整群抽样,整群抽样是将总体各单位划分成若干群(组),然后以群为单位从中随机抽取部分群体,由选中的群体所包含的全部单位构成样本。,组织整群抽样时,首先要对所研究的总体按需要划分出群的单位,然后把总体各群进行编号,再按简单随机抽样或等距抽样方法抽取样本群,组成样本。,2.5阶段抽样,阶段抽样亦称多阶段抽样。阶段抽样是将总体先分成若干大组,大组中再分小组,还可以往下细分。抽样时先随机抽取大组,再从抽中的大组中随机抽取小组,最后根据最终抽取的所有单位组成样本,进行调查。,阶段抽样方法多用简单随机抽样方法,也可将几种抽样方法结合使用。,3抽样分布,3.1总体分布、样本分布与抽样分布,从概率论角度看,总体各单位标志值,Xi,(,i,=1,2,,N,)可以看作是随机变量,X,的,N,种取值。因此,统 计上 常将随机变量,X,的 全 部 取 值,X,1,,,X,2,,,X,N,的集合称为变量总体 (简称总体,记为,X,),,X,1,,,X,2,,,X,N,被称为总体单位(个体),从总体中随机抽取的,n,个个体,X,1,,,X,2,,,X,n,,称为总体,X,的一个容量为,n,的样本,其中,X,1,,,X,2,,,X,n,被称为“样本单位”。样本单位,X,1,,,X,2,,,X,n,可以看作是,n,个相互独立且与,X,具有相同概率分布的随机变量,从总体 X 中进行一次 具体抽样,所获得的具体数据,x,1,,,x,2,,,x,n,是,n,个随机变量(样本),X,1,,,X,2,,,X,n,的具体数值,常称为样本观察值或样本值。,设,X,1,,,X,2,,,X,n,为总体,X,的一个样本,,f,(,X,1,,,X,2,,,X,n,)为一个连续函数,若,f,(,X,1,,,X,2,,,X,n,)中不含任何未知参数,则称,f,(,X,1,,,X,2,,,X,n,)为一个统计量。如果,x,1,,,x,2,,,x,n,为样本,X,1,,,X,2,,,X,n,的具体样本观察值,则,f,(,x,1,,,x,2,,,x,n,)是,f,(,X,1,,,X,2,,,X,n,)的一个观察值。,例如,样本,X,1,,,X,2,,,X,n,的均值、方差,S,2,都是统计量,对于从总体,X,中抽出的某一具体样本,x,1,,,x,2,,,x,n,,其均值、s,2,分别被称为统计量及,S,2,的一个观察值。,从总体,X,中多次独立地随机抽取样本,每次所得到的样本观察值是各不相同的;作为随机样本的函数,统计量,f,(,X,1,,,X,2,,,X,n,)的各次观察值,f,(,x,1,,,x,2,,,x,n,)往往也是不同的,即统计量,f,(,x,1,,,x,2,,,x,n,)也是一个随机变量。,总体,X,的概率分布称为总体分布。样本观察值的概率分布称为样本分布。统计量的概率分布被称为抽样分布。总体分布、样本分布及抽样分布的关系,可用例5.1予以说明。,例5.1 设有5台仪器,其使用时间分别为1年,2年,3年,4年,5年。现采用重复抽样方法抽出2台仪器构成样本,试给出其总体分布,样本均数的抽样分布及相应的分布特征。,该总体的概率分布如下表:,表5.1 5台仪器使用时间的概率分布,使用时间,X,i,1,2,3,4,5,台 数,f,i,1,1,1,1,1,概 率,P,i,f,i,/,f,i,该总体分布的特征:,从5台仪器中用重复抽样方式随机抽取2台构成样本,所有可能样本:,(1,1),(1,2),(1,3),(1,4),(1,5),(2,1),(2,2),(2,3),(2,4),(2,5),(3,1),(3,2),(3,3),(3,4),(3,5),(4,1),(4,2),(4,3),(4,4),(4,5),(5,1),(5,2),(5,3),(5,4),(5,5).,的抽样分布,=10.04+1.50.08+20.12+2.50.16+30.20,+3.50.16+40.12+4.50.08+50.043(年),(1-3),2,0.04+(1.5-3),2,0.08+(2-3),2,0.12,+(2.5-3),2,0.16+(3-3),2,0.20+(3.5-3),2,0.16,+(4-3),2,0.12+(4.5-3),2,0.08+(5-3),2,0.04l(年),样本均值,1,1.5,2,2.5,3,3.5,4,4.5,5,次 数,f,i,1,2,3,4,5,4,3,2,1,概 率,P,i,0.04,0.08,0.12,0.16,0.20,0.16,0.12,0.08,0.04,这一结论具有普遍意义。样本均值的抽样分布,并描述了其分布特征。当总体容量较大时,无法用上述方法描述统计量的抽样分布,必须进一步探讨抽样分布的理论方法。,3.2样本均值 的抽样分布,作为随机变量,样本均值的变化规律,可以用 的所有可能取值及其所对应的概率来描述,即为样本均值 的抽样分布。,3.2.1,2,已知时样本均值 的抽样分布,当总体,X,服从正态分布时,设,x,1,,,x,2,,,x,n,是从正态总体,X,N,()中重复抽取的一个简单随机样,本,则其样本均值 亦是服从正态分布的,随机变量,并且可以证明,,即 ,N,()。,例如,某总体,X,N,(20,3,2,);现从中随机,抽取一个,n,3 的简单随机样本,则,N,(20,3,2,3),即 ,N,(20,3);如果将,n,由3增加到9,,则 ,N,(20,1)。,总体分布与不同样本容量的抽样分布,由此可以说明:,(1)当总体服从正态分布时,不论样本容量,n,有多大,样本均值均服从以总体均值,为中心的正态分布。,(2)从正态总体中随机抽样,样本均值的数学期望等于总体均值,;样本均值的方差为总体方差 的1/n,这意味着样本均值的各观察值比总体各单位,X,i,更紧密地集中在总体均值,的周围,且样本均值的集中程度与样本容量,n,成正比。,(3)样本均值的方差 ,进而,有,样本均值的标准误差 (简称,均值的标准误)。,(4)对 作标准正态变量变换,令,则 ,N,(0,1)。,当总体X不服从正态分布时,样本均值的抽样分布与样本容量,n,的大小有关。根据中心极限定理,随着样本容量,n,的逐渐增加,样本均值的抽样分布趋近正态分布。因此,当样本容量,n,充分大(一般认为,n,50)时,样本均值的抽样分布一般可按正态分布处理。,3.2.2 未知时样本均值的抽样分布,t,分布,当总体服从正态分布时,从正态总体中随机抽样,且总体方差 已知时,样本均值服从标准正态分布,即,u,分布。当总体方差 未知时,我们可以用样本方差S,2,代替总体方差,2,,用标准误的估计值 来估计样本均值的标准误 ,这时对正态变量仍按上述方法进行变换;其结果已不是标准正态分布,而是自由度为,n,-1的,t,分布了。即,t,分布也是一种对称分布,在样本容量,n,不大的情况下,,t,分布与标准正态分布相差较大,但随着样本含量的逐渐增大(严格讲是自由度,n,-l逐渐增大),t,分布逐渐逼近标准正态分布,尤其是当自由度大于40时,,t,分布与标准正态分布相差甚微,当自由度时,,t,分布就与标准正态分布完全一样了。因此,当自由度较大时的,t,分布可以近似地按正态分布处理。,不同自由度下的,t,分布,和正态分布一样,,t,分布曲线下的总面积也等于1,即,t,值落入区间(-,+)内的概率为1。,t,值落入任一区间(,t,1,,,t,2,)内的概率等于该区间曲线和横轴所夹的面积。如,t,值落于区间(-,t,0.05,,+,t,0.05,)内的概率为0.95,,t,值落于区间(-,t,0.01,,+,t,0.01,)内的概率为0.99。这里的,t,0.05,、,t,0.01,是概率分别为0.05,0.01时的,t,界值。,附表3列出了不同自由度下,t,分布的分位数,表头上的各概率是指,t,大于表中所列,t,界值时的概率。,例如,从表中可以查出自由度9,概率0.05的单侧分位数1.833,记作,t,0.05,9,1.833。其含义为当,t,1.833时,曲线下面积(或概率)为0.05。由于曲线的对称性,对于单侧分位数可以表示为:,P(,t,t,,,)P(,t,-,t,,,)=,以后我们会见到,在很多情况下需要将给出的概率,或者说曲线下的面积,平均分配到两个尾区,求出双侧对称的,t,分位数。这时每一尾区的曲线下面积,只为给定概率的1/2。,例如,查自由度9,概率0.05的,t,双侧分位数,就要查概率为,/20.025时的单侧分位数。从附表3中,可以查出,t,0.025,9,2.262,由于曲线的对称性,则另一尾区,t,0.025,9,2.262。,就是说,,t,2.262 和,t,2.262 (相当于,t,2.262)的两个尾区的曲线下的面积之和为0.05。对于双侧分位数可以表示为:,P(,t,t,/2,,),以后我们均以“,t,,,”表示单侧分位数,,“,t,/2,,”表示双侧分位数。,3.2.3 两个样本均值之差的抽样分布,当 和 为已知时,,当 和 均 为未知时,且,当 和 均 为未知时,且,当,X,1,和,X,2,为非正态总体,和 均 为未知时,且,3.3样本比率(成数),p,的抽样分布,设容量为,N,的总体中具有某种性质的总体单位数为,M,,则总体关于这种性质的总体单位数的比率 。,如果从该总体抽取容量为,n,的简单随机样本,对样本比率,P,,则有,4抽样误差的估计,4.1抽样误差的概念,抽样误差是指统计量与相应参数之差。,如样本均值与总体均值之差,样本比率,p,与总体比率P之差等。,由于总体中各单位之间存在着变异,抽样调查中抽取的样本只包含总体一部分的单位,其结构不可能和总体完全一致,因而样本指标不一定恰好等于相应的总体指标。抽样误差越小,用样本估计总体的可靠性就越大,否则,抽样误差越大,用样本估计总体的可靠性就越小。,抽样误差虽然不可避免,但它具有一定的规律性,在抽样调查中,掌握和应用这种规律性是非常重要的。,4.2影响抽样误差的因素,(1)样本容量的大小。在其他因素完全相同的条件下,样本容量越大,抽样误差就越小;而样本容量越小,抽样误差就越大。,(2)总体单位标志变异度的大小。抽样误差与总体标志变异度成正比。即总体标志变异度越大,抽样误差也越大;总体的标志变异度越小,则抽样误差也越小。,(3)不同的抽样组织形式。对同一总体进行抽样调查。在样本容量一定的条件下,重复抽样的误差比不重复抽样的误差要大些。,4.3均值的抽样误差,从总体,X,中随机抽取一个容量,n,的样本,x,1,,,x,2,,,x,n,,由于有多种抽选方法,可以抽取多个不同样本,因而就有多个不同的样本均值。,如果把样本均值看作变量,也可以用标准差说明各样本均值间的变异程度,即样本均值的标准误差,简称标准误。均值的抽样误差的大小通常用标准误来表示。,根据抽样分布的原理,容量为,n,的样本均值分布的方差 等于总体方差,2,的1/n,即,取两端平方根,则为:,在实际应用中,总体标准差,未知,通常是用标准误的估计值来说明均值抽样误差大小的。,均值的标准误估计值在随机抽样方式重复抽样时,其计算公式为:,不重复抽样,其抽样误差总是小于重复抽样误差。从容量为,N,的总体中不重复抽样,均值的标准误计算公式为:,当总体单位数,N,很大时,式中的,N,-1可近似取,N,,则,通常称为有限总体修正系数。当,nN,不大(一般不大于5%时,标准误计算公式中的修正系数可以省去。,例5.2,某县利用原有的浅层水井进行地下水污染状况抽样调查。从该县的1000眼水井中随机抽选10眼水井,测定井水中砷的浓度,测定结果,10眼井水中砷的平均浓度为0.58mg,L,标准差为mg,L。试求其均值的标准误。,本例 0.,58mgL,,S0.1,mgL,,,N,1000,,n,=10,由于,n/N,1%5%,因此按式(5.11)计算均值的标准误,4.4比率(成数)的标准误,比率的标准误计算与均值的标准误计算原理基本相同。重复抽样时,比率的标准误计算公式为:,当,P,未知时,常以样本比率,p,来估计,则,不重复抽样时比率标准误的计算公式为:,例5.3某市监测大气中SO,2,浓度,在采集的200个空气样品中,经测定有8个样品SO,2,浓度超标。求SO,2,超标率的标准误。,本例SO,2,浓度超标率 ,由于,P,未知,,而且是从无限总体中抽样,可按式(5.15)计算:,例5.4 某河段有1000个污水排放口,用不重复抽样方法从中抽检100个污水排放口,结果有85个超标,求该超标率的标准误。,排污口超标率 按式(5.16),计算:,该河段污水排放口超标率的标准误为3.39%。,标准误与标准差的区别:,标准差描述个体间的变异程度。凡同性质的资料,标准差大表示个体变异大,标准差小表示个体变异小。,而标准误是样本指标的标准差,反映样本指标的抽样误差,即样本指标与总体指标的接近程度。凡同性质的资料,标准误大,表示样本指标的抽样误差大,用样本指标代表总体指标的可靠性小,而标准误小,表示样本指标的抽样误差小,用样本指标代表总体指标的可靠性大。,4.5抽样极限误差,抽样极限误差又称抽样允许误差。把样本指标与总体指标之间的抽样误差控制在一个允许的限度范围内,这个可允许的最大抽样误差范围称为抽样极限误差。,用绝对值表示,用不等式表示则为:,p,5.参数估计,5.1参数估计的优良标准,评价统计量的优劣一般应遵从以下原则:,5.1.1无偏性,总体参数的估计量是一个随机变量,对随机样本,x,1,,,x,2,,,x,n,的不同观察值,某估计量会取得不同的估计值。估计量的每一个估计值与相应的总体参数的真值之间可能存在着一定的误差,但如果某估计量的所有可能估计值的平均值,即估计量的数学期望等于相应的总体参数值,则该估计量就被称为相应总体参数的无偏估计量。,如果估计量的数学期望值不等于要估计的参数,就称为偏倚估计量,它可正可负,等于零时即为无偏估计量。,无偏估计实际上是在平均意义下较好的一个估计量。一个好的估计量是无偏的或至少是近于无偏的。,对于样本均值 有,所以样本均值是总体均值,的无偏估计量。,无偏估计的实际意义:,无系统误差,.,P,(,),B,A,无偏,有偏,证,例,1,特别的:,不论总体,X,服从什么分布,只要它的数学期望存在,对于样本方差,s,2,有,样本方差一般指 ,并简记为,s,2,。,证,例,2,(这种方法称为,无偏化,),.,5.1.2有效性,设,1,,,2,为参数,的两个无偏估计量,如果对任一容量为,n,的样本,有,D,(,1,),D,(,2,),则称,1,比,2,的估计值更有效。若固定样本容量,n,,使取得极小值的无偏估计量就称之为最有效的估计量,又称最优估计量。因此,估计量的方差越小,说明估计量取值越集中,它的有效性越高。,由于方差是随机变量取值与其数学期望的偏离程度,所以无偏估计以方差小者为好.,A,B,的抽样分布,的抽样分布,P,(,),证明,例,4,(,续例,3),5.1.3 一致性,当样本容量逐渐增加时,如果估计量的某估计值会愈来愈接近于相应的参数值,则称该估计量是参数的一致估计量。,5.1.4充分性,如果一个估计量充分地利用了样本中有关总体的所有可能信息,它就称为充分估计量。即如果某估计量是某参数的充分估计量,则不会有别的统计量能够为该参数提供更多的来自样本的信息。,5.2,点估计,设,总体,X,的分布函数形式已知,但它的,一个,或,多个,参数,为未知,借助于总体,X,的一个,样本,来估计总体未知参数的值的问题称为,点估计问题,.,例,1,解,用样本均值来估计总体的均值,E,(,X,).,点估计问题的,一般提法,1.,估计量的求法,由于,估计量,是,样本,的,函数,是随机变量,故对不同的样本值,得到的参数值往往不同,如何求估计量,是关键问题.,常用构造估计量的方法:,(两种),矩估计法和最大似然估计法,.,(1).,矩估计法,复习,2.,样本,k,阶(原点)矩,(,X,为连续型),(,X,为离散型),矩估计法的定义,用,样本矩,来估计,总体矩,用样本矩的,连续函数,来估计总体矩的,连续函数,这种估计法称为,矩估计法,.,矩估计法的具体做法:,矩估计量的观察值称为矩估计值.,例2,设,总体,X的概率密度为,其中,为待估参数,设,是来自X的,一个样本,,求,的矩估计量.,.,解,总体X 的,一阶矩,为,以一阶样本矩,代替上式中的一阶总体矩 ,,从中解出 ,,,,得到,的矩估计量为,例3,设总体X的概率密度为,其中,为待估参数,设,是来自X的一个样本,求,的矩估计量.,解 总体X 的一阶、二阶矩分别为,分别以一阶、二阶样本矩,代替上两式中的,有,从中解得,即得到,的矩估计量为,解,根据矩估计法,例,4,解,例,5,解方程组得到,a,b,的矩估计量分别为,解,解方程组得到矩估计量分别为,例,6,上例表明:,总体均值与方差的矩估计量的表达式,不因不同的总体分布而异,.,一般地,(2).,最大似然估计法,似然函数的定义,最大,似然估计法,似然函数的定义,求最大似然估计量的步骤,:,最大似然估计法是由,费舍尔,引进的.,最大似然估计法也适用于分布中含有多个未知参数的情况.此时只需令,对数似然方程组,对数似然方程,解,似然函数,例,7,这一估计量与矩估计量是相同的.,例8,在例2中求参数,的最大似然估计值,设,是一个样本值.,解 似然函数为,令,解得,注意到,故所求,的最大似然估计值为,这与,的矩估计值,不一样,.,解,X,的,似然函数为,例,9,它们与相应的矩估计量相同.,解,例,10,注:最大似然估计法也适用于分布中含多个未知参数的情形.,两种求点估计的方法,:,矩估计法,最大似然估计法,在统计问题中往往,先,使用最大似然估计法,在最大似然估计法使用不方便时,再,用矩估计法,.,5.2点估计和区间估计,点估计就是用某样本指标直接作为相应总体指标的估计值。,点估计方法虽然简单,但由于未考虑到样本指标与总体指标之间客观存在着的抽样误差,也没有给出估计的概率保证程度,无法确定估计的可靠程度。因此,我们常用区间估计,实践中有许多区间估计的例子。,5.2.1置信概率和置信区间,按一定的概率估计总体参数在哪个范围,这个范围称为总体参数的置信区间。,区间内总体参数出现的概率称为置信概率。,对总体参数,估计其取值范围,对于给定的小概率,有,(,1,,,2,)是参数,的置信区间,为显著性水平,1-为区间估计的置信度或置信水平,即置信概率。它表明判断总体参数落在置信区的可信程度。,1,,,2,分别为参数的下置信限和上置信限。称为舍弃域。,置信区间与置信概率的关系,对于特定总体,总体参数总是一个确定的值,统计量则是一个随机变量。因此,由,1,,,2,所构成的置信区间也是一个随机区间。在所有可能样本指标所构成的所有置信区间中,有的区间可能包括了总体指标,有的可能没有包括。置信度1-的含义是,由全部样本指示所确定的所有置信区间中,有100(1-)%的估计区间包括了总体参数,,另外有100%的区间没有包括总体指标,。而对由某一样本指标所确定的具体估计区间(,1,,2)来说,就是其包含,的可能性(概率)为100(1-)%,不包含,的可能性为,100%。,置信区间的宽窄与置信概率和样本容量有关,它随着不同的置信度和样本容量而变化。置信区间若取得过大,估计精度就差,价值往往不大。而取得过小,需要大量增加样本容量,费力费时。置信区间取多大才算合适,需要根据所研究对象的性质,结合实践经验与专业知识来决定。实际应用中,一般取0.01或0.05,如无特别指出,一般取0.05。,95,求置信区间的一般步骤,(共,3,步),5.2.2总体均值的区间估计,(1)n,30,,总体方差已知时,总体均值的区间估计。,对于给定的置信度1-,有,置信度为1-时总体均值的置信区间,计算公式为:,,,例5.5 根据以往资料,土壤中磷的含量服从正态分布,现对某地土壤进行采样调查,测得9个土壤样品中磷的平均含量为364.3ppm,已知该土壤中磷含量的总体标准差为99.8 ppm,试估计该地土壤中磷中平均含量的95%和99%置信区间。,时,则 的95%置信区间为:,,,=(303.8,429.5),99%置信区间为:,=(278.5,450.1),在报告结果时,可将点估计和区间估计同时写出,如本例95%和99%的置信区间可分别写成364.3(303.8,429.5)ppm和364.3(278.5,450.1)ppm。,如果是非正态总体或总体分布形态未知,当总体方差已知且样本容量,n,充分大时,总体均值的置信区间可按上式近似计算。,(2)总体方差未知时总体均值的置信区间,从正态总体中随机抽样,当样本容量较小且总体方差未知时,根据,t,分布原理,对于给定的置信度1-,有,总体均数值的1-置信区间为,对于非正态总体,只要样本容量,n,足够大,根据中心极限定理,仍可按上式估计总体均数值的置信区间。,当样本容量,n,足够大时,,例5.6 某排污口经100次测试,废水中COD平均为100mg/L,标准差为20 mg/L,试估计该排污口废水中COD值的95%置信区间。,=(96.1,103.9),即该排污口废水中COD值的95%置信区间为96.1103.9 mg/L。,例 5.7 为检查某湖水受汞污染情况,从该湖中随机取9条鱼龄相近的鱼,测得鱼胸肌中汞含量平均为2.01ppm,标准差为0.11ppm,试求该湖鱼胸肌中汞含量的95%及99%置信区间。,=(1.925,2.095),5.2.3 两个总体均值之差的区间估计,1、两总体方差,1,2,和,2,2,已知时 两个总体均值之差的区间估计,来自两个正态总体的样本均值分别为 x,1,和x,2,,其样本容量分别为n,1,和n,2,根据抽样分布原理有,N(0,1),对给定的置信度1-,则有,1-,2,的置信区间为,式中 是x1 x2的抽样分布之,标准差,用 表示 称为两均值之,差的标准误,表示由x,1,-x,2,估计,1,2,的抽样误差。,如果两总体方差未知,当样本n1和n2均足够大时可近似的以样本方差s1 s2代替式中总体方差,计算均值差的置信区间。,2、两总体方差,1,2,和,2,2,未知,但,1,2,=,2,2,时,,,两个总体之差的区间估计,设从方差均为,的两正态总体中随机抽取容量为n1和n2的样本 当未知时,则统计量,给定置信概率为1-,则可得置信区间为,式中t/2,v 为自由度为n1+n2-2时的t临界值,其中,是x1-x2的抽样分布之标准差。称为两均值之差的标准误,表示由 x1-x2估计1-2的抽样误差,3、,两总体方差,1,2,和,2,2,未知,但,1,2,2,2,时,,,两个总体均值之差的区间估计,由于,1,2,2,2,两总体方差不具有齐性,根据抽样分布原理,统计量,服从自由度为n的t分布。,其中,对给的的置信概率 1-,可得其均值差的置信区间为,例 甲乙两地空气中某元素的含量服从正态分布,1,2,=0.013,,2,2,=0.012,从两地抽样测试结果如下 n,甲,=30 x,甲,=0.03 n,乙,=28 X,乙,=0.016,求置信概率我0.95时两地均值之差的置信区间,-0.042,甲,-,乙,0.072,已知某造纸厂废水中悬浮物连续排放服从正态分布,一月份对该厂废水抽样8次,其废水悬浮物含量平均为22.5mg/l,2月份抽样8次测得废水悬浮物平均含量17.8mg/l一月份和2月份测定结果的标准差分别为8.3 和7.6,求两个月废水中悬浮物平均差值的95%置信区间。,根据题意 本例属于总体方差,1,、,2,未知,1,=,2,式中 自由度v=8+8-2=14,=0.05 t,0.05/2,14,=2.415,-3.8,1,-,2,13.2,某县甲、乙两污水渠酚含量属于正态分布甲测定39次其平均含量0.58 标准差s,1,=0.10 乙 测定43次 平均含量0.18 标准差s,2,=0.08 求置信概率95%情况下两污水渠酚平均含量的置信区间,计算得 k=0.633 n=73 t,0.05/2,73,=1.991,0.36,1,-,2,0.44,5.2.4 配对数据平均数差的置信区间,环境科学中 许多问题来自两总体的数据匹配成对出现的。如不同方法或不同处理装置对同一污染物处理效果的比较,同一生物体对不同污染物浓度的反应等。对具有配对数据的两正态总体平均数差的置信区间的求法可采用下述方法。,设来自两正态总体的配对数据分别为x,1k,x,2k,(k=1,2,3.n)它们的差值为d,k,=x,1k,-x,2k,统计量 其中,它是自由度为n-1的t分布。置信概率1-,则配对数据差值d 的置信区间为,两种方法处理油污染的实验数据如下,甲 4.0、5.0、6.0、1.0、5.4、4.1,乙 3.3、7.0、4.4、2.2、3.5、0.7,求配对数据差的置信区间(,=0.05),计算差值 d,k,0.7、-2.0、1.6、-1.2、1.9、3.4,求,n=6-1=5 t,0.05/2,5,=2.571,-1.35,d,2.81,5.2.5总体比率(成数)的区间估计,(1)正态近似法。,根据抽样分布原理,当样本容量,n,足够大时(一般,np,5或,n(,1,p,)5),样本比率,p,近似服从正态分布。,因此可以利用正态分布进行样本比率(成数),p,的统计推断,。,P,,,例 5.10 从某河流随机抽取764份水样,经测定COD超标者162份,超标率为21.2%,试估计该河水COD总体超标率的95%置信区间。,本例,n=,764,,p,=21.2%,,np,5,可用正态近似法估计该河水COD总体超标率的95%置信区间,总体合格率,P,的95%置信区间:,(,),=(0.183,0.241),(2)查表法。,当样本容量,n,较小,特别是,P,接近于0或1时,按二项分布原理确定总体比率的置信区间,其计算过程较繁,附表8列出了二项分布的置信区间临界值,在实际应用中直接由表查出总体比率的置信区间甚为方便。,例5.11 在某废水处理厂出水口随机检测20次,其中有8次超标,试确定超标率的置信区间。,查附表8,在,n=,20横行与,X,=8的纵列交叉处的数值为1964,即该出水口COD超标率的95%置信区间为(19%,64%)。,5.3区间估计必要样本单位数目的确定,抽样调查工作中,抽取的样本单位数越多,则得到的样本资料对总体的代表性就越强,抽样估计的精度及可靠程度也就越高;如果抽样单位数越少,所得到的样本资料对总体的代表性就越差,抽样估计的精度及可靠程度就会越低。,对于特定总体,在确定其必要抽样数目时,主要应考虑允许误差(精度要求),置信水平(可靠程度),人、财、物及时间等因素。,确定必要抽样单位数目应遵循的原则是:在保证抽样推断能达到所要求精度和可靠程度的情况下,抽取适当的样本单位数。,5.3.1估计总体均值时,样本容量的确定,当总体服从正态分布,总体标准差已知时,在简单重复抽样的情况下,,有限总体,在不重复抽样情况下,当总体服从正态分布,而总体标准差未知的情况下,区间估计常用样本标准差,s,代替总体标准差,按,t,分布原理进行。,在简单随机重复抽样情况下,有限总体,在不重复抽样情况下,由于各种抽样组织形式下抽样误差的计算表示方法有所不同,故必要抽样单位数目的计算公式也相应有所不同。,等比例分层抽样时,整群抽样(各群容量相等),等距抽样视同为简单随机不重复抽样,故其必要抽样单位数目按右式计算。,估计总体均值时,确定必要的抽样单位数目,一般与下列因素有关,(1)总体标准差。总体标准差大小与必要抽样数目多少成正比关系。总体内部各单位之间标志变异度越大,则总体标准差越大,必要的抽样单位数目也就要求越多;而总体内部各单位之间标志变异度越小,则总体标准差越小,必要的抽样单位数目也就要求越少。,(2)允许误差,即极限抽样误差。允许误差与必要抽样单位数目成反比。允计误差越大,则精度要求越低,必要抽样数目就要求越少;允许误差越小,则精度要求越高,必要抽样单位数目就要求越多。允许误差是在调查前根据调查对象的性质、调查目的和条件来确定。,(3)置信水平(可靠程度)。估计的可靠程度要求越高,必要抽样单位数目要求越多,可靠程度要求越低,则必要抽样单位数目要求越少。,(4)抽样是否重复。重复抽样与不重复抽样在其他条件完全相同的情况下,必要抽样单位数目有所不同。一般而言,重复抽样需多抽一些样本单位,而不重复抽样可以少抽一些。因为不重复抽样比重复抽样误差要小。,(5)抽样组织形式。不同的抽样组织形式,其估计精度不完全相同,因而必要抽样数目的计算公式也不完全一样。,例 5.13,有300亩稻田,因受酸雨危害减产,已知水稻亩产量,X,N,(),今抽样调查该稻田减产情况。要求置信度达到95%,允许误差不超过3kg,试确定应抽多少亩才合适?,重复抽样,不重复抽样,5.3.2 估计总体比率时,必要抽样单位数目的确定,重复抽样时,必要抽样单位数目为,不重复抽样时,必要抽样单位数目为,以上公式中,由于总体比率是未知的,可用样本比率或历史资料代替,当,P=,0.5时,为最大,故若无法得到,P,时,可直接假定,P=,0.5,以确保达到估计的精度和置信度要求。,例 5.14 某地有人口100万,该地区部分饮用水含氟量偏高,据以往调查情况,氟中毒比率为20%,现欲对该地抽样调查氟中毒情况,若规定允许误差不超过1%,置信度95%,试确定至少应抽查多少人才能满足估计精度和可靠程度的要求?,即至少应抽6147人进行调查才能满足估计精度和可靠程度的要求。,本章小结,抽样推断是利用样本信息估计总体的数量特征的重要方法,具有随机性,估计性、概率性和可以计算与控制的特点。,常见的随机抽样形式有简单随机抽样,分层随机抽样,机械随机抽样,整群随机抽样,阶段抽样。简单随机抽样是根据随机原则直接从总体中抽取样本单位的一种抽样方法,在理论上最符合随机原则,是最基本的随机抽样形式。,总体,X,的概率分布称为总体分布。样本观察值的概率分布称为样本分布。统计量的概率分布被称为抽样分布。统计量的抽样分布是抽样推断的理论基础。,抽样误差是指统计量与相应参数之差。抽样误差的大小通常用标准误来表示。抽样误差主要受样本容量、变异度、抽样组织形式的影响,属随机误差,虽不可避免,但可以计算和控制,这是统计分析的重要任务之一。,参数估计包括点估计和区间估计,作总体均值与总体比率的区间估计,要正确理解置信概率与置信区间的概念。,
展开阅读全文

开通  VIP会员、SVIP会员  优惠大
下载10份以上建议开通VIP会员
下载20份以上建议开通SVIP会员


开通VIP      成为共赢上传

当前位置:首页 > 包罗万象 > 大杂烩

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        抽奖活动

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服