收藏 分销(赏)

工程数学新编统计学全套课件电子教案板.ppt

上传人:丰**** 文档编号:11293775 上传时间:2025-07-15 格式:PPT 页数:285 大小:14.58MB 下载积分:25 金币
下载 相关
工程数学新编统计学全套课件电子教案板.ppt_第1页
第1页 / 共285页
工程数学新编统计学全套课件电子教案板.ppt_第2页
第2页 / 共285页


点击查看更多>>
资源描述
,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,Click to edit Master title style,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,概率论,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,工程数学,-,新编统计学,第一章 概述,问题,1,:,什么是统计,问题,2,:,统计方法有哪些特点,引 言,第一章 概述,统计是处理和分析数据的一门学科,数 据,相关知识,有效,信息,1.1,引言,美国的一家电视专栏访问一位孩子得白血病的母亲,他们恰巧住在高压电线附近。主持人提出这样一个问题:白血病与暴露在高压线所产生的磁场有无显著关系?为此美国国家癌症研究中心花费五年时间和,500,万美元进行统计调查,得出的结论是调查的数据不支持白血病与高压线磁场之间有相关关系。,白血病,与高压线,1.1,引言,你相信孩子母亲的诉说,,还是癌症中心的调查数据?,1.1,引言,某社区拟建一所养老院,服务对象为满足一定条件的,65,岁以上的老人,在预算规划时需知道当地居民的预期寿命。为解决这个问题,收集了近十年,65,岁以上老人的死亡资料,并基此得到预期寿命的估计。,寿命预期,观点透视和评论,有大学老师说,“在网上修课的学生,比在教室里修课的学生表现好”;某媒体报导说,“关于就业的调查报告显示,受教育多的人比受教育少的挣的钱要多”。关于这些说法你如何评论?,1.1,引言,这里有个潜在变量的问题。网上修课学生的平均年龄大且底子比较好;受教育多的人平均来说家境比较好。这些都是不可忽略的。,股票价格是经常波动的,而且有时股价的波动是非理性的。下面是中国,A,股市场中三个银行股四天的收盘价(单位:人民币元),时间名称,2002.9.2,2002.11.29,2002.12.26,2003.1.2,浦发银行,12.52,10.37,9.62,9.25,民生银行,12.89,10.94,9.83,8.90,招商银行,10.79,9.21,8.47,8.06,1.1,引言,从以上数据你能否比较这三个银行股在这一时间段内的走势的强弱?,股票价格的波动,统计方法的特点,统计数据是统计研究的出发点,又是统计方法加以实施的载体,而且也是推断结论的唯一实证依据。因此可以说,“一切由数据说话”是统计方法的第一个、也是最重要的特点。,一切由数据说话,1.1,引言,统计方法的第二个特点是:统计分析的结果常常会出错,而且这种错误并非由于方法的误用所引起的,分析结论也会告诉你出错的机会是多少。例如每天的天气预报。当它报告一个结果:明天是晴或是雨时,也会告诉你明天晴的机会是多少。天气预报虽然可能会出错,但谁又会怀疑天气预报的科学性和重要性呢?,1.1,引言,统计方法的特点,统计方法的第三个特点是:统计方法研究和揭示现象之间的数量关系表现层面上的相关关系,但不一定是因果关系(也许,试验型数据的统计分析会有例外,因为有可能通过实验来严格控制其它的潜在因素),1.1,引言,统计方法的特点,1.1,引言,?,统计方法的第四个特点是,使用归纳推理,即选取适合观察结果的假设,由特殊推向一般。统计数据是作为全体研究对象的一部分观察值,选定一组假设或设定一种模型下,基于数据要推断整个研究对象的情况,因此统计推理是归纳推理。统计方法的这一特点使得统计有广泛的应用。,1.1,引言,统计方法的特点,收视率调查,可靠性寿命试验,应用,实例,1.1,引言,随机现象及,统计规律性,随机试验和随机现象,随机性和,规律性,1.2,随机现象及随机规律性,每次试验将会,发生什么结果,是事先无法预,知的试验,与随机试验,相伴的现象,随机试验 随机现象,1.2,随机现象及随机规律性,1.2,随机现象及随机规律性,寿命预期,在一批量很大的同型号产品中,随机抽取,n,件,观察抽到的,n,个产品中的次品数,则可能结果是次品数为,0,件,,1,件,,,,n,件中的一个。,掷骰子,投掷一枚均匀骰子,观察出现朝上一面的点子数,则可能的结果可以是,1,点,,2,点,,,,6,点中的一个。,寿命预期,在一批量很大的同型号产品中,随机抽取,n,件,观察抽到的,n,个产品中的次品数,则可能结果是次品数为,0,件,,1,件,,,,n,件中的一个。,掷骰子,投掷一枚均匀骰子,观察出现朝上一面的点子数,则可能的结果可以是,1,点,,2,点,,,,6,点中的一个。,以上两个试验共同特点:如果重复这种试验,,可能的结果可以各不相同,事前无法预知。,在日常生活中现象随机性的例子可以说比比皆是,但是真正要把握它并不容易。,1.2,随机现象及随机规律性,在人们的潜意识中,由于硬币的均匀性,似乎正反面应该交替出现,因此认为结果(,1,)是随机的,而结果(,2,),(,3,)很不随机。,重复投掷一枚均匀硬币六次,观察出现的面,得到以下三种结果,(,1,)正反正反正反,(,2,)反反反正正正,(,3,)正反反反反反,随机性和规律性,1.2,随机现象及随机规律性,通过对看起来是随机的现象进行统计分析将随机性归纳于可能的规律性中,这是统计思想的重要体现。,不确定性和随机性是统计这门学科的研究对象的,最重要的特性。,近代统计学大师,C.R.Rao,曾说过,统计学就是围绕不确定性的驾驭而发展起来的。,1,变量,2,总体和样本,3,概率,不确定性的度量,概念,1,概率,不确定性的度量,概念,2,变量,概念,3,总体和样本,1.3,统计学中的基本概念,概率是统计学中的一个最基本的概念。,概率是随机事件发生的可能性大小,是不确定性的一种度量。,总是介于,0,到,1,之间的一个数,概率为,0,:,表明该事件几乎不可能发生。,概率为,1,:,表明该事件几乎必然发生。,1.3,统计学中的基本概念,概率,不确定性的度量,部分成绩资料,变量,1.3,统计学中的基本概念,学生姓名,专业,学分,成绩,刘明,力学,3,优,王祥,计算机,3,良,李晓燕,财会,2.5,优,赵伟,文学,2.5,及格,个体:,统计中每个,研究的对象,变量:,人们对个体所,关心的,“,特征,”,总体是研究对象的全体,,是由一个一个的个体组成的,样本是总体的一部分,,是部分个体的特征的观察值。,1.3,统计学中的基本概念,总体和样本,从样本中,获取信息,,对总体,作出结论。,民意调查,一些新闻机构或其他媒体常常要举办民意调查,探询人们对某些公共议题的意见,此处变量即人们对相关问题的回答。,总体,18,岁以上的居民,样本,从总体中挑选出,可能对职业的分布有些要求,其人数在几十到几百人之间。调查方式可以是电话访谈,也可以是座谈,比如他们对某个公共议题的态度,从而得到赞成和反对的百分比。样本提供了总体的信息。,在统计中,一般要求样本具有这样的性质:,即总体中每个个体都有同等机会被包含在样本中,,称这样的样本为随机样本。,1.3,统计学中的基本概念,第二章 数据的描述,统计是寻找现实世界中隐含在数据背后的统计规律性的学科。,通过使用图形、分析数据,我们可以去探寻数据背后隐含的意义。,本章介绍如何利用各种各样的图形和简单的数据运算,来概括数据的某些特征。,注:由于数据来自于总体,所以这些特征一般而言也反映了总体的特征。对数据的描述也是对总体的一个近似的描述。,2.2,简单随机抽样,有放回抽样,从某个总体中抽取容量为,n,的样本(即,n,个个体),每抽取一个个体作测试或观察后放回总体中,然后再随机抽取下一个个体,直到完成要求的,n,次测试或观察为止。,从某个总体中抽取容量为,n,的样本(即,n,个个体),每抽取一个个体作测试或观察后不再放回总体中,然后再随机抽取下一个个体,直到完成要求的,n,次测试或观察为止。,无放回抽样,注:简单随机抽样相当于有放回的抽样。在实际问题中,很多抽样都涉及到对有限总体进行无放回的抽样。如果样本大小,n,远小于总体所含个体的个数,N,(一般认为,当,n1/2,;而当,k,50,时,,P(B),0.97,。也就是说,如有随机产生的,50,人聚集在一起,他们中至少有,2,人同生日的可能性几乎接近,1,。,3.3,概率的性质,条件概率,-,事件关联时的概率计算,3.4,条件概率与,Bayes,公式,已经知道一个事件已经发生条件下,,另一个事件发生的概率:,例,3.10,某网站对已经在,Inter,网上的顾客进行抽样调查,下面是调查数据,3.4,条件概率与,Bayes,公式,每月上网,时间(,h,),性 别,总 和,E4,:女,E5,:男,E1,:,40,小时,450 500,300 800,100 350,950,1,100,450,总数,850 1,650,2,500,目的在研究顾客上网时间是否同性别有关。,此试验的样本空间共有,6,个样本点。今求已经知道为女性顾客,她每月上网,20,40,小时的条件概率,也即求,P(E,2,|E,4,),。,解:注意到调查中,女性顾客有,850,人,而其中上网,20,40,小时的有,300,人(注意不是,1,100,人),因此,乘法规则,3.4,条件概率与,Bayes,公式,例,3.11 (,例,3.10,续)求,P(E,2,|E,4,),解:我们已求出,P(E2|E4,),=0.3529,,;由调查数据,独立性,3.4,条件概率与,Bayes,公式,定义,称事件,A,,,B,是相互独立的,如果,A,发生与否,不影响,B,发生的概率,或者,B,发生与否,不影响,A,发生的概率。,全概率公式与,Bayes,公式,3.4,条件概率与,Bayes,公式,某肥皂公司有二个生产车间,一个在苏州,一个在无锡,但都生产同型号肥皂。苏州生产的肥皂占总数的,60,,而无锡则占,40,。二个车间生产的产品都送到二地之间的一个中心仓库,且产品混合放在一起。从质量检查可知苏州的产品有,5,的不合格;无锡的则有,10,不合格。求:,(1),从中心仓库随机抽出一个产品,求它是不合格品的概率是多少?,(2),从中心仓库随机抽出一个产品是不合格的,又是来自苏州生产的概率是多少?,(3),从中心仓库随机抽出一个产品是不合格的,又是来自无锡生产的概率是多少?,例,3.14,全概率公式,3.4,条件概率与,Bayes,公式,已知可能“原因”发生的概率,求“结果”发生的概率。我们称这一类问题为全概率问题。,设事件 两两互斥,且,又事件,B,满足 ,则有,注:条件的含义是:,B,发生当且仅当,B,与 之一同时发生。,贝叶斯公式,3.4,条件概率与,Bayes,公式,例,3.15,一个盒子装有,6,只乒乓球,其中,4,只是新球。第一次比赛时随机地从盒子中取出,2,只乒乓球,使用后放回盒子。第二次比赛时又随机地从盒子中取出,2,只乒乓球。,试求第二次取出的球全是新球的概率;,已知第二次取出的球全是新球,试求第一次比赛时取的球已含一个新球的概率。,第四章 随机变量及其分布,1,随机变量概念的产生,2,引入随机变量的意义,3,随机变量的分类,一、随机变量概念的产生,在实际问题中,随机试验的结果可以用数量来表示,由此就产生了随机变量的概念,.,1,、有些试验结果本身与数值有关(本身就是一个数),.,例如,掷一颗骰子面上出现的点数;,八月份上海的最高温度;,每天进入一号楼的人数;,昆虫的产卵数;,2,、在有些试验中,试验结果看来与数值无关,但我们可以引进一个变量来表示它的各种结果,.,也就是说,把试验结果数值化,.,正如裁判员在运动场上不叫运动员的名字而叫号码一样,二者建立了一种对应关系,.,这种对应关系在数学上理解为定义了一种实值单值函数,.,X,(,e,),e,.,R,这种实值函数与在高等数学中大家接触到的函数不一样!,(,1,)它随试验结果的不同而取不同的值,因而在试验之前只知道它可能取值的范围,而不能预先肯定它将取哪个值,.,(,2,)由于试验结果的出现具有一定的概率,于是这种实值函数取每个值和每个确定范围内的值也有一定的概率,.,称这种定义在样本空间,S,上的实值单值函数,X,=,X,(,e,),为,随,量,机,变,简记为,r.v.,而表示随机变量所取的值时,一般采用小写字母,x,y,z,w,n,等,.,随机变量通常用大写字母,X,Y,Z,W,N,等表示,有了随机变量,随机试验中的各种事件,就可以通过随机变量的关系式表达出来。,二、引入随机变量的意义,如:单位时间内某电话交换台收到的呼叫次数用,X,表示,它是一个随机变量,.,事件,收到不少于,1,次呼叫,没有收到呼叫,X,1,X,=0,随机变量概念的产生是概率论发展史上的重大事件。引入随机变量后,对随机现象统计规律的研究,就由对事件及事件概率的研究扩大为对随机变量及其取值规律的研究。,事件及,事件概率,随机变量及其,取值规律,我们将研究两类随机变量:,如“取到次品的个数”,,“收到的呼叫数”等,.,随机变量,离散型随机变量,连续型随机变量,例如,“电视机的寿命”,实际中常遇到的“测量误差”等,.,三、随机变量的分类,这两种类型的随机变量因为都是随机变量,自然有很多相同或相似之处;但因其取值方式不同,又有其各自的特点。,随机变量,连续型随机变量,离散型随机变量,解:分析,例,一报童卖报,每份,0.15,元,其成本为,0.10,元,.,报馆每天给报童,1000,份报,并规定他不得把卖不出的报纸退回,.,设,X,为报童每天卖出的报纸份数,试将报童赔钱这一事件用随机变量的表达式表示,.,当,0.15,X,1000 0.1,时,报童赔钱,故,报童赔钱,X,666,报童赔钱,卖出的报纸钱不够成本,4.1,离散型随机变量及其分布,1,离散型随机变量的分布律,2,常用离散型分布,从右图中任取,3,个球,取到的白球数,X,是一个随机变量,(1),X,可能取的值是,0,1,2;,(2),取每个值的概率为,:,看一个例子,一、离散型随机变量分布律的定义,离散型随机变量,如果一个随机变量只可能取有限个或可列无限个值(即它的值域是一个有限集或可列无限集),那么便称这个随机变量为(一维)离散性随机变量。,其中,(,k,=1,2,),满足:,k,=1,2,(,1,),(,2,),离散型随机变量 的分布律,设,x,k,(,k,=1,2,),是离散型随机变量,X,所取的一切可能值,称 为,X,的分布律,用这两条性质,判断一个函数,是否是分布律,解,:,依据分布律的性质,P(,X,=,k,)0,a,0,从中解得,即,例,2,设随机变量,X,的分布律为:,k,=0,1,2,试确定常数,a,.,二、离散型随机变量表示方法,(,1,)公式法,(,2,)列表法,X,例,某篮球运动员投中篮圈概率是,0.9,,求他两次独立投篮投中次数,X,的概率分布,.,解:,X,可取值为,0,1,2;,P,X,=0=(0.1)(0.1)=0.01,P,X,=1=2(0.9)(0.1)=0.18,P,X,=2=(0.9)(0.9)=0.81,一般表示为:,这就是,X,的分布律。,X,例,4.1,一口袋中有,6,个球,在这,6,个球上分别标有,-1,,,-1,,,0,,,0,,,0,,,2,这样的数字。从袋中任取一球,设各个球被取到的可能性相同,求取得的球上标明的数字的分布律。,解:,可能取的值为,-1,,,0,,,2,。由古典概率的定义,可得,因此,X,的分布律为,X,4.1.2,常用离散型分布,1,、(,0-1,)分布:,(也称两点分布),随机变量,X,只可能取0与1两个值,其分布律为:,X,看一个试验 将,一枚均匀骰子抛掷,3,次,.,X,的分布律是:,2.,贝努利试验和二项分布,令,X,表示,3,次中出现“,4”,点的次数,掷骰子:,“,掷出,4,点,”,,,“,未掷出,4,点,”,抽验产品:,“,是正品,”,,,“,是次品,”,一般地,,设在一次试验,E,中我们只考虑两个互逆的,结果:,A,或,.,这样的试验,E,称为,贝努利试验,。,“,重复”,是指这,n,次试验中,P(A)=p,保持不变,将贝努利试验独立地重复地进行,n,次,则称这一串,重复的独立,试验为,n,重伯努利试验。,“,独立”,是指各 次试验的结果互不影响,用,X,表示,n,重伯努利试验中事件,A,发生的次数,则,易证:,(,1,),称随机变量,X,服从参数为,n,和,p,的二项分布,记作,X,B,(,n,p,),(,2,),例,4.3,设有,80%,的人喜欢某项产品,如果随机访问,6,人,记,X,为,6,人中喜欢某项产品的人数,求,X,的分布律;,至少有,4,人喜欢该产品的概率。,解:,易见,,X,服从二项分布,,则,X,的分布律为,所求概率为,例,4.4,设某保险公司的某人寿保险险种有,1000,人投保,每个人在一年内死亡的概率为,0.005,,且每个人在一年内是否死亡是相互独立的,试求在未来一年中这,1000,个投保人中死亡人数不超过,10,人的概率。,当问题中的,n,很大时,二项分布的概率计算很困难。这时,可用其,近似算法,设 ,当,n,很大,,p,很小,且 适中时,有,3.,泊松分布,设随机变量,X,所有可能取的值为,0,1,2,且概率分布为:,其中 是常数,则称,X,服从参数为 的,泊松分布,记作,二项分布的逼近,例,4.6,设某班车起点站上客人数,X,服从参数为 的泊松分布,且起点站上有一个客人与,2,个客人的概率相同,求起点站上至少有,2,个客人候车的概率。,解:,设,,由已知条件得,所求概率为,例如机器包装一袋,500,克的糖,重量在,497,505,范围内都认为机器工作是正常的,一般不会苛求包装重量必须是,500,克。,4.2,随机变量的分布函数,一般地,对于一个随机变量,X,,常常需要知道 的值,其中 。,设,X,是一个随机变量(不论是否位离散型),称定义域为 ,函数值为区间,0,1,上的实值函数,为随机变量的,分布函数,。,分布函数性质,分布函数在,0-1,之间取值,分布函数可以表示随机变量取值某个区间的概率,F(x),是单调不减的,即对任意的,1,对任意一个,右连续,解:,X,可能取的值为,-1,,,0,,,2,,取这些值的相应概率为,F(x),的表达式为,例,4.7,求例,4.1,的随机变量,X,的分布函数,4.3 连续型随机变量及其分布,随机变量可能的取值可充满一个区间(或若干个区间的并),它们可能的取值不能一一列出,连续型随机变量,如果随机变量,X,的分布函数,F(x),对每一,x,可表示为,其中,则称,X,为,连续型随机变量,,,f(x),为,X,的,概率密度函数(简称密度函数),,并称,X,的分布为,连续型分布,。,密度函数具有下列性质:,注:,1,、这两条性质反映了密度函数的本质,即如果一个函数满足上述两条,那么,f(x),一定是某个随机变量的密度函数。,1,、,注:,2,、,2,、,常用结论:,1,、,F(x),是连续函数,且在,f(x),的连续点处有,2,、对任意一个常数,c,,,3,、对任意两个常数,,a,,,b,,,上面的性质,2,表明对连续型随机变量而言,取任一个常数值的概率为,0,,这正是连续型随机变量与离散型随机变量的最大区别。,例,4.8,某种型号的电子管的寿命(以小时计)具有以下的密度函数,求:常数,c,;,一个电子管的寿命超过,5000,小时的概率;,的,X,分布函数,F(x),。,4.3.2,常用的连续型随机变量,1,均匀分布,2,指数分布,3,正态分布,均匀分布,设随机变量,X,的密度函数为,则称服从区间,(,a,b,),上的,均匀分布,,其中,a,,,b,为两个参数,且,a3.54),的值。,5.1,抽样分布,由于 分布,,t,分布,,F,分布这三大统计分布的密度函数和分布函数比较复杂,其分布函数值、密度函数值、分位点的计算都需要通过查表或者利用软件得到。,这三个分布的分位点常表述为 ,其含义如下,5.2,正态总体下的抽样分布,抽样分布基本定理,设 为来自总体 的样本,则有,(a),与 独立,(b),(c),通常 可用作总体方差 的估计,它与 一起构成了最常用的统计量。,注:除了正态总体等少数例外,对一般总体而言,精确的抽样分布很难得到,一般都需要借助于极限分布才可能得到统计量的近似分布。,5.2,正态总体下的抽样分布,单正态总体,双正态总体,为来自总体 的样本,则有:,当 时,有下列结论:,这里,为来自总体 的样本,为来自,总体的样本。,5.3,点估计方法,点估计,点估计是统计推断的一个重要组成部分。几乎所有的统计推断、包括区间估计和假设检验在内,都会用到点估计。点估计也是统计推断的一项基础性工作。,例,5.2,像这类基于样本来估计我们感兴趣的参数的方法就称为点估计方法。,光速的测定,A.A.Michelson,和,S.Newcomb,利用反射镜测量由他们的实验室(位于,Potomac,河)到,Washington Monument,的,7400,米距离光传播所需的时间,得下列,66,个数据:,28 22 36 26 28 28 26 24 32 30 27 24 33 21 36 32 31 25 24 25 28 36 27 32 34 30 25 26 26 25 -44 23 21 30 33 29 27 29 28 22 26 27 16 31 29 36 32 28 40 19 37 23 32 29 -2 24 25 27 24 16 29 20 28 27 39 23,以上记录是以,0.000024800(,秒,),为基准的上下浮动值(如:,28,指,0.000024828,-2,指的是,0.000024798,等)。,假定这种测量方法得到的光速测量值因为随机因素的关系,服从正态分布 问 是多少?,问题?,使用什么样的统计量去估计参数?,可以用样本均值,也可以用样本中位数,还可以用别的统计量,5.3,点估计方法,寻求估计量的方法,贝叶斯方法,最小二乘法,极大似然法,这里我们主要介绍前面两种方法,5.3,点估计方法,矩估计法,矩估计法是英国统计学家,K,.,皮尔逊,最早提出来的,.,由辛钦定理,若总体 的数学期望 有限,则有,矩法,其中 为连续函数,.,注:矩估计法的基本思想是“替换”,即用样本矩代替同阶总体矩。矩估计法的特点是不需要假定总体分布有明确的分布类型。,5.3,点估计方法,现在回到例,5.2,:,设测得的光传播,7400,米所需的时间 ,因 ,所以可得 ,又样本的观测值 ,故可以换算成光速的数学期望的估计为,298072.0524,。,5.3,点估计方法,例,5.3,设有一批同型号的灯管,其寿命(单位:小时)服从参数为 的指数分布,未知。今测试其中的,11,只灯管,得到其寿命的数据如下:,110 184 145 122 165 143 78 129 62 130 168,用矩估计法估计 的值。,解:,由 ,可知 ,而 ,故,矩法的优点,简单易行,并不需要事先知道总体是什么分布,矩法的缺点,当总体类型已知时,没有充分利用分布提供的信息。一般场合下,矩估计量不具有唯一性。,主要原因,建立矩法方程时,选取那些总体矩用相应样本矩代替带有一定的,随意性。,5.3,点估计方法,极大似然法,5.3,点估计方法,它是在总体类型已知条件下使用的一种参数估计方法,.,费歇,在,1922,年重新发现了这一方法,并首先研究了这种方法的一些性质,.,它首先是由德国数学家,高斯,在,1821,年提出的,.,然而,这个方法常归功于英国统计学家,费歇,.,Fisher,Gauss,先看一个简单例子,:,某位同学与一位猎人一起外出打猎,.,一只野兔从前方窜过,.,只听一声枪响,野兔应声倒下,.,如果要你推测,,是谁打中的呢?,你会如何想呢,?,5.3,点估计方法,你就会想,只发一枪便打中,猎人命中的概率一般大于这位同学命中的概率,.,看来这一枪是猎人射中的,.,这个例子所作的推断已经体现了极大似然法的基本思想,.,5.3,点估计方法,极大似然法的原理,是一个定义在上的函数,我们称之为似然函数。直观上,表示由参数产生样本的“可能性”的大小。,设 为来自总体 的样本,则 有联合分布为 ,在此 是固定的,是变元,但如令变元固定在 处,让 变化,则,5.3,点估计方法,极大似然法的原理,如有满足,则 称为 的,极大似然估计,。注意到,只与样本 的观察值 有关,也即 ,所以称,为 的极大似然估计值,简记 为 的,MLE,。,5.3,点估计方法,两点说明,5.3,点估计方法,引入对数似然函数 ,由对数似然函数的凸性,与 有相同的最大值点。所以,可从 中得到 使 达到最大的 ,这个也就是使 达到最大的 。一般通过解方程 来得到 的极大似然估计。,(2),当 关于 不可微或者 没有驻点时,则只能直接求 的极大值点,(1),当 关于 可微时,一般可用如下的方法求,MLE,。,例,5.5,5.3,点估计方法,设 是取自总体,X,的一个样本,其中 未知,似然函数为,由 ,解得 。,于是 的极大似然估计为。,例,5.,(例,5.5,续),5.3,点估计方法,设一升水中含有的大肠杆菌个数 ,其中 未知,。为了检查水消毒设备的效果,从消毒后的水中随机地抽取了,50,次,每次,1,升。化验得到每升水中大肠杆菌个数如表,5.1,所示,试估计平均每升水中大肠杆菌的个数。,解:现在要求 的估计值,的极大似然估计为,即估计每升水中有一个大肠杆菌。,例,5.,5.3,点估计方法,设 是取自正态总体 的一个样本。,当,未知,(),已知时,的极大似然估计量为,。,当 已知,未知,(,),的极大似然估计量为,。,例,5.8,5.3,点估计方法,设 是取自总体的 的样本,未知,,求 的极大似然估计。,解:似然函数,其中,。,由于 在 处间断,且 ,当 时,随着 的减少而递增,因而当 时,达到最大。故 的极大似然估计为 。,5.3,点估计方法,矩法与极大似然法是两种不同的估计方法。对同一未知参数,有时候,它们的估计会相同,有时候,它们的估计完全不同。,一般而言,如果已知总体,X,的分布类型时,最好使用极大似然估计。,矩法与极大似然法的比较,无偏估计的概念,5.3,点估计方法,由于历史的原因,人们常常要求估计量具有无偏性,即若参数 的估计 ,满足 ,则称,T,为 的一个无偏估计。例如样本平均是总体平均值的无偏估计。,无偏性的实际意义是指没有系统性的偏差。,例如,用样本均值作为总体均值的估计时,虽无法说明一次估计所产生的偏差,但这种偏差随机地在,0,的周围波动,对同一统计问题大量重复使用不会产生系统偏差。,5.4,置信区间,前面,我们讨论了参数点估计。它是用样本算得的一个值去估计未知参数,.,但是,点估计值仅仅是未知参数的一个近似值,它没有反映出这个近似值的误差范围,使用起来把握不大。,区间估计正好弥补了点估计的这个缺陷。,区间估计是应用统计工作者常用的一种参数估计方法。这种方法不仅给出了未知参数的近似值,而且给出了这个近似值的误差范围。,5.4,置信区间,例,5.9,某农作物的平均亩产量,X,(单位:,kg,)服从正态分布 ,今随机抽取,20,亩进行试验,观察其亩产量,得值如下:,372 632 634 627 546 483 482 493 423 645,540 417 325 620 427 541 456 423 354 560,我们希望以,95%,的可靠度估计上述亩产量的平均值 与真值 的最大误差是多少?,5.4,置信区间,首先,由例,5.6,(,1,)可知 的极大似然估计为 ,所以 在此例中的估计值为:。由于 ,从而存在 使得,这里的,c,就是可允许的最大误差。,注意到事件 等价于 ,这也就是说,随机区间 覆盖未知参数 有,95%,的机会,习惯上称此随机区间为 的区间估计。,5.4,置信区间,定义,5.1,设 是来自总体 的样本,未知。对于预先给定的 ,若有统计量 使得,则称 为 的双侧 置信区间,为置信水平,一旦样本有观察值 则称相应的 为置信区间的观察值。,注,1,:一般,我们依据不同问题,取置信水平为,0.99,,,0.95,或者,0.90,。,注,2,:有的时候,根据实际问题,我们可能只需要关心未知参数的上限或者下限,这时候,只需要上式中取单边就可以了,比如:,,则称 为 的置信水平为 的置信上限。类似地,可以定义置信下限。,5.4,置信区间,两个要求,5.4.1,一个正态的情形,均值估计,设 为取自正态总体 的样本。,(,1,)若 已知,参数 的 置信区间即为 。这,里用了枢轴变量,(,2,)若 未知,需要将 用它的估计 来代替,则参数 的 置信,区间为 ,这里,枢轴变量为,注:置信区间并不唯一。之所以取两端概率相同的分位点,是因为当涉及的分布为对称分布时,取这样的分位点,可保证得到的置信区间有最短区间长度。,5.4.1,一个正态的情形,例,5.10,为了考察某厂生产的水泥构件的抗压强度(单位:千克力,/,平方厘米),抽取了,25,件样品进行测试,得到,25,个数据,并由此算得,如果我们在抽样前已经从历史上积累的资料中获悉,该厂生产的水泥构件的抗压强度 ,其中 未知,现在希望通过抽样所获得的信息给出 的一个置信度为,0.95,的区间估计。该公式为:,又 ,我们可以通过上述公式很快算出置信区间为,407.16,422.84,。,由此,我们很快得出结论,我们可以以,95%,的可靠程度,保证该厂生产的水泥构件的抗压强度在,407.16,422.84,(,千克力,/,平方厘米,),之间。,5.4.1,一个正态的情形,方差估计,设 为取自正态总体 的样本。,(,1,),若 已知,参数 的 置信区间为,这里用了枢轴变量,(,2,),若 未知,参数 的 置信区间为,这里用了枢轴变量,(,1,),若 已知,参数,的,置信区间即为,这里,,,用了枢轴变量,*5.4.2,二个正态总体的情形,设 为取自 的样本,为取自 的样本,且 与 相互独立,求双正态总体均值差 的 置信区间。,(,2,),若 未知,且 ,参数 的 置信区间为,这里,,用了枢轴变量,*5.4.2,二个正态总体的情形,例,5.11,为了比较用甲、乙两种饲料喂养大白鼠对其体重增加的影响,对,22,只大白鼠进行了试验,得数据如表,5.2,。,表,5.2,大白鼠体重,假定在两种饲料喂养下的大白鼠体重增加量都服从正态分布,且它们的方差相等。在置信水平,0.95,下,试求两种饲料喂养下的大白鼠体重的平均增加量之间差异的双侧置信区间。,饲料,大白鼠体重的增加量(单位:克),甲,7.0 11.8 10.1 8.5 10.7 13.2 9.4 7.9,乙,13.4 14.6 10.4 11.9 12.7 16.1 10.7 8.3 13.2 10.3 11.3 12.9 9.7,*5.4.2,二个正态总体的情形,解:,,,从而,可得水平为,0.95,的 的置信区间的观察值为,第六章 假设检验,基本思想,1,单正态总体检验,2,双正态总体检验,3,非正态总体检验,4,6.1,基本思想,原假设和备选假设,2,否定论证,3,P,值,统计显著性,4,两类错误概率,5,检验问题,1,6.1,基本思想,某盒装饼干厂,其包装广告上称每盒质量为,269,克,但有顾客投诉该饼干质量不是,269,克,为此质检部门从准备出厂的一批饼干中,随机抽出,30,盒,发现其平均质量为,268,克,问该产品的广告是否为虚假广告?,假设:,该广告是真实的,回答:,这个假设是否成立,检验问题,6.1,基本思想,检验问题的特点,检验和估计的差别,假设检验,统计估计,(,A,),抽样前对相关问题已有假设,无事先假设,(,B,),通过抽样回答该假设成立与否,结果是定性的,结果是定量的,6.1,基本思想,原假设,(H,0,),表明总体没有什么变异,不存在所要寻找的效应;,备选假设,(H,A,),表示总体已经发生了变异,出现了所要寻找的效应。,收集数据的目的在于证实总体出现了目标效应(或变异)。,原假设和备选假设,检验者的期望,H,0,H,A,数据,6.1,基本思想,拒绝,支持,6.1,基本思想,小概率事件的实际推断原理,一个小概率事件在一次试验中,是几乎不可能发生的!,6.1,基本思想,否定论证,数据,实际推断原理,拒绝,H,0,假定,H,0,成立,矛盾,6.1,基本思想,定义,p=P(T,比观察值,T,0,更极端,|H,0,),P,值与显著性,显著性,显著,高度显著,若,Z,偏大,表明与,H,0,背离,且在,H,0,下有,6.1,基本思想,检验统计量,令,p,为合格率,待检假设为,某工厂生产的产品,长期以来不合格率不超过,0.01,,某天开工后,为检验生产过程是否正常,随机地抽取了,100,件产品,发现其中有,3,件不合格品,能否认为这天的生产过程是正常的?,产品合格率,6.1,基本思想,总体状态,检验结果,接受,H,0,拒绝,H,0,H,0,成立,正确,第一类错误,H,0,不成立,第二类错误,正确,两起错误概率,显著性水平检验法,1,均值检验,2,方差检验,3,6.2,单正态总体检验,6.2,单正态总体检验,拒绝域,显著性水平检验法,1,拒绝域,R,是样本空间的子集,使得,6.2,单正态总体检验,今,Z=2.01,落入,R,故在 下,,拒绝,H,0,由标准正态分布表,可得,k=1.645,,称,k,为检验的临界值,对给定,在,H,0,:p=0.01,下,ZN(0,1),产品合格率,6.2,单正态总体检验,设,X,未知;从随机抽出,30,盒饼干,测得质量的平均数 ,标准差,s=1.8,。对 ,检验,统计量,结果是显著的,均值检验,2,饼干质量广告,6.2,单正态总体检验,某种品牌杀虫剂的生产商声称其产品将大部分药效至,少保持,6,个月,并且从,0,到,6,个月,其产品的药效下降,幅度的标准差不超过,2,。一消费者从生产商那里购买了,20,罐杀虫剂,先试验每罐药效,然后将其储存了,6,个月,再试验每罐的药效,得到,20,罐杀虫药药效下降的百分比数据如下:(单位,%,),6.5,,,3.5,,,4.4,,,6.0,,,6.6,,,5.4,,,7.9,,,4.6,,,5.4,,,5.7,,,2.5,,,1.1,,,5.9,,,2.7,,,2.3,,,1.4,,,1.8,,,5.8,,,0.2,,,7.1,对,=0.05,检验该杀虫剂的药效下降的百分比是否有更大的变异性(假定下降百分比服从正态分布)?,方差检验,3,6.2,单正态总体检验,对于 ,无理由拒绝,H,0,,但因,p,不大,样本容量,n,相对较小,因此如不能据此接受,H,0,。结论只能是基于当前数据尚无充分理由认为该药效下降的百分比已经有更大变异。为作出正确的判断,可加大样本容量,基于新的数据再作一次补充的检验。,原假设和备选假设为:,(即比生产商声称的有更大的变异性),一个合适的检验统计量为,在,H,0,之下,,我们可以计算,p,值:,6.3,双正态总体检验,方差已知时对均值差的,Z-,检验,1,方差相等的,F,检验,3,方差未知但相等时,对均值差的,-,检验,2,6.3,双正态总体检验,为评估某地区中学教学改革后教学质量情况,分别在,1998,年,,1999,年举行两次数学考试,学生是从该区中学的,17,岁学生中随机抽取,每次,100,个,两次考试的平均得分分别是,63.5,,,67.0,。假定两次数学考试成绩分别服从正态分布 若已知 ,对显著水平,=0.05,检验该地区数学成绩有无提高。,方差已知时对均值差的,Z-,检验,
展开阅读全文

开通  VIP会员、SVIP会员  优惠大
下载10份以上建议开通VIP会员
下载20份以上建议开通SVIP会员


开通VIP      成为共赢上传

当前位置:首页 > 教育专区 > 其他

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        抽奖活动

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服