资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,第7章 分析化学中数据处理,7.1 标准偏差,(标准差或均方误差),7.2 随机误差正态分布 7.3 少许数据统计处理 7.4 误差传递 7.5 回归分析 7.6 提升分析结果准确度方法,1/58,几个概念(术语),1,、总体(母体),所研究对象某特征值全体。,2,、个体,总体中每一个单元,指全体中一个单位或某一次测定。,3,、样本(子样),从总体中随机抽出一组测量值或指总体一个部分。,4,、样本容量(样本大小),指样本中个体数目,或样本中测量值数目。,2/58,总体、个体、样本、样本容量间关系,当,n,时:,又,n,20,次,,有限次,测量,且无系统误差,当,n,时:,n,20,次,,无限次,测量,且无系统误差,个体,样本平均值,样本容量,总体平均值,样本平均偏差,总体平均偏差,3/58,7.1,标准偏差,(标准差或均方误差),7.1.1,总体标准偏差,当,n,时:,测量值,x,对总体平均值偏离用表示。,(,此式应用于,n,,,=,x,T,;无系统误差,),式中:,差方和,(它能更加好地说明数据分散程度),4/58,7.1.2,样本标准偏差,S,(,n,为有限值,普通,20,且无系统误差),一样:,式中,差方和,(即偏差平方和),S,与比较:,(,1,)用 代替了;(,2,)用,n,1,代替了,n,。,式中:,n,-,1=f,自由度,标准偏差计算:,(等效式,可直接利用测量数据计算),5/58,7.1.3,相对标准偏差,(变异系数或变动系数),相对标准偏差,=,(或,1000,),7.1.4,标准偏差(或s)与平均偏差(或 )异同点,1,、无须考虑偏差正负号,2,、(或s)增强了大偏差数据作用,如,P,243,-,二组数据:,可见:,S,3、与关系,统计学证实:,当n时,,=0.8(即),或4=3,(但有书中也有,=0.8 S,或,4 =3S,)。,X,min,X,max,S,数据1,-,0.4,+0.4,0.24,0.28,数据2,-0.7,+0.5,0.24,0.33,6/58,7.1.5,平均值标准偏差,统计学上证实:,(无限次测量),或:,(有限次测量),7/58,可见:,(,1,)且是,S,倍,即:平均值误差按测定次数百分比减小;,(,2,)上式意义:,(,3,)增加测定次数,n,,能够提升测定结果精密度,但实际上增加,n,所取得效果是有限制。,即:,4次测量时:是S1/2倍,9次测量时:是S1/3倍,酬答依次减小,25次测量时:是S1/5倍,8/58,同理:,单次测量 ()与平均值 间也有:,(无限次测量),(有限次测量),9/58,7.2,随机误差正态分布,7.2.1,频数分布,频数(n,i,),每组中出现数据个数,相对频数(或频率),频率密度,以频数(或频率密度)组值范围,作图,得频数(或频率密度)分布,直方图。,(见P,245,-图7-1),10/58,7.2.2,正态分布,(高斯,G.F.Gauss,分布),对上述分析数据进行整理时,数据含有以下特征,:,向某中心值集中趋势;偏离此中心值倾向。,为明确表示数据特征,我们通常用两个特征参数来表征一组数据:,(,1,)数据集中趋势,(,2,)数据离散倾向,1,、正态分布曲线,11/58,式中:,y,相当于测量值,x,出现频率密度 (或概率密度),相当于总体平均值,相当于曲线最高点对应横坐标值,表征数据集中趋势,总体标准差,相当于到曲线两拐点之一距离,表征数据分散程度,x,(自变量)个别测量值,x-,代表测量值对偏离,(表征随机误差),12/58,随机误差有以下规律,:,(,1,)单峰性,当,x=,时,(无系统误差时,=x,T,),,,y,max,表达了测量值集中趋势,或,()是最正确值或最可信赖值,;,(,2,)对称性,曲线以,x=,为对称轴,呈,钟形对称,,说明,正负误差出现机率相等,;,(,3,)有界性,当,x,+,或,x,时,曲线以,x,轴为渐近线,即:,大误差出现机率小,小误差出现机率大,;,(,4,)当,x=,时,概率密度,测量值落在,dx,范围内概率,13/58,当,时,数据分散,分布曲线平坦,(矮胖),;当,时,数据集中,分布曲线尖锐,(高瘦),。,当,相同,不一样时,,曲线形状一致,而位置发生左(或右)移,,所以大小代表数据集中于何处。,(,5,)所以只要、确定之后,分布曲线便确定下来,,这种分布曲线,记作:,14/58,2,、标准正态分布曲线,为一方便求出某区间概率,将横坐标进行变量代换,。,定义:,(即:以为单位来表征随机误差),则:,概率即,这么曲线称之,标准正态分布曲线,,,记作,N,(,0,,,1,),15/58,标准正态分布曲线特征是,:,(,1,)当,X=,时,,y,有极值,当,=1,时,(,2,)正负误差出现机会均等;,(,3,)大误差出现概率小,小误差出现概率大。,16/58,7.2.3,随机误差区间概率,实际分析工作中,对误差有两类问题需回答:,(,1,)某一给定范围测定,这些测定出现机会是多少?,(,2,)为确保测定有一定把握,这些测定误差能够要求在什么范围内?,以上这些问题回答都要知道,误差区间概率,,,(即概率密度积分),17/58,正态分布曲线,y,与横轴所夹面积表示全部数据出现概率总和,显然:,曲线与横轴间所夹面积=正态分布密度函数在,x,+区间积分值,,它代表了各种大小偏差本样值出现概率总和。,18/58,或:,某范围内测量值出现,概率,=该部分面积/总面积,或:取不一样,u,值对 积分得到。,P,248,-表7-2为:,积分值即,概率,单边值。,19/58,注意:,(,1,)表中积分值上下限为,0,u,(单边),若考虑,|,u,|,时,应将积分值,2,(双边),,一样:,若考虑,|,u,|,以外概率,=1,2P,(双边)或,u,概率,=0.5,P,。,(,2,)由此表可,计算,随机误差或测量值出现在某区间内(或外)概率。,(3)此表另一个应用:,能够从概率倒过来找误差界限(范围),20/58,可见:,随机误差超出3测量值出现概率很小(仅0.3%),,普通这么极端值可舍弃(所以常将3称之随机误差极限值)。,随机误差出现区间(双边),测量值(x=u)出现区间(双边),概,率,=,1,x=,1,0.34132=0.6826,=,1.96,x=,1.96,0.95,=,2,x=,2,0.4773,2=0.955,=,2.58,x=,2.58,0.99,=,3,x=,3,0.4987,2=0.997,21/58,例,1,:,某年全国参加高考学生化学成绩平均值为,=75,分,,=10,分,若满分为,100,分,总分为,120,分,计算:高于,100,分和不及格(低于,60,分)学生概率。,解:,x,=,u,x,=100,时:,x,=60,时:,查,P248-,表,7-2,知:,|,u,|=2.5,时,,P=0.4938,|,u,|=1.5,时,,P=0.4332,。,高于,100,分学生概率为:,0.5000-0.4938=0.062,低于,60,分学生概率为:,0.5000-0.4332=0.0668,22/58,例,2,:,求测量值落在区间(-,0.7,,,+0.7,)概率。,解:,,,x,=,u,当,u,=0.7,时,,查,P248-,表,7-2,知,:,P=0.2580,求得其概率,P=,0.2580,2=0.5160=51.6%,例,3,:,求测量值落在(-,0.4,,,+1.0,)区间概率,解:,|,u,1,|=0.4,时,,查,P,248,-,表,7-2,知:,P=0.1554|,u,2,|=1.0,时,,查,P,248,-,表,7-2,知,:,P=0.3413,求得其概率,P=,0.1554+0.3413=0.4967,(,49.67%,),可见:当两区间宽度相等时,测量值落在对称区间概率大于不对称区间概率,这种现象对正态分布来说是普遍。,23/58,例,4,:,某班学生,117,个数据基本遵从正态分布,N,(,66.62,(,0.21,),2,),求测量值落在(,66.15,67.04,)中概率。,解:,=66.62,,,=0.21,,而,当,x,1,=67.04,时,,,查得,P,1,=0.4773,当,x,2,=66.15,时,,,查得,P,2,=0.4861,P,=0.4773+0.4861=0.9634,(,96.34%,),同理:落在,66.15,67.04,以外概率,=1,-,96.34%=3.66%,(,4%,),理论上约有,1173.66%=4.28=4,个数据落在上述范围以外,(事实也如此),,故:这批数据确实符合正态分布。,24/58,7.3 少许数据统计处理,只有当n时,这时才能准确无误地找到,显然,这是做不到,实际工作中,包括测量数据通常不多,此时得到 总带有一定不确定性,因为,x,T,不知,所以是算不出来。若以 代替,x,T,,以,S,代替,,而又按理论上正态分布来处理实际问题,是不合理,甚至可能得到错误判断。,为了处理用统计方法处理有限次测量数据,并能合理地推断总体特征问题,,英国统计学家兼化学家戈塞特(W.S.Gosset)以笔名“student”发表了其研究工作,提出,在统计处理少许试验数据时,为了赔偿以S代替带来误差,能够依据测量数据多少,用另一数值“t”代替“,u,”,,这一代替和赔偿方法称之,“t分布”或“学生氏t”法。,25/58,7.3.1 t 分布曲线,在进行有限次测量时,用S代替所带来误差,用一新量“t”来赔偿。,t 值定义为:,(对应 ),注:有些书中定义:,在t分布曲线中:纵坐标,概率密度,横坐标,t值。,0.4,26/58,可见:,当n时,t分布正态分布。同理:t分布曲线下某区间面积也表示随机误差在该区间内概率。,t分布中,t值随概率和f值改变。,(不一样概率和f值对应t值,见P,250,-表7-3),注意:,(1)表中:P置信度,(置信概率),,它表示在某t值时,测量值,x,落在ts范围内概率,(或代表我们相信测量值,x,误差不超出ts把握);,(2)显著性水准,(危险率),:它表示测量值,x,落在ts以外概率,显然:=1P;,(3)当f时,tu,(当f=20时,t与u已很靠近),。,27/58,7.3.2平均值置信区间,分析测量结果可表示为:,(或:=xts),=x,ts,或,=x,u,表示,:,在一定置信度时,以测量值x为中心,包含总体平均值在内可靠性范围,置信区间,。,而 或 表示:,在一定置信度下,以样本平均值为中心,包含总体平均值在内可靠性范围,平均值置信区间,。,以上关系式也表明了平均值(或x,T,)与总体平均值关系,即:说明了平均值可靠性。,28/58,例1:,钢中铬百分含量测定,先测两次:1.12,1.15,再测三次:1.11,1.16,1.12。试计算按两次和五次测定数据来表示平均值置信区间(=0.05)。,解:,两次测定:,=1.14(%),S=0.021(%),,,三次测定:,=1.13(%),S=0.022(%),,,可见:,同一置信度下n(f),置信区间;S,置信区间,平均值可靠性,。,29/58,例2,:P,251,-例5。,解:,P=0.90时,=(47.600.09)%,P=0.95时,=(47.600.13)%,可见P,置信区间,P=0.99时,=(47.600.23)%,所以置信概率越高,置信区间就越宽,判断失误机会就越小。反之,则判断失误可能性上升。,统计意义上推断通常不把P定为100%,而,通常将P定为95%或90%。,注意:,对平均值置信区间必须正确了解,如例1中,:(1.130.03)%,表示“在此区间中包含总体平均值把握为95%”,,若了解为“在未来测定中,试验平均值有95%落在(1.130.03)%区间内”是错误。,30/58,7.3.3显著性检验,在定量分析中,当我们取得一系列数据后,必须对这些数据进行正确评价,要必定地回答这些数据是否全部有效,是否存在系统误差,对于比较两种分析方法或两试验室分析结果,或进行各种测定条件下试验等试验结果作出合理判断。所谓“,显著性检验,”就是利用统计方法来检验被处理问题是否存在统计上显著性差异即:,“假设检验”,。,31/58,1、t 检验法,(1)平均值与标准值比较,方法:,如一批数据:n,S,f=n1,并已知标准值。,计算:;查P,250,-表7-3得 ;比较:若 ,则,有显著性差异,(存在系统误差);,若 ,则,无显著性差异,(不存在系统误差),32/58,这类t检验法可应用于以下几个方面:,已知,(如标样标准值),;,已知其理论值,且误差是正态分布,所以此,理论值视为,;,常规分析中,产品规格所定值视作;,已作过一组n20数据,其 可视作,则另一组n值较少数据可与之比较。,33/58,例:,某厂生产复合维生素丸,要求每50g维生素丸中含Fe2400mg,从某次生产中随机抽取部分试样测定五次,得铁含量如:2372,2409,2395,2399,2411,问此产品是否合格?,解,:,n,=5,,f,=4,,查P,250,-表7-3知,:,,无显著性差异,故此产品合格。,34/58,(2)两组平均值比较,方法:,先进行F检验,,,证实两组数据精密度间无显著性差异;,再用t检验,,证实两平均值间无显著性差异。,设:两组测定结果计算:;查P,253,-表7-4F,表,;比较:,若FF,表,,,无显著性差异,,反之,,FF,表,,,有显著性差异;,用t检验法(检验 与 间有没有显著性差异):计算t值:,35/58,式中:,合并标准偏差,比较:,t,与 (f=n,1,+n,2,2),:有显著性差异;,:无显著性差异,(与 间差异由随机误差引发),36/58,2、F检验法,此法经过计算两组数据方差S,2,之比来检验它们之间在精密度上是否存在显著性差异。,如:,若 ,则对应地,计算,(F值总是大于1),比较F与F,表,注意:,(1)进行F检验时,应确定属于单边或双边检验问题,(表中单边P=95%,双边P=90%);,(2)任何结论都是相对、有条件。,37/58,例1:,为判定一分析方法准确度,取含量为100mg某基准物进行了五次测定:100.3,99.2,99.4,100.0,99.7怎样评价此组数据。,解:,查表,,,无显著性差异。,讨论:,=99.7100.0,(低0.3mg),,但S=0.45,且仅测5次,,判断此法不存在负系统误差证据不足。,(此时t=1.5P=80%,即:随机误差出现机会有20%),38/58,例2:,在上例基础上又补充五次测定:99.9,99.4,100.1,99.4,99.6此时结果怎样?,解:,存在显著性差异,(即存在系统误差),39/58,7.3.4异常值取舍,(或可疑值取舍或过失误差判断),1、法(四倍法),(1)原理:,依正态分布,偏差大于3值出现概率小于0.3%,所以认为该偏差属过失误差所致(,属小概率事件,),因为3=4,所以偏差大于4值是属过失误差所致,在有限次测量中,,4,近似为,4,,,所以偏差大于,4,值应舍去。,(2)方法:,除去可疑值(异常值)后,求其余数据 及 ;判断:若 ,则x,异,应弃去,反之则保留。,40/58,2、Grubbs法,方法:,(1),将数据由小至大依次排列,:,x,1,x,2,x,n1,x,n,(2),计算,,S,(全部数据),(3),计算,(4),查表,:T,n,(P256-表7-5),(5),判断,:当TT,n,,则X,异,应舍弃,反之则应保留。,41/58,3、Q检验法,(舍弃商法),方法:,(1),将数据依小至大排列:,X,1,,X,2,,X,n1,,X,n,(2),计算极差,:,R=,x,max,x,min,,即R=,x,n,x,1,(3),计算舍弃商Q,:,(或,),(4),查表,:Q,表,(P,257,-表7-6),(5),判断,:当QQ,表,,则X,异,应舍弃,反之应保留。,42/58,说明:,(1)法较简单,不需表值,易为人们所接收,但此法数据上不严格,因为在 以内或以外测定出现机会是多少是不明确,要找出 分布也很困难;判断中没有联络n值,且先将X,异,排除在外,然后检验,所以极易将有效数据舍弃(因为可疑限得较低),所以,当前使用不多,仅在要求不高,n=48次时使用。,(2)Q法符合统计原理,具直观、计算方便优点,所以常采取,但此法将可疑限订得太高,所以有时会过多保留异常值(仅适于310次测定)。,(3)Grubbs法是当前最合理,舍取效果最好,使用最普通方法,但计算麻烦(,S),当其它方法与Grubbs法发生矛盾时,以后者为主。,43/58,7.4 误差传递7.4.1系统误差传递,1.加减法,和、差绝对误差=各测量值绝对误差和差,如:则:,2.乘除法,积、商相对误差=各测量值相对误差和差,如:则:,3.指数关系,分析结果相对误差=指数倍测量值相对误差,如:则:,4.对数关系,分析结果绝对误差=0.434系数倍测量值相对误差,如:则:,44/58,7.4.2随机误差传递,1.加减法,分析结果方差=各测量值方差总和,如:,则:,2.乘除法,分析结果相对标准差平方=各测量值相对标准差平方总和,如:,则:,3.指数关系,分析结果相对标准偏差=指数倍测量值相对标准偏差,如:则:,4.对数关系,分析结果相对标准偏差=0.434系数倍测量值相对标准偏差,如:则:,45/58,7.4.3极值误差,(极限误差或极差误差法),1.加减法,如:,则:,(极值误差),2.乘除法,如:,则:,46/58,例1:,用一台停点标准差为0.4mg分析天平进行重量分析,称取含银试样,0.g,,得AgCl沉淀,0.2500g,,问在求,Ag%,时,因为,称量时观察停点,所带来,标准差,是多少?,解:,而测定中:试样称量读两次停点;沉淀称量读四次停点(,随机误差传递,),47/58,例2:,某滴定分析用去标液体积为,25.00ml,,其体积测量标准差为,0.05ml,,称量试样,0.g,,其称量,标准差,为,0.4mg,,标液,浓度相对标准偏差,为,0.1%,,试计算,分析结果,相对标准偏差 。,解:,48/58,例3:,电位法测定某一价金属离子活度,若,电势,测定,标准差,为10,3,,求分析结果,S,C,/C。,解:,(当a为氧化态时取+,当a为还原态时取),49/58,7.5 回归分析,7.5.1 一元线性回归方程,如:,一元线性方程,(即回归方程),回归线:,利用最小二乘法确立最正确直线称之,(,线上全部测量值y偏差平方和最小),回归系数:,a、b,1、回归系数确实定,x,自变量,(准确或可准确测量,严格控制),误差较小,y,因变量,(测量值),,总带有误差,设其为e(偏差),回归线模型:,n次测定后得(x,i,,y,i,),i=1,2,3n,50/58,令:,y偏差平方和为Q(总误差),(1),回归线是全部直线中差方和Q最小一条直线。,对(1)中a、b分别求偏微分并令其=0。(2)(3),求得,51/58,由一组(x,i,,y,i,)求得a、b值称之参数a、b预计量(用 表示),它们一旦确定,回归方程便确定,即:,回归直线,(不是任意直线),2、回归直线特点,(1)它必定经过()点,切记,(2)对全部试验点而言,此线误差最小(3)它可能不过任何一个试验点,(与直尺作图习惯不一样),52/58,3、求解回归方程中应注意几个问题,(1)不要过早修约数字,应在取得a、b详细值后再合理修约,(不然 会使有效数字降低很多);,(2)b有效数字位数应与x相等,a与y相等,(最多多一位);,(3)回归计算较烦易错,所以最好验算:,公式,53/58,7.5.2相关系数,1、相关系数,定义:,54/58,r物理意义:,55/58,(1)当r=1时,所以点都在回归直线上,,此时称y与x完全相关,,试验误差=0;,(2)当0|r|1时,(大多如此),,x与y间有相关关系:r0时正相关;r0时负相关。,|r|越靠近1,y与x相关关系越好,点越靠近直线;,(3)当r=0时,回归线平行于x轴直线,,此时b=0,y与x无关,即回归直线无意义,(y改变不随x而改变)。,注意:,(1)在r定义式中:分子永远小于分母,所以r取值范围:0|r|1;(2)r表示y与x间线性相关关系,所以当r很小或r=0时,并不表示y与x间不存在其它相关关系。,56/58,2、相关系数显著性检验,判断变量x与y间是否存在线性关系或说线性关系好不好是相正确,它也能够借用显著性检验来判断。在一定置信度下,只有当rr,表,时,线性关系才有意义(P,264,-表7-7r表),57/58,7.6 提升分析结果准确度方法,1、选择适当分析方法,2、减小测量误差,3、减小随机误差:,适当增加测定次数,4、消除系统误差:,对照试验;空白试验;仪器校准;结果校正。,天平称量,重量、滴定:相对误差0.1%,即天平称量误差0.0001mg,最少应称0.2g,光度法:相对误差,=2%,若称取,0.5g,样,只需称准至,2%,0.5=0.01g(0.001g),则可。,滴定法,相对误差0.1%,而读数0.01ml,所以最少消耗体积=2030ml,光度法,A=0.2,0.8,58/58,
展开阅读全文