资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,第一节 信度概述,一、什么是信度,信度又叫可靠性,是指测量结果的稳定性程度或一致性程度。,一个好的测验必须稳定可靠,即多次测量的结果保持一致,否则便不可信。,任何一种测量,总有或多或少的误差,信度受随机误差的影响。随机误差越大,信度也就越低;随机误差越小,信度就越高。,信度也可看作测量结果受机遇影响的程度。,信度的含义可以从两个层面加以分析:,(1)当我们以同样的测量工具重复测量某项持久性的特质时,是否得到相同的结果?由此可知此一测量工具的稳定性。,(2)测量工具能否减少随机误差的影响,提供某项特质个别差异程度的真实量数?由此可知测量结果的精确性。,由于S,X,2,=S,T,2,+S,E,2,,,所以信度还可表示为:,XX,=(S,X,2,-S,E,2,)/S,X,2,=1-S,E,2,/S,X,2,信度在1(完全可信)与0(不可信)之间,由于真分数的变异数是不能直接测量的,因此信度是一个理论上构想的概念,由于我们无法得到测验的真正信度,我们只能用一些指标对它进行估计。,二、信度系数,大部分的信度指标都以相关系数表示,即用同一被试样本所得的两组资料的相关作为测量一致性的指标,称作信度系数。,要注意三点:,(1)在不同的情况下,对不同样本,采用不同方法会得到不同的信度系数,因此一个测验可能不止一个信度系数。,(2)信度系数只是对测量分数不一致程度的估计,并没有指出不一致的原因。,(3)获得较高的信度系数并不是心理测量追求的最终目标,它只是迈向目标的一步,是使测验有效的一个必要条件。,信度系数达到多高才可以接受呢?,最理想的情况是,XX,=1,但这是办不到的。,一般能力与成就测验的信度系数要求在0.90以上,有的可以达到0.95;,至于性格、兴趣、价值观等人格测验的信度系数,通常在080到085或更高些。,当,XX,0.70时,不能用测验来对个人作评价,也不能在团体间作比较;,当,XX,大于或等于0.70时,可用于团体间比较;,当,XX,大于或等于0.85时,可用于鉴别个人。,任何测验只有包含特定样本的题目,由特定的施测者,对特定的被试,在特定的时间、地点施测,情况不同便会得到不同的分数。由于信度系数总是在特定情况下获得的,因此,只有当一个测验在很多情况下被证实具有较高的信度时,才可以说它是比较可靠的测验。,三、信度的作用,信度系数有两个实际用处:,一是用来解释个人分数的意义,二是用来比较不同测验分数的差异,1信度可以用来解释个人测验分数的意义,由于存在测量误差,一个人所得分数有时比真分数高,有时比真分数低,有时二者相等。理论上我们可对一个人施测无限多次,然后求所得分数的平均数与标准差,这样平均数就是这个人的真分数,标准差就是测量误差大小的指标。,但这在实际上是行不通的。然而,我们可以用一组被试(人数足够多)两次施测的结果来代替对同一个人反复施测,以估计测量误差的变异数。此时,每个人在两次测验中的分数之差可以构成一个新的分布,这个分布的标准差就是,测量的标准误,,是表示测量误差大小的指标。,测量的标准误可用下式计算:,SE=S,X,(1-,XX,),这里,SE,为测量的标准误,S,X,为所得分数的标准差,,XX,为测量的信度。,从式中可以看出,测量的标准误与信度之间有互为消长的关系:,信度越高,标准误越小;信度越低,标准误越大。,根据上公式,知道了一组测量的标准差和信度系数,就可以求出测量的标准误。进一步我们就可以从每个人的实得分数估计出真分数的可能范围,即确定出在不同或然率水准上真分数的置信区间。,人们一般采用95%的或然率水准,其置信区间为:,(X-1.96SE),T,(X+1.96SE),这就是说,大约有95%的可能性真正分数落在所得分数,1.96SE,的范围内,或者5%的可能性落在这范围之外。这实际上也表明了再测时分数改变的可能范围。,例题,在一次测验中有一学生得80分,这是否反映了他们的真实水平?如果再测一次他的分数将改变多少?已知该次测验的标准差为5,信度系数为0.84。,首先计算SE:,SE=5,(1-0.84)=2,T=80,1.96,2=76.0883.92,我们可以说该学生的真正分数有95%的可能性落在76与84分之间。,2信度可以帮助进行不同测验分数的比较,来自不同测验的原始分数是无法直接比较的,而必须将它们转换成相同尺度的标准分数才能进行比较。,例:某班期末考试,张生语文、数学的成绩转换成T分数(平均数为50、标准差为10)分别为65和70,由此我们可以知道张生的数学比语文考得稍好些,但二者差异是否有意义,仍不清楚。,为了说明个人在两种测验上表现的优劣,我们可以用“差异的标准误”来检验其差异的显著性,常用的公式为:,SE,d,=S (2-,XX,-,YY,),公式中,SE,d,为差异的标准误,,S,为标准分数的标准差(如T分数的S=10),,XX,和,YY,分别是两个测验的信度系数。,如上例中,假定此次语文、数学考试的信度分别为0.84和0.91,张生的两个分数差异的标准误为:,SEd=10,(,2-0.84-0.91)=5,若采用95%的置信区间(即.05显著水平),则张生在这两门课上T分数的差异必须达到或超过1.96,SEd=1.96,5=9.8,才能认为二者真有差异。,因为数学的T分数只比语文高5分,所以差异并不显著。,用SE估计个人分数的误差要注意四点:,(1)一个测验有很多可能的信度估计,因而也有同样多的标准误估计,在实际工作中要注意选择最适合某一特殊情况的信度估计来解决问题。,(2)理论假定SE在所有分数水平都一样,但有时高分段与低分段其标准误并不相同。水平高的人与水平低的人在做测量时会有不同的随机误差,受随机误差的影响也不一样。,(3)测验分数是一个人真正分数的最佳估计,但由于存在测量误差,所以必须将测验分数看成以该点为中心上下波动的范围,而不要看成确切的点。这一范围有多宽将取决于测量标准误的大小,最终取决于信度系数。,(4)测量标准误是对测量误差的描绘,用它能对个人真正分数的置信区间作出估计,但用它来估计个人真正水平则可能导致严重错误,因为它没有考虑到系统误差的影响。,第二节 信度的估计方法,信度是反映测量中随机误差大小的指标。由于造成测量的随机误差的方式或来源多种多样,所以信度的估计方法也多种多样。下面所介绍的信度估计方法是分别考察信度的某一方面的,使用时要特别注意它的含义及适用范围。,信度与误差来源,误差来源,信度类型,时间,再测信度(稳定性),内容,复本信度,分半信度(等值性),Alpha系数(同质性),时间和内容,先后施测两个复本,评价者/观察者,评分者信度,一、重测信度,1含义和计算,重测信度(test-retest reliability)指的是用同一个量表对同一组被试施测两次所得结果的一致性程度。,重测信度能表示两次测验结果有无变动,反映测验分数的稳定程度,所以又叫,稳定性系数,。,其计算公式即皮尔逊积差相关公式:,XX,=,(X,X)(Y,Y)/,(X,X),2,.,(Y,Y),2,公式中,,XX,是重测信度,X及,X是第一次测量的实得分数及实得分数的平均值,Y及,Y是第二次测量的实得分数及实得分数的平均值。,什么样的测量要考虑重测信度?,人的多数心理特质如智力、性格等,具有相对的稳定性,因此对这些心理特质的测量,应该前后一致。因此,我们希望得到测验稳定性的证据。,另外,我们还经常要用测验分数对人做预测,此时测验分数的跨时间的稳定性更加重要。,重测信度的优点在于提供有关测验结果是否随时间而变异的资料,作为预测受试者将来行为表现的依据。其缺点是易受学习和记忆的影响。,如果相隔时间太短,则记忆犹在,练习的影响很大,往往造成假性的高相关;如果相隔时间太长,那么身心特质的发展与学习经验的累积等均足以改变测验分数的意义,使相关降低。,一般来说,最适宜的相隔时间随测验的目的和性质而异,少者两周,多者半年。,2使用的前提条件(3个条件),(1)该测验测量的心理特性必须相当稳定。,(2)遗忘和练习的效果基本上相互抵消。,(3)两次测验期间的学习效果没有差异。,学校的各种测验或标准化考试,上面三个假设几乎是无法满足的。因此,一般标准化考试很少用重测法来估计测验的信度。,成人的人格特质一般是稳定的,并且不容易受遗忘、练习、学习的影响,较多用重测法估计信度。,二、复本信度,1含义与计算,任何测验都只是所有可能题目中的一份取样,所以可能编制许多平行的等值测验,叫做复本。,复本信度(alternate-form reliability)就是指用两个复本测验测量同一批被试所得结果的一致性程度。,其大小等于同一批被试在两个复本测验上所得分数的积差相关系数。,两个等值测验可同时连续施测或相距一段时间分两次施测。前者的复本信度又,称等值性系数,,其分数的不一致主要来自,题目取样的差别,,因为两次测验的间隔极短,所以没有时间造成的误差。后一种复本信度又称,稳定性与等值性系数,。因为它把复本法与重测法结合起来,所有影响施测和再施测不一致的因素以及影响平行型不一致的因素都将对它发生影响,因此分数的不一致性最高。可见与稳定性系数和等值性系数相比,稳定性与等值性系数是对信度的最严格的检验,其值最低。,2使用前提条件,首先要有两份或两份以上真正平行的测验。即两测验在题目内容、数量、形式、难度、区分度、指导语、时限、以及所用的例题、公式和测验的其它所有方面都应该相同或相似。若不一致,所得的信度就成了歪曲的估计。,事实上,要编制两份完全等值的测验是不大可能的,即使是很有经验的测验编制者,也只能编制出基本等值的测验。,用复本法估计测验的信度的条件之二便是被试要有条件接受两个测验。这种条件主要取决于时间和经费等几个方面。,对于稳定性与等值性系数,还需要满足重测信度的基本条件。,三、分半信度,分半信度(split-half reliability)指的是将一个测验分成对等的两半,根据所有被试在这两半测验上所得分数的一致性程度。,分半信度系数可以和等值性系数一样解释。因为这两半测验基本上相当于最短时距施测的两个平行的复本,由于只需要对一个测验进行一次施测,考察的是两半题目之间的一致性,所以这种信度系数有时也被称为,内部一致系数,。,虽然分半信度也可当作内部一致性的测量,但我们将归类为等值的特例,与其它等值性测量唯一不同之处是在测验施测后才分成两个。,分半信度的计算:,和等值复本信度的计算方法类似,只不过被试在两半测验上得分的相关系数只是半个测验的信度。由于在其它条件相等的情况下,测验越长,信度越高,因此必须用“,斯皮尔曼布朗公式,”进行校正:,XX,=2,hh,/(1,hh,),式中,XX,为整个测验的信度,,hh,为两半测验分数间的相关系数。,弗朗那根(Flanagan)公式:,XX,=2 1,(S,a,2,+S,b,2,)/S,x,2,公式中S,a,2,和S,b,2,分别表示所有被试在两半测验上得分的变异数,S,x,2,表示全体被试在整个测验上的总得分的变异数。,卢伦(Rulon)公式:,XX,=1,S,d,2,/S,x,2,公式中S,d,2,表示同一组被试在两半测验上得分之差的变异数,其它符号与上公式一样。,2使用的前提条件及范围,分半信度通常是在只能施测一次或没有复本的情况下使用。而且,在使用斯布公式时要求全体被试在两半测验上得分的变异数要相等。当一个测验无法分成对等的两半时,分半信度不宜使用。,由于将一个测验分成两半的方法很多(如:按题号的奇偶性分半、或按题目的难度分半、或按题目的内容分半等),所以,同一个测验通常会有多个分半信度值。,四、同质性信度,1含义,同质性信度(homogeneity reliability)也叫内部一致性系数,它是指测验内部所有题目间的一致性程度。,这里的一致性是指题目分数的一致,而不是题目内容或形式的一致。,题目内部的一致性主要受两方面变异的影响:内容的同质性与所研究的行为的同质性。所以同质性信度就是一个测验所测内容或特质的相同程度。,当一个测验具有较高的同质性信度时,说明测验主要测的是某一单个心理特质,实测结果就是该特质水平的反映。如果一个测验同质性信度不高,则说明测验结果可能是几种心理特质的综合反映,这时,测验的结果不好解释。一种好的办法是把一个异质的测验分解成多个具有同质性的分测验,再根据被试在分测验上的得分分别作出解释。,什么情况下需要考察题目的同质性?,这取决于测量目的,一般用于预测的测验或学绩测验可不考虑同质性。,而在提出或验证某种心理学理论的构想和假设时,却要求对所研究的心理特质或构想作出“纯粹”的测量,否则便不能由测验分数作出意义明确的推论。,可见,同质性测验是发展心理学理论所必需的。,2计算及适用范围,对同质性信度的估计,主要有库理信度、克伦巴赫,系数和荷伊特信度。,(1)库德理查逊公式,库德(G.F.Kuder)和理查逊(M.W.Richardson)提出一种分析题目间一致性以估计信度的方法,最常用的是,K-R20公式:,XX,=K/(K,1)1,(,pi qi)/S,x,2,式中K表示整个测验的题数,,pi,为通过一题目的人数比例,,qi,为未通过一题目的人数比例,,S,x,2,为测验总分的变异数。,K-R20公式仅适用于题目是二分记分(0、1)的测验,即答对一题很一分,答错无分的测验。当各题难度相近的情况下,可用公式K-R21。,K-R21公式:,XX,=K/(K,1)1,(K,pi,qi)/S,x,2,=K S,x,2,X(K,X)/(K,1)S,x,2,式中,pi,为题目的平均通过率,,qi,为未通过率,,X,为测验总分的平均数,其它字母的意义与K-R20相同。,例,张老师在任教班级施测50题的测验(每题对得1分,错为0分),并求出平均分为40分,标准差为6分。该测验的信度是多少?,K-R21公式虽然计算较为简单,但求得的信度系数有低估的倾向,当题目难度相差较大时,偏差更大。,(2)克伦巴赫,系数,库德理查逊公式只适用于答对一题得一分,答错无分的测验,不适用于多重记分的测验。针对这一需要,克伦巴赫(L.J.Cronbach)另创,系数,其公式如下:,=K/(K,1)1,(,Si,2,)/S,x,2,式中为某一项目分数的变异数,其它字母意义与K-R20公式相同。当题目与二分法计分时,,Si,2,=,pi qi,,所以K-R20公式可以当作,系数的特例。,例(见教材P79)某态度量表共7题,100个被试在各题上得分的方差分别是0.81、0.82、0.79、0.83、0.85、0.76、0.77,测验总分的方差为14.00,则此测验的,信度是多少?,(3)荷伊特信度,1941年荷伊特(C.Hoyt)提出用方差分析来衡量测验内部一致性的方法。,一组测验分数的总变异数可划分为三个来源:人与人之间的差别,题目间的差别以及人与题目交互作用的差别。真正变异数可以从人与人之间的差别来估计,测量误差变异数可从人与题目之间的交互作用来估计。荷伊特信度的估计公式为:,XX=1,MS人,题/MS人,式中,MS人,是同人与人间差别有关的均方,,MS人,题,是同人与题目交互作用有关的均方。,(4)因素分析,有些测量学家认为因素分析是决定测验同质性的最好方法。,在测验上,如果一个因素就足以解释所有题目分数的变异时,这个测验就是同质的,假如需要一个以上的因素时,则测验的组成是异质的。,五、评分者信度,1含义及计算,心理测验一般都有一套标准化的评分程序,尤其是客观题,由评分引起的误差变异是可以忽略的。但在教育测量中,有很多测验是无法完全客观记分的。对这些无法进行完全客观记分的测量工具而言,评分者之间的变异也是误差的重要来源之一。如高考的作文题的评分,必然会涉及到评分者的主观判断,受评分者的喜好与水平等的影响。,因此,有必要考察这些,测验的评分者之间评分的一致性程度,即评分者信度,(scorer reliability)。,考察评分者信度的方法:,随机抽取相当份数的试卷,由两位评分者按记分要点分别给分,然后根据每份测验卷的两个分数计算其相关系数,即评分者信度。,一般要求在成对的受过训练的评分者之间平均一致性达到0.90以上,才认为评分是客观的。,第三节 提高测量信度的方法,一、影响测量信度的因素,在测量过程中凡是能引起测量误差的因素都会影响测量信度。,1被试因素:,被试的身心健康状况、应试动机、注意力、求胜心、作答态度等。,2主试因素:,不按规定实施测验,制造紧张气氛,给予特殊的协助,评分主观等。,3测验内容因素:,试题取样不当,内部一致性低,题数过少,题意模糊等。,4测验情境因素:,通风、温度、光线、噪音、桌面好坏等。,除外,以下几个因素会影响信度系数的大小:,1被试样本,(1)整个团体内成员的异质性影响测验信度,。,成员特质分布范围越广(即越异质),其信度系数也越大。,团体异质性不同,分数的标准差也不同。当将测验用于标准差不同的团体时,可用下面的公式推算出新的信度系数:,nn,=1,S,o,2,(1,oo,)/S,n,2,S,o,为信度系数已知的分布的标准差,,S,n,2,为信度系数未知的分布的标准差,,oo,为用于原团体的信度,,nn,为用于异质程度不同的团体时的信度,。,例 一个测验应用于全体小学生的样本(常模样本),其分数的标准差为10,信度系数为0.90,假如将此测验应用于小学五年级,其分数标准为5。其信度系数估计值为多少?,(2)团体的平均水平也会影响测验的信度,。,这是因为,对于不同水平的团体,题目具有不同的难度。每个题目在难度上的微小差异累积起来便会影响信度。,另外,在选择题测验中,对于较年幼或能力较低的被试,分数受猜测影响较大,因此信度相对要低些。一般对这样的被试不宜使用选择题测验。,2题目因素,(1)题目的数量,题目的数量(即测验的长度)也是影响信度系数的一个因素。一般说来,在一个测验中增加同质的题目,可以使信度提高。,增加测验长度的效果可以用斯皮尔曼布朗公式的通式来计算:,KK,=K,XX,/1,(K,1),XX,K,为改变后的长度与原来长度之比,,XX,为原测验的信度,,KK,为测验长度是原来K倍时的信度估计。,例,有一个包括10个题目的测验,信度为0.50,若把测验增加到50个题目,其信度将增加到多少?,题目数量 10 50 100 200 300 400 500,相关系数.50 0.83 0.91 0.95 0.968 0.976 0.980,虽然增加题目可以提高信度,但并不是越多越好,增加测验长度的效果遵循,报酬递减率,。测验过长是得不偿失的,有时还会引起被试的疲劳和反感而降低可靠性。,此外,只有当新题目是与原题目具有同质性时,增长测验才能改进信度。,(2)测验难度,测验的难度与信度间没有简单的关系。但若测验太难或太易,则使测验分数的分布范围缩小,从而使信度降低。这表明,要使信度达到最高,能产生,最广分数分布,的难度水平才是最合适的。,为达到最理想的分数分布,难度水平多高才是最合适的呢?,洛德(Lord)提出在成就测验中,为了保证其可靠性,各类选择题理想的平均难度为:,题目类型 五选题 四选题 三选题 是非题,平均难度 0.70 0.74 0.77 0.85,3间隔时间,以重测法或复本法求信度时,两次测验相隔时间越短,其信度系数越大;间隔时间越长,其它变量介入的可能性越大,受外界影响也越多,信度系数也就越低。,二、提高测量信度的常用方法(略),一个测量的信度受许多因素的影响。为了提高测量的信度应高度控制这些造成分数变异的因素,使误差变异尽可能减少,使个别差异尽可能增大。研究者在评价测量工具的信度与解释测量结果的时候,必须考虑足以影响信度的各种因素,才能确实把握测验分数的意义,在可靠的范围内加以适当的应用。,本章完!,谢谢!,
展开阅读全文