资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,一 信度的概念,(一)信度的定义,信度是指同一被试在不同时间内用同一测验(或用另一套相等的测验)重复测量,所得结果的一致程度,即一个测验的,稳定性、一致性。,在测量理论中,信度被定义为:一组测量分数的真分数方差与总方差(实得分数的方差)的比率。,第一,,实得分数(X)是真实分数(T)和误差(E)之和。,X=T+E,第二,,X=T+E转换为,方差表示:,S,2,X,=S,2,T,+S,2,E,第三,,信度被定义为:一组测量分数的真分数方差与总方差(实得分数的方差)的比率。,r,xx,=S,2,T,/S,2,X,第四,,真实分数的转换:,S,2,T,=S,2,X,-S,2,E,第五,,r,xx,=1-S,2,E,/S,2,X,3.测量标准误,测量误差分布的标准差,即为,测量的标准误,。,公式为:,注:SE为测量的标准误,S,X,是所得分数的标准差,r,xx,为测验的信度系数,测量的标准误越小,信度越高,反之亦然.,二 信度评估的方法,(一)重测信度,(二)复本信度,(三)分半信度,(四)内部一致性信度,(五)评分者信度,(一)重测信度(test-retest reliability),1.重测信度概念,,也称稳定性系数,主要针对时间变量。,2.采集数据的方法,:对同一组被试间隔一定的时间重复测试一次,求两次得分间的相关系数。,3.时间间隔的确定,:一般为24周,最好不要超过6个月。,(二)复本信度,1.复本信度概念,,也称等值性系数,误差来源是题目取样偏差。(A本与B本),2.数据收集的方法:,被试施测两个内容等值但题目不同的测验,求两次得分间的相关系数。在计算复本信度时,应该有半数的被试先作A本再作B本,另一半被试先作B本再作A本,由此可以抵消施测顺序的效应。,3.重测复本信度:,在不同的时间里施测两个等值的测验(复本),得到的相关就是重测复本信度,也称稳定等值系数。,(三),分半信度(split-half reliability),1.分半信度及计算:,在测验实施后将测验按奇、偶数分为等值的两半,并分别计算每位被试在两半测验上的得分,求出这两半分数的相关系数。,2.,分半法经常会低估信度,必须修正,借以估计整个测验的信度。,分半信度的校正公式,:r,xx,=2r,hh,/(1+r,hh,),注:r,xx,为测验在原长度时的相关系数,r,hh,为一半分数的相关系数,重测信度和复本信度主要是考察测验跨时间的一致性(稳定性)和跨形式的一致性(等值性)。内部一致性信度系数主要反应的是,题目之间,的关系,表示测验能够测量相同内容或特质的程度。,如,EPQ人格测验的各项目之间的同质程度。,(四),同质性信度(homogeneity reliability),同质性信度(homogeneity reliability),1.同质性信度的概念:,同质性信度又称内部一致性信度。指测验的所有题目间性质的一致性,即测得是同一种心理特质或行为。,2.采集数据的方法:,施测一次测验,算出所有测题的得分,求出各题目间的相关。,当各个测题的得分有较高的正相关时,不论题目的内容和形式如何,则测验为同质的。相反,即使所有题目看起来好象测量同一特质,但相关很低或为负相关时,则测验为异质的。,3.,最常看到的同质信度是克伦巴赫(Cronbach)a系数。,(五)评分者信度(scorer reliability),1.评分者信度的概念:,用于测量不同评分者之间的误差。,2.采集数据的方法:,主要,他评量表,。,随机抽取若干份测验卷,由两位评分者按评分标准分别给分,然后再根据每份测验卷的两个分数计算相关,即得评分者信度。,一般要求在成对的受过训练的评分者之间平均一致性达0.90以上,才认为评分是客观的。,当多个评分者评定多个对象,并以等级法记分时,可采用,肯德尔和谐系数,作为评分者信度的估计。,三、信度的意义(信度与测验分数的解释),(一)解释真实分数与实得分数的相关,(二)确定信度可以接受的水平,(三)解释个人分数的意义,(四)比较不同测验分数的差异,(一)解释真实分数与实得分数的相关,信度系数可以解释为总的方差中有多少比例是由真实分数的方差决定的,也就是测验的总变异(总方差)中真分数造成的变异占百分之几。,例如,,r,xx,=0.,90,时,即实得分数中有90%的变异是真实分数造成的,误差造成的只占10%。r,xx,=1时,表示没有测量误差。,值得注意的是,信度系数的分布是,0.001.00的正数范围,表示信度缺乏完全可信。,(二)确定信度可以接受的水平,(参考p352),1.,当r,xx,0.70时,测验不能用于对个人作出评价或预测,而且不能作团体比较;,当0.70r,xx,0.85时,可用于团体比较;,当r,xx,0.85时,才能用来鉴别或预测个人成绩或作为。,2.新编的测验信度应过于原有的同类测验或相似测验.,(三)解释个人分数的意义,其一是估计真实分数的范围;,其二是了解实得分数再测时可能的变化情形。这就是测量标准误的应用。,结合p353公式和事例讲解,计算例题,某被试在智力测验中IQ为100,这是否反映他的真实水平?如果再测一次,他的分数将会改变多少?,已知:该测验的标准差为15,信度系数为0.84。,计算过程:,根据测量标准误公式得出,该测验的SE为:,根据统计学上对于置信区间的规定,大约有95%的可能性落在所得分数1.96的范围内或者说有5的可能性落在此范围外。,即该被试的置信区间为,X,1.96SE。,IQ=1001.966=10011.7688112,因此,该被试的真实IQ应该在88112之间,若再测一次,他的IQ低于88,高于112的可能性不超过5%。,(四)比较不同测验分数的差异,信度在评价两个不同测验的分数是否有明显差异时起着非常重要的作用。,两个不同测验的分数:,两个人不同分数的差别,同一被试在两个测验上的差别。,这就是差异分数的标准误问题,计算公式:,注:S 代表两个测验使用的标准差,r,xx,与r,yy,代表两个测验的分半信度,统计学上,一般要求两个分数的差异程度达到0.05的显著水平,才能承认差别显著的影响,(参考p353),。,计算实例,某被试在韦氏成人智力测验的言语智商为102,操作智商为110。其操作智商是否高于言语智商?,已知:标准差为15,言语智商测验信度为0.87,操作智商测验信度为0.88。,计算过程:,首先计算差异分数的标准误:,其次根据统计学关于置信区间的规定,只有两个测验分数的差异大于1.96SEd时,才有显著差异。,因为,1.96,7.5=14.7,即,该被试在韦氏测验两个半得分的差异高于约14.7分,才能到达5%显著水平。所以,该被试的两个测验分数差异1101028,14.7分表明,差异不显著。,四 影响信度的因素,(一)样本特征,(二)测验长度,(三)测验难度,(四)时间间隔,(一)样本特征,1.样本团体异质性的影响,团体异质程度(水平差异程度)与分数的分布有关,一个团体越异质,其分数分布的范围也就越大,信度系数也就越高.,2.样本团体平均能力水平的影响,(二)测验长度,测验的长度,即测验的数量,也是影响信度的一个因素.,1.测验越长测题取样或内容取样越有代表性。,如:题目范围广泛.,2.测验越长被试的猜测因素影响就越小。即题目上的随机误差会相互抵消.,注意点:测验的长度也要适度(引起被试的疲劳和反感也会降低信度).,通过增加题目提高信度的方法(参考p355):,计算公式:k=r,kk,(1-r,xx,)r,xx,(1-r,kk,),注:k为改变后的量表长度与原来长度之比,r,xx,为原测验的信度;r,kk,为欲提高测验信度。,计算例题,一个包括40个题目的测验信度为0.80,欲将信度提高到0.90,问至少需要增加多少题目?,解答:根据公式:k=r,kk,(1-r,xx,)r,xx,(1-r,kk,),得出:k=2.25,因此,取得0.9的信度,测验长度应为原来的2.25倍,即需要增加402.2540=50个题目。,(三)测验难度,难度与信度不存在简单的对应关系。如果因为难度过大或过小,造成分数范围缩小,可使信度降低。,(四)时间间隔,再测法求信度,间隔时间越短信度系数越大;间隔时间越久,信度系数越低。,
展开阅读全文