ImageVerifierCode 换一换
格式:PPT , 页数:129 ,大小:1.34MB ,
资源ID:14013125      下载积分:10 金币
快捷注册下载
登录下载
邮箱/手机:
温馨提示:
快捷下载时,用户名和密码都是您填写的邮箱或者手机号,方便查询和重复下载(系统自动生成)。 如填写123,账号就是123,密码也是123。
特别说明:
请自助下载,系统不会自动发送文件的哦; 如果您已付费,想二次下载,请登录后访问:我的下载记录
支付方式: 支付宝    微信支付   
验证码:   换一换

开通VIP
 

温馨提示:由于个人手机设置不同,如果发现不能下载,请复制以下地址【https://www.zixin.com.cn/docdown/14013125.html】到电脑端继续下载(重复下载【60天内】不扣币)。

已注册用户请登录:
账号:
密码:
验证码:   换一换
  忘记密码?
三方登录: 微信登录   QQ登录  

开通VIP折扣优惠下载文档

            查看会员权益                  [ 下载后找不到文档?]

填表反馈(24小时):  下载求助     关注领币    退款申请

开具发票请登录PC端进行申请

   平台协调中心        【在线客服】        免费申请共赢上传

权利声明

1、咨信平台为文档C2C交易模式,即用户上传的文档直接被用户下载,收益归上传人(含作者)所有;本站仅是提供信息存储空间和展示预览,仅对用户上传内容的表现方式做保护处理,对上载内容不做任何修改或编辑。所展示的作品文档包括内容和图片全部来源于网络用户和作者上传投稿,我们不确定上传用户享有完全著作权,根据《信息网络传播权保护条例》,如果侵犯了您的版权、权益或隐私,请联系我们,核实后会尽快下架及时删除,并可随时和客服了解处理情况,尊重保护知识产权我们共同努力。
2、文档的总页数、文档格式和文档大小以系统显示为准(内容中显示的页数不一定正确),网站客服只以系统显示的页数、文件格式、文档大小作为仲裁依据,个别因单元格分列造成显示页码不一将协商解决,平台无法对文档的真实性、完整性、权威性、准确性、专业性及其观点立场做任何保证或承诺,下载前须认真查看,确认无误后再购买,务必慎重购买;若有违法违纪将进行移交司法处理,若涉侵权平台将进行基本处罚并下架。
3、本站所有内容均由用户上传,付费前请自行鉴别,如您付费,意味着您已接受本站规则且自行承担风险,本站不进行额外附加服务,虚拟产品一经售出概不退款(未进行购买下载可退充值款),文档一经付费(服务费)、不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
4、如你看到网页展示的文档有www.zixin.com.cn水印,是因预览和防盗链等技术需要对页面进行转换压缩成图而已,我们并不对上传的文档进行任何编辑或修改,文档下载后都不会有水印标识(原文档上传前个别存留的除外),下载后原文更清晰;试题试卷类文档,如果标题没有明确说明有答案则都视为没有答案,请知晓;PPT和DOC文档可被视为“模板”,允许上传人保留章节、目录结构的情况下删减部份的内容;PDF文档不管是原文档转换或图片扫描而得,本站不作要求视为允许,下载前可先查看【教您几个在下载文档中可以更好的避免被坑】。
5、本文档所展示的图片、画像、字体、音乐的版权可能需版权方额外授权,请谨慎使用;网站提供的党政主题相关内容(国旗、国徽、党徽--等)目的在于配合国家政策宣传,仅限个人学习分享使用,禁止用于任何广告和商用目的。
6、文档遇到问题,请及时联系平台进行协调解决,联系【微信客服】、【QQ客服】,若有其他问题请点击或扫码反馈【服务填表】;文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“【版权申诉】”,意见反馈和侵权处理邮箱:1219186828@qq.com;也可以拔打客服电话:0574-28810668;投诉电话:18658249818。

注意事项

本文(多因素方差分析.ppt)为本站上传会员【s4****5z】主动上传,咨信网仅是提供信息存储空间和展示预览,仅对用户上传内容的表现方式做保护处理,对上载内容不做任何修改或编辑。 若此文所含内容侵犯了您的版权或隐私,请立即通知咨信网(发送邮件至1219186828@qq.com、拔打电话4009-655-100或【 微信客服】、【 QQ客服】),核实后会尽快下架及时删除,并可随时和客服了解处理情况,尊重保护知识产权我们共同努力。
温馨提示:如果因为网速或其他原因下载失败请重新下载,重复下载【60天内】不扣币。 服务填表

多因素方差分析.ppt

1、单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,第二章 多因素方差分析概述:,单因素方差分析是检验多个样本均数间差别有无统计学意义的统计学方法。在医学领域中,还经常碰到研究多个因素对某个观察指标的作用的问题。多因素方差分析是分析两个及两个以上因素对观察指标影响的统计方法。,方差分析中,影响观察指标的因素称为因子(,factor);,因子所处的状态称为因子的一个水平(,level of factor);,各因子水平的组合称为处理(,treatment).,一、二因子方差分析,例:,A,、,B,两药治疗缺铁性贫血,12,例,试验结果如下:四种疗法治疗缺铁性贫

2、血后红细胞增加数(,10,12,/L,),疗法,红细胞增加数 总体均数记号,一般疗法,0.8 0.9 0.7,一般疗法加,A,药,1.3 1.2 1.1,一般疗法加,B,药,0.9 1.1 1.0,一般疗法加,A,药加,B,药,2.1 2.2 2.0,本例研究目的,之一,为,A,药的使用是否会引起病人的红细胞数变化。检验,H,01,:,+=+,研究目的,之二,为,B,药的使用是否会引起病人的红细胞数的变化。检验,H,02,:,+=+,研究目的之三为,A,药与,B,药是否有交互作用。所谓有协同作用,是指同时用,A,、,B,两药起的作用大于单独用,A,药和,B,药的作用之和。所谓有拮抗作用,是指同

3、时用,A,、,B,两药起的作用小于单独用,A,药各,B,药的作用之和。,不论协同或拮抗作用均意味着,A,、,B,药同时使用的作用不等于单独作用之和。两药有无协同作用或拮抗作用,只要检验假设:,H,03,:,-=-,或,H,03,:,-=-,例题的统计量,A,药,B,药,不用(,b=1,)用,(b=2),不用,y,111,=0.8 y,121,=0.9,(a=1)y,112,=0.9 y,122,=1.1,y,113,=0.7 y,123,=1.0,用,y,211,=1.3 y,221,=2.1,(a=2)y,212,=1.2 y,222,=2.2,y,213,=1.1 y,223,=2.0,方

4、差分析表,变异来源,SS,df,MS F P,处理间模型,2.9625 3 0.9875 98.75 0.0000,因子,A 1.6875 1 1.6875 168.75 0.0000,因子,B 0.9075 1 0.9075 90.75 0.0000,A,与,B,的交互作用,0.3675 1 0.3675 36.75 0.0000,误差,0.0800 8 0.0100,总的,3.0425 11 0.2766,注意:当因子,A,与,B,间的交互作用有统计学意义时,对,A,(或,B,)的单独作用的解释须小心。本例,用,B,药时,用,A,药病人比不同时用,A,药的病人的红细胞数均数大,不用,B,药

5、时,用,A,药病人比不同时用,A,药的病人的红细胞数均数也大,故可说明,A,药有效。但有时可能出现这种情况,用,B,药时,用,A,药病人比不同时用,A,药的病人的红细胞数均数大,不用,B,药时,用,A,药病人比不同时用,A,药的病人的红细胞数均数小,此时就不能简单地说,A,药有利于病人红细胞数增加,需分别就用,B,药和不用,B,药两种情况说明,A,药的作用。对,B,作用的作用的解释也是如此。,方差分析变异来源:,各自的自由度分别为:,三因子方差分析,例题 某研究者以大白鼠作试验,观察指标是肝重与体重之比(,5%,),主要想了解正氟醚对观察指标的作用,同时要考察用生理盐水和用戊巴比妥作为诱导药对

6、正氟醚毒性作用有无影响,对不同性别大白鼠诱导的作用有何不同,以及对不同性别大白鼠正氟醚的作用是否相同。,A,因子,B,因子,C,因子 肝重与体重之比 总体均数,不用 生理盐水 雌,5.26 5.68 5.83,111,不用 生理盐水 雄,5.00 5.52 5.38,112,不用 戊巴比妥 雌,5.87 5.50 6.20,121,不用 戊巴比妥 雄,6.13 6.46 5.21,122,用 生理盐水 雌,5.42 5.60 5.70,211,用 生理盐水 雄,6.30 7.02 5.90,212,用 戊巴比妥 雌,4.64 4.60 5.44,221,用 戊巴比妥 雄,6.02 5.70 5

7、48,222,方差分析的随机效应模型 方差分析中的因子有选择型与随机型之分,若数据资料中涉及到因子水平是研究者关心的因子水平全体,则该因子属于选择型因子;相应的模型称为固定效应模型。,若数据资料中涉及到因子水平只是研究者关心的因子水平总体的一个样本,则该因子属于随机型因子;若你的研究中有某些因子是随机型因子或全为随机型因子时,方差分析的模型与固定效应模型相同,但关于主效应、和交互效应的假定及,F,统计量的计算公式有些不同。,实例 某医院管理者欲了解血压计与量血压的医生对血压测定结果是否有影响。他在医院中随机抽取,3,台血压计,,4,名医生,对,24,名体检者测量血压,下面是舒张压的观察结果,

8、请作分析。,血压计 医生甲(,b=1,)医生乙,(b=2),医生丙,(b=3),医生丁,(b=4),a=1 60,97 84,63 70,99 74,68,a=2 91,60 85,88 90,74 76,62,a=3 85,67 90,71 65,79 75,96,用随机效应模型作为方差分析时,离均差平方和与自由度的计算与固定效应相同,但无效假设与,F,统计量的计算有所不同。,它们的计算公式为:,方差分析的混合效应模型例题:设某人研究围产期窒息对新生儿中血中次黄嘌呤浓度是否有影响,同时还了解新生出生一小时内次黄嘌呤浓度是否有变化。他随机抽取围产期窒息,9,名,不窒息的正常新生儿,9,名(作为

9、对照)对每组的,9,名新生儿随机安排三个不同时间,测定血中次黄嘌呤浓度如下:,因子,B,因子,A,出生时 出生后,20,分钟 出生后,30,分钟,对照组,6.20 11.50 14.53,5.80 13.37 11.40,8.25 24.10 12.37,围产期,23.06 25.56 10.52,窒息组,21.46 30.40 13.66,11.43 18.19 18.20,用混合效应作方差分析时,离均差平方和与自由度的计算与固定效应相同,但无效假设与,F,统计量不同。它们的计算公式为:,几点说明,1,、每个处理均有观察且有相同观察例数(,n),这种设计称为完全、平衡设计。若每个处理均有观察

10、但观察例数不等,则属于完全、不平衡设计。,2,、方差分析要求观察值独立且服从正态分布,还要求各处理组有相同的方差。在这三个条件中,对独立性要求最严,对正态性要求最宽,当各处理组有相同观察例数时。对方差齐性的要求也不严。,3,、本章仅介绍二因子、三因子方差分析,二因子方差模型中除了各因子的主效应外,还有两因子的一级交互作用项;三因子模型中除了主效应,每两因子的交互效应外,还有三因子的二级交互效应;四因子模型中除主效应,每两因子一级交互效应,三因子的二级交互效应;还有四因子的三级交互作用项;五因子及五个以上的因子的模型以此类推。,协方差分析,检验两个或两个以上均数间差别的显著性,可考虑用方差分析

11、方差分析要求各比较组除了所施加的处理因素不同外,其它对观察指标有影响因素的因素齐同或均衡,即要求控制对观察指标有影响的其它因素。在实际工作中,有时有些因素无法控制或由于实验设计的疏忽、实验条件的限制等原因造成对观察指标有影响的个别因素未加控制或难以控制。如降压药物疗效考核的临床试验中,病人的初始血压水平对服药一段时间后血压下降量有相当的影响,但病人初始血压水平是难以控制的。如果不考虑病人初始血压水平的差异,直接用方差分析的方法比较不同处理组病人的平均血压下降量,以评价药物的降压效果是不恰当。如何在比较两组或多组均数间差别的同时扣除或均衡这些不可控因素的影响,可考虑采用协方差分析方法,协方差分

12、析的基本思想和步骤一、基本思想,协方差分析(,analysis of,covariance,ANCOVA,),是将线性回归分析与方差分析结合起来的一种统计分析方法。在方差分析中,影响观察指标,Y,的因素往往是一些定性变量,而在线性回归分析中,影响,Y,的都是定量变量。协方差基本思想就是将那些定量变量,X,(指未加控制或难以控制)对,Y,的影响看作协变量(,convariate,),,建立应变量,Y,随协变量,X,变化的线性回归关系,并利用这种回归关系把,X,值化为相等后再进行各组,Y,的修正均数(,adjusted mean),间比较的假设检验,其实质就是从,Y,的总离均差平方和中扣除协变量,

13、X,对,Y,的回归平方和,对残差平方和作进一步分解后再进行方差分析,以更好的评价各种处理的效应。,二、应用条件,协方差分析(,analysis of,covariance,ANCOVA,),有两个重要的应用条件:一是与方差分析的应用条件相同;二是各总体客观存在线性回归关系且斜率相同(回归线平行),即要求各样本回归系数,b,本身有统计学意义而各样本回归系数,b,间的差别无统计学意义。因此进行协方差分析时,必须先对样本资料进行方差齐性检验及回归系数的假设检验,若满足这两个条件或经变量变换后满足这两个条件,才可作协方差分析。,完全随机设计资料的协方差分析例 为研究,A,、,B,、,C,三种饲料对猪的

14、催肥效果,用每种饲料喂,8,头猪一段时间,测得每头猪的初始重量(,X,)和增量(,Y,)数据见下表,试分析三种饲料对猪的催肥效果是否相同?,A,饲 料,B,饲 料,C,饲 料,X,1,Y,1,X,2,Y,2,X,3,Y,3,1 15 85 17 97 22 89,2 13 83 16 90 24 91,3 11 65 18 100 20 83,4 12 76 18 95 23 95,5 12 80 21 103 25 100,6 16 91 22 106 27 102,7 14 84 19 99 30 105,8 17 90 18 94 32 110,协方差分析表,离 均 差 平 方 和及 积

15、 和,估 计 误 差,变异来源,L,XX,L,XY,L,YY,MS F,总变异,23 720.50 1080.75 25550.96 22 934.84,组间变异,2 545.25 659.88 1317.58,组内变异,21 175.25 420.87 1238.38 20 22.64 11.38,修正均数,2 707.20 353.60 31.07,随机区组设计资料的协方差分析例 为研究三种饲料对增加大白鼠体重的影响,有人按随机区组设计将初始体重相等的,36,只大白鼠分为,12,个区组,再将每个区组的,3,只大白鼠随机分入,A,、,B,、,C,三种饲料组,但在实验设计时未对大白鼠的进食量加

16、以控制。三组大白鼠的进食量(,X,)和所增体重量(,Y,)数据见下表,试问扣除进食量因素后,三种饲料对增加大白鼠体重有无差别?,A,饲 料,B,饲 料,C,饲 料,X,1,Y,1,X,2,Y,2,X,3,Y,3,1 256.9 27.0 260.3 32.0 544.7 160.3,2 271.6 41.7 271.1 47.1 481.2 96.1,3 210.2 25.0 214.7 36.7 418.9 114.6,4 300.1 52.0 300.1 65.0 556.6 134.8,5 262.2 14.5 269.7 39.0 394.5 76.3,6 304.4 48.8 307

17、5 37.9 426.6 72.8,7 272.4 48.0 278.9 51.5 416.1 99.4,8 248.2 9.5 256.2 26.7 549.9 133.7,9 242.8 37.0 240.8 41.0 580.5 147.0,10 324.9 56.5 340.7 60.3 608.3 165.8,11 356.9 76.0 356.3 102.1 559.6 169.8,12 198.2 9.2 199.2 8.1 371.9 54.3,四,重复测量资料的方差分析,重复测量资料,(repeated measurement data),是同一对象的同一观察指标在不同时间

18、点上进行多次测量所得的资料,常用来分析该指标在不同时间 点上的变化特点。这类资料在临床试验和流行病学研究中常见。,例,9-4,为研究减肥新药盐酸西布曲明片和盐酸西布曲明胶囊的减肥效果是否不同,以及肥胖患者服药后不同时间的体重随时间的变化情况。采用双盲双模拟随机对照试验,将体重指数,BMIf27,的肥胖患者,40,名随机等分成两组,一组给予盐酸西布曲明片,+,模拟盐酸西布曲明胶囊,另一组给予盐酸西布曲明胶囊,+,模拟盐酸西布曲明片。所有患者每天坚持服药,共服药,6,个月,受试期间禁用任何影响体重的药物,而且受试对象行为、饮食及运动与服药前的平衡期均保持一致。分别平衡于,(0,周,),、服药后的,

19、8,周、,16,周、,24,周测定肥胖患者的体重,(kg),见表,9-13,受试对象,j,剂型,k,服药后测定时间,(,周,),0,8,16,24,1,1,84.4,82.8,82.2,83.0,2,1,105.0,100.8,97.4,96.6,3,1,63.8,62.0,61.6,60.4,4,1,86.2,85.5,83.0,81.8,5,1,75.6,73.4,74.0,73.0,6,1,61.2,60.4,60.8,60.2,7,1,67.8,66.0,63.4,63.6,8,1,77.2,73.6,72.6,72.0,9,1,73.2,72.2,72.2,74.6,10,1,65.

20、4,63.6,62.6,60.8,11,1,80.0,77.0,72.4,69.4,12,1,74.4,77.0,75.2,77.4,13,1,82.6,80.4,81.2,79.6,14,1,68.6,65.0,63.2,63.4,15,1,79.0,77.0,73.8,72.5,16,1,69.4,66.8,64.4,60.8,17,1,72.6,71.0,68.2,70.2,18,1,72.4,72.6,72.8,72.6,19,1,75.6,73.4,73.4,72.2,20,1,80.0,78.0,76.4,74.8,21,2,64.4,61.4,61.8,62.0,22,2,91.

21、0,88.4,87.4,89.6,23,2,76.0,76.2,72.8,71.6,24,2,71.0,72.0,69.8,68.4,25,2,69.4,66.6,62.8,60.8,26,2,89.9,87.4,92.6,95.5,27,2,66.8,63.6,62.6,61.6,28,2,63.4,61.2,62.6,62.0,29,2,70.0,67.6,69.8,69.4,30,2,86.6,84.0,81.4,78.0,31,2,90.4,84.4,77.4,71.0,32,2,74.8,73.6,72.8,76.6,33,2,67.4,64.4,61.0,58.2,34,2,84.

22、4,82.2,80.2,75.4,35,2,79.0,76.0,76.5,78.5,36,2,87.4,83.2,81.2,77.2,37,2,68.7,65.8,63.0,66.4,38,2,83.0,81.8,78.4,78.4,39,2,66.5,64.4,63.4,65.4,40,2,64.6,62.6,64.2,62.0,随机区组与重复测量资料的区别主要有二,:,重复测量资料中同一受试对象的数据高度相关,表,9-14,表,9-13,数据的简单相关系数,r(n,=20),2,)重复测量资料中的处理因素在受试对象间为随机分配,但受试对象内的各时间点往往是固定的,不能随机分配;随机区组设计

23、资料中每个区组内的受试对象彼此独立,处理只在区组内随机分配,同一区组内的受试对象接受处理各不相同,(k=1),服药后测定时间,i,服药后测定时间,i(,周,),(k=2),服药后测定时间,I,服药后测定时间,i(,周,),8,16,24,0,0.989,0.971,0.939,0,0.989,0.944,0.850,8,0.986,0.966,8,0.961,0.880,16,0.985,16,0.958,一、离均差平方和与自由度的分解:全部受试对象的结果用,X,ijk,表示,其中,i,表示时间点,j,表示受试对象,,k,表示受试对象的处理因素。,二、重复测量资料方差分析的基本步骤,(,1,)

24、建立假设并建立检验水准,对于因素,K,:,H,0,:不同剂型的减肥总体均数相等,即,1,=,2,H,1,:不同剂型的减肥的总体均数不等或不全相等,对于时间因素,I,:,H,0,:服用减肥药前后不同时间体重的总体均数相等,H,1,:服用减肥药前后不同时间体重的总体均数不等或不全相等,对于交互作用,KI,:,H,0,:服药剂型,K,和时间,I,间无交互效应,即,K,因素与,I,因素无交互作用,H,1,:服药剂型,K,和时间,I,间有交互效应,即,K,因素与,I,因素有交互作用,=0.05,(,2,)计算检验统计量,F,值:,变异来源,SS,df,MS,F,P,(,受试对象间,),(,13163.9

25、810),(39),处理,K,5.9290,1,5.9290,0.017,0.897,个体间误差,13158.0520,38,346.2645,(,受试对象内,),(904.6500),(120),时间,I,384.5300,3,128.1767,28.213,0.000,交互作用,KI,2.1940,3,0.7313,0.161,0.922,个体间误差,517.9260,114,4.5432,总,14068.6310,159,88.4820,(,3,)确定,P,值,做出推断结论本例,按,=0.05,的水准,减肥药剂型,K,、剂型,K,与时间,I,的交互应,KI,均不拒绝,H,0,,无统计学意

26、义,还不能认为盐酸西布曲明不同剂型的减肥效果不同,也不能认为盐酸西布曲明不同剂型和不同时间的交互作用的减肥效果不同。而时间因素,I,拒绝,H,0,接受,H,1,有统计学意义,可认为服用减肥药盐酸西布曲明前后不同时间的平均体重不全相等。,三、重复测量资料方差分析的前提条件 进行重复测量资料的方差分析,除需满足一般方差分析的条件外,还需要特别满足协方差阵(,covariance matrix),的球形性(,sphericity,/circularity),或复合对称性(,compound symmetry),。若球形不对称性质不能满足,则方差分析的,F,值是有偏的,因它增大了第一类错误的概率。球形

27、对称性通常采,Mauchly,检验(,Mauchly,s,test),来判断。,表,9-16,例,9-4,资料的,Mauchly,检验和球对称系数,Mauchly,sW,检验,2,df,p,球对称系数,Greenhousw-Geisser,Huynh-,Feldt,0.0985,85.133,5,0.000,0.4361,0.4573,若按规定的检验水准,=0.10,,拒绝,H,0,,接受,H,1,,则理论上讲应对受试对象内所有变异的自由度进行校正,包括时间效应、处理和时间的交互效应以及个体误差三者的自由度均进行校正。,表,9-17,例,9-4,资料经球对称系数计算机结果,变异来源,df,F,

28、P,校正,df,校正,P,G-G,H-F,G-G,H-F,(,受试对象内,),(120),时间,I,3,28.213,0.000,1.31,1.37,0.000,0.000,交互作用,KI,3,0.161,0.922,1.31,1.37,0.757,0.768,个体间误差,114,49.72,52.13,多元线性回归,多元线性回归,一、此型资料有一个应变量与多个自变量(,M,个自变量)依存在关系,它的基本形式为,Y=B,0,+B,1,X,1,+B,2,X,2,+B,M,X,M,。,B,0,为回归方程的常数项,,B,1,、,B,2,.,B,M,为偏回归系数,(,PARTIAL REGRESSIO

29、N COEFFICIEBT,)。如,B,1,表示在,X,2,、,X,3,.X,M,固定条件下,,X,1,每增减一个单位对,Y,的效应。二、步骤。,1,、建立回归方程。,2,、对总回归方程检验。,3,、,B,进行检验。,多元线性回归方程的建立(利用最小二乘法的原理),总胆固醇 甘油三酯 胰岛素菜 糖化血红蛋白质 血糖,X,1,X,2,X,3,X,4,y,5.68 1.90 4.53 8.2 11.2,3.79 1.64 7.32 6.9 8.8,6.02 3.56 6.95 10.8 12.3,4.85 1.07 5.88 8.3 11.6,4.60 2.32 4.05 7.5 13.4,6.0

30、5 0.64 1.42 13.6 18.3,4.90 8.50 12.60 8.5 11.1,7.08 3.00 6.75 11.5 12.1,3.85 2.11 16.28 7.9 9.6,4.65 0.63 6.59 7.1 9.6,4.59 1.97 3.61 8.7 9.3,4.29 1.97 6.61 7.8 10.6,7.97 1.93 7.57 9.9 8.4,6.19 1.18 1.42 6.9 9.6,6.13 2.06 10.35 10.5 10.9,例,11-2,现有,20,名糖尿病人的血糖(,mmol,/L,)、胰岛素,(,mU,/L),及生长素,(,g,/L),的数据

31、如表,11-9,。试建立多元线性回归方程分析血糖浓度与胰岛素及生长素的数量依存,关系。,三、应用方程中几个问题。,使用注意的问题。(,1,)正态性问题。多元回归模型的前提条件是当前各自变量,X,I,分别取不同值时,,Y,的分布是正态分布,,Y,的不同分布服从方差齐性。如稍偏离以上条件,一般影响不大;但如资料与以上条件偏离较大,则需寻资料作适当的数据转换,使之尽可能满足以上条件,方可进行多元回归分析。,(,2,),N,直的大小 一般是分析因素的,5-10,倍,3,、对资料类型要求数值变量资料。如有少数自变量的观测值为半定量资料,甚至是定性资料时,适当的数据转换也可应用。,4,、多元共线性。在多元

32、线回归模型中,当一个自变量几乎是其他一些自变量的线性组合时,即自变量存在线性相关时,偏回归系数的估计就不稳定,并且会有较大的误差。在医学中经常遇到这种问题。如果相关程度不大,一般影响不大,如相关程度大,则回归方程就不能正确反映自变量和应变量之间本来的数量关系。解决的办法是采用岭回归分析或筛选自变量。,4,、自变量的选择:若自变量间存在多重共线,将引起偏回归系数,j,的最小二乘估计,b,j,的方差过大,从而引起,b,j,失真。其实不仅在发生共线性时需筛选自变量,在一开始数据分析时就有自变量筛选的问题。如何选择自变量呢?主要依赖专业知识,根据研究目的选择尽量少的自变量。,被选自变量一般有这样两种:

33、一是研究目的要弄清它对因变量的作用的影响因素,二是已知对自变量有作用,且观察对象中有变异的,而且可能干扰影响因素,x,对,y,的作用因素。椐专业知识选择自变量的基础上,再借助统计方法进一步筛选自变量。,用统计学方法筛选自变量,首先有准则。一般有残差平方和准则和统计量检验准则。统计量显著性检验准则是通过显著性检验,选择有统计学意义进入自变量子集。常用的有三种:,向前法,后退法,逐步回归法,5,、指标的数量化,1,)自变量为连续变量的情况:通常情况下连续变量是以原始观察值的形式出现。当某个自变量,X,与应变量,Y,间不呈线性关系时,可考虑对,X,作某种变换,以改善回归方程的拟合优度。某种数据转换是

34、否为优,可用确定系数,R,2,作为判断尺度。一个好的数据转换可使,R,2,明显增大。,2,)自变量为无序分类变量的情况:如病人的性别、治疗方式等都可能是影响疾病预后的自变量。为了能将这类信息引入回归方程中,必须对其数量化。数量化方式有多种,如是二分类指标,如对性别变量,X,的赋值方法为:,如果是多分类指标,假定有,K,类,则用,K,1,个取值为,0,或为,1,的哑变量(,dummy variables),能完整地标记出这些类别。如治疗原发性高血压有中医、西医及中西医结合三种不同的疗法,可用两个哑变量,X,1,,,X,1,表示,赋值方法为:,3,)自变量为有序变量:如果自变量是一个有序变量,如将

35、病情分为,“,轻、中、重,”,,用,X,表示病情,赋值方法为:另一个方法是将,X,用两个哑变量表示。,6,、关于逐步回归在自变量较多的情况下,使用逐步回归分析常能使问题得到简化,较快得到结果。但必须指出:对逐步回归结果不要盲目信任,所谓的,“,最优,”,回归方程并不一定是最好,没有选入方程的变量未必没有统计学意义。事实上,方程上中引入什么变量,理想的做法应该由研究者结合问题本身和专业知识以及经验来确定,不加分析地使用逐步回归难以取得好的应用效果。,7,、变量间的交互作用当某一自变量对应变量,Y,的作用大小与另一个自变量的取值有关时,则两个变量有交互作用。回归方程中是否要考虑交互作用主要靠专业知

36、识。为检验两个变量是否有交互作用,普遍作法是在方程中加入它们的乘积项。,8,、回归方程的评价为评价回归方程的拟合效果,应分析回归方程的残差分布,利用残差提供的信息可以检验资料的正态性与方差齐性,并可分析所建立的回归方程是否合适以及对哪些观察点的预报效果较差。残差是指观察值与估计值之差,即。残差分析中一个简单的方法是以标准化残差为纵坐标,以为横坐标作残差图分析。如果以,0,为中心,在恒定区内较均匀地散布在一条直线的上下两侧,可认定同方差的假定成立,如果的分布随的增大而扩散或收敛,则说明同方差的假定不能成立。,LOGISTIC,回归,(,LOGISTIC REGRESSION,),在流行病学中通常

37、是,需要,分析疾病与致病因素的定量关系,如食管癌的发生与吸烟、饮酒、不良饮食等危险因素有关,为正确说明这种关系,需要排除一些混杂因素的影响,传统上常使用,Mantel-,Haenszel,分层分析方法,但这种方法适用于样本量大、分析因素较少的情况。如果用线性回归方法,由于应变量,Y,是一个二值变量(通常取值为,1,或,0,),不满足应用条件,尤其是当各因素都处于低水平或高水平时,预测值可能超过它是一种用于多因素分析的曲线模型(即,S,型曲线模型,适用于应变量为离散的分类资料)。,01,范围,出现不合理现象。用,logistic,回归分析则可较好地解决上述问题,当前医学常用的应变量为两项分类资

38、料的,LOGISTIC,回归。按设计类型分为条件,LOGISTIC,回归,用于处理配对病例,对照研究资料;非条件,LOGISTIC,回归,用于对例研究与非配对病例,对照研究资料。当然也用于多项分类资料。,二分类模型,一个,受试单位或个体的分类变量,Y,取值为两个可能数值之一,为方便起见用,1,和,0,表示(如,患病,Y=1,,否,Y=0,)。,Y=,出现阳性结果的概率记为,P,(,Y=1,);出现阴性结果的概率为,1-P,(,Y=0,),或简记为,1-P,,用,LOGISTIC,回归模型表示出现阳性结果的概率为:,P=EXP,(,+,1,X,1,+,m,X,m,),/(1+EXP,(,+,1,

39、X,1,+,m,X,m,),),出现阴性结果的概率为:,1-P=1/,EXP,(,+,1,X,1,+,m,X,m,),那么,P/1-P=EXP,(,+,1,X,1,+,m,X,m,),两边取对数称为,:,LOGIT,(,P,),=+,1,X,1,+,m,X,m,模型的基本性质:设,为,0,,,1,为,1,,就得最简单的,LOGISTIC,回归,P=1/1+e,-x,,,实际上是它的截距,它越小曲线越左移。它越大曲线越右移。如果,1,为负值,就为,X,增加时,P,反而下降,这反映暴露因素是保护因素而不是危险因素,如果,1,为正值时,暴露因素为危险因素。,比数(,Odds,)、,Logit(In,

40、Odds),与比值比,(Odds Ratio),:,以,P,为某事件发生的概率,,1-P,为不发生某事件的概率,两者的比值为叫做比数,也叫优势,比数若大于,1,说明发生的可能性大于不发生的可能性,也就是说发生占优势;反之,比值小于,1,说明不发生占优势。比数的自然对数值,LnP/1-P,,叫做,Logit,,即,LogitP,,它也可写作为,LogitP,=+,1,X,1,也可用,Odds=e,+,1,X,1,在流行病学中往往有两个组,如暴露组与未暴露组,这两个组的比数的比值,叫做比值比(,Odds Ratio,也简称为,OR,)。如对比某一因素两个不同暴露水平,x,1,=,c,j,与,x,j

41、c,0,的发病情况,其优势比的自然对数为:,特殊地,如果,X,j,赋值为则暴露组与非暴露组发病的优势比为,Or,j,=,exp,j,.,对于发病率很低的慢性疾病如心脑血管病、恶性肿瘤等,由于,p1,,优势比可以作为相对危险度的近似估计,即:,参数估计 根据一组实际观察资料估计,Logistic,回归模型的参数时,通常用最大似然估计(,maximum likelihood,estimate,MLE,),即建立一个样本函数根据最大似然原理,在一次抽样中获得现样本的概率应该最大,也即似然函数,L,应该达到最大。为简化计算,通常取函数的对数形式它所采用,Newton-,Raphson,迭代方法使对

42、数似然函数达最大,此时就可求出,0,、,1,、,2,。,m,的估计值,b,0,、,b,1,、,b,2,。,m,m,,及标准误。,优势比估计:由以下公式就可求出某个因素两个不同水平(,C,0,,,C,1,)优势比的估计值为:,OR,j,的可信区间可利用,b,j,的抽样分布来估计,在样本含量较大时,它近似正态分布。若自,X,j,只有暴露与非暴露两个水平,则优热势比的可信区间估计公式为:,例下表是一个研究吸烟、饮酒与食管癌关系的病例对照资料,试作,Logistic,回归分析,吸烟饮酒观察例数阳性数阴性数,X,1,X,2,n d,n-d,0 0 199 63 136,0 1 170 63 107,1

43、0 101 44 57,1 1 416 265 151,随访资料的生存分析,对生存资料的分析称为生存分析。所谓生存资料就是描述寿命或者一个发生时间的数据。更详细的说一个人的生存时间的长短与许多因素有联系的,研究因素与生存时间的联系有无及程度大小,称为生存分析。,一、基本概念,1,、失效事件与起始时间,在生存分析随防研究过程中,一部分研究对象可观察到死亡,可以得到准确的生存时间,它提供的信息是完全;这种事件称为,失效事件,(,failure event),也称之为,死亡事件,、,终点事件,。起始事件(,initial event),是反映生存时间起始特征的事件,如疾病确诊、某种疾病治疗开始、接触

44、毒物等。,2,、截尾数据(,Censored data,)但往往有一部分人或中途失防,或到观察结束时仍存活,对这些人无法知道准确的生存时间,对于这样的观测值,只知道其生存时间大于,而不知道其准确的生存时间。这种数据称为,截尾数据,(,Censored data,)。它提供不完全信息。生产截尾值的原因:,1,)病人失访;,2,)病人的生存期超过了研究的终止期;,3,)在动物实验中,有时事先规定观察期限或动物数,3,、,生存时间生存时间(,survival time),是指任何两个有联系事件之间的时间间隔,常用,t,表示。狭义的生存时间指患某疾病的病人从发病到死亡所经历的时间跨度,广义的生存时间定

45、义为从某种起始事件到终点事件所经历的时间跨度。如急性白血病病人从治疗开始到复发为止之间的缓解期,冠心病病人两次发作之间的时间间隔,戒烟开始到重新吸烟之间的时间间隔,接触危险因素到发病的时间间隔等。生存分析中最基本的问题就是计算生存时间,要明确规定事件的起点、终点及时间的测度单位,否则就无法分析比较。,生存分析这个统计技术可以同时分析有结局的生存数据和没有结局的截尾数据,能较充分地利用资料信息。,如果改变出生,/,死亡的含义,可使生存分析得到更广泛的应用。,如以开始暴露于某病的危险因素代替出生,以发生此病代替死亡可用生存分析来研究暴露于危险因子后在多少月或年内发病概率。再比如,以某病治疗代替出生

46、以死于该病作为死亡,生存分析来研究某病治疗后的生存时间,如此等等。,二、资料收集一)随访内容,1,、明确开始随访的时间如住院时间、确诊时间、开始治疗时间等。,2,、随访结局和终止随防的时间,3,、记录影响生存时间的有关因素二)随访方式,1,、全体观察对象同时接受处理措施,观察到最后一例出现结果,或事先规定的随访截止时间。,2,、全体观察对象在不同时间接受治疗,完成一定数量随访病例后决定随访截止时间,可按事先规定的时间停止随访。,随访资料常见形式示意图,三)生存分析研究的主要内容,1,、描述生存过程,2,、比较生存过程,3,、影响生存时间的因素分析,三、生存分析的基本方法,1,、非参数法非参数

47、法的特点是不论是什么样的分布形式,只根据样本提供的顺序统计量对生存率进行估计,常用的方法有乘法极限法和寿命表法。对于两个及多个生存率的比较,其无效假设只是假定两组或多组总体生存时间分布相同,而不对其具体的分布形式及参数进行推断。,2,、参数法参数的特点是假定生存时间服从特定的参数分布,然后根据已知分布特点对影响生存的时间进行分析,常用的方法有指数分布法、,Weibull,分布法、对数正态回归分布法和,logistic,回归法,3,、半参数法,四、生存率的估计,与生存曲线,1,、小样本生存分析当随访的病例数较少时,不需要根据病人的随访时间对病人分组,生存率的估计采用乘积极限法(,product-

48、limit method,)。该方法由,Kaplan-Meier,提出,故又称,Kaplan-Meier,法。例 一组病人的存活时间(天数)如下,试估计生存曲线,(,带,+,的数据是截尾数据,),。,90 150 210 540 150 270,+,1,、生存率计算,1,)、将生存时间由小到大排列,2,)、计算条件死亡概率及生存概率,3,)生存率,2,、生存率的标准误的计算,3,、生存曲线以生存时间为横轴、生存率为纵轴绘制一条生存曲线,用以描述其生存过程。并根据两条生存曲线的高低,直观比较不同治疗方式之间的生存过程。,3,、中位生存时间中位生存时间(,median survival time)

49、又称为生存时间的中位数,表示刚好有,50%,的个体其存活期大于该时间。计算中位生存时间有两种,即图解法和线性内插法。图解法利用生存图,从纵轴生存率为,0.5,处划一条平行线与生存率曲线相交,然后自交点处划垂线与横轴相交,此交点即为中位生存时间。线性内插法首先找出两生存率,S,(,t,i-1,),和,S,(,t,i,),,使得,S,(,t,i-1,),0.5,,,S,(,t,i,),0.5,,然后计算中位生存时间。,乘积极限法估计生存率计算表,存活时间(天)期初例数 死亡人数 死亡概率 生存概率 生存率 标准误,90,6,1,1/6 5/6,0.8333 0.1521,150 5 2 2/5

50、3/5 0.5000 0.2041,270 3 0 0 1 0.5000 0.2041,210 3 1 1/3 2/3 0.3333 0.1925,540 1 1 1/1 0/1 0.0000,0.0000,生存曲线图,2,、大样本资料的生存分析在样本较大时,随访病例的生存时间常可按年、月、或日进行分组,得出具有若干时间段生存时间数据的频数表。对分组的生存数据可按寿命表法计算生存率。它的计算与小样本的计算基本相同,稍有不同的是:若有截尾数据,则计算条件概率分母用校正人口数,如校正人口数期初人口数,1/2*,截尾例数,术后年数 期内死 期内截 期初观 校正年 死亡 生存,k,年生 标准误,亡人数

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        抽奖活动

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服