收藏 分销(赏)

第18章 logistic回归分析.ppt

上传人:xrp****65 文档编号:14015075 上传时间:2026-05-27 格式:PPT 页数:56 大小:744.50KB 下载积分:10 金币
下载 相关
第18章 logistic回归分析.ppt_第1页
第1页 / 共56页
第18章 logistic回归分析.ppt_第2页
第2页 / 共56页


点击查看更多>>
资源描述
单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,第十八章,logistic,回归分析,(logistic,regression),1,例,18-1,在研究医院抢救急性心肌梗塞(,AMI,)患者能否成功的危险因素调查中,某医院收集了,5,年中该医院所有的,AMI,患者,共,200,例,研究危险因素为,X1(,抢救前是否休克);,X2(,抢救前是否心衰);,X3(,抢救前是否超过,12,小时)等。,研究目的:分析影响抢救成功的主要因素。,2,P=0(,抢救成功),P=1(,抢救不成功),X1,X2,X3,N,X1,X2,X3,N,0,0,0,35,0,0,0,4,0,0,1,34,0,0,1,10,0,1,0,17,0,1,0,4,0,1,1,19,0,1,1,15,1,0,0,17,1,0,0,6,1,0,1,6,1,0,1,9,1,1,0,6,1,1,0,6,1,1,1,6,1,1,1,6,3,医学研究中常碰到,应变量,的可能取值仅有两个(即,二分类变量,)或多个,如生存与死亡、发病与未发病、阳性与阴性、治愈与未治愈、暴露与未暴露等,.,而我们在研究中,又经常要分析,应变量结果,的产生与哪些因素有关。例如:生存与死亡,发病与未发病,阴性与阳性等结果的产生可能与病人的年龄、性别、生活习惯、体质、遗传等许多因素有关,。,5,如何找出其中哪些因素对结果的产生有显著性影响呢?,显然这类资料不满足多重线性回归的条件。,Logistic,回归分析能较好地解决这类问题。,目的:,作出以多个自变量(危险因素)估计,应变量(,结果因素),的,logistic,回归方程。,资料:,1.,应变量为反映某现象发生与不发生的二值变量;,2.,自变量宜全部或大部分为分类变量,可有少数数值变量。分类变量要数量化。,7,例,18-1,在研究医院抢救急性心肌梗塞(,AMI,)患者能否成功的危险因素调查中,某医院收集了,5,年中该医院所有的,AMI,患者,共,200,例,研究危险因素为,X1(,抢救前是否休克);,X2(,抢救前是否心衰);,X1(,抢救前是否超过,12,小时)等。,研究目的:分析影响抢救成功的主要因素。,8,P=0(,抢救成功),P=1(,抢救不成功),X1,X2,X3,N,X1,X2,X3,N,0,0,0,35,0,0,0,4,0,0,1,34,0,0,1,10,0,1,0,17,0,1,0,4,0,1,1,19,0,1,1,15,1,0,0,17,1,0,0,6,1,0,1,6,1,0,1,9,1,1,0,6,1,1,0,6,1,1,1,6,1,1,1,6,9,用途:,研究某种疾病或现象发生和多个危,险因素(或保护因子)的数量关系。,单因素,用 检验的,局限性,:,只能研究,1,个危险因素,;,只能够定性。,卡方检验,10,outline,Logistic,回归模型的基本结构与建立,条件,logistic,回归,Logistic,回归的应用与注意事项,11,第一节,logistic,回归模型的,基本结构与建立,12,,,在,m,个自变量的作用下阳性结果发生的概率记作,一、,基本概念,13,Logistic,回归模型的构造,若因变量,y,为连续型正态定量变量时,可采用多元线性回归分析,y,与变量,X1,X2,Xp,之间的关系:,y,0,+,1,X,1,+,2,X,2,+,p,X,p,现,y,为发病或未发病,生存与死亡等,定性分类变量,,不能直接用上模型进行分析。,能否用发病的概率,P,来直接代替,y,呢?,p,0,+,1,X,1,+,2,X,2,+,p,X,p,14,等式左边,变化范围,P,发病概率,0 P1,1,P,不发病概率,0 P1,p/1-p,比数,(ratio)0 p/1-p+,ln(p/1-p),对数比,(ratio),-,ln(p/1-p)+,15,Logistic,回归模型为,:,lnP/(1-P)=0+1X1+,pXp,.,定义,:,logit(P,)=lnP/(1-P),为,Logistic,变换,Logistic,回归模型为,:,logit(P,)=0+1X1+,pXp,;,概率,P,:,0,1,,,logit,P,:。,取值范围,16,经数学变换可得,:,概率预报模型,logistic,函数的图形,18,Logistic,回归模型是一种概率模型,它是以疾病,死亡等结果发生的概率为因变量,影响疾病发生的因素为自变量建立回归模型。它特别适用于应变量为二项,多项分类的资料。,在临床医学中多用于鉴别诊断,评价治疗措施的好坏及分析与疾病预后有关的因素等。,19,模,型,参,数,的,意,义,20,流行病学衡量危险因素作用大小的比数比例指标。计算公式为:,优势比,OR,(odds,ratio),21,22,与,logistic,P,的关系,:,23,24,二、,logistic,回归模型的参数估计,参数估计,原理:最大似然,(maximum,likelihood,),估计,25,2,.,优势比估计,可反映某一因素两个不同水平(,c,1,,,c,0,),的优势比,。,对于二分类,26,三、,logistic,回归模型的假设检验,1.,似然比检验,基本思想,:,比较在两种不同假设条件下的对数似然函数值,看其差别大小。,具体方法:先拟合一个不包含待检因素在内的,logistic,模型,求出它的对数似然函数,lnL,0,(,包含,l,个自变量,),然后把需要检验的因素加入,模型中去再配合,得到新的对数似然函数,lnL,1,(,包含,p,个自变量,),,G=1,(,lnL,1,-lnL,0,)服从自由度,=,p-,l,的 分布,既适合单个,自变量的假设检验又适合多个自变量的假设检验(常用于整个模型)。,27,三、,logistic,回归模型的假设检验,2.,大于,3.84,,有统计学意义,比较适合单个自变量的检验,28,例,18-1,在研究医院抢救急性心肌梗塞(,AMI,)患者能否成功的危险因素调查中,某医院收集了,5,年中该医院所有的,AMI,患者,共,200,例,研究危险因素为,X1(,抢救前是否休克);,X2(,抢救前是否心衰);,X1(,抢救前是否超过,12,小时)等。,研究目的:分析影响抢救成功的主要因素。,29,P=0(,抢救成功),P=1(,抢救不成功),X1,X2,X3,N,X1,X2,X3,N,0,0,0,35,0,0,0,4,0,0,1,34,0,0,1,10,0,1,0,17,0,1,0,4,0,1,1,19,0,1,1,15,1,0,0,17,1,0,0,6,1,0,1,6,1,0,1,9,1,1,0,6,1,1,0,6,1,1,1,6,1,1,1,6,30,例,18-1,的参数估计与,Wald,检验结果,logit(P,)=-2.0858+1.1098X,1,+0.7028X,2,+0.9751X,3,31,方法:,前进法、后退法和逐步法,。,检验统计量:,不是,F,统计量,而是似然比统计量、,Wald,统计量和计分统计量之一。,四、自变量筛选,例,18-2,为了探讨冠心病发生的有关危险因素,对,26,例冠心病病人和,28,例对照者进行病例,对照研究,各因素的说明及资料见表,18-1,和表,18-2,。试用,logistic,逐步回归分析方法筛选危险因素。,32,表,18-1,冠心病,8,个可能的危险因素与赋值,33,表,18-2,冠心病危险因素的病例,对照调查资料,34,表,18-3,例,18-2,进入方程中的自变量及有关参数的估计值,学会,看,结果!,35,36,第二节 条件,logistic,回归,37,一、,原理,此时,每一匹配组内病例和对照是可比的,而匹配组间无可比性,.,38,表,18-5 1:,M,条件,logistic,回归数据的格式,*,t,=0,为病例,其它为对照,39,条件,logistic,模型,40,参数估计,原理:最大似然,(maximum likelihood),估计,综合,n,个匹配组后的条件似然函数,:,对,L,取自然对数后,用,Newton-,Raphson,迭带方法求得,参数,j,的估计值,b,j,(j,=1,,,2,,,3,,,m,),41,二、应用实例,42,表,18-7,喉癌,1:2,配对病例,对照调查资料整理表,43,表,18-8,例,18-3,进入方程中的自变量及有关参数的估计值,采用逐步法,6,个危险因素 变量筛选,4,个进方程,结果见表,20-8,。,44,第三节,logistic,回归的应用及注意事项,45,一、,logistic,回归的应用,1,流行病学危险因素分析,logistic,回归得到某一因素的回归系数,b,j,后,可以很快估计这一因素在不同水平下的优势比或相对危险度,非常适用于流行病学研究,(包括病例对照研究、队列研究、横断面研究),。,46,一、,logistic,回归的应用,2,校正混杂因素,流行病学中常存在一些混杂因素,,logistic,可以很方便的控制混杂因素的影响,得到校正后的优势比。,比,Mantel-,Haenszel,应用方便的多。,47,一、,logistic,回归的应用,3,预测与判别,如:通过例,20-1,建立的模型,根据,AMI,患者的危险因素暴露情况,预测,AMI,抢救成功的概率。,对于条件,logistic,回归,常数项得不到估计,不能用于预测。,有的情况下,模型的常数项没有多大实际意义。,对于,病例对照研究,的病例和对照的比例是人为选定的,不能代表自然人群的病例和非病例的比例,因而建立的模型常数项没有实际意义,也不能直接用于预测。,大规模的,队列研究和横断面研究,中,不同暴露层的发病率(或患病率等指标)与研究人群分布一致,常数项才有意义,可用来预测。,48,二、,logistic,回归应用的注意事项,1,、变量的取值形式:,数值变量,转化为有序分类,便于结果解释。,无序分类,为了便于解释,对二项分类变量一般按,0,、,1,编码,一般以,0,表示阴性或较轻情况,而,1,表示阳性或较严重情况。,多分类(,k,个)无序分类常用,k-1,个(,0,,,1,)哑变量代替。,有序分类,可以直接按得分处理,也可以转化为,k-1,个,(,0,,,1,)哑变量,(,dummy variable,),代替。,49,西、中西、中三种疗法哑变量化,原资料,姓名,性别,年龄,疗法,张山,1,50,中西,李四,1,20,西,王五,0,18,中,刘六,0,70,中,赵七,1,35,中西,孙八,0,29,西,哑变量化,姓名,性别,年龄,X1,X2,张山,1,50,0,1,李四,1,20,1,0,王五,0,18,0,0,刘六,0,70,0,0,赵七,1,35,0,1,孙八,0,29,1,0,无序分类资料,分,k,类,转化为,k-1,个(,0,,,1,)哑变量,(,dummy variable),无序分类资料,分,k,类,转化为,k-1,个(,0,,,1,)哑变量,(,dummy variable),b,1,:,相当,A,型相对于,O,型的差别,b,2,:,相当,B,型相对于,O,型的差别,b,3,:,相当,AB,型相对于,O,型的差别,51,b,1,b,2,b,3,分别反映中学、大学、大学以上相对于小学文化程度者经济收入差别的大小,等级资料,将,K,个等级转换为,K-1,个(,0,,,1,)哑变量,(,dummy variable),52,采用此种哑变量赋值方法,主要在于强调参数的解释。,要注意的而是,关于”阳性反映“的定义,如果反应变量,Y,的编码顺序相反,相应的回归系数的绝对值不变,正负号相反。,53,2,、样本含量,样本含量要足够大。,经验上病例和对照人数应各有,30-50,例。,方程中自变量的个数越多,例数越大。,对于配对资料,,n20p,,,p,为自变量个数。,54,3,、多数情况下,模型常数项没有多大意义,不用对其进行参数估计和假设检验,。,55,小结:,1,、,logistic,回归模型参数的意义,2,、,logistic,回归模型的假设检验,3,、逐步回归,4,、条件,logistic,回归,5,、,logistic,回归模型的应用,56,
展开阅读全文

开通  VIP会员、SVIP会员  优惠大
下载10份以上建议开通VIP会员
下载20份以上建议开通SVIP会员


开通VIP      成为共赢上传

当前位置:首页 > 包罗万象 > 大杂烩

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        抽奖活动

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服