资源描述
,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,单击此处编辑母版标题样式,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,单击此处编辑母版标题样式,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,*,生物信息学概述,一,.,生物信息,蛋白质结构与功能,细胞,染色体,核酸,生物分子信息,生物分子至少携带着三种信息,遗传信息,与功能相关的结构信息,进化信息,生物分子信息的特征,生物分子信息数据量大,生物分子信息复杂,生物分子信息之间存在着密切的联系,遗传信息的载体,DNA,遗传信息的载体主要是,DNA,控制生物体性状的基因是一系列,DNA,片段,生物体生长发育的本质就是遗传信息的传递和表达,DNA,通过自我复制,在生物体的繁衍过程中传递遗传信息,基因通过转录和翻译,使遗传信息在生物个体中得以表达,并使后代表现出与亲代相似的生物性状,2026/10/4,4,蛋白,质,RNA,转录,DNA,翻译,DNA,前体,RNA,mRNA,多肽链,2026/10/4,生命机器的执行者,-,蛋白质,蛋白质,功能,取决于蛋白质的空间,结构,蛋白质结构决定于蛋白质的,序列,(这是目前基本共认的假设),蛋白质结构的信息隐含在蛋白质序列之中。,2026/10/4,DNA,分子和蛋白质分子都含有进化信息,通过比较,相似的蛋白质序列,,如肌红蛋白和血红蛋白,可以发现由于基因复制而产生的分子进化证据。,通过比较来自于不同种属的同源蛋白质,即,直系同源蛋白质,,可以分析蛋白质甚至种属之间的系统发生关系,推测它们共同的祖先蛋白质。,2026/10/4,7,生,物,分,子,信,息,DNA,序列数据,蛋白质序列数据,生物分子结构数据,生物分子功能数据,最基本,直观,复杂,生物信息数据类型,2026/10/4,DNA,核酸序列,蛋白质,氨基酸序列,蛋白质,结构,蛋白质,功能,最基本的,生物信息,维持生命活动的机器,第一部,遗传密码,第二部,遗传密码?,生命体系千姿百态的变化,生物分子数据及其关系,2026/10/4,9,第一部遗传密码已被破译,但对密码的转录过程还不清楚,对大多数,DNA,非编码区域的功能还知之甚少,对于第二部密码,目前则只能用统计学的方法进行分析。破译“第二遗传密码”:即,折叠密码,(,folding code,),从蛋白质的一级结构得到立体结构,即可直接从基因推测其编码蛋白质所对应的生物学功能。破解折叠密码被列为“,21,世纪的生物学”的重要课题。,生物分子数据是宝藏,生物信息数据库是金矿,等待我们去挖掘和利用,2026/10/4,Bioinformatics,,,生物,+,信息,+,学,新兴的交叉学科,Computer,sciences,Mathematical,sciences,Life,sciences,二、生物信息学的概念,定义一:生物信息学是一门收集、分析遗传数据以及分发给研究机构的新学科,(1987),定义二:生物信息学特指数据库类的工作,包括持久稳固的在一个稳定的地方提供对数据的支持,(1994),定义三:采用信息科学技术,对各种生物信息(包括核酸、蛋白质等)的收集、加工、储存、分析、解释的一门学科。,收集、加工、储存:,计算机科学家,分析、解释:,生物学家,三、生物信息学发展简史,(一)前基因组时代的生物信息学,起源于,20,世纪,70-80,年代。这一阶段的主要成就包括核酸和蛋白质序列的初步分析、生物学数据库的建立以及检索工具的开发。,例如,Dayhoff,的替换矩阵、,Neelleman,和,Wunsch,的序列比对及,GenBank,(由美国国立生物技术信息中心建立和维护的核酸与蛋白质序列数据库)等大型数据库的建立,形成了生物信息学的雏形。,1967:Dayhoff,研制出蛋白质序列图集,即后来著名的蛋白 质信息源,PIR,;,1970:Needleman,和,Wunsch,提出了著名的序列比对算法,是生物信息学发展中最重要的贡献;,1978:Gingeras,等人研制了核酸序列中酶切位点识别程序;,1981,:,Doolittle,提出了关于序列模式的概念;,1986:,日本核酸序列数据库,DDBJ,诞生;,1986:,蛋白质数据库,SWISS-PROT,诞生;,1988:,美国国家生物技术信息中心,NCBI,诞生;,1988:,成立欧洲分子生物学网络,(EMBNet),,,EMBL,数据库诞生,(二)基因组时代的生物信息学,以基因组计划的实施为标志的基因组时代(,1990,年至,2001,年)是生物信息学成为一个较完整的新兴学科并得到高速发展的时期。,这一时期生物信息学确立了自身的研究领域和学科特征,成为生命科学的热点学科和重要前沿领域之一。,这一阶段的主要成就包括大分子序列以及表达序列标签 (,expressed sequence tag,,,EST,)数据库的高速发展、,BLAST,(,basic local alignment search tool,)和,FASTA,(,fast alignment,)等工具软件的研制和相应新算法的提出、基因的寻找与识别、电子克隆(,in silico cloning,)技术等,大大提高了管理和利用海量数据的能力。,人类基因组计划开始,(,Human Genome Project,HGP,),人类基因组计划带来了,生物信息学,20,世纪,90,年代,人类基因组计划,(HGP,,,Human Genome Project),目标:整体上破解人类遗传信息的奥秘,由美国,NIH,和能源部提出和带头,美、英、德、法、日、中共同参与的国际合作项目。,完成人全部,24(22+X+Y),条染色体中,3.2109,个碱基对的序列测定,主要任务包括做图(遗传图谱、物理图谱以及转录图谱的绘制)、测序和基因识别,其根本任务是解读和破译生物体的生老病死以及与疾病相关的遗传信息。,基因组,(Genome),:,包含,细胞或生物体,全套的遗传信息的全部遗传物质,包括:,细胞核基因组,DNA,细胞质(线粒体、叶绿体)基因组,DNA,人类基因组:,3.210,9,bp,18,曼哈顿原子弹计划,阿波罗登月计划,人类基因组计划,人类自然科学史上的,3,大计划,At the White House on June 26,Francis Collins(r),Director of the National Human Genome Research Institute,President Clinton,and J.Craig Venter,President of Celara Genomics,lauded the thousands of scientists who contributed to the genome sequence.,21,2001,年,2,月,15,日,Nature,封面,2001,年,2,月,16,日,Science,封面,22,我国对人类基因组计划的贡献,24,human,Arabidopsis,拟南芥,Thermotoga maritima,Escherichia coli,大肠杆菌,Buchnera,sp.APS,Rickettsia prowazekii,Ureaplasma urealyticum,Bacillus subtilis,Drosophila melanogaster,Thermoplasma acidophilum,Plasmodium falciparum,Helicobacter pylori,mouse,Caenorhabitis elegans,rat,Borrelia burgorferi,Borrelia burgorferi,Aquifex aeolicus,Neisseria,meningitidis Z2491,Mycobacterium tuberculosis,数据库中的蛋白质序列,Swiss-prot,:,550,000,条蛋白质序列,29,结构与功能,信号网络,代谢途径,细胞重建,系统重建,基因组,基因,(,三,),后基因组时代的生物信息学,四、生物信息学的研究领域,基因组序列装配,基因识别,基因功能预报,基因多态性分析,基因进化,mRNA,结构预测,基因芯片设计,基因芯片数据分析,疾病相关基因分析,蛋白质序列分析,蛋白质家族分类,蛋白质结构预测,蛋白质折叠研究,代谢途径分析,转录调控机制,蛋白质芯片设计,蛋白质芯片数据分析,药物设计,大规模核酸测序及拼接,基因识别与定位,基因相关的,SNP,研究,非编码区信息结构分析,比较基因组学,(,一,),核酸及基因组信息,大规模基因组测序,33,运用计算机软件进行序列拼接,计算机辅助疫苗设计,计算机辅助疫苗设计,生物分子数据是宝藏,生物信息数据库是金矿,等待我们去挖掘和利用,Aquifex aeolicus,(五)在药学领域应用,2001年2月15日Nature封面,通过数据分析首先确立靶标分子,器官移植中供体/受体配对分析,蛋白质功能取决于蛋白质的空间结构,4个已上市的HIV-1蛋白酶抑制剂类药物的研制过程中,计算机辅助药物设计起了重要作用,Plasmodium falciparum,1981:Doolittle提出了关于序列模式的概念;,但在高等生物和人类基因组中,非编码序列则占了基因组序列的绝大部分。,生物分子信息之间存在着密切的联系,基于机理的药物发现:基因组药物实际上利用了反向生物学的原理沿着从基因序列一蛋白质一功能一药物的途径研制新药,其优势是取自庞大的人类基因资源及其编码蛋白质做为原材料,具有巨大的开发潜力。,破译“第二遗传密码”:即折叠密码(folding code),从蛋白质的一级结构得到立体结构,即可直接从基因推测其编码蛋白质所对应的生物学功能。,SNP在人类基因组中广泛存在,平均每5001000个碱基对中就有1个,估计其总数可达300万个甚至更多。,基因识别与定位,基因相关的,SNP,研究:,单核苷酸多态性,(,Single Nucleotide Polymorphisms,,,SNP),:,主要是指在基因组水平上由单个核苷酸的变异所引起的,DNA,序列多态性。它是人类可遗传的变异中最常见的一种。占所有已知多态性的,90%,以上。,SNP,在人类基因组中广泛存在,平均每,500,1000,个碱基对中就有,1,个,估计其总数可达,300,万个甚至更多。,SNP,的研究意义,寻找疾病相关的突变位点,法医学研究,器官移植中供体,/,受体配对分析,37,全基因组关联分析(,Genome-wide association study,GWAS,),:,是指在人类全基因组范围内找出存在的序列变异,即单核苷酸多态性(,SNP,),从中筛选出与疾病相关的,SNPs,非编码区信息结构分析:基因表达调控分析,在微生物中,,非编码区,只占整个基因组序列的,10%-20,;但在高等生物和人类基因组中,非编码序列则占了基因组序列的绝大部分。在人的基因组中,非编码序列超过,95%,。,非编码区有调控作用的核苷酸序列,包括位于编码区上游的,RNA,聚合酶结合位点。,比较基因组学,(Comparative Genomics),是基于基因组图谱和测序基础上,对已知的基因和基因组结构进行比较,来了解基因的功能、表达机理和物种进化的学科,(,二,),蛋白质及蛋白质组信息,蛋白质结构预测,蛋白质功能预测,基因表达及蛋白质组信息学,蛋白质,三维结构,测定主要方法:,X,射线晶体结构分析、多维核磁共振(,NMR,)波谱分析和电子显微镜二维晶体三维重构(电子晶体学,,EC,)等物理方法,Difficult!,Expensive!,Too Much Time!,蛋白质结构及功能预测,遗传信息的载体DNA,由美国NIH和能源部提出和带头,美、英、德、法、日、中共同参与的国际合作项目。,1988:成立欧洲分子生物学网络(EMBNet),EMBL数据库诞生,2001年2月15日Nature封面,器官移植中供体/受体配对分析,大量基因特别是疾病相关基因申请专利,如肥胖。,单核苷酸多态性(Single Nucleotide Polymorphisms,SNP):主要是指在基因组水平上由单个核苷酸的变异所引起的DNA序列多态性。,生物信息学,例如Dayhoff的替换矩阵、Neelleman和Wunsch的序列比对及GenBank(由美国国立生物技术信息中心建立和维护的核酸与蛋白质序列数据库)等大型数据库的建立,形成了生物信息学的雏形。,基因通过转录和翻译,使遗传信息在生物个体中得以表达,并使后代表现出与亲代相似的生物性状,Bacillus subtilis,蛋白质组研究,蛋白质组(,proteome,),:即包括一种细胞乃至一种生物所表达的全部蛋白质。蛋白质组本质上指的是在大规模水平上研究蛋白质的特征,包括蛋白质的表达水平,翻译后的修饰,蛋白与蛋白相互作用等,由此获得蛋白质水平上的关于疾病发生,细胞代谢等过程的整体而全面的认识。,基因组,数据库,蛋白质,序列,数据库,蛋白质,结构,数据库,DDBJ,EMBL,GenBank,SWISS-PROT,PDB,PIR,(,三,),生物分子数据的收集与管理,2026/10/4,(,四,),数据库搜索及序列比较,搜索同源序列在一定程度上就是通过序列比较寻找相似序列,序列比较的一个基本操作就是,比对,(,Alignment,),即将两个序列的各个字符(代表核苷酸或者氨基酸残基)按照对应等同或者置换关系进行对比排列,其结果是两个序列共有的排列顺序,这是序列相似程度的一种定性描述,多重序列比对,研究的是多个序列的共性。序列的多重比对可用来搜索基因组序列的功能区域,也可用于研究一组蛋白质之间的进化关系。,2026/10/4,46,发现同源分子,2026/10/4,47,48,生物信息学和人类基因组计划为药物靶标的发现和新药的研制开创了新天地,未来的药物设计将是基于生物信息学的知识挖掘的过程,通过数据分析首先确立靶标分子,预测蛋白质分子结构,设计药物分子与靶标分子相互作用,(,五,),在药学领域应用,所谓基因组药物(,Genomic drug),是指利用基因序列数据,经生物信息学分析、高通量基因表达、高通量功能筛选和体内外药效研究开发得到的新药候选物,基于机理的药物发现:,基因组药物实际上利用了反向生物学的原理沿着从基因序列一蛋白质一功能一药物的途径研制新药,其优势是取自庞大的人类基因资源及其编码蛋白质做为原材料,具有巨大的开发潜力。,基因组药物,人类基因组约有,10万,左右的基因编码10万以上的蛋白质,其中至少5即,5000,以上的基因编码蛋白质可能具有药物开发前景。大量基因特别是疾病相关基因申请专利,如肥胖。,理想的抗生素靶标,应为微生物细胞存活所必须,在病原体中高度保守,且在人体中不存在或与人类基因有根本差异,诊断类药物设计,:生物芯片设计,遗传病,:基因诊断(腺苷脱胺酶基因突变可引起重症联合免疫缺陷症(,SCID),;而淋巴细胞表面分子,CD40,或其配体(,CD40L,)基因突变则可引起无丙种球蛋白血症),感染性疾病,癌症?,预防类药物设计,:,计算机辅助疫苗设计,计算机预测抗原表位,计算机辅助药物设计,(,Computer-Aided Drug Design,,,CADD,)是近年来发展起来的研究与开发新药的一种崭新技术,以数学、药物化学、生物化学、分子生物学、分子药理学、结构化学、结构生物学、细胞生物学等学科为基础,以量子化学、分子力学和分子动力学等为理论依据,借助计算机数值计算和逻辑判断、数据库、图形学、人工智能等处理技术,进行合理的药物设计。,数据库、文献、合成,小分子的三维结构,数据库、同源模建,大分子的三维结构,QM,、,MM,、,MD,以及,QM/MM,计算机辅助药物设计,构效关系方法,药效团模型方法,分子对接方法,从头设计方法,数据库搜索方法,虚拟组合化学方法,ADME/TOX,预测,组合合成及,高通量筛选,可能的先导化合物,合成及活性测定,先导化合物的优化,候选化合物,CADD,应用实例,第一个,SBDD,方法设计的,新药碳酸酐酶抑制剂,Dorzolamide,(,治疗青光眼疾病,),于,1994,年上市,Wellcome,公司用,CADD,方法设计的,5,HT1D,受体激动剂,311C90,(,治疗偏头痛,),,进入三期临床研究,美国,Eli,Lilly,公司开发的第一个高效、高选择性,人体非胰腺分泌型磷脂酶抑制剂,LY311727,进入临床研究,4,个已上市的,HIV,-,1,蛋白酶抑制剂类,药物的研制过程中,计算机辅助药物设计起了重要作用,2,个,凝血酶抑制剂,已进入临床研究,Glaxo,开发的,唾液酸酶抑制剂,4,-,胍基,Nen5Ac2en,(,抗感冒药物,),进入临床研究,嘌呤核苷磷酸化酶抑制剂,B3X,-,34,-,治疗牛皮癣,进入临床三期,治疗,糖尿病药物,(,醛糖还原酶抑制剂,),上市,年龄,老年人,儿童,新生儿,性别,身高,/,体重,并发症,病程,脏器功能,肝,肾,心,环境因素,饮食,/,吸烟,/,合并用药,药物反应个体差异,基因多态性,药物基因组学,(Pharmacogenomics,PGx):,研究,DNA,如何影响药物反应,谢谢观看,谢谢观看,
展开阅读全文