资源描述
单击此处编辑母版标题样式,*,单击此处编辑母版文本样式,第二级,第三级,第四级,第五级,第四章 多序列比较的实际应用,多序列比较就是把两条以上可能有系统进化关系的序列进行比较的方法。目前对多序列比较的研究还在不断前进中,现有的大多数算法都基于渐进比较的思想,在序列两两比较的基础上逐步优化多序列比较的结果。进行多序列比较后可以对比较结果进行进一步处理,尤其是在寻找基因和致力于发现新蛋白的努力中,人们习惯于把新的序列同已知功能的蛋白序列作比较。,由于这些比较通常都希望能够推测新蛋白的功能,不管它们是双重比较还是多序列比较,都可以回答大量的其它的生物学问题。例如:在搜集的比较序列中,可以看出隐含于蛋白之中的物种进化关系,以便于更好地理解蛋白的进化。研究一个家族中的相关蛋白的差异,分析进化压力和生物秩序对于功能相关的蛋白进化影响。研究完多序列比较中的高度保守区域,我们可以对蛋白质的整个结构进行预测,并且猜测这些保守区域对于维持三维结构的重要性。,分析一群相关蛋白质时,很有必要了解比较正确的构成。发展用于多序列比较的程序是一个很有活力的研究领域,绝大多数方法都是基于渐进比较(,progressive alignment,),的概念。渐进比较的思想依赖于使用者用作比较的序列之间确实存在的生物学上的或者更准确地说是系统发生学上的相互关联。,与上一章的关系,1,、对数据库比较,比较结果未知;,2,、比较后寻找到一组相似序列;,3,、构建进化树,第一节,渐进比较方法,1.CLUSTAL W,CLUSTAL W,算法是一个最广泛使用的多序列比较程序,在任何主要的计算机平台上都可以免费使用。这个程序基于渐进比较的思想,将得到的一系列序列输入,对于每两个序列进行双重比较并且计算结果。基于这些比较,计算得到一个距离矩阵,反映了每对序列的关系,然后,基于邻近加入方法,这个矩阵被用来计算出一个系统发生辅助树。,这个辅助树,加权后可以证实极相近的序列,然后以双重比较极相近的序列开始,为组建比较提供基础,重新比较下一个加入的比较序列,依次类推。如果加入的序列较多,那么毫无疑问,必须加入空位以适应序列的差异,但是加入空位必须接受空位开放罚分和空位扩展罚分。,在绝大多数情况下,使用者不会在比较时加入结构信息,但是空位开放补偿利用了可以出现在,-,螺旋或,-,折叠末端的特殊残基以及空位罚分所偏好的残基。已经存在的空位的扩展原则很简单,只是要在那些极有可能在结构中形成弯曲的位点扩展空位,这些空位扩展罚分计算是由位置决定的。,为了介绍,CLUSTAL W,的使用,考察一下从四种不同物种来源的,matrix metalloproteinase 9,preproprotein,蛋白(,Homo sapiens,,,Paralichthys,olivaceus,,,Rattus,norvegicus,,,Bos,taurus,)。,将下列蛋白序列放入一个独立的文件中,。,g,i|14786152|ref|XP_029934.1|matrix metalloproteinase 9,preproprotein,Homo sapiens,MSLWQPLVLVLLVLGCCFAAPRQRQSTLVLFPGDLRTNLTDRQLAEEYLYRYGYTRVAEMRGESKSLGPALLLLQKQLSLPETGELDSATLKAMRTPRCGVPDLGRFQTFEGDLKWHHHNITYWIQNYSEDLPRAVIDDAFARAFALWSAVTPLTFTRVYSRDADIVIQFGVAEHGDGYPFDGKDGLLAHAFPPGPGIQGDAHFDDDELWSLGKGVVVPTRFGNADGAACHFPFIFEGRSYSACTTDGRSDGLPWCSTTANYDTDDRFGFCPSERLYTQDGNADGKPCQFPFIFQGQSYSACTTDGRSDGYRWCATTANYDRDKLFGFCPTRADSTVMGGNSAGELCVFPFTFLGKEYSTCTSEGRGDGRLWCATTSNFDSDKKWGFCPDQGYSLFLVAAHEFGHALGLDHSSVPEALMYPMYRFTEGPPLHKDDVNGIRHLYGPRPEPEPRPPTTTTPQPTAPPTVCPTGPPTVHPSERPTAGPTGPPSAGPTGPPTAGPSTATTVPLSPVDDACNVNIFDAIAEIGNQLYLFKDGKYWRFSEGRGSRPQGPFLIADKWPALPRKLDSVFEERLSKKLFFFSGRQVWVYTGASVLGPRRLDKLGLGADVAQVTGALRSGRGKMLLFSGRRLWRFDVKAQMVDPRSASEVDRMFPGVPLDTHDVFQYREKAYFCQDRFYWRVSSRSELNQVDQVGYVTYDILQCPED,gi|15718389|dbj|BAB68366.1|,gelatinase,Paralichthys,olivaceus,MRCCALAVCLVLVIVQDGWSLPLRSISVTFPGDILKNVTDTDLAETYLKRFGYLDKMHRSGFQSMVSTAKALKMMQRQMGLKETGKLDKSTLEAMKQPRCGVPDVANYQTFEGDLKWDHNDVTYRTLNYSPDMESSLIDDAFARAFKVWSDVTPLTFTRLYEGTADIMISFGKADHGDPYPFDGRNGLLAHAYPPGEGVQGDAHFDDDEHWTLGNGPAVKTLYGNADGAMCHFPFTFEGKSYTSCTTDGRTDNLPWCATTADYSRDGKYGFCPSELLYTVGGNADGAKCVFPFVFLEKEYDSCTKEGRSDGYRWCATTANFDQDQKYGFCPSRDTAVFGGNSEGEPCHFPFVFLGKEYDSCTSEGREDGKLWCSTTDNYDEDAKWGFCDDEGYSLFLVAAHEFGHALGLDHSNIREALMYPMYTYVEDFSLHKDDIEGIQYLYGRGTGPDPTPPQPTSTTTTPNPTEEPEPTTPQPVDPTRDACKLTKFDTITMIENELHFFENGNYWKMPSRGDGGLKGPFSLSERWPALPAVIDSAFEDLLTKNMYFFSGNRFWVYTKEGVLGPRSIEKLGLPTSIQKVEGALQRGKGKVLLFTEESFWKFDLKSQKMDKGYPKSTDYVFGGVPNDAHDVFQYKGHMYFCRDSFYWRMNSRRQVDRVGYVKYDLLKCSDSY,gi|13591993|ref|NP_112317.1|matrix metalloproteinase 9(,gelatinase,B,92-kDa type IV,collagenase,),Rattus,norvegicus,MNPWQPLLLVLLALGYSFAAPHQRQPTYVVFPRDLKTSNLTDTQLAEDYLYRYGYTRAAQMMGEKQSLRPALLMLQKQLSLPQTGELDSETLKAIRSPRCGVPDVGKFQTFEGDLKWHHHNITYWIQSYTEDLPRDVIDDSFARAFAVWSAVTPLTFTRVYGLEADIVIQFGVAEHGDGYPFDGKDGLLAHAFPPGPGIQGDAHFDDDELWSLGKGAVVPTYFGNANGAPCHFPFTFEGRSYLSCTTDGRNDGKPWCGTTADYDTDRKYGFCPSENLYTEHGNGDGKPCVFPFIFEGHSYSACTTKGRSDGYRWCATTANYDQDKLYGFCPTRADVTVTGGNSAGEMCVFPFVFLGKQYSTCTGEGRSDGRLWCATTSNFDADKKWGFCPDQGYSLFLVAAHEFGHALGLDHSSVPEALMYPMYHYHEDSPLHEDDIKGIQHLYGRGSKPDPRPPATTAAEPQPTAPPTMCPTAPPMAYPTGGPTVAPTGAPSPGPTGPPTAGPSEAPTESSTPVDNPCNVDVFDAIADIQGALHFFKDGRYWKFSNHGGSQLQGPFLIARTWPALPAKLNSAFEDPQSKKIFFFSGRKMWVYTGQTVLGPRSLDKLGLGSEVTLVTGLLPRRGGKALLISRERIWKFDL,KSQKVDPQSVTRLDNEFSGVPWNSHNVFHYQDKAYFCHDKYFWRVSFHNRVNQVDHVAYVTYDLLQCP,gi|467621|emb|CAA55127.1|matrix metalloproteinase 9,Bos,taurus,MSPLQPLVLALLVLACCSAVPRRRQPTVVVFPGEPRTNLTNRQLAEEYLYRYGYTPGAELSEDGQSLQRALLRFQRRLSLPETGELDSTTLNAMRAPRCGVPDVGRFQTFEGELKWHHHNITYWIQNYSEDLPRAVIDDAFARAFALWSAVTPLTFTRVYGPEADIVIQFGVREHGDGYPFDGKNGLLAHAFPPGKGIQGDAHFDDEELWSLGKGVVIPTYFGNAKGAACHFPFTFEGRSYSACTTDGRSDDMLWCSTTADYDADRQFGFCPSERLYTQDGNADGKPCVFPFTFQGRTYSACTSDGRSDGYRWCATTANYDQDKLYGFCPTRVDATVTGGNAAGELCVFPFTFLGKEYSACTREGRNDGHLWCATTSNFDKDKKWGFCPDQGYSLFLVAAHEFGHALGLDHTSVPEALMYPMYRFTEEHPLHRDDVQGIQHLYGPRPEPEPRPPTTTTTTTTEPQPTAPPTVCVTGPPTARPSEGPTTGPTGPPAAGPTGPPTAGPSAAPTESPDPAEDVCNVDIFDAIAEIRNRLHFFKAGKYWRLSEGGGRRVQGPFLVKSKWPALPRKLDSAFEDPLTKKIFFFSGRQVWVYTGASLLGPRRLDKLGLGPEVAQVTGALPRPEGKVLLFSGQSFWRFDVKTQKVDPQSVTPVDQMFPGVPISTHDIFQYQEKAYFCQDHFYWRVSSQNEVNQVDYVGYVTFDLLKCPED,这四种输入序列放在一个单独的文件中,作成,7,种可以接受的格式中的一种,,ClustalW,currently supports 7 multiple sequence formats.These are:,NBRF/PIR,EMBL,/,UniProtKB,/Swiss-Prot,Pearson(,Fasta,),GDE,ALN/,ClustalW,GCG/MSF,RSF,然后进入,,www.ebi.ac.uk/clustalw,/,站点,将需要比较的序列输入工具程序中,在图,4.1,中的“序列输入窗口”输入或粘贴需要比较的序列,也可以在“文件输入窗口”将含有需要比较序列的文件名输入,Clustalw,运行程序中,进行多序列比较。,结果输出可以在网页中获得,也可以通过电子邮件发到用户的信箱。,通过改变输出结果下拉菜单,用户可以根据需要获得多种形式的输出结果。用户在执行多序列比较时有很多选择的自由,用户可以设定空位开放和扩展的罚分,指出在组建辅助树时分歧到什么程度证明可以跳过一个序列,选择一个分值矩阵(,BLOSUM,或,PAM,),,并且可以选择当一个亲水残基出现(或缺失)在一个特异位点时,是否要执行特异性罚分,如果需要,要罚多少分。,程序会在屏幕上显示构建辅助树的过程,然后开始真正的多序列比较。,G 7,P -2 9,D -1,-1,7,E -2 0 2 6,N 0 -2 2 0 6,H -2,-2,0 0 1 10,Q -2 -1 0 2 0 1 6,K -2 -1 0 1 0 -1 1 5,R-2,-2,-1 0 0 0 1 3 7,S 0 -1 0 0 1 -1 0 -1,-1,4,T-2 -1,-1,-1,0 -2 -1,-1,-1,2 5,A 0 -1 -2 -1,-1,-2 -1,-1,-2 1 0 5,M-2,-2,-3 -2,-2,0 0 -1,-1,-2 -1,-1,6,V -3,-3,-3,-3,-3,-3,-3,-2,-2,-1 0 0 1 5,I -4 -2 -4 -3 -2 -3 -2 -3,-3,-2 -1,-1,2,3,5,L-3,-3,-3,-2 -3 -2,-2,-3 -2-3 -1,-1,2 1 2 5,F-3,-3,-4 -3 -2,-2,-4 -3 -2,-2,-1 -2 0 0 0 1 8,Y-3,-3,-2,-2,-2,2 -1,-1,-1,-2 -1 -2 0 -1 0 0 3 8,W-2 -3 -4 -3 -4 -3 -2,-2,-2,-4 -3 -2,-2,-3 -2,-2,1 3 15,C -3 -4 -3,-3,-2 -3,-3,-3,-3,-1,-1,-1,-2-1,-3,-2,-2,-3 -5 12,G P D E N H Q K R S T A M V I L F Y W C,Blosum,45 Matrix,CLUSTA W,结束时,会显示最终的比较结果,上述的例子的结果显示在图,4.3,中。在比较下方,一些位点被标记为星号或圆点,这些标记分别显示这些残基在序列中是绝对或是高度保守的。结果输出的最后部分是进化树,可以看出,比较的四种源自不同种属的蛋白进化关系。如果返回的比较出现太多的空位或是不考虑这些蛋白的任何已知信息,用户就可以再修正参数,然后返回程序,看它是否影响最终的比较。,2.MultAlin,MultAlin,方法也是基于用一系列双重比较开始的思想,然后基于双重比较的打分值进行一个分层次的聚类。当序列都分成类后,开始进行多序列比较,计算出多序列比较中的两个序列比较的新值,基于这些新值,重新构建一棵树。这个过程不断进行,直到分值不再上升,此时所有序列比较也就结束了。,MultAlin,(,www.toulouse.inra.fr/cgi-bin/multalin,/,;,,prodes.toulouse.inra.fr/multalin/multalin.html,)可以在,INRA Toulouse,的一个环球网点上很容易地执行,要比较的序列按照,FASTA,的格式被粘贴到序列输入框内,也可以在文件输入窗口输入文件名,将序列提交给服务器。在提交序列之前,用主界面的一系列下拉菜单,用户定义适当的参数,比如输出格式,可选的输入格式,引用的分值矩阵以及空位开放和扩展罚分的分值。大多数用户只会根据输入序列的远近关系,选择不同的分值矩阵。,然后,序列被提交到服务器上,当多序列比较返回时,会计算一个一致序列并显示在比较的下方。举例来说,如图,4.4,所示的用,CLUSTAL W,比较的同样的序列被提交给,MultAlin,服务器,接受缺省的比较参数。,其结果如图,4.5,所示,在一致序列中,所有序列都匹配的残基相应的位置用此残基的大写字母表示,大多数都匹配的用小写字母表示,同样地,符号!、,$,、,%,和,#,分别表示保守取代,,很明显,用两种方法分别得到的比较结果并不完全一样。这并不以为这一种方法比另外一种方法优越,根据实际情况,从输入序列的性质出发,应用不同的方法会得到不同程度的成功。用户应该选择若干个工具同时使用,并且对最终的比较结果作手工修正以期达到最佳效果。,第二节,基序和模式比较,上述的方法对于多序列比较是非常有用的,缺点是用户必须事先搜集好需要比较的输入序列,要么通过一系列的,BLAST,或其它的数据库搜索,要么在实验室里直接作出决定。但是,在实际工作中我们常常可以获取一个单独的序列,并且基于此序列中的任何基序或模式,针对所有的蛋白质家族,完成某个特异方法所定义的最佳比较。很多时候,这些方法所揭示的距离关系并不能从标准的数据库搜索中轻易获取。在这一部分,我们讨论两种方法,都是搜索特殊数据库以获取序列的基序和模式的,当然也是两种从最少的序列信息中进行蛋白质家族分类的强有力的方法。,1,、,ProfileScan,基于经典的模式分析的,Gribskov,方法,ProfileScan,使用一种称为,pfscan,的方法寻找一个蛋白质或核酸的查询序列同一个模式库的相似性,因此,在搜索中需要有模式库,第一个是,PROSITE,(,,www.expasy.ch/prosite,/,),,一个,ExPASy,(,http,:,/,www.Expasy.org,),数据库,通过使用基序和序列模式(诸如指纹)将生物学意义重大的位点收集分类;,第二个是,Pfam,(,,www.sanger.ac.uk/Software/Pfam/search.shtml,),收集了蛋白质结构域家族,与其它收集方法有很大不同的是,最初的蛋白质结构域的比较完全是用手工完成的,而不是依靠自动化的处理方法,正因为这样,,Pfam,几年前,只拥有,500,多条款目,但这些款目的质量极好。现在拥有,8957,条目,.,基于,PROSITE,和,Pfam,的搜索可以通过访问,ProfileScan,的主页完成,它只需要一条简单的输入序列(用文本格式),或者一个标号,比如一个,SWISS-PROT ID,。,用户可以选择搜索的敏感度,选择返回显著的匹配或者所有匹配,甚至包括边界的情况。,为了说明输出的格式,我们现在向,PROSITE,系统提交人类,matrix metalloproteinase 9,preproprotein,Homo sapiens,蛋白序列。返回的,PROSITE,条目显示蛋白的功能区,数字“,Start”,和“,End”,是显示出查询序列和匹配的模式重叠的位点,Bits,是序列比较可靠性评分,,Evalue,是序列比较错误概率。,2.BLOCKS,BLOCKS,数据库利用了模块的概念,对蛋白质家族进行鉴定,而不是只依赖于单个的序列本身。模块的思想来源于更加普遍的概念,基序(,motif,),,基序通常是指一段氨基酸序列保守的伸展,拥有一定的蛋白质功能或者结构。当这些来源于同一家族中的蛋白质中的基序比较时(不引入空位),其结果就是部件;部件就是指比较,而不是序列本身。很明显,任何一个独立的蛋白都可以包含一个或者更多个部件,对应于它的每一个功能和结构基序。,BLOCKS,数据库本身来源于,PROSITE,的条目。当使用一个感兴趣的序列进行,BLOCKS,搜索时,查询序列就会同数据库中所有的部件在任何可能的位点进行比较,对于每一个比较都会使用位点特异分值矩阵或者,PSSM,进行打分。,PSSM,和这本书前面叙述的分值矩阵(例如,BLOSUM62,),的重大区别在于,其分值考虑到了在给定的位点是否拥有一个匹配以及一个给定氨基酸占据部件中的位点的可能性。所有基于这种形式的方法的核心思想都是观测残基占据比较蛋白质部件中的一个特异位点的几率,,BLOCKS,(,,blocks.fhcrc.org/blocks/blocks_search.html,),搜索可以通过访问西雅图的,Fred Hutchinson,肿瘤研究中心的,BLOCKS,主页完成,这个网点很直接,允许执行基于序列或者关键词的检索。如果用户在输入时使用了,DNA,序列,他就可以指明使用哪个遗传密码,搜索哪条链。不管执行搜索的是一个序列还是一个关键词,成功的搜索将会返回相应的部件,图,4.8,显示了一个例子。,在结果输出窗口,首先给出检索的概况,给出了这个部件代表的家族,,BLOCKS,数据库注册码和家族的详细描述;,BL,行给出了关于组建这个特别的部件的原始序列基序的信息:这个部件中有多少序列数目,接下来是统计学有效性和构成长度的信息;最后是序列列表,只显示出对应于这个特殊基序的序列部分,每一行的开头都是这个序列的,SWISS-PROT,注册码,第一个残基在整个序列中的位置,然后是序列本身以及基于位点的序列权重,这个权重用,100,刻度,,100,表示序列距离这个群体最远;注意到有些序列行中有空行:部分比较聚集在一起,在每个聚集中,,80%,的序列残基是相同的。,
展开阅读全文