收藏 分销(赏)

系统聚类的方法.ppt

上传人:胜**** 文档编号:757645 上传时间:2024-03-05 格式:PPT 页数:32 大小:1.35MB
下载 相关 举报
系统聚类的方法.ppt_第1页
第1页 / 共32页
系统聚类的方法.ppt_第2页
第2页 / 共32页
系统聚类的方法.ppt_第3页
第3页 / 共32页
系统聚类的方法.ppt_第4页
第4页 / 共32页
系统聚类的方法.ppt_第5页
第5页 / 共32页
点击查看更多>>
资源描述

1、聚类分析1 1聚类分析一 聚类分析的定义二 系统聚类的基本思想 三 八种系统聚类方法四 类间距离的统一性一、聚类分析的定义一、聚类分析的定义“物以类聚,人以群分物以类聚,人以群分”。对事物进行分类,是人们认。对事物进行分类,是人们认识事物的出发点,也是人们认识世界的一种重要方法。识事物的出发点,也是人们认识世界的一种重要方法。因此,分类学已成为人们认识世界的一门基础科学。因此,分类学已成为人们认识世界的一门基础科学。聚类分析就是分析如何对样品(或变量)进行量化分类聚类分析就是分析如何对样品(或变量)进行量化分类的问题。通常聚类分析分为的问题。通常聚类分析分为Q型聚类和型聚类和R型聚类。型聚类。

2、Q型型聚类是对样品进行分类处理,聚类是对样品进行分类处理,R型聚类是对变量进行分型聚类是对变量进行分类处理。类处理。二、系统聚类的基本思想二、系统聚类的基本思想系统聚类的基本思想是:距离相近的样品(或变量)先聚成类,系统聚类的基本思想是:距离相近的样品(或变量)先聚成类,距离相远的后聚成类,过程一直进行下去,每个样品(或变量)距离相远的后聚成类,过程一直进行下去,每个样品(或变量)总能聚到合适的类中。总能聚到合适的类中。系统聚类法是诸聚类分析方法中使用最多的一种,按下列步骤系统聚类法是诸聚类分析方法中使用最多的一种,按下列步骤进行:进行:计算计算n个样品两两之间的距离,构成距离矩阵个样品两两之

3、间的距离,构成距离矩阵合并距离最近的两类为一新类合并距离最近的两类为一新类计算新类与当前各类的距离。再合并、计算,直至只有一计算新类与当前各类的距离。再合并、计算,直至只有一类为止类为止画聚类图,解释画聚类图,解释将将n个样品各作为一类个样品各作为一类三、八种系统聚类方法三、八种系统聚类方法 在进行系统聚类之前,我们首先要定义类与类之间的在进行系统聚类之前,我们首先要定义类与类之间的距离,由类间距离定义的不同产生了不同的系统聚类法。距离,由类间距离定义的不同产生了不同的系统聚类法。常用的类间距离定义有常用的类间距离定义有8种之多,与之相应的系统聚类法种之多,与之相应的系统聚类法也有也有8种,分

4、别为最短距离法、最长距离法、中间距离法、种,分别为最短距离法、最长距离法、中间距离法、重心法、类平均法、可变类平均法、可变法和离差平方和重心法、类平均法、可变类平均法、可变法和离差平方和法。它们的归类步骤基本上是一致的,主要差异是类间距法。它们的归类步骤基本上是一致的,主要差异是类间距离的计算方法不同。以下用离的计算方法不同。以下用dij表示样品表示样品Xi与与Xj之间距离,之间距离,用用Dij表示类表示类Gi与与Gj之间的距离。之间的距离。1.最短距离法最短距离法定义类与之间的距离为两类最近样品的距离,即为定义类与之间的距离为两类最近样品的距离,即为 (1)设类与合并成一个新类记为,则任一类

5、与的距离为设类与合并成一个新类记为,则任一类与的距离为 (2)n最短距离法进行聚类分析的步骤如下:最短距离法进行聚类分析的步骤如下:(1)定义样品之间距离,计算样品的两两距离,得一距离)定义样品之间距离,计算样品的两两距离,得一距离 阵记为阵记为D(0),开始每个样品自成一类,显然这时,开始每个样品自成一类,显然这时Dij=dij。(2)找出距离最小元素,设为)找出距离最小元素,设为Dpq,则将,则将Gp和和Gq合并成一个合并成一个 新类,记为新类,记为Gr,即,即Gr=Gp,Gq。(3)按()按(5.12)计算新类与其它类的距离。)计算新类与其它类的距离。(4)重复()重复(2)、()、(3

6、)两步,直到所有元素。并成一类为)两步,直到所有元素。并成一类为 止。如果某一步距离最小的元素不止一个,则对应这些止。如果某一步距离最小的元素不止一个,则对应这些 最小元素的类可以同时合并。最小元素的类可以同时合并。1.最短距离法最短距离法n【例例 1】设有六个样品,每个只测量一个指标,分别是设有六个样品,每个只测量一个指标,分别是1,2,5,7,9,10,试用最短距离法将它们分类。,试用最短距离法将它们分类。(1)样品采用绝对值距离,计算样品间的距离阵)样品采用绝对值距离,计算样品间的距离阵D(0),见,见表表1表 1 1.最短距离法最短距离法(2)D(0)中最小的元素是中最小的元素是D12

7、D561,于是将,于是将G1和和G2合合并成并成G7,G5和和G6合并成合并成G8,并利用(,并利用(5.12)式计算新类与其)式计算新类与其它类的距离它类的距离D(1),见表,见表2表 2 1.最短距离法最短距离法(3)在)在D(1)中最小值是中最小值是D34D482,由于,由于G4与与G3合并,合并,又与又与G8合并,因此合并,因此G3、G4、G8合并成一个新类合并成一个新类G9,其与其,其与其它类的距离它类的距离D(2),见表,见表 3表 3 1.最短距离法最短距离法(4)最后将)最后将G7和和G9合并成合并成G10,这时所有的六个样品聚为一,这时所有的六个样品聚为一类,其过程终止。类,

8、其过程终止。上述聚类的可视化过程见图上述聚类的可视化过程见图1所示,横坐标的刻度表示并类所示,横坐标的刻度表示并类的距离。这里我们应该注意,聚类的个数要以实际情况所定,的距离。这里我们应该注意,聚类的个数要以实际情况所定,其详细内容将在后面讨论。其详细内容将在后面讨论。图1 最短距离聚类法的过程1.最短距离法最短距离法2.最长距离法最长距离法n再找距离最小两类并类,直至所有的样品全归为一类为止。再找距离最小两类并类,直至所有的样品全归为一类为止。可以看出最长距离法与最短距离法只有两点不同:可以看出最长距离法与最短距离法只有两点不同:一是类与类之间的距离定义不同;一是类与类之间的距离定义不同;另

9、一是计算新类与其它类的距离所用的公式不同。另一是计算新类与其它类的距离所用的公式不同。2.最长距离法最长距离法最短、最长距离定义表示都是极端情况,我们定义类间距离最短、最长距离定义表示都是极端情况,我们定义类间距离可以既不采用两类之间最近的距离也不采用两类之间最远的可以既不采用两类之间最近的距离也不采用两类之间最远的距离,而是采用介于两者之间的距离,称为中间距离法。距离,而是采用介于两者之间的距离,称为中间距离法。中间距离将类中间距离将类Gp与与Gq类合并为类类合并为类Gr,则任意的类,则任意的类Gk和和Gr的距的距离公式为离公式为 (14 0)(5)设设DkqDkp,如果采用最短距离法,则,

10、如果采用最短距离法,则Dkr=Dkp,如果采用,如果采用最长距离法,则最长距离法,则Dkr=Dkq。如图。如图2所示,所示,(5)式就是取它们式就是取它们(最长距离与最短距离)的中间一点作为计算(最长距离与最短距离)的中间一点作为计算Dkr的根据。的根据。3.中间距离法中间距离法n特别当特别当 =14,它表示取中间点算距离,公式为,它表示取中间点算距离,公式为 (6)图2 中间距离法3.中间距离法中间距离法4.重心法重心法5.类平均类平均法法6.可变类平均法可变类平均法 由于类平均法中没有反映出由于类平均法中没有反映出Gp和和Gq之间的距离之间的距离Dpq的影响,的影响,因此将类平均法进一步推

11、广,如果将因此将类平均法进一步推广,如果将Gp和和Gq合并为新类合并为新类Gr,类,类Gk与新并类与新并类Gr的距离公式为:的距离公式为:(12)其中其中 是可变的且是可变的且 1,称这种系统聚类法为可变类平均法。,称这种系统聚类法为可变类平均法。7.可变可变法法 该方法是该方法是Ward提出来的,所以又称为提出来的,所以又称为Ward法。该方法的基法。该方法的基本思想来自于方差分析,如果分类正确,同类样品的离差平本思想来自于方差分析,如果分类正确,同类样品的离差平方和应当较小,类与类的离差平方和较大。具体做法是先将方和应当较小,类与类的离差平方和较大。具体做法是先将n个样品各自成一类,然后每

12、次缩小一类,每缩小一类,离个样品各自成一类,然后每次缩小一类,每缩小一类,离差平方和就要增大,选择使方差增加最小的两类合并,直到差平方和就要增大,选择使方差增加最小的两类合并,直到所有的样品归为一类为止。所有的样品归为一类为止。设将设将n个样品分成个样品分成k类类G1,G2,Gk,用,用Xit表示表示Gt中的第中的第I个样品,个样品,nt表示表示Gt中样品的个数,中样品的个数,是是Gt的重心,则的重心,则Gt的样品的样品离差平方和为离差平方和为8.离差平方和法离差平方和法8.离差平方和法离差平方和法8.离差平方和法离差平方和法n n这种系统聚类法称为离差平方和法或这种系统聚类法称为离差平方和法

13、或Ward方法。下面论证方法。下面论证离差平方和法的距离递推(离差平方和法的距离递推(16)式。)式。8.离差平方和法离差平方和法n由于由于8.离差平方和法离差平方和法n 8.离差平方和法离差平方和法8.离差平方和法离差平方和法n上述八种系统聚类法的步骤完全一样,只是距离的递推公式上述八种系统聚类法的步骤完全一样,只是距离的递推公式不同。兰斯(不同。兰斯(Lance)和威廉姆斯()和威廉姆斯(Williams)于)于1967年给年给出了一个统一的公式。出了一个统一的公式。(18)其中其中ap、aq、是参数,不同的系统聚类法,它们取不是参数,不同的系统聚类法,它们取不同的数,详见表同的数,详见表4。n这里应该注意,不同的聚类方法结果不一定完全相同,一般这里应该注意,不同的聚类方法结果不一定完全相同,一般只是大致相似。如果有很大的差异,则应该仔细考查,找到只是大致相似。如果有很大的差异,则应该仔细考查,找到问题所在;另外,可将聚类结果与实际问题对照,看哪一个问题所在;另外,可将聚类结果与实际问题对照,看哪一个结果更符合经验。结果更符合经验。四、类间距离的统一性四、类间距离的统一性表4 系统聚类法参数表四、类间距离的统一性四、类间距离的统一性

展开阅读全文
相似文档                                   自信AI助手自信AI助手
猜你喜欢                                   自信AI导航自信AI导航
搜索标签

当前位置:首页 > 包罗万象 > 大杂烩

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        获赠5币

©2010-2024 宁波自信网络信息技术有限公司  版权所有

客服电话:4008-655-100  投诉/维权电话:4009-655-100

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :gzh.png    weibo.png    LOFTER.png 

客服