应用多元统计分析聚类分析PPT课件.ppt
《应用多元统计分析聚类分析PPT课件.ppt》由会员分享,可在线阅读,更多相关《应用多元统计分析聚类分析PPT课件.ppt(55页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、第一张,PPT共五十五页,创作于2022年6月第一节第一节 引言引言n“物以类聚,人以群分物以类聚,人以群分”。对事物进行分类,是人们认识事物。对事物进行分类,是人们认识事物的出发点,也是人们认识世界的一种重要方法。因此,分类学的出发点,也是人们认识世界的一种重要方法。因此,分类学已成为人们认识世界的一门基础科学。已成为人们认识世界的一门基础科学。n在生物、经济、社会、人口等领域的研究中,存在着大量量化在生物、经济、社会、人口等领域的研究中,存在着大量量化分类研究。例如:在生物学中,为了研究生物的演变,生物学分类研究。例如:在生物学中,为了研究生物的演变,生物学家需要根据各种生物不同的特征对生
2、物进行分类。在经济研究家需要根据各种生物不同的特征对生物进行分类。在经济研究中,为了研究不同地区城镇居民生活中的收入和消费情况,往中,为了研究不同地区城镇居民生活中的收入和消费情况,往往需要划分不同的类型去研究。在地质学中,为了研究矿物勘往需要划分不同的类型去研究。在地质学中,为了研究矿物勘探,需要根据各种矿石的化学和物理性质和所含化学成分把它探,需要根据各种矿石的化学和物理性质和所含化学成分把它们归于不同的矿石类。在人口学研究中,需要构造人口生育分们归于不同的矿石类。在人口学研究中,需要构造人口生育分类模式、人口死亡分类状况,以此来研究人口的生育和死亡规类模式、人口死亡分类状况,以此来研究人
3、口的生育和死亡规律。律。第二张,PPT共五十五页,创作于2022年6月n但历史上这些分类方法多半是人们主要依靠经验作定性分类,但历史上这些分类方法多半是人们主要依靠经验作定性分类,致使许多分类带有主观性和任意性,不能很好地揭示客观事物致使许多分类带有主观性和任意性,不能很好地揭示客观事物内在的本质差别与联系;特别是对于多因素、多指标的分类问内在的本质差别与联系;特别是对于多因素、多指标的分类问题,定性分类的准确性不好把握。为了克服定性分类存在的不题,定性分类的准确性不好把握。为了克服定性分类存在的不足,人们把数学方法引入分类中,形成了数值分类学。后来随足,人们把数学方法引入分类中,形成了数值分
4、类学。后来随着多元统计分析的发展,从数值分类学中逐渐分离出了聚类分着多元统计分析的发展,从数值分类学中逐渐分离出了聚类分析方法。随着计算机技术的不断发展,利用数学方法研究分类析方法。随着计算机技术的不断发展,利用数学方法研究分类不仅非常必要而且完全可能,因此近年来,聚类分析的理论和不仅非常必要而且完全可能,因此近年来,聚类分析的理论和应用得到了迅速的发展。应用得到了迅速的发展。n聚类分析就是分析如何对样品(或变量)进行量化分类的问题。聚类分析就是分析如何对样品(或变量)进行量化分类的问题。通常聚类分析分为通常聚类分析分为Q型聚类和型聚类和R型聚类。型聚类。Q型聚类是对样品进行型聚类是对样品进行
5、分类处理,分类处理,R型聚类是对变量进行分类处理。型聚类是对变量进行分类处理。第三张,PPT共五十五页,创作于2022年6月第二节第二节 相似性的量度相似性的量度 一 样品相似性的度量 二 变量相似性的度量 第四张,PPT共五十五页,创作于2022年6月一、样品相似性的度量一、样品相似性的度量n在聚类之前,要首先分析样品间的相似性。在聚类之前,要首先分析样品间的相似性。Q型聚类分析,常型聚类分析,常用距离来测度样品之间的相似程度。每个样品有用距离来测度样品之间的相似程度。每个样品有p个指标(变个指标(变量)从不同方面描述其性质,形成一个量)从不同方面描述其性质,形成一个p维的向量。如果把维的向
6、量。如果把n个个样品看成样品看成p维空间中的维空间中的n个点,则两个样品间相似程度就可用个点,则两个样品间相似程度就可用p维空间中的两点距离公式来度量。两点距离公式可以从不同角维空间中的两点距离公式来度量。两点距离公式可以从不同角度进行定义,令度进行定义,令dij 表示样品表示样品Xi与与Xj的距离,存在以下的距离公的距离,存在以下的距离公式:式:1明考夫斯基距离明考夫斯基距离 (5.1)明考夫斯基距离简称明氏距离,按的取值不同又可分成:明考夫斯基距离简称明氏距离,按的取值不同又可分成:第五张,PPT共五十五页,创作于2022年6月第六张,PPT共五十五页,创作于2022年6月n欧氏距离是常用
7、的距离,大家都比较熟悉,但是前面已经提到,欧氏距离是常用的距离,大家都比较熟悉,但是前面已经提到,在解决多元数据的分析问题时,欧氏距离就显示出了它的不足在解决多元数据的分析问题时,欧氏距离就显示出了它的不足之处。一是它没有考虑到总体的变异对之处。一是它没有考虑到总体的变异对“距离距离”远近的影响,远近的影响,显然一个变异程度大的总体可能与更多样品近些,既使它们的显然一个变异程度大的总体可能与更多样品近些,既使它们的欧氏距离不一定最近;另外,欧氏距离受变量的量纲影响,这欧氏距离不一定最近;另外,欧氏距离受变量的量纲影响,这对多元数据的处理是不利的。为了克服这方面的不足,可用对多元数据的处理是不利
8、的。为了克服这方面的不足,可用“马氏距离马氏距离”的概念。的概念。第七张,PPT共五十五页,创作于2022年6月2马氏距离马氏距离 设设Xi与与Xj是来自均值向量为是来自均值向量为 ,协方差为,协方差为=(0)的总体的总体G中的中的p维样品,则两个样品间的马氏距离为维样品,则两个样品间的马氏距离为 (5.5)马氏距离又称为广义欧氏距离。显然,马氏距离与上述各种距马氏距离又称为广义欧氏距离。显然,马氏距离与上述各种距离的主要不同就是它考虑了观测变量之间的相关性。如果各变离的主要不同就是它考虑了观测变量之间的相关性。如果各变量之间相互独立,即观测变量的协方差矩阵是对角矩阵,则马量之间相互独立,即观
9、测变量的协方差矩阵是对角矩阵,则马氏距离就退化为用各个观测指标的标准差的倒数作为权数的加氏距离就退化为用各个观测指标的标准差的倒数作为权数的加权欧氏距离。马氏距离还考虑了观测变量之间的变异性,不再权欧氏距离。马氏距离还考虑了观测变量之间的变异性,不再受各指标量纲的影响。将原始数据作线性变换后,马氏距离不受各指标量纲的影响。将原始数据作线性变换后,马氏距离不变。变。第八张,PPT共五十五页,创作于2022年6月3兰氏距离兰氏距离 (5.6)它仅适用于一切它仅适用于一切Xij0的情况,这个距离也可以克服各个指标之的情况,这个距离也可以克服各个指标之间量纲的影响。这是一个自身标准化的量,由于它对大的
10、奇异间量纲的影响。这是一个自身标准化的量,由于它对大的奇异值不敏感,它特别适合于高度偏倚的数据。虽然这个距离有助值不敏感,它特别适合于高度偏倚的数据。虽然这个距离有助于克服明氏距离的第一个缺点,但它也没有考虑指标之间的相于克服明氏距离的第一个缺点,但它也没有考虑指标之间的相关性。关性。第九张,PPT共五十五页,创作于2022年6月4距离选择的原则距离选择的原则n 一般说来,同一批数据采用不同的距离公式,会得到不同的分一般说来,同一批数据采用不同的距离公式,会得到不同的分类结果。产生不同结果的原因,主要是由于不同的距离公式的类结果。产生不同结果的原因,主要是由于不同的距离公式的侧重点和实际意义都
11、有不同。因此我们在进行聚类分析时,应侧重点和实际意义都有不同。因此我们在进行聚类分析时,应注意距离公式的选择。通常选择距离公式应注意遵循以下的基注意距离公式的选择。通常选择距离公式应注意遵循以下的基本原则:本原则:(1)要考虑所选择的距离公式在实际应用中有明确的意义。如欧氏距离就有非常明)要考虑所选择的距离公式在实际应用中有明确的意义。如欧氏距离就有非常明确的空间距离概念。马氏距离有消除量纲影响的作用。确的空间距离概念。马氏距离有消除量纲影响的作用。(2)要综合考虑对样本观测数据的预处理和将要采用的聚类分析方法。如)要综合考虑对样本观测数据的预处理和将要采用的聚类分析方法。如在进行聚类分析之前
12、已经对变量作了标准化处理,则通常就可采用欧氏距在进行聚类分析之前已经对变量作了标准化处理,则通常就可采用欧氏距离。离。(3)要考虑研究对象的特点和计算量的大小。样品间距离公式的选择是一个比)要考虑研究对象的特点和计算量的大小。样品间距离公式的选择是一个比较复杂且带有一定主观性的问题,我们应根据研究对象的特点不同做出具体分较复杂且带有一定主观性的问题,我们应根据研究对象的特点不同做出具体分折。实际中,聚类分析前不妨试探性地多选择几个距离公式分别进行聚类,然折。实际中,聚类分析前不妨试探性地多选择几个距离公式分别进行聚类,然后对聚类分析的结果进行对比分析,以确定最合适的距离测度方法。后对聚类分析的
13、结果进行对比分析,以确定最合适的距离测度方法。第十张,PPT共五十五页,创作于2022年6月二、变量相似性的度量二、变量相似性的度量n 多元数据中的变量表现为向量形式,在几何上可用多维空间中多元数据中的变量表现为向量形式,在几何上可用多维空间中的一个有向线段表示。在对多元数据进行分析时,相对于数据的一个有向线段表示。在对多元数据进行分析时,相对于数据的大小,我们更多地对变量的变化趋势或方向感兴趣。因此,的大小,我们更多地对变量的变化趋势或方向感兴趣。因此,变量间的相似性,我们可以从它们的方向趋同性或变量间的相似性,我们可以从它们的方向趋同性或“相关性相关性”进行考察,从而得到进行考察,从而得到
14、“夹角余弦法夹角余弦法”和和“相关系数相关系数”两种度量两种度量方法。方法。1、夹角余弦、夹角余弦两变量两变量Xi与与Xj看作看作p维空间的两个向量,这两个向量间的夹角余维空间的两个向量,这两个向量间的夹角余弦可用下式进行计算弦可用下式进行计算 (5.7)显然,显然,cos ij 1。第十一张,PPT共五十五页,创作于2022年6月2相关系数相关系数相关系数经常用来度量变量间的相似性。变量相关系数经常用来度量变量间的相似性。变量Xi与与Xj的相关系的相关系数定义为数定义为 (5.8)显然也有,显然也有,rij 1。第十二张,PPT共五十五页,创作于2022年6月n无论是夹角余弦还是相关系数,它
15、们的绝对值都小于无论是夹角余弦还是相关系数,它们的绝对值都小于1,作为,作为变量近似性的度量工具,我们把它们统记为变量近似性的度量工具,我们把它们统记为cij。当。当 cij =1时,说明变量时,说明变量Xi与与Xj完全相似;当完全相似;当 cij 近似于近似于1时,说时,说明变量明变量Xi与与Xj非常密切;当非常密切;当 cij =0时,说明变量时,说明变量Xi与与Xj完完全不一样;当全不一样;当 cij 近似于近似于0时,说明变量时,说明变量Xi与与Xj差别很大。差别很大。据此,我们把比较相似的变量聚为一类,把不太相似的变量归据此,我们把比较相似的变量聚为一类,把不太相似的变量归到不同的类
16、内。到不同的类内。n在实际聚类过程中,为了计算方便,我们把变量间相似性的度在实际聚类过程中,为了计算方便,我们把变量间相似性的度量公式作一个变换为量公式作一个变换为 dij=1 cij (5.9)或者或者 dij2=1 cij2 (5.10)用表示变量间的距离远近,小则与先聚成一类,这比较符合人用表示变量间的距离远近,小则与先聚成一类,这比较符合人们的一般思维习惯。们的一般思维习惯。第十三张,PPT共五十五页,创作于2022年6月第三节第三节 系统聚类分析法系统聚类分析法 一 系统聚类的基本思想 二 类间距离与系统聚类法 三 类间距离的统一性 第十四张,PPT共五十五页,创作于2022年6月一
17、、系统聚类的基本思想一、系统聚类的基本思想n系统聚类的基本思想是:距离相近的样品(或变量)先聚成类,系统聚类的基本思想是:距离相近的样品(或变量)先聚成类,距离相远的后聚成类,过程一直进行下去,每个样品(或变量)距离相远的后聚成类,过程一直进行下去,每个样品(或变量)总能聚到合适的类中。系统聚类过程是:假设总共有总能聚到合适的类中。系统聚类过程是:假设总共有n个样品个样品(或变量),第一步将每个样品(或变量)独自聚成一类,共(或变量),第一步将每个样品(或变量)独自聚成一类,共有有n类;第二步根据所确定的样品(或变量)类;第二步根据所确定的样品(或变量)“距离距离”公式,公式,把距离较近的两个
18、样品(或变量)聚合为一类,其它的样品把距离较近的两个样品(或变量)聚合为一类,其它的样品(或变量)仍各自聚为一类,共聚成(或变量)仍各自聚为一类,共聚成n 1类;第三步将类;第三步将“距离距离”最近的两个类进一步聚成一类,共聚成最近的两个类进一步聚成一类,共聚成n 2类;类;,以上,以上步骤一直进行下去,最后将所有的样品(或变量)全聚成一类。步骤一直进行下去,最后将所有的样品(或变量)全聚成一类。为了直观地反映以上的系统聚类过程,可以把整个分类系统画为了直观地反映以上的系统聚类过程,可以把整个分类系统画成一张谱系图。所以有时系统聚类也称为谱系分析。除系统聚成一张谱系图。所以有时系统聚类也称为谱
19、系分析。除系统聚类法外,还有有序聚类法、动态聚类法、图论聚类法、模糊聚类法外,还有有序聚类法、动态聚类法、图论聚类法、模糊聚类法等,限于篇幅,我们只介绍系统聚类方法。类法等,限于篇幅,我们只介绍系统聚类方法。第十五张,PPT共五十五页,创作于2022年6月二、类间距离与系统聚类法二、类间距离与系统聚类法n在进行系统聚类之前,我们首先要定义类与类之间的距离,由在进行系统聚类之前,我们首先要定义类与类之间的距离,由类间距离定义的不同产生了不同的系统聚类法。常用的类间距类间距离定义的不同产生了不同的系统聚类法。常用的类间距离定义有离定义有8种之多,与之相应的系统聚类法也有种之多,与之相应的系统聚类法
20、也有8种,分别为最种,分别为最短距离法、最长距离法、中间距离法、重心法、类平均法、可短距离法、最长距离法、中间距离法、重心法、类平均法、可变类平均法、可变法和离差平方和法。它们的归类步骤基本上变类平均法、可变法和离差平方和法。它们的归类步骤基本上是一致的,主要差异是类间距离的计算方法不同。以下用是一致的,主要差异是类间距离的计算方法不同。以下用dij表表示样品示样品Xi与与Xj之间距离,用之间距离,用Dij表示类表示类Gi与与Gj之间的距离。之间的距离。第十六张,PPT共五十五页,创作于2022年6月1.最短距离法最短距离法定义类与之间的距离为两类最近样品的距离,即为定义类与之间的距离为两类最
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 应用 多元 统计分析 聚类分析 PPT 课件
限制150内