PCA的原理及步骤(共6页).doc
《PCA的原理及步骤(共6页).doc》由会员分享,可在线阅读,更多相关《PCA的原理及步骤(共6页).doc(6页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、精选优质文档-倾情为你奉上一、基本原理主成分分析是数学上对数据降维的一种方法。其基本思想是设法将原来众多的具有一定相关性的指标X1,X2,XP(比如p个指标),重新组合成一组较少个数的互不相关的综合指标Fm来代替原来指标。那么综合指标应该如何去提取,使其既能最大程度的反映原变量Xp所代表的信息,又能保证新指标之间保持相互无关(信息不重叠)。设F1表示原变量的第一个线性组合所形成的主成分指标,即,由数学知识可知,每一个主成分所提取的信息量可用其方差来度量,其方差Var(F1)越大,表示F1包含的信息越多。常常希望第一主成分F1所含的信息量最大,因此在所有的线性组合中选取的F1应该是X1,X2,X
2、P的所有线性组合中方差最大的,故称F1为第一主成分。如果第一主成分不足以代表原来p个指标的信息,再考虑选取第二个主成分指标F2,为有效地反映原信息,F1已有的信息就不需要再出现在F2中,即F2与F1要保持独立、不相关,用数学语言表达就是其协方差Cov(F1, F2)=0,所以F2是与F1不相关的X1,X2,XP的所有线性组合中方差最大的,故称F2为第二主成分,依此类推构造出的F1、F2、Fm为原变量指标X1、X2XP第一、第二、第m个主成分。根据以上分析得知: (1) Fi与Fj互不相关,即Cov(Fi,Fj) = 0,并有Var(Fi)=aiai,其中为X的协方差阵 (2)F1是X1,X2,
3、Xp的一切线性组合(系数满足上述要求)中方差最大的,即Fm是与F1,F2,Fm1都不相关的X1,X2,XP的所有线性组合中方差最大者。F1,F2,Fm(mp)为构造的新变量指标,即原变量指标的第一、第二、第m个主成分。 由以上分析可见,主成分分析法的主要任务有两点: (1)确定各主成分Fi(i=1,2,m)关于原变量Xj(j=1,2 , p)的表达式,即系数( i=1,2,m; j=1,2 ,p)。从数学上可以证明,原变量协方差矩阵的特征根是主成分的方差,所以前m个较大特征根就代表前m个较大的主成分方差值;原变量协方差矩阵前m个较大的特征值(这样选取才能保证主成分的方差依次最大)所对应的特征向
4、量就是相应主成分Fi表达式的系数,为了加以限制,系数启用的是对应的单位化的特征向量,即有= 1。 (2)计算主成分载荷,主成分载荷是反映主成分Fi与原变量Xj之间的相互关联程度: 二、主成分分析法的计算步骤主成分分析的具体步骤如下: (1)计算协方差矩阵计算样品数据的协方差矩阵:=(sij)pp,其中 i,j=1,2,p(2)求出的特征值及相应的正交化单位特征向量 的前m个较大的特征值l1l2lm0,就是前m个主成分对应的方差,对应的单位特征向量就是主成分Fi的关于原变量的系数,则原变量的第i个主成分Fi为:Fi =X主成分的方差(信息)贡献率用来反映信息量的大小,为:(3)选择主成分 最终要
5、选择几个主成分,即F1,F2,Fm中m的确定是通过方差(信息)累计贡献率G(m)来确定当累积贡献率大于85%时,就认为能足够反映原来变量的信息了,对应的m就是抽取的前m个主成分。(4)计算主成分载荷 主成分载荷是反映主成分Fi与原变量Xj之间的相互关联程度,原来变量Xj(j=1,2 , p)在诸主成分Fi(i=1,2,m)上的荷载 lij( i=1,2,m; j=1,2 ,p)。: 在SPSS软件中主成分分析后的分析结果中,“成分矩阵”反应的就是主成分载荷矩阵。(5)计算主成分得分 计算样品在m个主成分上的得分: i = 1,2,m实际应用时,指标的量纲往往不同,所以在主成分计算之前应先消除量
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- PCA 原理 步骤
限制150内