多元统计分析判别分析.ppt
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_05.gif)
《多元统计分析判别分析.ppt》由会员分享,可在线阅读,更多相关《多元统计分析判别分析.ppt(46页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、关于多元统计分析判别分析现在学习的是第1页,共46页1问题引入2思路点拨3判别分析方法4DNA序列分类问题的求解5. 参考文献目 录现在学习的是第2页,共46页 首先,我们来考虑一下2000年“网易杯”全国大学生数学建模竞赛的A题是关于“DNA序列分类”的问题 1问题引入现在学习的是第3页,共46页 人类基因组中的DNA全序列是由4个碱基A,T,C,G按一定顺序排成的长约30亿的序列,毫无疑问,这是一本记录着人类自身生老病死及遗传进化的全部信息的“天书”。但是,除了这四种碱基外,人们对它所包含的内容知之甚少,如何破译这部“天书”是二十一世纪最重要的任务之一。在这个目标中,研究DNA全序列具有什
2、么结构,由这4个字符排成的看似随机的序列中隐藏着什么规律,又是解读这部天书的基础,是生物信息学(Bioinformatics)最重要的课题之一。 现在学习的是第4页,共46页虽然人类对这部“天书”知之甚少,但也发现了DNA序列中的一些规律性和结构。例如,在全序列中有一些是用于编码蛋白质的序列片段,即由这4个字符组成的64种不同的3字符串,其中大多数用于编码构成蛋白质的20种氨基酸。又例如,在不用于编码蛋白质的序列片段中,A和T的含量特别多些,于是以某些碱基特别丰富作为特征去研究DNA序列的结构也取得了一些结果。此外,利用统计的方法还发现序列的某些片段之间具有相关性,等等。这些发现让人们相信,D
3、NA序列中存在着局部的和全局性的结构,充分发掘序列的结构对理解DNA全序列是十分有意义的。 现在学习的是第5页,共46页作为研究DNA序列的结构的尝试,试对以下序列进行分类:问题一:下面有20个已知类别的人工制造的序列(见附件1),其中序列标号110 为A类,11-20为B类。请从中提取特征,构造分类方法,并用这些已知类别的序列,衡量你的方法是否足够好。然后用你认为满意的方法,对另外20个未标明类别的人工序列(标号2140)进行分类,把结果用序号(按从小到大的顺序)标明它们的类别(无法分类的不写入): A类 ; B类 。现在学习的是第6页,共46页问题二:请对 182个自然DNA序列(http
4、:/ 看了这道题,我们应当从何处入手呢,我们应该怎样进行分析呢现在学习的是第7页,共46页2思路点拨细读全题对未知事物进行分类 问题的本 质对另外20个未标明类别的DNA序列进行分类 根据所给的20个已知类别的DNA序列所提供的信息 对182个自然DNA序列进行分类 现在学习的是第8页,共46页 如果将每一个DNA序列都看作样本,那么该问题就进一步提炼成一个纯粹的数学问题:设有两个总体(类) 和 ,其分布特征(来自各个总体的样本)已知,对给定的新品 ,我们需要判断其属于哪个总体(类)。 对于上面的数学问题,可以用很多成熟的方法来解决,例如: (1)BP神经网络; (2)聚类分析;(3)判别分析
5、;等等。 1G2GX现在学习的是第9页,共46页 如何选取方法是建模过程中需要解决的另外一个问题:BP神经网络是人工神经网络的一种,它通过对训练样本的学习,提取样本的隐含信息,进而对新样本的类别进行预测。BP神经网络可以用以解决上面的DNA序列分类问题,但是,如何提取特征、如何提高网络的训练效率、如何提高网络的容错能力、如何建立网络结构是能否成功解决DNA序列分类问题的关键所在;聚类分析和判别分析都是多元统计分析中的经典方法,都可以用来将对象(或观测值)分成不同的集合或类别,但是,聚类分析更侧重于“探索”对象(或观测值)的自然分组方式,而判别分析则侧重于将未知类别的对象(或观测值)“归结”(或
6、者说,分配)到已知类别中。显然,判别分析更适合用来解决上面的DNA序列分类问题。现在学习的是第10页,共46页3判别分析方法 判别分析是用于判别样品所属类别的一种多元统计分析方法。判别分析问题都可以这样描述:设有 个 维的总体 ,其分布特征已知(如已知分布函数分别为 或者已知来自各个总体的样本),对给定的一个新样品 ,我们需要判断其属于哪个总体。一般来说,根据判别规则的不同,可以得到不同的判别方法 ,例如,距离判别、贝叶斯(Bayes)判别、费希尔(Fisher)判别、逐步判别、序贯判别等。这里,我们简单介绍三个常用的判别方法:距离判别、贝叶斯(Bayes)判别和费希尔(Fisher)判别。
7、km12, ,kG GG12( ), ( ), , ( )kFx F xF xX现在学习的是第11页,共46页判 别 分 析 方 法1.距离判别2.贝叶斯(Bayes)判别3.费希尔(Fisher)判别4.判别分析模型的 显著性检验 现在学习的是第12页,共46页3.1 距离判别 距离判别的基本思想:样品 X离哪个总体的距离最近,就判断 X 属于哪个总体。 这里的“距离”是通常意义下的距离(欧几里得距离:在 m 维欧几里得空间 R 中,两点 与 的欧几里得距离,也就是通常我们所说的距离为 )吗? 带着这个疑问,我们来考虑这样一个问题 :TmxxxX),(21TmyyyY),(212222211
8、2)()()(),(mmYXYXYXYXd现在学习的是第13页,共46页21, GG),(21NX)6 ,(22NY 设有两个正态总体 , 和 , 现在有一个新的样品位于 A 处(参见图1) 1d2d 从图中不难看出: ,是否 A 处的样品属于总体 呢? 21d d1G图 1现在学习的是第14页,共46页 显然不是,因为从概率的角度来看,总体 的样本比较分散,而总体 的样本则非常集中,因此 处的样品属于总体 的概率明显大于属于总体 的概率,也就是说, 处的样品属于总体 的“可能性”明显大于属于总体 的“可能性”!这也说明了用欧几里得距离来度量样品到总体距离的局限性。因此,需要引入新的距离概念这
9、就是下面给出的马氏距离。2G1G2G1GA1G2GA2G现在学习的是第15页,共46页定义1(马氏距离):设总体 G 为 m 维总体 ( m 个因素或指标),其均值向量为 (这里 T 表示转置),协方差阵为 ,则样品 到总体 G 的马氏距离定义为Tm),(21mmij)(TmxxxX),(21)()(),(12XXGXdT现在学习的是第16页,共46页3.1.1 两总体的距离判别 先考虑两个总体( )的情况。设有两个总体 和 , 和 分别是 和 的协方差阵, 和 分别是 和 的均值。对于新的样品 ,需要判断它来自那个总体。 设来自 ( )的训练样本为其中 表示来自哪个总体, 表示来自总体 的样
10、本量。2k1G2G121G2G121G2GXiG2 , 1iTijmijijijxxxX),(212 , 1iinj, 2 , 1 iG现在学习的是第17页,共46页要判断新样品 来自哪个总体,一般的想法是分别计算新样品到两个总体的马氏距离 和 : 如果 则判定 ;反之,如果 则判定 : 即 (1) A. 时的判别方法21X),(12GXd),(22GXd),(),(2212GXdGXd1GX),(),(2212GXdGXd2GX2211222212,( , )( , ),( , )( , )X Gd XGd XGX Gd XGd XG if:if:现在学习的是第18页,共46页其中 , ,
11、记 为了得到更简单的判别规则,我们下面计算新样品到两个总体的马氏距离 和 的差221211112211121112211221(,)(,)()()()()2()2()()22()TTTTTTTdX GdX GXXXXXXX ),(12GXd),(22GXd)(2121)(211)()(XXWT现在学习的是第19页,共46页显然,判别规则(1)式等价于 (2)通常,称 为判别系数向量称 为线性判别函数。 注意判别准则(1)式或者(2)式将 维空间 划分成两部分: 和 也即 。距离判别的实质就是:给出空间 的一个划分 和 ,如果样品 落入 之中,则判定 ;如果样品 落入 之中,则判定 。12,(
12、) 0,( ) 0X GW XX GW Xif:if:)(XWmmR 0)(|1XWXD 0)(|2XWXD21DDRmmR1D2DX1D1GXX2D2GX现在学习的是第20页,共46页 当 时,根据判别准则(1)式,我们同样的给出判别函数 为相应的判别规则为 (3)B. 时的判别方法2121)(XW)()()()()(21221111XXXXXWTT12,( )0,:( )0XGW XXGif W Xif:现在学习的是第21页,共46页 在实际应用中,总体的均值和协方差阵一般是未知的,我们所知道的仅仅是一组样本或者观测值,在这种情况下,就需要利用数理统计的知识,对 进行估计。 利用已知样本,
13、易得 的无偏估计分别为C. 的估计 2121,2121,2121,111111njjXnX212221njjXnX11111111)(11njTjjXXXXnS21222222)(11njTjjXXXXnS现在学习的是第22页,共46页 对于多个总体的情况,可以类似于两个总体的处理过程,我们给出如下的步骤: 第一步:计算样品 到每个总体的马氏距离 ; 第二步:比较 的大小,将样品 判为距离最小的那个总体。 如果均值为: 和协方差: 未知,可以类似两个总体的情形运用训练样本来进行估计。这里不再赘述。 3.1.2 多总体的距离判别X), 2 , 1)(2kiXdi), 2 , 1)(2kiXdiX
14、), 2 , 1(kii), 2 , 1(kii现在学习的是第23页,共46页3.1.3 距离判别的不足 距离判别方法简单实用,容易实现,并且结论的意义明确。但是,距离判别没有考虑: (1)各总体本身出现的可能性在距离判别中没有考虑; (2)错判造成的损失在距离判别中也没有考虑。 在很多情况下,不考虑上面的两种因素是不合理的。贝叶斯(Bayes)判别方法克服了距离判别的不足。现在学习的是第24页,共46页与前面距离判别方法不同的是:所谓贝叶斯(Bayes)判别,就是在考虑各总体的先验概率和错判损失的情况下,给出空间 的一个划分: ,使得运用此划分来判别归类时,所带来的平均错判损失最小。3.2
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 多元 统计分析 判别分析
![提示](https://www.taowenge.com/images/bang_tan.gif)
限制150内