数据统计分析模型优秀PPT.ppt
《数据统计分析模型优秀PPT.ppt》由会员分享,可在线阅读,更多相关《数据统计分析模型优秀PPT.ppt(15页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、参考书施雨,李耀武编,概率论与数理统计应用,西安交通高校出版社梅长林,范金成编,数据分析方法,高等教化出版社,王学民编,应用多元统计分析,上海财经高校出版社方开泰编,运用多元统计分析,华东师范高校出版社统计软件SAS(StatisticalAnalysisSystem)SPSS(StatisticalPackagefortheSocialScience)R数据统计分析常用模型方差分析方差分析回来分析回来分析判别分析判别分析聚类分析聚类分析主成分分析主成分分析相关分析(典型相关分析)相关分析(典型相关分析)因子分析因子分析列联表分析列联表分析时间序列分析时间序列分析例子例例1:为了比较同一类型的
2、三种不同食谱的养分:为了比较同一类型的三种不同食谱的养分效果,将效果,将19只幼鼠随机地分为三组,每只分只幼鼠随机地分为三组,每只分为为8只、只、4只、只、7只,各接受这三种食谱喂养。只,各接受这三种食谱喂养。假定其他条件均保持相同,假定其他条件均保持相同,12周后测得其体周后测得其体重增加量如下表所示,是比较这三种食谱的重增加量如下表所示,是比较这三种食谱的养分效果是否有显著差异养分效果是否有显著差异食谱食谱体重增加量体重增加量甲甲164190203205206214228257乙乙185197201231丙丙187212215220248265281例子例例2:为了研制一种治疗枯草热病的药
3、物,将为了研制一种治疗枯草热病的药物,将两种成分(两种成分(A和和B)各按三种不同剂量(低、)各按三种不同剂量(低、中、高)混合,将中、高)混合,将36位自愿受试患者随机位自愿受试患者随机分为分为9组,每组组,每组4人服用各种剂量回合下的人服用各种剂量回合下的药物,记录其病情缓解的时间(单位:小药物,记录其病情缓解的时间(单位:小时)如下表所示,试分析两种成分及交互时)如下表所示,试分析两种成分及交互作用对病情缓解的时间是否有显著影响。作用对病情缓解的时间是否有显著影响。例子AB 低剂量中剂量高剂量低剂量 2.42.72.32.54.64.24.94.74.84.54.44.6低剂量 5.85
4、.25.55.38.99.18.79.09.19.38.79.4低剂量 6.15.75.96.29.910.510.610.113.513.013.313.2例子例例3:费希尔(费希尔(Fisher)于)于1936年发表了关年发表了关于鸢尾花于鸢尾花(Iris)的数据。数据是对的数据。数据是对3种鸢尾花:种鸢尾花:刚毛鸢尾花(第刚毛鸢尾花(第1组)、变色鸢尾花(第组)、变色鸢尾花(第2组)和费吉尼亚鸢尾花(第组)和费吉尼亚鸢尾花(第3组)各抽取一组)各抽取一个容量为个容量为50的样本,测量其花萼长的样本,测量其花萼长x1,花萼花萼宽宽x2,花瓣长,花瓣长x3,花瓣宽,花瓣宽x4,单位为,单位为
5、mm,数据如下表所示。假定有新样品,数据如下表所示。假定有新样品(x1,x2,x3,x4)=(62.35,58,18),试判别该试判别该样品属于哪种鸢尾花。样品属于哪种鸢尾花。例子编号品种萼长x1萼宽x2瓣长x3瓣宽x41150331422146341435126528461552262224515101364285622150363336025例子例例4:2000年全国高校生数学建模竞赛年全国高校生数学建模竞赛A题题DNA序列分类序列分类2000年年6月,人类基因组支配中月,人类基因组支配中DNA全序列草图完成,预料全序列草图完成,预料2001年可以完成精确的年可以完成精确的全序列图,此后人
6、类将拥有一本记录着自身生老病死及遗传进化的全部信息的全序列图,此后人类将拥有一本记录着自身生老病死及遗传进化的全部信息的“天书天书”。这本大自然写成的。这本大自然写成的“天书天书”是由是由4个字符个字符A,T,C,G按确定依次排成的长约按确定依次排成的长约30亿亿的序列,其中没有的序列,其中没有“断句断句”也没有标点符号,除了这也没有标点符号,除了这4个字符表示个字符表示4种碱基以外,人们种碱基以外,人们对它包含的对它包含的“内容内容”知之甚少,难以读懂。破译这部世界上最巨量信息的知之甚少,难以读懂。破译这部世界上最巨量信息的“天书天书”是是二十一世纪最重要的任务之一。在这个目标中,探讨二十一
7、世纪最重要的任务之一。在这个目标中,探讨DNA全序列具有什么结构,由这全序列具有什么结构,由这4个字符排成的看似随机的序列中隐藏着什么规律,又是解读这部天书的基础,是生物个字符排成的看似随机的序列中隐藏着什么规律,又是解读这部天书的基础,是生物信息学(信息学(Bioinformatics)最重要的课题之一。)最重要的课题之一。虽然人类对这部虽然人类对这部“天书天书”知之甚少,但也发觉了知之甚少,但也发觉了DNA序列中的一些规律性和结构。序列中的一些规律性和结构。例如,在全序列中有一些是用于编码蛋白质的序列片段,即由这例如,在全序列中有一些是用于编码蛋白质的序列片段,即由这4个字符组成的个字符组
8、成的64种不种不同的同的3字符串,其中大多数用于编码构成蛋白质的字符串,其中大多数用于编码构成蛋白质的20种氨基酸。又例如,在不用于编码种氨基酸。又例如,在不用于编码蛋白质的序列片段中,蛋白质的序列片段中,A和和T的含量特殊多些,于是以某些碱基特殊丰富作为特征去探的含量特殊多些,于是以某些碱基特殊丰富作为特征去探讨讨DNA序列的结构也取得了一些结果。此外,利用统计的方法还发觉序列的某些片段序列的结构也取得了一些结果。此外,利用统计的方法还发觉序列的某些片段之间具有相关性,等等。这些发觉让人们信任,之间具有相关性,等等。这些发觉让人们信任,DNA序列中存在着局部的和全局性的序列中存在着局部的和全
9、局性的结构,充分发掘序列的结构对理解结构,充分发掘序列的结构对理解DNA全序列是特别有意义的。目前在这项探讨中最全序列是特别有意义的。目前在这项探讨中最一般的思想是省略序列的某些细微环节,突出特征,然后将其表示成适当的数学对象。一般的思想是省略序列的某些细微环节,突出特征,然后将其表示成适当的数学对象。这种被称为粗粒化和模型化的方法往往有助于探讨规律性和结构。这种被称为粗粒化和模型化的方法往往有助于探讨规律性和结构。作为探讨DNA序列的结构的尝试,提出以下对序列集合进行分类的问题:1)下面有20个已知类别的人工制造的序列(见下页),其中序列标号110为A类,11-20为B类。请从中提取特征,构
10、造分类方法,并用这些已知类别的序列,衡量你的方法是否足够好。然后用你认为满足的方法,对另外20个未标明类别的人工序列(标号2140)进行分类,把结果用序号(按从小到大的依次)标明它们的类别(无法分类的不写入):A类_;B类_。请具体描述你的方法,给出计算程序。假如你部分地运用了现成的分类方法,也要将方法名称精确注明。这40个序列也放在如下地址的网页上,用数据文件Art-model-data标识,供下载:网易163教化频道在线试题;教化网:cbi.pku.eduNewmcm2000教化网:csiam.edu/mcm例子2)在同样网址的数据文件Nat-model-data中给出了182个自然DNA
11、序列,它们都较长。用你的分类方法对它们进行分类,像1)一样地给出分类结果。提示:衡量分类方法优劣的标准是分类的正确率,构造分类方法有很多途径,例如提取序列的某些特征,给出它们的数学表示:几何空间或向量空间的元素等,然后再选择或构造适合这种数学表示的分类方法;又例如构造概率统计模型,然后用统计方法分类等。例子Art-model-data1.aggcacggaaaaacgggaataacggaggaggacttggcacggcattacacggaggacgaggtaaaggaggcttgtctacggccggaagtgaagggggatatgaccgcttgg2.cggaggacaaacgggat
12、ggcggtattggaggtggcggactgttcggggaattattcggtttaaacgggacaaggaaggcggctggaacaaccggacggtggcagcaaagga3.gggacggatacggattctggccacggacggaaaggaggacacggcggacatacacggcggcaacggacggaacggaggaaggagggcggcaatcggtacggaggcggcgga4.atggataacggaaacaaaccagacaaacttcggtagaaatacagaagcttagatgcatatgttttttaaataaaatttgtattattatggt
13、atcataaaaaaaggttgcga5.cggctggcggacaacggactggcggattccaaaaacggaggaggcggacggaggctacaccaccgtttcggcggaaaggcggagggctggcaggaggctcattacggggag6.atggaaaattttcggaaaggcggcaggcaggaggcaaaggcggaaaggaaggaaacggcggatatttcggaagtggatattaggagggcggaataaaggaacggcggcaca7.atgggattattgaatggcggaggaagatccggaataaaatatggcggaaaga
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 数据 统计分析 模型 优秀 PPT
限制150内