2021年统计.板块五.独立性检验.pdf
《2021年统计.板块五.独立性检验.pdf》由会员分享,可在线阅读,更多相关《2021年统计.板块五.独立性检验.pdf(12页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、1 统计.板块五.独立性检验一随机抽样1随机抽样:满足每个个体被抽到的机会是均等的抽样,共有三种经常采用的随机抽样方法:简单随机抽样:从元素个数为N的总体中不放回地抽取容量为n的样本,如果每一次抽取时总体中的各个个体有相同的可能性被抽到,这种抽样方法叫做简单随机抽样抽出办法:抽签法:用纸片或小球分别标号后抽签的方法 随机数表法:随机数表是使用计算器或计算机的应用程序生成随机数的功能生成的一张数表表中每一位置出现各个数字的可能性相同随机数表法是对样本进行编号后,按照一定的规律从随机数表中读数,并取出相应的样本的方法简单随机抽样是最简单、最基本的抽样方法系统抽样:将总体分成均衡的若干部分,然后按照
2、预先制定的规则,从每一部分抽取一个个体,得到所需要的样本的抽样方法抽出办法:从元素个数为N的总体中抽取容量为n的样本,如果总体容量能被样本容量整除,设Nkn,先对总体进行编号,号码从1到N,再从数字1到k中随机抽取一个数s作为起始数,然后顺次抽取第2(1)sksksnk,个数,这样就得到容量为n的样本如果总体容量不能被样本容量整除,可随机地从总体中剔除余数,然后再按系统抽样方法进行抽样系统抽样适用于大规模的抽样调查,由于抽样间隔相等,又被称为等距抽样分层抽样:当总体有明显差别的几部分组成时,要反映总体情况,常采用分层抽样,使总体中各个个体按某种特征分成若干个互不重叠的几部分,每一部分叫做层,在
3、各层中按层在总体中所占比例进行简单随机抽样,这种抽样方法叫做分层抽样分层抽样的样本具有较强的代表性,而且各层抽样时,可灵活选用不同的抽样方法,应用广泛2简单随机抽样必须具备下列特点:简单随机抽样要求被抽取的样本的总体个数N是有限的简单随机样本数n小于等于样本总体的个数N简单随机样本是从总体中逐个抽取的简单随机抽样是一种不放回的抽样简单随机抽样的每个个体入样的可能性均为nN3系统抽样时,当总体个数N恰好是样本容量n的整数倍时,取Nkn;若Nn不是整数时,先从总体中随机地剔除几个个体,使得总体中剩余的个体数能被样本容量n整除因为每个个体被剔除的机会相等,因而整个抽样过程中每个个体被抽取的机会仍然相
4、等,为Nn精品w o r d 学习资料 可编辑资料-精心整理-欢迎下载-第 1 页,共 12 页2 二频率直方图列出样本数据的频率分布表和频率分布直方图的步骤:计算极差:找出数据的最大值与最小值,计算它们的差;决定组距与组数:取组距,用极差组距决定组数;决定分点:决定起点,进行分组;列频率分布直方图:对落入各小组的数据累计,算出各小数的频数,除以样本容量,得到各小组的频率 绘制频率分布直方图:以数据的值为横坐标,以频率组距的值为纵坐标绘制直方图,知小长方形的面积组距频率组距频率频率分布折线图:将频率分布直方图各个长方形上边的中点用线段连接起来,就得到频率分布折线图,一般把折线图画成与横轴相连,
5、所以横轴左右两端点没有实际意义总体密度曲线:样本容量不断增大时,所分组数不断增加,分组的组距不断缩小,频率分布直方图可以用一条光滑曲线()yf x来描绘,这条光滑曲线就叫做总体密度曲线总体密度曲线精确地反映了一个总体在各个区域内取值的规律三茎叶图制作茎叶图的步骤:将数据分为“茎”、“叶”两部分;将最大茎与最小茎之间的数字按大小顺序排成一列,并画上竖线作为分隔线;将各个数据的“叶”在分界线的一侧对应茎处同行列出四统计数据的数字特征用样本平均数估计总体平均数;用样本标准差估计总体标准差数据的离散程序可以用极差、方差或标准差来描述极差又叫全距,是一组数据的最大值和最小值之差,反映一组数据的变动幅度;
6、样本方差描述了一组数据平均数波动的大小,样本的标准差是方差的算术平方根一般地,设样本的元素为12nxxx,样本的平均数为x,定义样本方差为222212()()()nxxxxxxsn,样本标准差22212()()()nxxxxxxsn简化公式:22222121()nsxxxnxn五独立性检验1两个变量之间的关系;常见的有两类:一类是确定性的函数关系;另一类是变量间存在关系,但又不具备函数关系所要求的确定性,它们的关系是带有一定随机性的当一个变量取值一定时,另一个变量的取值带有一定随机性的两个变量之间的关系叫做相关关精品w o r d 学习资料 可编辑资料-精心整理-欢迎下载-第 2 页,共 12
7、 页文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F
8、10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R
9、3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2
10、Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E
11、4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D
12、6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8
13、K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G33 系2散点图:将样本中的n个数据点()(1 2)iixyin,描在平面直角坐标系中,就得到了散点图散点图形象地反映了各个数据的密切程度,根据散点图的分布趋势可以直观地判断分析两个变量的关系3如果当一个变量的值变大时,另一个变量的值也在变大,则这种相关称为正相
14、关;此时,散点图中的点在从左下角到右上角的区域反之,一个变量的值变大时,另一个变量的值由大变小,这种相关称为负相关 此时,散点图中的点在从左上角到右下角的区域散点图可以判断两个变量之间有没有相关关系4统计假设:如果事件A与B独立,这时应该有()()()P ABP A P B,用字母0H表示此式,即0:()()()HP ABP A P B,称之为统计假设52(读作“卡方”)统计量:统计学中有一个非常有用的统计量,它的表达式为22112212211212()n n nn nn n n n,用它的大小可以用来决定是否拒绝原来的统计假设0H如果2的值较大,就拒绝0H,即认为A与B是有关的2统计量的两个
15、临界值:3.841、6.635;当23.8 4 1时,有95%的把握说事件A与B有关;当26.635时,有99%的把握说事件A与B有关;当23.841时,认为事件A与B是无关的独立性检验的基本思想与反证法类似,由结论不成立时推出有利于结论成立的小概率事件发生,而小概率事件在一次试验中通常是不会发生的,所以认为结论在很大程度上是成立的1独立性检验的步骤:统计假设:0H;列出22联表;计算2统计量;查对临界值表,作出判断2几个临界值:222()0.10(3.841)0.05(6.635)0.01PPP 2.706,22联表的独立性检验:如果对于某个群体有两种状态,对于每种状态又有两个情况,这样排成
16、一张22的表,如下:状态B状态B合计状态A11n12n1n状态A21n22n2n1n2nn如果有调查得来的四个数据11122122nnnn,并希望根据这样的4个数据来检验上述的两种状态A与B是否有关,就称之为22联表的独立性检验六回归分析精品w o r d 学习资料 可编辑资料-精心整理-欢迎下载-第 3 页,共 12 页文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1
17、M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W
18、7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3
19、文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10
20、M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T
21、5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1
22、G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G3文档编码:CB7E4F
23、10M1M2 HA8D6R3T5W7 ZI4A8K2Q1G34 1回归分析:对于具有相关关系的两个变量进行统计分析的方法叫做回归分析,即回归分析就是寻找相关关系中这种非确定关系的某种确定性回归直线:如果散点图中的各点都大致分布在一条直线附近,就称这两个变量之间具有线性相关关系,这条直线叫做回归直线2最小二乘法:记回归直线方程为:?yabx,称为变量Y对变量x的回归直线方程,其中ab,叫做回归系数?y是为了区分Y的实际值y,当x取值ix时,变量Y的相应观察值为iy,而直线上对应于ix的纵坐标是?iiyabx设x Y,的一组观察值为()iixy,1 2in,且回归直线方程为?yabx,当x取值ix
24、时,Y的相应观察值为iy,差?(12)iiyy in,刻画了实际观察值iy与回归直线上相应点的纵坐标之间的偏离程度,称这些值为离差我们希望这n个离差构成的总离差越小越好,这样才能使所找的直线很贴近已知点记21()niiiQyabx,回归直线就是所有直线中Q取最小值的那条这种使“离差平方和为最小”的方法,叫做最小二乘法用最小二乘法求回归系数ab,有如下的公式:1221?niiiniix ynxybxnx,?aybx,其中a b,上方加“”,表示是由观察值按最小二乘法求得的回归系数3线性回归模型:将用于估计y值的线性函数abx作为确定性函数;y的实际值与估计值之间的误差记为,称之为随机误差;将ya
25、bx称为线性回归模型产生随机误差的主要原因有:所用的确定性函数不恰当即模型近似引起的误差;忽略了某些因素的影响,通常这些影响都比较小;由于测量工具等原因,存在观测误差4线性回归系数的最佳估计值:利用最小二乘法可以得到?ab,的计算公式为1122211()()()()nniiiiiinniiiixxyyx ynx ybxxxn x,?aybx,其中11niixxn,11niiyyn由此得到的直线?yabx就称为回归直线,此直线方程即为线性回归方程其中?a,b分别为a,b的估计值,?a称为回归截距,b称为回归系数,?y称为回归值5相关系数:112222221111()()()()()()nniii
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 2021 统计 板块 独立性 检验
限制150内