回归分析的基本思想及其初步应用(5).ppt
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_1.gif)
![资源得分’ title=](/images/score_05.gif)
《回归分析的基本思想及其初步应用(5).ppt》由会员分享,可在线阅读,更多相关《回归分析的基本思想及其初步应用(5).ppt(22页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、第一章第一章 统计案例统计案例 线性回归模型线性回归模型y=y=bx+a+ebx+a+e增加了随机误差项增加了随机误差项e e,因,因变量变量y y的值由自变量的值由自变量x x和随机误差项和随机误差项e e共同确定,即共同确定,即自自变量变量x x只能解析部分只能解析部分y y的变化的变化。在统计中,我们也把自变量在统计中,我们也把自变量x x称为称为解析变量解析变量,因变,因变量量y y为为预报变量预报变量。我们可以用我们可以用相关指数相关指数R2来刻画回归的效果,其计算公式是来刻画回归的效果,其计算公式是显然,显然,R2的值越大,说明残差平方和越小,也就是说模型拟合的值越大,说明残差平方
2、和越小,也就是说模型拟合效果越好。效果越好。R2越接近越接近1,表示回归的效果越好(因为,表示回归的效果越好(因为R2越接近越接近1,表示解析,表示解析变量和预报变量的线性相关性越强)。变量和预报变量的线性相关性越强)。如果某组数据可能采取几种不同回归方程进行回归分析,如果某组数据可能采取几种不同回归方程进行回归分析,则可以通过比较则可以通过比较R R2 2的值来做出选择,即的值来做出选择,即选取选取R R2 2较大的模型作为较大的模型作为这组数据的模型这组数据的模型。总的来说:总的来说:相关指数相关指数R2是度量模型拟合效果的一种指标。是度量模型拟合效果的一种指标。在线性模型中,它在线性模型
3、中,它代表自变量刻画预报变量的能力代表自变量刻画预报变量的能力。1、残差、残差数据点和它在回归直线上相应位置的差异数据点和它在回归直线上相应位置的差异 称为相应于点(称为相应于点(x xi i,y yi i )的的残差残差。例:编号为例:编号为6 6的女大学生,计算随机误差的效应(残差)的女大学生,计算随机误差的效应(残差)2、残差平方和、残差平方和 把每一个残差所得的值平方后加起来,用数学符号表把每一个残差所得的值平方后加起来,用数学符号表示为:示为:称为称为残差平方和残差平方和在例在例1 1中,残差平方和约为中,残差平方和约为128.361128.361。编号编号12345678身高身高/
4、cm165165157170175165155170体重体重/kg4857505464614359残差残差-6.3732.6272.419-4.6181.1376.627-2.8830.382 我们可以利用图形来分析残差特性,作图时纵我们可以利用图形来分析残差特性,作图时纵坐标为残差,横坐标可以选为样本编号,或身高数坐标为残差,横坐标可以选为样本编号,或身高数据据,或体重估计值等,这样作出的图形称为,或体重估计值等,这样作出的图形称为残差图残差图。表表1-4列出了女大学生身高和体重的原始数据以及列出了女大学生身高和体重的原始数据以及相应的残差数据。相应的残差数据。使用公式使用公式 计算残差计算
5、残差残差图的制作及作用。残差图的制作及作用。坐标纵轴为残差变量,横轴可以有不同的选择;坐标纵轴为残差变量,横轴可以有不同的选择;若模型选择的正确,残差图中的点应该分布在以若模型选择的正确,残差图中的点应该分布在以横轴为心的带形区域;横轴为心的带形区域;对于远离横轴的点,要特别注意。对于远离横轴的点,要特别注意。身高与体重残差图异常点 错误数据 模型问题 几点说明:几点说明:第一个样本点和第第一个样本点和第6个样本点的残差比较大,需要确认在采集过程中是否有人为个样本点的残差比较大,需要确认在采集过程中是否有人为的错误。如果数据采集有错误,就予以纠正,然后再重新利用线性回归模型拟合数的错误。如果数
6、据采集有错误,就予以纠正,然后再重新利用线性回归模型拟合数据;如果数据采集没有错误,则需要寻找其他的原因。据;如果数据采集没有错误,则需要寻找其他的原因。另外,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这另外,残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高,回归方程的预报精度越高。样的带状区域的宽度越窄,说明模型拟合精度越高,回归方程的预报精度越高。用身高预报体重时,需要注意下列问题:用身高预报体重时,需要注意下列问题:1、回归方程只适用于我们所研究的样本的总体;、回归方程只适用于我们所研究的样本的总体;2、我们
7、所建立的回归方程一般都有时间性;、我们所建立的回归方程一般都有时间性;3、样本采集的范围会影响回归方程的适用范围;、样本采集的范围会影响回归方程的适用范围;4、不能期望回归方程得到的预报值就是预报变量的精确值。、不能期望回归方程得到的预报值就是预报变量的精确值。事实上,它是预报变量的可能取值的平均值。事实上,它是预报变量的可能取值的平均值。这些问题也使用于其他问题。这些问题也使用于其他问题。一般地,建立回归模型的基本步骤为:一般地,建立回归模型的基本步骤为:(1)确定研究对象,明确哪个变量是解析变量,哪个变量)确定研究对象,明确哪个变量是解析变量,哪个变量是预报变量。是预报变量。(2)画出确定
8、好的解析变量和预报变量的散点图,观察它)画出确定好的解析变量和预报变量的散点图,观察它们之间的关系(如是否存在线性关系等)。们之间的关系(如是否存在线性关系等)。(3)由经验确定回归方程的类型(如我们观察到数据呈线)由经验确定回归方程的类型(如我们观察到数据呈线性关系,则选用线性回归方程性关系,则选用线性回归方程y=bx+a).(4)按一定规则估计回归方程中的参数(如最小二乘法)。)按一定规则估计回归方程中的参数(如最小二乘法)。(5)得出结果后分析残差图是否有异常(个别数据对应)得出结果后分析残差图是否有异常(个别数据对应残差过大,或残差呈现不随机的规律性,等等),过存在残差过大,或残差呈现
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 回归 分析 基本 思想 及其 初步 应用
![提示](https://www.taowenge.com/images/bang_tan.gif)
限制150内