数据仓库dw建设.doc
《数据仓库dw建设.doc》由会员分享,可在线阅读,更多相关《数据仓库dw建设.doc(9页珍藏版)》请在淘文阁 - 分享文档赚钱的网站上搜索。
1、1. 数据仓库概述经过多年IT的建立,信息对于企业的日常管理已经日益重要,并逐渐成为重要的信息资产,信息资产的管理已经成为日常管理中一个非常重要的环节。如何管理与利用好企业内部纷繁的数据也越来越成为信息管理的一项重要工作。在过去相当一段时间内,企业业务系统的构建主要围绕着业务的数据展开,应用的构建多是自下而上构建,主要以满足某个部门的业务功能为主,我们称之为业务处理的时代。这样的构建方式造成了一个个分立的应用,分立的应用导致了一个个的静态竖井。由于数据附属于应用,缺乏企业全局的单一视图,形成了一个个信息孤岛,分立的系统之间缺乏沟通,同样数据的孤岛导致只能获得片面的信息,而不是全局的单一视图。存
2、储这些信息的载体可能是各种异构或同构的关系型数据库,也有可能是XML、EXCEL等文件。因此,构建新一代的一体化平台提上了日程并最终促成全域数据的管理方式,目的是覆盖企业各个环节的关键业务数据,完善元数据管理,形成全局的数据字典、业务数据标准与统一的业务指标含义,能够灵活的获取企业业务数据的单一视图需要保证数据的一致性、完整性、准确性与及时性。数据的交换与共享主要发生在上下级组织机构之间或同级的不同部门之间。最终,这些数据可以为部队分析、决策支持多维分析、即席查询、数据挖掘等应用提供更及时、准确、有效的支持。数据仓库的目标是实现跨系统数据共享,解决信息孤岛,提升数据质量,辅助决策分析,提供统一
3、的数据效劳。同时,数据仓库的构建也面临着各种挑战,比方信息整合在技术上的复杂度、信息整合的管理本钱、数据资源的获取、信息整合的实施周期以及整合工程的风险等。2. 全域数据库总体架构全域数据库总体架构全域数据库总体的层次,最下面是根底架构层,主要包括支撑这一架构运行的主机系统、存储藏份系统、网络系统等内容。从下往上看,再上面是数据源层,既包括各个业务的关系型数据源、内容管理数据源也包括半构造化数据源比方XML、EXCEL等,也包括各个总队、支队的业务数据源。数据源层之上是“交换效劳体系,主要包括信息效劳总线与效劳总线两局部。信息效劳总线主要实现数据层的信息整合与数据转换,而效劳总线主要实现应用层
4、的信息交换与整合。信息效劳总线主要依托联邦、复制、清洗、转换等技术实现,其主要包括信息整合效劳与清洗转换加载效劳两局部。通过信息效劳总线的信息整合效劳数据联邦、复制,可以透明、实时的访问分布在总队与支队的各个业务系统中的各种同构、异构数据前提是拥有足够的权限。信息整合效劳在整个企业层面保证了数据的完整性与及时性。信息效劳主要使用两种技术来完成这一功能:联邦与复制。通过联邦功能可以把关系数据、半构造化数据如 Excel文件、XML 文件、Web 搜索引擎、MQ 查询与内容源组成一个逻辑数据库,对这些数据源中的表可以像操作本地数据库表一样进展操作,而不必关心我们操作的这些数据底层是什么数据源,物理
5、在什么位置。而针对大数据量的数据访问或高并发的访问,通常将源数据增量实时复制到本地,复制的实现是基于对源数据库的日志进展捕获,获取增量数据,并基于消息的机制将其复制到目的数据库,复制的过程中可以实现数据的合并、拆分、转换等操作。信息效劳总线主要完成数据的分析、清洗标准化、转换、加载等工作。数据清洗,主要是去除冗余数据,将零散字段合并成全局记录,并解决重叠与矛盾的数据,然后通过添加关系与层次构造完善丰富信息。首先面临的挑战就是如何更有效的识别现有的业务系统,包括业务系统使用的分类方法、层次构造、数据分布、数据字典等。如果数据字典不完整或缺失,就要通过方法找出其数据的存储构造以及各个表之间的主外键
6、关联、各表之间的转换关系等,同样,数据的分布情况同样可以使用分析功能来完成。在对现有数据足够了解的根底上完成了数据的分析,接下来就要制定数据的清洗规那么以及转换规那么,其中,清洗规那么又分为两种情况,一种清洗规那么是明确的,另一种清洗规那么是模糊的,比方不同系统中存储的地址信息,“南京市定淮门大街9号与“江苏省南京市下关区定淮门大街9号实际上是一个地址,但计算时机当成两个地址来处理。概率匹配功能与动态权重策略可以匹配创立高质量、准确的数据,并在整个数据域中一致地识别核心业务信息,如人名、位置、与时间。数据清洗、转换、加载效劳对保障数据的准确性与一致性非常重要。在不同的系统中,对同一业务会使用不
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 数据仓库 dw 建设
限制150内