面试题-ETL.docx
《面试题-ETL.docx》由会员分享,可在线阅读,更多相关《面试题-ETL.docx(6页珍藏版)》请在第壹文秘上搜索。
1、在数据仓库项目中,数据探究阶段的主要目的是什么?答:在逻辑数据映射进行之前,须要首先对全部的源系统进行分析。对源系统的分析通常包括两个阶段,一个是数据探究阶段(),另一个是异样数据检测阶段。数据探究阶段包括以下内容:1 .收集全部的源系统的文档、数据字典等内容。2 .收集源系统的运用状况,如谁在用、每天多少人用、占多少存储空间等内容。3 .推断出数据的起始来源Oo4 .通过数据概况()来对源系统的数据关系进行分析。数据探究阶段的主要目的是理解源系统的状况,为后续的数据建模和逻辑数据映射打下坚实的基础。2. ?在过程中四个基本的过程分别是什么?答:数据仓库构建方法中,的过程和传统的实现方法有一些
2、不同,主要分为四个阶段,分别是抽取()、清洗()、一样性处理O和交付(),简称为。1 .抽取阶段的主要任务是:读取源系统的数据模型。连接并访问源系统的数据。改变数据捕获。抽取数据到数据打算区。2 .清洗阶段的主要任务是:清洗并增补列的属性。清洗并增补数据结构。清洗并增补数据规则。增补困难的业务规则。建立元数据库描述数据质量。将清洗后的数据保存到数据打算区。3. 一样性处理阶段的主要任务是:一样性处理业务标签,即维度表中的描述属性。一样性处理业务度量与性能指标,通常是事实表中的事实。去除重复数据。国际化处理。将一样性处理后的数据保存到数据打算区。4. 交付阶段的主要任务是:加载星型的和经过雪花处
3、理的维度表数据。产生日期维度。加载退化维度。加载子维度。加载1、2、3型的缓慢改变维度。处理迟到的维度和迟到的事实。加载多值维度。加载有困难层级结构的维度。加载文本领实到维度表。处理事实表的代理键。加载三个基本类型的事实表数据。加载和更新聚集。将处理好的数据加载到数据仓库。从这个任务列表中可以看出,的过程和数据仓库建模的过程结合的特别紧密。换句话说,系统的设计应当和目标表的设计同时起先。通常来说,数据仓库架构师和系统设计师是同一个人。3.举例说明各种过程中的元数据。答:元数据是项目组面对的一个特别重要的主题,对于整个数据仓库项目也是特别重要的一部分。对于元数据的分类和运用没有很确定的定义。通常
- 配套讲稿:
如PPT文件的首页显示word图标,表示该PPT已包含配套word讲稿。双击word图标可打开word文档。
- 特殊限制:
部分文档作品中含有的国旗、国徽等图片,仅作为作品整体效果示例展示,禁止商用。设计者仅对作品中独创性部分享有著作权。
- 关 键 词:
- 试题 ETL