电脑桌面
添加小米粒文库到电脑桌面
安装后可以在桌面快捷访问

商业智能平台研究:ETL中的数据质量控制VIP免费

商业智能平台研究:ETL中的数据质量控制_第1页
1/6
商业智能平台研究:ETL中的数据质量控制_第2页
2/6
商业智能平台研究:ETL中的数据质量控制_第3页
3/6
商业智能平台研究:ETL中的数据质量控制来源:本站原创|作者:cognoschina网编|分类:数据转换|2011-4-1915:30正文评论(0)数据质量一直是ETL工具的一个高级特性,为了解释清楚这个问题,让我们看看oracle的商业ETL工具OracleWarehouseBuilder在数据质量上是如何管理的。ETL难以成功有以下几个难点:1.数据仓库的数据来自于多个数据源,所以数据的一致性很难得到保证,很多情况下需要一种硬性的标准来决定数据的取舍问题.2.数据格式问题,例如数据缺失,超出数据范围,无效数据格式等等。3.出现错误之后没有正确的处理问题,导致数据的质量不断的下降。4.数据一致性问题,处于数据库性能考虑,有时候可能会有意的去掉一些外间或者检查约束。5.业务逻辑问题.由于数据库在最初设计时就不够严格和谨慎。我们怎么判断数据的质量好坏的呢,一般用户拿原有系统的显示方式查看某一查询条件的数据与用商业智能报表所产生出来的数据进行对比,看有多大的出入,这个可能需要原先系统有足够的能力显示这些数据并且商业智能工具的报表有足够强大的查询和报表展示能力,或者是用商业智能的报表与OLAP运行出来的报表进行对比,看有多大的出入,出入一般都是会存在的,因为数据不可能完全的准确,但是一定要搞清楚哪里数据出现了问题,并且尽量不要让这些误差扩大到用户无法接受的地步,否则就认为BI失败了。(咋同是一个工具做出来的,数据的出入就这么大呢?)oraclewarehousebuilder提供三个特性来使ETL的过程简单1.GraphicalDataProfiler可以查看数据的结构,语义,内容,异常,和大纲,数据规则,这就是在前一篇说的,kettle的数据管理没有oraclewarehousebuilder强大的特性.kettle也提供查看表结构,column的结构,但是它不会判断一个column是不是主键或外键,一个字符串的最小长度是多少,最大长度是多少,一个整数的长度是多少,一个double的精度是多少。2.CorrectionWizard把数据规则应用到你的ETL过程中,自动映射并更正,清理,转化数据,相当于oraclewarehousebuilder提供一些默认的值来帮助你更快的创建映射规则,这个功能也比kettle强大。3.DataAuditor获取数据规则并监控数据转换的过程。kettle也提供数据监控的机制,并把log记入下来,并告诉你重复的记录数,读写多少条记录,更新拒绝多少条记录,时间,速度,步骤是否成功等信息.oraclewarehousebuilder提供查看选中表的结构信息和数据信息数据归档编辑器有很多面板。这些面板显示已归档的对象和归档的结果。为了方便解释,可以将整个面板分成6个部分,分别是左上角的面板(有两个tab)叫做1号面板,左边中间的property面板,叫做2号面板,左下角的monitor面板,叫做3号面板,右上角的ProfileResultsCanvas面板(有10个tab),叫4号面板,右边中间的DataGridPanal,叫5号面板,右下角的DataRulePanal,叫6号面板。1号面板显示已归档的表、视图、物化视图(oracle10g新加的特性)、外部表、维度和事实等对象以及已经创建的任何更正模块的详细信息。2号面板显示与数据归档关联的属性的列表。使用该属性列表,您可以优化数据归档的参数;启用或禁用某些数据归档组件并启用选定表的数据规则归档。3号面板是监视器面板。该面板显示已提交的所有归档作业的进度。数据归档需要时间,所以可以在后台完成的作业,同时执行其他OracleWarehouseBuilder任务;当作业完成时,OracleWarehouseBuilder会发出通知,kettle在执行监控上提供的信息比oraclewarehousebuilder多一些,包括速度和时间,还可以看到你启动多少线程组和线程,线程进行到那一步都显示的出来。4号面板提供最多的信息,所以分成了10格tab,包含大量归档结果汇总的tab。5号面板显示数据的统计信息,某一个column出现的值,出现的次数,占的百分比,有了这个功能,如果出现了错误的数据,将可以更容易的看到和清除。6号面板显示数据规则。其中4号面板有10个tab,其中有几个tab非常有用。(看上面的图)DataTypetab详细说明表中每列的列名,数据格式,主要的数据类型,主要的数据类型所占的百分比,数据的长度,最大值和最小值,主要的长度,主要的长度所占的百分比,类型的精度。其中所...

1、当您付费下载文档后,您只拥有了使用权限,并不意味着购买了版权,文档只能用于自身使用,不得用于其他商业用途(如 [转卖]进行直接盈利或[编辑后售卖]进行间接盈利)。
2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。
3、如文档内容存在违规,或者侵犯商业秘密、侵犯著作权等,请点击“违规举报”。

碎片内容

商业智能平台研究:ETL中的数据质量控制

确认删除?
VIP
微信客服
  • 扫码咨询
会员Q群
  • 会员专属群点击这里加入QQ群
客服邮箱
回到顶部