ImageVerifierCode 换一换
格式:PPT , 页数:27 ,大小:207KB ,
资源ID:13786812      下载积分:10 金币
快捷注册下载
登录下载
邮箱/手机:
温馨提示:
快捷下载时,用户名和密码都是您填写的邮箱或者手机号,方便查询和重复下载(系统自动生成)。 如填写123,账号就是123,密码也是123。
特别说明:
请自助下载,系统不会自动发送文件的哦; 如果您已付费,想二次下载,请登录后访问:我的下载记录
支付方式: 支付宝    微信支付   
验证码:   换一换

开通VIP
 

温馨提示:由于个人手机设置不同,如果发现不能下载,请复制以下地址【https://www.zixin.com.cn/docdown/13786812.html】到电脑端继续下载(重复下载【60天内】不扣币)。

已注册用户请登录:
账号:
密码:
验证码:   换一换
  忘记密码?
三方登录: 微信登录   QQ登录  

开通VIP折扣优惠下载文档

            查看会员权益                  [ 下载后找不到文档?]

填表反馈(24小时):  下载求助     关注领币    退款申请

开具发票请登录PC端进行申请

   平台协调中心        【在线客服】        免费申请共赢上传

权利声明

1、咨信平台为文档C2C交易模式,即用户上传的文档直接被用户下载,收益归上传人(含作者)所有;本站仅是提供信息存储空间和展示预览,仅对用户上传内容的表现方式做保护处理,对上载内容不做任何修改或编辑。所展示的作品文档包括内容和图片全部来源于网络用户和作者上传投稿,我们不确定上传用户享有完全著作权,根据《信息网络传播权保护条例》,如果侵犯了您的版权、权益或隐私,请联系我们,核实后会尽快下架及时删除,并可随时和客服了解处理情况,尊重保护知识产权我们共同努力。
2、文档的总页数、文档格式和文档大小以系统显示为准(内容中显示的页数不一定正确),网站客服只以系统显示的页数、文件格式、文档大小作为仲裁依据,个别因单元格分列造成显示页码不一将协商解决,平台无法对文档的真实性、完整性、权威性、准确性、专业性及其观点立场做任何保证或承诺,下载前须认真查看,确认无误后再购买,务必慎重购买;若有违法违纪将进行移交司法处理,若涉侵权平台将进行基本处罚并下架。
3、本站所有内容均由用户上传,付费前请自行鉴别,如您付费,意味着您已接受本站规则且自行承担风险,本站不进行额外附加服务,虚拟产品一经售出概不退款(未进行购买下载可退充值款),文档一经付费(服务费)、不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
4、如你看到网页展示的文档有www.zixin.com.cn水印,是因预览和防盗链等技术需要对页面进行转换压缩成图而已,我们并不对上传的文档进行任何编辑或修改,文档下载后都不会有水印标识(原文档上传前个别存留的除外),下载后原文更清晰;试题试卷类文档,如果标题没有明确说明有答案则都视为没有答案,请知晓;PPT和DOC文档可被视为“模板”,允许上传人保留章节、目录结构的情况下删减部份的内容;PDF文档不管是原文档转换或图片扫描而得,本站不作要求视为允许,下载前可先查看【教您几个在下载文档中可以更好的避免被坑】。
5、本文档所展示的图片、画像、字体、音乐的版权可能需版权方额外授权,请谨慎使用;网站提供的党政主题相关内容(国旗、国徽、党徽--等)目的在于配合国家政策宣传,仅限个人学习分享使用,禁止用于任何广告和商用目的。
6、文档遇到问题,请及时联系平台进行协调解决,联系【微信客服】、【QQ客服】,若有其他问题请点击或扫码反馈【服务填表】;文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“【版权申诉】”,意见反馈和侵权处理邮箱:1219186828@qq.com;也可以拔打客服电话:0574-28810668;投诉电话:18658249818。

注意事项

本文(《数据仓库与数据挖掘》(演示稿)第7章.ppt)为本站上传会员【pc****0】主动上传,咨信网仅是提供信息存储空间和展示预览,仅对用户上传内容的表现方式做保护处理,对上载内容不做任何修改或编辑。 若此文所含内容侵犯了您的版权或隐私,请立即通知咨信网(发送邮件至1219186828@qq.com、拔打电话4009-655-100或【 微信客服】、【 QQ客服】),核实后会尽快下架及时删除,并可随时和客服了解处理情况,尊重保护知识产权我们共同努力。
温馨提示:如果因为网速或其他原因下载失败请重新下载,重复下载【60天内】不扣币。 服务填表

《数据仓库与数据挖掘》(演示稿)第7章.ppt

1、Click to edit Master title style,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,复旦大学 软件学院,2004.04,数据仓库与数据挖掘,(第,7,章),1,第,7,章数据挖掘中的数据预处理,主要内容,数据预处理的基本功能,数据预处理的主要方法,数据清理,数据采样,数据集成与变换,数据约简,数据的概念分层,2,DM,的过程,(,1,),DW,的步骤:,数据准备:,数据集成,数据选择,预分析,挖掘,表述,评价,(,2,),DW,系统的结构:,用

2、户界面,结果输出,数据挖掘核心,知识库,数据仓库,数据库,文件系统,其他,数据源,ODBC,或其他专用数据库接口,3,数据准备阶段,:,数据的选择(选择相关的数据),净化(消除噪音、冗余数据),推测(推算缺失数据),转化(离散值数据与连续值数据之间的相互转换、数据值的分组分类、数据项之间的计算组合等),数据缩减(减少数据量),经过处理过的数据一般存储在数据仓库中。数据准备是否做得充分将影响到数据挖掘的效率和准确度以及最终模式的有效性。,数据挖掘的过程,4,数据挖掘的过程,挖掘阶段:该阶段是数据挖掘的核心步骤,也是技术难点所在。根据数据挖掘的目标,采用人工智能、集合论、统计学等方法,应用相应的数

3、据挖掘算法,分析数据并通过可视化工具表述所获得的模式或规则。,5,数据挖掘的过程,评价阶段:在数据挖掘中得到的模式可能是没有实际意义或没有使用价值的,也有可能不能准确反映数据的真实意义,甚至在某些情况下是与事实相反的,因此需要评估,确定哪些是有效的、有用的模式。评估可以根据用户多年的经验,有些模式也可以直接用数据来检验其准确性。,巩固和运用阶段:用户理解的、并被认为是符合实际和有价值的模式形成了知识。同时还要对知识进行一致性检查,解决与以前得到的知识互相冲突、矛盾的地方,使知识得到巩固。运用知识有两种方法:一种是只需看知识本身所描述的关系或结果,就可以对决策提供支持;另一种是要求运用知识对新的

4、数据进行分析,由此可能产生新的问题,而需要对知识作进一步的优化。,6,数据预处理的必要性,数据挖掘要求的数据:干净、准确、简洁、完整。,原始数据存在的问题:,杂乱性:来自多种数据库和文件系统,缺乏统一标准和定义。,冗余性:同一个事务在数据库中可能存在多个相同的物理描述。,不完整性:设计缺陷或人为原因造成数据丢失、不确定、不完整。,7,数据预处理的基本功能,数据清洗,数据集成,数据变换,数据约简,8,数据预处理的基本功能,数据清洗,功能:,去除源数据中的噪声数据和无关数据,重复数据处理,缺值数据处理,数据类型转换,方法:,有监督方法:有领域专家指导,无监督方法:样本数据训练算法,9,数据预处理的

5、基本功能,数据集成,功能:,数据的选择:从多数据源中选择数据,数据冲突处理:如字段同名异义、异名同义、长度不同。,数据不一致处理:如单位、命名、结构、含义不一致。,数据类型的选择,10,数据预处理的基本功能,数据变换,功能:,格式化:将元组集按照格式化条件合并,即对属性值量纲的归一化处理。,归纳:处理元组属性值之间的“,is-a”,语义关系。,多维数据组织:采用切片、旋转、投影等操作将原始数据按照多维立方体形式组织成为不同层次、不同粒度、不同维度的聚集。,11,数据预处理的基本功能,数据简化,功能:在对数据挖掘任务和原始数据充分理解的基础上,发现依赖于目标的表达数据的有用特征,从而尽可能地精简

6、数据量。,方法:,属性选择:属性剪枝、并枝、相关分析。,数据抽样:随机抽样、等间隔抽样、分层抽样。,12,数据预处理的主要方法,基于约略集的属性约简方法:按等价关系对属性集进行划分,求出最小约简集。,基于概念树的数据浓缩方法:将元组逐层归纳为概念树,并去除噪声数据。,基于信息论的数据泛化方法:数据立方体法、面向属性的归纳方法、最大熵方法。,基于统计分析的属性选取方法:主成分分析、回归分析、公共因素模型分析,找出特征属性。,遗传算法:高效进行数据聚类预处理。,13,数据清理,空缺值处理,忽略有空缺值的元组,人工填写空缺值,使用一个全局常量填充空缺值,使用属性的平均值填充空缺值,使用与给定元组属同

7、一类的所有样本的平均值填充空缺值,使用最可能的值填充空缺值,14,数据清理,噪声数据处理,噪声:测量变量中的随机错误或偏差。,数据平滑技术:,分箱方法:考察邻近数据(同一箱中)的值来平滑数据值。,聚类方法:通过聚类发现孤立点。,计算机与人工相结合方法:识别噪声数据。,回归分析:建立回归方程,识别噪声数据。,15,数据清理,不一致数据处理,数据不一致处理:,单位,命名,结构,含义,方法:,数据集成,数据变换,16,数据采样,数据采样:使用样本集代替整个数据集。,方法:,随机采样:使用随机函数。,分层采样:根据数据分布的不平衡性(密度)控制采样频率。,窗口采样:使用窗口保存一批数据作为学习算法的训

8、练样本集。,静态采样与动态采样:静态或动态确定样本集与母数据库的相似度。,17,数据集成,基本任务:将多个数据源中的数据结合起来存放在一致的数据存储(如数据仓库)中。,功能:,数据的选择:从多数据源中选择数据,数据冲突处理:如字段同名异义、异名同义、长度不同。,数据不一致处理:如单位、命名、结构、含义不一致。,数据类型的选择,18,数据集成,方法:,实体识别方法:利用元数据识别同名异义、异名同义的实体,冗余属性识别方法:利用相关分析方法,计算属性间的相关度,重复元组识别方法:同一个数据存放在多个相同的元组中,数据值不一致检测与处理方法:单位、命名、结构转换,19,数据变换,基本任务:将数据转换

9、成为适合于挖掘的形式。,方法:,数据平滑:去除数据中的噪声,分箱、聚类、回归数据清理,聚集:对数据进行汇总和聚集,为多粒度数据构造多维立方体数据归约,数据概化:使用功能分层,用高层概念替换低层原始数据数据归约,20,数据变换,方法:,规范化:将属性值按比例缩放使其落入一个小的特定区间加快分类规则挖掘、学习阶段的速度;最小,/,最大规范化、小数定标规范化等,属性构造:构造新的属性添加到属性集中提高精度和对高维数据结构的理解,有利于挖掘过程,21,数据约简,基本任务:将海量的源数据进行约简,但仍保持或接近源数据的完整性,使数据挖掘产生相同或几乎相同的结果。,数据约简的方法:,数据立方体聚集,维归约

10、数据压缩,数值压缩,离散化和概念分层,22,数据约简,数据立方体聚集,数据立方体存储多维数据,创建在最低层数据立方体的称为基本立方体,最高层抽象的数据立方体称为顶点立方体,较高层的数据立方体将减少结果数据。,数据立方体聚集即将感兴趣的实体提高其抽象层次,以减少结果数据,便于分析使用。,23,数据约简,维归约,基本任务:删除不相关的维或属性(数百个),以减少数据量。,方法:属性子集选择法,即找出最小属性集,使得数据的概论分布尽可能接近使用所有属性的原分布。,问题:,n,个属性有,2,n,个子集,,如何找到“好的”子集?,24,数据约简,维归约,属性子集选择法:压缩搜索空间的启发式算法,启发式方

11、法的技术:,逐步向前选择:从空属性集开始,选择最好的属性添加入属性集。,逐步向后删除:从属性全集开始,删除其中最差的属性。,向前选择和向后删除结合:每一步选择一个最好的属性,并在剩余的属性中删除一个最差的属性。,判定树归纳:删除不出现在判定树中的属性,25,数据压缩,基本任务:对数据进行编码和变换,得到数据的压缩表示,使用时进行解压缩,重新构造原数据(无损)或原数据的近似值(有损)。,方法:,离散余弦变换(,DCT,),离散小波变换(,DWT,),主成分分析(,PCA,),26,数据的概念分层,基本任务:利用离散化技术将属性域划分为区间,用区间标号代替实际的数据值,以减少属性值的数量。,方法:,分箱,直方图分析,聚类分析,基于熵的离散化,基于自然划分的数据分段,27,

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        抽奖活动

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服