资源描述
Click to edit Master title style,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,*,Click to edit Master title style,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,*,Click to edit Master title style,Click to edit Master text styles,Second level,Third level,Fourth level,Fifth level,*,*,数据挖掘与决议支持,王 星,wx99scy,Tel:86-10-62511333,数据挖掘与决策支持分析报告,第1页,自我介绍,王星,毕业于中国人民大学统计学院,获经济学博士学位。,中国人民大学统计学院数据挖掘中心副主任,年曾赴台湾辅仁大学管理学院进修3个月。,擅长SPSSClementine、SASEM等软件使用,具备较强市场研究和数据分析能力。,数据挖掘-客户关系管理科学与艺术作者,该书于201月出版,中国财政金融出版社。,数据挖掘与决策支持分析报告,第2页,今天我们不得不生活在全球化和信息技术革命影响下世界,企业要生存,只有两个选择:适应它或被他抛弃。,英特尔企业主席:安德鲁.格鲁夫,数据挖掘与决策支持分析报告,第3页,课程目标,数据挖掘产生与发展,数据挖掘与企业决议支持关系,数据挖掘一些基本工具与算法,数据挖掘流程,数据挖掘软件,数据挖掘与决策支持分析报告,第4页,1.数据挖掘产生与发展,数据挖掘与决策支持分析报告,第5页,数据?,文字,书籍,期刊,WWW,备忘录,刊载/参考,胶卷,照片,其它影像,广播,电视,电话通讯,数据库,数据挖掘与决策支持分析报告,第6页,数据挖掘技术由来,从技术角度来看:数据挖掘被称为继网络之后下一个技术热点;,从生产角度来看:因为人工费用提升,产品和服务成本降低,管理和服务过程信息化是必定。,从数据管理和利用来看:单纯存取功效不再适应,待管理数据量正在以指数增加。,数据挖掘与决策支持分析报告,第7页,纽约时报由60年代1020版扩张至现在100200版,最高曾达1572版;北京青年报也已是1648版;,国家图书馆有1000万册图书,一个企业就可能拥有这些数据;,统计流程控制经过成千上万个传感器不停读取和统计数据;,电话系统,网络系统一个月统计可能需要10,12,条统计超出1000,gigabyte,。,数据突出特点,数据挖掘与决策支持分析报告,第8页,产生问题,信息过量;,信息真假难以辨识;,信息安全难以确保;,信息形式不一致,难以统一处理。,数据挖掘与决策支持分析报告,第9页,进化,阶段,商业,问题,支持,技术,产品,厂家,产品,特点,数据搜集,(60年代),“过去十年中企业总收入是多少?”,计算机、磁带和磁盘,IBM,CDC,提供历史性、静态数据信息,数据访问,(80年代),“广州分企业去年三月销售额是多少?”,关系数据库,RDBMS,,结构化查询语言,SQL)ODBC,Oracle、Sybase、Informix、IBM、Microsoft,在统计级提供历史性、动态数据信息,数据仓库;决议支持,(90年代),“去年三月深圳销售是多少?广州据此可得出什么结论?”,联机分析处理,OLAP,多维数据库、数据仓库,Pilot、Comshare、Arbor、Cognos、Microstrategy,在各种层次上提供回溯、动态数据信息,数据挖掘,正在流行,“下个月广州销售会怎么样?为何?”,高级算法、多处理器计算机、海量数据库,Pilot、Lockheed、IBM、SGI、,其它初创企业,预测,模式,数据挖掘与决策支持分析报告,第10页,数据挖掘演变过程,机器学习,类神经网络,知识发觉,数据挖掘,60年代,70年代,80年代,90年代,数据挖掘与决策支持分析报告,第11页,数据能够产生商业价值,能够想象在老年杂志上登载怎样广告?,怎样预防信用卡盗用?,地质采矿,婴儿纸尿布和啤酒故事,数据挖掘与决策支持分析报告,第12页,数据挖掘定义,.,Data mining is the,non-trivial,process,of identifying valid,novel,potentially useful,and ultimately understandable,patterns,in data.,Fayyad,.,Data mining is the process of extracting previously unknown,comprehensible,and,actionable information,form large databases and using it to make,crucial business decisions,.,Zekulin,数据挖掘与决策支持分析报告,第13页,远古至今即存在,数据挖掘,月晕,知风,晚上起雾,第二天晴天,看到妈妈拿鞭子,逃,跑,這些在我們传统使用方法称之为:,经验法则,数据挖掘与决策支持分析报告,第14页,数据挖掘,-,从大量数据中寻找规律技术,是统计学、数据库技术和人工智能技术等综合。,数据挖掘与决策支持分析报告,第15页,数据挖掘,功效,分类:Decision Tree,Neural Network etc.,推估:Regression&Neural Network etc.,预测:Decision Tree,Neural Network etc.,关联分组:GRI,Apriori etc.,聚类:K-means&Kohonen Network,数据挖掘与决策支持分析报告,第16页,需要数据挖掘5条理由,Large number of records(cases)(10,8,-10,12,bytes),High dimensional data(variables)(10-10,4,attributes),Only a small portion,typically 5%to 10%,of the collected data is ever analyzed.,Data that may never be explored continues to be collected out of fear that something that may prove important in the future may be missing.,Magnitude of data precludes most traditional analysis(more on complexity later).,数据挖掘与决策支持分析报告,第17页,数据挖掘主要性,Technology Review杂志年公布改变未来十项新兴趋势:,机器与人脑接口,塑料晶体管,数据挖掘(Data mining),数字权利管理,生物测量学(Biometrics),语音识别处理,微光学技术(Microphotonics),破解程序代码(Untangling code),机器人设计,微应用流体学(Microfluidics),数据挖掘与决策支持分析报告,第18页,数据挖掘与数据查询,表面知识(,Shallow Knowledge):,能够利用数据库查询语言找到,全部使用信用卡购置烤箱某大型商场客户列表。,多维知识(,Multidimensional knowledge):,多表连接操作,跨国电信企业客户呼叫模式分析:话费清单,客户帐户数据等。,隐藏知识(,Hidden knowledge),将不良风险人和能按时还贷人区分开来。,地下知识(,Deep knowledge),数据挖掘与决策支持分析报告,第19页,电信企业长话业务数据分布,数据挖掘与决策支持分析报告,第20页,数据挖掘与教授系统,数据挖掘并不总是有效,尤其没有优质数据起源,数据挖掘能够被由一个或多个模仿教授处理问题程序部分代替。,教授系统,数据,数据挖掘工具,知识,规则,数据挖掘与决策支持分析报告,第21页,2.数据挖掘应用,数据挖掘与决策支持分析报告,第22页,数据挖掘,客,户,分,析,析,基,分,因,其它,保险客户,证券客户,银行客户,电信客户,零售客户,信用卡,储蓄卡,存折,按揭,借贷,人类基因,植物基因,动物基因,特殊群体基因,基因序列,基因表示谱,基因功效,基因制药,.,数据挖掘在中国内地市场规模未来五年内将达百亿,数据挖掘与决策支持分析报告,第23页,科学研究,天文学:,SKICAT,基因工程:,GRAIL,GeneID,Geneparser,人类基因,植物基因,动物基因,特殊群体基因,基因序列,基因表示谱,基因功效,基因制药,.,数据挖掘与决策支持分析报告,第24页,商业领域数据挖掘,作为研发工具:制药业,predict the effectiveness of surgical procedure,medical test,medication,改进生产过程:6,市场营销.,客户关系管理.,金融投资,欺诈甄别,数据挖掘与决策支持分析报告,第25页,Established Loyals,Share of customers,Share of profits,3%,8%,Developing Loyals I,Developing Loyals II,Borrowing Potentials,Card,bill,Multiple account holding is common,Long relationship time,High transaction activities,High phone banking usage,Share of customers,Share of profits,9%,44%,Highest asset balance across segments,25%of segment has high bank assets,Liabilities low,Share of customers,Share of profits,12%,13%,Highest level of multiple deposit account holding,Average account balance very high,Mean age is 45,Share of customers,Share of profits,10%,12%,All hold credit cards,Most have loans in small amounts,Deposit balance low,客户细分,数据挖掘与决策支持分析报告,第26页,Web,挖掘,文档自动分类,帮助寻找用户感兴趣新闻,设计电子新闻和垃圾邮件过滤系统,数据挖掘与决策支持分析报告,第27页,市场营销,Marketing,-whos likely to buy?,Forecasts,-what demand will we have?,Loyalty,-whos likely to defect?,Credit,-which loans were profitable?,Fraud,-when did it occur?,数据挖掘与决策支持分析报告,第28页,数据挖掘与决议支持,业务数据,交易数据,外部数据,数据仓库,决议支持系统,Marketing,Phone,Center,sales,IVR,(,MDBMS),数据分析,用户分析,行销管理,挑选客户名册,产品分析,应用系统,客服行销,数据挖掘与决策支持分析报告,第29页,3.数据挖掘流程(6步法),数据挖掘与决策支持分析报告,第30页,怎样定义有兴趣模式,从人口数据库中很轻易得到以下知识或规则:,假如“某人家庭角色是丈夫”=“此人性别是男性,”;,Data mining=“garbage in,garbage out”?,数据挖掘与决策支持分析报告,第31页,数据挖掘流程与美食制作,芦笋百合,数据挖掘与决策支持分析报告,第32页,六步之一:商业了解,商业目标,问题范围,可能处理方案以及各自优缺点,花费时间:20%30%,主要性:,电信行业几个主要营销问题,:,个别消费者,通话模式,高利润服务,数据挖掘与决策支持分析报告,第33页,六步之二:数据了解,数据概念描述(格式等);,搜集数据;,数据探索性研究;,花费时间:20%30%,主要性:,通话明细数据能够从以下几个渠道取得:,直接交换机统计(,direct switch recording),计费系统输入数据(,inputs into the billing system)。,数据仓储提供基础数据(,Data warehouse feeds)。,其它相关客户数据,数据挖掘与决策支持分析报告,第34页,六步之三:数据准备,花费时间:50%70%,主要性:,数据清理;,数据转换;,数据整合;,格式化数据,数据挖掘与决策支持分析报告,第35页,六步之四:建立模型与模式,数据描述与汇总,细分,分类,预测,关联,更深层次问题是:哪些客户对价格比价敏感,数据挖掘与决策支持分析报告,第36页,有监督数据挖掘(学习),用归纳形成概念模型,使用模型帮助区分结构相同对象。这类学习称为基于归纳有指导概念学习(,supervised learning),数据挖掘与决策支持分析报告,第37页,有监督数据挖掘模型例,依据历史行销统计,推测谁最有可能对我们下一次推荐产品做出,响应,。,依据经验,最适当医疗处方是什么?,下一个最有可能被,淘汰,机器是哪一个型号?,在未来六个月里,哪些客户最有可能,离开,?,依据历史欺诈,哪些交易行为最有可能发生,欺诈,?,某人申请信用卡或某项保险资格是否能够,获批,?,数据挖掘与决策支持分析报告,第38页,Diagonosis=,咽炎,No,Yes,Yes,No,淋巴肿,发烧,感冒,敏感症,数据挖掘与决策支持分析报告,第39页,无监督数据挖掘,无监督数据挖掘是在数据中寻找新模式。这些模式使我们更深入地了解数据,了解数据本身就有可能生成有用信息。,无监督数据挖掘和有监督数据挖掘在数据挖掘中是同等主要。无监督数据挖掘经惯用于数据探索阶段。比如,数据中有什么?它描述了怎样信息?数据中是否存在不寻常模式?数据对客户细分有怎样提议?,哪些产品应依据指定目录放在一起?,找到对书籍和音乐方面,有相同品位读者和听众。,为市场行销人员找到真正客户群体。,数据挖掘与决策支持分析报告,第40页,35.00=,Age=43.00,and Life Ins Promo=Yes,:rule accuracy 100.00%,:rule coverage 100.00%,35.00=Age=43.00,and Magazine Promo=Yes,:rule accuracy 85.71%,:rule coverage 85.71%,数据挖掘与决策支持分析报告,第41页,六步之五:模型评价,累计增益图,ROC,曲线,数据挖掘与决策支持分析报告,第42页,错误不对称,数据挖掘与决策支持分析报告,第43页,六步之六:结果公布,公布结果计划,监测和维护模型计划,报表公布,数据挖掘与决策支持分析报告,第44页,4.一个目录直销例子,数据挖掘与决策支持分析报告,第45页,目录直销业常见几个目标,增加用户响应度;,增加总收入;,降低邮寄费用;,增加利润;,激发潜在用户活力;,较高订单金额和较低退货率;,数据挖掘与决策支持分析报告,第46页,案例背景,SAM,是一家从事礼品、花卉以及提供园艺工具目录服务企业。这家企业在美国有以上成功经营历史,积攒了35610个客户,,SAM,发觉最近目录响应率在不停下降,企业希望能找到影响客户响应关键原因,同时希望扩展其客户群体。,数据挖掘与决策支持分析报告,第47页,RFM分析,R:Recency,F:Frequency,M:Monetary,数据挖掘与决策支持分析报告,第48页,第一步:定义变量:,R:Lstpurch:,自最终一次购置以来月数,F:Nunpurch:,最近36个月内购置次数,M:Totpurch:,最近36个月内消费总量,数据挖掘与决策支持分析报告,第49页,第二步:客户行为模式分布,60%以上客户很长时间没有购置产品,很大百分比客户过去一年里购置次数在2到4之间,大约85%客户少于5次,80%年度总消费金额在$100以下,几乎85%客户低于$300。,数据挖掘与决策支持分析报告,第50页,SAM,客户购置习惯分析,第三步:将响应率与这些原因进行比较:,比较方法:,一一比较,交叉列联,最近购置行为是一个影响响应率最为出众变量!,数据挖掘与决策支持分析报告,第51页,第四步:渗透分析,关键点,:,外部数据(人口数据):,年纪,居住时间等,客户百分比,市场百分比,X,100,渗透指数=,数据挖掘与决策支持分析报告,第52页,数据挖掘与决策支持分析报告,第53页,最终一步:,制订决议:目标市场定位于年纪在35-44岁客户。,Any Problem?,数据挖掘与决策支持分析报告,第54页,5.数据挖掘基本算法,数据挖掘与决策支持分析报告,第55页,Debt$40K,Q,Q,Q,Q,I,I,1,2,3,4,5,6,factor 1,factor 2,factor n,神经网络,Neural Networks,聚类分析,Clustering,Open,Accnt,Add New,Product,Decrease,Usage,?,Time,序列分析,Sequence Analysis,决议树,Decision Trees,倾向性分析,客户保留,客户生命周期管理,目标市场,价格弹性分析,客户细分,市场细分,倾向性分析,客户保留,目标市场,欺诈检测,关联分析,Association,市场组合分析,套装产品分析,目录设计,交叉销售,数据挖掘与决策支持分析报告,第56页,1)决议树模型,实例用“属性-值”对表示;,目标函数有离散输出值:分类问题;,有完整规则表示式,解释性强;,训练数据能够允许有错误或缺失存在;,数据挖掘与决策支持分析报告,第57页,例:垃圾邮件识别问题,Y,Y,Y,Y,Y,Y,Y,Y,Y,N,N,N,N,N,N,N,N,N,N,N,N,Y,Y,Y,Y,Y,N,N,¥%#*,等字符出现频数,?!+&等字符出现频数,数据挖掘与决策支持分析报告,第58页,2,),关联规则,(,Association Rule,),同一个交易中,一个,item,出,现,也会引发另一个,item,出,现,Association rule,例子,若用户购置面包,则他很可能也会购置牛奶,Association rule:,面包=牛奶,P(,牛奶|面包)概率值高,数据挖掘与决策支持分析报告,第59页,数据挖掘与决策支持分析报告,第60页,关联规则,可信度,(,Confidence),可信度为:,在,A,出,现,条件,下出,现,B,概率,可信度=,P,(,B,|,A,)=,P,(,A,B,)/,P,(,A,),比如:,数据库中交易纪录,t1:(,面包,牛奶,),t2:(,面包,.),t3:(,面包,牛奶,),t4:(),P(,牛奶|面包)=,P(,面包,牛奶),P(,面包),N(,面包,牛奶),N(,面包),=,数据挖掘与决策支持分析报告,第61页,关联规则,支持度,(,Support),关联规则,A,=,B,支持度,为:,A,与,B,同时出,现,概率,P,(,A,B,),例子:数据库中交易纪录以下:,t1:(,面包,牛奶,),t2:(,面包,.),t3:(,面包,牛奶,),t4:(),请问,:,面包=牛奶,支持度为多少?,数据挖掘与决策支持分析报告,第62页,3,)序列模式,用户通常在购置某类商品后,,经过一段时间,,会再购置另一类商品,比如:买过“,棉被、枕头、床单”,之后,经过一段时间,通常会再购置“,纸,尿裤、奶粉,”,数据挖掘与决策支持分析报告,第63页,序列模式例,用户代号,交易时间,购置物品代号,1,1,90/7/25,90/7/30,30 60,90,2,2,2,90/7/10,90/7/15,90/7/20,10,20,30,40,60,70,3,90/7/25,30,50,70,4,4,4,90/7/25,90/7/30,90/8/25,20,30,60,70,5,90/7/12,90,比如:,先买20,再买30,再买60,70,20,30 60,70,数据挖掘与决策支持分析报告,第64页,4).聚类,数据挖掘与决策支持分析报告,第65页,5).类神经网络,好处,对问题假定、要求较少。,能够实现特征空间较为复杂划分,缺点,训练速度慢,需要更多训练数据,无法对结果进行透彻了解,数据挖掘与决策支持分析报告,第66页,6.数据挖掘软件发展现实状况,数据挖掘与决策支持分析报告,第67页,二、数据挖掘软件发展,第一代系统与第二代相比因为不含有和数据管理系统之间有效接口,所以在数据预处理方面有一定缺点,第三、四代系统强调预言模型使用和在操作型环境布署,第二代系统提供数据管理系统和数据挖掘系统之间有效接口,第三代系统另外还提供数据挖掘系统和预言模型系统之间有效接口,当前,伴随新挖掘算法研究和开发,第一代数据挖掘系统依然会出现,第二代系统是商业软件主流,部分第二代系统开发商开始研制对应第三代数据挖掘系统,比如,IBM Intelligent Score Service。,第四代数据挖掘原型或商业系统还未见报导,数据挖掘与决策支持分析报告,第68页,第二代数据挖掘软件,特点,与数据库管理系统(,DBMS),集成,支持数据库和数据仓库,和它们含有高性能接口,含有高可扩展性,能够挖掘大数据集、以及更复杂数据集,经过支持数据挖掘模式(,data mining schema),和数据挖掘查询语言增加系统灵活性,经典系统如,DBMiner,,能经过,DMQL,挖掘语言进行挖掘操作,缺点,只重视模型生成,怎样和预言模型系统集成造成了第三代数据挖掘系统开发,数据挖掘与决策支持分析报告,第69页,数据挖掘软件发展,数据挖掘软件发展经历了三个阶段,独立数据挖掘软件,横向数据挖掘工具集,纵向数据挖掘处理方案,Gregory Piatetsky-Shapiro,观点,数据挖掘与决策支持分析报告,第70页,独立数据挖掘软件(95年以前),特点,独立数据挖掘软件对应第一代系统,出现在数据挖掘技术发展早期,研究人员开发出一个新型数据挖掘算法,就形成一个软件。,这类软件要求用户对详细算法和数据挖掘技术有相当了解,还要负责大量数据预处理工作。比如,C4.5,决议树,,,平行坐标可视化(,parallel-coordinate visualization)。,数据挖掘与决策支持分析报告,第71页,通用数据挖掘软件盛行,(95年开始),发展原因,伴随数据挖掘应用发展,人们逐步认识到数据挖掘软件需要和以下三个方面紧密结合:1)数据库和数据仓库;2)各种类型数据挖掘算法;3)数据清洗、转换等预处理工作。,伴随数据量增加,需要利用数据库或者数据仓库技术进行管理,所以数据挖掘系统与数据库和数据仓库结合是自然发展。,现实领域问题是各种多样,一个或少数数据挖掘算法难以处理,挖掘数据通常不符合算法要求,需要有数据清洗、转换等数据预处理配合,才能得出有价值模型,数据挖掘与决策支持分析报告,第72页,通用数据挖掘工具集(95年开始),特点,提供各种数据挖掘算法,包含数据转换和可视化,经典横向工含有,IBM Intelligent Miner,SPSS,Clementine,SAS,Enterprise Miner,SGI,MineSet,Oracle Darwin,等,数据挖掘与决策支持分析报告,第73页,第二代数据挖掘软件,DBMiner,数据挖掘与决策支持分析报告,第74页,第二代软件,SAS Enterprise Miner,数据挖掘与决策支持分析报告,第75页,第三代软件,SPSS Clementine,以,PMML,格式提供与预言模型系统接口,数据挖掘与决策支持分析报告,第76页,发展原因,伴随横向数据挖掘工具使用日渐广泛,人们也发觉这类工具只有精通数数据挖掘算法教授才能熟练使用,假如对算法不了解,难以得出好模型,从1999年开始,大量数据挖掘工具研制者开始提供纵向数据挖掘处理方案(,Vertical Solution),,即针对特定应用提供完整数据挖掘方案,对于纵向处理方案,数据挖掘技术应用多数还是为了处理一些特定难题,而嵌入在应用系统中,行业数据挖掘处理方案(99年开始),数据挖掘与决策支持分析报告,第77页,行业数据挖掘处理方案(99年开始),KD1(,主要用于零售业),Options&Choice(,主要用于保险业),HNC(,欺诈行为侦测),Unica Model 1(,主要用于市场营销),数据挖掘与决策支持分析报告,第78页,行业数据挖掘处理方案(99年开始),在证券系统中嵌入神经网络预测功效,在欺诈检测系统中嵌入欺诈行为分类/识别模型,在客户关系管理系统中嵌入客户成簇/分类功效或客户行为分析功效,在机器维护系统中嵌入监/检测或识别难以定性设备故障功效,在数据库营销中嵌入选择最可能购置产品客户功效,在机场管理系统中嵌入旅客人数预测、货运优化功效,在基因分析系统中嵌入,DNA,识别功效,在制造/生产系统中嵌入质量控制功效等,数据挖掘与决策支持分析报告,第79页,第四代数据挖掘软件,特点,当前移动计算越发显得主要,将数据挖掘和移动计算相结合是当前一个研究领域。,第四代软件能够挖掘嵌入式系统、移动系统、和普遍存在(ubiquitous)计算设备产生各种类型数据,第四代数据挖掘原型或商业系统还未见报导,PKDD2001上Kargupta发表了一篇在移动环境下挖掘决议树论文,Kargupta是马里兰巴尔摩州立大学(University of Maryland Baltimore County)正在研制CAREER数据挖掘项目标责任人,该项目研究期限是204月到年4月,目标是开发挖掘分布式和异质数据(Ubiquitous设备)第四代数据挖掘系统。,数据挖掘与决策支持分析报告,第80页,综合数据挖掘处理方案,各行业电子商务网站,算,法,层,商,业,逻,辑,层,行,业,应,用,层,商业,应用,商业,模型,挖掘,算法,CRM,产品推荐,客户细分,客户流失,客户利润,客户响应,关联规则、序列模式、分类、聚集、神经元网络、偏差分析,WEB,挖掘,网站结构优化,网页推荐,商品推荐,。,基因挖掘,基因表示路径分析,基因表示相同性分析,基因表示共发生分析,。,银行,电信,零售,保险,制药,生物信息,科学研究,。,相关,行业,数据挖掘与决策支持分析报告,第81页,三、数据挖掘软件现实状况,/5/14/5/24(,实际),/11/26/12/9(,预测),数据挖掘与决策支持分析报告,第82页,调查汇报(.6.3-6.16),数据挖掘与决策支持分析报告,第83页,大部分处于科研阶段,各大学和科研机构从事数据挖掘算法研究,国内著作数据挖掘方面书较少(翻译有),有一些企业在国外产品基础上开发特定应用,IBM Intelligent Miner,SAS Enterprise Miner,国内应该有自主知识产权数据挖掘软件,数据挖掘软件现实状况(,国内情况,),数据挖掘与决策支持分析报告,第84页,谢谢大家,数据挖掘与决策支持分析报告,第85页,
展开阅读全文