资源描述
1.4 数据仓库和数据库有何不同?有哪些相似之处?
答:区别:数据仓库是面向主题,集成,不易更改且随时间变化数据集合,用来支持管理人员决策,数据库由一组内部有关数据和一组管理和存取数据软件程序构成,是面向操作型数据库,
是构成数据仓库源数据。它用表组织数据,采用 ER 数据模型。 相似:它们都为数据挖掘提供了源数据,都是数据组合。
1.3 定义下列数据挖掘功能:特性化、区别、关联和有关分析、预测聚类和演变分析。使用你熟悉现实生活数据库,给出每种数据挖掘功能例子。
答:特性化是一种目的类数据普通特性或特性汇总。例如,学生特性可被提出,形成所有大学计算机科学专业一年级学生轮廓,这些特性涉及作为一种高年级平均成绩(GPA:Grade point
aversge)信息,
尚有所修课程最大数量。
区别是将目的类数据对象普通特性与一种或各种对比类对象普通特性进行比较。例如,具备高GPA 学生普通特性可被用来与具备低GPA 普通特性比较。最后描述也许是学生一种普通可比较轮廓,就像具备高GPA 学生75%是四年级计算机科学专业学生,而具备低GPA 学生65%不是。
关联是指发现关联规则,这些规则表达一起频繁发生在给定数据集特性值条件。例如,一种数据挖掘系统也许发现关联规则为:major(X,“computing science”) ⇒ owns(X,“personal computer”)
[support=12%,confidence=98%] 其中,X 是一种表达学生变量。这个规则指出正在学习学生,12%
(支持度)主修计算机科学并且拥有一台个人计算机。这个组一种学生拥有一台个人电脑概率是
98%(置信度,或拟定度)。
分类与预测不同,由于前者作用是构造一系列能描述和区别数据类型或概念模型(或功能),而后者是建立一种模型去预测缺失或无效、并且普通是数字数据值。它们相似性是她们都是预测工具:
分类被用作预测目的数据类标签,而预测典型应用是预测缺失数字型数据值。
聚类分析数据对象不考虑已知类标号。对象依照最大花蕾内部相似性、最小化类之间相似性原则进行聚类或分组。形成每一簇可以被看作一种对象类。聚类也便于分类法组织形式,将观测组织成类分
层构造,把类似事件组织在一起。
数据演变分析描述和模型化随时间变化对象规律或趋势,尽管这也许涉及时间有关数据特性化、区别、关联和有关分析、分类、或预测,这种分析明确特性涉及时间序列数据分析、序列或
周期模式匹配、和基于相似性数据分析
2.3 假设给定数据集值已经分组为区间。区间和相应频率如下。
―――――――――――――――――――――――――――――――――――――
年龄 频率
―――――――――――――――――――――――――――――――――――――
1~5
200
5~15
450
15~20
300
20~50
1500
50~80
700
80~110
44
―――――――――――――――――――――――――――――――――――――计算数据近似中位数值。
解答: 先鉴定中位数区间:N=200+450+300+1500+700+44=3194;N/2=1597
∵ 200+450+300=950<1597<2450=950+1500;
∴ 20~50 相应中位数区间。
∴ median=32.97 岁。
2.2 假定用于分析数据包括属性age。数据元组age 值(以递增序)是:13,15,16,16,19,
20,20,21,22,22,25,25,25,25,30,33,33,35,35,35,35,36,40,45,46,52,
70。
答:(a) 该数据均值是什么?中位数是什么?
均值
=(13+15+16+16+19+20+20+21+22+22+25+25+25+25+30+33+33+35+35+35+35+36+40+45+46+52+70)/ 27
=29.96
中位数应是第14个,即x14=25=Q2。
(b) 该数据众数是什么?讨论数据峰(即双峰、三峰等)。
这个数集众数有两个:25 和35,发生在同样最高频率处,因而是双峰众数。
(c) 数据中列数是什么?
数据中列数是最大数和最小数均值。即:midrange=(70+13)/2=41.5。
(d) 你能(粗略地)找出数据第一种四分位数(Q1)和第三个四分位数(Q3)吗?
数据集第一种四分位数应发生在25%处,即在(N+1)/4=(27+1)/4=7 处。因此:Q1=20。而第三个四分位数应发生在75%处,即在3×(N+1)/4=21 处。因此:Q3=35
(e) 给出数据五数概括。
一种数据集分布5 数概括由最小值、第一种四分位数、中位数、第三个四分位数、和最大值构成。它给出了分布形状良好汇总+并且这些数据是:13、20、25、35、70。
(f) 画出数据盒图。
(g) 分位数—分位数图与分位数图不同之处是什么?
分位数图是一种用来展示数据值低于或等于在一种单变量分布中独立变量粗略比例。这样,她可以展示所有数分位数信息,而为独立变量测得值(纵轴)相对于它们分位数(横轴)被描绘出来。但分位数—分位数图用纵轴表达一种单变量分布分位数,用横轴表达另一单变量分布分位数。两个坐标轴显示它们测量值相应分布值域,且点按照两种分布分位数值展示。一条线(y=x)可画到图中+以增长图像信息。落在该线以上点表达在y 轴上显示值分布比x 轴相应等同分位数相应值分布高。反之,对落在该线如下点则低。
2.4 假设医院检测随机选取 18 个成年人年龄和身体脂肪数据,得到如下成果:
(a) 计算年龄和脂肪比例均值、中位数和原则差.
年龄均值=(23+23+27+27+39+41+47+49+50+ 52+54+54+56+57+58+58+60+61)/18=836/18=46.44,中位数= (50+52)/2=51,
原则差=方差平方根=开根号( 1/n[∑(Xi)2-1/n(∑Xi)2])=开根号 1/18[2970.44]=12.85.
脂肪比例均值=28.78,中位数=30.7,原则差= 8.99.
(b) 绘制年龄和脂肪比例盒图
(c) 依照这两个属性,绘制散布图,各 q-q 图
q-q 图 散布图
(d) 依照 z-score 规范化来规范化这两个属性(P46)
(e) 计算有关系数(皮尔逊积矩系数). 这两个变量是正有关还是负有关?
ra,b=∑ (ai-A)(bi-B)/Nσ Aσ B=( ∑ (aibi)-NAB) /Nσ Aσ B=( ∑ (aibi)-18*46.44*28.78)
/18*12.85*8.99=0.82
有关系数是 0.82。变量呈正有关。
3.3 使用习题 2.4 给出 age 数据回答下列问题:
(a) 使用分箱均值光滑对以上数据进行光滑,箱深度为 3。解释你环节。 评述对于给定数据,该技术效果。
(b) 如何拟定数据中离群点?
(c) 对于数据光滑,尚有哪些其她办法?解答:
(a) 使用分箱均值光滑对以上数据进行光滑,箱深度为 3。解释你环节。评述对于给定数据,
该技术效果。
用箱深度为 3 分箱均值光滑对以上数据进行光滑需要如下环节:
环节 1:对数据排序。(由于数据已被排序,因此此时不需要该环节。)环节 2:将数据划分到大小为 3 等频箱中。
箱 1:13,15,16 箱 2:16,19,20 箱 3:20,21,22箱 4:22,25,25 箱 5:25,25,30 箱 6:33,33,35箱 7:35,35,35 箱 8:36,40,45 箱 9:46,52,70
环节 3:计算每个等频箱算数均值。
环节 4:用各箱计算出算数均值替代每箱中每个值。
箱 1:44/3,44/3,44/3 箱 2:55/3,55/3,55/3 箱 3:21,21,21
箱 4:24,24,24 箱 5: 80/3 ,80/3, 80/3 箱 6: 101/3,101/3, 101/3
箱 7:35,35,35 箱 8:121/3,121/3,121/3 箱 9:56,56,56
(b) 如何拟定数据中离群点?
聚类办法可用来将相似点提成组或“簇”,并检测离群点。落到簇集外值可以被视为离群点。作为选取,一种人机结合检测可被采用,而计算机用一种事先决定数据分布来区别也许离群点。这些也许离群点能被用人工轻松检查,而不必检查整个数据集。
(c) 对于数据光滑,尚有哪些其她办法?
其他可用来数据光滑办法涉及别分箱光滑办法,如中位数光滑和箱边界光滑。作为选取,等宽箱可被用来执行任何分箱方式,其中每个箱中数据范畴均是常量。除了分箱办法外,可以使用回归技术拟合成函数来光滑数据,如通过线性或多线性回归。分类技术也能被用来对概念分层,这是通过将低档概念上卷到高档概念来光滑数据。
3.5 如下规范化办法值域是什么?
答:
(a) min-max 规范化。
值域是[new_min,new_max]。
(b) z-score 规范化。
值域是[(old_min-mean)/σ,(old_max-mean)/σ],总来说,对于所有也许数据集值域是(-∞,
+∞)。
(c) 小数定标规范化。
值域是(-1.0,1.0)。
3.7 使用习题2.4 给出age 数据,回答如下问题:
(a) 使用min-max 规范化将 age 值 35 变换到[0.0,1.0]区间。
(b) 使用 z-score 规范化变换 age 值 35,其中 age 原则差为 12.94 岁。
(c) 使用小数定标规范化变换 age 值35。
(d) 对于给定数据,你乐意使用哪种办法?陈述你理由。
解答:
3.9 假设12 个销售价格记录组已经排序如下:5,10,11,13,15,35,
50,55,72,92,204,215。使用如下每种办法将其划提成三个箱。
(a) 等频(等深)划分。
(b) 等宽划分。
(c) 聚类。 解答:
(a) 等频(等深)划分。
bin1
5,10,11,13
bin1
15,35,50,55
bin1 72,91,204,215
(b) 等宽划分。
每个区间宽度是:(215-5)/3=70
bin1
5,10,11,13,15,35,50,55,72
bin1
91
bin1
204,215
(c) 聚类。
咱们可以使用一种简朴聚类技术:用 2 个最大间隙将数据提成 3 个箱。
bin1
5,10,11,13,15
bin1
35,50,55,72,91
bin1
204,215
3.11 使用习题2.4 给出age 数据,
(a) 画出一种等宽为10 等宽直方图;
(b) 为如下每种抽样技术勾画例子: SRSWOR,SRSWR ,聚类抽样, 分层 抽样。使用大小为5 样本和层“青年“中年”和“老年。
解答:(a) 画出一种等宽为10 等宽直方图;
8
7
6
5
4
3
2
1
0
15 25 35 45 55 65
(b) 为如下每种抽样技术勾画例子: SRSWOR,SRSWR ,聚类抽样, 分层 抽样。使用大小为5 样本和层“青年“中年”和“老年。
元组:
T1
13
T10
22
T19
35
T2
15
T11
25
T20
35
T3
16
T12
25
T21
35
T4
16
T13
25
T22
36
T5
19
T14
25
T23
40
T6
20
T15
30
T24
45
T7
20
T16
33
T25
46
T8
21
T17
33
T26
52
T9
22
T18
35
T27
70
SRSWOR 和SRSWR:不是同次随机抽样成果可以不同,但前者因无放回因此不能有相似元组。
SRSWOR
(n=5)
SRSWR
(n=5)
T4
16
T7
20
T6
20
T7
20
T10
22
T20
35
T11
25
T21
35
T26
52
T25
46
聚类抽样:设起始聚类共有 6 类,可抽其中m 类。
Sample1
Sample2
Sample3
Sample4
Sample5
Sample6
T1
13
T6
20
T11
25
T16
33
T21
35
T26
52
T2
15
T7
20
T12
25
T17
33
T22
36
T27
70
T3
16
T8
21
T13
25
T18
35
T23
40
T4
16
T9
22
T14
25
T19
35
T24
45
T5
19
T10
22
T15
30
T20
35
T25
46
Sample5
Sample2
T6
20
T21
35
T7
20
T22
36
T8
21
T23
40
T9
22
T24
45
T10
22
T25
46
T1
13
young
T10
22
young
T19
35
middle age
T2
15
young
T11
25
young
T20
35
middle age
T3
16
young
T12
25
young
T21
35
middle age
T4
16
young
T13
25
young
T22
36
middle age
T5
19
young
T14
25
young
T23
40
middle age
T6
20
young
T15
30
middle age
T24
45
middle age
T7
20
young
T16
33
middle age
T25
46
middle age
T8
21
young
T17
33
middle age
T26
52
middle age
T9
22
young
T18
35
middle age
T27
70
senior
T4
16
young
T12
25
young
T17
33
middle age
T25
46
middle age
T27
70
Senior
4.3 假定数据仓库包括三维:time,doctor和patient;和两个度量:count和charge;其中,charge是医生对病人一次诊治收费。
(a) 列举三种流行数据仓库建模模式
答:三类模式普通用于建模数据仓库架构星形模型,雪花模型和事实星座模型。
(b) 使用(a)列举模式之一,画出上面数据仓库模式图
数据仓库星形模型
(C)由基本方体[day,doctor,patient]开始,为列出每位医生收费总数,应当执行哪些OLAP操作?沿课程(course)维从course_id“上卷”到department。
l 沿时间(time)维从 day “上卷”到 year。
l 取 time=,对维 time作“切片” 操作
l 沿病人(patient)维从 个别病人 “上卷”到 所有病人。
(d) 为得到同样成果,写一种SQL查询。假定数据存储在关系数据库中,其模式为
fee(day,month,year,doctor,hospital,patient,count,charge)。
答:SQL查询语句如下: select doctor,SUM(charge) from fee
where year= group by doctor
4.4 假定BigUniversity 数据仓库包括如下4 个维student(student_name,
area_id , major, status, university) , course(course_name, department) , semester(semester,year) 和instructor(dept,rank);2 个度量:count和avg_grade。 在最低概念层,度量avg_grade 存储学生实际课程成绩。在较高概念层, avg_grade 存储给定组合平均成绩。
(a) 为该数据仓库画出雪花形模式图。
(b) 由基本方体[student, course, semester, instructor] 开始, 为列出 BigUniversity 每个学生 CS 课程平均成绩, 应当使用哪些特殊 OLAP 操作。
(c) 如果每维有 5 层(涉及all),如“ student<major<status<university<all ”,该立方体包括多少方体?
解答:
a) 为该数据仓库画出雪花形模式图。雪花模式如图所示。
b) 由基本方体[student, course, semester, instructor] 开始,为列出 BigUniversity 每个学生 CS 课程平均成绩,应当使用哪些特殊 OLAP 操作。
这些特殊联机分析解决(OLAP )操作有:
i. 沿课程(course)维从 course_id “上卷”到department。
ii. 沿学生(student)维从 student_id “上卷”到university 。
iii. 取department= “ CS ” 和university= “ Big University ”, 沿课程
(course)维和学生(student)维切片。
iv. 沿学生(student)维从 university 下钻到student_name。
c) 如果每维有5 层(涉及 all,如“student<major<status<university<all
,”该
立方体包括多少方体?
这个立方体将包括54=625 个方体。
4.5 假定数据仓库包括4维:date,spectator,location,和game,和两个度量:count和charge;其中,charge是观众在给定日期观看节目付费。观众可以是学生、成年人或老年人,每类观众有不同收费原则。
(a)画出该数据仓库星形模式图。
答: 星形模式图如下:
b. 由基本方体[date,spectator,location,game]开始,为列出学生观众在GM_Place 总付费,应执行OLAP 操作:
l 沿时间(date)维从date_id “上卷”到 year。
l 沿时间(game)维从 game_id “上卷”到所有。
l 沿时间(location)维从location_id “上卷”到 location_name 。
l 沿时间(spectator)维从spectator_id “上卷”到 status 。
l 以 status="students",location name="GM Place" and year= 作转轴操作
4.6 数据仓库可以用星形模式或雪花模式建模。简略讨论这两种模式相似点和不同点,然后分析它们相对做优、缺陷。哪种模式更实用,给出你观点并陈述你理由。
答:星形模式或雪花模式相似点是它们包括一种事实表和某些维表。它们重要不同在于,雪花模式维表也许是规范化形式,以便减少了冗余,这种表易于维护并节约存储空间。然而,与巨大事实表相比,这种空间
节约可以忽视。此外,由于执行查询需要更多连接操作,雪花形构造也许减少浏览性能,这样,系统性能也许相对受到影响。星型模式长处是简朴、这使得它更有效,但它需要更多空间。因而,只要空间规定不是太大时,星形模式比雪花模式更好,由于普通效率比空间具备更高优先级。在工业上,有时也许将数据从一种雪花模式非规范化为星型模式以加快解决速度,另一种选取是保持雪花模式维表,然后相似数据当前顾客折叠为星形。
4.9
4.11
ROLAP·采用一个OLAP版务器,数据仓库的产生可以由一个使用汇总实车表的关系型或扩展的关系型数据侔管理系统(DBMS)实现这个实串表可以存储给定立方体的聚 数据和由给定数据立方休的揆式连接键指出的抽象级中的数据
MOLAP为了产生一个数据仓库,MOLAP技术使用多维数组结构来存估数据和多路数组聚 来计箕数据立方体已
HOLAP:HOL.廿技术的特色是应用一个关系数据库来存储数据和一些低层次的聚集并且应用一个MOLAP来存估商层次的聚 .
ii.上卷。
ROL.吁·沿一维用汇总的实审表上卷.我们在包含期望维的一个泛化的表中寻找记录e例如.从日到川上卷数据维,共中选择那些包含所有特定值的区1,ii]的日期的记录食记录中给定的测虽域的值,例如以美元计的销售盆.将会包含用于期望的上卷的部分和霹
MOLAP,在数据立方休中执行上卷,为得到期望的维直接茅爬到相应
的概念层例如.沿若地点维从城市上卷的国家.得到史泛化的数据. HOLAP,使用HOL心技术进行上卷的方法将会与ROL.tj>或MOLAP相似.主要体现在依靠在相应维的执行中所使用的技术令
iii下钻.
ROLAP`.我们使用汇总的举实表沿某一维下钻.是为了寻找表中的记录.这个表包含对期望维的一个泛化.例如.沿地点维从困家到省或者州下钻,选抒下一概念)县能枭低区域的记录,即对应包含所有特定值的地点.在这种桔况下、城市域可能包含所有的值.这个记录中给定的测虽域的值将会包含下钻所期望得到求和女例如c1oll邱_sold亢
5.1 5.2
4."召丈10棣墨本方伴只包含3个王本午元(I)(•,,女d,心 ds.d吐
(2)(d .b“九生,. d,.d心和(3)(d,,b,,“九···,.d“d,j,共中C平d,, boo#廷
且,,千心该立万伴芍夏囊怂加江
(.)完全败芍立方体中包含多少个非空方体?
(')究全它体包含多少个李空聚集(拿片本)午元?
(c) 如朵冰山立万体的条件公岭~叨21“,冰山立万汗包含多少个丰空素岸牢元?
(d) 竿元(如砰元包兄不存在牛元d使符d是牛元C的仲铢化(即d遍
过用非...出11 c中的".得到).并且d与,具白用开的度量生·芍寸方体是仅由芍牟元组戌的效珩立方体.诀丈士立方体宁勺多少个书华元?
解答,
(邑)元企敛符立方体中包含多少个非交方体?
2'`个,
仓)充士立万伴宁包含多少个李空索票(非&车}卒元?
(1) 袋一个午元可以产生2','一1个非空冢卖呐牛无.这样包括膏消愁的烹垒.
伐f迫共行过冥_31-#元.
(2) 我们'Ill心,个只交叠一次(共记了2次效)的华元,I•次年( .·...,..... d人心)个交叠两次,天记了3次蚁)的平元,这扦民们应去除总坎达5心'个父叠的午元.
(3) 这杆坟忙3丸产-沁-3=19>沪l个李空萦黑午元,
(c)如梨冰山立方体的冬件足飞叩?2声,冰山立方伴包含多少个丰交聚置年元?
(l)(...生心·,,;,.d,")打2个计数,因为它是由牟元1和江汪钮
(2)(.d, •.J,-·.心如)勺'}个it效,因为它是由华;;;l和总元2产生的; (3)(d厂,',d么'.,. J“d,d h2个U过因为它是由平元l和车元2产生的, (4)('. •, •,4..., 4心)白3个汁欢,因为它是由平元1、华;;;2和午元3
5.4 假定基本方体有三维A,B,C,其单元数如下:|A|=1000000,|B|=100,|C|=1000.假定每维均等地分块成 10
某些。
(a) 假定每维只有一层,画出完整立方体格。
答:完整立方体格如下图
(b) 如果每个立方体单元存储一种 4 字节度量,若立方体是稠密,所计算立方体有多大?
答:所计算立方体大小如下:
all:1
A:1,000,000; B:100; C:1,000; 小计:1,001,100
AB:1,000,000*100=100,000,000; BC:100*1,000=100,000;AC:1,000,000*1,000=1,000,000,000;小计:1,100,100,000
ABC:1,000,000*100*1,000=100,000,000,000
总和:1+1,001,100+1,100,100,000+100,000,000,000=101,101,101,101 * 4 = 404,404,404,404 字节
(C)指出空间需求量最小立方体中块计算顺序,并计算 2-D 平面计算所需要内存空间总量。
答:顺序计算,需要至少数量空间 B-C-A.如图所示:
计算二维平面需要总主内存空间是:
总空间 = (100×1,000) + (1,000,000 × 10) + (100 × 10,000) = 20,100,000 单元* 4字节/单元= 80,400,000 字节
6.3 Apriori 算法使用子集支持性质先验知识。
(a) 证明频繁项集所有非空子集也必要是频繁。
答:设s 是一种频繁项集,min_sup 是最小支持度阀值,任务有关数据D 是数据库事务集合,|D|是D 有事务量,则有 Support_count(s) = min_sup×|D|;
再设s’是s 非空子集,则任何包括项集s 事务将同样包括项集s’ ,即:
support_ count(s') support count(s) = min_sup ×|D|.
因此,s’也是一种频繁项集。
(b) 证明项集s 任意非空子集s’支持至少和s 支持度同样大。
答:设任务有关数据D是数据库事务集合,|D|是D 事务量,由定义得:
设s’是s非空子集,由定义得:
由(a)可知:support(s’) support(s)
由此证明,项集s任意非空子集s’支持至少和s支持度同样大。
(c) 给定频繁项集 l 和 l 子集 s ,证明规则置信度不也许不不大于
答:设 s 是 l 子集,则 设s’是s非空子集,则
由(b)可知:support_count(s') support count(s),
此外,confidence(s’) (l-s’)) confidence(s) (l- s))
因此,规则置信度不也许不不大于。
6.6 设数据库有 5 个事务。设min_sup =60%,min_conf=80%
(a) 分别使用Apriori 和FP 增长算法找出所有频繁项集。比较两种挖掘过程效率。
效率比较:Apriori 需多次扫描数据库而FP 增长建立FP 树只需一次扫描。在Apriori 算法中产生候选是昂贵(由
于联接),而FP 增长不产生任何候选。
(b) 列举所有与下面元规则匹配强关联规则(给出支持度S 和置信度C),其中,X 是代表顾客变量,itemi 是
表达项变量(如:“A”、“B”等):
答: k,o e [0.6,1]
e,o k [0.6,1]
6.8.数据库有 4 个事务,设min_sup =60%,min_conf=80%
(a)在item_category 粒度(例如,itemi 可以是“Milk”),对于下面规则模板
对最大k,列出频繁k 项集包括最大k 频繁k 项集所有强关联规则(涉及它们支持度S 和置信度c).
(b)在 粒度(例如:itemi 可以是“Sunset-Milk”)对于下面规则模板
对最大k,列出频繁k 项集(但不输出任何规则)。
6.14 下面相依表汇总了超级市场事务数据。其中,hot dogs 表达包括热狗事务,hot dogs 表达不包括热狗事务,hamburgers 表达包括汉堡包事务,hamburgers 表达不包括汉堡包事务,
(a) 假定挖掘出了关联规则 。给定最小支持度阀值 25%,最小置信度阀值 50%,该
关联规则是强规则吗?
答:依照规则, support = /5000 = 40%, confidence = /3000 = 66.7%. 该关联规则是强规则.
(b) 依照给定数据,买 hot dogs 独立于买humburgers 吗?如果不是,两者之间存在何种有关联系。
答:corr{hotdog;hamburger} = P({hot dog,hamburger})/(P({hot dog}) P({hamburger})=0.4/(0.5 × 0.6)
=1.33 > 1. 因此,买 hot dogs不是独立于买humburgers。两者存在正有关关系
8.1 简述决策树分类重要环节。
8.5 给定一种具备 50 个属性(每个属性包括 100 个不同值)5GB 数据集,而你台式机有 512M 内存。简述对这种大型数据集构造决策树一种有效算法。通过粗略地计算机主存使用阐明你答案是对的。
这个问题咱们将使用雨林算法。假设有C 类标签。最需要内存将是avc-set 为根树。计算avc-set 根节点,咱们扫描一次数据库,构建avc-list 每
50 个属性。每一种avc-list 尺寸是 100×C,avc-set 总大小是 100×C×50,对于合理C 将很容易适应 512 MB 内存,计算其她avc-sets 也是使用
类似办法,但她们将较小,由于很少属性可用。在并行计算时,咱们可以通过计算avc-set 节点来减少同一水平上扫描次数,使用这种每节点小
avc-sets 办法,咱们或允许以适应内存水平。
8.7 下表由雇员数据库训练数据构成。数据已泛化。例如:age “31...35”表达年龄在 31-35 之间。对于给定行,count 表达department,status,age 和salary 在该行具备给定值元组数。设status 是类标号属性。
(a)如何修改基本决策树算法,以便考虑每个广义数据元组(即每一行)count? (b)使用修改算法,构造给定数据决策树。
(c) 给定一种数据元组,它在属性department,age 和salary 值分别为“systems”,“26..30”,和“46K.. 50K”。该元组 status 朴素贝叶斯分类是什么?
9.2 支持向量机(SVM)是一种具备高精确率分类办法。然而,在使用大型数据元组集进行训练时,SVM 解决速
度很慢。讨论如何克服这一困难,并为大型数据集有效SVM 算法。
展开阅读全文