收藏本站
《吉林大学》 2004年
收藏 | 手机打开
二维码
手机客户端打开本文

基于粗糙集的数据挖掘方法研究

崔广才  
【摘要】:近年来,数据挖掘引起了信息产业界的极大关注,其主要原因是存在大量可供使用的数据,并且迫切需要将这些数据转换成有用的信息和知识。 粗糙集理论对于人工智能和认知科学是十分重要的,从它一提出来就受到到模糊数学创始人 Zadeh 的重视和高度评价,并将其列入他新提倡的软计算的基础理论之一。将粗糙集应用于数据挖掘领域,能提高对大型数据库中的不完整数据进行分析和学习的能力,具有广泛的应用前景和实用价值。 属性约简是粗糙集理论中的一个重要课题。由于大型数据库中常常包含许多对发现规则来讲是冗余的、不必要的属性,研究人员发现,如果能将冗余属性删除,将会大大提高系统潜在知识的清晰度,降低发现规则的时间复杂性,提高发现效率。 对于大型数据库中的海量数据,更需要的是增量地更新数据挖掘结果,而不是从每次更新的数据库重新进行挖掘。这种算法渐增地进 WP=121 行知识更新,修正和加强先前业已发现的知识。增量算法是提高学习效率的一个重要算法之一。在数据挖掘中使用增量算法,不仅复杂度较小,而且可以通过增加实例修正已有的规则集。 为解决上述问题,本文研究了一些基于粗糙集和遗传算法的数据挖掘方法,主要工作包括: 1.研究了数据挖掘的原理和现状,当前的数据挖掘方法已综合了数据库、人工智能、统计学、模式识别、机器学习、数据分析等众多领域的研究成果。本文从数据挖掘和知识分类的角度出发,探讨了数据挖掘的相关概念、工作步骤和关键技术。数据挖掘(DM)是指从大量的原始数据中发现隐含的、未知的、有用的知识的非平凡过程。简单的说,就是从数据到知识的过程。在数据挖掘系统中数据库被分为两部分,一部分是训练集,一部分是测试集。通过使用训练集,进行一个学习过程且获得相应的知识模式。工作步骤主要包括:数据准备、实际的挖掘、规则表述。在此基础上将数据挖掘和知识发现、在线分析等进行了比较,指出数据挖掘是从存放在数据库、数据仓库或其他信息库中的大量数据中挖掘有趣知识的过程。从数据分析的角度来看,OLAP位于较浅的层次,而DM则处于较深的位置。数据挖掘方法主要有:决策树、神经网络、模糊论、遗传算法、贝叶斯网络和粗糙集等方法。通过总结数据挖掘的方法,得出数据挖掘系统的模型。 2.深入分析了粗糙集的基本理论、属性约简的基本方法与算法、遗传算法的基本理论。粗糙集理论是一种新的处理模糊和不确定性知识的数学工具。其主要思想就是在保持分类能力不变的前提下,通过知识约简导出问题的决策或分类规则。粗糙集的核心问题是知识的约简和获取,这离不开一系列的算法作支撑,包括求等价关系、求上下近似、判断属性的重要性、求核、属性约简等,其中属性约简是粗糙集用于数据分析的主要手段。约简算法的设计和实现是粗糙集研究的 WP=122 重要内容之一。讨论了知识约简与知识依赖关系,知识表达系统和决策表的关系,探讨和比较了多种属性约简方法的实现原理,给出了各方法的优缺点。求所有约简属性集的问题实质是一个属性组合情况的搜索问题,用一些启发式规则对搜索算法进行引导,将大大降低算法的复杂度。基于属性重要性和频度的启发式约简算法需要计算决策表的核,而当决策表的属性较多时,决策表可能没有核,从而使该算法失去较好的起点。此外由于引入了用户偏好集,使算法执行前可人为指定某些人主观认为比较重要的属性加入约简,使得算法具有较高的准确性和较强的伸缩性。可是用这种方法得出的约简往往包含很多属性,使得所得到的规则前提条件很长。由于引入用户偏好集,算法最后所得的约简可能还有多余属性,并不符合约简的定义。深入研究了遗传算法实现的共性问题,并给出了各类算子的设计和实现方法。本文提出对选择算子的改进,在执行选择算子时,首先对种群个体进行分类,每类中的个体是相同的,然后对每类个体都计算适应值,若有多类个体的适应值同时为最大,则对适应值最大的几个类的个体数目进行修正,使这几类个体在种群中的数目大致相等,然后再用旋转盘算法对种群中的个体进行选择。 3.研究了把信息论应用于决策信息系统属性约简的方法,并与遗传算法相结合,改善了原属性约简算法的性能。属性重要性反映了把某一属性加入到核时互信息的增量,本文将从信息论角度定义的属性重要性度量作为启发信息引入遗传算法,从而得到一种用于求解最小约简的启发式遗传算法。遗传算法中修正算子用来对种群进行修复,保证所有个体都是侯选约简,使搜索总在可行解空间上进行。并在保证侯选约简的条件下,尽可能增加个体适应值。用基于信息熵属性重要性度量和基于粗糙集的属性依赖度的加权平均和作为约简算法中的修正操作依据,由于增加了一个修正算子,使所有经过修正的个体都 WP=123 是候选约简,这使得遗传操作作用在可行候选解空间上,节省了计算资源,有效地加快了算法收敛速度。该算法在选择算子中增加了一步操作,当下一代中最差个体比上一代最好个体适应性差时,用上一代最好个体替换下一代最差个体,并适当地调整优良个体的比例,保证了种群的多样性。改进算法结束条件,使之由群体稳定性来决定,保证了遗?
【学位授予单位】:

知网文化
【相似文献】
中国期刊全文数据库 前20条
1 张新光,王建华;数据仓库信息处理技术研究[J];齐齐哈尔大学学报;2000年03期
2 丁纪云,蔡春娥;利用构造数据集评定数据挖掘过程的方法[J];湖南广播电视大学学报;2001年02期
3 任承业,罗伟其;校园信息系统中CRM与数据挖掘的结合和应用[J];计算机工程与应用;2003年13期
4 王艳;数据挖掘在数字图书馆中的应用[J];情报科学;2003年02期
5 邵红全,赵茜;用SQL Server2000实现数据挖掘的技术与策略[J];电脑开发与应用;2003年04期
6 耿庆鹏,卢子芳;利用数据挖掘技术实现对电信行业用户欺诈行为的预测[J];电信快报;2003年10期
7 蒋良孝,蔡之华;基于数据仓库的数据挖掘研究[J];计算技术与自动化;2003年03期
8 叶静,蔡之华;遥感图像中的数据挖掘应用概述[J];计算机与现代化;2003年10期
9 黄解军,万幼川,潘和平;银行客户关系管理与数据挖掘的应用[J];计算机工程与设计;2003年07期
10 崔强,朱卫东;基于数据挖掘的铁路机务段成本控制系统[J];铁路计算机应用;2003年01期
11 杨思春;基于数据仓库的数据挖掘技术分析研究[J];微机发展;2003年09期
12 汤效琴,戴汝源;数据挖掘中聚类分析的技术方法[J];微计算机信息;2003年01期
13 李月芳,孙俊;数据挖掘及其在电网故障诊断中的应用[J];农机化研究;2003年04期
14 陈勍;数据挖掘技术及其应用[J];医学信息;2004年04期
15 ;中国科学院数据挖掘与知识管理学术研讨会在京举行[J];管理评论;2004年07期
16 曾贞;数据挖掘在电子商务中的应用[J];甘肃农业;2004年07期
17 陈钟;基于DSO的数据挖掘应用[J];广西师范学院学报(自然科学版);2004年S1期
18 柯文德;一种基于数据挖掘的分布式入侵检测模型[J];计算机测量与控制;2004年08期
19 徐玲;基于案件综合信息分析挖掘的研究[J];广东公安科技;2004年01期
20 赵明清;蒋昌俊;陶树平;;基于等价相异度矩阵的聚类[J];计算机科学;2004年07期
中国重要会议论文全文数据库 前10条
1 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
2 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
3 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
4 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
5 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
6 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
7 朱扬勇;黄超;;基于多维模型的交互式数据挖掘框架[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
8 陈涛;胡学钢;陈秀美;;基于数据挖掘的教学质量评价体系分析[A];全国第21届计算机技术与应用学术会议(CACIS·2010)暨全国第2届安全关键技术与应用学术会议论文集[C];2010年
9 王星;谢邦昌;戴稳胜;;数据挖掘在保险业中的应用[A];北京市第十二次统计科学讨论会论文选编[C];2003年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
2 李坤然;数据挖掘在股市趋势预测的应用研究[D];中南林业科技大学;2008年
3 郑宏;数据挖掘可视化技术的研究与实现[D];西安电子科技大学;2010年
4 杜金刚;数据挖掘在电信客户关系管理及数据业务营销中的应用[D];北京邮电大学;2010年
5 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
6 梁小鸥;数据挖掘在高职教学管理中的应用[D];华南理工大学;2011年
7 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
8 黎卫英;数据挖掘在中职幼教课程改革中的应用[D];福建师范大学;2009年
9 张煜辉;数据挖掘和SPC在生产过程质量控制中应用研究[D];上海交通大学;2009年
10 刘华敏;数据挖掘在高职院校学生成绩分析中的应用[D];安徽大学;2011年
中国知网广告投放
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62982499
  • 010-62783978