收藏本站
《西南交通大学》 2006年
收藏 | 手机打开
二维码
手机客户端打开本文

数据预处理算法的研究与应用

李晓菲  
【摘要】:随着信息时代的来临,人类在各种领域中面临着越来越多的数据信息,与此同时,这些数据的规模还在以惊人的速度不断增长。因此,为了提高工作效率和生活质量,人们必须获取蕴藏在这些数据中的有价值信息。为了达到这个目的,人们开始致力于从数据库中挖掘知识的研究。然而,众所周知,数据库中往往存在冗余数据、缺失数据、不确定数据和不一致数据等诸多情况,这些数据成了发现知识的一大障碍。因此,在从数据库中挖掘知识之前必须对数据进行预处理。 本论文着重研究数据挖掘中的数据预处理技术,尤其是数据清洗技术,并实现了数据挖掘试验平台(Data Mining Laboratory, DMLab)的数据预处理模块的功能。 首先对数据预处理知识做了全面和详细的描述,介绍了数据预处理的研究背景、定义和主要的预处理技术研究现状等。然后对现有的数据预处理技术进行了深入的分析,涉及到数据清洗、数据选样、数据变换和数据归约等技术。之后重点对缺失值填充技术及各种填充算法进行了深入地研究和探讨,并提出了基于聚类技术的缺失值填充法。最后,在前面讨论的各种技术的基础上,实现了数据挖掘试验平台的数据预处理模块功能,主要包括数据清洗、数据选样、数据转换、数据归约等功能。 在对数据预处理技术进行的研究中,着重介绍了缺失值清洗的基本知识和方法,并探讨了当前缺失值清洗技术,客观地评价了它们的优缺点。本文对目前广泛应用的各种数据预处理技术进行了深入的研究,并在此基础上完成了DMLab系统中数据预处理模块的设计和实现,既根据系统需要实现了部分基础的预处理算法,又提出了如何应用聚类算法进行缺失值填充的新方法,并给出了在数据集上的试验结果及结论。 本文的主要创新点在于提出的基于聚类技术的缺失值填充算法。
【学位授予单位】:西南交通大学
【学位级别】:硕士
【学位授予年份】:2006
【分类号】:TP311.13

【引证文献】
中国期刊全文数据库 前1条
1 王帮容;谭丽;;不同分子量阻燃剂迁移行为的数学模型[J];四川理工学院学报(自然科学版);2010年05期
中国重要会议论文全文数据库 前1条
1 张峰;薛青;;基于贝叶斯网络的战场目标识别方法研究[A];图像图形技术与应用进展——第三届图像图形技术与应用学术会议论文集[C];2008年
中国硕士学位论文全文数据库 前10条
1 尚军亮;时间序列预测方法及在隧道控制中的应用研究[D];西安电子科技大学;2010年
2 李蒙;基于影响因素主成分分析的采购数量预测模型[D];大连理工大学;2011年
3 朱琼瑶;水质时序数据处理及预警系统数据库构建技术研究[D];浙江大学;2012年
4 梁本哲;基于粗糙集理论的土地利用规划决策支持系统模型及其应用研究[D];中国地质大学;2007年
5 肖静;面向水路交通信息平台的数据处理技术与应用研究[D];南京理工大学;2007年
6 张智勇;基于GMDH的缺失数据插补方法研究[D];四川大学;2007年
7 鲍静;关联规则挖掘及其在图书流通数据中的应用研究[D];合肥工业大学;2007年
8 张燕;基于聚类算法的数据清洗的研究与实现[D];华北电力大学(河北);2008年
9 许小明;多源异构日志的数据归并和预处理技术[D];哈尔滨工程大学;2009年
10 刘列;北京市高中会考数据挖掘系统设计与实施[D];北京邮电大学;2008年
【参考文献】
中国期刊全文数据库 前2条
1 王清毅,蔡智,邹翔,蔡庆生;部分数据缺失环境下的知识发现方法[J];软件学报;2001年10期
2 王双成,苑森淼;具有丢失数据的贝叶斯网络结构学习研究[J];软件学报;2004年07期
【共引文献】
中国期刊全文数据库 前10条
1 张小平,马垣;KDD中的数据清理技术研究[J];鞍山科技大学学报;2003年02期
2 冀俊忠;张鸿勋;胡仁兵;刘椿年;;基于蚁群算法的贝叶斯网结构学习[J];北京工业大学学报;2011年06期
3 陈伟,丁秋林;具有数据清理功能的交互式数据迁移及应用[J];吉林大学学报(信息科学版);2004年02期
4 孙铁民;于杰;尚程;田大新;张丽华;;基于无监督学习的数据清洗算法[J];吉林大学学报(信息科学版);2008年06期
5 石秀春;王福生;;基于语义知识网络的文书档案修复方法[J];档案学研究;2009年03期
6 谢川;倪世宏;张宗麟;;基于支持向量机的缺失飞行参数预测方法[J];弹箭与制导学报;2004年S2期
7 郝丽,刘乐平,王星;数据挖掘(Data Mining)在体育统计中的应用[J];东华理工学院学报(社会科学版);2004年02期
8 王鹏;周厚顺;王树宗;;物元贝叶斯网络模型研究[J];国防科技大学学报;2009年01期
9 李菁菁,邵培基,黄亦潇;数据挖掘在中国的现状和发展研究[J];管理工程学报;2004年03期
10 刘星毅;韦小铃;;基于欧式距离的最近邻改进算法[J];广西科学院学报;2010年04期
中国重要会议论文全文数据库 前8条
1 刘星毅;;基于欧式距离的最近邻改进算法[A];广西计算机学会2010年学术年会论文集[C];2010年
2 华翔;王俊社;秦洪海;;基于代理的网络故障关联体系[A];2007通信理论与技术新发展——第十二届全国青年通信学术会议论文集(下册)[C];2007年
3 廖学清;吕强;;试析数据缺失下学习贝叶斯网中初始网络的选择[A];2008'中国信息技术与应用学术论坛论文集(二)[C];2008年
4 王桂芹;黄道;;数据挖掘技术综述[A];计算机技术与应用进展·2007——全国第18届计算机技术与应用(CACIS)学术会议论文集[C];2007年
5 陈堃;李心科;;基于可扩展数据清理框架的元数据的研究[A];计算机技术与应用进展·2007——全国第18届计算机技术与应用(CACIS)学术会议论文集[C];2007年
6 武森;张桂琼;王莹;吴玲玉;;容差集合差异度高维不完备数据聚类[A];第十二届中国管理科学学术年会论文集[C];2010年
7 高淑娟;鲍玉斌;江志纲;王大玲;于戈;;一种基于最小风险贝叶斯决策的数据清洗策略[A];第十九届全国数据库学术会议论文集(研究报告篇)[C];2002年
8 王令群;郑应平;周爱华;;数据挖掘技术在半导体生产过程数据分析中的应用[A];2005年中国智能自动化会议论文集[C];2005年
中国硕士学位论文全文数据库 前10条
1 侯佳奇;社保联网审计中增量数据分布式处理的研究[D];哈尔滨工程大学;2010年
2 孙明帅;面向NSSA的异构数据规范化处理与集成[D];哈尔滨工程大学;2010年
3 谷琳;数据挖掘在陶瓷涂层制备中的应用[D];辽宁工程技术大学;2009年
4 孙玉侠;数据挖掘中的谱聚类算法研究[D];中国海洋大学;2010年
5 王爽;GIS与空间数据挖掘技术在环境污染事故应急处理系统中的应用研究[D];中国海洋大学;2010年
6 张晓艳;面向农业信息服务平台的挖掘技术研究[D];湖南工业大学;2010年
7 杨洋;基于车载LIDAR数据的建筑物立面重建技术研究[D];解放军信息工程大学;2010年
8 叶奇旺;数据挖掘技术在手机行业客户关系管理中的应用研究[D];东华大学;2011年
9 范晓燕;数据挖掘技术在新生儿数据分析中的应用研究[D];东华大学;2011年
10 高晓利;基于贪婪搜索的贝叶斯网络结构学习算法[D];西安电子科技大学;2011年
【同被引文献】
中国期刊全文数据库 前10条
1 朱小栋,郑诚,舒坚,陈振;关联规则的哈希修剪算法研究[J];安徽大学学报(自然科学版);2005年04期
2 沈非,黄薇薇,查良松;RS、GIS一体化土地利用动态信息提取技术改进初探[J];安徽师范大学学报(自然科学版);2002年04期
3 窦祥国,胡学钢;关联规则的评价方法研究[J];安徽技术师范学院学报;2005年04期
4 刘军山,徐枞巍;高等教育评价指标体系质量问题的理论探讨[J];北京航空航天大学学报(社会科学版);2000年01期
5 程兴新;EM算法的收敛性[J];北京大学学报(自然科学版);1987年03期
6 陈继松;船舶跟踪和管理系统[J];船舶工程;1994年05期
7 张宾,贺昌政;GMDH算法的终止法则研究[J];吉林大学学报(信息科学版);2005年03期
8 黄智,何跃;关联规则挖掘在卷烟市场研究中的应用[J];成都信息工程学院学报;2005年03期
9 王宝珍;土地利用总体规划信息系统的研究[J];测绘工程;2000年04期
10 刘永山,汤毅,陈雯柏,曾昭天;数据挖掘技术的研究[J];重庆工业高等专科学校学报;2003年02期
中国硕士学位论文全文数据库 前10条
1 刘坤朋;数据挖掘中聚类算法的研究[D];长沙理工大学;2010年
2 李伟湘;基于二次规划法的连续体结构拓扑优化方法及其应用研究[D];长沙理工大学;2010年
3 张建良;证据理论在决策支持系统中的应用研究[D];合肥工业大学;2011年
4 石冰辉;基于虚拟现实的景观仿真应用研究[D];长安大学;2011年
5 许文武;基于视频的运动目标检测与跟踪方法应用研究[D];江苏科技大学;2011年
6 王海君;道路纵断面自动生成及优化算法的研究[D];长安大学;2001年
7 张浩;数据融合在工程中的应用与研究[D];湖南大学;2001年
8 仲维国;信息系统中粗糙集理论若干问题的研究[D];南京理工大学;2002年
9 张振华;粗集理论及其在数据预处理过程中的应用[D];昆明理工大学;2002年
10 黄添强;基于空间数据挖掘的环境调控空间决策支持系统研究[D];福州大学;2003年
【二级引证文献】
中国期刊全文数据库 前3条
1 阮鑫丰;朱文莉;;熵定价公式的套期保值参数研究及其在动态对冲中的应用[J];四川理工学院学报(自然科学版);2012年05期
2 林郎碟;王灿辉;;Apriori算法在图书推荐服务中的应用与研究[J];计算机技术与发展;2011年05期
3 韩存鸽;;统计分析及关联挖掘在高校图书馆流通数据中的应用[J];计算机系统应用;2012年08期
中国硕士学位论文全文数据库 前10条
1 陈凤萍;寿光人才求职招聘网站中资源检索算法的研究[D];中国海洋大学;2010年
2 况莉莉;关联规则在高校图书馆读者数据处理中的应用研究[D];合肥工业大学;2010年
3 乔哲峰;自适应情景感知中间件的情景数据预处理模型研究与实现[D];华东师范大学;2011年
4 马睿;医疗质量管理数据查询与监测软件的研发[D];电子科技大学;2010年
5 张兴华;数据清洗方法在电力企业数据中心的应用研究[D];兰州理工大学;2011年
6 黄鑫檑;西南地区学生辍学预警技术研究[D];上海师范大学;2011年
7 王卫;水路危险货物运输事故应急处置及应急管理信息系统研究[D];南京理工大学;2011年
8 赵琦;入侵检测系统报警融合关键技术研究[D];云南大学;2011年
9 严的兵;基于数据挖掘的学生成绩分析[D];安徽大学;2011年
10 潘晓花;基于少数民族汉语教学的HSK成绩多元数据挖掘应用研究[D];新疆师范大学;2010年
【相似文献】
中国期刊全文数据库 前10条
1 向浩求;危韧勇;;基于数据挖掘的信用卡数据预处理研究[J];现代商业;2007年13期
2 宓为建;徐子奇;刘园;;大型港机结构安全控制中数据挖掘的预处理[J];计算机辅助工程;2006年01期
3 颜昌沁;徐小华;石玉萍;;浅谈电信数据预处理[J];福建电脑;2011年03期
4 王军;王涛;宋宝燕;;Web日志挖掘中重构网站结构技术[J];辽宁大学学报(自然科学版);2006年03期
5 李甲林;;Web日志挖掘中的数据预处理技术研究与实现[J];电脑知识与技术;2009年14期
6 邱长波,李瑞录,黄薇;人口信息系统数据挖掘的数据预处理研究[J];情报科学;2004年12期
7 周增国;庞有军;;Cookie技术在Web日志挖掘预处理中的应用[J];大连大学学报;2006年02期
8 倪洁;杨巨庆;;基于数据挖掘的网站最优路径的构建与优化[J];哈尔滨师范大学自然科学学报;2010年04期
9 于飞;丁华福;姜伦;;Web日志挖掘中数据预处理技术的研究[J];计算机技术与发展;2010年05期
10 刘越江,黄今慧;数据挖掘中的数据预处理技术[J];科技情报开发与经济;2003年05期
中国重要会议论文全文数据库 前10条
1 吕琳;朱东华;刘玉琴;;面向数据仓库的数据预处理研究综述[A];2007年中国智能自动化会议论文集[C];2007年
2 谭立云;凯丽比努尔;塔西甫拉提;高学东;热合木江;;数据挖掘中的数据预处理方法研究[A];全国第16届计算机科学与技术应用(CACIS)学术会议论文集[C];2004年
3 张荣祖;朱扬勇;;一个可视化数据挖掘系统中的数据预处理技术[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
4 许小林;唐文忠;;基于贝叶斯算法的垃圾邮件检测中数据预处理技术的研究[A];计算机技术与应用进展——全国第17届计算机科学与技术应用(CACIS)学术会议论文集(上册)[C];2006年
5 肖英治;陈红;;带数据清洗功能的数据预处理系统PW-ETL的设计与实现[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
6 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
7 陆维权;;数据挖掘在肿瘤患者住院费用研究中的应用[A];第十九届全国肿瘤医院管理学术研讨会论文汇编[C];2009年
8 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
9 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
10 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
中国重要报纸全文数据库 前10条
1 张立明;数据挖掘之道[N];网络世界;2003年
2 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
3 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
4 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
5 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 李晓菲;数据预处理算法的研究与应用[D];西南交通大学;2006年
2 李瑞华;数据挖掘在煤矿安全监测中的应用[D];西安电子科技大学;2010年
3 李明;数据清洗技术在文本挖掘中的应用[D];南京理工大学;2008年
4 陈鑫;化工工艺数据挖掘中数据预处理技术的研究与应用[D];上海交通大学;2010年
5 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
6 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
7 严峰;银行房贷信用评估的联机分析与挖掘算法实现[D];大连理工大学;2006年
8 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
9 赵飞国;面向数据挖掘的数据预处理系统设计与实现[D];北京交通大学;2011年
10 刘志强;基于数据挖掘的客户行为分析和预测研究[D];山东科技大学;2010年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026