收藏本站
《浙江工业大学》 2012年
收藏 | 手机打开
二维码
手机客户端打开本文

广义马氏距离及其在数据挖掘中的应用研究

陈欢  
【摘要】:距离是科学研究与工程技术领域中使用非常广泛的一种度量,通常被用作衡量两个个体间的相似性,如,聚类分类中的相似性可以用距离来度量;图像匹配中的匹配度可以用距离描述;信息安全中的过滤准则也可以距离来刻画等等。从公元三世纪创立的欧式几何至今,距离计算方法的发展十分缓慢。随着电子商务的高速发展,数据挖掘的热潮再次席卷而来,研究一种新的能够克服现有距离相似性缺点并更适合于数据挖掘领域的距离具有较大的意义。 本文以数据挖掘为背景,研发了一种新的更能体现数据间相关性的相似性计算方法,并分别将其应用于传统数据挖掘中的缺损数据补值、新兴的不确定数据挖掘以及分布式数据挖掘领域,理论证明和实验结果均说明了新距离相似性的优越性能。 主要工作如下: 1.总结数据挖掘领域中的距离计算方法。在数据挖掘领域中,常用的距离相似性计算方法有Euclidean距离、Manhattan距离、Mahalanobis距离等,根据各种距离的计算形式分析了它们的优缺点,为下文研究新的距离提供了依据。 2.提出了MP马氏距离(Moore-PenroseMahalanobisDistance)并应用于缺损数据补值。马氏距离相比其它距离,较充分的考虑了数据之间的相关性且不受量纲影响,鉴于该距离中使用的逆矩阵可能不存在的缺点,通过奇异值分解构造了基于Moore-Penrose逆的MP马氏距离,它不受逆矩阵是否存在的影响。在改进了复相关系数倒数赋权法后,将MP马氏距离应用于缺损数据补值,实验结果不仅验证了MP马氏距离的任意存在性,而且在准确性上也略优于马氏距离。 3.提出了WMP马氏距离(WeightedMoore-PenroseMahalanobisDistance)并应用于聚类分析。MP马氏距离虽然对任意数据集都存在,但其体现的数据相关性过于客观,可能导致信息错误和挖掘结果非常糟糕。根据实对称矩阵的谱分解理论以及加权Moore-Penrose逆,提出了WMP马氏距离。结合经典的聚类算法进行了仿真分析,结果表明WMP马氏距离在体现数据相关性的准确性上有很大的提高。 4.研究了一种新的不确定数据挖掘框架。一般的数据挖掘过程中,原始数据本身可能不准确,数据的预处理可能带来不确定性,数据集成等步骤也可能给数据集带来不确定性,而常见的数据挖掘算法均是针对确定性数据的,因此,传统挖掘方式本身存在着一定的弊端。提出了一种新的基于概率维度的不确定数据挖掘框架,并构造了它的实例,探讨了结合WMP马氏距离应用的相关研究方向。 5.研究了一种新的分布式Bayes预测方法。排行榜在电子商务领域中广受关注,但是TB级以上的实时数据排行问题即使在分布式环境下亦是一个难题。改进了朴素Bayes方法,提出了一种离线形式的数据过滤方法,将不可能进入榜单的数据提前进行过滤,从而减小了实时排行所需时间。最后分析了WMP马氏距离在分布式环境下的应用前景。
【学位授予单位】:浙江工业大学
【学位级别】:硕士
【学位授予年份】:2012
【分类号】:TP311.13

手机知网App
【参考文献】
中国期刊全文数据库 前5条
1 王国胤,于洪,杨大春;基于条件信息熵的决策表约简[J];计算机学报;2002年07期
2 杨涛,骆嘉伟,王艳,吴君浩;基于马氏距离的缺失值填充算法[J];计算机应用;2005年12期
3 张琨,许满武,张宏,刘凤玉;基于一种相对Hamming距离的入侵检测方法——RHDID[J];计算机学报;2003年01期
4 林树宽;张冬岩;李文贤;张天成;张一飞;;基于聚类和主成分分析的神经网络预测模型[J];小型微型计算机系统;2005年12期
5 刘泉凤,陆蓓;数据挖掘中聚类算法的比较研究[J];浙江水利水电专科学校学报;2005年02期
中国硕士学位论文全文数据库 前1条
1 冯勤;基于回归数据挖掘预测系统的分析与研究[D];天津大学;2005年
【共引文献】
中国期刊全文数据库 前10条
1 高超;王丽君;;数据挖掘技术在基于系统调用的入侵检测中的应用[J];鞍山科技大学学报;2006年01期
2 满江虹,达庆利;基于信息熵的粗约简及其Bayes解释的供应链需求集成分析[J];东南大学学报(自然科学版);2004年03期
3 张腾飞,肖健梅,王锡淮;粗糙集理论中属性相对约简算法[J];电子学报;2005年11期
4 胡国华;基于区分矩阵的属性约简算法研究[J];福建电脑;2005年04期
5 袁修久,张文修;决策表的分布约简和严凸函数下约简的等价性[J];系统工程;2003年05期
6 刘金福;于达仁;胡清华;;基于加权熵的重要性不对等样本学习的知识约简[J];广西师范大学学报(自然科学版);2006年04期
7 林镇飚,桂现才;粗糙集理论中决策表属性约简的信息量表示[J];广西师范学院学报(自然科学版);2005年02期
8 宋岚;黄兆华;王洪;;基于Rough熵的决策表约简算法研究[J];华东交通大学学报;2006年04期
9 韩伟,沈霄凤,王云;信息系统的属性重要性度量及知识约简算法比较[J];华东师范大学学报(自然科学版);2004年03期
10 沈占锋;骆剑承;陈秋晓;黄光玉;盛昊;;高分辨率遥感影像并行处理数据分配策略研究[J];哈尔滨工业大学学报;2006年11期
中国重要会议论文全文数据库 前7条
1 郎风华;鲜继清;唐贤伦;;一种基于格贴近度的模糊入侵检测方法[A];’2004计算机应用技术交流会议论文集[C];2004年
2 李海涛;刘福军;;基于熵的不协调决策表知识约简[A];2006年全国理论计算机科学学术年会论文集[C];2006年
3 宫蕊;舒红平;郭远远;;基于DBSCAN的密度聚类算法的研究[A];2008'中国信息技术与应用学术论坛论文集(二)[C];2008年
4 王振宇;谭红叶;郑家恒;;基于Bootstrapping的交通工具名识别[A];2008'中国信息技术与应用学术论坛论文集(二)[C];2008年
5 孙浩军;孔令俊;刘志辉;;利用高斯分布生成数据对聚类算法的比较[A];2007'仪表,自动化及先进集成技术大会论文集(一)[C];2007年
6 王娟;;一种基于粗糙集理论的操作风险判别方法[A];科学发展观与系统工程——中国系统工程学会第十四届学术年会论文集[C];2006年
7 贾超;张胤;;互联网络的多特征融合入侵检测方法[A];第二届全国信息检索与内容安全学术会议(NCIRCS-2005)论文集[C];2005年
中国博士学位论文全文数据库 前10条
1 赵军;基于粗集理论的KDD技术研究[D];重庆大学;2003年
2 于洪;Rough Set理论及其在数据挖掘中的应用研究[D];重庆大学;2003年
3 王立宏;信息系统的约简与粒度分析及其在数据挖掘中的应用[D];上海大学;2004年
4 郭秀娟;基于关联规则数据挖掘算法的研究[D];吉林大学;2004年
5 黄兵;基于粗糙集的不完备信息系统知识获取理论与方法[D];南京理工大学;2004年
6 余卫宇;几种图像结构语义模型和图像[D];华南理工大学;2005年
7 Rong Xiaoxia;[D];山东大学;2005年
8 戎晓霞;不确定优化问题的若干模型与算法研究[D];山东大学;2005年
9 张凤斌;基于免疫遗传算法的入侵检测技术研究[D];哈尔滨工程大学;2005年
10 王加阳;面向海量数据的粗糙集理论与方法研究[D];中南大学;2005年
中国硕士学位论文全文数据库 前10条
1 覃志华;可变精度粗糙集合模型研究与应用[D];中南大学;2005年
2 陈鑫影;基于粗糙集理论的约简算法研究[D];吉林大学;2005年
3 罗强;基于粗糙集理论的知识发现在web文本挖掘上的应用研究[D];广西大学;2003年
4 谷雨;基于粗糙集和概念格的入侵检测研究[D];云南师范大学;2003年
5 李银花;基于粗糙集理论的属性约简算法研究及应用[D];华北工学院;2004年
6 任海涛;基于案例的推理及其在农业专家系统中的应用[D];山西大学;2004年
7 曹付元;多值信息系统与决策表知识约简[D];山西大学;2004年
8 姚勇;应用Rough集理论对电力客户数据的分析[D];华北电力大学(河北);2004年
9 范敏;基于粗糙集的数据简约算法研究及设计[D];昆明理工大学;2003年
10 王源;特定目标自动识别方法研究[D];南京理工大学;2004年
【二级参考文献】
中国期刊全文数据库 前10条
1 高洪深,陶有德;基于人工神经网络的非线性回归预测模型的研究[J];北方工业大学学报;1999年01期
2 鄂旭,高学东,武森,张秋月;信息表中不完备数据的填补方法[J];北京科技大学学报;2005年03期
3 朱小飞,卓丽霞;一种基于量化容差关系的不完备数据分析方法[J];重庆工学院学报;2005年05期
4 黄艳,王延章;大型数据库中多层次相联规则的提取[J];大连理工大学学报;1999年06期
5 段玉倩,贺家李;遗传算法及其改进[J];电力系统及其自动化学报;1998年01期
6 李滢雪,吴顺祥;灰决策表的属性约简算法[J];福建电脑;2005年09期
7 李存华,孙志挥,陈耿,胡云;核密度估计及其在聚类算法构造中的应用[J];计算机研究与发展;2004年10期
8 苗夺谦,胡桂荣;知识约简的一种启发式算法[J];计算机研究与发展;1999年06期
9 张士林,毛海军,赵秋艳;对于粗糙集应用中数据不全的解决方法研究[J];计算机工程与应用;2003年09期
10 史玉峰;史文中;靳奉祥;;熵及其在空间数据不确定性研究中的应用[J];计算机工程;2005年24期
中国博士学位论文全文数据库 前1条
1 王庆东;基于粗糙集的数据挖掘方法研究[D];浙江大学;2005年
中国硕士学位论文全文数据库 前1条
1 冯勤;基于回归数据挖掘预测系统的分析与研究[D];天津大学;2005年
【相似文献】
中国期刊全文数据库 前10条
1 丁纪云,蔡春娥;利用构造数据集评定数据挖掘过程的方法[J];湖南广播电视大学学报;2001年02期
2 任承业,罗伟其;校园信息系统中CRM与数据挖掘的结合和应用[J];计算机工程与应用;2003年13期
3 王艳;数据挖掘在数字图书馆中的应用[J];情报科学;2003年02期
4 邵红全,赵茜;用SQL Server2000实现数据挖掘的技术与策略[J];电脑开发与应用;2003年04期
5 耿庆鹏,卢子芳;利用数据挖掘技术实现对电信行业用户欺诈行为的预测[J];电信快报;2003年10期
6 蒋良孝,蔡之华;基于数据仓库的数据挖掘研究[J];计算技术与自动化;2003年03期
7 叶静,蔡之华;遥感图像中的数据挖掘应用概述[J];计算机与现代化;2003年10期
8 黄解军,万幼川,潘和平;银行客户关系管理与数据挖掘的应用[J];计算机工程与设计;2003年07期
9 崔强,朱卫东;基于数据挖掘的铁路机务段成本控制系统[J];铁路计算机应用;2003年01期
10 杨思春;基于数据仓库的数据挖掘技术分析研究[J];微机发展;2003年09期
中国重要会议论文全文数据库 前10条
1 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
2 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
3 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
4 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
5 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
6 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
7 朱扬勇;黄超;;基于多维模型的交互式数据挖掘框架[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
8 陈涛;胡学钢;陈秀美;;基于数据挖掘的教学质量评价体系分析[A];全国第21届计算机技术与应用学术会议(CACIS·2010)暨全国第2届安全关键技术与应用学术会议论文集[C];2010年
9 王星;谢邦昌;戴稳胜;;数据挖掘在保险业中的应用[A];北京市第十二次统计科学讨论会论文选编[C];2003年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
2 李坤然;数据挖掘在股市趋势预测的应用研究[D];中南林业科技大学;2008年
3 郑宏;数据挖掘可视化技术的研究与实现[D];西安电子科技大学;2010年
4 杜金刚;数据挖掘在电信客户关系管理及数据业务营销中的应用[D];北京邮电大学;2010年
5 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
6 梁小鸥;数据挖掘在高职教学管理中的应用[D];华南理工大学;2011年
7 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
8 黎卫英;数据挖掘在中职幼教课程改革中的应用[D];福建师范大学;2009年
9 张煜辉;数据挖掘和SPC在生产过程质量控制中应用研究[D];上海交通大学;2009年
10 刘华敏;数据挖掘在高职院校学生成绩分析中的应用[D];安徽大学;2011年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026