收藏本站
《哈尔滨工程大学》 2009年
收藏 | 手机打开
二维码
手机客户端打开本文

Web数据挖掘中加权关联规则算法的研究

翟罡  
【摘要】: 数据挖掘是从大量的数据集中提取隐含的、事先未知的、并且潜在有用的知识过程。随着Internet迅速发展,互联网上的数据越来越庞大。将数据挖掘的思想和方法应用到Web上,解决Web中遇到的一些问题,从而形成了Web数据挖掘这样一个新的研究方向。 Web数据挖掘有很多研究热点,其中关联规则挖掘是Web数据挖掘领域研究的一个重要方面。本文首先对数据挖掘、Web数据挖掘和Web数据预处理等相关知识进行了阐述;然后研究了关联规则基本理论及关联规则经典算法;最后为了解决现实数据库中每个项目的分配不均匀性和重要性差异,重点研究了加权关联规则挖掘算法。 深入分析了著名的加权关联规则挖掘算法——New-Apriori算法,发现了该算法中存在的问题。其一,New-Apriori算法进行项集连接有不合理之处;其二,需要重复扫描数据库来计算候选项集的支持计数,从而严重影响了算法的运行效率;其三,New-Apriofi算法没有对候选项集进行剪枝,这样会保留许多无用的候选项集。针对上述三方面问题,本文给出了一种改进的算法——WARDM(Weighted Association Rules Data Mining)算法。该算法对候选1-项集、候选2-项集及候选k-项集(k>2)地生成分别讨论,避免漏掉加权频繁项集;利用事务标识号集合来计算候选项集的支持计数,这样只需扫描一遍事务数据库,减少了数据库的扫描次数;根据加权关联规则的性质,在计算候选项目集时进行两次减枝,减少了候选项目集的数量。实验结果表明,新算法在时间上地消耗明显少于New-Apriori算法,有效提高了算法的效率;同时,新算法能有效减小候选顶集的规模。
【学位授予单位】:哈尔滨工程大学
【学位级别】:硕士
【学位授予年份】:2009
【分类号】:TP311.13

【引证文献】
中国期刊全文数据库 前1条
1 邹永平;;改进的Fp-Growth算法在高校教务选课系统中的应用[J];天津职业技术师范大学学报;2012年04期
中国硕士学位论文全文数据库 前5条
1 周霞;基于粗糙集的电子商务交易知识获取研究[D];哈尔滨工程大学;2010年
2 李彦伟;基于关联规则的数据挖掘方法研究[D];江南大学;2011年
3 张秋凤;加权关联规则挖掘算法研究及应用[D];天津师范大学;2011年
4 孙学军;面向电子商务的Web数据挖掘应用研究[D];山东大学;2011年
5 邹永平;高校教务选课系统数据挖掘子系统的设计与实现[D];电子科技大学;2012年
【参考文献】
中国期刊全文数据库 前10条
1 范亚芹,刘颖,李兴男;Web数据挖掘原理及实现[J];吉林大学学报(信息科学版);2003年04期
2 欧阳继红,王仲佳,刘大有;具有动态加权特性的关联规则算法[J];吉林大学学报(理学版);2005年03期
3 张智军,方颖,许云涛;基于Apriori算法的水平加权关联规则挖掘[J];计算机工程与应用;2003年14期
4 王实;高文;李锦涛;;Web数据挖掘[J];计算机科学;2000年04期
5 陆丽娜,杨怡玲,管旭东,魏恒义;Web日志挖掘中的数据预处理的研究[J];计算机工程;2000年04期
6 张文献,陆建江;加权布尔型关联规则的研究[J];计算机工程;2003年09期
7 陈健,印鉴;Web使用挖掘技术研究综述[J];计算机工程;2005年09期
8 邢东山,沈钧毅,宋擒豹;从Web日志中挖掘用户浏览偏爱路径[J];计算机学报;2003年11期
9 吉根林,杨明,宋余庆,孙志挥;最大频繁项目集的快速更新[J];计算机学报;2005年01期
10 袁鼎荣;严小卫;;最大频繁项集挖掘算法的分析研究[J];计算机应用与软件;2005年12期
【共引文献】
中国期刊全文数据库 前10条
1 王傲胜;李国徽;;具有利润约束的数值型关联规则的发现[J];安徽电气工程职业技术学院学报;2006年03期
2 梅俊;郑刚;;一种基于临时表的关联规则增量更新算法[J];安徽工程科技学院学报(自然科学版);2010年01期
3 邹力鹍;张其善;;基于多最小支持度的加权关联规则挖掘算法[J];北京航空航天大学学报;2007年05期
4 张勉;基于隐马尔可夫模型的用户兴趣漂移模式发现方法[J];北京建筑工程学院学报;2005年03期
5 杨晓;张迎新;;Apriori算法在消费市场价格分析中的研究与应用[J];北京工商大学学报(自然科学版);2009年03期
6 王培吉;章树玲;赵玉琳;;基于分辨矩阵的含负属性项关联规则挖掘[J];江西师范大学学报(自然科学版);2012年01期
7 谷兰英,王明常;多元地学信息系统的设计与实现[J];吉林大学学报(地球科学版);2005年S1期
8 王岚,张鹏祥;基于Web的数据挖掘研究[J];长春师范学院学报;2005年07期
9 耿生玲;康宝生;;基于差分的玫瑰线像素级绘制算法[J];吉林大学学报(信息科学版);2007年04期
10 郭艳军;王忠桃;钱卫;;加权关联规则的改进算法[J];成都信息工程学院学报;2008年03期
中国重要会议论文全文数据库 前10条
1 阮鸣梁;陈维默;;数据挖掘技术的发展与应用[A];福建省科协第五届学术年会数字化制造及其它先进制造技术专题学术年会论文集[C];2005年
2 陈晓云;李龙杰;马志新;白伸伸;王磊;;AFP-Miner:一种新高效的频繁项集挖掘算法[A];2006年全国理论计算机科学学术年会论文集[C];2006年
3 钱学君;胡小建;;决策树算法在焊接工艺设计中的应用[A];2008年安徽省科协年会机械工程分年会论文集[C];2008年
4 刘杰;周志杰;;分布式关联规则挖掘在分级网络管理中的研究[A];2008通信理论与技术新发展——第十三届全国青年通信学术会议论文集(下)[C];2008年
5 吴雯雯;王浩;杨静;;基于用户访问模式的个性化推荐算法研究[A];第六届全国信息获取与处理学术会议论文集(3)[C];2008年
6 魏新;廖闻剑;彭艳兵;;基于数据挖掘的校园网络行为分析[A];第十届中国科协年会信息化与社会发展学术讨论会分会场论文集[C];2008年
7 王芳;;烟草配送线路优化问题的探讨[A];中国烟草学会2009年年会论文集[C];2009年
8 李通;刘昌钰;唐常杰;左劼;于中华;;基于自然语言理解技术的Web文件分类与过滤[A];第十七届全国数据库学术会议论文集(研究报告篇)[C];2000年
9 程静;邱玉辉;;Web Mining中的网页分类[A];第十八届全国数据库学术会议论文集(技术报告篇)[C];2001年
10 冯玉才;刘玉葆;冯剑琳;;半结构化数据中模式的交互式开采[A];第十九届全国数据库学术会议论文集(技术报告篇)[C];2002年
中国博士学位论文全文数据库 前10条
1 刘雪梅;服务器端软件性能分析和诊断方法研究[D];哈尔滨工程大学;2010年
2 李彤岩;基于数据挖掘的通信网告警相关性分析研究[D];电子科技大学;2010年
3 马春山;移动增值业务的个性化推荐研究[D];北京邮电大学;2011年
4 王炼红;人工免疫优化与分类算法及其应用研究[D];湖南大学;2009年
5 刘慧君;用户浏览模式挖掘方法与应用研究[D];重庆大学;2010年
6 彭光金;小样本工程造价数据的智能学习方法及其在输变电工程中的应用研究[D];重庆大学;2010年
7 周明;基于数据挖掘的制造业采购DSS理论及方法研究[D];天津大学;2009年
8 孔令东;基于模糊Petri网的瓦斯突出空间预测模型研究[D];中国矿业大学;2011年
9 马超飞;基于关联规则的遥感数据挖掘与应用[D];中国科学院研究生院(遥感应用研究所);2002年
10 张小刚;关联规则挖掘及其在复杂工业过程控制中的应用研究[D];湖南大学;2002年
中国硕士学位论文全文数据库 前10条
1 梅俊;数据挖掘中关联规则算法的研究及应用[D];安徽工程大学;2010年
2 韩微微;基于web日志的网络课程使用状况信息采集及评价的研究[D];哈尔滨师范大学;2010年
3 蔡宏果;基于基因表达式编程的Web个性化推荐技术研究[D];广西师范学院;2010年
4 王宇轩;电子信箱的可用性实验研究[D];浙江理工大学;2010年
5 王德才;数据挖掘在校园卡消费行为分析中的研究与应用[D];哈尔滨工程大学;2010年
6 杨海陆;公路收费系统数据分析与挖掘[D];哈尔滨工程大学;2010年
7 孙原;基于酉变换的权威页面挖掘算法研究[D];哈尔滨工程大学;2010年
8 刘晨;XML文档聚类的研究[D];大连理工大学;2010年
9 姜荣;时间序列的聚类和关联规则挖掘研究[D];辽宁师范大学;2010年
10 王宏云;基于数据挖掘的煤矿安全监测系统研究[D];辽宁工程技术大学;2009年
【同被引文献】
中国期刊全文数据库 前10条
1 邹力鹍;张其善;;基于多最小支持度的加权关联规则挖掘算法[J];北京航空航天大学学报;2007年05期
2 张振琳;黄明;;改进的差别矩阵及其求核方法[J];大连交通大学学报;2008年04期
3 唐晓萍;数据挖掘与知识发现综述[J];电脑开发与应用;2002年04期
4 侯新丽;孟晓伟;于松;;基于矩阵的加权关联规则挖掘算法[J];电脑开发与应用;2010年06期
5 李军;数据挖掘系统实现的一般模型[J];大庆石油学院学报;2003年03期
6 叶东毅,陈昭炯;一个新的差别矩阵及其求核方法[J];电子学报;2002年07期
7 杨明,孙志挥;改进的差别矩阵及其求核方法[J];复旦学报(自然科学版);2004年05期
8 雷力;;矩阵加权关联规则挖掘算法研究[J];福建电脑;2006年10期
9 王秀,叶东毅;基于分布约简的获取规则的增量式方法[J];福州大学学报(自然科学版);2005年01期
10 张天桥;;面向电子商务的数据挖掘系统设计[J];中国管理信息化;2008年18期
中国博士学位论文全文数据库 前4条
1 崔广才;基于粗糙集的数据挖掘方法研究[D];吉林大学;2004年
2 魏娟;基于粗糙集的知识发现及在CRM中的应用研究[D];哈尔滨工程大学;2006年
3 王实;基于Web访问信息挖掘的推荐方法研究[D];中国科学院研究生院(计算技术研究所);2001年
4 沈斌;关联规则相关技术研究[D];浙江大学;2007年
中国硕士学位论文全文数据库 前10条
1 刘洋;基于Web的内容挖掘技术研究[D];哈尔滨工程大学;2003年
2 孙杰;数据挖掘技术在零售业领域中的应用研究[D];东北财经大学;2003年
3 曲斌;数据挖掘技术在零售业CRM中的应用研究[D];浙江大学;2004年
4 涂庆华;数据挖掘在高校人事管理系统中的应用研究[D];南京理工大学;2004年
5 周露;基于数据挖掘技术的电子化客户关系管理(eCRM)研究[D];武汉大学;2004年
6 杨柳;基于粗糙集的数据挖掘技术研究及其在智能软件中的实现[D];电子科技大学;2004年
7 阙夏;连续属性离散化方法研究[D];合肥工业大学;2006年
8 田地;基于电子商务Web的数据挖掘技术研究[D];郑州大学;2006年
9 胡明涛;基于粗糙集理论的零售业数据挖掘研究[D];江西财经大学;2006年
10 陈媛;两种个性化推荐算法的研究及应用[D];吉林大学;2007年
【二级参考文献】
中国期刊全文数据库 前10条
1 宋伟,王举成,马根峰,赵济林;Internet数据挖掘原理及实现[J];重庆邮电学院学报(自然科学版);2001年02期
2 陆建江,钱祖平,宋自林;正态云关联规则在预测中的应用[J];计算机研究与发展;2000年11期
3 王晓峰,王天然,赵越;一种自顶向下挖掘长频繁项的有效方法[J];计算机研究与发展;2004年01期
4 胡陈勇,刘大有,刘亚波;一种扩展的关联规则挖掘算法[J];吉林大学学报(理学版);2005年02期
5 刘瑞虹;曹东启;;基于Intranet的Web信息获取方法和实现[J];计算机科学;1999年01期
6 欧阳为民;郑诚;蔡庆生;;国际上关联规则发现研究述评[J];计算机科学;1999年03期
7 陈恩红;范焱;王行甫;蔡庆生;;网际网上半结构化数据抽取与知识发现方法及其实现[J];计算机科学;1999年10期
8 王伟强;高文;段立娟;;Internet上的文本数据挖掘[J];计算机科学;2000年04期
9 冯志新,钟诚;基于FP-tree的最大频繁模式挖掘算法[J];计算机工程;2004年11期
10 杨明,孙志挥;一种基于前缀广义表的关联规则增量式更新算法[J];计算机学报;2003年10期
【相似文献】
中国期刊全文数据库 前10条
1 张新光,王建华;数据仓库信息处理技术研究[J];齐齐哈尔大学学报;2000年03期
2 丁纪云,蔡春娥;利用构造数据集评定数据挖掘过程的方法[J];湖南广播电视大学学报;2001年02期
3 任承业,罗伟其;校园信息系统中CRM与数据挖掘的结合和应用[J];计算机工程与应用;2003年13期
4 王艳;数据挖掘在数字图书馆中的应用[J];情报科学;2003年02期
5 邵红全,赵茜;用SQL Server2000实现数据挖掘的技术与策略[J];电脑开发与应用;2003年04期
6 耿庆鹏,卢子芳;利用数据挖掘技术实现对电信行业用户欺诈行为的预测[J];电信快报;2003年10期
7 蒋良孝,蔡之华;基于数据仓库的数据挖掘研究[J];计算技术与自动化;2003年03期
8 叶静,蔡之华;遥感图像中的数据挖掘应用概述[J];计算机与现代化;2003年10期
9 黄解军,万幼川,潘和平;银行客户关系管理与数据挖掘的应用[J];计算机工程与设计;2003年07期
10 崔强,朱卫东;基于数据挖掘的铁路机务段成本控制系统[J];铁路计算机应用;2003年01期
中国重要会议论文全文数据库 前10条
1 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
2 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
3 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
4 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
5 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
6 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
7 朱扬勇;黄超;;基于多维模型的交互式数据挖掘框架[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
8 陈涛;胡学钢;陈秀美;;基于数据挖掘的教学质量评价体系分析[A];全国第21届计算机技术与应用学术会议(CACIS·2010)暨全国第2届安全关键技术与应用学术会议论文集[C];2010年
9 王星;谢邦昌;戴稳胜;;数据挖掘在保险业中的应用[A];北京市第十二次统计科学讨论会论文选编[C];2003年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
2 李坤然;数据挖掘在股市趋势预测的应用研究[D];中南林业科技大学;2008年
3 郑宏;数据挖掘可视化技术的研究与实现[D];西安电子科技大学;2010年
4 杜金刚;数据挖掘在电信客户关系管理及数据业务营销中的应用[D];北京邮电大学;2010年
5 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
6 梁小鸥;数据挖掘在高职教学管理中的应用[D];华南理工大学;2011年
7 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
8 黎卫英;数据挖掘在中职幼教课程改革中的应用[D];福建师范大学;2009年
9 张煜辉;数据挖掘和SPC在生产过程质量控制中应用研究[D];上海交通大学;2009年
10 刘华敏;数据挖掘在高职院校学生成绩分析中的应用[D];安徽大学;2011年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026