收藏本站
《重庆大学》 2003年
收藏 | 手机打开
二维码
手机客户端打开本文

网站日志的数据挖掘

段晓峰  
【摘要】:随着INTERNET上数据量呈爆炸式的增长,信息数据的有用性变的十分必要。WEB挖掘是将数据挖掘技术应用于互联网,目前在许多研究领域都是热点。作者讨论了WEB挖掘和WEB挖掘的分类。根据挖掘的内容,WEB挖掘可分为三种,WEB使用挖掘,WEB内容挖掘,WEB结构挖掘。对每种挖掘,作者都讨论了与其相关的研究领域,技术和发展方向。WEB使用挖掘是本文主要的研究方向。 WEB使用挖掘是利用数据挖掘技术根据WEB使用数据挖掘用户访问网站的行为模式。网站使用记录挖掘不同与网站内容挖掘和网站结构挖掘,它的挖掘对象不是网上的原始数据,而是记录用户与网站交互的过程的数据。就些数据包括:客户端浏览器日志记录,网站服务器访问记录、代理服务器日志记录、用户注册信息等。WEB使用挖掘分为三个阶段,数据预处理,模式发现,模式分析。作者详细讨论了这三个阶段所遇到的问题和解决办法。 许多数据挖掘方法在WEB挖掘上都有很好的应用,作者讨论以下几种在WEB使用记录上常用的方法,统计分析方法,关联规则方法,序列模式方法,聚类方法,分类方法,并着重讨论关联规则方法应用于WEB使用记录的挖掘。关联规则方法在数据挖掘领域被广泛应用,它主要用于发现有用的模式,典型的例子就是购物篮分析。将关联规则应用于WEB使用记录挖掘的关键在于如何构造购物篮。用户点击网站的每一页所产生的动作都被服务器记录在日志中,分析日志文件,并结合网站的拓扑和实际内容,经过数据清理,用户识别,会话识别,事务识别四个数据预处理过程,我们可以获得一个事务集合,从而构造购物篮。作者详细讨论了在构造购物篮的过程中所遇到的问题和解决办法。Apriori 算法是一种著名的关联规则挖掘算法,本文讨论了该算法及其实现,并将其应用到一个典型的网站上。 最后,在这些工作的基础上,作者将WEB使用记录挖掘应用到重庆电视台互联网站上,得到了一些有用的模式。
【学位授予单位】:重庆大学
【学位级别】:硕士
【学位授予年份】:2003
【分类号】:TP393.092

【引证文献】
中国期刊全文数据库 前2条
1 赵文忠;张长利;房俊龙;;Web日志挖掘在农业网站的应用[J];东北农业大学学报;2010年08期
2 赵莹莹;韩元杰;;Web日志数据挖掘中数据预处理模型的研究与建立[J];现代电子技术;2007年04期
中国硕士学位论文全文数据库 前5条
1 李勇君;基于Hadoop的海量期货数据的分布式存储和算法分析[D];天津大学;2012年
2 张姝;网站可用性分析及可视化技术研究[D];沈阳工业大学;2006年
3 李向云;Web日志挖掘技术的研究[D];大庆石油学院;2007年
4 刘滨;Web日志挖掘及其实现[D];哈尔滨工程大学;2007年
5 赵文忠;WEB挖掘在农业网站的应用研究[D];东北农业大学;2008年
【参考文献】
中国期刊全文数据库 前10条
1 万方,尹为民,吴迪;网络数据挖掘及其新技术探讨[J];信息技术;2002年01期
2 韩家炜,孟小峰,王静,李盛恩;Web挖掘研究[J];计算机研究与发展;2001年04期
3 王实,高文,李锦涛,谢辉;路径聚类:在Web站点中的知识发现[J];计算机研究与发展;2001年04期
4 邓英,李明;Web数据挖掘技术及工具研究[J];计算机工程与应用;2001年20期
5 陆丽娜,杨怡玲,管旭东,魏恒义;Web日志挖掘中的数据预处理的研究[J];计算机工程;2000年04期
6 钟清流;Web数据挖掘的BN实现方案[J];计算机工程;2001年06期
7 何炎祥,陈 伟,孔维强,张 戈;Web数据挖掘中的增量挖掘[J];计算机工程;2002年04期
8 谢丹夏,李晓东;数据挖掘技术在Web上的应用及其工具设计[J];计算机应用;2001年02期
9 苏中,马少平,杨强,张宏江;基于Web-Log Mining的Web文档聚类[J];软件学报;2002年01期
10 宋擒豹,沈钧毅;基于关联规则的Web文档聚类算法[J];软件学报;2002年03期
【共引文献】
中国期刊全文数据库 前10条
1 钱立三;WEB日志挖掘在远程开放教育中的应用[J];安徽广播电视大学学报;2005年03期
2 宁小红;;Web Usage Mining在电子商务中的应用[J];安徽农业科学;2007年13期
3 张克君;杨炳儒;赵耿;曲文龙;李欣;;一种分布式Web使用模式挖掘模型及算法[J];北京科技大学学报;2006年09期
4 谢秋华;;Web文本挖掘的相关技术问题探讨[J];长春理工大学学报;2010年07期
5 庞淑英,付铁威,胡恒奎,郑晓建;挖掘用户兴趣的Web智能检索桌面的研究[J];成都理工大学学报(自然科学版);2003年02期
6 肖蓉,李旭伟,朱宏;IP网管数据挖掘系统的分析与设计[J];成都信息工程学院学报;2004年02期
7 陈磊;王鹏;董静宜;任超;;基于云计算架构的分布式数据挖掘研究[J];成都信息工程学院学报;2010年06期
8 洪梅;;Web日志挖掘在电子商务中的应用[J];长春大学学报;2008年10期
9 鲁光男;;KDD在高校教育中的应用[J];长春大学学报;2008年12期
10 雷筱珍;赖万钦;;一种基于URL路径的页面用户聚类方法[J];长春工程学院学报(自然科学版);2009年02期
中国重要会议论文全文数据库 前10条
1 代广珍;徐超;;基于Web的数据挖掘研究综述[A];2005年“数字安徽”博士科技论坛论文集[C];2005年
2 师伟;廖闻剑;;数据挖掘在Web上的研究与应用[A];中国电子学会第十六届信息论学术年会论文集[C];2009年
3 陈震;陈维默;;浅谈数据挖掘技术[A];福建省科协第五届学术年会数字化制造及其它先进制造技术专题学术年会论文集[C];2005年
4 张东娜;彭宏;吴铁峰;;一种基于粗集与贝叶斯分类器的中文网页分类方法[A];第一届全国Web信息系统及其应用会议(WISA2004)论文集[C];2004年
5 钟福金;穆斌;;语义Web挖掘研究[A];第一届全国Web信息系统及其应用会议(WISA2004)论文集[C];2004年
6 詹宇斌;殷建平;周文兰;;基于概率关联图挖掘Web日志中有趣关联规则[A];2006年全国理论计算机科学学术年会论文集[C];2006年
7 冯迪;李晋宏;曹原;;基于网页的数据挖掘研究[A];2007通信理论与技术新发展——第十二届全国青年通信学术会议论文集(上册)[C];2007年
8 魏新;廖闻剑;彭艳兵;;基于数据挖掘的校园网络行为分析[A];第十届中国科协年会信息化与社会发展学术讨论会分会场论文集[C];2008年
9 彭怡;寇纲;;基于领域知识的数据挖掘理论框架研究[A];第三届(2008)中国管理学年会论文集[C];2008年
10 于满泉;谭松波;许洪波;;网页内部结构挖掘技术研究[A];NCIRCS2004第一届全国信息检索与内容安全学术会议论文集[C];2004年
中国博士学位论文全文数据库 前10条
1 张翔;文本挖掘技术研究及其在综合风险信息网络中的应用[D];西北大学;2011年
2 孙晶涛;基于内容的垃圾邮件过滤技术研究[D];兰州理工大学;2010年
3 万淼;基于群智能和随机索引的网络聚类算法研究[D];北京邮电大学;2011年
4 梁成军;网球技战术决策支持系统研究与应用[D];上海体育学院;2011年
5 刘铭;大规模文档聚类中若干关键问题的研究[D];哈尔滨工业大学;2010年
6 马俊;信息技术嵌入的物流企业服务能力研究[D];武汉理工大学;2011年
7 高飞;关联规则挖掘算法研究[D];西安电子科技大学;2001年
8 陈定权;自动主题搜索的应用研究[D];中国科学院研究生院(文献情报中心);2003年
9 李学明;计算机数据的关联规则挖掘理论和算法研究[D];重庆大学;2003年
10 刘君强;海量数据挖掘技术研究[D];浙江大学;2003年
中国硕士学位论文全文数据库 前10条
1 王宇轩;电子信箱的可用性实验研究[D];浙江理工大学;2010年
2 刘建东;基于Web访问信息挖掘的数字图书馆个性化服务研究[D];浙江理工大学;2010年
3 孙原;基于酉变换的权威页面挖掘算法研究[D];哈尔滨工程大学;2010年
4 李媛;电子商务个性化推荐关键技术研究[D];哈尔滨工程大学;2010年
5 景向永;电子资源使用统计标准化研究[D];大连理工大学;2010年
6 程波波;基于文本的茶学本体学习方法研究[D];安徽农业大学;2010年
7 张峰;基于数据挖掘技术的教学管理应用研究[D];合肥工业大学;2010年
8 方少卿;Web就业信息抽取系统的实现研究[D];合肥工业大学;2010年
9 徐旭;基于决策树的Web应用系统个性化身份验证研究[D];合肥工业大学;2010年
10 年爱华;数据挖掘在职校普通话等级考试成绩分析中的应用[D];兰州大学;2010年
【同被引文献】
中国期刊全文数据库 前10条
1 于淞楠;从信息需求角度看我国农业信息化[J];边疆经济与文化;2004年10期
2 黄明,魏静波,牛娃;对Apriori算法的进一步改进[J];大连铁道学院学报;2003年04期
3 杜文华;Web使用挖掘综述[J];电脑开发与应用;2003年04期
4 王玉珍;Web使用模式挖掘中的几个关键问题研究[J];电脑开发与应用;2003年11期
5 刘华元;袁琴琴;王保保;;并行数据挖掘算法综述[J];电子科技;2006年01期
6 董德民;;面向电子商务的Web使用挖掘及其应用研究[J];中国管理信息化(综合版);2006年10期
7 王熙照,王丽娟,袁方,湛燕;Web用户访问模式挖掘[J];河北大学学报(自然科学版);2002年04期
8 侯亚丽,袁方;Web日志挖掘中的数据预处理技术[J];河北大学学报(自然科学版);2005年02期
9 易敏昕,张有仁,汪胜;基于日志定制的Web使用数据挖掘预处理研究[J];华东理工大学学报;2003年04期
10 马金龙;马非特;;金融市场高频数据挖掘的新进展——金融孤子(非欧几何)构造投资模式的实盘交易[J];华南金融电脑;2006年06期
中国硕士学位论文全文数据库 前10条
1 水俊峰;面向智能Web站点的数据挖掘技术研究及应用[D];武汉理工大学;2003年
2 田海山;基于Web日志的数据挖掘研究[D];河北工业大学;2003年
3 周宇;基于WUM的个性化智能推荐技术研究[D];浙江工业大学;2003年
4 赵伟;基于Web日志的用户访问模式挖掘[D];天津大学;2004年
5 褚法政;基于数据挖掘的银行客户关系管理[D];青岛大学;2004年
6 马大为;电子交易行情预测算法研究[D];郑州大学;2004年
7 罗超;基于流数据关联规则的访问模式挖掘研究[D];辽宁工程技术大学;2005年
8 何玉宝;数据挖掘在网站可用性分析上的应用研究[D];大连海事大学;2005年
9 王丽娜;WEB日志挖掘的研究和实现[D];郑州大学;2005年
10 金花;一种新的Web日志挖掘算法的研究[D];大连交通大学;2005年
【二级引证文献】
中国期刊全文数据库 前9条
1 于华;张文盛;;基于Web日志的网站优化方案的设计与实现[J];办公自动化;2012年12期
2 宋莹;沈奇威;王晶;;基于Hadoop的Web日志预处理的设计与实现[J];电信工程技术与标准化;2011年11期
3 赵娜;葛蒲阳;;Web日志挖掘的数据预处理研究[J];电脑知识与技术;2008年18期
4 牛永洁;张成;;用户行为驱动的网页布局自动调整的研究[J];计算技术与自动化;2011年01期
5 赵龙文;郭静;;Web挖掘中公民隐私权保护解决方案探讨[J];科技管理研究;2012年04期
6 王长征;;基于Web日志挖掘的网上教学质量评估方法研究[J];科技广场;2008年05期
7 张晓敬;姚家奕;;基于Web数据挖掘的企业知识管理系统模型框架[J];内蒙古科技与经济;2009年19期
8 黄璟;肖梦雄;魏亮;;基于squid的反向代理运维系统设计[J];软件导刊;2012年05期
9 赵娜;田保慧;姜建国;;基于加权矩阵聚类的Web日志挖掘算法[J];现代电子技术;2008年12期
中国硕士学位论文全文数据库 前10条
1 龚健;数据挖掘技术在农业信息服务中的应用研究[D];安徽农业大学;2010年
2 张晓艳;面向农业信息服务平台的挖掘技术研究[D];湖南工业大学;2010年
3 高峰;基于兴趣分类的用户行为分析系统的研究[D];山东大学;2010年
4 杜立平;Web用户访问聚类模式研究[D];西安电子科技大学;2010年
5 詹圣君;基于用户行为日志分析的搜索引擎排序算法研究[D];湖北工业大学;2011年
6 王华;基于遗传算法的Web日志挖掘的应用研究[D];安徽工业大学;2011年
7 刘其辉;大众行为下基于贝叶斯网的知识集群模型及其应用[D];华南理工大学;2011年
8 李晓辉;基于用户行为分析的数据挖掘系统研究与设计[D];北京邮电大学;2011年
9 李丽;面向交友网站的Web日志关联规则挖掘及系统实现[D];重庆大学;2010年
10 周津;互联网中的海量用户行为挖掘算法研究[D];中国科学技术大学;2011年
【二级参考文献】
中国期刊全文数据库 前10条
1 王继成,邹涛,杨小江,潘金贵,张福炎;基于Internet的信息资源发现技术与实现[J];计算机研究与发展;1999年11期
2 王继成,潘金贵,张福炎;Web文本挖掘技术研究[J];计算机研究与发展;2000年05期
3 李晓黎,刘继敏,史忠植;概念推理网及其在文本分类中的应用[J];计算机研究与发展;2000年09期
4 周斌,吴泉源,高洪奎;用户访问模式数据挖掘的模型与算法研究[J];计算机研究与发展;1999年07期
5 邹涛,王继成,朱华宇,金翔宇,张福炎;WWW上的信息挖掘技术及实现[J];计算机研究与发展;1999年08期
6 谢丹夏;Web上的数据挖掘技术和工具设计[J];计算机工程与应用;2001年06期
7 刘明吉;王秀峰;黄亚楼;;数据挖掘中的数据预处理[J];计算机科学;2000年04期
8 王利强,唐常杰,于中华,何雪梅;基于Web的数据采掘[J];计算机应用;1998年10期
9 邹涛,黄源,张福炎;基于WWW的文本信息挖掘[J];情报学报;1999年04期
10 田金兰,张素琴,黄刚;用关联规则方法挖掘保险业务数据中的投资风险规则[J];清华大学学报(自然科学版);2001年01期
【相似文献】
中国期刊全文数据库 前10条
1 于海涛;;Web挖掘技术在搜索引擎中的应用[J];齐齐哈尔师范高等专科学校学报;2009年06期
2 袁柱;;电子商务中Web数据挖掘的应用研究[J];商场现代化;2007年22期
3 余华鸿;;电子商务中Web挖掘技术的应用[J];今日科苑;2008年18期
4 石岩;;Web挖掘技术在电子商务中的应用[J];科技情报开发与经济;2006年23期
5 宋艳;刘少华;;Web挖掘在电子商务中的应用[J];电脑知识与技术;2008年14期
6 史哲;;基于XML的Web数据挖掘及应用模式研究[J];科技创新导报;2011年02期
7 刘峰,张文鹏;远程教学系统中的关键技术——Web挖掘[J];南阳师范学院学报;2005年09期
8 陈伟;;Web挖掘在电子商务中的应用研究[J];商场现代化;2009年02期
9 柳珺;;Web挖掘技术与电子商务[J];商场现代化;2007年09期
10 秦鸿;基于Web的数据挖掘[J];电子科技大学学报;2002年S1期
中国重要会议论文全文数据库 前10条
1 丁瑾;;基于Web数据挖掘的综述[A];山西省科学技术情报学会学术年会论文集[C];2004年
2 易虹;许德刚;;Web数据挖掘的研究与应用[A];第一届全国Web信息系统及其应用会议(WISA2004)论文集[C];2004年
3 吴珊;杨桦;;基于日志挖掘的Web预取模型[A];2006年电气工程教育专业委员会年会论文集[C];2006年
4 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
5 曾潮缤;罗键;;Web使用记录挖掘中的聚类分析研究[A];第二十一届中国数据库学术会议论文集(技术报告篇)[C];2004年
6 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
7 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
8 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
9 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 裴维玲;呼叫中心与数据挖掘,谁先上?[N];网络世界;2001年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 蒲秋梅;基于XML的Web数据挖掘技术的研究[D];武汉大学;2004年
2 段晓峰;网站日志的数据挖掘[D];重庆大学;2003年
3 张承明;基于Web的数据挖掘研究[D];山东科技大学;2003年
4 陈敏;基于Web使用挖掘的知识发现研究[D];合肥工业大学;2005年
5 郭鹏;基于Web数据挖掘分类算法的个性化信息服务[D];太原理工大学;2003年
6 祝效普;WEB用户访问序列模式挖掘[D];天津大学;2005年
7 冶红;基于数据挖掘的Web挖掘系统的研究[D];大连理工大学;2003年
8 彭希鸿;基于Web内容挖掘的网页分类与过滤研究与应用[D];中南大学;2003年
9 潘延军;基于用户浏览内容的Web用户浏览行为个性化研究[D];天津大学;2005年
10 孙丽;Web数据的挖掘方法研究[D];大庆石油学院;2004年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026