收藏本站
《东北大学》 2006年
收藏 | 手机打开
二维码
手机客户端打开本文

面向智能信息检索的Web挖掘关键技术研究

袁方  
【摘要】:WWW自从1991年问世以来得到了非常迅速的发展,为人们获取各种信息提供了方便。随着Internet技术的不断发展和完善,WWW将会逐步成为人们获取信息的一个重要渠道。如果说,在信息量相对较少的时候,Internet为人们获取信息提供了方便的话,随着Internet上信息量的急剧增加,人们却感觉到查找所需要的信息越来越困难了,其原因就在于传统的信息检索方式已越来越不适应网上的海量信息,人们希望有更加智能化的信息检索方式出现,以应对海量信息的检索。 本文对面向智能信息检索的Web挖掘的若干关键技术进行研究,重点研究了数据预处理、Web页面分类/聚类及Web用户分类/聚类、概念检索、个性化服务等问题,提出或改进了一些应用于智能信息检索的Web挖掘算法,应用研究成果实现了一个小型智能化信息检索的系统原型。 数据预处理包括基于PDF文件的信息抽取、中文文本分词和Web日志预处理。对于PDF文件信息抽取,提出了基于格式注入的规则抽取和基于树模型的信息抽取算法,在人工标注指导下学习信息抽取规则,取得了较高的信息抽取准确率。对于中文文本分词,提出了基于固定词典和统计相结合的渐进式丰富词典的中文文本分词方法,较好地解决了新词识别问题,相对于单纯的词典方法或统计方法,具有更好的分词效果。Web日志预处理包括数据清洗、用户识别、会话识别和路径补充等工作,在分析已有工作的基础上,重点讨论了路径补充问题并提出了新的路径补充算法,使Web日志预处理工作更加完善。 在中文页面分类研究中,讨论了用于文本分类的各种方法,重点讨论了对文本分类具有较高分类准确率的k-近邻方法。针对k-近邻方法分类效率不高的问题,提出了基于密度的训练样本集约减、渐进式分类等算法。通过计算训练样本集中各类别的类别密度及整个训练集的平均密度,去掉高密度类别中的部分样本;渐进式分类模式模拟人工分类文本的智能化形式,分为按标题分类、按关键段落分类和按全文分类三个层次,尽量减少分析全文的比例。实验表明,这两个方面的改进,不仅提高了k-近邻方法的分类效率,而且对其分类准确率也有一定程度的提高,这说明训练样本集的约减使其具有更好的代表性,渐进式文本分
【学位授予单位】:东北大学
【学位级别】:博士
【学位授予年份】:2006
【分类号】:TP391.3

【引证文献】
中国期刊全文数据库 前6条
1 沈典;;基于信息推送的领域垂直搜索引擎研究[J];电子世界;2012年08期
2 魏桂英;高学东;武森;;基于领域本体的个性化文本信息检索[J];辽宁工程技术大学学报(自然科学版);2011年02期
3 李丹;鲁明羽;时丽莎;;循证医学信息化若干关键技术的研究[J];广西师范大学学报(自然科学版);2008年03期
4 王春艳;程霜梅;杨鑫;;基于聚簇样本约减的K-近邻神经网络分类器[J];情报科学;2010年10期
5 曾锡山;胡俊荣;;WEB文本海量数据挖掘应用中的多点数据采集及处理问题研究[J];情报杂志;2010年08期
6 杨晓燕;;Web信息检索问题及算法改进研究[J];浙江万里学院学报;2008年05期
中国博士学位论文全文数据库 前1条
1 朱鲲鹏;基于Web日志挖掘的智能信息检索研究[D];哈尔滨工业大学;2009年
中国硕士学位论文全文数据库 前2条
1 韩晓光;基于语义网的智能信息检索[D];沈阳工业大学;2011年
2 杨毅超;基于Web数据挖掘的作物商务平台分析与研究[D];湖南农业大学;2008年
【参考文献】
中国期刊全文数据库 前10条
1 邓志鸿,唐世渭,张铭,杨冬青,陈捷;Ontology研究综述[J];北京大学学报(自然科学版);2002年05期
2 王继成,潘金贵,张福炎;Web文本挖掘技术研究[J];计算机研究与发展;2000年05期
3 周水庚,周傲英,曹晶,胡运发;一种基于密度的快速聚类算法[J];计算机研究与发展;2000年11期
4 韩家炜,孟小峰,王静,李盛恩;Web挖掘研究[J];计算机研究与发展;2001年04期
5 李荣陆,胡运发;基于密度的kNN文本分类器训练样本裁剪方法[J];计算机研究与发展;2004年04期
6 朱明,王军,王俊普;基于多层模式的多记录网页信息抽取方法[J];计算机工程;2001年09期
7 杜小勇,李曼,王大治;语义Web与本体研究综述[J];计算机应用;2004年10期
8 赵伟,戴新宇,尹存燕,陈家骏;一种规则与统计相结合的汉语分词方法[J];计算机应用研究;2004年03期
9 曾春,邢春晓,周立柱;个性化服务技术综述[J];软件学报;2002年10期
10 马帅,王腾蛟,唐世渭,杨冬青,高军;一种基于参考点和密度的快速聚类算法[J];软件学报;2003年06期
【共引文献】
中国期刊全文数据库 前10条
1 方国桢,吴莉;化学计量学在元素形态同时测定中的应用[J];四川有色金属;1999年03期
2 张世海,刘晓燕,欧进萍;高层结构智能选型知识发现及方法比较[J];四川建筑科学研究;2005年05期
3 王倩;蒋林华;张京丰;徐海群;;模糊神经网络在粉煤灰混凝土强度预测中的应用[J];四川建筑科学研究;2006年06期
4 张彤;王建平;孟改样;;异因同果关联神经网络在工程造价中的应用研究[J];四川建筑科学研究;2009年02期
5 潘洁珠;半结构化数据及其数据模型[J];安徽教育学院学报;2003年06期
6 钱立三;WEB日志挖掘在远程开放教育中的应用[J];安徽广播电视大学学报;2005年03期
7 范进;;产业结构对产业集群影响力的实证分析[J];安徽广播电视大学学报;2006年04期
8 梁峰;金莹;;基于Agent技术的语义网服务模型[J];安徽广播电视大学学报;2008年01期
9 于立红;杜芸;;数据挖掘中数据预处理方法与技术[J];安徽电子信息职业技术学院学报;2009年04期
10 汪浩瀚;曾建军;;芜湖市工业企业效益的统计分析及综合评定[J];安徽大学学报(自然科学版);1991年02期
中国重要会议论文全文数据库 前10条
1 叶红云;倪志伟;陈恩红;;一种混合型集成学习演化决策树算法[A];2005年“数字安徽”博士科技论坛论文集[C];2005年
2 代广珍;徐超;;基于Web的数据挖掘研究综述[A];2005年“数字安徽”博士科技论坛论文集[C];2005年
3 章曙光;;基于CBR的电力负荷预测系统的研究与实现[A];2005年“数字安徽”博士科技论坛论文集[C];2005年
4 冯艳;于立平;邵玮;乔俊峰;唐燕;;转变经济发展方式对北京经济影响的测度[A];科学发展:社会管理与社会和谐——2011学术前沿论丛(下)[C];2011年
5 雷育生;甘仞初;杨军;;一种基于用户偏好的虚拟网站信息结构自适应调整算法[A];2007年全国第十一届企业信息化与工业工程学术会议论文集[C];2007年
6 贾允毅;胥布工;王世华;刘步春;;端对端网络时钟漂移补偿算法研究及其实现[A];第二十六届中国控制会议论文集[C];2007年
7 ;A Hybrid Clustering Algorithm Based on Grid Density and Rough Sets[A];第二十七届中国控制会议论文集[C];2008年
8 张娟;陈杰;段梅;;基于神经网络和广义经典分配算法的多传感器航迹关联[A];第二十七届中国控制会议论文集[C];2008年
9 隋金雪;杨莉;华臻;张鑫;;改进的BP网络在火焰燃烧状态识别中的应用[A];第二十七届中国控制会议论文集[C];2008年
10 ;Learning Algorithm of Decision Tree Generation for Continuous-valued Attribute[A];第二十九届中国控制会议论文集[C];2010年
中国博士学位论文全文数据库 前10条
1 王杰;基于人工智能的乒乓球比赛技战术诊断与评估研究[D];上海体育学院;2010年
2 于翔;基于网格的数据流聚类方法研究[D];哈尔滨工程大学;2010年
3 赵琪;我国国有企业人力资源优化配置研究[D];哈尔滨工程大学;2010年
4 李华文;船舶交通管理系统经济社会影响评价研究[D];大连海事大学;2010年
5 牟向伟;模糊语义个性化推荐系统在电子政务中的应用研究[D];大连海事大学;2010年
6 张进;地震叠前数据的弹性阻抗非线性反演方法研究[D];中国海洋大学;2009年
7 卜志国;海洋生态环境监测系统数据集成与应用研究[D];中国海洋大学;2010年
8 熊晶;海洋生态本体的建模方法研究及应用[D];中国海洋大学;2010年
9 马勇;欧盟科技一体化研究[D];华东师范大学;2011年
10 全惠敏;电能质量相关信号的S变换检测算法及应用研究[D];湖南大学;2010年
中国硕士学位论文全文数据库 前10条
1 代宏伟;布里渊散射水下探测目标的自动识别[D];南昌航空大学;2010年
2 杜武青;西部大气环境中聚酯玻璃钢老化及室内外老化相关性研究[D];南昌航空大学;2010年
3 厉颖;基于本体的服装领域知识表示的建模研究[D];山东科技大学;2010年
4 李金华;基于SVM的多类文本分类研究[D];山东科技大学;2010年
5 孙岭;一种基于前缀表达式的Web信息抽取方法的关键问题的实现[D];山东科技大学;2010年
6 吕媛媛;基于本体的物流信息集成系统的研究[D];山东科技大学;2010年
7 吕晨;搜索竞价广告关键词优化问题研究[D];山东科技大学;2010年
8 吴则则;支持动态演进的用户兴趣模型挖掘方法研究[D];山东科技大学;2010年
9 吴香庭;基于遗传算法的K-means聚类方法的研究[D];山东科技大学;2010年
10 李臻;城市公交车辆智能调度优化研究[D];山东科技大学;2010年
【同被引文献】
中国期刊全文数据库 前10条
1 邓志鸿,唐世渭,张铭,杨冬青,陈捷;Ontology研究综述[J];北京大学学报(自然科学版);2002年05期
2 许云,樊孝忠,张锋;基于知网的语义相关度计算[J];北京理工大学学报;2005年05期
3 暴海龙,李金林;专利检索中的IPC和主题词识别方法研究[J];北京理工大学学报(社会科学版);2003年05期
4 白同强,刘磊;语义Web的研究与展望[J];吉林大学学报(信息科学版);2004年02期
5 王志明;沙莎;;Web文本挖掘技术在新闻主题检测中的应用研究[J];长沙大学学报;2007年05期
6 查志琴;;基于行模式的网页信息提取算法[J];常州工学院学报;2007年04期
7 原福永,李莉,李红岩;智能信息检索的设计与研究[J];燕山大学学报;2005年04期
8 周琪锋;;基于Web的数据挖掘技术的研究[J];电脑知识与技术(学术交流);2007年01期
9 朱扬勇,周欣,施伯乐;规则型数据采掘工具集AMINER[J];高技术通讯;2000年03期
10 张明,王煜,杨敬伟,袁方,赵红,石强;基于Ontology的智能信息检索研究[J];河北大学学报(自然科学版);2005年05期
中国博士学位论文全文数据库 前4条
1 俞方桦;互联网信息资源整合研究[D];东华大学;2001年
2 许建潮;Web挖掘中若干问题的研究[D];吉林大学;2005年
3 王进;基于本体的语义信息检索研究[D];中国科学技术大学;2006年
4 王修力;基于描述复杂性的信息检索理论与若干模型研究[D];北京语言大学;2006年
中国硕士学位论文全文数据库 前10条
1 凌海云;基于语义网的智能搜索技术的研究与实现[D];电子科技大学;2004年
2 岳文;信息检索算法在Web中的应用与研究[D];湖南大学;2006年
3 高继峰;基于语义Web的智能信息检索系统研究[D];郑州大学;2006年
4 李衍淼;基于本体的智能信息检索系统研究[D];山东科技大学;2006年
5 李盛韬;基于主题的Web信息采集技术研究[D];中国科学院研究生院(计算技术研究所);2002年
6 杨明莉;基于语义网的智能搜索模型的研究[D];东北师范大学;2007年
7 贾保先;基于Ontology的智能信息检索关键技术研究[D];中国海洋大学;2007年
8 习明昊;基于语义网描述语言的信息检索系统[D];武汉科技大学;2007年
9 黎明;基于语义网的信息检索技术的研究[D];南京理工大学;2007年
10 李晓喆;基于语义网的个人数字化站点实现[D];复旦大学;2009年
【二级引证文献】
中国期刊全文数据库 前4条
1 王向阳;马军;;一个基于PageRank的科技文献质量评价算法[J];广西师范大学学报(自然科学版);2009年01期
2 陈华城;杜学绘;陈性元;夏春涛;;基于兴趣本体的文档敏感信息检测方法[J];计算机应用;2012年11期
3 陈志兴;;基于语义网的信息检索技术研究定量分析(2002~2011)[J];图书馆学研究;2012年06期
4 闻中慧;;数据挖掘中的本体应用研究综述[J];软件导刊;2012年07期
中国硕士学位论文全文数据库 前2条
1 卢小康;中文文本复制检测技术研究[D];杭州电子科技大学;2009年
2 邱娣;基于Web日志挖掘的用户信息需求识别研究[D];华中师范大学;2012年
【二级参考文献】
中国期刊全文数据库 前10条
1 邓志鸿,唐世渭,张铭,杨冬青,陈捷;Ontology研究综述[J];北京大学学报(自然科学版);2002年05期
2 黄德根,朱和合,王昆仑,杨元生,钟万勰;基于最长次长匹配的汉语自动分词[J];大连理工大学学报;1999年06期
3 王锡江;王启祥;陈家骏;;基于邻接知识的汉语自动分词系统[J];计算机研究与发展;1992年11期
4 孙茂松,黄昌宁,邹嘉彦,陆方,沈达阳;利用汉字二元语法关系解决汉语自动分词中的交集型歧义[J];计算机研究与发展;1997年05期
5 姚天顺,张桂平,吴映明;基于规则的汉语自动分词系统[J];中文信息学报;1990年01期
6 沈达阳,孙茂松,黄昌宁;汉语分词系统中的信息集成和最佳路径搜索方法[J];中文信息学报;1997年02期
7 王伟,钟义信,孙建,杨力;一种基于EM非监督训练的自组织分词歧义解决方案[J];中文信息学报;2001年02期
8 李蓉,刘少辉,叶世伟,史忠植;基于SVM和k-NN结合的汉语交集型歧义切分方法[J];中文信息学报;2001年06期
9 邹涛,王继成,张福炎;基于WWW的资料搜集系统的设计与实现[J];情报学报;1999年03期
10 黄豫清,戚广志,张福炎;从WEB文档中构造半结构化信息的抽取器[J];软件学报;2000年01期
【相似文献】
中国期刊全文数据库 前10条
1 宋艳;刘少华;;Web挖掘在电子商务中的应用[J];电脑知识与技术;2008年14期
2 吴林旭;姚跃华;黄晶;;基于蚁群优化在Web数据挖掘分类模型的实现[J];计算机工程与科学;2009年03期
3 陈伟;;Web挖掘在电子商务中的应用研究[J];商场现代化;2009年02期
4 杨风雷;阎保平;;Web用户行为模式挖掘研究[J];微电子学与计算机;2008年11期
5 姜涌;吕冰;;Web挖掘技术在电子商务的应用[J];计算机与数字工程;2008年04期
6 张辉;;基于本体的语义Web挖掘技术研究[J];电脑开发与应用;2009年02期
7 蔺世杰;李明杰;;基于Web挖掘的个性化信息服务系统的设计[J];常熟理工学院学报;2006年06期
8 赵元媛;;Web挖掘与个性化服务研究[J];商场现代化;2007年17期
9 靳明霞;李玉华;管建军;;序列模式挖掘在电子商务个性化服务中的应用[J];计算机技术与发展;2006年10期
10 黄镇圣;;基于Web浏览的高校图书馆用户个性化研究[J];科技信息;2009年12期
中国重要会议论文全文数据库 前10条
1 谭立云;凯丽比努尔;塔西甫拉提;高学东;热合木江;;数据挖掘中的数据预处理方法研究[A];全国第16届计算机科学与技术应用(CACIS)学术会议论文集[C];2004年
2 吕琳;朱东华;刘玉琴;;面向数据仓库的数据预处理研究综述[A];2007年中国智能自动化会议论文集[C];2007年
3 楚红涛;寒枫;张燕;王婷;;基于数据流的挖掘研究[A];计算机技术与应用进展·2007——全国第18届计算机技术与应用(CACIS)学术会议论文集[C];2007年
4 于健;陈子军;李霞;李炜;;一种新的多密度聚类算法[A];2007北京地区高校研究生学术交流会通信与信息技术会议论文集(上册)[C];2008年
5 张荣祖;朱扬勇;;一个可视化数据挖掘系统中的数据预处理技术[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
6 潘玉奇;石冰;周劲;袁宁;;基于多维数据模型的聚类分析的研究[A];山东省计算机学会2005年信息技术与信息化研讨会论文集(一)[C];2005年
7 田小丽;郑康锋;钮心忻;;一种基于改进K-Medoids算法的网络攻击检测技术[A];2009通信理论与技术新发展——第十四届全国青年通信学术会议论文集[C];2009年
8 丁瑾;;基于Web数据挖掘的综述[A];山西省科学技术情报学会学术年会论文集[C];2004年
9 许小林;唐文忠;;基于贝叶斯算法的垃圾邮件检测中数据预处理技术的研究[A];计算机技术与应用进展——全国第17届计算机科学与技术应用(CACIS)学术会议论文集(上册)[C];2006年
10 王静;汪晓刚;;一种新的保护原始数据隐私性的聚类算法[A];第十届中国科协年会论文集(三)[C];2008年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 张立明;数据挖掘之道[N];网络世界;2003年
4 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
5 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
中国博士学位论文全文数据库 前10条
1 袁方;面向智能信息检索的Web挖掘关键技术研究[D];东北大学;2006年
2 杨小兵;聚类分析中若干关键技术的研究[D];浙江大学;2005年
3 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
4 张瑀;基于实验数据挖掘与细胞自动机的结构分析方法[D];哈尔滨工业大学;2010年
5 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
6 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
9 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
10 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
中国硕士学位论文全文数据库 前10条
1 鄢文晋;蚁群算法及其在数据挖掘中的应用[D];重庆大学;2007年
2 潘延军;基于用户浏览内容的Web用户浏览行为个性化研究[D];天津大学;2005年
3 吕毅;基于Web挖掘的Portal个性化服务模型的研究及实现[D];西北大学;2007年
4 郭鹏;基于Web数据挖掘分类算法的个性化信息服务[D];太原理工大学;2003年
5 王春贺;个性化推荐技术研究及其在数字图书馆中应用[D];浙江大学;2007年
6 张承明;基于Web的数据挖掘研究[D];山东科技大学;2003年
7 蒲秋梅;基于XML的Web数据挖掘技术的研究[D];武汉大学;2004年
8 陈敏;基于Web使用挖掘的知识发现研究[D];合肥工业大学;2005年
9 唐艺军;基于蚁群算法的数据挖掘应用研究[D];辽宁工程技术大学;2007年
10 李雪倩;Web使用记录挖掘在数字图书馆个性化服务中的应用研究[D];黑龙江大学;2008年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026