收藏本站
《东北师范大学》 2010年
收藏 | 手机打开
二维码
手机客户端打开本文

个性化信息检索系统中文本聚类的研究

张金  
【摘要】: 随着互联网发展和普及,“检索”已经成为人们生活中的一部分。互联网已经把全世界连在了一起,如何从浩瀚的信息海洋中找到自己想要的东西呢,答案就是“检索”。 在众多检索系统中,对于学术研究最有用的当属文献检索了,但是当前的文献检索系统大都只能进行关键字匹配的检索,抓不住用户的兴趣,如果检索系统能够获取用户的兴趣,就可以使用户在一次又一次的检索中会发现自己想要的文献总是能出现在排序的最前面,肯定大大方便了用户,使其对所使用的检索系统大家赞赏并决定长期使用,这无论对用户还是检索平台都是大有益处的。 本着以上的思想,本小组开始制作这样一个检索系统,它能通过用户的检索行为来获取用户的兴趣,并将兴趣相似的用户组成用户组,以方便用户的交流,共享资源。本文讨论的是我们小组所做的检索系统中的基础部分,包括文本预处理,对文本向量进行聚类构建系统底层部分。本人的工作具体是完成了文本处理程序可以对文献进行预处理,它可以将分词后的文本转化为向量;可以对题目,关键词,摘要加权,并调整其权重;可以按词性提取特征;完成对其停用词表的控制;程序可以生成文档频数,tfidf的特征向量,支持向量机的特征向量等多种特征向量。并且在随后聚类试验中,改进AP[1](Affinity propagation clustering)聚类,使其获得更好的聚类结果。 AP聚类有一个优点,就是如果使用者不知道数据的类数,不用指定类数也可以很好的进行分类,但是有时侯我们知道类数,那么我们怎么能提高分类的效果呢?本篇论文提出了一种改进的AP聚类算法来处理这种情况。当你知道数据类数的时候,可以指定AP最终聚成的类数。实验也表明了,它不低于原AP聚类算法的效果
【学位授予单位】:东北师范大学
【学位级别】:硕士
【学位授予年份】:2010
【分类号】:TP391.1

【相似文献】
中国期刊全文数据库 前10条
1 冯霞;闫冠男;李娟娟;;一种基于潜在语义索引的谱聚类方法研究[J];中国民航大学学报;2011年03期
2 王春腾;符传谊;邢洁清;;一种改进的谱聚类方法及其在文本分析中的应用[J];电脑知识与技术;2011年16期
3 程结晶;钱晓芳;张方;;网络环境下个性化信息资源服务途径初探[J];现代情报;2011年09期
4 何峰;丁晓青;;结合文本聚类和文本检索的语料选取方法[J];高技术通讯;2010年12期
5 钟将;刘龙海;梁传伟;;基于成对约束的主动半监督文本聚类[J];计算机工程;2011年13期
6 周鑫;郝志峰;蔡瑞初;温雯;;带噪声的文本聚类及其在反垃圾邮件中的应用[J];广西师范大学学报(自然科学版);2011年02期
7 苏喻;郑诚;马中杰;;基于语义的VSM模型改进[J];计算机应用与软件;2011年08期
8 孙桂煌;;一种基于n-gram短语的文本聚类方法研究[J];现代计算机(专业版);2011年14期
9 刘海峰;庞秀梅;张学仁;;一种聚类模式下基于密度的改进KNN算法[J];微电子学与计算机;2011年07期
10 刘海峰;姚泽清;刘守生;;一种基于模糊加权的改进文本聚类方法[J];微电子学与计算机;2011年09期
中国重要会议论文全文数据库 前10条
1 张猛;王大玲;于戈;;一种基于自动阈值发现的文本聚类方法[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
2 董婧灵;李芳;何婷婷;涂新辉;万剑;;基于LDA模型的文本聚类研究[A];中国计算语言学研究前沿进展(2009-2011)[C];2011年
3 王乐;田李;贾焰;韩伟红;;一个并行的文本聚类混合算法[A];第二十四届中国数据库学术会议论文集(研究报告篇)[C];2007年
4 张宝艳;王庆辉;;中文文本聚类的研究与实现[A];第一届学生计算语言学研讨会论文集[C];2002年
5 张刚;周昭涛;王斌;;基于主题的分布式信息检索研究[A];NCIRCS2004第一届全国信息检索与内容安全学术会议论文集[C];2004年
6 白刚;张铮;丁宗尧;朱毅;;中文文本聚类在互联网搜索的研究与应用[A];第三届全国信息检索与内容安全学术会议论文集[C];2007年
7 王莹;刘杨;;维基百科的文本聚类方法分析[A];2009年研究生学术交流会通信与信息技术论文集[C];2009年
8 黎琳;;Web内容挖掘在数字图书馆中的应用[A];中国工程物理研究院第七届电子技术青年学术交流会论文集[C];2005年
9 彭怡;;从数据挖掘文章聚类分析看其发展趋势[A];现代工业工程与管理研讨会会议论文集[C];2006年
10 朱强生;田英;周延泉;何华灿;;基于非负因子分析的模糊文本挖掘[A];2006通信理论与技术新进展——第十一届全国青年通信学术会议论文集[C];2006年
中国重要报纸全文数据库 前5条
1 应晓敏 窦文华;条条道路通罗马[N];计算机世界;2003年
2 中国科学院计算技术研究所 王 斌;内容为王[N];计算机世界;2004年
3 王培森;从Web挖到竞争情报[N];中国计算机报;2003年
4 采访人:本报记者 齐柳明、吴小京 被采访人:中国科学院文献情报中心(中科院图书馆)孙坦博士、辛希孟教授;数字图书馆让普通人学富五车[N];光明日报;2002年
5 应晓敏 窦文华;实现途径[N];计算机世界;2003年
中国博士学位论文全文数据库 前10条
1 徐森;文本聚类集成关键技术研究[D];哈尔滨工程大学;2010年
2 孟宪军;互联网文本聚类与检索技术研究[D];哈尔滨工业大学;2009年
3 郝立丽;汉语文本数据挖掘[D];吉林大学;2009年
4 倪兴良;问答系统中的短文本聚类研究与应用[D];中国科学技术大学;2011年
5 刘向威;NLP技术在中文信息检索中的应用研究[D];天津大学;2005年
6 高茂庭;文本聚类分析若干问题研究[D];天津大学;2007年
7 胡佳妮;文本挖掘中若干关键问题的研究[D];北京邮电大学;2008年
8 宣照国;文本挖掘算法及其在知识管理中的应用研究[D];大连理工大学;2008年
9 王乐;短语消息聚类相关技术研究[D];国防科学技术大学;2008年
10 杨创新;基于机器学习的高性能中文文本分类研究[D];华南理工大学;2009年
中国硕士学位论文全文数据库 前10条
1 张金;个性化信息检索系统中文本聚类的研究[D];东北师范大学;2010年
2 何晏成;基于近邻传播和凝聚层次的文本聚类方法[D];哈尔滨工业大学;2010年
3 庞俊;基于确定话题和情感极性的博客文本聚类研究[D];武汉理工大学;2010年
4 李梅;改进的K均值算法在中文文本聚类中的研究[D];安徽大学;2010年
5 王飞;基于蚁群优化的模糊文本聚类算法研究[D];河南工业大学;2010年
6 孙鑫;元搜索引擎结果个性化排序的研究与实现[D];中国石油大学;2008年
7 赵颖;基于Ontology的Web文本聚类研究[D];西华大学;2011年
8 盛江涛;网络论坛话题发现与跟踪技术研究[D];哈尔滨工业大学;2010年
9 刘延亮;一种文本聚类原型系统的设计与实现[D];大连理工大学;2006年
10 谷波;基于粗集模型的聚类方法及其在文献过滤系统中的应用[D];山西大学;2004年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026