收藏本站
《复旦大学》 2005年
收藏 | 手机打开
二维码
手机客户端打开本文

频繁模式挖掘相关技术研究

马海兵  
【摘要】:随着计算机与信息技术的普及及大容量存储技术的发展,人们在日常事务处理和科学研究中积累了大量宝贵的数据。如何从中提取或“挖掘”用户所需要的信息,是当前信息科学和技术领域面临的一大挑战。频繁模式挖掘是数据挖掘领域的一个基本问题,研究内容一般包括事务、序列、树和图。其方法被广泛应用于许多其它数据挖掘任务中,如相关性分析,周期分析,最大模式,闭合模式,查询,分类,索引等等。由于问题本身的基础性和内在复杂性,频繁模式挖掘方法成为许多研究者关注的课题。 本文对频繁模式挖掘相关技术进行了研究。重点研究了以下几个问题:将互关联后继树模型引入频繁模式挖掘方法;利用静态IS树高效挖掘频繁项集和频繁闭合项集;利用模式增长方法在有序树构成的森林中挖掘嵌入式频繁子树;在无序树构成的森林中挖掘直接频繁子树;及相关的实现技术等。本文研究内容和创新工作主要包括以下五个方面: 1)基于IS~+-树模型的频繁模式挖掘 互关联后继树模型是一种新型的全文存储索引模型。这种模型充分利用了字符序列的有序性和冗余性,适用于海量的全文存储和索引。互关联后继树模型是一种通用的模型。本文扩展了互关联后继树模型的应用领域,首次提出一种基于间接互关联后继树模型(IS~+-树)的频繁模式挖掘算法。算法特点是:挖掘任务只局部关联于一棵根树;动态更新性好,仅做增量变化:算法简单实用。与传统方法相比,该算法具有较好的挖掘效率。 2)基于静态IS-树的频繁模式挖掘 间接互关联后继树在强调了通用性的同时损失了效率。本文进一步提出一种基于静态IS-树专用模型的频繁项集挖掘算法IS-mine。IS—mine直接构造频繁项集,不进行候选集产生与测试操作;算法采用深度优先,模式增长的策略,挖掘任务只在一棵静态的IS-树上进行,避免代价较高的动态树的构建;针对不同特征的数据集,算法采用不同的过滤技术缩小搜索空间。实验与理论分析表明,对于稠密和稀疏数据两类数据集,算法都具有较好的时空效率。 3)高效频繁闭合模式 频繁闭合模式提供了完全频繁模式的所有信息,但数量却可以少几个数量级。本文提出一种基于静态IS-树的频繁闭合项集有效算法IS-Close。算法采用静态投影,模式增长的方法;用多种策略,尽量在算法运行的早期利用闭合项集的各种
【学位授予单位】:复旦大学
【学位级别】:博士
【学位授予年份】:2005
【分类号】:TP311.13

【引证文献】
中国期刊全文数据库 前2条
1 周常恩;林端宜;杨雪梅;赖新梅;褚剑锋;;频繁模式挖掘算法综述[J];福建电脑;2010年02期
2 黄黎明;唐朝晖;;智能控制过程中模糊专家控制规则的获取[J];计算机工程与应用;2007年13期
中国博士学位论文全文数据库 前2条
1 林晓勇;频繁模式挖掘和动态维护的理论与方法研究[D];北京化工大学;2008年
2 郑晓艳;频繁模式挖掘技术研究及其在供应链管理中的应用[D];天津大学;2010年
中国硕士学位论文全文数据库 前9条
1 刘忠慧;正负项关联规则挖掘的研究和应用[D];西南石油大学;2011年
2 苏纯;基于树结构的生物数据挖掘算法的研究与实现[D];哈尔滨工业大学;2006年
3 李姝;基于XML的Web数据挖掘研究[D];大连海事大学;2007年
4 傅珊珊;基于聚类的XML文档集成管理方法研究[D];华侨大学;2008年
5 奚培;一种数据流频繁闭合项集挖掘算法的研究[D];哈尔滨工程大学;2009年
6 旷玲丽;Web挖掘相关问题的研究[D];西南交通大学;2009年
7 李仁;关联规则在文本分类中的研究[D];南昌大学;2008年
8 陈秋阳;基于数据挖掘技术的精准营销系统的设计与实现[D];浙江大学;2010年
9 欧阳林;数据挖掘在农村信贷业务中的应用研究[D];中南林业科技大学;2012年
【共引文献】
中国期刊全文数据库 前10条
1 马帅,唐世渭,杨冬青,王腾蛟,高军;移动环境中的最大移动序列模式挖掘(英文)[J];北京大学学报(自然科学版);2004年03期
2 黄金;;基于频繁模式的蛋白质序列分类[J];东北农业大学学报;2008年05期
3 任家东;宗俊省;;一种基于规则表达式约束的序列模式增量式挖掘算法[J];燕山大学学报;2007年05期
4 任家东;周晓磊;;一种挖掘序列模式的增量式更新算法[J];燕山大学学报;2007年06期
5 龚振志;胡孔法;达庆利;张长海;;DMGSP:一种快速分布式全局序列模式挖掘算法[J];东南大学学报(自然科学版);2007年04期
6 胡孔法;张长海;陈崚;达庆利;;一种面向物流数据分析的路径序列挖掘算法ImGSP[J];东南大学学报(自然科学版);2008年06期
7 陈景强;翁正秋;;一种基于投影数据库的SPAM算法[J];电脑知识与技术;2010年07期
8 柴思跃;苏奋振;周成虎;;基于周期表的时空关联规则挖掘方法与实验[J];地球信息科学学报;2011年04期
9 殷脂;殷卫红;;DNA序列数据分析技术综述[J];上海电力学院学报;2011年04期
10 高琳;覃桂敏;周晓峰;;图数据中频繁模式挖掘算法研究综述[J];电子学报;2008年08期
中国重要会议论文全文数据库 前10条
1 姚伟力;王锡禄;宋俊德;;基于序列模式挖掘的告警相关性分析算法[A];2005年信息与通信领域博士后学术会议论文集[C];2005年
2 潘瑾;严勇;王晨;方晨;汪卫;施伯乐;;Chopper:一个高效的有序标号树频繁结构的挖掘算法[A];第二十届全国数据库学术会议论文集(研究报告篇)[C];2003年
3 吴先荣;杨冬青;唐世渭;王腾蛟;;基于序列树的告警相关性分析[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
4 吕静;陈未如;刘俊;Osei Adjei;;并发分支模式挖掘[A];第二十一届中国数据库学术会议论文集(技术报告篇)[C];2004年
5 吴铁峰;彭宏;张东娜;;一种网络告警的增量挖掘算法[A];第二十一届中国数据库学术会议论文集(技术报告篇)[C];2004年
6 王生生;刘大有;;多粒度时空数据库[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
7 朱永泰;王晨;洪铭胜;汪卫;施伯乐;;ESPM——频繁子树挖掘算法[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
8 牛兴雯;杨冬青;唐世渭;王腾蛟;;OSAF-tree——可迭代的移动序列模式挖掘及增量更新方法[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
9 程银波;司菁菁;;带有间隔约束的序列模式挖掘算法[A];第二十二届中国数据库学术会议论文集(技术报告篇)[C];2005年
10 张锐;熊赟;陈越;朱扬勇;;MS-BioSM:一个基于多支持度生物序列模式挖掘算法[A];第二十四届中国数据库学术会议论文集(技术报告篇)[C];2007年
中国博士学位论文全文数据库 前10条
1 叶红云;面向金融营销问题的个性化推荐方法研究[D];合肥工业大学;2011年
2 朱辉生;基于情节规则匹配的数据流预测研究[D];复旦大学;2011年
3 林冠洲;网络流量识别关键技术研究[D];北京邮电大学;2011年
4 冯博;基于半结构化数据的数据流挖掘算法研究[D];北京邮电大学;2011年
5 刘维;生物序列模式挖掘与识别算法的研究[D];南京航空航天大学;2010年
6 杨钤雯;序列模式挖掘方法及Web使用挖掘研究[D];天津大学;2010年
7 霍卫峰;无机微孔晶体数据库的数据挖掘与结构检索[D];吉林大学;2011年
8 佘春东;数据挖掘算法分析及其并行模式研究[D];电子科技大学;2004年
9 束志恒;化学化工数据挖掘技术的研究[D];浙江大学;2005年
10 宋世杰;基于序列模式挖掘的误用入侵检测系统及其关键技术研究[D];国防科学技术大学;2005年
中国硕士学位论文全文数据库 前10条
1 任芳;时间序列数据挖掘研究[D];辽宁师范大学;2010年
2 陈晶;基于序列模式挖掘算法的入侵检测研究[D];华东师范大学;2011年
3 白霜;DNA序列的最大频繁模式挖掘[D];南昌大学;2010年
4 徐海兰;Web日志挖掘技术在个性化信息推荐中的应用[D];延边大学;2009年
5 严兆斌;序列模式挖掘在公路隧道交通中的应用研究[D];西安电子科技大学;2009年
6 李瑞华;数据挖掘在煤矿安全监测中的应用[D];西安电子科技大学;2010年
7 高磊;大规模铝电解日报数据中序列模式挖掘及其规则提取的研究[D];北方工业大学;2011年
8 董严冰;旅游信息数据挖掘和流量模型的研究[D];北方工业大学;2011年
9 翁玉霞;局域网环境下智能考试系统的设计与实现[D];河北科技大学;2010年
10 赵炎;频繁子树优化查询策略[D];吉林大学;2011年
【同被引文献】
中国期刊全文数据库 前10条
1 姜明辉,王欢,王雅林;分类树在个人信用评估中的应用[J];商业研究;2003年21期
2 范亚芹,刘颖,李兴男;Web数据挖掘原理及实现[J];吉林大学学报(信息科学版);2003年04期
3 吴相智,刘卫国,费洪晓;一种基于栈结构的HTML到XML的转换方法[J];长沙交通学院学报;2004年02期
4 张敏;生物序列比对算法研究现状与展望[J];大连大学学报;2004年04期
5 张玉芳;熊忠阳;彭燕;刘君;;基于兴趣度含正负项目的关联规则挖掘方法[J];电子科技大学学报;2010年03期
6 行小帅,焦李成;数据挖掘的聚类方法[J];电路与系统学报;2003年01期
7 武瑞娟;马礼;叶树华;;关联规则挖掘研究综述[J];电脑开发与应用;2008年03期
8 史玉珍;赵伟艇;;数据挖掘下新农村决策支持系统的构建[J];电脑开发与应用;2009年12期
9 姜霞,张晓伟;基于XML的Web挖掘技术研究[J];电脑知识与技术;2005年20期
10 胡锦美;基于树与链表的关联规则增量更新的实现[J];闽江学院学报;2005年05期
中国重要会议论文全文数据库 前1条
1 孟军;姜军晓;刘秋水;;基于滑动窗口的流数据频繁模式挖掘算法[A];第三届全国信息检索与内容安全学术会议论文集[C];2007年
中国博士学位论文全文数据库 前10条
1 高飞;关联规则挖掘算法研究[D];西安电子科技大学;2001年
2 周皓峰;关联规则挖掘的拓展性研究[D];复旦大学;2003年
3 张小刚;关联规则挖掘及其在复杂工业过程控制中的应用研究[D];湖南大学;2002年
4 毛国君;数据挖掘技术与关联规则挖掘算法研究[D];北京工业大学;2003年
5 王越;分布式关联规则挖掘的方法研究[D];重庆大学;2003年
6 李学明;计算机数据的关联规则挖掘理论和算法研究[D];重庆大学;2003年
7 刘君强;海量数据挖掘技术研究[D];浙江大学;2003年
8 温磊;基于有向项集图的关联规则挖掘算法研究与应用[D];天津大学;2004年
9 郭秀娟;基于关联规则数据挖掘算法的研究[D];吉林大学;2004年
10 阮幼林;频繁模式挖掘算法及在入侵检测中的应用研究[D];华中科技大学;2004年
中国硕士学位论文全文数据库 前10条
1 肖红;基于web的中文文本挖掘研究[D];大庆石油学院;2004年
2 袁新程;基于数据挖掘技术的电信IP决策支持系统的设计与实现[D];南京理工大学;2004年
3 易高翔;Web文本挖掘研究与实现[D];武汉科技大学;2004年
4 陈明建;基于WEB的数据挖掘技术——WEB内容挖掘的设计与实现[D];电子科技大学;2003年
5 黄晶晶;基于分类频繁模式树的关联分类算法的研究与应用[D];河海大学;2005年
6 窦祥国;关联规则评价方法研究[D];合肥工业大学;2005年
7 孙莹;序列模式发现中关键问题的研究与实现[D];合肥工业大学;2005年
8 管恩政;序列模式挖掘算法研究[D];吉林大学;2005年
9 连洁;关联规则算法性能分析及改进[D];吉林大学;2005年
10 崔彩霞;基于支持向量机的文本分类方法研究[D];山西大学;2005年
【二级引证文献】
中国期刊全文数据库 前6条
1 李永庆;史廷春;;FDM成型机原型精度控制[J];机床与液压;2010年23期
2 张弘;;大滞后系统控制中专家-模糊PID方法的应用[J];计算机工程与应用;2009年28期
3 徐侃;李郝林;;模糊推理技术在螺纹磨削工艺决策中的应用[J];制造业自动化;2012年18期
4 李娟;杨珺;;基于分区的频繁子树挖掘算法研究[J];计算机工程与设计;2011年06期
5 刘铁英;;烟草商业企业精准营销流程研究[J];企业导报;2013年04期
6 张新建;;专家模糊控制在煤气加压混合系统中的应用[J];自动化与仪表;2012年02期
中国博士学位论文全文数据库 前3条
1 王正顺;纸张电磁干燥技术研究[D];华南理工大学;2010年
2 郑祥明;微型飞行器非线性飞行动力学与智能控制研究[D];南京航空航天大学;2008年
3 曹方;电渣重熔过程智能控制方法的研究[D];大连理工大学;2010年
中国硕士学位论文全文数据库 前10条
1 邹丁山;新型变频空调电气系统的研究与实现[D];长春工业大学;2010年
2 张杞;电信企业精确营销系统分析与研究[D];北京邮电大学;2011年
3 吴倩;基于关联规则的零售业CRM的设计和实现[D];华东师范大学;2011年
4 盛魁;基于SVM的中文网页自动分类技术研究[D];安徽大学;2011年
5 王燕;基于XML的Web文本挖掘及关联算法的研究[D];江苏科技大学;2011年
6 范玉玲;基于可变滑动窗口的数据流闭合频繁模式挖掘研究[D];江苏科技大学;2011年
7 杨阳;基于数据挖掘的泌尿外科临床决策支持系统研究[D];重庆大学;2011年
8 王强;我国手机银行基于数据库的精准营销战略研究[D];哈尔滨工程大学;2011年
9 梁东武;仿人智能控制器的参数在线模糊自整定在小车二级倒立摆中的应用[D];重庆大学;2008年
10 曾雷;试验水池拖车计算机控制系统[D];哈尔滨工程大学;2008年
【相似文献】
中国期刊全文数据库 前10条
1 程转流;王本年;;数据流中的频繁模式挖掘[J];计算机技术与发展;2007年12期
2 庄波;刘希玉;;数据流中频繁模式挖掘算法研究及进展[J];福建电脑;2008年03期
3 王敏;赵晓雷;;数据流频繁模式挖掘[J];渭南师范学院学报;2010年02期
4 刘丽娜;李德雄;;一种基于频繁模式的关联规则改进算法[J];河北省科学院学报;2006年03期
5 张倩;王治和;景永霞;;基于SQL的频繁模式挖掘算法[J];中原工学院学报;2005年06期
6 胡燕;韩瑞雪;;基于Top-K项频繁模式挖掘的研究及实现[J];计算机与数字工程;2009年04期
7 夏阳;;有关关联规则的挖掘算法研究[J];经营管理者;2009年11期
8 胡彧;王顺平;;事务型滑动窗口下的数据流频繁模式挖掘[J];计算机工程与应用;2010年22期
9 徐小云;岳志强;;数据挖掘中算法概述[J];科技信息(科学教研);2008年21期
10 李畅畅;曾黄麟;孙勇;王振明;;一种基于映射方法的改进频繁模式增长算法[J];四川理工学院学报(自然科学版);2009年03期
中国重要会议论文全文数据库 前10条
1 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
2 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
3 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
4 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
5 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
6 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
7 朱扬勇;黄超;;基于多维模型的交互式数据挖掘框架[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
8 陈涛;胡学钢;陈秀美;;基于数据挖掘的教学质量评价体系分析[A];全国第21届计算机技术与应用学术会议(CACIS·2010)暨全国第2届安全关键技术与应用学术会议论文集[C];2010年
9 王星;谢邦昌;戴稳胜;;数据挖掘在保险业中的应用[A];北京市第十二次统计科学讨论会论文选编[C];2003年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
中国博士学位论文全文数据库 前10条
1 马海兵;频繁模式挖掘相关技术研究[D];复旦大学;2005年
2 刘勇;频繁模式挖掘相关技术研究[D];复旦大学;2007年
3 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
4 封毅;中医药知识发现可靠性研究[D];浙江大学;2008年
5 董晓莉;时间序列数据挖掘相似性度量和周期模式挖掘研究[D];天津大学;2007年
6 董俊;不确定数据中数据挖掘方法的研究[D];燕山大学;2012年
7 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
8 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
9 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
10 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
中国硕士学位论文全文数据库 前10条
1 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
2 李坤然;数据挖掘在股市趋势预测的应用研究[D];中南林业科技大学;2008年
3 郑宏;数据挖掘可视化技术的研究与实现[D];西安电子科技大学;2010年
4 杜金刚;数据挖掘在电信客户关系管理及数据业务营销中的应用[D];北京邮电大学;2010年
5 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
6 梁小鸥;数据挖掘在高职教学管理中的应用[D];华南理工大学;2011年
7 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
8 黎卫英;数据挖掘在中职幼教课程改革中的应用[D];福建师范大学;2009年
9 张煜辉;数据挖掘和SPC在生产过程质量控制中应用研究[D];上海交通大学;2009年
10 刘华敏;数据挖掘在高职院校学生成绩分析中的应用[D];安徽大学;2011年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62791813
  • 010-62985026