收藏本站
收藏 | 手机打开
二维码
手机客户端打开本文

数据流相似性查询及模式挖掘研究

郭建奎  
【摘要】: 随着数据挖掘研究领域的不断拓宽和研究内容的不断深入,人们发现应用中越来越多的数据是以流的形式产生的,例如网络流,网页点击流,交通流以及传感器网络数据等等。分析和挖掘这类数据日益成为一个热点问题。其中,分析流数据间的相似性和模式发现成为重要的研究内容。研究数据流的相似性查询对于完善数据流查询、改进数据流系统等都有着重要的应用价值,并且对于在数据流上进行分类、聚类等也有着指导意义。当前在数据流环境下相似性查询和模式发现的研究工作没有充分考虑数据流数据自身的特点,往往假定内存空间无限或者不满足增量更新。另一方面,据我们所知,目前还没有相关工作系统地解决相似性查询的问题。 基于此,本文着重研究数据流环境下相似性查询及模式发现问题,主要包括如下三个关键方面: (1)基于Lp距离,提出系统解决数据流环境下相似性查询的技术。 在数据流环境下,基于Lp距离函数,本文系统的提出了一个解决相似性查询的框架,用以解决数据流环境下相似性查询。在充分分析数据流数据的特点后,提出一种新颖的数据结构SDS-Tree(the Same-DirectedSlope Tree)来分层表示数据流对象,实现对原始数据流的表示。基于Lp距离,本文证明SDS-Tree的有效性,并且进一步给出一个相似性判别中更为有效的粒度。基于有效的SDS-Tree结构,文章分别给出有效处理单一固定窗口下的相似性查询算法ASQFSW(Algorithm for SimilarityQueries in Fixed Sliding Window)以及滑动窗口下的增量相似性查询算法IASQSW(Incremental Algorithm for Similarity Queries in SlidingWindows)。特别,IASQSW算法找到了窗口滑动时数据流数据变化的一个上界,根据该上界,算法只需更新有限的SDS-Tree结点,就能够完成窗口滑动时的相似性查询。详细的理论分析以及大量的实验评估表明,我们给出的技术和方法显著优于目前的研究方法。 (2)针对Lp距离无法解决时间弯曲的现象,为提高在数据流环境下相似性查询的准确度,提出了基于DTW距离的相似性查询的技术。 在数据流环境下,使用Lp距离无法解决时间弯曲现象。为提高在一些应用场合中相似性匹配的准确度,基于DTW距离,提出了一个解决相似性查询的算法ESDS(Estimating Similarity on Data Streams)。算法根据数据流数据的变化特性提出了数据分段的思想,每段数据仅用三个数值(最大值,最小值和差异值)来表示原始数据流的特性。为保证数据特征提取的有效性,根据数据变化的规律,提出了振荡数据的概念,并给出了判断数据流中是否存在振荡数据的算法judgeSurge。为保证对振荡数据的处理不会影响到数据流的特性,进一步提出了有效振荡和最大有效振荡幅度的概念,设计了求解有效振荡数据的算法judgeValidSurge和求解最大有效振荡幅度的算法calMaxScope。算法基于特征数据,设计了新的DTW距离函数,基于动态规划算法,设计了在数据流环境下进行相似性判别的算法ESDS。详细的理论分析以及大量的实验评估表明,文章给出的技术和方法具有很高的准确度和效率。 (3)针对Web流数据,设计了两个Web流模式挖掘算法。 数据流间的相似性查询在Web数据流中有重要的应用价值。文章首先分析了Web流数据的特征,然后着重研究了Web流数据的模式发现问题。在充分分析经典算法WAP-mine的缺陷后,首先针对WAP树结构设计了一个自顶向下挖掘的算法TD-WAP-mine。算法避免了在挖掘频繁模式过程中每次需要构造大量中间数据,而直接对原始的WAP树进行挖掘,节省了生成中间数据的代价,在支持度比较小或者原始Web流数据过于大的情况下,TD-WAP-mine表现出更好的性能。其次,针对WAP树存在数据冗余情况,提出了压缩WAP树的概念,在不影响挖掘结构的前提下,设计了压缩WAP树算法,并且直接对WAP树投影,设计了一个自顶向下的挖掘算法TAM-WAP,在大规模实验集上的实验表明,TAM-WAP算法表现出更好的性能和伸缩性。


知网文化
【相似文献】
中国期刊全文数据库 前20条
1 李斌;数据流处理自动化和重新设计[J];管理科学文摘;1997年05期
2 赵以强;张龙波;;数据流管理系统研究现状分析[J];科技信息;2010年28期
3 王金栋;张磊;丁秋林;黄添强;;一种支持分布式数据流处理的双层重叠网络模型[J];应用科学学报;2006年04期
4 安红,孟建;基于数据流处理的雷达对抗仿真框架研究[J];电子对抗技术;2004年06期
5 谢应科,张涛,韩承德;实时SAR成像系统中矩阵转置的设计和实现[J];计算机研究与发展;2003年01期
6 杜威,邹先霞;基于数据流的滑动窗口机制的研究[J];计算机工程与设计;2005年11期
7 李浪;李仁发;;基于数据流异常挖掘的入侵检测系统设计[J];科学技术与工程;2008年13期
8 羌晨晨;;数据流关键技术研究概论[J];装备制造技术;2009年11期
9 孟军;张航黎;张建英;郭禾;;分布式数据流的渐增式聚集维护算法[J];微电子学与计算机;2006年10期
10 陈磊松;;数据流处理系统的负载控制策略研究[J];漳州师范学院学报(自然科学版);2009年03期
11 魏定国;吴时霖;;数据流复杂查询处理的研究[J];计算机科学;2004年02期
12 安红;;基于数据流处理的雷达对抗仿真系统[J];现代雷达;2006年05期
13 蒋建军;王以群;;农村社会保障体系数据流关联规则挖掘[J];计算机工程;2009年17期
14 王金栋;周良;张磊;丁秋林;;基于分枝路径分析的连续查询降载算法[J];应用科学学报;2007年01期
15 胡彧;王顺平;;事务型滑动窗口下的数据流频繁模式挖掘[J];计算机工程与应用;2010年22期
16 闵思鹤,王甲池,江太辉;DS/CDMA扩频通信接收机数据流处理方案[J];通信技术;2003年06期
17 王爽;杨广明;王国仁;;分布式数据流系统通信有效性研究综述[J];微型机与应用;2007年S1期
18 李岩;王惠文;叶明;;数据流分析与技术研究[J];计算机工程与应用;2008年15期
19 张龙波,李战怀,闫剑锋;一种面向数据流处理的直方图增量维护算法[J];计算机工程;2005年14期
20 安红;王春丽;杨莉;;数字仿真技术在电子战装备性能评估中的应用[J];中国电子科学研究院学报;2006年04期
中国重要会议论文全文数据库 前10条
1 张冬冬;李建中;王伟平;郭龙江;;分布式复式数据流的处理[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
2 魏永超;陈立军;;数据流上复杂事件处理系统Eagle的设计与实现[A];第二十五届中国数据库学术会议论文集(一)[C];2008年
3 蔡致远;熊方;钱卫宁;周傲英;;核合并分析及其在数据流密度估计上的应用[A];第二十届全国数据库学术会议论文集(研究报告篇)[C];2003年
4 尹婷;李红燕;;窗口模型下数据流查询流水化执行的研究[A];第二十一届中国数据库学术会议论文集(技术报告篇)[C];2004年
5 宋宝燕;陆岩;张俊宁;;数据流上的一种适应性查询优化及调度策略[A];第二十三届中国数据库学术会议论文集(研究报告篇)[C];2006年
6 吕雁飞;武珊珊;谷峪;许嘉;于戈;;一种数据流上统计性查询QoS的保证方法[A];第二十四届中国数据库学术会议论文集(研究报告篇)[C];2007年
7 周锐;肖川;王国仁;韩东红;霍欢;;数据流滑动窗口连接上的卸载技术的研究[A];第二十三届中国数据库学术会议论文集(技术报告篇)[C];2006年
8 霍欢;王国仁;陈庆奎;彭敦陆;;基于Hole-Filler模型的XML数据流上的SLCA算法[A];第26届中国数据库学术会议论文集(A辑)[C];2009年
9 武珊珊;宋宝燕;袁锋;于亚新;于戈;;数据流模型研究[A];第二十一届中国数据库学术会议论文集(研究报告篇)[C];2004年
10 闫朝升;李建中;李金宝;;数据流上滑动窗口技术的研究与实现[A];第二十一届中国数据库学术会议论文集(技术报告篇)[C];2004年
中国博士学位论文全文数据库 前10条
1 朱小栋;基于扩展预测模型标记语言的数据流挖掘系统建模研究[D];南京航空航天大学;2009年
2 吴枫;数据流挖掘若干关键技术研究[D];国防科学技术大学;2009年
3 郭立超;数据流挖掘若干技术研究及其在电信行业的应用[D];浙江大学;2011年
4 于翔;基于网格的数据流聚类方法研究[D];哈尔滨工程大学;2010年
5 李军;基于用户行为挖掘的数据流管理技术研究[D];北京邮电大学;2012年
6 王修君;高效数据流和海量文本处理算法研究[D];中国科学技术大学;2011年
7 李培培;数据流中概念漂移检测与分类方法研究[D];合肥工业大学;2012年
8 周勇;基于并行计算的数据流处理方法研究[D];大连理工大学;2013年
9 欧阳震诤;不平稳数据流的分类技术研究[D];国防科学技术大学;2009年
10 冯博;基于半结构化数据的数据流挖掘算法研究[D];北京邮电大学;2011年
中国硕士学位论文全文数据库 前10条
1 何登成;数据流上复杂序查询的研究与实现[D];浙江大学;2010年
2 周驰;数据流上概念漂移的检测和分类[D];郑州大学;2010年
3 刘娜;离散型数据流在线关联分析[D];大连理工大学;2012年
4 孔颖;基于粒度的数据流不确定性信息处理[D];重庆交通大学;2013年
5 李有生;一种改进的数据流处理算法的研究与实现[D];吉林大学;2010年
6 何江燕;基于数据流的聚类分析算法研究[D];兰州交通大学;2010年
7 李燕;面向含噪数据流的概念漂移集成分类研究[D];合肥工业大学;2011年
8 罗秀;数据流在线分类算法的研究与实现[D];东北大学;2009年
9 由欣;基于有向图构造的数据流预测算法的研究[D];哈尔滨工程大学;2011年
10 张育培;非平稳数据流的概念漂移检测及其分类[D];郑州大学;2013年
中国重要报纸全文数据库 前9条
1 计算机世界实验室 吴挺;Intel的专业“核动力”[N];计算机世界;2007年
2 北京 冬梅;P4时代真的来了吗[N];中国电脑教育报;2001年
3 甘久斌;如何有效管理宽带用户[N];通信产业报;2002年
4 ;立体防护“中枢神经系统”[N];网络世界;2003年
5 ;NetScreen-IDP 500 高端入侵检测与防护设备[N];计算机世界;2003年
6 李勇;降低投资70%[N];中国计算机报;2003年
7 ;在移动互联网里推广IPv6[N];人民邮电;2002年
8 ;港湾网络多业务万兆城域网解决方案[N];人民邮电;2003年
9 记者 郭姜宁;企业级电子商务资金流网络管理系统问世[N];科技日报;2001年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62982499
  • 010-62783978