收藏本站
收藏 | 手机打开
二维码
手机客户端打开本文

电信数据挖掘的数据质量评估技术研究

王晓华  
【摘要】: 近年来,数据挖掘作为海量数据中知识提取的有效手段,已广泛应用于电信领域,如话费欺诈分析、客户细分、客户流失预测、交叉销售等。然而,现实中的电信数据往往质量较差,不能满足数据挖掘的要求,导致数据挖掘在电信中应用的成功案例较少,数据质量低下已成为制约数据挖掘在电信行业应用的主要瓶颈之一,因此,在进行数据挖掘之前,有必要进行数据质量评估,以衡量挖掘的可行性,避免时间和精力的浪费。对于数据质量评估,虽然前人已有较多的研究成果,但大部分集中在框架理论,较少涉及特定的行业背景和具体应用,而面向特定挖掘主题的数据质量评估,尚未有专门的文献讨论。本文针对电信数据挖掘的常用主题——欠费挖掘,在深入研究缺失和离群对数据挖掘影响的基础上,对面向数据挖掘的数据质量评估技术展开研究,具体的研究工作如下: 1.对于缺失评估,提出类分布CD(Class Distribution)的概念,以衡量各个输入属性和目标属性之间的关联度,基于此,提出类分布差异的属性加权算法CAWA,算法能够区分不同输入属性对分类结果的重要性,并由此提出基于属性加权的缺失评估算法AMEA,以实现数据的缺失评估。实验结果表明,该评估算法能够合理量化缺失对挖掘结果的影响。 2.对于离群评估,针对电信数据的特点,尤其是欠费数据非平衡的特性,分析了非平衡数据中的离群点对分类结果的影响,并结合超图离群检测(HOT)算法,提出离群度OD(Outlier Degree)的概念,基于此,提出非平衡离群评估算法IOEA,以实现数据的离群评估。实验结果表明,该离群评估算法能够合理量化离群对挖掘结果的影响。 3.在缺失评估和离群评估的基础上,结合电信欠费数据挖掘本身的特点,提出一个较为完整的数据质量评估体系,该体系由缺失评估和离群评估两部分组成,并在实验的基础上,结合电信行业专家经验,给出评估得分向量的参考值。实验结果表明,该参考值能够对挖掘的可行性分析提供有意义的指导。


知网文化
【相似文献】
中国期刊全文数据库 前20条
1 谭耀武;;基于数据挖掘粗糙集技术的电信运营商客户价值评价[J];沿海企业与科技;2006年01期
2 耿庆鹏,卢子芳;利用数据挖掘技术实现对电信行业用户欺诈行为的预测[J];电信快报;2003年10期
3 杨晓波,胡黎伟;时间序列理论在电信行业预测决策系统中的应用[J];计算机工程与应用;2004年28期
4 杨树莲;数据挖掘在电信行业客户流失分析中的应用[J];计算机与现代化;2005年02期
5 张利岩;;数据仓库技术在电信行业中的应用[J];电脑与电信;2008年08期
6 陈凤洁;电信客户细分方法及应用[J];科技和产业;2005年11期
7 王慧嫔;;基于MMDB技术对电信计费系统研究与实现的探讨[J];科技资讯;2009年16期
8 顾良翠;面向CRM的数据挖掘技术在电信行业的应用[J];长春工程学院学报(自然科学版);2004年04期
9 ;数据挖掘的发展与电信行业的应用[J];通信企业管理;2003年08期
10 陈光宇;胡丽英;苏勇;;聚类分析在电信行业客户关系管理中的应用[J];微计算机信息;2006年33期
11 张嫣;安中印;宋中山;;数据挖掘中的聚类算法[J];电脑知识与技术(学术交流);2007年07期
12 陈起;;数据挖掘在电信客户细分中的应用[J];科学技术与工程;2009年16期
13 谷凌雁;朱笑花;;基于数据仓库的分级式电信经营分析系统设计[J];电脑开发与应用;2008年02期
14 颜昌沁;胡建华;周海河;;基于Clementine神经网络的电信客户流失模型应用[J];电脑应用技术;2009年01期
15 蔡鑫;;电信数据挖掘数据准备过程的规范化设计[J];计算机工程;2007年24期
16 张永辉;杨本昭;胡万里;;以决策树分类方法实现电信行业精准营销[J];信息安全与通信保密;2009年11期
17 汪希;谢戈;;数据仓库技术在云南移动经营分析系统中的应用[J];云南大学学报(自然科学版);2009年S1期
18 李卫民;;EP算法在电信客户细分中的应用[J];中国商界(下半月);2010年01期
19 巩建光;;基于数据挖掘方法的电信行业增值业务精确营销研究[J];制造业自动化;2011年02期
20 何明轩;;数据挖掘在电信客户关系管理的应用[J];电脑知识与技术(学术交流);2007年03期
中国重要会议论文全文数据库 前10条
1 郭学军;陈晓云;;粗集方法在数据挖掘中的应用[A];第十六届全国数据库学术会议论文集[C];1999年
2 徐慧;;基于Web的文献数据挖掘[A];第十七届全国数据库学术会议论文集(技术报告篇)[C];2000年
3 孙迎;;医院信息的数据挖掘与方法研究[A];中华医学会第十次全国医学信息学术会议论文汇编[C];2004年
4 薛晓东;李海玲;;数据挖掘的客户关系管理应用[A];科技、工程与经济社会协调发展——河南省第四届青年学术年会论文集(下册)[C];2004年
5 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病“阴阳类证”辨证规范的数据挖掘研究[A];中华医学会第十三次全国神经病学学术会议论文汇编[C];2010年
6 薛鲁华;张楠;;聚类分析在Web数据挖掘中的应用[A];北京市第十三次统计科学讨论会论文选编[C];2006年
7 朱扬勇;黄超;;基于多维模型的交互式数据挖掘框架[A];第二十届全国数据库学术会议论文集(技术报告篇)[C];2003年
8 陈涛;胡学钢;陈秀美;;基于数据挖掘的教学质量评价体系分析[A];全国第21届计算机技术与应用学术会议(CACIS·2010)暨全国第2届安全关键技术与应用学术会议论文集[C];2010年
9 王星;谢邦昌;戴稳胜;;数据挖掘在保险业中的应用[A];北京市第十二次统计科学讨论会论文选编[C];2003年
10 郭建文;黄燕;印鉴;杨小波;梁兆辉;;建立中风病阴阳类证辨证规范的数据挖掘研究[A];2010中国医师协会中西医结合医师大会摘要集[C];2010年
中国博士学位论文全文数据库 前10条
1 孙丽;工艺知识管理及其若干关键技术研究[D];大连交通大学;2005年
2 胡志坤;复杂有色金属熔炼过程操作模式智能优化方法研究[D];中南大学;2005年
3 刘革平;基于数据挖掘的远程学习评价研究[D];西南师范大学;2005年
4 刘寨华;基于临床数据分析的病毒性心肌炎证候演变规律研究[D];黑龙江中医药大学;2006年
5 王川;基因芯片数据管理及数据挖掘[D];中国科学院研究生院(上海生命科学研究院);2004年
6 王涛;挖掘序列模式和结构化模式的精简集[D];华中科技大学;2006年
7 郭斯羽;动态数据中的数据挖掘研究[D];浙江大学;2002年
8 李旭升;贝叶斯网络分类模型研究及其在信用评估中的应用[D];西南交通大学;2007年
9 刘东升;面向连锁零售企业的客户关系管理模型(R-CRM)研究[D];浙江工商大学;2008年
10 余红;网络时政论坛舆论领袖研究[D];华中科技大学;2007年
中国硕士学位论文全文数据库 前10条
1 颜昌沁;基于数据挖掘的电信客户离网预测研究与应用[D];昆明理工大学;2009年
2 廖赛恩;养生方数据挖掘分析系统的研制[D];湖南中医药大学;2010年
3 李坤然;数据挖掘在股市趋势预测的应用研究[D];中南林业科技大学;2008年
4 郑宏;数据挖掘可视化技术的研究与实现[D];西安电子科技大学;2010年
5 杜金刚;数据挖掘在电信客户关系管理及数据业务营销中的应用[D];北京邮电大学;2010年
6 徐路;基于决策树的数据挖掘算法的研究及其在实际中的应用[D];电子科技大学;2009年
7 梁小鸥;数据挖掘在高职教学管理中的应用[D];华南理工大学;2011年
8 王浩;数据挖掘在上海市职业能力考试院招录考试优化管理项目中的运用研究[D];华东理工大学;2012年
9 黎卫英;数据挖掘在中职幼教课程改革中的应用[D];福建师范大学;2009年
10 张煜辉;数据挖掘和SPC在生产过程质量控制中应用研究[D];上海交通大学;2009年
中国重要报纸全文数据库 前10条
1 李开宇 黄建军 田长春;把“数据挖掘”作用发挥出来[N];中国国防报;2009年
2 华莱士;“数据挖掘”让银行赢利更多[N];国际金融报;2003年
3 记者 晏燕;数据挖掘让决策者告别“拍脑袋”[N];科技日报;2006年
4 □中国电信股份有限公司北京研究院 张舒博 □北京邮电大学计算机科学与技术学院 牛琨;走出数据挖掘的误区[N];人民邮电;2006年
5 张立明;数据挖掘之道[N];网络世界;2003年
6 中圣信息技术有限公司 李辉;数据挖掘在CRM中的作用[N];中国计算机报;2001年
7 田红生;数据挖掘在CRM中的应用[N];中国经济时报;2002年
8 王广宇;数据挖掘 加速银行CRM一体化[N];中国计算机报;2004年
9 周蓉蓉;数据挖掘需要点想像力[N];计算机世界;2004年
10 张舒博;数据挖掘 提升品牌的好帮手[N];首都建设报;2009年
 快捷付款方式  订购知网充值卡  订购热线  帮助中心
  • 400-819-9993
  • 010-62982499
  • 010-62783978