摘要:传统的主曲线算法在小规模数据集上能获得良好的效果,但单节点的计算和存储能力都不能满足海量数据主曲线的提取要求,而算法分布式并行化是目前解决该类问题最有效的途径之一。本文提出基于MapReduce框架的分布式软K段主曲线算法(Distributed soft k-segments principal curve,Dis-SKPC)。首先,基于分布式K—Means算法,采用递归粒化方法对数据集进行粒化,以确定粒的大小并保证粒中数据的关联性。然后调用软K段主曲线算法计算每个粒数据的局部主成分线段,并提出用噪声方差来消除在高密集、高曲率的数据区域可能产生的过拟合线段。最后借助哈密顿路径和贪婪算法连接这些局部主成分线段,形成一条通过数据云中间的最佳曲线。实验结果表明,本文所提出的DisSKPC算法具有良好的可行性和扩展性。
分类:期刊> 自然科学与工程技术> 信息科技> 电信技术
收录:北大期刊(中国人文社会科学期刊) > CSCD 中国科学引文数据库来源期刊(含扩展版) > 统计源期刊(中国科技论文优秀期刊) > 知网收录(中) > 维普收录(中) > 万方收录(中) > SA 科学文摘(英) > JST 日本科学技术振兴机构数据库(日) > Pж(AJ) 文摘杂志(俄) > 剑桥科学文摘 > 国家图书馆馆藏 > 上海图书馆馆藏 > 文摘与引文数据库
关键词:分布式并行化 主曲线 数据粒化 mapreduce
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社