摘要:针对传统数据流频繁项集计算中效率低、内存消耗大等问题,本文采用并行计算的思想设计了一种基于MapReduce的数据流频繁项集挖掘算法,首先,对进行数据分块压缩和传输,其次,将数据频繁项的计算分布在负载均衡的数据节点,可以有效保证数据的执行效率.最后通过一次调度处理合并各个节点产生的频繁项集并进行合并.理论分析和实验对比结果均表明,该算法对于并行处理数据流频繁项集的统计问题是有效可行的.
分类:期刊> 自然科学与工程技术> 基础科学> 基础科学综合
收录:北大期刊(中国人文社会科学期刊) > CSCD 中国科学引文数据库来源期刊(含扩展版) > 统计源期刊(中国科技论文优秀期刊) > 知网收录(中) > 维普收录(中) > 万方收录(中) > CA 化学文摘(美) > JST 日本科学技术振兴机构数据库(日) > Pж(AJ) 文摘杂志(俄) > 国家图书馆馆藏 > 上海图书馆馆藏
关键词:mapreduce 频繁项集 数据流 并行计算 数据挖掘
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社