摘要:随着数据规模的不断增大,传统的关系型数据库方法已经无法满足大数据量的数据查询需求,而基于Hadoop平台的Hive 数据仓库为海量数据分析提供了方便的操作.随着实时查询需求的增加,基于Spark 的Hive 操作得到了很好的应用.文章主要介绍了Hive on Spark 的整合步骤以及与Hadoop 运行模式的比较.对MovieLens 数据集的实验测试显示,新模式的执行速度提高了17.42-46.35 倍,这对进一步了解Hive 的运行机制及海量数据的实时分析具有重要的意义.
分类:期刊> 自然科学与工程技术> 信息科技> 计算机软件及计算机应用
收录:知网收录(中) > 维普收录(中) > 万方收录(中) > 国家图书馆馆藏 > 上海图书馆馆藏
关键词:hadoop hive spark 海量数据 实时分析
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社