摘要:针对海量数据分析时需要消耗大量的计算时间和空间资源问题,引入并改进基于可变网格划分的密度偏差抽样技术,创新在于改进网格区间的合并.算法对原始数据集进行抽样,从而得到能较好反应原始数据集分布特征的样本数据集,实现对原始数据集的约简.将KM算法用于简约后的数据,以测试算法的效果.实验结果表明,该算法有效.
分类:期刊> 人文社会科学> 社会科学II> 教育综合
收录:知网收录(中) > 维普收录(中) > 万方收录(中) > 国家图书馆馆藏 > 上海图书馆馆藏
关键词:海量数据 可变网格 密度偏差
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社