摘要:密度峰值聚类算法(density peaks clustering algorithm,DPC)是2014年提出的一种新型聚类分析算法,它基于聚类中心局部密度大以及与密度更大点之间的距离较远两大特点绘制决策图寻找聚类中心,从而得到任意形状的簇.但在寻找聚类中心的过程中,求解局部密度以及高密度距离属性都依赖于相似度矩阵的计算,计算复杂度较高,限制了密度峰值聚类算法在大规模数据集中的应用.针对此不足,提出基于网格筛选的密度峰值聚类算法(density peaks clustering algorithm based on grid screening,SDPC),根据数据的不均匀分布,使用网格化方法去除部分密度稀疏的点,然后再使用密度峰值聚类算法中决策图的方法选取聚类中心,可以在保证聚类准确性的基础上有效降低计算复杂度.理论分析和实验测试表明:基于网格筛选的密度峰值聚类算法不仅可以对大规模数据集进行正确的聚类,还极大地降低了计算复杂度.
分类:期刊> 自然科学与工程技术> 信息科技> 电子信息科学综合
收录:北大期刊(中国人文社会科学期刊) > CSCD 中国科学引文数据库来源期刊(含扩展版) > 统计源期刊(中国科技论文优秀期刊) > 知网收录(中) > 维普收录(中) > 万方收录(中) > EI 工程索引(美) > JST 日本科学技术振兴机构数据库(日) > Pж(AJ) 文摘杂志(俄) > 剑桥科学文摘 > 国家图书馆馆藏 > 上海图书馆馆藏 > 文摘与引文数据库
关键词:密度峰值聚类算法 网格筛选 决策图 计算复杂度 大规模数据集
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社