400-808-1701
首页 期刊 控制与决策 基于不平衡数据样本特性的新型过采样SVM分类算法(非官网)

基于不平衡数据样本特性的新型过采样SVM分类算法

摘要:针对传统采样方式准确率与鲁棒性不够明显,欠采样容易丢失重要的样本信息,而过采样容易引入冗杂信息等问题,以UCI公共数据集中的不平衡数据集Pima-Indians为例,综合考虑数据集正负类样本的类间距离、类内距离与不平衡度之间的关系,提出一种基于样本特性的新型过采样方式.首先对原始数据集进行距离带的划分,然后提出一种改进的基于样本特性的自适应变邻域Smote算法,在每个距离带的少数类样本中进行新样本的合成,并将此方式推广到UCI数据集中其他5种不平衡数据集.最后利用SVM分类器进行实验验证的结果表明:在6类不平衡数据集中,应用新型过采样SVM算法,相比已有的采样方式,少(多)数类样本的分类准确率均有明显提高,且算法具有更强的鲁棒性.

分类:期刊> 自然科学与工程技术> 信息科技> 自动化技术

收录:北大期刊(中国人文社会科学期刊) > CSCD 中国科学引文数据库来源期刊(含扩展版) > 统计源期刊(中国科技论文优秀期刊) > 知网收录(中) > 维普收录(中) > 万方收录(中) > EI 工程索引(美) > JST 日本科学技术振兴机构数据库(日) > Pж(AJ) 文摘杂志(俄) > 国家图书馆馆藏 > 上海图书馆馆藏

关键词:数据集不平衡 样本距离 数据集重构 支持向量机 

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社