PDF下载
基于安全样本筛选的不平衡数据抽样方法

石洪波 刘焱昕 冀素琴 ​

山西财经大学信息学院

摘要: 针对欠抽样可能导致有用信息的丢失,以及合成小类的过抽样技术(SMOTE)可能使大类和小类间类重叠更严重的问题,文中提出基于安全样本筛选的欠抽样和SMOTE结合的抽样方法(ScreeningSMOTE).利用安全筛选规则,识别并丢弃大类中部分对确定决策边界无价值的实例和噪音实例,采用SMOTE对筛选后数据集进行过抽样.基于安全样本筛选的欠抽样既避免原始数据中有价值信息的丢失,又丢弃大类中的噪音实例,缓减过抽样数据集类重叠的问题.实验表明在处理不平衡数据集,特别是维数较高的不平衡数据集时ScreeningSMOTE的有效性.
关键词: 不平衡数据;安全样本筛选;欠抽样;不平衡比率;合成小类的过抽样技术(SMOTE)
DOI:
基金资助:
文章地址: