国内刊号:11-2127/TP
国际刊号:1002-8331
发布日期:
作者:孟东霞, 姚怡帆, 杨旌
单位:河北金融学院 金融科技学院,河北 保定 071051;
关键词:不平衡数据,自然最近邻,微簇,欠采样,集成学习
基金:河北省金融科技应用重点实验室开放课题(2024005);河北省教育厅青年基金(QN2024200)。
集成欠采样是解决类别不平衡问题的有效途径,部分方法因损失多数类关键信息或破坏内部分布结构而影响性能。为充分保留多数类分布结构并提升少数类识别精度,提出在Boosting框架下从多数类微簇中动态采样的不平衡数据集成分类算法。利用自然最近邻构建多数类微簇,依据样本分布自适应确定各微簇采样数量,进而结合采样权重选取多数类样本,与少数类共同训练初始基分类器。在后续迭代中,根据上一轮分类结果动态更新微簇采样配置,重新选择样本训练新的基分类器,最终通过加权集成获得强分类器。在22个数据集上与4种经典欠采样方法(随机欠采样、Cluster Centroid等)及8种主流集成欠采样方法(Self-paced Ensemble、CusBoost、Equalization Ensemble等)进行了对比实验,所提方法在F1-score、G-mean和AUC指标上均展现出更优性能。
来源:2026年第6期
《计算机工程与应用》期刊编辑部