本实验以台湾证券交易所上市公司 1999–2009 年财务指标为分析对象,构建企业破产风险预警模型。 针对财务数据中破产样本占比极低(约 3.2%)的类别不平衡问题,采用 SMOTE 过采样与 class_weight 加权双轨方案,对逻辑回归、决策树、KNN、SVM、随机森林等 10 个模型方案进行 超参搜索与系统对比。由于 96.8% 样本为多数类,accuracy 会被虚高,因此以 Recall / F1 / PR-AUC 作为第一决策指标,并配套 Permutation Importance 与 SHAP 双重模型解释,从财务与企业战略角度给出可落地结论。
| 模型 | 特征选择 | 不平衡方案 | Accuracy | Precision | Recall | F1 | ROC-AUC | PR-AUC |
|---|---|---|---|---|---|---|---|---|
| Random Forest Classifier | No | SMOTE | 95.97% | 0.413 | 0.591 | 0.486 | 0.943 | 0.483 |
| Random Forest (FS) | Yes | SMOTE | 95.97% | 0.413 | 0.591 | 0.486 | 0.939 | 0.465 |
| Random Forest (class_weight) | No | class_weight | 94.87% | 0.345 | 0.659 | 0.453 | 0.941 | 0.477 |
| Support Vector Classifier | No | SMOTE | 94.57% | 0.279 | 0.432 | 0.339 | 0.851 | 0.276 |
| SVC (class_weight) | No | class_weight | 94.28% | 0.270 | 0.455 | 0.339 | 0.888 | 0.294 |
| Logistic Regression | No | SMOTE | 88.93% | 0.194 | 0.773 | 0.311 | 0.904 | 0.320 |
| K Nearest Neighbour (FS) | Yes | SMOTE | 89.81% | 0.197 | 0.705 | 0.308 | 0.869 | 0.246 |
| DecisionTree Classifier | No | SMOTE | 91.20% | 0.203 | 0.591 | 0.302 | 0.841 | 0.212 |
| K Nearest Neighbour | No | SMOTE | 91.42% | 0.203 | 0.568 | 0.299 | 0.832 | 0.190 |
| Logistic Regression (class_weight) | No | class_weight | 88.27% | 0.181 | 0.750 | 0.292 | 0.871 | 0.299 |