TABLE 1.
Optimal classification performance (AUC-ROC, BA, and MCC values) of each feature selection method for predicting KS using a cross-validation of training set results.
| Feature selection method | Machine learning algorithm | Rebalancing method | Cutoff | AUC-ROC | BA | MCC |
|---|---|---|---|---|---|---|
| AUC-ROC | NB | ROSE | 0.52 | 0.72 ± 0.03 | 0.69 ± 0.02 | 0.27 ± 0.02 |
| AUC-ROC | NNET | Original | 0.52 | 0.70 ± 0.03 | 0.68 ± 0.02 | 0.28 ± 0.03 |
| AUC-ROC | RF | Upsampling | 0.52 | 0.76 ± 0.02 | 0.72 ± 0.02 | 0.32 ± 0.03 |
| AUC-ROC | SVM | Upsampling | 0.52 | 0.74 ± 0.02 | 0.70 ± 0.02 | 0.29 ± 0.03 |
| AUC-ROC | XGBoost | Original | 0.52 | 0.76 ± 0.02 | 0.71 ± 0.02 | 0.31 ± 0.03 |
| Fisher’s exact test | NB | Original | 0.01 | 0.78 ± 0.01 | 0.73 ± 0.01 | 0.33 ± 0.02 |
| Fisher’s exact test | NNET | ROSE | 0.05 | 0.74 ± 0.02 | 0.70 ± 0.02 | 0.28 ± 0.04 |
| Fisher’s exact test | RF | Upsampling | 0.05 | 0.81 ± 0.01 | 0.75 ± 0.01 | 0.35 ± 0.02 |
| Fisher’s exact test | SVM | Upsampling | 0.03 | 0.78 ± 0.01 | 0.73 ± 0.01 | 0.32 ± 0.02 |
| Fisher’s exact test | XGBoost | Upsampling | 0.05 | 0.79 ± 0.01 | 0.73 ± 0.01 | 0.32 ± 0.03 |
| RF | NB | Original | 40 | 0.74 ± 0.02 | 0.69 ± 0.02 | 0.28 ± 0.03 |
| RF | NNET | Upsampling | 50 | 0.69 ± 0.02 | 0.66 ± 0.01 | 0.23 ± 0.03 |
| RF | RF | Original | 50 | 0.77 ± 0.02 | 0.71 ± 0.02 | 0.32 ± 0.04 |
| RF | SVM | Upsampling | 50 | 0.73 ± 0.02 | 0.69 ± 0.02 | 0.28 ± 0.04 |
| RF | XGBoost | Original | 50 | 0.75 ± 0.02 | 0.70 ± 0.02 | 0.30 ± 0.04 |
| XGBoost | NB | Original | 50 | 0.76 ± 0.02 | 0.71 ± 0.02 | 0.30 ± 0.03 |
| XGBoost | NNET | Original | 40 | 0.72 ± 0.02 | 0.69 ± 0.02 | 0.29 ± 0.03 |
| XGBoost | RF | Original | 50 | 0.79 ± 0.02 | 0.74 ± 0.02 | 0.35 ± 0.04 |
| XGBoost | SVM | Upsampling | 50 | 0.76 ± 0.02 | 0.71 ± 0.02 | 0.30 ± 0.02 |
| XGBoost | XGBoost | Upsampling | 50 | 0.77 ± 0.02 | 0.71 ± 0.02 | 0.30 ± 0.02 |