{"id":"W2897650261","doi":"10.1016/j.eswa.2024.124863","title":"An empirical evaluation of imbalanced data strategies from a practitioner’s point of view","year":2024,"lang":"en","type":"article","venue":"Expert Systems with Applications","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":12,"is_retracted":false,"has_abstract":false,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Support vector machine; Artificial intelligence; Gradient boosting; Classifier (UML); Boosting (machine learning); Binary classification; Computer science; Correlation; Random forest; Binary number; Pattern recognition (psychology); Cut-point; Correlation coefficient; Machine learning; Mathematics; Data mining; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.05458787,0.001013075,0.00100802,0.00275859,0.0009152347,0.002529927,0.002132154,0.0019789,0.002935686],"category_scores_gemma":[0.2338512,0.0003281075,0.0006154106,0.002920041,0.001915968,0.005159518,0.002561277,0.001752406,0.0007788334],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001731971,"about_ca_system_score_gemma":0.001750565,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00172098,"about_ca_topic_score_gemma":0.002066323,"domain_scores_codex":[0.9476272,0.0397942,0.001922533,0.003038991,0.007100655,0.0005164115],"domain_scores_gemma":[0.6503446,0.3052039,0.008356834,0.01728362,0.01656907,0.002241951],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.009529185,0.007796432,0.09565849,0.0037718,0.001346939,0.0003250749,0.00346291,0.1147601,0.00479572,0.03926602,0.01707951,0.7022078],"study_design_scores_gemma":[0.002474403,0.0156953,0.0499327,0.001453882,0.001395389,0.001192958,0.007847077,0.8092385,0.01230703,0.06777181,0.03047463,0.0002162456],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7728119,0.007121534,0.2024848,0.002996147,0.0003102508,0.00121137,0.00106335,0.0004930865,0.01150753],"genre_scores_gemma":[0.9090552,0.0009418353,0.08666629,0.0003847385,0.0001075814,0.0005399671,0.0009500462,0.0000988966,0.001255329],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.05458787,"threshold_uncertainty_score":0.2886917,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09491998972119446,"score_gpt":0.4088449582014986,"score_spread":0.3139249684803041,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}