{"id":"W4407729374","doi":"10.2139/ssrn.5138371","title":"Enhancing Diabetes Risk Prediction: A Comparative Evaluation of Bagging, Boosting, and Ensemble Classifiers with Smote Oversampling","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Artificial Intelligence in Healthcare","field":"Health Professions","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"Dalhousie University","funders":"","keywords":"Oversampling; Boosting (machine learning); Artificial intelligence; Machine learning; Computer science; Random subspace method; Ensemble learning; Pattern recognition (psychology); Support vector machine; Bandwidth (computing)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.01194541,0.0003672551,0.0007323429,0.000354438,0.001524554,0.0000317052,0.0002698785,0.0005315786,0.0000537518],"category_scores_gemma":[0.001142114,0.0003260575,0.0001150977,0.0002490531,0.0001549226,0.0001583097,0.0002691757,0.01075209,0.000006098284],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003801436,"about_ca_system_score_gemma":0.02087953,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002168066,"about_ca_topic_score_gemma":0.02594532,"domain_scores_codex":[0.9928082,0.002108001,0.001379649,0.0005676065,0.0008949933,0.002241528],"domain_scores_gemma":[0.9941818,0.001253744,0.002214344,0.0003769659,0.001816418,0.0001567598],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0006160865,0.0001237888,0.8669797,0.002117903,0.002135728,0.000001652046,0.05176447,0.03004809,0.0005263658,0.01093034,0.0002856481,0.0344702],"study_design_scores_gemma":[0.002071397,0.001706511,0.01562071,0.02050588,0.002982682,0.00002603212,0.2300093,0.2421518,0.003994274,0.4793722,0.0004476378,0.001111596],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9571759,0.007840428,0.03015143,0.0003585833,0.001101127,0.001688285,0.00007630722,0.00006773192,0.001540239],"genre_scores_gemma":[0.9943566,0.003822097,0.0006778082,0.00006447354,0.0005585604,0.00012281,0.00002714607,0.00002928455,0.000341171],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.851359,"threshold_uncertainty_score":0.9999192,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1242596101640117,"score_gpt":0.4480131405016227,"score_spread":0.3237535303376109,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}