{"id":"W4415905951","doi":"10.1111/dar.70065","title":"Machine Learning Algorithms to Predict Heavy Episodic Drinking in the United States Using Survey Data","year":2025,"lang":"en","type":"article","venue":"Drug and Alcohol Review","topic":"Substance Abuse Treatment and Outcomes","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Structural Genomics Consortium; Public Health Ontario; University of Toronto; Centre for Addiction and Mental Health","funders":"National Institute on Alcohol Abuse and Alcoholism; National Institutes of Health","keywords":"Discriminative model; Survey data collection; Test (biology); Predictive modelling; Model validation; Test data","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001815775,0.0001692594,0.000457669,0.0001611893,0.0001201752,0.00003265002,0.0002097471,0.00002464333,0.00002144809],"category_scores_gemma":[0.0002975514,0.0001018421,0.00003912215,0.001045861,0.00003206298,0.0000796638,0.000114414,0.0002318265,0.000006781283],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003480977,"about_ca_system_score_gemma":0.0000423465,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009107488,"about_ca_topic_score_gemma":0.0005315857,"domain_scores_codex":[0.998618,0.0003515476,0.0003164123,0.0003059859,0.0001824865,0.0002255616],"domain_scores_gemma":[0.9988978,0.0004592213,0.00005733423,0.000485699,0.00004088047,0.00005906688],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00003642374,0.0000618921,0.9448897,0.0005780432,0.00008544151,0.00005259576,0.000776984,0.00002407391,0.000003248467,0.00002332028,0.001488552,0.05197979],"study_design_scores_gemma":[0.007897435,0.000209261,0.5833038,0.0621392,0.00212463,0.0001285891,0.002328678,0.05246668,0.00008384319,0.0001910059,0.2882552,0.0008716004],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6896774,0.3039988,0.0002019421,0.004431036,0.0001052455,0.001248151,0.0000230491,0.00006230539,0.0002520024],"genre_scores_gemma":[0.6220518,0.3609547,0.0007562262,0.01241981,0.0000594815,0.0000353292,0.002859997,0.00002757635,0.0008350682],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3615858,"threshold_uncertainty_score":0.4153,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1059651283166314,"score_gpt":0.3778669965816435,"score_spread":0.2719018682650122,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}