{"id":"W4409157871","doi":"10.1016/j.jeph.2025.202990","title":"Validation of a generative artificial intelligence tool for the critical appraisal of articles on the epidemiology of mental health: Its application in the Middle East and North Africa","year":2025,"lang":"en","type":"article","venue":"Journal of Epidemiology and Population Health","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Middle East; Critical appraisal; Mental health; Generative grammar; Epidemiology; Psychology; North east; Geography; Artificial intelligence; Medicine; Computer science; Psychiatry; History; Alternative medicine; Ethnology; Pathology; Archaeology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01008984,0.00007933919,0.0005119761,0.0001123336,0.0002144522,0.000001690834,0.00007862606,0.00008211644,0.000003623175],"category_scores_gemma":[0.01586337,0.00004209021,0.00006745875,0.0002335264,0.0002926877,0.00004904102,0.0000105274,0.0002390257,1.577569e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004489455,"about_ca_system_score_gemma":0.0002609039,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004886244,"about_ca_topic_score_gemma":0.0002077665,"domain_scores_codex":[0.995949,0.001690871,0.001951556,0.0001298171,0.0000905821,0.0001882023],"domain_scores_gemma":[0.976259,0.02209846,0.001170733,0.0001493014,0.0002692268,0.00005329104],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001206013,0.0003132092,0.4452698,0.0005264745,0.00004526662,7.753646e-8,0.0192659,0.001527521,0.00008402647,0.4317136,0.0004422976,0.09960574],"study_design_scores_gemma":[0.0001892422,0.003897019,0.7176074,0.0008061268,0.00009863607,0.00004360887,0.02471649,0.05737561,0.001171586,0.193544,0.0004400446,0.0001102215],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7886213,0.003522579,0.04013934,0.1668186,0.0002048804,0.0006764512,0.00001265519,0.000001310696,0.000002823926],"genre_scores_gemma":[0.9947467,0.0008729889,0.001565977,0.002635847,0.0001284718,0.00002995121,0.00001568034,0.000002928616,0.000001389758],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2723376,"threshold_uncertainty_score":0.9924265,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5333452892192624,"score_gpt":0.5201651295202311,"score_spread":0.0131801596990313,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}