{"id":"W4409283522","doi":"10.1136/bmjebm-2024-113066","title":"Novel AI applications in systematic review: GPT-4 assisted data extraction, analysis, review of bias","year":2025,"lang":"en","type":"article","venue":"BMJ evidence-based medicine","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hospital for Sick Children; University of Toronto","funders":"","keywords":"Data extraction; Concordance; Comparability; Computer science; Meta-analysis; Systematic review; Statistics; Data mining; Artificial intelligence; Medicine; MEDLINE; Mathematics; Internal medicine; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"systematic_review","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2317545,0.004182814,0.005125008,0.01304649,0.001570616,0.008789917,0.004204373,0.003516177,0.02359643],"category_scores_gemma":[0.521881,0.004200181,0.01333589,0.01232066,0.001769624,0.006358456,0.009158188,0.003471965,0.005608978],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005343271,"about_ca_system_score_gemma":0.02131742,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003045128,"about_ca_topic_score_gemma":0.007958881,"domain_scores_codex":[0.8007211,0.151525,0.0292782,0.006929137,0.01074483,0.0008017541],"domain_scores_gemma":[0.4780599,0.4081268,0.03319387,0.04305436,0.03613365,0.001431554],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00627632,0.0002929885,0.009082122,0.1938684,0.02007009,0.0007298156,0.007036889,0.02217491,0.005420822,0.02049636,0.06259684,0.6519545],"study_design_scores_gemma":[0.020151,0.003521446,0.01785213,0.09323405,0.04453305,0.003654989,0.002313534,0.3297673,0.0178008,0.159847,0.3058105,0.001514193],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.009452806,0.01318111,0.8608833,0.006442535,0.001432814,0.04983469,0.01543631,0.03655566,0.006780858],"genre_scores_gemma":[0.01817814,0.001919006,0.9368825,0.0007859995,0.0001290191,0.03902134,0.001882374,0.0006784669,0.0005231753],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.7682455,"threshold_uncertainty_score":0.9473835,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8422006587199937,"score_gpt":0.6309828565757105,"score_spread":0.2112178021442832,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}