{"id":"W4409283522","doi":"10.1136/bmjebm-2024-113066","title":"Novel AI applications in systematic review: GPT-4 assisted data extraction, analysis, review of bias","year":2025,"lang":"en","type":"article","venue":"BMJ evidence-based medicine","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hospital for Sick Children; University of Toronto","funders":"","keywords":"Data extraction; Concordance; Comparability; Computer science; Meta-analysis; Systematic review; Statistics; Data mining; Artificial intelligence; Medicine; MEDLINE; Mathematics; Internal medicine; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"methods","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"methods","study_design":"systematic_review","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","bibliometrics","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.3074515,0.0004916425,0.01248393,0.002145807,0.0001065225,0.0001138558,0.0050458,0.0001150014,0.00561469],"category_scores_gemma":[0.4581247,0.0002293742,0.001699116,0.02181764,0.000197932,0.0005578843,0.0002432624,0.0003194094,0.0002729697],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001067553,"about_ca_system_score_gemma":0.0007461686,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001744388,"about_ca_topic_score_gemma":0.0002263988,"domain_scores_codex":[0.944508,0.01564206,0.02928494,0.001947154,0.008272148,0.0003456929],"domain_scores_gemma":[0.8758671,0.06000214,0.02553068,0.03051354,0.007701524,0.0003849792],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"systematic_review","study_design_scores_codex":[0.000007035688,0.0001940068,0.00956817,0.6520575,0.001054386,0.000004426006,0.00002008026,0.00004358158,0.00009587085,0.0008410975,0.3346226,0.001491321],"study_design_scores_gemma":[0.0003347151,0.0000330445,0.008648696,0.9242257,0.02582275,0.00001024638,0.0002036323,0.006474189,0.00001228825,0.0002060724,0.0337791,0.0002495861],"study_design_candidate":"systematic_review","study_design_consensus":"systematic_review","genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.00001732107,0.6089945,0.33971,0.04215346,0.0001426624,0.007843895,0.00004919559,0.0000107256,0.001078166],"genre_scores_gemma":[0.08219907,0.6787473,0.03729688,0.1561381,0.0006842226,0.01164852,0.002573401,0.0001076369,0.03060489],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.3024132,"threshold_uncertainty_score":0.9989741,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.8422006587199937,"score_gpt":0.6309828565757105,"score_spread":0.2112178021442832,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}