{"id":"W4408354914","doi":"10.2196/64682","title":"GPT-3.5 Turbo and GPT-4 Turbo in Title and Abstract Screening for Systematic Reviews","year":2025,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Turbo; Turbo code; Computer science; Systematic review; Turbo equalizer; Sensitivity (control systems); Selection (genetic algorithm); Systematic error; MEDLINE; Chemistry; Algorithm; Artificial intelligence; Engineering; Statistics; Mathematics; Decoding methods; Biochemistry; Electronic engineering; Concatenated error correction code","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07081199,0.002264,0.004410564,0.009343877,0.0009527879,0.004740849,0.001895179,0.001617844,0.02562438],"category_scores_gemma":[0.3487509,0.001662043,0.01098506,0.009238361,0.0007778143,0.004738863,0.003745527,0.002281246,0.006755223],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001485971,"about_ca_system_score_gemma":0.009329952,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002631031,"about_ca_topic_score_gemma":0.008726047,"domain_scores_codex":[0.9313387,0.0498623,0.01234252,0.002683479,0.003142046,0.0006308156],"domain_scores_gemma":[0.5547163,0.3888572,0.0251876,0.01151212,0.01747097,0.002255809],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.01850507,0.0004473759,0.05062925,0.09418547,0.0243195,0.0007928166,0.001874464,0.009569229,0.006251524,0.004310817,0.06585798,0.7232564],"study_design_scores_gemma":[0.02382211,0.01166929,0.1807497,0.05418173,0.1296761,0.009965532,0.002917026,0.273253,0.03869248,0.05517964,0.2169153,0.002978097],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2699769,0.07391419,0.4789294,0.02189196,0.004036864,0.02877084,0.0550117,0.04546655,0.02200166],"genre_scores_gemma":[0.3325537,0.008033938,0.6261362,0.003061047,0.0008176434,0.01313223,0.008988994,0.003891017,0.003385246],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.929188,"threshold_uncertainty_score":0.3744941,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.532833534534895,"score_gpt":0.5358457267401503,"score_spread":0.003012192205255282,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}