{"id":"W4416891240","doi":"10.1007/s12178-025-10001-y","title":"Evaluating the Efficacy and Efficiency of GPT-5 for Automated Title and Abstract Screening in Orthopedic Surgery Systematic Reviews","year":2025,"lang":"en","type":"article","venue":"Current Reviews in Musculoskeletal Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":false,"ca_institutions":"Hamilton Health Sciences; McMaster University","funders":"","keywords":"Orthopedic surgery; Inclusion and exclusion criteria; Predictive value; Sports medicine; Inclusion (mineral); Systematic review","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.00540686,0.0001165287,0.0007724892,0.0002072119,0.00003995341,0.000003546494,0.00005134759,0.00004366994,0.00003468396],"category_scores_gemma":[0.01096804,0.00006481413,0.0000665673,0.0004599218,0.0001104865,0.00002806559,0.00001785146,0.0001714828,0.000006867607],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00002516398,"about_ca_system_score_gemma":0.00007886378,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00004473965,"about_ca_topic_score_gemma":0.00001269564,"domain_scores_codex":[0.9981164,0.0002179946,0.001199692,0.0001867139,0.0001312606,0.0001478814],"domain_scores_gemma":[0.9977243,0.001685509,0.0002714812,0.000205562,0.0000691646,0.00004398177],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"systematic_review","study_design_scores_codex":[0.00001736187,0.00006981404,0.006918429,0.09985236,0.000006733023,4.106736e-7,0.0004330584,0.000001586774,0.00007454785,0.0001102651,0.00169283,0.8908226],"study_design_scores_gemma":[0.001223654,0.001031744,0.1009048,0.8052219,0.001116903,0.00002779105,0.001460531,0.03413406,0.00006796984,0.0005532742,0.05372029,0.0005371277],"study_design_candidate":"systematic_review","study_design_consensus":null,"genre_codex":"review","genre_gemma":"empirical","genre_scores_codex":[0.3938549,0.5962842,0.0005273034,0.001477356,0.001006829,0.006362802,0.000001033098,0.00002745271,0.000458177],"genre_scores_gemma":[0.8816833,0.1163418,0.0005548081,0.0002324276,0.0003153265,0.0006869214,0.00003289456,0.00001721285,0.0001352609],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8902855,"threshold_uncertainty_score":0.997363,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3686849703064726,"score_gpt":0.5599606477077739,"score_spread":0.1912756774013013,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}