{"id":"W4415925415","doi":"10.2196/74899","title":"Assessing the Limitations of Large Language Models in Clinical Practice Guideline–Concordant Treatment Decision-Making on Real-World Data: Retrospective Study","year":2025,"lang":"en","type":"article","venue":"JMIRx Med","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Clinical Practice; Retrospective cohort study; MEDLINE; Risk assessment; Health care","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.002986741,0.0001126667,0.0003556868,0.0002151517,0.0001252906,0.00003455229,0.0001700235,0.00004888221,0.000008514875],"category_scores_gemma":[0.01147569,0.00007435442,0.00005699247,0.0007197611,0.00005137593,0.0002831609,0.00006763609,0.0002919207,0.000007495407],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003833875,"about_ca_system_score_gemma":0.0006387421,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00339465,"about_ca_topic_score_gemma":0.01757933,"domain_scores_codex":[0.9976164,0.000371845,0.001142866,0.0003724978,0.0003072104,0.0001891767],"domain_scores_gemma":[0.9919457,0.00632982,0.0003254582,0.0009304968,0.0004212192,0.00004729031],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.0009149328,0.007050467,0.1665016,0.00001785061,0.0002129371,0.00009314381,0.01911701,0.0003263926,0.00003136873,0.004291189,0.009082442,0.7923607],"study_design_scores_gemma":[0.001084838,0.002468996,0.5255023,0.001300084,0.0006801488,0.000006105053,0.3906966,0.05526952,0.0002615099,0.006282798,0.01619185,0.0002552972],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9665388,0.0001483848,0.003603068,0.01739312,0.0006681218,0.001607316,0.00001430134,0.00003182106,0.009995054],"genre_scores_gemma":[0.9923636,0.000251215,0.005305585,0.001348881,0.000224768,0.0000759726,0.00003493968,0.00001113837,0.0003838779],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7921054,"threshold_uncertainty_score":0.9968511,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4364023688737394,"score_gpt":0.629305263558597,"score_spread":0.1929028946848576,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}