{"id":"W4416713244","doi":"10.1016/j.jposna.2025.100294","title":"Not Ready for Prime Time: Limitations of a Retrieval-Augmented Generation Large Language Model in Assessing Risk of Bias in Observational Studies","year":2025,"lang":"en","type":"article","venue":"Journal of the Pediatric Orthopaedic Society of North America","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Observational study; Prime (order theory); Identification (biology); Component (thermodynamics); Risk assessment","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001354976,0.00009277337,0.0004491097,0.0002140856,0.00006832524,0.00000362208,0.0001025227,0.00006617128,0.000002835719],"category_scores_gemma":[0.004914516,0.00007036104,0.0003672036,0.001204874,0.00009048461,0.0001254489,0.00002900542,0.0002620106,2.079505e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001484036,"about_ca_system_score_gemma":0.001259142,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001122173,"about_ca_topic_score_gemma":0.00007521535,"domain_scores_codex":[0.9979409,0.0001352791,0.001279476,0.0001078802,0.0003912117,0.0001452481],"domain_scores_gemma":[0.9957504,0.001439322,0.001596152,0.0001530365,0.001025432,0.00003562373],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001968922,0.0004800375,0.9678384,0.0003316697,0.0001543167,3.753461e-7,0.007246101,0.008214854,0.001157245,0.000006404367,0.00248944,0.01188427],"study_design_scores_gemma":[0.001047708,0.0005252064,0.7952003,0.0004208201,0.001067687,0.000004336298,0.0127729,0.1857991,0.002666726,0.0002467556,0.0001110937,0.0001373457],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9896824,0.00192304,0.005215622,0.002549365,0.0002035468,0.0003637134,0.00005020887,0.000003053058,0.000009062705],"genre_scores_gemma":[0.9824718,0.005179004,0.01165566,0.0003218297,0.0002368636,0.000007183287,0.0000260907,0.000007731849,0.00009378389],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.1775842,"threshold_uncertainty_score":0.5883489,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3457414614050695,"score_gpt":0.4492989157929659,"score_spread":0.1035574543878964,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}