{"id":"W4408612469","doi":"10.2196/73264","title":"Peer Review of “Large Language Models for Pediatric Differential Diagnoses in Rural Health Care: Multicenter Retrospective Cohort Study Comparing GPT-3 With Pediatrician Performance”","year":2025,"lang":"en","type":"article","venue":"JMIRx Med","topic":"Child and Adolescent Health","field":"Health Professions","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Medicine; Retrospective cohort study; Cohort; Pediatrics; Cohort study; Family medicine; Internal medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001304865,0.0002597272,0.001056681,0.0002891886,0.0004073476,0.000007456327,0.0002219163,0.00009392942,0.0000369392],"category_scores_gemma":[0.0002696552,0.0001998647,0.00009629253,0.0005613664,0.00002077753,0.0001308586,0.0001315741,0.0006982664,0.000004670311],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0006021608,"about_ca_system_score_gemma":0.0006259326,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007334303,"about_ca_topic_score_gemma":0.002603377,"domain_scores_codex":[0.9967372,0.0004271157,0.001027091,0.0003964132,0.0006538486,0.0007583081],"domain_scores_gemma":[0.9981298,0.0002453775,0.0004815628,0.0003868764,0.0006161765,0.0001402216],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002423531,0.0007354632,0.9574609,0.01583705,0.00002741837,0.000001370573,0.01394436,0.000004888982,4.582863e-7,0.00007471271,0.01138297,0.0002879934],"study_design_scores_gemma":[0.00601883,0.0003020458,0.97342,0.004702004,0.0001288063,1.141242e-7,0.01436756,0.0005898763,0.000001739494,0.000004303138,0.0002881779,0.000176576],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9784957,0.006247376,0.0001651897,0.003572857,0.0005941641,0.01022141,0.0001185571,0.0000668084,0.0005179711],"genre_scores_gemma":[0.9924027,0.004133264,0.00006843203,0.00145564,0.0004546698,0.0003805369,0.0001862585,0.00003125121,0.0008872841],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01595901,"threshold_uncertainty_score":0.8150248,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02316779950438205,"score_gpt":0.4009411151111602,"score_spread":0.3777733156067782,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}