{"id":"W4408772055","doi":"10.2196/73258","title":"Authors’ Response to Peer Reviews of “Large Language Models for Pediatric Differential Diagnoses in Rural Health Care: Multicenter Retrospective Cohort Study Comparing GPT-3 With Pediatrician Performance”","year":2025,"lang":"en","type":"article","venue":"JMIRx Med","topic":"Child and Adolescent Health","field":"Health Professions","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Medicine; Retrospective cohort study; Pediatrics; Cohort; Cohort study; Family medicine; Differential (mechanical device); Peer review; Health care; Internal medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002820974,0.0003017053,0.001191638,0.0005630378,0.0005004317,0.00001212807,0.0002618375,0.0001247119,0.00003070858],"category_scores_gemma":[0.0006101055,0.0002334651,0.0001042552,0.0007868669,0.00001866221,0.0001264044,0.0001745058,0.0007363643,0.00001059355],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008229228,"about_ca_system_score_gemma":0.0006269253,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007020568,"about_ca_topic_score_gemma":0.004115638,"domain_scores_codex":[0.9956232,0.001250239,0.001243083,0.0004945304,0.000499116,0.000889867],"domain_scores_gemma":[0.9979974,0.0004485886,0.0004732776,0.0004851303,0.000352006,0.0002435923],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00302278,0.0007281038,0.9326229,0.001553521,0.00001867966,0.000001765033,0.05294736,0.00001892616,0.000006496772,0.0000441688,0.008721652,0.0003136249],"study_design_scores_gemma":[0.006172126,0.0006344985,0.968954,0.0007090362,0.00008083401,1.030197e-7,0.0216365,0.0005152317,0.000004829486,0.000003450507,0.001086056,0.0002033346],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.980927,0.0006959389,0.0004337924,0.003287789,0.0007237429,0.01362016,0.0001088905,0.00006559087,0.0001371199],"genre_scores_gemma":[0.99581,0.0002991636,0.0002053483,0.0008589707,0.0004409007,0.0006281405,0.00006910281,0.00003687194,0.001651442],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03633108,"threshold_uncertainty_score":0.9520429,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02879520124447506,"score_gpt":0.4151003452801781,"score_spread":0.386305144035703,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}