{"id":"W4412840519","doi":"10.5489/cuaj.9238","title":"Evaluation of ChatGPT’s performance on answering pediatric urology questions based on association guidelines","year":2025,"lang":"en","type":"article","venue":"Canadian Urological Association Journal","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Dalhousie University","funders":"","keywords":"Pediatric urology; Association (psychology); Urology; Medicine; Psychology; General surgery; Psychotherapist","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":true,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01502806,0.0007144119,0.001067737,0.0021083,0.0004397545,0.001132544,0.0009747493,0.000836714,0.00461247],"category_scores_gemma":[0.06760417,0.0002957193,0.001530925,0.001167724,0.0006566444,0.00105601,0.002541284,0.001033904,0.001663538],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008781917,"about_ca_system_score_gemma":0.001561551,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001866908,"about_ca_topic_score_gemma":0.003575667,"domain_scores_codex":[0.9879593,0.005950998,0.001860188,0.000975408,0.002481406,0.0007727313],"domain_scores_gemma":[0.9289028,0.04174531,0.01148426,0.002274045,0.01106553,0.00452806],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001191665,0.000833073,0.8452005,0.001175782,0.0002599694,0.0005206685,0.0103566,0.001540771,0.002912898,0.0002472966,0.009998525,0.1257622],"study_design_scores_gemma":[0.0001653045,0.002923195,0.9630915,0.0006327339,0.0002289259,0.001623895,0.006279087,0.008115536,0.003547366,0.0003841312,0.01285927,0.0001490708],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9868184,0.0005628454,0.003850815,0.000607633,0.0001334432,0.001237557,0.001479333,0.0004618233,0.004848147],"genre_scores_gemma":[0.9718849,0.0007673361,0.02035076,0.0003525981,0.0001036145,0.00211265,0.002284838,0.00008438953,0.002058879],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01502806,"threshold_uncertainty_score":0.07947695,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1321286135176192,"score_gpt":0.406915864179151,"score_spread":0.2747872506615319,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}