{"id":"W4392501426","doi":"10.2196/52818","title":"Appraisal of ChatGPT’s Aptitude for Medical Education: Comparative Analysis With Third-Year Medical Students in a Pulmonology Examination","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":13,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Aptitude; Context (archaeology); Pulmonology; Medical education; Medicine; Psychology; Internal medicine; Biology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002335572,0.0002574913,0.0003787139,0.001789893,0.0006264771,0.001252039,0.0004971303,0.0006811688,0.001810371],"category_scores_gemma":[0.01242551,0.0001751813,0.0004358399,0.0007131603,0.0006593651,0.0006673288,0.001854085,0.0005547976,0.0004881304],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007079318,"about_ca_system_score_gemma":0.0008457836,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002037385,"about_ca_topic_score_gemma":0.00300186,"domain_scores_codex":[0.9986715,0.0003708715,0.0001434788,0.0001689591,0.0003657739,0.0002795226],"domain_scores_gemma":[0.9881771,0.003729019,0.002664941,0.0004212835,0.001866693,0.003140933],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001414859,0.0002360365,0.9771828,0.00004879517,0.00002442167,0.0003273937,0.01303193,0.00004464874,0.0009596824,0.00003734354,0.0001166714,0.007848777],"study_design_scores_gemma":[0.000003722646,0.0004694807,0.9852929,0.00001771418,0.000009110898,0.0004125202,0.01289284,0.0001794251,0.0003096961,0.00002130442,0.0003823171,0.000009050883],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9996814,0.00002967481,0.00003790499,0.00001422649,0.000002656094,0.000007624006,0.0000168515,0.00000195706,0.0002077879],"genre_scores_gemma":[0.9996424,0.00003164973,0.00007832824,0.00001584774,0.000003724105,0.00001326191,0.0000430778,0.000001753535,0.0001699469],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.002335572,"threshold_uncertainty_score":0.01235187,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06702913400771111,"score_gpt":0.5136152125865308,"score_spread":0.4465860785788197,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}