{"id":"W4391644915","doi":"10.2196/50965","title":"Comparison of the Performance of GPT-3.5 and GPT-4 With That of Medical Students on the Written German Medical Licensing Examination: Observational Study","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":104,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"German; Enthusiasm; Observational study; Medical education; Medicine; Medical care; Psychology; Family medicine; Internal medicine","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003074789,0.0004353302,0.0005870697,0.001846029,0.0005195861,0.001229909,0.0007555604,0.00120436,0.001979475],"category_scores_gemma":[0.01611319,0.0003073592,0.0007186606,0.001298138,0.0008197055,0.001284727,0.002037913,0.001173465,0.001368412],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009144106,"about_ca_system_score_gemma":0.000904442,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005384529,"about_ca_topic_score_gemma":0.004693295,"domain_scores_codex":[0.9973205,0.0005588026,0.0003560234,0.0004029469,0.0007610936,0.000600544],"domain_scores_gemma":[0.9879135,0.002504718,0.00435469,0.0005300433,0.001983647,0.002713238],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001412544,0.0003098378,0.9957904,0.00001675899,0.00002445391,0.0001126696,0.0006452785,0.00007315211,0.0001602924,0.00001945512,0.0003074964,0.002399019],"study_design_scores_gemma":[0.00001012049,0.0007542627,0.9970742,0.000008742957,0.00001583439,0.0001929186,0.001049777,0.000334082,0.0001708269,0.00002419122,0.0003538952,0.00001113553],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.999313,0.00003346206,0.00002900784,0.00003964149,0.000004493801,0.00001510859,0.0001333655,0.000004287762,0.0004276674],"genre_scores_gemma":[0.9992557,0.00003038734,0.00006429505,0.00003544589,0.000005886273,0.00001910928,0.000270996,0.000003650683,0.0003144655],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.005384529,"threshold_uncertainty_score":0.01626128,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2296316867141716,"score_gpt":0.5298358915005704,"score_spread":0.3002042047863989,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}