{"id":"W4402540843","doi":"10.2196/63430","title":"ChatGPT-4 Omni Performance in USMLE Disciplines and Clinical Skills: Comparative Analysis","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":89,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Medical education; Psychology; Medicine; Computer science; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01676624,0.0005271956,0.000654135,0.001936816,0.0004312724,0.001118349,0.0009603858,0.000675612,0.001586083],"category_scores_gemma":[0.08476152,0.0003467149,0.0009628724,0.001298937,0.001006114,0.001452981,0.002728019,0.0008353147,0.0007827373],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001495595,"about_ca_system_score_gemma":0.001103973,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006461429,"about_ca_topic_score_gemma":0.007789741,"domain_scores_codex":[0.989415,0.005741441,0.001114682,0.001087527,0.002200539,0.000440715],"domain_scores_gemma":[0.9211642,0.05512215,0.00790951,0.004159883,0.009055534,0.002588895],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.002605472,0.0008445837,0.9209965,0.0003006001,0.0003593231,0.0001647668,0.009240452,0.002851499,0.001220651,0.0003775314,0.001832107,0.05920656],"study_design_scores_gemma":[0.0001133432,0.001881958,0.975935,0.00009673228,0.0001383664,0.0003096508,0.002369647,0.01421921,0.00260618,0.000382076,0.001880659,0.0000671743],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9963267,0.00009581989,0.001509173,0.00005373723,0.00002082166,0.0001734589,0.0004157089,0.00006766874,0.001336883],"genre_scores_gemma":[0.9952427,0.00008983348,0.002854656,0.00004256621,0.00001433926,0.0003172946,0.000813396,0.00003187856,0.0005933682],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01676624,"threshold_uncertainty_score":0.08866948,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1129561708718853,"score_gpt":0.5515908393364383,"score_spread":0.438634668464553,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}