{"id":"W4386439692","doi":"10.2196/48039","title":"Performance of ChatGPT on the Peruvian National Licensing Medical Examination: Cross-Sectional Study","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":88,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"United States Medical Licensing Examination; Context (archaeology); Medical education; Psychology; Sample (material); Medicine; Family medicine; Medical school; Geography","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004886103,0.0003261334,0.0005028194,0.001533137,0.0004463643,0.0007452079,0.0006709481,0.0007409439,0.001337039],"category_scores_gemma":[0.02195912,0.0004842893,0.0005677079,0.001260504,0.000529666,0.001150446,0.001400573,0.0006561686,0.0004883243],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005334434,"about_ca_system_score_gemma":0.0003838511,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007821311,"about_ca_topic_score_gemma":0.007664079,"domain_scores_codex":[0.9974367,0.00106503,0.0002783701,0.0003733918,0.0006184091,0.0002281836],"domain_scores_gemma":[0.9842591,0.005785933,0.005139529,0.001198058,0.003060947,0.0005563787],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00003449789,0.00006687635,0.9977567,0.00001878302,0.00002279202,0.00004833046,0.000626976,0.00002478641,0.00006410939,0.000006512409,0.00007471283,0.001254945],"study_design_scores_gemma":[0.000002811483,0.0001925981,0.9984936,0.00001159605,0.00001689147,0.0001548879,0.0006514994,0.0002468892,0.00005285317,0.000005956862,0.0001666644,0.000003849834],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9991221,0.0001057442,0.0001122517,0.00003017779,0.000002886116,0.00003305858,0.0001685445,0.000006599558,0.0004186001],"genre_scores_gemma":[0.9990606,0.00009973877,0.0001878761,0.00002918254,0.000008176102,0.00004475922,0.0003577382,0.000004450075,0.0002074103],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007821311,"threshold_uncertainty_score":0.02584052,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1491671043030322,"score_gpt":0.4935031896576396,"score_spread":0.3443360853546074,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}