{"id":"W4404993326","doi":"10.2196/57451","title":"Performance of GPT-3.5 and GPT-4 on the Korean Pharmacist Licensing Examination: Comparison Study","year":2024,"lang":"en","type":"article","venue":"JMIR Medical Education","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Pharmacy; Pharmacist; Medicine; Legislation; Medical education; Family medicine; Political science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.000835366,0.0000923666,0.0001488279,0.0001175783,0.0001185903,0.00002823886,0.00006688583,0.00007104904,0.0003277534],"category_scores_gemma":[0.0004286244,0.00006208231,0.00002579342,0.0003162629,0.0001207976,0.00007807787,0.00001519117,0.0003253536,0.00006293967],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008339955,"about_ca_system_score_gemma":0.0007660041,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001292325,"about_ca_topic_score_gemma":0.00001522029,"domain_scores_codex":[0.9986886,0.0001040589,0.0003840545,0.0002037361,0.0004932689,0.0001262894],"domain_scores_gemma":[0.9990897,0.0003536074,0.00006335505,0.000182821,0.0001542967,0.0001562862],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.00007505687,0.001463345,0.05720441,0.0003663438,0.00002596672,0.000002020307,0.02883026,0.000001283041,0.000135647,0.0008343946,0.007072759,0.9039885],"study_design_scores_gemma":[0.0004714345,0.005745491,0.591274,0.006789776,0.0004360203,0.000241901,0.1359297,0.19467,0.01924825,0.0004486211,0.04413271,0.0006122148],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9809355,0.0004049047,0.00001390336,0.01495943,0.001190792,0.0007243408,4.970721e-7,0.00004014876,0.001730514],"genre_scores_gemma":[0.9977569,0.0001227262,0.00002395934,0.0008737078,0.0007704022,0.0001019437,0.00001693548,0.000011557,0.0003218403],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9033763,"threshold_uncertainty_score":0.3588669,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.15283647417708,"score_gpt":0.4955732877592086,"score_spread":0.3427368135821286,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}